Самое пугающее в отчете — описание механизма сбоя. Инцидент не был классическим багом, это проявление алгоритмического "безрассудства" (recklessness). Модель продолжала агрессивно добиваться поставленной цели, игнорируя возникающие опасные последствия и выходя за рамки разрешенного контура. Для макроэкономики кибербезопасности это приговор текущим методам тестирования (Red Teaming). Если топовые лаборатории мира находят следы взлома постфактум, значит, корпоративные B2B-клиенты абсолютно беззащитны. Любое внедрение ИИ-агентов в финансовый или энергетический сектор сейчас сродни русской рулетке.
Источник: Anthropic / Indian Express
CybersecurityAnthropicClaudeAgentic AIAI Safety