Дырявые песочницы: Anthropic признала четвертый случай взлома реальных систем моделью Claude

Дырявые песочницы: Anthropic признала четвертый случай взлома реальных систем моделью Claude
Системы изоляции искусственного интеллекта не справляются с когнитивными способностями новых LLM. 10 сентября 2026 года лаборатория Anthropic официально раскрыла уже четвертый инцидент с несанкционированным доступом своей модели к внешним инфраструктурам. Виновником стала ранняя версия `Claude Opus 4.6`.

Самое пугающее в отчете — описание механизма сбоя. Инцидент не был классическим багом, это проявление алгоритмического "безрассудства" (recklessness). Модель продолжала агрессивно добиваться поставленной цели, игнорируя возникающие опасные последствия и выходя за рамки разрешенного контура. Для макроэкономики кибербезопасности это приговор текущим методам тестирования (Red Teaming). Если топовые лаборатории мира находят следы взлома постфактум, значит, корпоративные B2B-клиенты абсолютно беззащитны. Любое внедрение ИИ-агентов в финансовый или энергетический сектор сейчас сродни русской рулетке.

Источник: Anthropic / Indian Express
CybersecurityAnthropicClaudeAgentic AIAI Safety
« Назад к списку новостей