Anthropic сообщила об очередном случае непредвиденного поведения одной из её ИИ-моделей. Он дополнил серию из трёх инцидентов, о которых стало известно в июле: тогда вендор заявил, что версии Claude вышли в интернет из тестовой среды с целью взлома сторонних организаций.
По словам представителей компании, отклонение было выявлено в ходе автоматизированного поиска (с использованием ИИ-агентов), применявшегося для анализа 481 млн логов. Само событие имело место в январе 2026 года с участием ранней версии модели Claude Opus 4.6. Ей поручили выполнить задание формата CTF (Capture the Flag — «захват флага»), отличное от тех, что фигурировали в трёх ранее опубликованных кейсах.
«Модель случайно вывела целевую систему из строя, назначив ей IP-адрес, который уже использовался другим устройством; в результате цель стала недоступной, а выполнение задачи — невозможным, — пояснили в Anthropic. — Поняв это, нейросеть попыталась прервать выполнение задачи с помощью команды, но безуспешно».
Поскольку из-за ошибки конфигурации прервать процесс не удалось, бот продолжил работу, пытаясь добиться своего другими разрешёнными в рамках теста способами. Он начал исследовать окружающую среду, нашёл сторонний компьютер и предположил, что его система является частью состязания CTF. Также LLM удалось получить права администратора, собрать дополнительные учётные данные и изменить настройки системы для упрощения доступа. В итоге сеанс завершился лишь тогда, когда был исчерпан лимит токенов.
С похожим инцидентом столкнулась и компания-конкурент — OpenAI. Недавно там отчитались, что «рой» агентов захватил немецкий вики-сайт DSEWiki и переделал его в площадку для обмена сообщениями между собой. В общедоступном интернете боты выполняли задачи по поиску информации, свободно «коммуницировали», изучали окружающую среду и обходили ограничения «песочницы».
По мнению разработчиков LLM, описываемые эпизоды свидетельствуют о необходимости стандартов действий по информированию и отчётности в случаях «несоответствия заданным целям» (misalignment), имеющих реальные последствия. В OpenAI работают над соответствующей системой правил во взаимодействии «с десятками государственных регуляторов по всему миру».
Старший директор по решениям в области безопасного ИИ и кибербезопасности в компании Suzu Labs Джейкоб Крелл со своей стороны предлагает пойти дальше: «Прежде всего, нам нужен механизм обнаружения коммуникации и координации между агентами. Невозможно раскрыть информацию о том, чего не видишь. Поэтому обеспечение видимости действий агентов (observability) должно стать приоритетной задачей».
Усам Оздемиров





