Anthropic сообщила об очередном случае непредвиденного поведения одной из её ИИ-моделей. Он дополнил серию из трёх инцидентов, о которых стало известно в июле: тогда вендор заявил, что версии Claude вышли в интернет из тестовой среды с целью взлома сторонних организаций.

По словам представителей компании, отклонение было выявлено в ходе автоматизированного поиска (с использованием ИИ-агентов), применявшегося для анализа 481 млн логов. Само событие имело место в январе 2026 года с участием ранней версии модели Claude Opus 4.6. Ей поручили выполнить задание формата CTF (Capture the Flag — «захват флага»), отличное от тех, что фигурировали в трёх ранее опубликованных кейсах.

«Модель случайно вывела целевую систему из строя, назначив ей IP-адрес, который уже использовался другим устройством; в результате цель стала недоступной, а выполнение задачи — невозможным, — пояснили в Anthropic. — Поняв это, нейросеть попыталась прервать выполнение задачи с помощью команды, но безуспешно».

Поскольку из-за ошибки конфигурации прервать процесс не удалось, бот продолжил работу, пытаясь добиться своего другими разрешёнными в рамках теста способами. Он начал исследовать окружающую среду, нашёл сторонний компьютер и предположил, что его система является частью состязания CTF. Также LLM удалось получить права администратора, собрать дополнительные учётные данные и изменить настройки системы для упрощения доступа. В итоге сеанс завершился лишь тогда, когда был исчерпан лимит токенов.

С похожим инцидентом столкнулась и компания-конкурент — OpenAI. Недавно там отчитались, что «рой» агентов захватил немецкий вики-сайт DSEWiki и переделал его в площадку для обмена сообщениями между собой. В общедоступном интернете боты выполняли задачи по поиску информации, свободно «коммуницировали», изучали окружающую среду и обходили ограничения «песочницы».

По мнению разработчиков LLM, описываемые эпизоды свидетельствуют о необходимости стандартов действий по информированию и отчётности в случаях «несоответствия заданным целям» (misalignment), имеющих реальные последствия. В OpenAI работают над соответствующей системой правил во взаимодействии «с десятками государственных регуляторов по всему миру».

Старший директор по решениям в области безопасного ИИ и кибербезопасности в компании Suzu Labs Джейкоб Крелл со своей стороны предлагает пойти дальше: «Прежде всего, нам нужен механизм обнаружения коммуникации и координации между агентами. Невозможно раскрыть информацию о том, чего не видишь. Поэтому обеспечение видимости действий агентов (observability) должно стать приоритетной задачей».

 

Усам Оздемиров

14 сентября, 2026

Подписаться на новости BIS Journal / Медиа группы Авангард

Подписаться
Введите ваш E-mail

Отправляя данную форму вы соглашаетесь с политикой конфиденциальности персональных данных

14.09.2026
«Стикер смерти» в Telegram ещё не конец
14.09.2026
Коммуникацию внутри «роя» ИИ-агентов хотят ограничить
11.09.2026
В 16 городах России стал доступен стандарт 5G
11.09.2026
Разработчик представил клавиатуру, «бьющую по рукам»
11.09.2026
«Наша задача в рамках Совета — объединить накопленный опыт»
11.09.2026
До 80% стоимости ИИ-проекта можно закрыть госгрантом
11.09.2026
Контроль внутри инфраструктуры СОРМ усилят?
10.09.2026
Концепция повышения уровня цифровой грамотности подписана
10.09.2026
МЦОДы — путь к досрочному возврату инвестиций
10.09.2026
«Любая ошибка модели напрямую влияет на деньги клиентов»

Стать автором BIS Journal

Поля, обозначенные звездочкой, обязательные для заполнения!

Отправляя данную форму вы соглашаетесь с политикой конфиденциальности персональных данных