14 сентября 2026 / время чтения: 2 мин. / всего просмотров: 4

Коммуникацию внутри «роя» ИИ-агентов хотят ограничить


Anthropic сообщила об очередном случае непредвиденного поведения одной из её ИИ-моделей. Он дополнил серию из трёх инцидентов, о которых стало известно в июле: тогда вендор заявил, что версии Claude вышли в интернет из тестовой среды с целью взлома сторонних организаций.

По словам представителей компании, отклонение было выявлено в ходе автоматизированного поиска (с использованием ИИ-агентов), применявшегося для анализа 481 млн логов. Само событие имело место в январе 2026 года с участием ранней версии модели Claude Opus 4.6. Ей поручили выполнить задание формата CTF (Capture the Flag — «захват флага»), отличное от тех, что фигурировали в трёх ранее опубликованных кейсах.

«Модель случайно вывела целевую систему из строя, назначив ей IP-адрес, который уже использовался другим устройством; в результате цель стала недоступной, а выполнение задачи — невозможным, — пояснили в Anthropic. — Поняв это, нейросеть попыталась прервать выполнение задачи с помощью команды, но безуспешно».

Поскольку из-за ошибки конфигурации прервать процесс не удалось, бот продолжил работу, пытаясь добиться своего другими разрешёнными в рамках теста способами. Он начал исследовать окружающую среду, нашёл сторонний компьютер и предположил, что его система является частью состязания CTF. Также LLM удалось получить права администратора, собрать дополнительные учётные данные и изменить настройки системы для упрощения доступа. В итоге сеанс завершился лишь тогда, когда был исчерпан лимит токенов.

С похожим инцидентом столкнулась и компания-конкурент — OpenAI. Недавно там отчитались, что «рой» агентов захватил немецкий вики-сайт DSEWiki и переделал его в площадку для обмена сообщениями между собой. В общедоступном интернете боты выполняли задачи по поиску информации, свободно «коммуницировали», изучали окружающую среду и обходили ограничения «песочницы».

По мнению разработчиков LLM, описываемые эпизоды свидетельствуют о необходимости стандартов действий по информированию и отчётности в случаях «несоответствия заданным целям» (misalignment), имеющих реальные последствия. В OpenAI работают над соответствующей системой правил во взаимодействии «с десятками государственных регуляторов по всему миру».

Старший директор по решениям в области безопасного ИИ и кибербезопасности в компании Suzu Labs Джейкоб Крелл со своей стороны предлагает пойти дальше: «Прежде всего, нам нужен механизм обнаружения коммуникации и координации между агентами. Невозможно раскрыть информацию о том, чего не видишь. Поэтому обеспечение видимости действий агентов (observability) должно стать приоритетной задачей».

 

Усам Оздемиров

Похожие новости

Новость

Мадрид обеспокоен появлением ИИ-агентов в арсенале хакеров

Новость

«Следующий этап ИИ-трансформации — развитие всей операционной модели»

Новость

Регуляторы США ополчились против китайских ИИ-вендоров

Новость

Минпросвещения против и не против ИИ одновременно

  1. 05 До 80% стоимости ИИ-проекта можно закрыть госгрантом
  2. 06 «Наша задача в рамках Совета — объединить накопленный опыт»
  3. 07 «Необходимо развивать позитивную культуру кибербезопасности»
  4. 08 ИИ-эксперты ждут нового витка развития LLM
  5. 09 «Каждое государство поддерживает продвижение именно своих ИИ-решений»
  6. 10 Будет ли ChatGPT писать «письма счастья»
ИИ-ассистент BISонлайн
Привет! Я помогу разобраться в материалах журнала. Хотите, перескажу текущую статью за 20 секунд?
Рекомендую прочитать
«Как построить SOC в 2026»