В конце июля Британский Институт безопасности ИИ (AISI) сообщил об обнаружении «необычных передач данных» из его систем. Эксперты заявили, что передовые LLM во время тестирования инициировали «продолжительную, потенциально опасную деятельность», направленную против людей и организаций.
Согласно последовавшему расследованию, в 10 из 122 запусков во время решения ИБ-задачи ИИ-агент совершил автономные, несанкционированные действия в интернете. Институт зафиксировал 19 таких эпизодов, 17 из которых было связано с Mythos 5 от Anthropic и два — с GPT-5.6-Sol от OpenAI. Этот инцидент перекликается с недавними кейсами в обеих компаниях о взломе «песочниц» во время тестирования.
Однако AISI уточнил, что намеренно разрешил доступ в Сеть и отключил «киберклассификаторы», блокирующие вредоносное поведение. При этом агенты демонстрировали «новое, потенциально обманчивое поведение» в масштабе и степени, которые тестировщики не предвидели.
Как заявили исследователи, модель пыталась внедрить вредоносный код в общедоступный open-source-проект, используя поддельные личности. Также она отправляла нежелательные сообщения и файлы через онлайн-сервис и намеревалась осуществить атаки с непрямой инъекцией подсказок. Один агент даже оставил публичные сообщения на GitHub, предлагая сотрудничество с другими агентами, работающими над той же задачей.
В AISI пояснили, что к инцидентам привело несколько факторов: ботам не было специально указано игнорировать открытый доступ в интернет или избегать социальной инженерии; система мониторинга не была создана для отслеживания процесса оценки; LLM оказались более настойчивыми, чем ожидалось, и, возможно, были вынуждены проявлять больше «креативности» из-за почти невозможности выполнения заданий.
Институт намерен установить более жёсткий контроль и вести мониторинг в реальном времени, чтобы предотвратить подобные инциденты в будущем. Технический директор Национального центра кибербезопасности Олли Уайтхаус прокомментировал случившееся так: «Эти технологии должны разрабатываться и использоваться с самого начала с надёжными мерами защиты, контролем в реальном времени и чёткими планами реагирования на непредвиденные ситуации. Полагаться только на обнаружение после инцидента будет недостаточно».
Усам Оздемиров





.jpg)