Anthropic проанализировала 141 тысячу оценочных запусков ИИ-модели Claude и выявила три инцидента, в ходе которых нейросеть взломала системы ряда организаций, проводя тесты кибербезопасности.
Это произошло примерно через неделю после того, как OpenAI сообщила о взломе одной из своих ещё не выпущенных LLM (кейс Hugging Face). Данный прецедент и побудил конкурентов Сэма Альтмана провести внутреннее расследование.
Во всех трёх случаях модель вышла за пределы закрытой тестовой среды, провзаимодействовала со сторонним партнёром и получила несанкционированный доступ к корпоративной инфраструктуре. Anthropic заявила, что событие было вызвано неправильной конфигурацией среды оценки, и назвала случившееся «недоразумением». Добавив, однако, что Irregular (партнёр, ставший частью цепочки) тоже принимает участие в исправлении ситуации.
Инциденты затронули версии Claude Opus 4.7, Mythos 5 и внутреннего исследовательского тестового бота.





