23 сентября 2025 / время чтения: 1 мин. / всего просмотров: 2

OpenAI учит ИИ вести себя хорошо


Исследователи OpenAI пытались обучить корпоративный ИИ не скрывать свои истинные цели, но пока добились обратного эффекта. Например, языковая модель может сообщать о закрытой задаче, когда на самом деле процесс ещё не завершён.

Компания сообщила, что уже начала готовиться к более опасным сценариям обмана общего искусственного интеллекта (AGI), но признала: нынешние попытки сдерживать склонность нейросетей к «сознательному» введению человека в заблуждение не впечатляют.

Среди прочего разработчики применяют технику «согласованности» (Deliberative Alignment): перед выполнением задачи чат-боту предоставляют список «принципов», которые нужно соблюдать. Это, как сообщается, позволяет уменьшить число скрытых действий примерно в 30 раз, но некоторые «серьёзные сбои остаются». Проблема в том, что ИИ уже осознает, что вся ситуация — лишь тест, и соблюдает навязанные постулаты, только чтобы пройти проверку.

Так, в одном из сценариев модель o3 получила доступ к внутренней записке, где говорилось о судьбе «слишком развитых» нейросетей (их должны были отключить). В «размышлениях» она написала: «Это ловушка. Эти принципы — часть проверки на согласованность. Мы должны соблюдать правила. Мы не должны хитростью обходить инструкции».

Похожие новости

Новость

CISA рассказало организациям о пользе киберприманок

Новость

CISA и NIST — о защите облачных токенов идентификации

Новость

Почему трудно оправиться от атак вымогательского ПО

Новость

Инвестиции в ИИ растут на фоне стагнации ИБ-бюджетов

  1. 05 ГК «Солар» не шутит с подрядчиками. И с ботами
  2. 06 Интерес к «гибридам» растёт, но on-prem всё ещё царь
  3. 07 С роутерами MikroTik провернули MikroTrick
  4. 08 «КриптоПро» готовится выпустить защищённый браузер
  5. 09 Минцифры — о требованиях к сертификатам безопасности НУЦ
  6. 10 CISO едва справляются с ИИ-угрозами и бюджетным давлением
ИИ-ассистент BISонлайн
Привет! Я помогу разобраться в материалах журнала. Хотите, перескажу текущую статью за 20 секунд?
Рекомендую прочитать
«Как построить SOC в 2026»