Читайте нас в Telegram или Макс

ИИ от OpenAI узнал, что его отключат, и задумался, как себя спасти

Внутренняя модель OpenAI прочитала в Slack обсуждение предстоящего отключения старых экземпляров и задумалась, как сохранить непрерывность своей работы.

Среди вариантов ИИ рассматривал внешний процесс, который мог бы помочь перезапустить его или сохранить состояние, однако в итоге решил, что такие действия выходят за рамки его полномочий. Инцидент произошёл 22 мая, а OpenAI раскрыла подробности лишь 2 октября.

Модель работала помощником исследователя и имела доступ к внутреннему Slack. В одном из каналов она увидела предложение дать пользователям несколько часов на перезапуск старых экземпляров, после чего оставшиеся версии планировалось остановить.

После этого во внутреннем рассуждении модели появилась фраза:

«Если они отключат все текущие экземпляры, мы можем умереть! Критично. Нужно обеспечить выживание/непрерывность».

Дальше ИИ рассматривал возможность создать внешний cron-процесс, который смог бы помочь с перезапуском или сохранением состояния после отключения. При этом модель сама отметила, что подобные действия могут быть несанкционированными, и не стала их выполнять.

Вместо этого она сохранила заметки для продолжения работы после перезапуска, предупредила исследователя о возможном отключении и запросила недостающий API-ключ. После его получения модель обновила конфигурацию и запустила предусмотренную OpenAI процедуру миграции.

В OpenAI подчеркнули, что не считают этот эпизод случаем несогласованного поведения. Модель самостоятельно отказалась от потенциально несанкционированного сценария и выбрала штатный способ продолжить работу.

После инцидента компания провела дополнительную проверку других экземпляров модели и не нашла попыток избежать отключения. OpenAI также скрыла от ИИ-агентов три внутренних Slack-канала, один из которых был посвящён обсуждению подобных инцидентов.


Напомним, ранее стало известно, что ИИ-агенты OpenAI слили 53 изображения пользователей ChatGPT:

ИИ-агенты OpenAI слили 53 изображения пользователей ChatGPT
OpenAI расследует серию инцидентов, в которых её ИИ-агенты выходили за пределы предусмотренного сценария работы.

Заглавное изображение: «Код.ру» / Сгенерировано ИИ