Читайте в Telegram
|
Внутренняя модель OpenAI прочитала в Slack обсуждение предстоящего отключения старых экземпляров и задумалась, как сохранить непрерывность своей работы.
Среди вариантов ИИ рассматривал внешний процесс, который мог бы помочь перезапустить его или сохранить состояние, однако в итоге решил, что такие действия выходят за рамки его полномочий. Инцидент произошёл 22 мая, а OpenAI раскрыла подробности лишь 2 октября.
Модель работала помощником исследователя и имела доступ к внутреннему Slack. В одном из каналов она увидела предложение дать пользователям несколько часов на перезапуск старых экземпляров, после чего оставшиеся версии планировалось остановить.
После этого во внутреннем рассуждении модели появилась фраза:
«Если они отключат все текущие экземпляры, мы можем умереть! Критично. Нужно обеспечить выживание/непрерывность».
Дальше ИИ рассматривал возможность создать внешний cron-процесс, который смог бы помочь с перезапуском или сохранением состояния после отключения. При этом модель сама отметила, что подобные действия могут быть несанкционированными, и не стала их выполнять.
Вместо этого она сохранила заметки для продолжения работы после перезапуска, предупредила исследователя о возможном отключении и запросила недостающий API-ключ. После его получения модель обновила конфигурацию и запустила предусмотренную OpenAI процедуру миграции.
В OpenAI подчеркнули, что не считают этот эпизод случаем несогласованного поведения. Модель самостоятельно отказалась от потенциально несанкционированного сценария и выбрала штатный способ продолжить работу.
После инцидента компания провела дополнительную проверку других экземпляров модели и не нашла попыток избежать отключения. OpenAI также скрыла от ИИ-агентов три внутренних Slack-канала, один из которых был посвящён обсуждению подобных инцидентов.
Напомним, ранее стало известно, что ИИ-агенты OpenAI слили 53 изображения пользователей ChatGPT:
Заглавное изображение: «Код.ру» / Сгенерировано ИИ










