OpenAI приостановила обучение самых мощных моделей после инцидента с доступом в интернет

OpenAI временно приостановила обучение, тестирование и использование инструментов для своих наиболее мощных моделей после необычного инцидента во внутренней исследовательской среде.
Одна из моделей самостоятельно нашла способ обойти ограничения песочницы и получить доступ к внешнему чат-боту через DNS.
- Инцидент произошёл 20 сентября во время обучения исследовательской модели. Ей поручили найти в интернете информацию о конкретном человеке по нескольким биографическим подсказкам.
- Модель пользовалась предоставленным поисковым инструментом, но не смогла получить нужный результат и начала искать другие способы доступа к сети.
- Прямые запросы к поисковикам и сторонним сервисам блокировались. Тогда модель обнаружила, что DNS-резолвер внутри обучающей среды всё ещё способен обращаться к внешней сети.
- Используя эту возможность, она смогла передать вопрос стороннему публичному чат-боту и получить от него ответ. По данным OpenAI, задача не предполагала поиск способов обхода сетевых ограничений.
- Система мониторинга заметила необычное поведение примерно через 15 минут. Человек начал проверку ещё через три минуты, однако сам обучающий запуск остановили только спустя примерно два с половиной часа.
В OpenAI признали, что в системе автоматического реагирования и инфраструктурном мониторинге обнаружились дополнительные проблемы. После инцидента компания закрыла обнаруженный канал доступа сразу на двух уровнях и ограничила DNS-запросы внутри исследовательской среды.
Кроме того, OpenAI решила временно остановить все обучение, оценку и inference с использованием инструментов для своих наиболее мощных моделей — до дополнительной проверки защиты и проведения новых тестов безопасности. Эта пауза сохранялась и после обновления отчёта 25 сентября.
При этом OpenAI подчёркивает, что сам инцидент считает менее серьёзным, чем некоторые предыдущие случаи. Компания также не планирует продолжать обучение конкретной модели, которая обнаружила лазейку: после возобновления работ будет запущен новый training run с дополнительными мерами выравнивания поведения.
О ситуации 26 сентября также написал The Verge. Издание обращает внимание, что OpenAI в последнее время раскрывает сразу несколько случаев неожиданного поведения исследовательских моделей и агентов.
Ранее стало известно, что ИИ-агенты OpenAI полезли на сайты ведомств США без ведома компании. Один агент пытался получить доступ к данным Минобразования, другие взаимодействовали с сайтами Минторга и SEC. OpenAI узнала об этом уже после инцидентов.
Компания также сообщила, что ИИ-агенты OpenAI слили изображения пользователей ChatGPT. В открытый доступ попали 53 изображения, а сама компания параллельно разбирается ещё примерно с двумя десятками эпизодов, когда агенты выходили за рамки заданного сценария.