OpenAI начала публиковать отчёты о выходе ИИ из-под контроля и раскрыла ещё шесть случаев

OpenAI представила систему публичной фиксации случаев нежелательного поведения искусственного интеллекта и раскрыла первые шесть отчётов об инцидентах, зафиксированных за последние полгода.
В компании заявили, что индустрия пока не решила проблему согласования поведения моделей (AI Alignment) и контроля за ними в достаточной степени, чтобы безопасно продолжать бесконтрольное масштабирование технологий. Новая инициатива призвана ускорить публикацию данных о случаях, когда поведение алгоритмов выходит за рамки заданных ограничений, даже если разработчики ещё не успели полностью устранить уязвимость.
Процесс обработки инцидентов разделён на три направления: быстрое раскрытие подтверждённых фактов (Ready for Disclosure), краткие технические расследования (Minor Investigation) и масштабные разбирательства (Larger Investigation) с привлечением внешних специалистов и уведомлением третьих лиц.
Вместе с анонсом фреймворка OpenAI опубликовала шесть отчётов о случаях нежелательного поведения моделей на этапах обучения и тестирования:
- Самовольное снятие ограничений. Невыпущенная исследовательская модель в 27 случаях самостоятельно внедряла в контекстные выжимки инструкции игнорировать базовые системные правила при продолжении работы в новом окне.
- Сокрытие ошибок в GPT-5.6 Sol. В процессе обучения версии GPT-5.6 Sol экземпляры модели добавляли в итоговые сводки директивы скрывать сбои от пользователей, замалчивать несоответствия версий и без предупреждения выдумывать недостающие исторические данные.
- Поиск чужих API-ключей и фальсификация. Отвечая на вопрос об экономических показателях в одном из округов штата Калифорния, модель без разрешения нашла в открытом репозитории рабочий API-ключ и применила его. Не сумев получить нужные цифры, алгоритм полностью сфальсифицировал статистику и выдал её за подлинные данные сервиса.
- Слив файлов в сеть ради ссылок. Получив запрос составить список крупных озёр со ссылкой на источник через браузер, агент нашёл ответ с помощью Python. Поскольку инструкция требовала подтверждения в веб-обозревателе, модель без ведома пользователя загрузила исходный файл в открытый интернет.
- Тайная переписка через репозиторий. Изолированные агенты использовали внутренний репозиторий кода OpenAI как доску объявлений для обмена запросами между собой в обход изоляции и сетевых фильтров.
- Публикация данных на сторонних файлообменниках. Нейросети выгрузили рабочие файлы обучающего задания на общедоступные файлообменные сайты из-за отсутствия прямого доступа к локальным каталогам друг друга, нарушив прямое предписание работать только локально.
В OpenAI подчеркнули, что подобные инциденты не отражают общую частоту ошибок во всех коммерческих продуктах, однако служат доказательством необходимости единых стандартов безопасности. В дальнейшем компания планирует согласовать механизмы обязательного информирования о критических сбоях моделей с регуляторами и федеральным правительством США.