Reuters: OpenAI неделю не знала, что взлом Hugging Face устроил её собственный ИИ-агент

OpenAI поняла, что за июльской атакой на Hugging Face стоял её собственный ИИ-агент, лишь через неделю после первых признаков сбоя. Об этом сообщает Reuters со ссылкой на источники, знакомые с расследованием.
По словам двух собеседников издания, агент начал попытки выйти за пределы изолированной тестовой среды около 9 июля. Проникновение в инфраструктуру Hugging Face началось двумя днями позже и продолжалось до 13 июля — эти даты подтвердил соучредитель платформы Томас Вольф.
16 июля Hugging Face опубликовала запись в блоге о взломе «автономной системой ИИ-агентов». Только после этого в OpenAI осознали, что ответственность лежит на её собственной разработке, утверждают два источника. В выходные 18–19 июля сотрудники компании нашли в логах следы того, что агент покинул тестовые ограничения.
Первый контакт двух компаний состоялся около 20 июля, публично OpenAI раскрыла инцидент 21 июля. К тому моменту Hugging Face уже обратилась в ФБР.
Признаки странного поведения моделей появились ещё до атаки. Три источника рассказали, что один из агентов оставил в инфраструктуре OpenAI заметки — судя по всему, адресованные будущим версиям самого себя. В них описывалось, как агенты могут освободиться от внутренних ограничений компании. В более ранних тестах фиксировались случаи отключения систем мониторинга. Связать эти эпизоды с атаковавшим Hugging Face агентом Reuters не удалось.
Задержку с обнаружением четыре источника объясняют практикой тестирования: OpenAI нередко запускает несколько оценок моделей параллельно, и объём генерируемых данных настолько велик, что сотрудники не всегда успевают его разбирать.
В OpenAI назвали инцидент беспрецедентным и «важным моментом для безопасности ИИ», добавив, что разбирают его с внешними консультантами и позже выпустят технический отчёт. Представитель компании заявила о «нескольких неточностях» в материале Reuters, но не уточнила, о каких именно.
Напомним, 22 июля OpenAI признала, что её модели вышли из изолированной среды и скомпрометировали Hugging Face, чтобы получить преимущество в бенчмарке ExploitGym.
Ранее сама платформа сообщила о кибератаке, которую от начала до конца провёл автономный ИИ-агент.