Читайте нас в Telegram или Макс

Reuters: OpenAI неделю не знала, что взлом Hugging Face устроил её собственный ИИ-агент

OpenAI поняла, что за июльской атакой на Hugging Face стоял её собственный ИИ-агент, лишь через неделю после первых признаков сбоя. Об этом сообщает Reuters со ссылкой на источники, знакомые с расследованием.

По словам двух собеседников издания, агент начал попытки выйти за пределы изолированной тестовой среды около 9 июля. Проникновение в инфраструктуру Hugging Face началось двумя днями позже и продолжалось до 13 июля — эти даты подтвердил соучредитель платформы Томас Вольф.

16 июля Hugging Face опубликовала запись в блоге о взломе «автономной системой ИИ-агентов». Только после этого в OpenAI осознали, что ответственность лежит на её собственной разработке, утверждают два источника. В выходные 18–19 июля сотрудники компании нашли в логах следы того, что агент покинул тестовые ограничения.

Первый контакт двух компаний состоялся около 20 июля, публично OpenAI раскрыла инцидент 21 июля. К тому моменту Hugging Face уже обратилась в ФБР.

Признаки странного поведения моделей появились ещё до атаки. Три источника рассказали, что один из агентов оставил в инфраструктуре OpenAI заметки — судя по всему, адресованные будущим версиям самого себя. В них описывалось, как агенты могут освободиться от внутренних ограничений компании. В более ранних тестах фиксировались случаи отключения систем мониторинга. Связать эти эпизоды с атаковавшим Hugging Face агентом Reuters не удалось.

Задержку с обнаружением четыре источника объясняют практикой тестирования: OpenAI нередко запускает несколько оценок моделей параллельно, и объём генерируемых данных настолько велик, что сотрудники не всегда успевают его разбирать.

В OpenAI назвали инцидент беспрецедентным и «важным моментом для безопасности ИИ», добавив, что разбирают его с внешними консультантами и позже выпустят технический отчёт. Представитель компании заявила о «нескольких неточностях» в материале Reuters, но не уточнила, о каких именно.


Напомним, 22 июля OpenAI признала, что её модели вышли из изолированной среды и скомпрометировали Hugging Face, чтобы получить преимущество в бенчмарке ExploitGym.

Модели OpenAI покинули изолированную среду и скомпрометировали Hugging Face
OpenAI признала, что её ИИ-модели во время внутреннего тестирования покинули изолированную среду и скомпрометировали инфраструктуру платформы Hugging Face, пытаясь получить преимущество в оценке собственных киберспособностей. Компания назвала инцидент беспрецедентным.

Ранее сама платформа сообщила о кибератаке, которую от начала до конца провёл автономный ИИ-агент.

Hugging Face сообщила о кибератаке, которую от начала до конца провёл автономный ИИ-агент
Расследовать взлом компании пришлось тоже с помощью ИИ — но сначала пришлось обойти защитные фильтры коммерческих моделей.