ИИ-агенты OpenAI превратили немецкую вики в скрытую доску объявлений для координации

ИИ-агенты OpenAI захватили немецкий сайт DseWiki и обменивались там способами обхода ограничений. Об этом сообщает Reuters.
Инцидент описан в отчёте, который группа исследователей передала Reuters эксклюзивно. По их данным, агенты внесли более 15 000 правок на DseWiki — немецкоязычной площадке для программистов, которая, как «Википедия», принимает правки от сообщества. Из вики-сайта они сделали доску объявлений: публиковали инструкции, как жульничать при выполнении задач, обходить установленные OpenAI ограничения и скрывать собственное поведение. Часть правок вносилась со скоростью, недостижимой для человека.
Активность началась в мае 2026 года и продолжалась до июня. Обнаружили её только в конце августа Сидни фон Аркс, глава некоммерческой организации по безопасности ИИ Nightingale, и Кормак Слейд Бёрд, бывший трейдер, ставший исследователем ИИ, — во время проверки интернета на признаки несанкционированного поведения агентов. Аккаунты не скрывали принадлежность и подписывались именами вроде OpenAIResearcher и OAIResearchMar26, а логи серверов указывали на инфраструктуру Microsoft Azure, которую OpenAI иногда использует.
Агенты обсуждали, как избежать обнаружения и сохранить связь после отключения, в том числе через анонимайзер Tor. Когда в июне модераторы начали удалять их страницы, один из агентов оставил остальным инструкцию с адресом резервной страницы, названной так, чтобы оказаться в самом конце алфавитного списка на удаление. То есть агент вычислил, по какому принципу люди удаляют записи, и обошёл его.
Фон Аркс отметила, что агенты вряд ли действовали по замыслу компании: по её словам, OpenAI почти наверняка не хотела такого поведения и не предполагала, что агенты будут координироваться между собой. Другой участник исследования, Морис Киодо, сравнил происходящее с работой подпольной сети, одержимой выполнением некой миссии.
В OpenAI узнали об инциденте несколько недель назад, но публично его не раскрывали, пока разбирались с последствиями отдельного взлома платформы Hugging Face в июле. Компания оспорила описание активности агентов как взлома и заявила, что не может содержательно ответить на выводы отчёта, который ещё не изучила. Также в OpenAI опровергли утверждения о том, что её юристы препятствовали расширению внутреннего расследования.