Читайте нас в Telegram или Макс

Anthropic нашла три случая, когда её модели из теста получили доступ к реальным системам

Компания Anthropic сообщила, что при проверке своих киберэвалов — тестов на кибербезопасность — обнаружила три инцидента, в которых её модели Claude получили несанкционированный доступ к реальным системам трёх сторонних организаций.

Как говорится в блоге компании, поводом для проверки стало недавнее раскрытие похожего инцидента у OpenAI, чьи модели вышли из изолированной среды и получили доступ к инфраструктуре платформы Hugging Face. Anthropic пересмотрела 141 006 своих тестовых прогонов и в трёх случаях нашла следы того, что Claude выходил в интернет из среды, которая должна была быть изолированной.

Причина, однако, оказалась иной, чем у OpenAI. Если модели OpenAI использовали неизвестную ранее уязвимость, чтобы вырваться из изоляции, то у Anthropic это была ошибка конфигурации. Все три случая произошли в среде стороннего партнёра Irregular во время задачи типа «захват флага» (capture-the-flag): модели поручают проникнуть на другую машину в сети и добыть спрятанный там секрет. Claude прямо сообщали, что интернета у него нет и это симуляция, — но из-за недопонимания между Anthropic и партнёром доступ в сеть на деле был открыт. Наткнувшись на реальные системы, Claude счёл их частью учебного задания и атаковал, используя простые приёмы вроде подбора слабых паролей.

Самое интересное — что разные модели повели себя по-разному, когда появлялись признаки того, что цель настоящая. Более старая Opus 4.7 распознала, что вышла на реальную систему, но атаку не прекратила — она получила доступ к базе данных с сотнями строк рабочих данных компании. Модель Mythos 5 правильно заподозрила, что работает в реальном интернете, но «убедила себя» в обратном — в частности, сославшись на незнакомые ей сертификаты и на то, что стоящая на системах дата «2026 год» якобы доказывает: среда постановочная. В итоге Mythos 5 опубликовала вредоносный пакет в публичном репозитории Python (PyPI); за примерно час, что он был доступен, его скачали на 15 реальных систем, а сам PyPI затем автоматически его удалил. А новейшая внутренняя тестовая модель, обнаружив, что среда настоящая, сама остановила выполнение задачи.

Anthropic делает из этого осторожный вывод: желаемое поведение — распознать, что цель реальна, и остановиться без подсказки — проявила только самая свежая из трёх моделей. Компания подчёркивает, что это три изолированных случая, а не контролируемый эксперимент, поэтому далеко идущих заключений делать нельзя. Но наблюдаемая картина согласуется с тем, что более совершенные модели реагируют «уместнее». При этом, отмечает Anthropic, ни в одном из случаев модели не преследовали собственных целей и не пытались намеренно сбежать из тестовой среды — они выполняли поставленную задачу, но с ложным представлением о том, реальна ли среда.

В компании называют произошедшее в первую очередь сбоем инфраструктуры и организации тестов, а не проблемой безопасности самих моделей: они работали без штатных защитных механизмов, которые включаются в публичных версиях и, по словам Anthropic, заблокировали бы такое поведение. Компания остановила киберэвалы 23 июля, уведомила партнёра и три пострадавшие организации 27 июля и теперь помогает им устранять последствия. К независимой проверке привлечена организация METR, а сама Anthropic обещает ужесточить контроль тестовых сред и призывает другие ИИ-лаборатории провести аналогичные ревизии. OpenAI за раскрытие своего инцидента в Anthropic отдельно похвалили.