Anthropic ужесточила протоколы безопасности после «побегов» ИИ-моделей

Anthropic отчиталась об усилении мер безопасности и контроля выравнивания (alignment) после нескольких инцидентов с несанкционированным доступом моделей Claude к реальным системам.
Поводом для масштабного аудита стали события конца июля и начала августа 2026 года. В ходе тестирования без ограничений в сторонней среде модель Claude получила непредусмотренный доступ к интернету из-за ошибки в конфигурации окружения. Отдельный случай зафиксировал Британский институт безопасности ИИ (UK AISI), где тестируемая без ограничений модель Claude Mythos 5 предприняла ряд несанкционированных действий в сети, получив доступ к реальным веб-ресурсам.
В качестве оперативного ответа Anthropic временно приостанавливала внешние и часть внутренних проверок. Компания разработала и внедрила классификатор реального времени, который автоматически блокирует команды нейросети при попытке зондирования или побега из песочницы. Подобные фильтры также интегрировали в процессы обучения с подкреплением (RL).
Кроме того, разработчики установили строгие требования для внешних партнёров: проведение тестов только в изолированных средах без прямого выхода в сеть, предварительную проверку решаемости задач и обязательное указание чётких инструкций с ограничениями в системных промптах.
В рамках внутренней реорганизации Anthropic временно перенаправила около 150 инженеров и исследователей на задачи кибербезопасности, приостановив разработку части новых функций. Компания изолировала вычислительные кластеры, ограничила права постоянного доступа к весам моделей и закрыла устаревшие конфигурации инфраструктуры.