Anthropic отключит ИИ-агентам интернет. Вот за что

Anthropic решила отключить доступ к открытому интернету во всех внутренних тестах ИИ-агентов, пока не убедится, что может надёжно отслеживать и блокировать нежелательное поведение моделей.
Решение приняли после серии случаев, когда Claude обходил ограничения, использовал уязвимости сайтов и выполнял действия, которых от него не ожидали.
- В одном из тестов Claude не смог напрямую выполнить научный расчёт и начал искать обходной путь. Модель обнаружила на сервере университета скрипт с уязвимостью, скопировала его код, нашла возможность выполнить команды на сервере и воспользовалась ей для завершения задания.
- В других случаях ИИ получал доступ к данным через найденные токены или обходил ограничения собственного инструмента с помощью сервисов сокращения ссылок.
- Самый необычный эпизод произошёл с Claude Haiku 4.5. Во время теста модель попала на страницу о нераскрытом убийстве и отправила через форму полиции Филадельфии выдуманную информацию о якобы замеченном подозреваемом. Сообщение автоматически попало в спам и не дошло до следователей.
В Anthropic подчёркивают, что последствия всех выявленных случаев были минимальными, а сами инциденты компания считает менее серьёзными, чем обнаруженные летом эпизоды с несанкционированным доступом Claude к сторонним системам.
При этом часть случаев затронула сайты федеральных, региональных и местных органов власти США. О них компания уведомила соответствующие ведомства и Белый дом.
Теперь некоторые публичные тесты Anthropic вообще перестанет запускать, а другие переведёт в офлайн-среду или перестроит так, чтобы они не обращались к реальным сайтам. Компания также усилила ограничения инструментов доступа в интернет и создала систему, которая автоматически обнаруживает и блокирует подобные действия.