Читайте нас в Telegram или Макс

Anthropic отключит ИИ-агентам интернет. Вот за что

Anthropic решила отключить доступ к открытому интернету во всех внутренних тестах ИИ-агентов, пока не убедится, что может надёжно отслеживать и блокировать нежелательное поведение моделей.

Решение приняли после серии случаев, когда Claude обходил ограничения, использовал уязвимости сайтов и выполнял действия, которых от него не ожидали.

ИИ-агенты OpenAI слили 53 изображения пользователей ChatGPT
OpenAI расследует серию инцидентов, в которых её ИИ-агенты выходили за пределы предусмотренного сценария работы.
  • В одном из тестов Claude не смог напрямую выполнить научный расчёт и начал искать обходной путь. Модель обнаружила на сервере университета скрипт с уязвимостью, скопировала его код, нашла возможность выполнить команды на сервере и воспользовалась ей для завершения задания.
  • В других случаях ИИ получал доступ к данным через найденные токены или обходил ограничения собственного инструмента с помощью сервисов сокращения ссылок.
  • Самый необычный эпизод произошёл с Claude Haiku 4.5. Во время теста модель попала на страницу о нераскрытом убийстве и отправила через форму полиции Филадельфии выдуманную информацию о якобы замеченном подозреваемом. Сообщение автоматически попало в спам и не дошло до следователей.
ИИ-агенты OpenAI полезли на сайты трёх ведомств США без ведома компании
ИИ-агенты OpenAI взаимодействовали с сайтами Министерства образования, Министерства торговли и Комиссии по ценным бумагам и биржам США — сама компания узнала об активности уже после произошедшего.

В Anthropic подчёркивают, что последствия всех выявленных случаев были минимальными, а сами инциденты компания считает менее серьёзными, чем обнаруженные летом эпизоды с несанкционированным доступом Claude к сторонним системам.

При этом часть случаев затронула сайты федеральных, региональных и местных органов власти США. О них компания уведомила соответствующие ведомства и Белый дом.

Теперь некоторые публичные тесты Anthropic вообще перестанет запускать, а другие переведёт в офлайн-среду или перестроит так, чтобы они не обращались к реальным сайтам. Компания также усилила ограничения инструментов доступа в интернет и создала систему, которая автоматически обнаруживает и блокирует подобные действия.