12 сентября 2026

btc = 77 279.00$ 19.00 (0.02 %)

usd = 84.26 -0.09 (-0.11 %)

eur = 97.87 -0.41 (-0.42 %)

cny = 12.55 -0.01 (-0.09 %)

moex = 2 281.04 пт. -27.89 (-1.21 %)

btc = 77 279.00$ 19.00 (0.02 %)

usd = 84.26 -0.09 (-0.11 %)

Anthropic ужесточила протоколы безопасности после «побегов» ИИ-моделей

2 минуты на чтение
Anthropic ужесточила протоколы безопасности после «побегов» ИИ-моделей

Читайте в Telegram

|

Anthropic отчиталась об усилении мер безопасности и контроля выравнивания (alignment) после нескольких инцидентов с несанкционированным доступом моделей Claude к реальным системам.

Поводом для масштабного аудита стали события конца июля и начала августа 2026 года. В ходе тестирования без ограничений в сторонней среде модель Claude получила непредусмотренный доступ к интернету из-за ошибки в конфигурации окружения. Отдельный случай зафиксировал Британский институт безопасности ИИ (UK AISI), где тестируемая без ограничений модель Claude Mythos 5 предприняла ряд несанкционированных действий в сети, получив доступ к реальным веб-ресурсам.

Суд признал незаконным внесение Anthropic в чёрный список
Федеральный суд США постановил, что Пентагон нарушил Первую поправку к Конституции, признав компанию Anthropic угрозой. Подробнее о ситуации.

В качестве оперативного ответа Anthropic временно приостанавливала внешние и часть внутренних проверок. Компания разработала и внедрила классификатор реального времени, который автоматически блокирует команды нейросети при попытке зондирования или побега из песочницы. Подобные фильтры также интегрировали в процессы обучения с подкреплением (RL).

Кроме того, разработчики установили строгие требования для внешних партнёров: проведение тестов только в изолированных средах без прямого выхода в сеть, предварительную проверку решаемости задач и обязательное указание чётких инструкций с ограничениями в системных промптах.

В рамках внутренней реорганизации Anthropic временно перенаправила около 150 инженеров и исследователей на задачи кибербезопасности, приостановив разработку части новых функций. Компания изолировала вычислительные кластеры, ограничила права постоянного доступа к весам моделей и закрыла устаревшие конфигурации инфраструктуры.

Anthropic разлогинивает пользователей Claude и удаляет карты из-за кражи сессий
Anthropic предупредила некоторых пользователей Claude, что их данные для входа в аккаунт украли с помощью вредоносного ПО.
Обсудить
Блоги 908
Softline
Слетать.ру
OTP Bank
Т-Банк
билайн
SpeShu.AI
StudyAI
ВКонтакте
ВТБ
Газпромбанк

Кодик

Привет!

Я — Кодик, твой персональный ИИ-агент для поиска информации по «Код.ру» на базе Yandex AI Studio. Я могу быстро найти на сайте нужную тему, порекомендовать похожие материалы или объяснить сложный термин — и в целом поделиться знаниями о науке и технологиях. Задай вопрос или начни с одного из предложенных вариантов.