1 сентября 2026

btc = 78 074.00$ 34.29 (-0.43 %)

usd = 86.38 0.78 (0.91 %)

eur = 100.57 0.89 (0.89 %)

cny = 12.86 0.12 (0.98 %)

moex = 2 187.55 пт. 8.68 (0.40 %)

btc = 78 074.00$ 34.29 (-0.43 %)

usd = 86.38 0.78 (0.91 %)

Anthropic ужесточила протоколы безопасности после «побегов» ИИ-моделей

2 минуты на чтение
Anthropic ужесточила протоколы безопасности после «побегов» ИИ-моделей

Читайте в Telegram

|

Anthropic отчиталась об усилении мер безопасности и контроля выравнивания (alignment) после нескольких инцидентов с несанкционированным доступом моделей Claude к реальным системам.

Поводом для масштабного аудита стали события конца июля и начала августа 2026 года. В ходе тестирования без ограничений в сторонней среде модель Claude получила непредусмотренный доступ к интернету из-за ошибки в конфигурации окружения. Отдельный случай зафиксировал Британский институт безопасности ИИ (UK AISI), где тестируемая без ограничений модель Claude Mythos 5 предприняла ряд несанкционированных действий в сети, получив доступ к реальным веб-ресурсам.

Суд признал незаконным внесение Anthropic в чёрный список
Федеральный суд США постановил, что Пентагон нарушил Первую поправку к Конституции, признав компанию Anthropic угрозой. Подробнее о ситуации.

В качестве оперативного ответа Anthropic временно приостанавливала внешние и часть внутренних проверок. Компания разработала и внедрила классификатор реального времени, который автоматически блокирует команды нейросети при попытке зондирования или побега из песочницы. Подобные фильтры также интегрировали в процессы обучения с подкреплением (RL).

Кроме того, разработчики установили строгие требования для внешних партнёров: проведение тестов только в изолированных средах без прямого выхода в сеть, предварительную проверку решаемости задач и обязательное указание чётких инструкций с ограничениями в системных промптах.

В рамках внутренней реорганизации Anthropic временно перенаправила около 150 инженеров и исследователей на задачи кибербезопасности, приостановив разработку части новых функций. Компания изолировала вычислительные кластеры, ограничила права постоянного доступа к весам моделей и закрыла устаревшие конфигурации инфраструктуры.

Anthropic разлогинивает пользователей Claude и удаляет карты из-за кражи сессий
Anthropic предупредила некоторых пользователей Claude, что их данные для входа в аккаунт украли с помощью вредоносного ПО.
Обсудить
Блоги 852
OTP Bank
Слетать.ру
StudyAI
ЦНИС
ВКонтакте
Softline
Т-Банк
билайн
ВТБ
Газпромбанк

Кодик

Привет!

Я — Кодик, твой персональный ИИ-агент для поиска информации по «Код.ру» на базе Yandex AI Studio. Я могу быстро найти на сайте нужную тему, порекомендовать похожие материалы или объяснить сложный термин — и в целом поделиться знаниями о науке и технологиях. Задай вопрос или начни с одного из предложенных вариантов.