Спецслужбы США обвинили китайские ИИ-компании в масштабной дистилляции

Агентство CISA, АНБ и ФБР выпустили совместный отчёт о кибербезопасности, в котором обвинили ведущие китайские лаборатории в систематической выкачке возможностей американских нейросетей в промышленных масштабах.
Спецслужбы утверждают, что как минимум с конца 2024 года дистилляция стала не просто вспомогательным инструментом, а ключевой основой для развития передовых нейросетей в Китае. Среди фигурантов списка значатся DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun и Z.AI.
По данным ведомств, разработчики обходили пользовательские соглашения и системы защиты через серые прокси («передаточные станции»), шеринг оптовых премиум-аккаунтов и агрегаторы, скрывающие метаданные запросов. В частности, Moonshot AI приписывают дистилляцию сразу 17 американских моделей, включая Claude и GPT-4o, а DeepSeek обвиняют в целенаправленном извлечении скрытых цепочек рассуждений для создания R1 и V3.
Претензии к китайским разработчикам по поводу дистилляции данных американских моделей звучат регулярно — ранее о подобных подозрениях заявляли сами OpenAI и Anthropic. Однако нынешнее предупреждение принципиально отличается от прежних обвинений:
- Уровень расследования: инцидент перешёл из плоскости корпоративных споров и жалоб вендоров на государственный уровень. Предупреждение выпущено сразу тремя ключевыми спецслужбами и правительственными структурами США (CISA, NSA, FBI) в формате официальной директивы по киберугрозам национального масштаба.
- Масштаб и обвинение в «подмене фактов»: ведомства прямо заявили, что «дешевизна» и феноменальная эффективность обучения китайских моделей являются мифом. В отчёте подчёркивается, что расчёты затрат DeepSeek учитывают только вычислительные мощности, но игнорируют колоссальную стоимость обучающих данных, за создание которых уже заплатили американские лаборатории.
- Радикальные контрмеры: спецслужбы не просто зафиксировали факт утечки, но и предложили американским ИИ-компаниям применять метод «тихого ухудшения». Разработчикам рекомендовано отслеживать характерный трафик подозреваемых клиентов (круглосуточная активность без пауз, мгновенная пиковая нагрузка) и намеренно, без уведомления, отдавать им менее качественные и искажённые ответы, чтобы саботировать качество их синтетических датасетов.