Кодик кратко объясняет суть статьи
DeepSeek представила открытую мультимодальную нейросеть V4.1 Flash с контекстным окном до миллиона токенов, построенную на архитектуре смеси экспертов (MoE) с 552 млрд параметров, из которых активно используются 8 млрд при обработке запроса и 16 млрд при генерации. Новая структура Causal Encoder-Decoder снизила вычислительные затраты, особенно в агентских сценариях. Память для KV-cache уменьшилась вчетверо, а место на диске — в восемь раз благодаря сжатию кеша и пересчёту состояний на лету. Модель превзошла DeepSeek V4 Pro в бенчмарках: 74,2 балла в DeepSWE v1.1, 90,6 — в Terminal Bench 2.1, и 3471 балл на Codeforces. Встроенный ползунок рассуждений (1–100) позволяет регулировать точность и скорость. Модель обучена с нуля на собственных данных, с дистилляцией на финальном этапе. Специалисты США обвинили китайские компании в дистилляции американских ИИ. DeepSeek снизила цены на API: в часы пик — от $0,006 до $0,3 за миллион входных токенов, $1,2 — за выходные, в низкие нагрузки — вдвое дешевле. V4.1 Flash доступна по лицензии MIT, поддержка V4 Flash и V4 Flash Vision Exp прекращена, с 14 сентября 2026 года запросы с V4 Pro будут перенаправляться на V4.1 Flash. Параллельно Сбер выпустил открытую отечественную модель GigaChat 3.5 Reasoning для программирования и логики.
Читайте в Telegram
|
DeepSeek представила открытую мультимодальную нейросеть V4.1 Flash с поддержкой контекстного окна до миллиона токенов.
Модель построена на архитектуре смеси экспертов (MoE) и содержит 552 млрд параметров. Главным инженерным изменением стало внедрение новой структуры Causal Encoder-Decoder: нейросеть задействует всего 8 млрд активных параметров на этапе обработки входящего запроса и 16 млрд при генерации ответа. Разработчики заявляют, что такое разделение заметно снизило вычислительные затраты при работе со сложными агентскими сценариями.
По данным создателей, потребление памяти для кеша ключей и значений (KV-cache) уменьшилось в четыре раза по сравнению с моделью предыдущего поколения V4 Flash, а занимаемое место на постоянных накопителях сократилось в восемь раз. Этого удалось достичь благодаря сжатию кеша до 890 байт на токен и алгоритму, который пересчитывает часть состояний на лету вместо постоянной записи на диск.



В бенчмарках новинка опередила более крупную модель предыдущей серии DeepSeek V4 Pro. В тестах на программирование и работу агентов нейросеть набрала 74,2 балла в DeepSWE v1.1 и 90,6 балла в Terminal Bench 2.1, а также показала рейтинг 3471 на платформе Codeforces.
Кроме того, в модель встроили ползунок регулировки усилий рассуждения от 1 до 100, позволяющий гибко балансировать между скоростью генерации и точностью решения. Отдельно в DeepSeek уточнили, что модель разрабатывалась с нуля. Дистилляция была, но на финальном этапе пост‑обучения (OPD), таким образом заявляется, что претрейн модели был с нуля и на собственных данных.
Вместе с релизом модели DeepSeek снизила тарифы на доступ через API. В часы пик стоимость миллиона входных токенов составит от $0,006 (при попадании в кеш) до $0,3, а выходных — $1,2. В периоды низкой нагрузки цены опускаются в два раза: $0,003 за кешированный ввод, $0,15 за стандартный ввод и $0,6 за вывод.
Модель V4.1 Flash уже доступна разработчикам по открытой лицензии MIT, а веса и библиотеки энкодинга выложены в репозитории проекта. В связи с выходом новинки DeepSeek прекратила поддержку базовой V4 Flash и экспериментальной V4 Flash Vision Exp, а с 14 сентября 2026 года начнёт перенаправлять все запросы с флагманской V4 Pro на новую V4.1 Flash по более доступным тарифам.







