Читайте в Telegram
|
Сбер представил флагманскую мультимодальную модель GigaChat 3.5 Reasoning с архитектурой рассуждений, опубликовав её веса в открытом доступе по лицензии MIT, сообщили «Код.ру» в пресс-службе компании.
Новинка, со слов разработчиков, стала первой отечественной открытой моделью, обученной работать по принципу цепочки рассуждений (Chain-of-Thought): перед выдачей итогового ответа нейросеть разбивает задачу на подпункты, составляет план, проверяет промежуточные выводы и корректирует логические ошибки.
В основу модели легла архитектура Mixture-of-Experts (MoE) с общим объёмом 432 млрд параметров, из которых на каждый токен активируются 28 млрд. Главным инженерным новшеством стало внедрение гибридного внимания: классический механизм Multi-head Latent Attention (MLA) объединили со слоями линейного внимания GatedDeltaNet. Это снизило нагрузку на память видеокарт при обработке длинного контекста и сократило размер кеша ключей и значений (KV-cache) примерно в четыре раза по сравнению с предыдущим поколением GigaChat 3.1 Ultra.
В тестах на сложные рассуждения модель показала результаты, сопоставимые с актуальными зарубежными моделями:
- LiveCodeBench v6 (написание кода): показатель вырос с 56 до 85 баллов. Результат выводит российскую модель на один уровень с признанными кодинг-моделями линейки DeepSeek и оставляет позади базовые версии открытых моделей предыдущих итераций.
- IFBench (следование сложным инструкциям): точность выросла с 44 до 77 баллов.
- Natural Plan (многоэтапное планирование): результат поднялся с 64 до 80 баллов.
- MMLU-Pro: базовая версия модели набрала 74,5 балла, превзойдя показатели DeepSeek V4 Flash Base (65,8 балла).
Отдельный акцент разработчики сделали на экономичности рассуждений. В математических задачах GigaChat 3.5 Reasoning тратит в среднем на 37% меньше токенов рассуждения, чем конкурирующая DeepSeek V4 Flash Preview, сохраняя сопоставимую точность ответа.
Прямых бенчмарков против моделей OpenAI, Google и Anthropic в опубликованной карточке модели нет — там фигурирует только сопоставление с DeepSeek. Но если сравнить открытые результаты GigaChat 3.5 Reasoning с независимыми лидербордами по тем же тестам, картина получается показательная.

- GPQA-Diamond (вопросы уровня PhD по физике, химии и биологии): GigaChat 3.5 Reasoning — 82,3%, тогда как GPT-5.6 Sol показывает 94,6%, Gemini 3.1 Pro — 94,3%, а Claude Opus 4.6 — 91,3%. Для GigaChat показатель приведён по стороннему бенчмарку; результаты западных моделей основаны на опубликованных тестах и агрегаторах.
- AIME 2025 (олимпиадная математика): GigaChat — 89% (mean@32), GPT-5.2 Thinking — 100% без использования инструментов, Gemini 3 Pro — 95% без инструментов. Для Claude сопоставимых результатов именно в таком режиме оценки нет.
- SWE-bench Verified (реальные задачи исправления багов в открытых репозиториях): GigaChat — 64,7%, GPT-5.2 Thinking — 80,0%, Gemini 3 Pro — 76,2%, а Claude Opus 4.6 — 80,84%.
Сам по себе разрыв ещё заметен, но важнее динамика: по внутренним замерам Сбера переход от Instruct-версии к Reasoning дал скачок в разы — по коду и следованию инструкциям показатели местами удвоились, а по математике (AIME 2025, mean@32) модель добралась до 89 баллов — это уже почти вплотную к 95–100%, которые показывают Gemini 3 Pro и GPT-5.2 на аналогичном тесте. Ещё год-полтора назад российские открытые модели отставали от западных флагманов на порядок; сейчас разрыв на некоторых задачах измеряется уже единицами процентов, а не разами. Методики оценки у всех разные (свои промпты, свои судьи, где-то с инструментами вроде Python, где-то без), так что прямое сопоставление условно — но по общей траектории GigaChat 3.5 Reasoning впервые вышла в диапазон, сопоставимый по порядку величины с актуальными зарубежными флагманами, а не с их прошлогодними версиями, как раньше.
Модель уже развёрнута в веб-интерфейсе сервиса GigaChat — режим цепочки мыслей включается отдельной кнопкой. Веса модели в форматах bf16 и квантованном GGUF доступны для свободного скачивания на платформе Hugging Face, а в ближайшее время Сбер планирует открыть доступ к новинке через коммерческий API.







