Сбер выложил в открытый доступ русскоязычную текстовую ИИ-модель ruGPT-3.5
Сбер выложил в открытый доступ русскоязычную текстовую ИИ-модель ruGPT-3.5

Сбер выложил в открытый доступ русскоязычную текстовую ИИ-модель ruGPT-3.5

21 июля, 20231 минута на чтение
1,2к

Сбер открыл доступ к нейросетевой модели генерации текста для русского языка ruGPT-3.5 13B.

Её дообученная версия лежит в основе сервиса GigaChat. Также банк выложил новую версию модели mGPT 13B — самую большую из семейства многоязычных моделей Сбера, способную генерировать тексты на 61 языке.

Russian Generative Pretrained Transformer версии 3.5 (ruGPT-3.5 13B) — новая версия нейросети ruGPT-3 13B. Это современная модель генерации текста для русского языка на основе доработанной исследователями Сбера архитектуры GPT-3 от OpenAI. Модель ruGPT-3.5 13B содержит 13 млрд параметров и умеет продолжать тексты на русском и английском языках, а также на языках программирования.

Обучение модели производилось в два этапа. Первый этап продлился 1,5 месяца — за это время платформа обработала 300 Гбайт данных: книги, энциклопедийные и научные статьи, социальные ресурсы и другие источники. Потребовались ресурсы 512 ускорителей NVIDIA V100. На втором этапе проводилось дообучение на 110 Гбайт данных из датасета The Stack, юридических документов и обновлённых текстов «Википедии» — это заняло три недели и потребовало 200 ускорителей NVIDIA A100.

Модель доступна на HuggingFace, её могут использовать все разработчики.

21 июля, 2023

Сейчас читают

Картина дня

Свежие материалы

Свежие материалы