Читайте нас в Telegram или Макс

Google представила Gemini 3.5 Transcribe — модель для перевода речи в текст с поддержкой русского

Google называет её своей самой точной моделью распознавания речи. Она понимает более 85 языков, чистит текст от слов-паразитов и различает до трёх говорящих. Доступ уже открыли разработчикам.

Google выпустила Gemini 3.5 Transcribe — специализированную нейросеть для преобразования речи в текст, которую компания называет своей самой точной моделью распознавания речи. Об этом Google рассказала в своём блоге. Модель уже работает в приложении Gemini для macOS (пока на английском) и в функции надиктовки Rambler на клавиатуре Gboard для Android — в ряде стран, с поддержкой русского языка.

По приведённым Google результатам бенчмарка на распознавание речи в нескольких языках новая модель показывает меньше ошибок, чем конкурирующие решения (в подобных тестах чем ниже показатель, тем лучше).

Главное в Gemini 3.5 Transcribe — «умная» транскрибация. Модель не просто дословно записывает сказанное, а понимает, когда человек поправляет сам себя, убирает слова-паразиты и автоматически форматирует итоговый текст. Она распознаёт жаргон и нестандартное написание за счёт пользовательского словаря, поддерживает более 85 языков и умеет различать до трёх говорящих в заранее записанном аудио; поддержку большего числа спикеров пока тестируют.

Доступ к модели уже открыт разработчикам в режиме публичного превью — через Gemini API в Google AI Studio и на платформе Google Antigravity, а для компаний — на Gemini Enterprise Agent Platform. Кроме того, Google обещает «скоро» встроить Gemini 3.5 Transcribe в браузер Chrome: пользователь сможет надиктовывать текст голосом в любом веб-поле — от поисковой строки до формы на сайте.