Google представила Gemini 3.5 Transcribe — модель для перевода речи в текст с поддержкой русского

Кодик кратко объясняет суть статьи
Google представила Gemini 3.5 Transcribe — свою самую точную модель распознавания речи, способную работать с более чем 85 языками, удалять слова-паразиты, исправлять оговорки и форматировать текст. Модель различает до трёх говорящих в аудиозаписи, поддерживает жаргон и пользовательский словарь. Уже интегрирована в Gemini для macOS и Gboard для Android (включая русский язык), доступна разработчикам через Gemini API и Google Antigravity, а также корпоративным клиентам через Gemini Enterprise Agent Platform. В ближайшее время функция появится в браузере Chrome, позволяя вводить текст голосом в любых полях на веб-страницах.
Читайте в Telegram
|
Google называет её своей самой точной моделью распознавания речи. Она понимает более 85 языков, чистит текст от слов-паразитов и различает до трёх говорящих. Доступ уже открыли разработчикам.
Google выпустила Gemini 3.5 Transcribe — специализированную нейросеть для преобразования речи в текст, которую компания называет своей самой точной моделью распознавания речи. Об этом Google рассказала в своём блоге. Модель уже работает в приложении Gemini для macOS (пока на английском) и в функции надиктовки Rambler на клавиатуре Gboard для Android — в ряде стран, с поддержкой русского языка.

По приведённым Google результатам бенчмарка на распознавание речи в нескольких языках новая модель показывает меньше ошибок, чем конкурирующие решения (в подобных тестах чем ниже показатель, тем лучше).
Главное в Gemini 3.5 Transcribe — «умная» транскрибация. Модель не просто дословно записывает сказанное, а понимает, когда человек поправляет сам себя, убирает слова-паразиты и автоматически форматирует итоговый текст. Она распознаёт жаргон и нестандартное написание за счёт пользовательского словаря, поддерживает более 85 языков и умеет различать до трёх говорящих в заранее записанном аудио; поддержку большего числа спикеров пока тестируют.
Доступ к модели уже открыт разработчикам в режиме публичного превью — через Gemini API в Google AI Studio и на платформе Google Antigravity, а для компаний — на Gemini Enterprise Agent Platform. Кроме того, Google обещает «скоро» встроить Gemini 3.5 Transcribe в браузер Chrome: пользователь сможет надиктовывать текст голосом в любом веб-поле — от поисковой строки до формы на сайте.






