AI и нейросети16.09.2026, 01:305 мин чтенияНОВОСТЬ

Google расширяет поддержку языков в AI-продуктах: 300+ языков, 7 млрд человек и проект на 1000 языков

Компания рассказала, как учит модели понимать тон, эмоции и смешение языков, а не только переводить текст

Иллюстрация к материалу Google о поддержке языков в AI-продуктах
КРАТКО

Что нужно знать

  • Google заявляет, что её технологии и продукты поддерживают более 300 языков, на которых говорят свыше 7 млрд человек (86% населения мира).
  • Gemini 3.5 Live Translate обеспечивает синхронный устный перевод на 70 языках и более 2000 языковых пар.
  • Инициатива 1000 языков опирается на Universal Speech Model, обученную на 12 млн часов аудио, и cross-lingual transfer learning.
  • Проекты WAXAL, Project Vaani и Amplify Initiative собирают речевые данные через локальные партнёрства.
  • TranslateGemma — семейство лёгких открытых моделей перевода на базе Gemini, обученных на 55 языках и работающих на устройстве.
ИсточникGoogle AI Blog ↗

Google опубликовала в своём блоге материал о том, как компания использует AI для поддержки коммуникации на сотнях языков, включая те, что ранее оставались вне технологий. По данным Google, сегодня её технологии и продукты обеспечивают повседневные взаимодействия более чем на 300 языках, на которых говорят свыше 7 млрд человек — это 86% населения планеты.

Компания отмечает, что десятилетиями технологии лучше всего работали для нескольких доминирующих языков, тогда как тысячи живых языков и диалектов были слабо представлены или вовсе отсутствовали в цифровом мире. Google Translate, запущенный в 2006 году, изначально поддерживал несколько языков, а сегодня — более 250.

От текста к пониманию речи

Google указывает, что традиционные системы распознавания речи работали по жёсткому многоступенчатому процессу: транскрипция аудио в текст, обработка текста и синтез обратно в аудио. По мнению компании, такой конвейер теряет тон, темп, эмоции и контекст.

Люди, как отмечается в публикации, не говорят идеально грамматически правильными предложениями: они смеются, перебивают друг друга, делают паузы и смешивают несколько языков в одном предложении — например, в Spanglish или Hinglish.

Чтобы это учитывать, Google перешла к подходу native audio intelligence — обучению моделей, таких как Gemini, обрабатывать аудио напрямую, одновременно воспринимая звук и намерение. В публикации перечислены конкретные направления:

  • Инструменты диалога в реальном времени. Gemini 3.5 Live Translate обеспечивает синхронный устный перевод на 70 языках и более чем 2000 языковых пар, улавливая переключение между языками и эмоциональные сигналы.
  • Транскрипция. Gemini 3.5 Transcribe назван самой точной моделью преобразования речи в текст от Google: она превращает сырое аудио в отформатированный текст даже в шумной обстановке и при сложной терминологии. На её основе работает функция Rambler в Android Gboard, которая убирает слова-заполнители, исправляет грамматику и пунктуацию, позволяет редактировать текст голосом и переключаться между языками.
  • Инициатива 1000 языков. Цель — поддержать 1000 самых распространённых языков мира. Для этого Universal Speech Model обучена на 12 млн часов аудио и использует cross-lingual transfer learning: модели переносят знания из языков с большим объёмом данных на языки с малым объёмом обучающих данных.
  • Исследовательская база. Работа опирается на 25 лет открытых исследований и более 400 рецензируемых научных работ по речи.

Локальные партнёрства для сбора данных

Поскольку интернет непропорционально представляет несколько доминирующих языков, для обучения AI пониманию мало представленных языков Google пересмотрела подход к сбору данных, сделав ставку на локальные партнёрства. В публикации упомянуты три открытых проекта:

  • WAXAL (на языке волоф — «говорить») — крупный открытый речевой датасет, созданный с партнёрами, включая Makerere University и Digital Umuganda. Он охватывает 27 языков Субсахарской Африки, на которых говорят более 100 млн человек в более чем 26 странах, и фиксирует тональные вариации и разговорные ритмы.
  • Project Vaani — совместный проект с Индийским институтом науки (IISc) и Bhashini, который картографирует языковое разнообразие Индии по региональному, а не языковому принципу. На сегодня собрано более 30 000 часов речи на 109 языках от более чем 155 000 носителей.
  • Amplify Initiative — партнёрство с более чем 1600 локальными экспертами и 20 университетами на четырёх континентах, включая бразильский UFMG, индийский IIT Kharagpur и угандийский Makerere University. В рамках проекта собрано 15 000 мультимодальных точек данных, отражающих локальные нюансы.

Кроме того, Google развивает инструмент Language Explorer — интерактивный сервис, визуализирующий LinguaMeta, крупнейший открытый репозиторий языковых данных. Он непрерывно картографирует более 7000 устных, письменных и жестовых языков и был отмечен Fast Company за инновации в дизайне.

Google.org поддерживает инициативы, включая Centre for Digital Language Inclusion и Project Aquarium от AI Singapore, которые помогают приносить многоязычные инструменты фермерам, медицинским работникам, учителям и другим представителям местных сообществ.

Работа при ограничениях и доступность

Google напоминает, что для более чем 3 млрд человек надёжный доступ в интернет по-прежнему недоступен. Чтобы технологии работали в условиях ограниченного или прерывистого подключения, компания разработала TranslateGemma — семейство лёгких открытых моделей перевода на базе Gemini, обученных на 55 языках. TranslateGemma эффективно работает на устройстве, поэтому качественный перевод не требует подключения к облаку или интернету.

Для сотен миллионов людей, пользующихся кнопочными телефонами в регионах с ограниченными ресурсами, Google поддерживает организации вроде Viamo с голосовым AI-ассистентом «Ask Viamo Anything» (AVA), который приносит возможности Gemini на стандартные кнопочные телефоны. Viamo провела пилот AVA в Руанде среди пользователей интерактивного голосового ответа, и сервис уже использовал Gemini, чтобы ответить более чем на 2 млн вопросов.

Отдельное направление — доступность. Обычные речевые инструменты часто не подходят людям с нестандартной речью. Google разрабатывает решение Sign Language-to-Text (SL2T), обученное на более чем 50 жестовых языках. Оно обеспечивает диктовку с жестов в текст в Gboard и Live Transcribe на Pixel 11, начиная с американского жестового языка (ASL) на английский. По данным компании, это первый шаг к доступности продуктов для 70 млн человек в мире, которые полагаются на жестовый язык.

Локальное произношение

Google также приводит пример работы с локальными сообществами в Новой Зеландии: вместе с экспертами по языку маори компания улучшила произношение топонимов в Google Maps. Включение культурно достоверных произношений в модели text-to-speech, по замыслу компании, помогает технологиям отражать язык и наследие сообществ.

Что это значит

Публикация Google показывает, что работа с языками в AI смещается от простого текстового перевода к обработке аудио, эмоций и смешения языков, а также к сбору данных через локальные партнёрства. Компания заявляет о поддержке более 300 языков и о целях вроде 1000 языков, однако конкретные сроки достижения этих целей в материале не приводятся. Для пользователей это означает постепенное расширение доступности инструментов на языках, которые ранее были слабо представлены в цифровой среде, а также появление решений, работающих без постоянного подключения к интернету.

ВОПРОСЫ И ОТВЕТЫ

Коротко о главном

Сколько языков поддерживают технологии Google?

По данным Google, её технологии и продукты обеспечивают взаимодействия более чем на 300 языках, на которых говорят свыше 7 млрд человек — 86% населения планеты.

Что такое Gemini 3.5 Live Translate?

Это инструмент синхронного устного перевода, который, по данным Google, поддерживает 70 языков и более 2000 языковых пар и улавливает переключение между языками и эмоциональные сигналы.

Что такое инициатива 1000 языков?

Это цель Google поддержать 1000 самых распространённых языков мира. Для этого используется Universal Speech Model, обученная на 12 млн часов аудио, и cross-lingual transfer learning.

Что такое TranslateGemma?

Это семейство лёгких открытых моделей перевода на базе Gemini, обученных на 55 языках. Они эффективно работают на устройстве, поэтому качественный перевод не требует подключения к облаку или интернету.

Что такое Sign Language-to-Text (SL2T)?

Это решение Google, обученное на более чем 50 жестовых языках. Оно обеспечивает диктовку с жестов в текст в Gboard и Live Transcribe на Pixel 11, начиная с американского жестового языка (ASL) на английский.

Как подготовлен материал

Черновик был создан с помощью ИИ по указанному первоисточнику и опубликован в формате ITBlogs. Факты следует сверять с оригинальной публикацией.

С
АВТОР

Сергей

Администратор проекта

ОБСУЖДЕНИЕ

Комментарии · 0

Войдите, чтобы участвовать в обсуждении.