Google показала переводчик, который сохраняет голос и интонацию
Google представила Gemini 3.5 Live Translate — новую звуковую ИИ-модель для перевода речи в реальном времени. Система умеет автоматически распознавать более 70 языков и переводить речь с сохранением темпа, высоты голоса и интонации говорящего.
Главная идея технологии — сделать живой разговор на разных языках более естественным. Перевод должен звучать не как отдельная механическая озвучка, а как продолжение исходной реплики.
Перевод идёт почти одновременно с речью
Обычные голосовые переводчики часто ждут, пока человек закончит фразу, а уже потом начинают обработку. Из-за этого в диалоге появляются паузы, которые мешают нормальному общению.
Gemini 3.5 Live Translate работает иначе. Модель обрабатывает аудиопоток синхронно и выдаёт перевод с задержкой всего в несколько секунд.
Для пользователя это значит, что разговор становится ближе к обычной беседе. Собеседникам не нужно постоянно останавливаться, ждать перевода и заново подстраиваться под ритм общения.
Сохраняются голосовые особенности
Самая заметная особенность модели — сохранение интонации, темпа и высоты голоса. Это важно, потому что речь передаёт не только смысл слов.
Интонация помогает понять эмоции, уверенность, вопрос, сомнение или раздражение. Если перевод полностью лишён этих особенностей, разговор становится сухим и менее точным.
Новая система пытается сохранить характер исходной речи. Такой подход может быть полезен не только в бытовом общении, но и в переговорах, обучении, поддержке клиентов и видеоконференциях.
Модель рассчитана на шумные условия
Google отдельно отмечает, что система адаптирована к работе в шумной обстановке. Это важный пункт для реального использования.
Переводчик может понадобиться не в тихой комнате, а в аэропорту, на улице, в машине, офисе, кафе или во время звонка с нестабильным звуком.
Если модель способна лучше справляться с фоновыми шумами, она становится практичнее. В голосовых сервисах качество распознавания часто падает именно тогда, когда условия отличаются от идеальных.
Разработчики уже получили доступ
Инструмент доступен разработчикам в формате публичной предварительной версии через Gemini Live API и Google AI Studio.
Это значит, что технологию можно будет встраивать в сторонние приложения и сервисы. Разработчикам не придётся с нуля создавать сложную инфраструктуру для потоковой передачи аудио и перевода.
Также заявлена интеграция с профильными платформами для работы с медиапотоками. Это может ускорить появление новых сервисов на базе голосового перевода.
Технологию начнут внедрять в Meet и Translate
В корпоративном сегменте функция начнёт тестироваться в Google Meet для подписчиков Google Workspace. Система должна поддерживать более 2000 языковых комбинаций в рамках одной встречи.
Это заметный шаг вперёд по сравнению с прежним вариантом, где набор языков был значительно уже и требовалось участие английского языка.
Для обычных пользователей функция появится через глобальное обновление приложения Google Translate на iOS и Android. При подключённых наушниках перевод можно будет передавать собеседнику, а на Android появится режим прослушивания через динамик смартфона.
Безопасность тоже учли
Все сгенерированные аудиозаписи будут маркироваться невидимым цифровым водяным знаком SynthID. Это нужно для борьбы с подделками и дезинформацией.
Такая мера особенно важна для технологий, которые умеют сохранять особенности голоса. Чем реалистичнее становится синтетическая речь, тем выше риск злоупотреблений.
Gemini 3.5 Live Translate показывает, каким может стать следующий этап голосового перевода. Если технология будет работать стабильно, языковой барьер в звонках, поездках и рабочих встречах станет заметно ниже.
