# Google 放出 Gemini 3.5 实时翻译，70 多种语言语音直转，延迟接近实时

> 原标题：Google AI 发布 Gemini 3.5 Live Translate，支持 70+ 语言近实时语音到语音翻译

- 来源：AI HOT 精选
- 发布时间：2026-07-14T15:17:40.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/44295
- 原文：https://x.com/googleaidevs/status/2077049898059354565

## 摘要

Gemini 3.5 Live Translate 直接处理原始音频流，不是先转文字再翻译再念出来，所以能保留说话人的语调、节奏和音高。支持 70 多种语言，延迟做到近实时。东南亚打车平台 Grab 已经在测试，用来解决司机和乘客跨语言通话的问题——Grab 用户每月语音通话量超过 1000 万次，这个量级如果真能跑通，省下的沟通成本不小。开发者现在可...

## 推荐理由

Google 发了端到端语音翻译，Grab 已经在每月 1000 万+通话量里实测，技术信号和落地验证都够硬。没给 85 分以上是因为正文没披露具体延迟毫秒数和翻译质量指标，目前只能当方向性利好来看。

## 锐评

这条最值得看的是架构变化：不是传统的语音转文字、翻译、再文字转语音三件套，而是直接吃原始音频流，输出翻译后的音频流。好处是能保住说话人的语调、节奏和音高，翻译听起来更像本人说话，而不是机器人念稿。支持 70 多种语言，延迟说"近实时"，但正文没给具体数字，这点先别太激动——"近实时"在不同场景下可以是 200 毫秒也可以是 2 秒，差别很大。

Grab 的测试场景挺实在。他们每月语音通话量超过 1000 万次，司机和乘客跨语言沟通是刚需，不是 demo 摆拍。如果真能跑通这个量级，省下的沟通成本不小。但正文没披露测试期间的准确率、用户反馈或异常处理情况，这些才是判断能不能落地的关键。

开发者接入方式给了好几个选项：LiveKit、Fishjam、Pipecat、Vision Agents，还提到 Software Mansion 用 MoQ 协议解决流媒体瓶颈。说明 Google 这次不只是发模型，配套的工程链路也在推。但 Cookbook 示例代码和实际生产环境之间还有多大坑，正文没提，想试的团队得自己趟一遍。
