# 字节 Seed 发布 SeedRealtime，一个能边看、边听、边说的端到端音视频模型，已在豆包上线

> 原标题：字节 Seed 发布 SeedRealtime 音视频全双工大模型，走向全模态自然交互

- 来源：AI HOT 精选
- 发布时间：2026-08-04T16:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/48759
- 原文：https://seed.bytedance.com/zh/blog/seedrealtime-%E9%9F%B3%E8%A7%86%E9%A2%91%E5%85%A8%E5%8F%8C%E5%B7%A5%E5%A4%A7%E6%A8%A1%E5%9E%8B%E5%8F%91%E5%B8%83-%E8%B5%B0%E5%90%91%E5%85%A8%E6%A8%A1%E6%80%81%E8%87%AA%E7%84%B6%E4%BA%A4%E4%BA%92

## 摘要

SeedRealtime 把语音、画面和文字塞进了同一个模型里，不再走“先听写、再看图、最后念稿”的老路。它能在连续的音视频流里实时判断什么时候该接话、该盯着谁，官方说端到端人工评测里，抢话、迟回、被背景闲聊误触发的节奏问题比级联方案少了一半。几个演示场景挺具体：聚餐时能记住每个人的声音和脸，逛博物馆看到指定展品会主动出声提醒，冲咖啡时发现你把整粒豆子...

## 推荐理由

我会先打个折：正文没给延迟、并发成本这些工程硬指标，所以不能直接说“省了多少钱”。但这条消息值得上 featured，因为字节跳过了“先 ASR 再 LLM 再 TTS”的拼接方案，直接训了一个原生音视频全双工模型，并且端到端评测给出了节奏问题减半的量化结果。几个演示场景（聚餐认人、博物馆提醒、冲咖啡纠错）把“全模态交互”从论文拉到了产品里，豆包 App 全量上线也说明这不是实验室 demo。对从业者来说，这是第一个能摸到的音视频全双工大模型产品，工程参考价值大于论文本身。

## 锐评

SeedRealtime 做对了一件事：不再走“先听写、再看图、最后念稿”的老路，而是让模型在连续的音视频流里自己决定什么时候该接话、该盯着谁。官方给出的端到端人工评测数据是，对话节奏问题比级联方案减少一半，这个数字挺实在，但没披露测试样本量和场景覆盖度，所以“一半”这个幅度先别太激动。

几个演示场景选得聪明：聚餐认人、博物馆主动提醒展品、冲咖啡纠错，都是真实生活里级联系统容易翻车的地方。模型能记住“看到错金银铜虎噬鹿屏座就提醒我”这种长线任务，说明它把视觉感知和对话状态绑在了一起，不是简单的看图说话。不过正文没提模型规模、推理延迟和端侧部署方案，这些对实际体验影响很大。

目前产品已在豆包全量上线，算是业界第一个把音视频全双工大规模推出去的。但还缺第三方横向对比，也没说在极端噪声、多人抢话场景下的翻车率。后续如果能补上这些，判断会更踏实。
