字节 Seed 发布 SeedRealtime,一个能边看、边听、边说的端到端音视频模型,已在豆包上线
字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互
SeedRealtime 把语音、画面和文字塞进了同一个模型里,不再走“先听写、再看图、最后念稿”的老路。它能在连续的音视频流里实时判断什么时候该接话、该盯着谁,官方说端到端人工评测里,抢话、迟回、被背景闲聊误触发的节奏问题比级联方案少了一半。几个演示场景挺具体:聚餐时能记住每个人的声音和脸,逛博物馆看到指定展品会主动出声提醒,冲咖啡时发现你把整粒豆子...
推荐理由:我会先打个折:正文没给延迟、并发成本这些工程硬指标,所以不能直接说“省了多少钱”。但这条消息值得上 featured,因为字节跳过了“先 ASR 再 LLM 再 TTS”的拼接方案,直接训了一个原生音视频全双工模型,并且端到端评测给出了节奏问题减半的量化结果。几个演示场景(聚餐认人、博物馆提醒、冲咖啡纠错)把“全模态交互”从论文拉到了产品里,豆包 App 全量上线也说明这不是实验室 demo。对从业者来说,这是第一个能摸到的音视频全双工大模型产品,工程参考价值大于论文本身。