# 生数科技发布 Vidu S1，一张图就能跟 AI 打视频电话，语音指挥画面怎么变

> 原标题：生数科技发布 Vidu S1，推动视频生成迈向"实时交互"新时代

- 来源：AI HOT 精选
- 发布时间：2026-07-03T11:17:47.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/42187
- 原文：https://mp.weixin.qq.com/s/RuukpnoOA2tI0ERCNrLgtQ

## 摘要

生数科技在 2026 全球数字经济大会上放出了 Vidu S1，主打实时交互：你可以跟一个 AI 角色打视频电话，用语音直接控制画面走向，不限时长。它走的是自回归扩散路线，根据已经生成的画面和你的语音指令，持续预测下一帧，不需要传统建模。一张图片就能捏出一个角色，还能自定义音色。性能方面，540P 下跑到 25 FPS，最高能到 42 FPS，用 Tu...

## 推荐理由

生数科技放出的Vidu S1把视频生成从短片拉到了实时视频通话，交互形态变化大，技术细节和帧率也给了，所以给featured。没给更高分是因为目前只有发布信息，正文没披露实际延迟、并发成本或第三方评测，实际体验还得等上线再看。

## 锐评

Vidu S1 把视频生成做成了实时交互，你可以用语音跟一个AI角色视频通话，画面会跟着你的指令变，不限时长。它走的是自回归扩散路线，根据已生成的画面和语音输入持续预测下一帧，不需要传统建模。一张图就能捏角色，还能自定义音色。性能上，540P 跑到 25 FPS，最高能到 42 FPS，用 TurboDiffusion 压计算成本，如果是真的挺省钱。

但正文没披露两个关键指标：从你说话到画面反应的实际延迟是多少，以及长时间对话里角色会不会崩。25 FPS 是生成速度，不等于端到端交互延迟。另外，语音控制画面走向的准确率、复杂指令的理解能力都没提，这些直接决定它到底是玩具还是能进业务流程干活的东西。内测刚开，建议等实测数据再判断。
