跳到正文
r/LocalLLaMA

拿世界杯解说片段去测一个开源语音模型,短句情绪保留得不错,长句就露馅了

Tossed distorted audio samples to an open-weight voice model; it did fairly well.

一个用户拿世界杯解说片段去测开源语音模型 Confucius4,包括尖叫解说、屏息爆发和门将赛后颤抖采访。模型直接从音频翻译,不依赖文字稿,短句情绪保留得很好,但长句因为要边听边猜后半句,合成感就出来了。帖子没披露模型大小、训练数据和中英文支持情况。

读原文 ↗导出 Markdown