# 拿世界杯解说片段去测一个开源语音模型，短句情绪保留得不错，长句就露馅了

> 原标题：Tossed distorted audio samples to an open-weight voice model; it did fairly well.

- 来源：r/LocalLLaMA
- 发布时间：2026-09-04T12:50:25.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54787
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1w73ikh/tossed_distorted_audio_samples_to_an_openweight/

## 摘要

一个用户拿世界杯解说片段去测开源语音模型 Confucius4，包括尖叫解说、屏息爆发和门将赛后颤抖采访。模型直接从音频翻译，不依赖文字稿，短句情绪保留得很好，但长句因为要边听边猜后半句，合成感就出来了。帖子没披露模型大小、训练数据和中英文支持情况。
