# Qwen 发布 Qwen3.8-Omni-Flash，一个让音视频模型从“看懂”转向“干活”的原生全模态模型

> 原标题：Qwen 发布原生全模态模型 Qwen3.8-Omni-Flash，主打音视频智能体任务交付

- 来源：AI HOT 精选
- 发布时间：2026-09-17T17:18:08.568Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/57148
- 原文：https://qwen.ai/blog?id=qwen3.8-omni-flash

## 摘要

Qwen 推出了 Qwen3.8-Omni-Flash，这个模型的重点不再是单纯理解音视频，而是能规划任务、调用工具、完成实际工作，比如视频剪辑、MV 制作、电影解说和实时对话。它支持 100 万 token 的上下文窗口，在 29 项评测里平均分比上一代 Qwen3.5-Omni-Plus 高出 25% 以上。价格降得很猛：音频输入每小时 API 费...

## 推荐理由

Qwen 把全模态模型从理解推到了任务交付，有具体评测分和定价做支撑，不是空喊口号。分数定在 82 而不是更高，是因为这是发布首日的信息，没有第三方复现或跨源交叉验证，实际稳定性和延迟都还是未知数。

## 锐评

Qwen3.8-Omni-Flash 把重心从“理解”转向了“干活”，也就是让模型能规划任务、调用工具，去完成视频剪辑、电影解说这类实际工作。这比单纯刷理解分更有意思，因为它直接面向业务流程。从数据看，29 项评测平均分比上一代高了 25% 以上，在 WildClawBench-MM 这类智能体评测上提了 36.5 分，说明干活能力确实有提升。价格方面，音频输入每小时 API 费降了超过 98%，音视频输入降了超 93%，如果是真的，成本优势会很明显。

不过，这篇官方博客没给出具体的模型参数量，也没说这些评测任务的具体难度分布。它声称音频整体表现超过 Gemini 3.8 Flash，音视频表现接近，但对比的基准和细节没展开，这点先别太激动。另外，长音频和视频在真实业务里的存储、传输和推理成本很高，文章虽然提到了这些挑战，但没给出具体的解决方案和实测延迟数据。还缺在嘈杂真实场景下的稳定性报告，以及工具调用失败时的兜底策略。
