跳到正文

千问 Qwen

阿里千问 Qwen 系列的开源发布与迭代:从旗舰模型到端侧小模型的全谱系动态。

最新精选

第 1–20 条 · 共 205 条

9月24日星期四

Computing Life · Share · 鸭哥调研

Qwen-Image-2.1:版本号从3.0跳回2.1,一个模型把生图、改字、抠透明底全包了

Qwen在9月20日开源了7B参数的图像模型Qwen-Image-2.1,它把文生图、局部编辑和原生输出透明PNG这三件事收进了同一个管线里。最显眼的是版本号从7月的3.0反向跳回2.1,这背后是团队在2026年把产品分成了两条线:3.0是只提供API的闭源商业版,2.1则是继续走开源研究路线的分支。模型内置了一个能处理透明通道的自编码器,生成图片时直...

推荐理由:Qwen把一个模型同时干三件事——生成、编辑、出透明图——这比换个壳实在,版本号反跳也不是噱头,而是2026年双线策略的明确信号。对做图的人来说,少切一次工具就是省时间,点击欲和共鸣都够,分数不往上拉是因为正文没给透明通道在实际场景里的量化效果,先保守一点。

9月23日星期三

AI HOT 精选

Qwen 发了五个音频模型,语音识别、合成和实时对话都更新了,还加了两个创作和理解的新模型

Qwen-Audio-3.1 这次一口气放出五个模型,把之前的语音识别(ASR)、语音合成(TTS)和实时对话(Realtime)都升了级,另外新加了 TTS-Next 和 ASR-Next,分别用来做音频创作和更深层的音频理解。Realtime 模型现在能随时被打断,检测到你情绪低落时还会放慢语速、用更共情的方式回话。价格砍得挺狠:TTS 降了约七成...

推荐理由:Qwen 语音全家桶一次更新五个模型,不是简单刷版本号。我会先打个折:正文没披露 ASR-Next 和 TTS-Next 的具体能力边界和评测数据,这点先别太激动。但 TTS 降价约七成、Realtime 支持情绪感知打断,都是可验证的硬信息,对从业者选型和成本估算有直接参考价值。

9月22日星期二

Hacker News 首页

Tim Dettmers 实验室开源周:在你自己的硬件上跑前沿 AI

Tim Dettmers 的 dlab 这周会开源一整套工具,目标是让前沿 AI 能在本地硬件上跑起来。他们放出了一个能自己优化 Metal 内核的智能体,把 Qwen 3.6 35B-A3B 模型压到每个权重只占 1.5 比特,在 Mac 上跑出了每秒 450 个 token 的速度。核心观点是,现在做研究的基本单位不再是单篇论文,而是一套能互相配合...

推荐理由:Tim Dettmers 在量化领域是核心人物,这次不是发论文而是直接甩工具链,数字也具体(1.5 比特、450 tok/s),可复现路径摆出来了。我会先打个折:目前只是博客预告,实际兼容性和稳定性要等代码放出来才知道,但信息量和话题性都够上 featured。

9月20日星期日

AI HOT 精选

Qwen 开源 7B 图像模型,把生图和修图合二为一,还直接支持透明图

Qwen 放出了一个叫 Qwen-Image-2.1 的开源模型,参数量 7B,把文生图和图像编辑做进了一个轻量系统里。它最特别的地方是原生支持透明图像:你可以直接用文字让它生成带透明通道的 PNG,也能编辑已有的透明图层,甚至从普通照片里把主体抠出来变成 RGBA 素材。编辑能力上,它一次最多能参考 10 张图,支持局部修改和保持人物、产品不走样。为...

推荐理由:Qwen 这次放出的 7B 模型,最抓人的点是原生透明图像——不是后期抠图,而是直接生成 RGBA 的 PNG。这对做设计、做素材的人来说省了一步大工序。编辑能力上,一次能塞 10 张参考图,局部修改时尽量保持主体不走样,听起来实用。我会先打个折:正文没提推理延迟和显存要求,7B 模型跑起来到底要多快的卡、多高的成本,现在还不知道。另外,透明图像的生成质量和复杂场景下的抠图效果,也得自己上手试了才敢说稳。整体看,这个模型把生成和编辑捏在一起,又开源,对想自己搭工作流的团队是个好消息,但别急着把它当成即插即用的省钱方案,先看看实际跑起来的硬件门槛。

9月18日星期五

AI HOT 精选

Qwen 发布实时同传模型,延迟压到 2.3 秒,能分清谁在说话

Qwen3.8-LiveTranslate 把同声传译的延迟从上一代的 2.8 秒降到了 2.3 秒。它用了一种叫“交错架构”的方法,把音频和文字编成一条流,让模型边听边译,已经翻译过的内容可以缓存复用,所以质量比上一代有明显提升。这个模型支持 60 种语言的语音输入,新增了三个实用能力:一是实时区分说话人,多人轮流发言时能标出每句话是谁说的,并且克隆...

推荐理由:Qwen这次把同传延迟从2.8秒砍到2.3秒,靠的是交错架构和缓存复用,不是单纯堆算力。新增的说话人区分、声音克隆和双语字幕让模型从“翻译”往“场景理解”迈了一步。正文只给了官方博客,没有第三方评测或实际部署数据,所以分数没往上拉。对需要低延迟翻译的场景,这模型确实实用,但效果还得等更多人跑过才知道。

AI HOT 精选

Qwen 发布 Qwen3.8-Omni-Flash,一个让音视频模型从“看懂”转向“干活”的原生全模态模型

Qwen 推出了 Qwen3.8-Omni-Flash,这个模型的重点不再是单纯理解音视频,而是能规划任务、调用工具、完成实际工作,比如视频剪辑、MV 制作、电影解说和实时对话。它支持 100 万 token 的上下文窗口,在 29 项评测里平均分比上一代 Qwen3.5-Omni-Plus 高出 25% 以上。价格降得很猛:音频输入每小时 API 费...

推荐理由:Qwen 把全模态模型从理解推到了任务交付,有具体评测分和定价做支撑,不是空喊口号。分数定在 82 而不是更高,是因为这是发布首日的信息,没有第三方复现或跨源交叉验证,实际稳定性和延迟都还是未知数。

9月17日星期四

Hacker News 首页

训练一个 4B 模型,让它生成的查询计划比 Postgres 默认的快 81%

Rohan Bansal 拿 Qwen 4B 模型做实验,先让 GPT-6 Astra 当老师,用 500 条示范轨迹做监督微调,再设计了一套强化学习变体,让模型自己生成查询计划、扔到 Postgres 里实测耗时,根据快慢给奖励信号来更新权重。在 113 条多表联查的 SQL 上,最终模型生成的计划比 Postgres 默认计划延迟降低 44.7%,...

推荐理由:一个 4B 小模型,靠强化学习训出来的查询计划比 Postgres 默认计划快 81%,方法本身有实用价值。但测试只跑了 113 条多表联查 SQL,能不能泛化到其他场景还没验证,所以分数卡在 78。

9月7日星期一

r/LocalLLaMA

Qwen 3.8-27B 的 4-bit 量化版调两个参数后,跑分反超 Q5 量化并逼近官方满血版

一位老哥在 5090 上对比了 Qwen 3.8-27B 的两种本地运行方式:用 NInfer 跑的 NVFP4(4-bit 量化)和用 llama.cpp 跑的 Q5_K_M。一开始用默认采样参数(temp=1.0, min_p=0.0)跑 IFBench 指令遵循测试,Q5 严格分 76% 略高于 NVFP4 的 74%。但他发现 NVFP4 的宽...

推荐理由:这是一篇单人单卡、单模型的实测笔记,不是纸上谈兵。作者发现NVFP4默认参数下指令遵循能力被压住了,调参后直接反超更高比特的量化方案,还附了速度对比。我会先打个折:测试只在一张5090上跑了一个模型,依赖NInfer这个相对小众的推理引擎,普适性有限。但文章的价值在于给出了一个具体、可复现的调参思路,对本地部署党来说比泛泛的量化对比报告有用得多。

9月6日星期日

Computing Life · Share · 鸭哥调研

tok/s 是 agentic 场景里最会骗人的性能数字

作者拿 Cerebras 托管的 Qwen 27B(宣称每秒 1500 token)和本地跑的同一模型(实测每秒 102 token)做了一次真实写代码工作流的对比。算上输入预填充的时间后,云端实际有效吞吐只有 357 tok/s,比本地 102 tok/s 快 3.5 倍,远不是纸面上的 15 倍。更麻烦的是,云端模型吐字越快,agentic 循环转...

推荐理由:作者用30天的真实agentic工作流数据,把Cerebras宣称的1500 tok/s拉回到有效吞吐357 tok/s——只比本地快3.5倍。数字和方法论都扎实,不是空对空。没给更高分是因为云端样本偏小(28次生成),且本地配置细节没完全展开,结论的普适性可以先打个折。

9月4日星期五

r/LocalLLaMA

Qwen3.8-27b 被用户称为首个能“闭眼信任”的本地模型

Reddit 上有用户说,Qwen3.8-27b 在连续 8 个多小时的 agent 任务里一次都没出错,是他用过的第一个能像顶尖闭源模型那样放心把活丢给它的本地模型。另一位用户也证实,自己跑过 20 小时的会话,让模型用子代理和提交检查点干活,INT8 量化版甚至解决了一个 DeepSeek V4 Flash 没搞定的代码问题。帖子没说明具体任务类型...

推荐理由:两个独立用户都说Qwen3.8-27b在几小时到二十小时的agent任务里表现稳定,其中一个还直接跟DeepSeek V4 Flash做了对比,量化版反而解决了问题。我会先打个折:帖子没说明具体任务类型、失败标准,也没给出可复现的测试方法,这本质上是社区口碑,不是严谨评测。但考虑到本地模型长时间跑agent不出错这件事本身就稀缺,这条信息对从业者选型有参考价值,所以给72分,放在featured位置。

Computing Life · Share · 鸭哥调研

同一套编排骨架,换 GPT-4o 只多 5.8 分,训练 7B 决策节点却多出 17.2 分

Stanford 的 AgentFlow 论文做了一个很直接的对比:在同一个 agent 工作流里,把负责规划和调工具的决策节点从 Qwen2.5-7B 换成 GPT-4o,六个基准测试平均只涨了 5.8 分。但让这个 7B 节点在真实运行环境里,根据工具返回的成败信号边跑边学,平均涨了 17.2 分。差距不在模型大小,在于一个能持续吸收反馈,另一个停...

推荐理由:我会先打个折:正文没披露训练成本和延迟数据,所以 17.2 分的提升能不能直接搬到生产环境还得看具体实现。但 Stanford 这篇 AgentFlow 论文的对比很直接——在同一个 agent 工作流里,把决策节点从 Qwen2.5-7B 换成 GPT-4o,六个基准平均只涨 5.8 分;让这个 7B 节点根据工具返回的成败信号边跑边学,平均涨了 17.2 分。差距不在模型大小,在于一个能持续吸收反馈,另一个停在那里。对正在搭 agent 的人来说,这比无脑上大模型省钱,也给出了一个可复现的训练思路。

9月2日星期三

Hacker News 首页

Slotstream 让 48GB 内存的 Mac 跑起 104GB 的 Qwen 大模型,速度约每秒 12 个 token

carloslfu 开源了一个叫 Slotstream 的工具,用 MLX 和 Swift 写成。它能让一个 1250 亿参数、4-bit 量化后体积仍有 104GB 的 MoE 模型(Qwen3.8-Flash-Next),在一台只有 48GB 内存的 Mac 上跑起来。原理是不把整个模型塞进内存,而是按需从 SSD 里流式加载专家模块。生成速度大约...

推荐理由:一个个人项目,用流式加载专家模块的办法,让 104GB 的 Qwen 125B 模型在 48GB Mac 上跑到每秒约 12 token。工程思路干净,还给了 Ollama 兼容接口,试错门槛低。扣分是因为目前没有社区验证,正文也没披露长上下文下的稳定性或并发表现,所以我会先打个折。

9月1日星期二

Hacker News 首页

Hugging Face 2026 夏季开放模型观察:中国实验室造最大模型,但小模型才是真干活的主力

Hugging Face 每半年一次的生态报告更新了,这次覆盖 2026 年 1 到 8 月。最直观的变化是,中国实验室几乎每个月都在发布参数规模最大的开放模型,从 754B 一路干到 2.78 万亿参数,而美国实验室除了 NVIDIA 的 Nemotron 3 Ultra(561B)和 Thinking Machines Lab 的 Inkling,...

推荐理由:Hugging Face 的半年生态报告本身不是一手发布,但数字和对比框架够硬,三条都踩中了。扣分是因为正文只给了摘要,完整数据得点进去看,所以重要性打了 78 分。

8月29日星期六

r/LocalLLaMA

一台 16GB 显卡跑通 Qwen 3.8 27B 模型,100k 上下文速度冲到 50 token/秒

一位玩家在 RTX 4070 Ti SUPER(16GB 显存)上把 Qwen 3.8 27B 模型塞满了,生成速度跑到每秒 47-50 个 token,上下文窗口拉到 10 万 token。关键操作是用 beellama.cpp 引擎的非对称 KV 缓存压缩——K 缓存用 kvarn5、V 缓存用 kvarn4,省出约 6% 显存,把上下文从 8.8...

推荐理由:一条社区实战贴,参数和跑分都摆出来了,对 16GB 显卡用户有直接参考意义。没给更高分是因为 beellama.cpp 还是个偏小众的引擎,受众面不如 llama.cpp 广,而且这是个人分享的玩法,不是官方发布。

8月26日星期三

AI HOT 精选

Qwen 开源 Qwen3.8-Flash-Next:总参数 125B,每次只激活 6B,提前预览 Qwen4 架构

Qwen 放出了 Qwen3.8-Flash-Next 的权重,这是 Qwen4 架构的早期预览版。模型总参数 125B,但每次推理只激活 6B 参数,另外还带了一个 51B 的 N-gram 词表,可以卸载到内存里异步调用,不占显存。架构上改了四处:注意力层换成 Gated DeltaNet 加 Qwen 稀疏注意力,前者压缩长历史,后者用轻量索引挑...

推荐理由:Qwen 放出了 Qwen3.8-Flash-Next 权重,是 Qwen4 架构的早期预览。125B 总参数,每次推理只激活 6B,外加一个 51B 的 N-gram 词表可以卸载到内存异步调用,不占显存,部署成本会低不少。架构上改了四处,注意力层换成 Gated DeltaNet 加稀疏注意力,前者压缩长历史,后者用轻量索引挑 token,属于新机制落地。对做推理部署和关注国产开源模型进展的人来说,这是提前看 Qwen4 技术路线的窗口。信息来自官方发布,没有披露具体 benchmark 分数,这点先别太激动。

8月25日星期二

Hacker News 首页

Qwen 明天开源 Qwen3.8-Flash-Next:总参数 125B、激活 6B 的 MoE 多模态模型

Qwen 在 ModelScope 上预告了 Qwen3.8-Flash-Next,一个基于下一代 Qwen4 架构的多模态 MoE 模型,总参数 125B,每次推理只激活约 6B 参数。这次提前放出来是为了让社区先看看 Qwen4 的设计思路。明天(2026-08-26 15:00 UTC)正式开源,会同时放出 FP8 版本。正文没披露跑分、推理速度...

推荐理由:Qwen 提前放出了 Qwen4 架构的预告,125B 总参、6B 激活的 MoE 设计是实打实的新信息,在国内开源圈关注度很高。扣分是因为明天才正式开源,现在没跑分、没推理速度数据,我会先打个折——等明天 FP8 版本放出来再看实际表现。

8月21日星期五

Hacker News 首页

Nari Labs 把 Qwen3-TTS 的首音延迟压到 50 毫秒以内,一张 H100 就能跑 10 并发

Nari Labs 开源了一套 Qwen3-TTS 1.7B 的部署方案,在一张 H100 上做到 10 并发请求时,95% 的用户听到第一个字的时间不超过 50 毫秒,且播放不卡顿。他们对比了 vLLM-Omni、SGLang-Omni 等四个引擎,默认设置下最快的 p95 首音延迟也要 277 毫秒。核心优化有两招:一是动态切掉模型开头几十毫秒的静...

推荐理由:Nari Labs 开源了一套 Qwen3-TTS 1.7B 的部署方案,单张 H100 跑 10 个并发请求,95% 的用户在 50 毫秒内就能听到第一个字,比 vLLM-Omni 等引擎默认配置快了五倍以上。文章给了具体 benchmark 和可复现的优化步骤,我会先打个折——这是他们自己测的数据,实际场景里网络抖动和客户端解码还会吃掉一点延迟,但核心思路(动态剪掉开头静音、用 CUDA Graph 合并小算子)确实能帮做实时语音的团队少踩很多坑。

8月20日星期四

AI HOT 精选

阿里发布 Qwen-UI-Agent,一个能直接操作手机和电脑界面的模型

阿里千问团队放出了一个叫 Qwen-UI-Agent 的模型,专门训练它看懂并操作手机、电脑和网页的界面。在真机测试 MobileWorld-Real 上拿了 92.2% 的分数,AndroidDaily 接近满分 97.5%,电脑端 OSWorld-Verified 达到 79.5%,超过了 GPT-5.5 和 Gemini 3.1 Pro。训练时用...

推荐理由:阿里千问发了个 Qwen-UI-Agent,专门训练模型看懂并操作手机、电脑和网页界面,真机测试成绩压过了 GPT-5.5 和 Gemini 3.1 Pro。正文只给了标题和摘要,没展开训练细节和失败案例,所以分数先打到 82,等完整信息出来再调。

8月19日星期三

Hacker News 首页

粘贴一个 HuggingFace 模型 ID,就能看到它的交互式结构图,不用下载权重

modelmap.cc 这个工具把任何 HuggingFace 模型变成一张可交互的架构图。它先在 meta 设备上实例化模型拿到结构,再跑一次假的 traced 前向传播来推断张量形状,全程不下载实际权重。首页展示了 Qwen3.8-27B、DeepSeek-V4-Pro-0813、Kimi-K3 等热门模型,也放了 GPT-2、BERT、DeepS...

推荐理由:一个实用的 Show HN 工具,不下载权重就能画出模型架构图,首页还挂了 DeepSeek-V4-Pro 和 Kimi-K3。H 和 K 都踩中了,但 R 缺了点传播性——更像工具书签而不是话题引子。分数 72,刚好卡在 featured 线上。

8月18日星期二

Hacker News 首页

Qwen3.8 27B 在 Artificial Analysis 综合智能评测里拿了 52 分,开源模型里排第一

阿里巴巴 2026 年 8 月放出的 Qwen3.8 27B,在 Artificial Analysis 的智能指数上得分 52,压过了另外 134 个模型,是目前开源权重模型里最高的。这个指数综合了 9 项考试,覆盖让模型干业务流程的智能体任务、写代码、科学推理和知识问答。模型话特别多,跑评测时吐了 1.6 亿个 token,差不多是其他模型中位数的...

推荐理由:Qwen3.8 27B 在 Artificial Analysis 的智能指数上拿了 52 分,是目前开源权重模型里最高的,压过 134 个模型。数据给得实在,有分数、有 token 量对比,也把话多导致推理成本高的问题讲清楚了,三个维度都踩中。没给更高分是因为这是第三方跑分,不是自家放出的新能力或开源动作。