跳到正文

千问 Qwen

阿里千问 Qwen 系列的开源发布与迭代:从旗舰模型到端侧小模型的全谱系动态。

最新精选

第 181–200 条 · 共 205 条

4月30日星期四

r/LocalLLaMA

用 Kokoro 82M 和 Qwen 在本地把 PDF 转成有声书

Reddit 用户 purellmagents 搭了一套完全跑在本地的 PDF 转有声书流程,用 Kokoro 82M 做语音合成,Qwen 3.5 0.8B 或 2B 处理文本,llama.cpp 做推理,整个应用用 Tauri 2.0 打包,在 M1 Mac 上运行。工作方式是先读前 15 句,边读边准备下 15 句,减少等待。作者说真正的难点不在...

推荐理由:HKR 三项都踩中了,但本质是 Reddit 上的个人工作流展示,不是模型或平台发布。具体组件和 15 句预处理窗口让它能进低分 featured 档。我会先打个折:正文没披露代码和表格朗读的具体处理逻辑,这点先别太激动。

4月29日星期三

r/LocalLLaMA

双卡 RTX 5060 Ti 16GB 跑通 Qwen3.6 27B,vLLM 下跑到约 60 tok/s,支持 204K 上下文

一位用户用两张 RTX 5060 Ti 16GB 显卡,通过 vLLM 部署了 Qwen3.6 27B 模型。实测在 8K 上下文时生成速度约 62–66 tok/s,两张卡共占用 32GB 显存。配置上开了张量并行(TP=2)、fp8 KV 缓存、多 token 预测(MTP 一次猜 3 个 token),并把上下文窗口拉到了 204800。显存是瓶...

推荐理由:H、K、R 全中。帖子是一手实测,硬件、vLLM 参数、速度、上下文上限和显存余量都列得清楚,对想用消费级显卡跑 27B 的人有直接参考价值。唯一扣分点是来源只有 Reddit 单帖,没有更多交叉验证,所以分数停在 76 不进 78–84 那档。

4月28日星期二

机器之心 · 公众号

联影智能开源了首个能看懂医疗视频的模型方案,还带了一个52万条数据的评测集

联影智能放出了 uAI-NEXUS-MedVLM,一个专门让大模型理解超声、内窥镜这类医疗视频的开源方案,配套论文中了 CVPR 2026。他们同时发布了一个叫 MedVidBench 的评测集,包含 53.2 万条视频-指令对,覆盖 8 种医疗视频来源和 8 类任务。团队拿 Qwen2.5-VL-7B 在这个数据集上做监督微调,在核心指标 CVS 上...

推荐理由:HKR 三项都站得住:真实医疗视频加首个开源方案自带话题性,53 万条数据和 89.4% 对 16.4% 的结果提供了硬信息,也切中了通用模型在专业领域拉胯、开源方案抢位的行业情绪。医疗场景的垂直属性让分数落在 78–84 区间,82 分合理。

r/LocalLLaMA

本地跑代码模型终于能干活了:27B 模型在 Terminal-Bench 2.0 上拿了 38.2%,落后云端前沿模型约 6-8 个月

Antigma 用一套 agent 流程测了多个 27B–32B 的开源模型,跑的是 Terminal-Bench 2.0 的 89 个任务,用的是官方默认超时设置,没放宽条件。成绩最好的是 Qwen 3.6-27B,89 题做对 34 题,得分 38.2%。这个分数本身不算高,现在云端最强的模型能到 80% 左右。但有意思的是时间差:把 38.2% ...

推荐理由:我会先打个折:这是单篇 Reddit 帖子,不是论文,测试细节和复现条件正文没展开。但它的判断很实在——本地小模型跑代码已经跨过“能用”的门槛,不是遥遥领先,而是落后托管前沿 6–8 个月,这个定位比单纯报分有用。38.2% 的分数本身不高,但放在 89 个终端任务里,说明日常写脚本、调配置这类活它能接住一部分。对想离线部署、省 API 钱的团队,这个信号值得跟。

4月27日星期一

Hacker News 首页

在万米高空断网跑大模型:M5 Max 撑了 10 小时,但一根充电线让我亏了 34W 供电

作者在伦敦飞拉斯维加斯的 10 小时航班上,用一台顶配 MacBook Pro M5 Max(128GB 统一内存、40 核 GPU)离线跑了 Gemma 4 31B 和 Qwen 4.6 36B 两个本地模型。他主要用 DuckDB 搭了个云账单分析工具,还处理了约 400 万 token 的零散编码任务。体验下来,写限定范围的代码、做小工具时,本地...

推荐理由:这是一篇第一人称的本地推理实测,硬件、模型、功耗数字都摆出来了,不是空谈。我会先打个折:它更像个人体验报告,不是行业级发现,所以分数落在 72–77 这个区间。真正有意思的是功耗可观测性——同一负载下 iPhone 线只供 60W,MacBook 线供 94W,差了 34W,这点先别太激动,但说明供电配件对本地跑大模型的实际性能影响不小。正文没披露模型量化方式,也没说具体跑了什么任务,所以不能把结论拔太高。

机器之心 · 公众号

苹果新论文问:多模态模型没开口的 logits 里,到底藏了多少画面信息?

苹果这篇论文直接测了一个安全问题:视觉语言模型在生成回答前,内部那串“候选词概率”(logits)会不会把图片细节漏出去。他们在 CLEVR 和 MSCOCO 上做实验,发现只靠排名前 30 到 80 的 logits 值,就能反推出图片里有没有噪声、目标物体的特征,甚至部分背景属性。风险点在于,现在有些灰盒 API 会返回 top-k 的 log 概...

推荐理由:我会先打个折:这不是一个能直接拿来用的攻击工具,更像一次扎实的探针实验。但它的价值在于把“logits 能泄密”从直觉变成了可量化的证据,30–80 这个范围让风险变得具体。对做 VLM API 的团队来说,如果还在对外吐 top-k 对数概率,这篇论文值得立刻看一遍。

4月24日星期五

机器之心 · 公众号

复旦等团队提出 HERMES:把 KV 缓存当分层记忆用,流式视频理解首 token 延迟最高降 10 倍

这篇讲的是复旦大学、上海科学智能研究院和新加坡国立大学一起搞的 HERMES,一个不用重新训练就能加速流式视频理解的框架。核心思路是把模型里的 KV 缓存(你可以理解成模型在推理时记下的“草稿纸”)重新组织成三层记忆:当前帧的短期记忆、最近几帧的中期记忆,以及更早帧压缩后的长期记忆。同时它做了跨层记忆平滑和位置重编号,让模型读这段压缩历史时不会因为位置...

推荐理由:我会先打个折:这是学术研究,不是产品发布,所以重要性停在 82。但 HKR 三项都站得住——10 倍提速是实打实的标题钩子,68% token 削减和 27-29ms TTFT 是能拿来算账的数字,而且方案免训练、开源,对做流式视频落地的团队来说,省 token 就是省钱,低延迟就是体验。正文没披露长视频下的记忆退化情况和更多模型上的泛化结果,这点先别太激动,但现有数据已经够让做实时视频 agent 的人认真看一遍。

4月23日星期四

量子位 · 公众号

Qwen3.6-27B 开源,参数只有前代旗舰的十五分之一,但在智能体编程上反超了 397B 模型

Qwen 放出了 Qwen3.6-27B 的权重,一个 270 亿参数的稠密模型。官方说它在四项智能体编程基准上全面超过了自家上一代 3970 亿参数的旗舰 Qwen3.5-397B。具体看,SkillsBench 从 30.0 跳到 48.2,GPQA Diamond 拿到 87.8,AIME26 达到 94.1,说明模型在需要调用工具、写代码解决问...

推荐理由:这是一次有料的 Qwen 开源发布,给出了智能体编程和推理的硬分数,HKR 三项都站得住。我维持 84 分不往上加,因为正文只给了基准数字,没提上下文窗口、推理成本或独立复现结果,这些缺口让判断先打个折。

彭博科技

阿里在通义千问 App 里接入了东航订票,用户能直接搜航班下单

阿里把中国东方航空的机票预订功能塞进了通义千问 App,用户不用跳转就能完成航班搜索和下单。这是通义千问的 agent 技术第一次开放给大型商业伙伴,意味着它从聊天助手往交易环节里走了一步。不过正文没披露具体上线地区、舱位覆盖、支付流程和双方怎么分账,所以实际体验和商业回报还得再等等看。

推荐理由:我会先打个折:正文没披露上线范围、支付流程和分成结构,所以别急着算账。但 Qwen 从纯聊天界面跨到交易闭环,是 agent 落地的硬信号。东航作为首个大型商业伙伴接入,说明阿里在推模型进业务流程干活,而不只是答问题。这点先别太激动,等看实际跑起来的订单量和客诉情况。

4月22日星期三

Hacker News 首页

Qwen 开源 27B 稠密模型,编程能力超过自家 397B 的 MoE 老旗舰

Qwen 放出了 Qwen3.6-27B,一个 270 亿参数的稠密模型,主打编程,而且直接开源。它最狠的地方是跑分超过了上一代 3970 亿总参数(每次激活 170 亿)的 MoE 模型 Qwen3.5-397B-A17B。在 SWE-bench Verified 上拿了 77.2 分,比老旗舰的 76.2 高;在 Terminal-Bench 2....

推荐理由:Qwen3.6-27B 是一次有分量的开源模型发布,权重直接可下,编程基准分数明确,而且走的是稠密路线而非更大的 MoE。对 AI 从业者来说,这意味着用更低的部署成本去试一个旗舰级编程模型。HKR 三项都站得住,按规则,国内大模型的重要发布应该和同等美国实验室的发布给到同一档分数。

4月21日星期二

机器之心 · 公众号

Monet:让多模态模型在脑子里直接画图推理,不用每次都调外部工具

Monet 把 Qwen2.5-VL-7B 改造成 Monet-7B,核心是让模型在连续的视觉潜空间里做抽象推理,而不是每次都去调用外部画图或识别工具。训练分三步:先用 12.5 万条数据做监督微调,再用 VLPO 强化学习对齐偏好。在分布内任务上比原版模型提升 3% 到 9.75%,在分布外的抽象视觉推理上提升 2.31%。论文被 CVPR 2026...

推荐理由:这篇讲的是Monet,基于Qwen2.5-VL-7B做的一个模型,核心是让多模态模型像人一样做抽象视觉思考。它不用外部工具,而是用连续隐式视觉嵌入来搞定,这点我会先打个折——思路不新,但工程上做得扎实。论文已被CVPR 2026接收,代码、模型和125K条SFT数据都开源了,对想复现的人友好。方法分三阶段SFT加一个叫VLPO的强化学习,用偏好样本教模型学回答风格。文中说分布内任务比基座好3%到9.75%,分布外抽象视觉推理提升2.31%,数字看着还行,但别太激动,因为没披露统一榜单的完整绝对分数,不知道跟其他模型比到底排第几。真正值得盯的是它把V...

4月20日星期一

r/LocalLLaMA

用本地 Qwen3.6 给 Claude Code 当副手,每次任务省下 30 倍 Opus token

一位 Reddit 用户把 Qwen3.6 通过 LM Studio 接成 Claude Code 的 subagent,让本地模型干提取和审计的粗活,Claude 只做最后决策。在两个审计任务里,Opus 的边际 token 消耗降了约 30 倍:一个 23 个文件的路由审计从 1.3 万 token 降到 400 token,一个 18 个文件的 ...

推荐理由:一个 Reddit 用户拿自己的两台机器做了两组任务对比,数字很直接:23 个路由文件审计从 13k token 降到 0.4k,18 个 Astro 文件盘点从 89k 降到 3k,省了约 30 倍 Opus token。机制是把提取、盘点、审计这类工作交给本地 LM Studio 跑的 Qwen 子代理,Claude Code 只做调度。正文没藏着掖着,承认 Qwen 和 Opus 各有漏检,不是单方面碾压。我会先打个折:只有两个任务、一个人跑、没大规模验证,但思路和数字对想省 Opus 费用的人有直接参考价值。

4月19日星期日

r/LocalLLaMA

同一个 9B Qwen 模型,换套脚手架,Aider 编程得分从 19.1% 跳到 45.6%

作者拿 Qwen3.5-9B 的 Q4 量化版跑 Aider 的多语言编程基准(225 道题),只换了调用模型的外层脚手架,平均 pass@2 就从 19.11% 拉到了 45.56%。这个叫 little-coder 的脚手架不是新模型,它做了几件事:限制推理步数、加写文件前的安全锁、让模型主动扫描工作区文件,以及每轮塞一点针对性技能提示。核心观点是...

推荐理由:我会先打个折:证据确实薄,只有两次完整运行,没做消融也没换模型复现,所以别急着当结论用。但 hook 很实在——同一套 9B 权重,只靠 scaffold 设计就把 Aider 成绩翻了一倍多,说明 scaffold 和模型的匹配度可能比模型本身还关键。作者列出的四个机制(受限推理预算、拒绝覆盖已有文件的 Write guard、显式工作区发现、按轮注入小技能)也给了可复现的线索。对正在折腾本地小模型做代码 agent 的团队,这篇值得看一眼思路,但暂时别拿 45.6% 当稳定预期。

机器之心 · 公众号

MIA 记忆智能体框架:让 AI 干活不再“失忆”,边用边学

上海一个研究团队搞了个叫 MIA 的记忆框架,想让 AI 智能体在干活时能记住经验、持续进步,而不是每次重启都像失忆一样。它把记忆分成参数记忆和非参数记忆两种,用交替强化学习来更新,还支持边测试边学习。团队说在 7 个数据集上拿了最好成绩,但具体分数正文没给出来。核心思路是把记忆当成能力内化,不光是翻旧账。

推荐理由:我会先打个折:文章说在 7 个数据集上拿了最佳,但没放具体数字,也没说跟哪些基线比、差距多大,这点先别太激动。真正有意思的是思路——把记忆从“翻之前的缓存”升级成“边干活边内化能力”,用 Manager–Planner–Executor 架构和交替强化学习让模型在开放任务里持续变强。对做 Agent 的人来说,这个方向比刷榜更有看头,但复现细节和验证强度目前还看不清。

4月17日星期五

r/LocalLLaMA

Qwen3.6 新增 preserve_thinking 开关,修了上一代多轮对话“失忆”的 bug

Qwen3.6 模型页面上多了一个 preserve_thinking 参数,默认要打开。它的作用是把模型上一轮的思考过程原样保留在上下文里,而不是像 Qwen3.5 那样每次重新序列化,导致 KV 缓存失效、模型记不住自己刚想过什么。作者给了一个很直观的测试:先让模型想两个 20 位数字,只说出第一个;下一轮再问第二个。开关关掉时模型会说自己没生成过...

推荐理由:这条 Reddit PSA 的价值在于挖出了一个藏在模型页里的开关。我会先打个折,因为这不是官方发布说明,而是社区踩坑分享,但信息密度够高:有复现步骤、有根因分析、还顺手标了 LM Studio 和 oMLX 的支持状态。对正在用 Qwen3.6 搭 agent 的人来说,知道 preserve_thinking 能让推理上下文跨轮保留,比看十篇通稿都实在。

Hacker News 首页

Qwen3.6-35B-A3B 在我笔记本上画的鹈鹕,比 Claude Opus 4.7 画的还好

Simon Willison 在他的 MacBook Pro M5 上跑了一个 20.9GB 的 Qwen3.6-35B-A3B 量化版模型,让它和 Anthropic 刚发的 Claude Opus 4.7 比画 SVG 鹈鹕。结果 Qwen 画的自行车骨架是对的,Opus 却把车架画错了,连试两次都没救回来。作者怕大家说模型厂商专门练过他的鹈鹕题,...

推荐理由:Simon Willison 自己做了个主观测试,用 Qwen3.6-35B-A3B 的量化版在笔记本上生成 SVG 鹈鹕图,然后说比 Claude Opus 4.7 画得好。他特意补了一句:这个玩笑基准跟模型整体实力的相关性,这次已经破了。所以别当通用结论看,就是个有趣的单点对比。文章给了具体配置和复现方法,信息够用,但没做系统评测,判断就挂在主观偏好上。

4月16日星期四

Hacker News 首页

通义千问开源 Qwen3.6-35B-A3B:总参数 350 亿,每次推理只激活 30 亿,主打编程智能体

Qwen 放出了一个新开源模型 Qwen3.6-35B-A3B,用的是混合专家架构,总参数量 350 亿,但实际干活时只调用 30 亿参数,跑起来很省资源。它的核心卖点是编程智能体能力,在 SWE-bench Verified 上拿了 73.4 分,Terminal-Bench 2.0 上 51.5 分,直接超过了自家上一代 270 亿参数的密集模型 ...

推荐理由:这是 Qwen 正经发模型,不是套壳功能更新。HKR 三条全中:低激活参数做代理编程是钩子,基准分数给了具体数字,开源权重加 30 亿激活直接戳部署成本和竞争焦虑。没给 p1 是因为目前只有一篇博客,还没看到第三方复现和更多消融实验。

r/LocalLLaMA

Qwen 放出 Qwen3.6-35B-A3B,35B 总参数只激活 3B,开源可商用

Qwen 发了个新模型,叫 Qwen3.6-35B-A3B,用的是稀疏 MoE 架构,总参数量 35B,但每次推理只激活其中 3B 参数,跑起来会比较省资源。采用 Apache 2.0 协议,可以商用。官方说法是它在写代码、处理多模态任务上表现不错,还支持“思考”和“不思考”两种模式,能直接塞进业务流程里干活。不过这篇帖子没给出具体的跑分、上下文窗口长...

推荐理由:这条帖子是个发布通告,信息量有限但钩子够硬。35B 总量、3B 激活的稀疏 MoE 听着省算力,但正文没放基准和上下文窗口,我会先打个折。Apache 2.0 开源是实锤,对想自己部署的人有吸引力;agentic coding 和多模态推理的说法先别太激动,等实测数据出来再看。

4月7日星期二

Latent Space

Gemma 4 首周下载量破 200 万,本地跑模型成了新趋势

Google 的 Gemma 4 上线第一周就冲到约 200 万次下载。做个对比:Gemma 3 过去一年总共 670 万次,Gemma 2 从 2024 年 6 月到现在 140 万次,而 Qwen 3.5 在大约一个半月里拿了约 2700 万次。这次最值得关注的是本地部署的速度——有人用 iPhone 17 Pro 跑 Gemma 4 E2B,通过...

推荐理由:这条消息的看点不是 Google 又发了个模型,而是首周 200 万下载这个数字本身,以及它和 Qwen 3.5 一个半月 2700 万的对比——开源模型的采用速度在明显变快。更实在的是有人已经在 iPhone 上跑出 40 tok/s,这对做端侧部署的人来说是个可参考的实测数据,不是公关稿里的理论值。我会先打个折:下载量不等于日活,正文也没披露留存或实际调用量,所以别直接当成市场份额来看。但生态支持列得挺全,至少说明主流推理框架没掉队,这点对选型有帮助。

3月17日星期二

NVIDIA 博客

GTC 上 NVIDIA 用 RTX 电脑和 DGX Spark 跑本地 AI 助手,还发了新模型

NVIDIA 在 GTC 上主推两件事:一是让 AI 助手直接在 RTX 电脑和 DGX Spark 小超算上本地跑,不用联网,隐私和 token 成本都省了。DGX Spark 有 128GB 统一内存,能塞下 120B 参数以上的模型。二是发新模型,包括小号的 Nemotron 3 Nano 4B 和大号的 Nemotron 3 Super 120...

推荐理由:我会先打个折:正文没披露标题里“最新开放模型”的全量清单和价格,所以不能给更高分。但 HKR 三项都站得住——本地跑大模型和代理的钩子够强,128GB 统一内存和 PinchBench 分数是实打实的数字,而且本地推理正好踩在隐私和成本这两个行业痒点上。保留 featured,不往上提,因为信息有缺口,来源也是厂商发布稿。