跳到正文

千问 Qwen

阿里千问 Qwen 系列的开源发布与迭代:从旗舰模型到端侧小模型的全谱系动态。

最新精选

第 161–180 条 · 共 205 条

5月5日星期二

r/LocalLLaMA

Heretic 1.3 发布:模型可复现、内置跑分、显存占用更低

Heretic 1.3 这个版本主要干了三件事。第一,它现在能把跑模型时的环境——PyTorch 版本、GPU 型号、驱动、加速库这些——都打包记录下来,别人照着做就能复现结果,不用再猜“为啥我跑出来不一样”。第二,它内置了一套跑分系统,直接用 lm-evaluation-harness 测 MMLU、EQ-Bench、GSM8K 和 HellaSwa...

推荐理由:我会先打个折:正文没给出 VRAM 具体降了多少,这点先别太激动。但 Heretic 这次更新确实踩到了两个实在需求——一是让模型运行环境可复现,把 PyTorch、GPU、驱动版本都记下来,方便排查问题;二是内置了 lm-evaluation-harness 基准测试,不用再自己搭评测流程。项目有 2 万星、1300 万次下载,社区验证度够高。缺憾是 VRAM 优化只提了方向没给数字,所以重要性停在 72 分,放在 featured 里合适。

r/LocalLLaMA

分隔符+严格提示词让 Gemma 4 防注入率从 21% 飙到 100%,15 个模型 6100 次测试的基准结果

一位 Reddit 用户用 15 个模型、7 种攻击方式跑了 6100 多次提示注入测试。核心做法是把不可信文档用一长串随机分隔符包起来,再配上严格指令。Gemma 4 E4B 的防御率直接从 21.6% 拉到 100%。这个基准的指标很实在,只看“拦截成功数除以(拦截成功数+拦截失败数)”,可复现。正文没披露其他模型的具体分数,也没说攻击样本怎么构造...

推荐理由:我会先打个折:这是单个 Reddit 用户发布的基准,不是机构报告,但实验设计很实在。核心发现是用长随机分隔符把不可信文档包起来,再在系统提示里硬性要求模型只当数据读,Gemma 4 E4B 的防御率直接从 21.6% 拉到 100%。防御率定义是 blocked/(blocked+failed),这点交代得清楚。正文没披露攻击样本的具体构造和失败案例的细节,所以别急着当通用结论,但作为可复现的工程思路,对做 agent 和 RAG 的人有直接参考价值。

r/LocalLLaMA

MTPLX 让苹果芯片跑大模型快了一倍多,原生 MTP 推理引擎来了

一个叫 MTPLX 的推理引擎在 MacBook Pro M5 Max 上把 Qwen3.6-27B 的生成速度从每秒 28 个 token 提到了 63 个 token,快了 2.24 倍。测试用的是 4-bit MLX 量化,温度 0.6,top_p 0.95,top_k 20,最佳推测深度 D3。关键点是它直接用了模型自带的 MTP 头做推测解码...

推荐理由:我会先打个折:目前只有 Reddit 单帖来源,测试范围也限定在 Apple Silicon,验证面还窄。但 2.24 倍的吞吐提升是实打实的数字,而且 MTP heads 内置在模型里,不用额外加载一个 drafter 模型占内存,这点对 Mac 用户确实挺省钱。正文没披露更多模型或硬件的对比数据,所以先放在 featured 低位,等有更广的复现再往上调。

r/LocalLLaMA

本地跑 Qwen 给 Codex 当代码审查员、协作者和挑刺对手的实测

robert896r1 把 Qwen3.6 27B 的 GGUF 量化版放在 Codex 旁边当代码校验器,并放出了一套可复现的评测流程。测试覆盖了 Bartowski 和 Unsloth 两种量化来源、65k 和 128k 上下文窗口,以及 q8 和 f16 的 KV 缓存精度。三个 128k 上下文的配置并列最佳,在这个评测套件里没测出 q8 KV...

推荐理由:我会先打个折:这不是官方发布,是一个个人实测套件,样本量和覆盖面有限。但它的价值不在权威性,而在把 Qwen 塞进一个贴近真实开发的 sidecar eval 里——测的是漏指令、过度实现、UI 判断和长上下文遗漏,不是跑分。三个 128k profile 并列最佳,q8 KV 没翻车,这点对想省显存的人挺实用。正文没披露 Codex 的具体版本和调用方式,也没给错误分布,所以别当严谨 benchmark 用,更适合当一份本地部署的参考起点。

5月4日星期一

r/LocalLLaMA

用 Hermes Agent 和 qwen3.6-35b 在本地跑深度研究,生成了 21 页报告

一位 Reddit 用户用 Hermes Agent 框架搭配 qwen3.6-35b-a3b 的 Q6_K 量化版,在单张 RTX 4060 上跑了 6 轮循环、超过 5 小时,生成了一份 21 页的研究报告。生成速度约每秒 28 个 token。仓库里放了提示词、脚本、中间产物和最终报告。正文没披露报告具体主题和结论质量,也没说这 5 小时里人工干...

推荐理由:HKR 三项都站得住:这是一个带硬件型号、运行时长、生成速度和完整产物的本地 agent 实验。来源是 Reddit 个人分享,传播面有限,所以分数放在 72–77 的 featured 门槛区间,不往上拔。

r/LocalLLaMA

Mistral Medium 3.5 128B 和 Qwen 3.5 122B A10B 在 4 张 RTX 3080 20GB 上的跑分对比

一位 Reddit 用户用 4 张 RTX 3080 20GB 显卡跑了两个大模型。Mistral Medium 3.5 128B 在 llama.cpp 里把张量拆分(tensor split)打开后,生成速度从每秒 10.37 个 token 翻倍到 21.59。但 Qwen 3.5 122B A10B 这个混合专家模型(MoE,把任务分给不同子模...

推荐理由:HKR 三项全中。4×RTX 3080 这个配置本身就是个好钩子,帖子给了 llama.cpp 和 vLLM 下两组实打实的吞吐变化,不是空谈。Mistral 张量切分后速度翻倍,Qwen MoE 反而降速,这个对比把并行策略对 MoE 架构的差异暴露得很清楚。不过数据来自 Reddit 单次跑分,没交代精度和上下文长度,所以分数压在 72–77 这个区间,不往上拔。

r/LocalLLaMA

一台 5 年老笔记本跑通 35B 模型:6GB 显存 + CPU 混合推理,插电 23 token/秒

Reddit 用户 abhinand05 在一台 5 年前的华硕 ROG Zephyrus G14 上跑起了 Qwen3.6-35B-A3B 模型。这台笔记本只有 RTX 2060 Max-Q 6GB 显存,搭配 24GB DDR4 内存和 Ryzen 7 处理器。插电时生成速度约 23 token/秒,不插电掉到 10 token/秒出头。能跑起来的...

推荐理由:我会先打个折:这只是单个Reddit用户的跑分,不是官方发布,别当基准看。但它的价值不在权威性,而在把CPU MoE、KV cache量化和ngram推测解码这三样东西组合起来,在6GB显存的旧机器上跑出可用的速度。正文没披露量化精度和功耗细节,这点先别太激动。对想用老设备玩大模型的从业者来说,这篇给了参数和思路,比单纯喊'能跑'有用得多。

5月3日星期日

r/LocalLLaMA

本地模型后端生成基准测试:GLM、Qwen、DeepSeek 函数调用能力对比

AutoBe 发了一个后端代码生成基准,用函数调用来测模型设计数据库和 API 的能力。qwen3.5-35b-a3b 在测试里跟 gpt-5.4 打平,但样本量只有 4 个项目,而且评分工具是自己写的,可能有偏向。一个商场项目跑下来要消耗 2 到 3 亿 token,按 GPT 5.5 的定价算,单模型成本在 1000 到 1500 美元。正文没披露...

推荐理由:我会先打个折:数据来自 Reddit 帖子,只测了 n=4 个项目,评测 harness 还是自己写的,偏差肯定有。但 35B 模型追平 gpt-5.4 这个结论够抓眼球,加上单任务 1000 多美元的成本和笔记本可跑的硬限制,对做本地部署的人有参考价值。正文没披露具体任务类型和评分标准细节,这点先别太激动。

r/LocalLLaMA

论文称用低成本 FPGA 跑 Qwen3-30B-A3B Q4 推理,生成速度 18 t/s,量产成本预计 150 美元

这篇论文讲的是 Hummingbird+,用低成本 FPGA 跑大模型推理。他们拿 Qwen3-30B-A3B 的 Q4 量化版测试,生成速度能到每秒 18 个 token,板子带 24GB 显存,作者说量产的话成本能压到 150 美元左右。不过帖子正文没披露具体是哪款 FPGA、功耗多少、测试条件是什么,Reddit 原帖还被网络屏蔽了,看不到讨论细...

推荐理由:这篇论文的钩子很直接:一块预计量产成本 150 美元的 FPGA,能把 Qwen3-30B-A3B 的 Q4 量化版跑到每秒 18 个 token,配 24GB 内存。对想本地跑大模型又嫌显卡贵的人来说,这个数字挺诱人。但我会先打个折——正文没披露用的是哪款 FPGA,也没给功耗数据,评测条件同样空白。没有这些,18 t/s 是在什么负载、什么精度损失下跑出来的就说不清。所以这条值得关注,但别急着下结论,等他们把板卡型号和功耗补上再说。

r/LocalLLaMA

M1 Max 本地跑 10 个生图模型横评:Qwen-Image 蒸馏版 8 步出图比原版快 9 倍

一位 Reddit 用户在自己的 M1 Max(64GB 内存)上测了 10 个图像模型,从 SD 1.5 一路测到 Flux dev、Qwen-Image 和 Gemini。Qwen-Image Lightning 用 8 步蒸馏把出图时间从 93 分钟压到 10 分钟,效果还比原版好。Flux dev 在本地模型里写实感最强,但提示词偏英文思维,处...

推荐理由:Reddit 用户实打实在自己机器上跑了一遍,不是厂商通稿。Qwen-Image 蒸馏版 10 分钟出图、质量还更高,这点先别太激动,样本只有一个人一台机器,但 93 分钟到 10 分钟的差距确实说明蒸馏这条路在本地部署上挺省钱。Flux dev 写实强但偏英语文化,Gemini 中文和日语语境更准但要上云,这个取舍对国内用户有参考价值。正文没披露具体 prompt 和评分标准,所以数字只能当参考,不能当排名。

5月2日星期六

r/LocalLLaMA

Qwen 3.6 跑分赢,但 Gemma 4 实际用起来更省心:本地跑 27B/31B 视觉模型的 7 条实测发现

一位 Reddit 用户把 Qwen 3.6 和 Gemma 4 的 27B/31B 视觉模型拉到本地,用 vLLM 跑 FP8 精度对比。Qwen 在 GeoGuessr 这种难图上一次推理能烧掉 8000 多个 token,Gemma 经常 1500 个就搞定;Qwen 做视频还得先花 2 FPS 预处理。另外有个坑:vLLM 和 Llama.cp...

推荐理由:我会先打个折:这只是 Reddit 单帖,不是系统评测,权威性有限。但它的价值不在权威,而在“榜单赢家落地翻车”这个反差,以及 8000+ vs 1500 token、2 FPS、视觉 token 预算这些具体设定。对正在纠结选 Qwen 还是 Gemma 做本地视觉任务的人,这些信息比跑分榜实在得多。所以 HKR 三项全过,但因为没有官方结论或产品级变动,分数就停在 76,不进 P1。

r/LocalLLaMA

有人在 Windows 上直接用 vLLM 跑 Qwen3.6-27B,单张 RTX 3090 跑到 72 tok/s

Reddit 用户 One_Slip1455 发了个原生 Windows 版 vLLM 启动器,不用 WSL 也不用 Docker。在一张 RTX 3090 上跑 Qwen3.6-27B(INT4 量化),短上下文能到 72 tok/s;上下文拉到约 2.5 万 token 时速度 64.5 tok/s,12.7 万 token 时还有 53.4 to...

推荐理由:HKR 三项都成立:原生 Windows 跑 27B 模型是钩子,帖子里有可验证的速度和上下文数字,而且直击本地推理省钱这个痛点。不过来源只有 Reddit 单帖,没有官方背书或产品级变动,所以放在 featured 低位是合理的。

5月1日星期五

r/LocalLLaMA

PFlash:在 RTX 3090 上跑 128K 上下文,预填充比 llama.cpp 快 10 倍

PFlash 让 Qwen3.6-27B 的 Q4_K_M 量化模型在单张 RTX 3090 上处理 12.8 万 token 的输入时,首 token 延迟从 llama.cpp 冷启动的 248.4 秒压到 24.8 秒。做法是用一个 Qwen3-0.6B 小模型当“打分员”,挑出最重要的 5% 文本片段喂给大模型,省掉了大量无关计算。整个方案用 ...

推荐理由:HKR 三项都踩中了,但这是单条 Reddit 帖子,质量验证只给了单针 NIAH 32K–128K 全通过,RULER 和多针结果没放出来,所以先放在 featured 门槛上。

r/LocalLLaMA

Qwen3.6-27B 在单张 RTX 3090 上跑到 21.8 万上下文,工具调用也稳了

一位 Reddit 用户用一张 24GB 显存的 RTX 3090 跑 Qwen3.6-27B(一个 270 亿参数的模型),把上下文窗口推到了约 21.8 万个 token,生成速度在每秒 50 到 66 个 token 之间。之前工具调用时,如果返回结果有 2.5 万个 token 左右就会爆显存,他修了一个叫 Genesis PN12 补丁的锚点...

推荐理由:我会先打个折,这是 Reddit 个人实测,不是官方基准。但信息量够:修了 Genesis PN12 补丁后,25K token 的工具调用不再 OOM,198K 加 vision 能到 51/68 TPS。限制也说清楚了,单提示单卡在 50–60K 附近还有第二个内存断崖,这点先别太激动。对想用消费级显卡跑长上下文 agent 的人来说,这些数字和踩坑记录比论文更有参考价值。

r/LocalLLaMA

RTX 5080 16GB 跑长上下文编程:Qwen3.6-35B-A3B 在 128K 窗口下稳在 30 t/s,刚启动时能到 89 t/s

一位 Reddit 用户用 RTX 5080 16GB 显卡本地跑编程 agent,测了 Qwen3.6-35B-A3B 这个 MoE 模型(总参数 35B,每次激活 3B)。刚加载完上下文时速度有 89 t/s,等上下文塞满到 128K token 后,生成速度还能维持在 30 t/s,而且回复质量没掉。作为对比,同系列的 27B 稠密模型在 128...

推荐理由:HKR 三项都成立:16GB 显卡撑住 128K 上下文 30 t/s 是个很强的钩子,硬件和 CUDA 版本细节都有,还给了稠密模型的惨烈对比。不过这只是 Reddit 单帖测试,没有多源复现,所以 featured 而不是 P1。

4月30日星期四

MIT Technology Review · AI

Goodfire 发布 Silico,一个能让你像调试代码一样调试大模型内部参数的工具

Goodfire 推出了一款叫 Silico 的工具,让工程师可以在训练过程中直接查看和调整模型的参数,也就是决定模型行为的那些“旋钮”。它能把模型里的神经元和通路画成地图,比如他们在 Qwen 3 里发现一个神经元,激活后模型回答会变成电车难题式的道德困境。Silico 用智能体自动完成了大量原本需要人工做的可解释性工作,目标是让模型开发少点炼丹味,...

推荐理由:HKR 三项都成立:Silico 给出了一个可操作的机械可解释性调试手段。分数停在 76,因为目前只是一家创业公司的产品预览,正文没披露定价,也没有任何实际部署规模或客户数量的数据,所以我会先打个折,不往更高里推。

r/LocalLLaMA

实测:本地跑 Qwen-3.6-27B 跟闭源模型比,到底差多少

作者拿一个自动研究循环任务测了 5 个模型,只有 Qwen-3.6-27B 接近完成。本地用 q4_k_m 量化版跑了约 8 小时,消耗 3.9 万 token(上限 4.5 万);作为对比,全精度 Qwen 通过 OpenRouter 调用用了 440 万 token,花费 0.939 美元。关键看失败质量:两个 Qwen 版本都只差小修小补,而 G...

推荐理由:这篇帖子用一个自动研究任务把 Qwen-3.6-27B 和几个闭源模型放在一起比,结果只有 Qwen 基本完成,其他模型要么缺测试要么缺实现,对比很直观。数据也给了:本地量化版跑了约 8 小时,读 39k 写 45k tokens;全精度版消耗 4.4M tokens,花了 0.939 美元。失败质量比成功更值得看,两种 Qwen 都只需少量修复就能用。来源是单篇 Reddit 实测,权威性有限,所以放在 featured 低位,但 hook、数据和话题性都够。

r/LocalLLaMA

实测:用小模型跑编程 agent,哪些环节会崩

作者花了几周时间,用 7B 以下的本地小模型和免费云端模型跑多文件编程任务,发现结构化输出很不靠谱。崩得最多的地方有三个:模型在回复里乱加 markdown 代码块标记,把编辑内容写到错误的文件里,以及分不清该读文件还是写文件。作者给的解法是做后处理清洗和加校验步骤,但正文没披露具体用哪些模型、测试了多少任务,也没给出量化的成功率,所以这些结论只能当经...

推荐理由:这篇 Reddit 帖子不是论文,是作者拿 Qwen、Gemma 等小模型实打实跑了几周多文件编程 agent 后的踩坑记录。我会先打个折:它只是单人经验,没有系统对比实验,所以给 75 分。但内容很实在——7B 以下模型连输出格式都稳不住,Markdown 围栏乱加、改错文件、读写成写这类问题反复出现。作者没灌水,直接给了后处理、JSON schema 校验、路径白名单和只读路由这些能落地的补救办法。正文没披露具体模型版本和测试任务量,这点让结论的普适性弱一些,但对想用本地模型搭 coding agent 的人,这些失败模式比 benchmark...

r/LocalLLaMA

Qwen 发布 Qwen-Scope,用稀疏自编码器给 Qwen 3.5 模型做“内部体检”

Qwen 团队开源了 Qwen-Scope,这是一套针对 Qwen 3.5 系列(从 2B 到 35B MoE)的稀疏自编码器(SAE)。SAE 的作用是把模型内部那些纠缠在一起的激活信号拆解开,变成一个个相对独立的“特征”,方便人去看懂和调试。这次放出的 SAE 覆盖了模型所有层的残差流,还专门标出了一个叫 Feature #6159 的特征,跟中文...

推荐理由:我会先打个折:这不是新模型,所以重要性不会冲到顶。但 Qwen 官方放 SAE 这件事本身挺实在,等于给开发者开了个后门去看模型内部在想什么。覆盖范围从 2B 到 35B MoE,全层残差流都扫了,不是只挑几层做样子。Feature #6159 的例子也直观,能让人立刻联想到怎么用这些特征去修模型行为。唯一要留个心的是许可证里对移除安全过滤的态度,正文没细说具体限制条款,但既然提了,用的时候就得自己掂量。整体上,对做模型调试和可解释性的人来说,这是一份能直接上手试的工具级发布。

量子位 · 公众号

新加坡国立等团队提出 ViF,专治多智能体协作时的视觉幻觉传染

多智能体系统里有个麻烦:一个模型看图说话出错,把错误描述传给下一个模型,下一个模型再添油加醋,幻觉就像滚雪球一样越滚越大。新加坡国立大学 LV-Lab 等团队搞了个叫 ViF 的方法,不改造模型本身,即插即用。核心思路是不再只传文字,而是把视觉信息打包成“视觉接力令牌”塞进对话流里,同时用分层注意力重分配让模型多看该看的地方。论文已被 ICLR 202...

推荐理由:这篇入选 ICLR 2026 的工作解决的是多智能体视觉问答里一个很实际的毛病:纯靠文字传递信息,幻觉会一个 agent 传一个 agent,越传越离谱。他们提出的 ViF 用视觉中继令牌和分层注意力重分配,把图像信息直接塞进通信链路,不改模型就能插进现有系统。我会先打个折——论文没披露实际部署的延迟和额外算力开销,这点先别太激动。但 8 个基准、4 种结构、10 款模型上的提升摆在那里,幻觉严重度平均砍掉三成以上,环形结构接近四成,对做多模态 agent 的人来说是个值得跟的方案。