跳到正文

千问 Qwen

阿里千问 Qwen 系列的开源发布与迭代:从旗舰模型到端侧小模型的全谱系动态。

最新精选

第 41–60 条 · 共 205 条

7月8日星期三

AI HOT 精选

vLLM 的 transformers 后端现在跑得跟手写原生代码一样快,甚至更快

HuggingFace 宣布,vLLM 里用 transformers 库当模型后端,吞吐量已经追平甚至超过了 vLLM 手写的原生实现。他们在 Qwen3 的 4B、32B 和 235B MoE 三个模型上做了对比测试,结果都是打平或反超。对模型作者来说,现在只要加一个 --model-impl transformers 参数,不用做任何移植就能白嫖...

推荐理由:一个扎实的工程改进,有跨规模的实测数据撑腰,对需要部署模型的人直接有用。但受众太窄,多数 AI 从业者不关心推理后端选型,共鸣弱,刚好卡在 featured 门槛上。

6月30日星期二

Hacker News 首页

Qwen 3.6 27B 是本地跑模型的甜点级选择

Piotr Migdał 在 Macbook Max M5 128GB 上实测了 Qwen 3.6 27B,用 8-bit 量化版跑出每秒 32 个 token,占 42GB 内存。他认为这是第一个能当通用智能用的本地模型。测试里它一次就生成出六边形扫雷的 npm 包,还搭了一个响应式落地页。文章给了完整的 llama.cpp 配置命令,并出于伦理原因...

推荐理由:一篇带真实数字的个人实测,不是通稿。Qwen 3.6 本身热度就高,这篇文章补上了本地部署的实操细节。分数卡在 72 是因为它终究是个人评测,不是官方发布或重大产品更新。

6月24日星期三

AI HOT 精选

通义开源 Qwen-AgentWorld:一个会先预测再动手的智能体模型

通义千问放出了一个叫 Qwen-AgentWorld 的模型,它不是一个只会接指令的工具,而是先对世界状态做预测再执行动作。模型覆盖了 MCP、搜索、命令行、软件工程、网页、操作系统和安卓七个场景,训练用了超过一千万条真实交互记录,分三步走:先海量预训练,再监督微调,最后强化学习对齐。在自家评测 AgentWorldBench 上,397B 总参、17...

推荐理由:通义千问放出的 Qwen-AgentWorld 不是又一篇 agent 概念文,而是把“先预测世界状态再执行动作”这个思路做进了模型训练里,覆盖七个场景、千万级真实交互数据,三步训练路线也公开了。397B 总参数量不小,但 17B 激活参数意味着推理成本可控,这点对实际用的人来说挺关键。自家评测跑分好看,但刚开源,社区还没大规模验证,所以分数先打 82,等有人复现了再往上调。

Hacker News 首页

Qwen 发布 AgentWorld:一个能模拟环境、帮 AI 智能体练级的语言世界模型

Qwen 团队搞了个新东西,叫 Qwen-AgentWorld,本质上是一个用语言模型做的世界模拟器。它不直接干活,而是预测“在当前环境下做了某个动作后,下一步会发生什么”,覆盖了 7 种不同的场景。为了让模型学会这个本事,他们用了超过 1000 万条真实环境里的交互记录,分三步训练:先灌知识让它理解状态变化,再教它一步步推理出下一步,最后用规则和评分...

推荐理由:Qwen 团队拿语言模型当世界模拟器用,在 7 种环境里用超千万条交互记录训练它预测“做了某动作后会发生什么”。思路新,数据量和训练步骤也实在,对搭 agent 的人有参考价值。不过目前还是论文,不是产品,实际任务里能省多少事、准不准,还得看后续验证,所以分数没给太高。

6月18日星期四

Hacker News 首页

本地 Qwen 不是缩水版 Opus,它是另一种工具

Alex Ellis 用一块 RTX 6000 Pro 跑本地模型,两三个月就回本了。Qwen 27B 在 SWE-Bench 上只比 Claude Opus 4.8 低 12%,但一到他写的 Go 分布式系统里,量化后的模型就会陷入死循环和幻觉——他仍然不敢让它无人值守干活。正文没披露 token 速度和延迟数据。

推荐理由:Alex Ellis 拿自己公司的代码库做了次真实对比,不是跑分党自嗨。Qwen 27B 在 SWE-Bench 上只比 Opus 4.8 低 12%,看着差距不大,但一进他的 Go 分布式系统就翻车——量化后死循环、幻觉,他仍然不敢让模型无人值守干活。我会先打个折:正文没给 token 速度和延迟数据,结论偏个人经验,不是系统性评测。但“跑分接近不等于干活靠谱”这个判断,对正在选型的人很值钱。

6月16日星期二

r/LocalLLaMA

HalBench 给 29 个开源模型测拍马屁和幻觉,Qwen 3.6 和 Gemma 4 以小博大,Meta 继续证明自己不会花钱

HalBench 是一个开源基准测试,专门看模型面对错误前提时是直接反驳还是顺着说瞎话。v2.3 测了 33 个模型,其中 29 个开源。结果只有 Sonnet 4.6(65.1%)和 Grok 4.3(50.9%)的反驳率过半。开源里最强的是 Qwen 3.6,一个约 270 亿参数的稠密模型,反驳率 36.6%,压过了 GPT-5.4 和 Gemi...

推荐理由:一个社区自建的基准,有具体数字和排名,Qwen 3.6 在反驳率上超过 GPT-5.4,信息量够。没给 p1 是因为这是自建评测,还没同行评审,先当强推荐处理。

AI HOT 精选

本地编程栈实测:Qwen 3.6 35B-A3B 免费换来 5 倍提速

Tomasz Tunguz 翻完 Hacker News 上 500 多条评论,画出了现在程序员用本地模型写代码的主流配置。模型这边,Qwen 3.6 35B-A3B 被提到最多,占 33%,它的 27B 版本占 20%,后面是 DeepSeek Pro 和 Gemma4 31B。这些模型都用了混合专家架构,好处是能在普通家用显卡上跑起来——35B 总...

推荐理由:Tunguz 从 500 多条 HN 评论里挖出了真实的本地编程配置:模型端 Qwen 3.6 35B-A3B 占 33%,工具端 Pi 占 49%,混合专家架构让消费级显卡能跑起来。有对比有数字,不是厂商通稿。扣分是因为这是二手整理,不是一手评测,而且正文没给出性能对比基准,只能当社区风向看。

AI HOT 精选

Qwen-RobotNav:一个模型搞定五种导航任务,还能让上层 AI 随时调整它的观察策略

Qwen 发布了一个叫 Qwen-RobotNav 的导航模型,基于 Qwen3-VL 训练,用 1560 万条样本学会了指令跟随、找东西、跟踪目标、自动驾驶和具身问答这五种活。它把视觉记忆的控制权开放了出来,像调节“看多少帧”、“更关注新画面还是旧画面”、“不同摄像头各占多少注意力”这些参数,都可以在运行时直接改,不用重新训练。在 EXPRESS-B...

推荐理由:Qwen 基于 Qwen3-VL 训了个机器人导航模型,1560万条样本学会五种活。亮点是把视觉记忆参数开放出来,运行时就能调,不用重新训练。这点先别太激动,因为正文没给真实机器人上的测试结果,目前还是仿真和数据集上的表现。

AI HOT 精选

Qwen 发布 RobotWorld 世界模型:用自然语言统一 20 多种机器人的动作控制

Qwen 放出了一个叫 RobotWorld 的具身世界模型,核心思路是把自然语言当成通用遥控器——你说“拿起红杯子放架子上”,它就能直接生成对应的动作视频,不用给每种机器人单独写控制接口。模型用 Qwen2.5-VL 做动作编码器,靠 860 万条视频-文本对联合训练了操作、自动驾驶和室内导航三类场景,覆盖 20 多种机器人形态和 500 多个动作类...

推荐理由:Qwen 放出了 RobotWorld,一个用自然语言当通用动作接口的具身世界模型,拿 860 万条视频-文本对训练,跨了操作、自动驾驶和室内导航三个领域。规模和多形态覆盖是实打实的,没给更高分是因为目前只有博客和论文,没有可用的模型或 demo 放出来,落地效果还看不到。

6月12日星期五

AI HOT 精选

inclusionAI 开源 VISTA-4B,一个能看懂屏幕截图、帮你点按钮的视觉模型

inclusionAI 在 Hugging Face 上放出了 VISTA-4B,一个基于 Qwen3.5 的 40 亿参数视觉语言模型。它的核心能力是 GUI 元素定位:你给它一张屏幕截图和一句指令,它就能指出目标按钮或区域在哪。模型标签里带了 gui-grounding 和 reinforcement-learning,说明团队用了强化学习来提升定...

推荐理由:4B 的 GUI 定位模型方向实用,用强化学习训练也是个技术信号,但模型卡实在太干净了——零基准、零数据说明、零横向对比。我会先打个折,等他们补上评测再认真看。

6月10日星期三

r/LocalLLaMA

用约3美元API调用微调Qwen2.5-7B,在特定任务上达到Claude Haiku 96%的表现

一位Reddit用户用1040组偏好样本(DV-DPO,一种让模型学会回答风格的方法)微调了Qwen2.5-7B,成本按Claude Haiku的API价格算大约3美元,没花钱请人标注。在特定领域任务上,这个微调模型的综合得分达到了Claude Haiku的96%。部署在4-bit量化的T4机器上,生成一次回答的延迟是11秒。不过正文没披露具体是什么任...

推荐理由:这条信息本身是个Reddit帖子,任务范围和评测细节正文没展开,所以分数先打个折停在74。但3美元、零标注、96% Haiku这几个数字组合在一起,对想省钱又不想雇人标数据的团队来说,是个值得看一眼的信号。

AI HOT 精选

Google Gemini 3.5 实时翻译开放公测,支持 70 多种语言、2000 个语言对

Google 把 Gemini 3.5 的实时翻译功能放出来了,现在通过 Gemini API 就能用。它做的是语音到语音的低延迟翻译,覆盖 70 多种语言,能组合出 2000 个语言对,冷门小语种也包含在内。开发者可以把它接进实时对话、客服、直播或跨国会议里。主推文提到这消息被 Anthropic Fable 5 的声量盖过去了,还顺带提了阿里 Qw...

推荐理由:HKR 三项都成立:Google 把实时语音翻译做成 API 公开预览,对开发者有直接吸引力,也给了语言覆盖和语言对的具体数字。但文章只提了功能开放,没写价格、延迟基准和可用区域,信息有缺口,所以重要性停在 78。

r/LocalLLaMA

ICML 论文提出可预测幻觉的“回答-弃权”闸门,并开源 ntkMirror 免训练实现

这篇 ICML 2026 论文给证据型问答任务设计了一个 ISR=1 的闸门:模型在不确定时直接闭嘴不答,而不是硬编。他们同时放出了 ntkMirror,一个免训练的开源实现,能在本地模型上跑。做法是让模型对同一问题看多份不同排序的证据,如果几次回答不一致就弃权。在留出的审计集上,幻觉率压到了 0.0%–0.7%,代价是大约 24% 的问题被主动弃权。...

推荐理由:这篇 ICML 论文和配套的 ntkMirror 实现,核心思路不复杂:让模型对同一问题看几份顺序不同的证据,回答不一致就闭嘴不答。在审计集上幻觉率确实压得很低,但约四分之一的问题被弃权,这个代价得看场景能不能接受。论文限定在证据型问答,别急着往开放域对话上套。开源免训练能本地跑是个加分项,但正文没披露不同模型尺寸下的延迟和资源消耗,实际部署前最好自己测一下。

6月9日星期二

AI HOT 精选

Cohere 发布 North Mini Code:一个 30B 参数、每次只用 3B 的开源代码模型

Cohere 在 Hugging Face 上开源了 North Mini Code,采用 Apache 2.0 协议。这是一个 30B 参数的混合专家模型,每次推理只激活 3B 参数,专门为让模型在终端里自主写代码、修 bug 这类任务设计。在 SWE-Bench Verified 上,它的 pass@10 跑到了 80.2%,在 Artificia...

推荐理由:HKR-H 来自一个紧凑的 MoE 编码模型加上一个亮眼的 SWE-Bench 成绩;HKR-K 有参数、协议、上下文和基准数据。Cohere 不是前沿实验室,所以这个发布放在 78-84 分的开源编码模型区间比较合适。

AI HOT 精选

Qwen3.7-Max 靠一份 15 万字文档,4 小时做出能跑的手机和网页应用

实验里 Qwen3.7-Max 不看设计稿、不接后端,只读一份约 15 万字的产品调研文档,在隔离环境里分别生成了安卓 APK 和一个 Web 应用,单端耗时约 4 小时,中间没人插手。模型本身看不懂图,它是通过像素坐标反推布局来还原界面。做法是把任务拆成规划、架构、编码等阶段,每步做完就检查——静态检查、编译自检(0 error)、Web 端 34 ...

推荐理由:我会先打个折:正文没披露失败率、重试次数、人工介入点,也没说这15万字文档本身质量如何。但亮点在于它把模型看不懂图这个短板说清楚了——靠像素坐标反推布局,不是真懂设计。任务拆成规划、架构、编码并逐段自检的做法,让4小时出双端这件事有了可复现的骨架。如果是真的挺省钱,但没给对比基线,先别太激动。

r/LocalLLaMA

单张 MI50 跑 Qwen3.6-27B 速度翻倍:从 19.4 涨到 38.1 token/秒

有个玩家在单张 AMD MI50 上跑 Qwen3.6-27B 模型,用 Q8 或更低精度的量化版本时,发现显卡的算力没吃满。他想到一个取巧的办法:不额外加载一个小模型做投机解码,而是让同一个模型同时跑两路计算,假装自己有两份模型副本。结果生成速度直接从 19.4 token/秒翻到 38.1 token/秒。正文没披露具体实现细节和显存占用变化,所以...

推荐理由:这是个 Reddit 玩家的第一手实验,有数字有假设,但没经过正式验证。正文没披露具体实现细节和显存变化,也没有代码或更广的复现结果,所以先放在 featured 这一档。

r/LocalLLaMA

Levi:在你的本地 Qwen 30B 上跑类似 AlphaEvolve 的搜索系统

Levi 是一个开源项目,让你能在本地用 Qwen3-30B-A3B 模型跑一套类似 AlphaEvolve 的搜索系统。作者在 ADRS、IFBench 和 HotpotQA 三个基准上做了测试,声称在单模型、相同预算的条件下,整体成本最多能降到原来的 1/35,评估次数最多能减少到 1/12。不过正文被 Reddit 的网络屏蔽页挡住了,具体实现细...

推荐理由:这篇来自 Reddit 的帖子只给了模型名、基准和成本比例,代码成熟度和可复现细节正文被屏蔽了没看到,所以我会先打个折。但能在本地用 Qwen3-30B-A3B 跑 AlphaEvolve 风格搜索这件事本身挺抓人,数字如果属实确实省钱,先给 featured 让社区去验证。

6月8日星期一

r/LocalLLaMA

Luce Spark:让 35B 的 MoE 模型在 16GB 显存上跑起来,不用忍受传统卸载的速度惩罚

Luce Spark 是一个开源方案,能让 Qwen3.6 35B-A3B 这种规模的混合专家模型在 RTX 3090 上只占 13.3 GiB 显存,跑出约 100 tok/s 的速度。它的做法是把模型里经常被用到的“热门专家”常驻在 GPU 显存里,不常用的“冷门专家”留在系统内存,需要时再异步搬运到 GPU 上一个固定大小的缓存区,搬运过程会和计...

推荐理由:标题本身就是一个强钩子,35B MoE 塞进 16 GB 卡还免掉 offload 税,对玩本地推理的人来说吸引力很大。文章把技术思路翻译得很清楚:把经常被调用的专家留在 GPU 上,不常用的放内存,用的时候再异步搬进一个固定大小的缓存区,搬运和计算重叠进行,所以能跑到约 100 tok/s,峰值显存只吃 13.3 GiB。不过信息源主要来自 Reddit 帖子,没有第三方复现或更严谨的基准测试,所以重要性先给到 78,等有更多验证再往上调。

r/LocalLLaMA

RTX 5090 跑 Qwen3.6-27B 实测:DFlash 投机解码加 KV 缓存压缩,速度提到 3.26 倍

作者在单张 RTX 5090 上跑了 Qwen3.6-27B,用 DFlash 做投机解码(让一个小模型先猜答案,大模型再核对,省时间),同时压缩 KV 缓存(把模型记住的上下文瘦身,省显存)。结果最高提速到 3.26 倍。用 q4_0/turbo4 量化时速度是原来的 3.18 倍,WikiText-2 上的困惑度只涨了 0.02%,基本没掉精度。不...

推荐理由:作者在消费级新卡上实测了一套组合拳:用小模型先猜答案再让大模型核对(投机解码),同时把模型记的上下文瘦身(KV 缓存压缩)。结果速度翻了三倍多,精度几乎没掉。这对想在本地跑大模型的人来说是个很实在的参考,数据也够具体。不过来源只有 Reddit 一个帖子,我会先打个折,别当正式论文看。

r/LocalLLaMA

双卡 3090 跑 27B 模型,解码速度几乎翻倍,没插 NVLink 也做到了

一位 Reddit 用户拿 qwen3.6-27b-autoround-int4 模型做测试,对比单张 3090 和两张 3090 的表现。在没装 NVLink、走 8x/8x PCIe 通道、P2P 自动开启、张量并行设为 2 的条件下,叙事类文本的解码速度从 53 token/秒涨到 94 token/秒,代码类解码从 62 token/秒涨到 1...

推荐理由:我会先打个折:这只是 Reddit 上一个用户的单次测试,没换模型、没换卡型复现,所以别急着当通用结论。但它的价值在于给了一个很具体的参考点——在没桥接器、走普通 PCIe 通道的情况下,qwen3.6-27b 的 int4 量化版用张量并行跑,解码速度几乎翻倍。对正在纠结要不要加卡跑本地推理的人来说,这个数据比厂商白皮书实在。正文没披露功耗、延迟波动和长文本下的表现,这些缺口让结论只能停在“值得自己试一下”的程度。