跳到正文

千问 Qwen

阿里千问 Qwen 系列的开源发布与迭代:从旗舰模型到端侧小模型的全谱系动态。

最新精选

第 21–40 条 · 共 205 条

8月17日星期一

Hacker News 首页

Qwen3.8 27B 模型塞进 24GB 显卡跑满 256K 上下文,实测每秒 50 个 token

作者在一张 24GB 显存的 RTX PRO 4000 SFF 显卡上,把 Qwen3.8 27B 模型跑到了 50.44 tok/s,而且上下文长度拉满到 26 万 token。这个速度不是靠单一技术实现的,而是靠一套组合拳:自己调的 NVFP4 量化方案(保护了模型里对精度敏感的部分)、内置的 MTP 投机解码(让生成速度从 21.19 涨到 59...

推荐理由:一篇扎实的本地推理实战帖,数字可复现,技术路径清晰。三条 HKR 都踩中了,但本质是个人实验而非官方发布或行业事件,所以放在 featured 档,给 78 分。

FT · 科技

FT 评论:中国开源 AI 会像当年制造业一样,把大模型做成白菜价

这篇《金融时报》评论文章认为,中国正在用开源大模型复制当年制造业冲击全球的剧本——把技术变成超低价的商品,削弱西方公司的定价权。文章点名了 DeepSeek 和阿里通义千问(Qwen)系列,说它们的开源策略能快速拉拢开发者、建起生态,而美国公司还在闭源、烧钱堆算力。不过正文没给出具体的市场份额或企业采用数据,所以这更像一个方向性的判断,先别急着把它当成...

推荐理由:FT 这篇评论把中国开源模型(点名 DeepSeek 和 Qwen)说成是制造业冲击的 AI 版本——靠开源把技术打成白菜价,让西方公司没法靠闭源和堆算力维持高定价。角度抓得挺巧,但全文没给具体数字,更像一个提前发出的警告。我会先打个折,把它当方向判断看,别急着当成已经发生的事实。

AI HOT 精选

Qwen 3.8 27B 模型实测:能力很强,但默认推理强度会让它疯狂过度思考

Simon Willison 上手了阿里 Qwen 团队新发的 27B 模型,发现它默认的“超高”推理强度是个坑。一个简单的画圆指令,模型会花几分钟生成一段精美的动画 SVG,完全偏离原意;画一张“鹈鹕骑自行车”的 SVG,默认设置下烧掉 22,276 个推理 token,耗时 21 分钟才出图。关掉推理后,同样的任务只需两分多钟。他建议上手就调低或关...

推荐理由:Simon Willison 上手 Qwen 3.8 27B 发现默认推理强度是个坑,用画圆和鹈鹕骑自行车两个例子把 token 消耗和时间成本摆得很清楚。数字硬、对比直接,对本地部署用户是实打实的避坑指南。没给更高是因为核心发现是一个配置问题而非模型能力缺陷,但 78 分放在 featured 里完全撑得住。

8月16日星期日

Hacker News 首页

一份追踪30张模型卡片的排行榜,看前沿实验室到底报告了哪些基准

这个项目扫了11家机构的30张模型卡片,统计了79个基准被提及的次数,衡量的是厂商的关注度,不是基准本身好不好。MATH-500和Arena-Hard的分数快摸到天花板了,区分力在下降。DeepSeek自家的模型在26天内,AIME涨了40.6分,LiveCodeBench涨了25.4分。有6个基准(包括BrowseComp和SWE-bench Pro...

推荐理由:这篇不是评测基准好坏,而是统计厂商关注度,视角本身就有信息量。给出了MATH-500和Arena-Hard接近饱和的具体证据,以及DeepSeek短期内大幅刷分的数字,能引发对基准有效性的讨论。扣分是因为这是个人项目,统计口径和覆盖范围有限,但作为从业者参考够用了。

8月13日星期四

AI HOT 精选

阿里首次把 Qwen-Max 级别的模型权重放出来了,总参数 2.4 万亿,每次只激活 950 亿

阿里 Qwen 团队开源了 Qwen3.8-2.4T-A95B,这是他们第一次把云端最强模型级别的权重直接公开。模型用了混合专家架构,总共 2.4 万亿参数,但每次计算只激活其中的 950 亿,所以跑起来比同体量的稠密模型省算力。它原生支持 26 万多 token 的上下文,能一口气处理整本小说,还能扩展到 101 万 token。训练时加入了多 to...

推荐理由:阿里第一次把云端旗舰模型完整开源,2.4T MoE、激活95B、原生256K上下文,这几个指标放在一起分量很重。三个维度都踩中了:头部大厂罕见动作、技术上有具体新东西、对国内开发者生态有直接拉动。没给更高分是因为目前只有公告,还没看到第三方实测跑分和实际部署反馈,我会先打个折,等社区验证了再往上调。

8月8日星期六

AI HOT 精选

苹果官方文档确认,Mac 版 Apple 智能在国内接入阿里千问模型

苹果在 8 月 8 日更新了 Mac 简体中文支持文档,明确 Apple 智能可以配合阿里的千问模型使用。想用上这个功能,你的 Mac 得是国行版本,系统要升到 macOS 26.6 或更高,并且 Apple 账户地区设为中国大陆。在系统设置里启用千问扩展后,需要登录千问账户。它主要管两件事:一是在备忘录、邮件里帮你写东西或改写文本;二是 Siri 在...

推荐理由:苹果这次是更新了简体中文支持文档,把阿里千问作为 Apple 智能的扩展选项写死了。我会先打个折:这只是一次文档更新,没有真实跑分或延迟数据,实际体验还得等上手。但信息量够硬——硬件要求、系统版本、账户地区、功能边界都给了,不是那种“战略合作”的公关稿。对从业者来说,这等于看到苹果在国内的模型落地策略从模糊变清晰,所以给了 82 分,放在 featured 里。

8月6日星期四

AI HOT 精选

阿里云发布 Qwen-Image-3.0,高分辨率生图起步价 0.03 美元

Qwen-Image-3.0 主打生产环境可用,能吞下 4500 个 token 的提示词,相当于一篇小作文。官方说文字准确率超过 100%,logo 不会出现乱码或破损,原生支持 12 种语言。高分辨率生图起步价 0.03 美元,按量付费。不过正文只给了标题和链接,没提模型架构、推理速度和具体跑分,这个准确率数字先别太当真,等第三方实测再说。

推荐理由:Qwen 第一个专门的图像生成模型,0.03 美元起步、4500 token 提示词上限、12 种语言支持,这几个点确实有区分度。分数没给更高是因为信息源只有一条推文,正文没披露模型架构、推理速度和第三方跑分,那个“>100% 文字准确率”的说法先打个折,等实测再看。

8月5日星期三

Hacker News 首页

Qwen 发布 Image 3.0 Pro:一次生成带小字、多图排版的复杂版面,生图价格每千张 4 美元

这个模型能一口气处理 4500 个 token 的输入,直接生成报纸、菜单、故事板这类信息密度很高的图,而且图里还能再套图。它能把文字稳定渲染到 10 像素那么小,支持 12 种语言和 20 多种字体,对皮肤毛孔、发丝、微表情的还原也接近照片质感。输出价格是 1K 图 0.04 美元,2K 图 0.075 美元,但每分钟只能请求 1 次,所以想跑大批量...

推荐理由:Qwen 这次给的规格很具体——4500 token 输入、图里套图、10 像素文字稳定渲染,不是画饼。0.04 美元一张 1K 图的价格有竞争力,但每分钟 1 次的请求限制直接把批量场景堵死了,所以分数上我会先打个折。对做海报、菜单、故事板的人来说,小字和多语言支持是刚需,值得上手测,但别指望拿来跑流水线。

8月4日星期二

AI 群聊日报

Qwen 3.8 Max 跑分追平 Fable 5,权重下周开源;群里 agent 自己会下本地模型了

Qwen 3.8 Max 正式发布,2.4 万亿参数,Terminal Bench 2.1 得分 86.6,PaperBench 93.0 超过 Fable 5 的 88.8。群里有人充了 500 块的 token 额度一天就用完了,实际体感大概在 Luna 和 Terra 之间,主要优势还是便宜。下周 Qwen 3.8 Max 和 27B 模型都会开...

推荐理由:Qwen 3.8 Max 正式发布,2.4 万亿参数,PaperBench 93.0 超过 Fable 5 的 88.8,Terminal Bench 86.6,下周权重开源。群聊日报给了具体跑分和真实体感——有人充 500 块一天用完,实际能力大概在 Luna 和 Terra 之间,主要卖点是便宜。信息量足,但来源是群聊,权威性要打个折,所以没给更高分。

AI HOT 精选

Swiftlet 让 Mac 用 4.3 GB 内存跑 80B 模型,iPhone 也能跑 35B

Swiftlet 用 Swift 和 Metal 重写了 MoE 模型的推理方式,只把一个小型稠密核心常驻内存,专家权重按需从存储流式加载,不用全塞进内存。一个 80B 的 Qwen3-Next 在 Mac 上只占 4.3 GB 内存,35B 模型能跑在 iPhone 上。正文没给出延迟或每秒 token 数,所以实时性先别太期待。

推荐理由:Swiftlet 用 Swift 和 Metal 重写了 MoE 推理,让 80B 模型在 Mac 上只占 4.3 GB 内存,35B 模型能跑在 iPhone 上——工程路径具体,数字也够震撼,HKR 三条全中。正文没给延迟或每秒 token 数,所以实时性先别太激动,但技术方向和内存节省本身已经值得关注。

8月3日星期一

AI HOT 精选

Qwen3.8-Max 发布:2.4 万亿参数,开源权重下周放出,主打能自己干完几天活的编码和协作能力

Qwen 发布了 Qwen3.8-Max,一个总参数 2.4 万亿、每次推理激活 95B 的模型,开源权重下周放出。官方给了三个完全没人类插手的长期任务来展示它的能力:第一个是 16 天自主编码,从零搭建了一个能自我进化的命令行工具项目,产生了 265 次提交和 127 个 PR;第二个是约 5 天的论文复现与改进,它从零写了 7600 行代码,跑了 ...

推荐理由:Qwen3.8-Max 的看点不在参数大,而在开源+长期自主任务验证。2.4T 总参数、95B 激活,下周放权重,这本身就很炸。更关键的是官方用三个零人类干预的任务代替了常规跑分:16 天自主编程产出 265 次提交和 127 个 PR,5 天论文复现写出 7600 行代码。这种验证方式比刷榜更接近真实开发场景,也说明模型在长链条 agent 任务上确实能跑通。我会先打个折——权重还没放,第三方复现和实际落地效果要等下周再看。但如果是真的,这对开源社区和闭源厂商的定价逻辑都是不小的冲击。

7月25日星期六

r/LocalLLaMA

Laguna S 2.1 用 6 万多 token 的思考量,解了一道连 Qwen 都没搞定的算法题

一位用户拿一道自己花了好几天才解决的 Union-Find 数据重排题去测新出的 120B 模型 Laguna S 2.1。这道题要求在 Julia 里实现零动态内存分配,本地跑的 Qwen 3.5-122B 和 3.6-27B 都挂了。Laguna 在输出代码前生成了超过 6 万个思考 token,最终写出了能通过测试的代码,但用了一个取巧的办法:把...

推荐理由:这是一篇用户一手实测,题目具体、对比明确、有失败和成功的细节,不是泛泛的模型评价。但来源是单篇 Reddit 帖子,没有官方发布或多方交叉验证,权威性有限。信息量够上 featured,所以维持 72 分不变。

7月24日星期五

Hacker News 首页

Hetzner 开始试水大模型推理 API,目前只挂了一个模型

Hetzner 上线了一个实验性的推理 API,接口兼容 OpenAI 格式,目前只提供 Qwen 3.6 35B FP8 这一个模型。作者实测首 token 延迟中位数 153 毫秒,输出速度每秒 224 个 token,速度不错,但模型连简单的算术题都会做错。现在没有计费、没有 SLA,Hetzner 明说就是想看看需求、测测扩容和负载。更有意思的...

推荐理由:Hetzner 下场做推理是个信号:一家欧洲云厂商开始从卖裸金属往模型托管上探。作者给的实测数据挺实在,延迟和吞吐看着不差,但选的模型(Qwen 3.6 35B FP8)和算术翻车都说明这事还非常早期。我会先打个折,当成一次公开的压测和需求摸底来看,别当成品。

7月23日星期四

AI HOT 精选

通义千问发布 Qwen-Audio-3.0-TTS,Flash 版主打实时交互,Plus 版走高质量路线,目前在 Artificial Analysis ...

阿里通义千问这次发了两个 TTS 版本:Flash 做实时交互,Plus 做高质量生成。模型支持用【whisper】、【angry】这类内联标签直接控制语气,也可以用自然语言描述想要的风格,覆盖 16 种语言,一次最多生成 3 分钟音频。目前它在 Artificial Analysis 的 TTS 排行榜上拿了第一。不过正文没披露参数量、具体延迟数据和...

推荐理由:阿里通义千问发了 Qwen-Audio-3.0-TTS,Flash 版做实时交互,Plus 版走高质量路线,用 [whisper] 这类标签直接控制语气,16 种语言、最长 3 分钟,目前在 Artificial Analysis 的 TTS 榜排第一。我会先打个折:正文没披露参数量、延迟数据和定价,这些是实际落地要看的硬指标。不过 Flash/Plus 的分层和语气标签机制本身有信息量,对做语音 agent 的人有参考价值,所以维持 78 分。

7月22日星期三

AI HOT 精选

开源模型季度盘点:Kimi K3 实测、Qwen 转向开源、中国加速与蒸馏争论

Nathan Lambert 和 Florian Brand 聊了近期开源模型的动态。Kimi K3 上周发布,模型权重承诺 7 月 27 日放出,但 API 目前错误率很高——Lambert 开了 200 美元套餐,暂时还算稳定。他们认为 K3 的微调潜力很大,不过光加载权重就需要一整台 B300 节点,门槛不低。Qwen 宣布下一代主力模型会开放权...

推荐理由:这期播客是 Nathan Lambert 和 Florian Brand 的季度盘点,不是一手发布,但信息点很实:Kimi K3 权重放出日期、API 稳定性问题、加载门槛、Qwen 开源承诺、WAIC 演讲信号,以及知识蒸馏和开源闭源差距的讨论。我会先打个折,因为有些话题只是点到为止,正文没展开技术细节。不过对关注国产开源模型动态的人来说,这几个信号拼在一起已经够用,所以给了 featured 和 72 分。

7月15日星期三

TechCrunch · AI

苹果 AI 功能拿到中国准入许可,底层用阿里的通义千问模型

中国网信办批准了 Apple Intelligence 在国内上线,前提是苹果把阿里的通义千问(Qwen)模型集成到 iOS、iPadOS、macOS 和 visionOS 里,负责文字和图片的理解与生成。阿里确认了合作,但没给具体上线时间。苹果之前找过百度、DeepSeek 和字节跳动,都因为模型适配问题没谈成。大中华区对苹果很重要,上季度卖了 20...

推荐理由:这条消息的份量在于它把中美 AI 落地规则撞在了一起。苹果为了进中国,必须换掉自己的模型,用本地供应商的,而且前面三家都没谈成——说明不是随便找个合作方就能过审,技术适配和监管要求之间有硬摩擦。我会先打个折:正文没披露具体上线时间,也没说 Qwen 模型是端侧跑还是云端调,这点先别太激动。但审批通过本身和谈判失败的原因,已经足够让从业者重新掂量“海外 AI 进中国”的成本和路径了。

AI HOT 精选

阿里 Qwen 模型将接入苹果智能,给中国区 iPhone、iPad、Mac 跑 AI 功能

苹果选了阿里的 Qwen 模型来驱动中国版 Apple Intelligence,覆盖 iOS、iPadOS、macOS 和 visionOS,主要干文本和图片理解、内容生成这些活。网信办刚公布的移动端生成式 AI 备案里,苹果智能、华为小艺和 OPPO 的 AndesGPT 都在列。蔡崇信确认苹果之前跟好几家中国公司聊过,最后定了阿里。正文没披露具体...

推荐理由:苹果选阿里 Qwen 做中国版 Apple Intelligence,这事本身比技术细节更有信息量——它说明在合规和落地这两个硬指标上,Qwen 压过了百度、字节。网信办备案名单同时出现苹果、华为、OPPO,等于官方确认苹果 AI 要进中国了。我会先打个折:正文没写用的是 Qwen 哪个版本、什么时候上线,所以重要性停在 82,不往上拉。

AI HOT 精选

国行 Apple 智能完成备案,阿里确认千问将集成到 iPhone 等设备

网信办 7 月 8 日备案了苹果的“Apple 智能”大模型,适用场景是 iPhone,国行 AI 功能上线扫掉了一个关键障碍。阿里巴巴随后确认,会把千问模型作为 AI 能力集成到 Apple 智能里,覆盖 iOS、iPadOS、macOS 和 visionOS。用户不用跳转 App,就能在苹果设备上直接用千问做文字和图片理解、内容生成。苹果选阿里这事...

推荐理由:国行 Apple 智能备案通过,加上阿里确认把千问塞进苹果系统,两件事放一起就是个明确的里程碑。备案扫掉了最大的不确定性,阿里替代百度成为合作方有点意外但逻辑说得通。没给更高分是因为正文没提具体上线时间,也没说功能会先打折到什么程度,实际体验还得等。

Computing Life · Share · 鸭哥调研

AI 训练 AI:一次公开实验把自我改进的闭环走到了哪一步

Dan Austin 开源了一个完整的 AI 训练 AI 实验。外层用 Qwen3.6 智能体设计后训练方案,内层用 Qwen3-0.6B 或 1.7B 模型在 GPU 上真跑训练,隐藏评分再作为奖励反馈给外层。54 步下来,智能体先学会少交无效作业,然后把 1.7B 模型的使用比例从 42% 拉到了 95%,并开始主动调整温度、优化器等超参数。训练后...

推荐理由:我会先打个折:这只是一个公开实验,不是产品,规模也小。但它的价值在于把“AI 训练 AI”从概念变成了可复现的流程。外层 Qwen3.6 智能体设计后训练方案,内层 Qwen3-0.6B 和 1.7B 真跑训练,隐藏评分当奖励。54 步后,智能体先学会别交无效作业,然后主动把 1.7B 模型的使用比例从 42% 拉到 95%,还开始调温度、优化器这些超参数。这说明在小规模下,AI 确实能通过试错找到更省钱的训练策略。正文没披露最终模型在基准上的绝对分数,所以别急着说“超越人类调参”,但流程本身对做模型训练自动化的团队很有参考价值。

Hacker News 首页

PrismML 发布 Bonsai 27B:第一个能在手机上跑的 270 亿参数模型

PrismML 把 Qwen3.6 27B 压缩到了 3.9 GB,塞进了 iPhone 17 Pro。他们做了两个版本:三元版(5.9 GB)保留了原版 95% 的能力,1-bit 版(3.9 GB)保留了 90%。数学和编程分数几乎没掉,工具调用也撑住了,但视觉任务退化比较明显。两个版本都能处理图像,支持 26 万 token 的上下文和投机解码加...

推荐理由:PrismML 把 Qwen3.6 27B 压到 3.9 GB,装进 iPhone 17 Pro,三元版 5.9 GB 保留 95% 能力,1-bit 版 3.9 GB 保留 90%。数学和编程分数稳住了,工具调用也没崩,但视觉任务退化明显,这点先别太激动。正文没披露推理延迟和功耗,实际用起来烫不烫手还不清楚。整体是端侧部署的一个里程碑,但视觉短板和缺失的实测数据要打个折。