# GLM-5.3-Flash 和 Qwen 3.8-Flash-Next 同日发布，都砍掉了全局注意力

> 原标题：2026-08-26 群聊日报

- 来源：AI 群聊日报
- 发布时间：2026-08-27T09:28:39.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/53313
- 原文：https://louyu2015.github.io/AI-chatgroup-daily/daily/2026/08/26/daily/

## 摘要

今天两个新 Flash 模型撞车发布。GLM-5.3-Flash 在六项基准上追平 Claude Opus 4.8，每任务成本折后 0.045 美元，但实测速度慢、幻觉多。Qwen 3.8-Flash-Next 开源权重，在 DGX Spark 上单流解码跑到 64.7 tok/s，全面超过 DeepSeek V4 Flash。两者都用了 MoE 加稀...

## 推荐理由

两条 Flash 模型撞车发布，信息密度高。GLM-5.3-Flash 基准分好看但实测翻车，Qwen 3.8-Flash-Next 开源权重且推理速度有实测数据压过 DeepSeek V4 Flash。有具体数字、有社区真实反馈、有架构对比，对从业者选型参考价值大，但正文没展开幻觉具体表现和更多实测细节，所以重要性给 78 分。

## 锐评

今天日报信息量很大，核心看点是模型架构的集体转向。GLM和Qwen的新Flash模型都抛弃了全局注意力，改用MoE加稀疏注意力的混合架构。这不再是某个厂的独门绝技，而是行业在成本与性能间找到的新公约数。GLM-5.3-Flash跑分亮眼，六项基准追平Claude Opus 4.8，每任务成本折后才0.045美元，但群友实测反馈速度慢、幻觉多，说明纸面分数和实际体感之间还有不小的沟要填。Qwen 3.8-Flash-Next则更务实，直接开源权重，在DGX Spark上单流解码跑到64.7 tok/s，把DeepSeek V4 Flash比下去了，本地部署的可用性往前迈了一大步。

行业新闻里，NVIDIA花129亿美元收购Hugging Face是今天最重磅的消息。这个价格是HF年化收入的86倍，买的不是营收，是开源模型的分发管道。当大客户都在自研芯片，NVIDIA需要卡住生态位，让任何人在任何地方跑模型，最后都得买它的算力。另外，Anthropic筹备2万亿美元估值IPO，二季度调整后利润约5.59亿，而OpenAI同期经营亏损高达123亿，两家公司的财务路径已经彻底分化。Altman在播客里承认砍掉了Sora和Atlas，说OpenAI还没迎来iPhone时刻，这话从他自己嘴里说出来，比任何分析师的报告都更有分量。

技术细节上，QUASAR-QAT把Qwen 3.8-27B全部496个线性层都量化到了NVFP4，显存再省1.8GB，代价是不带MTP，用DFlash2能补回速度但没法做张量并行。Shopify CEO吐槽Claude Code不读AGENTS.md导致团队内部“裂脑”，这是个很实际的工程摩擦，说明AI工具在融入现有工作流时，配置文件的标准和兼容性还是个坑。
