今天日报信息量很大,核心看点是模型架构的集体转向。GLM和Qwen的新Flash模型都抛弃了全局注意力,改用MoE加稀疏注意力的混合架构。这不再是某个厂的独门绝技,而是行业在成本与性能间找到的新公约数。GLM-5.3-Flash跑分亮眼,六项基准追平Claude Opus 4.8,每任务成本折后才0.045美元,但群友实测反馈速度慢、幻觉多,说明纸面分数和实际体感之间还有不小的沟要填。Qwen 3.8-Flash-Next则更务实,直接开源权重,在DGX Spark上单流解码跑到64.7 tok/s,把DeepSeek V4 Flash比下去了,本地部署的可用性往前迈了一大步。
行业新闻里,NVIDIA花129亿美元收购Hugging Face是今天最重磅的消息。这个价格是HF年化收入的86倍,买的不是营收,是开源模型的分发管道。当大客户都在自研芯片,NVIDIA需要卡住生态位,让任何人在任何地方跑模型,最后都得买它的算力。另外,Anthropic筹备2万亿美元估值IPO,二季度调整后利润约5.59亿,而OpenAI同期经营亏损高达123亿,两家公司的财务路径已经彻底分化。Altman在播客里承认砍掉了Sora和Atlas,说OpenAI还没迎来iPhone时刻,这话从他自己嘴里说出来,比任何分析师的报告都更有分量。
技术细节上,QUASAR-QAT把Qwen 3.8-27B全部496个线性层都量化到了NVFP4,显存再省1.8GB,代价是不带MTP,用DFlash2能补回速度但没法做张量并行。Shopify CEO吐槽Claude Code不读AGENTS.md导致团队内部“裂脑”,这是个很实际的工程摩擦,说明AI工具在融入现有工作流时,配置文件的标准和兼容性还是个坑。