# 大模型现在也变复杂了

> 原标题：LLMs Are Complicated Now

- 来源：Hacker News 首页
- 发布时间：2026-06-20T01:25:14.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/39534
- 原文：https://ianbarber.blog/2026/06/19/llms-are-complicated-now/

## 摘要

Ian Barber 把 Llama 3 和 Nemotron 3 Ultra 的架构图摆在一起对比，发现现在的大模型塞进了好几种不同的注意力机制（分组查询、压缩、稀疏、线性、滑动窗口），前馈层用上了混合专家路由，连残差流和注意力块也开始做选择性路由了。视觉和音频编码器从外挂变成了内嵌，推理时还要跨多张 GPU 跑，中间插了一堆通信操作。他说这跟当年推...

## 推荐理由

一篇把两张架构图摆在一起走的观察笔记，没有新实验，但把 Llama 3 和 Nemotron 3 Ultra 的复杂度增长讲得很透——注意力变体、路由策略、多模态编码器内嵌、推理部署的通信开销都点到了。三个维度都踩中，不过本质是工程观察而非原创发现，所以重要性给 72、tier 给 featured 是合适的。

## 锐评

Ian Barber 把 Llama 3 和 Nemotron 3 Ultra 的架构图摆在一起，结论很直白：现在的大模型已经塞进了分组查询、压缩、稀疏、线性、滑动窗口等多种注意力机制，前馈层用上了混合专家路由，连残差流和注意力块也开始做选择性路由了。视觉和音频编码器从外挂变成了内嵌，推理时还要跨多张 GPU 跑，中间插了一堆通信操作。他说这跟当年推荐系统从干净的两塔模型变成工程怪兽的路径一模一样。

核心矛盾在于，你想试一个新的注意力变体，如果它比现有方案慢一个数量级，你根本试不起。但现有方案是经过算子融合优化的，你至少得把新方案也做部分融合才能公平对比，而手工融合每个候选方案又太贵。他的解法是像 PyTorch 的 FlexAttention 那样，在设计阶段就把可组合性和可验证性做进去，让研究迭代的成本别太高。

文章没给出具体性能数据，也没说这种复杂度到底换来了多少能力提升。作者自己也承认，靠智能体自动生成优化内核这条路，前提是你得先有一个可靠的基线来验证生成结果对不对，这个前提目前还没完全成立。
