跳到正文
Hacker News 首页

大模型现在也变复杂了

LLMs Are Complicated Now

Ian Barber 把 Llama 3 和 Nemotron 3 Ultra 的架构图摆在一起对比,发现现在的大模型塞进了好几种不同的注意力机制(分组查询、压缩、稀疏、线性、滑动窗口),前馈层用上了混合专家路由,连残差流和注意力块也开始做选择性路由了。视觉和音频编码器从外挂变成了内嵌,推理时还要跨多张 GPU 跑,中间插了一堆通信操作。他说这跟当年推...

推荐理由:一篇把两张架构图摆在一起走的观察笔记,没有新实验,但把 Llama 3 和 Nemotron 3 Ultra 的复杂度增长讲得很透——注意力变体、路由策略、多模态编码器内嵌、推理部署的通信开销都点到了。三个维度都踩中,不过本质是工程观察而非原创发现,所以重要性给 72、tier 给 featured 是合适的。

读原文 ↗导出 Markdown