跳到正文
Computing Life · Share · 鸭哥调研

近处保真、远处有损:三种长上下文方法背后的同一个直觉

YaRN、DeepSeek V4 和 DeepSeek-OCR 这三套方案来自不同团队,分别在位置编码、注意力通路和输入表示三个层面解决了长上下文的瓶颈,但底层逻辑完全一致:把最高精度留给近处或焦点,对远处信息做有损压缩。YaRN 对 RoPE 做分频处理,高频不动、低频压缩,让 Llama 2 7B 用约 384 个 A100 GPU 小时就扩展到 ...

推荐理由:文章把三个不同层面的长上下文方案统一到一个直觉下——近处保真、远处有损,而且给了训练成本和显存占用的硬数字,对做推理优化的工程师来说很实用。不是一手研究发布,正文在论证中途截断,信息完整度打了折扣,所以分数没给更高。

读原文 ↗导出 Markdown