# 近处保真、远处有损：三种长上下文方法背后的同一个直觉

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-08-25T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/52857
- 原文：https://yage.ai/share/long-context-layering-yarn-v4-20260825.html

## 摘要

YaRN、DeepSeek V4 和 DeepSeek-OCR 这三套方案来自不同团队，分别在位置编码、注意力通路和输入表示三个层面解决了长上下文的瓶颈，但底层逻辑完全一致：把最高精度留给近处或焦点，对远处信息做有损压缩。YaRN 对 RoPE 做分频处理，高频不动、低频压缩，让 Llama 2 7B 用约 384 个 A100 GPU 小时就扩展到 ...

## 推荐理由

文章把三个不同层面的长上下文方案统一到一个直觉下——近处保真、远处有损，而且给了训练成本和显存占用的硬数字，对做推理优化的工程师来说很实用。不是一手研究发布，正文在论证中途截断，信息完整度打了折扣，所以分数没给更高。

## 锐评

这篇文章把 YaRN、DeepSeek V4 和 DeepSeek-OCR 串了起来，点出了一个很朴素的工程直觉：在算力和显存都有限的情况下，对所有信息一视同仁是最笨的做法。最合理的策略就是把最高精度留给眼前或焦点，对远处信息做有损压缩。这个思路在坐标层、信息通路层和输入表示层分别落地，效果都很直接。

数字上，YaRN 让 Llama 2 7B 用约 384 个 A100 GPU 小时就扩到 128K 上下文，短文本性能衰退不到 1%；DeepSeek V4-Pro 在 1M 上下文下，单 token 计算量降到 V3.2 的 27%，KV cache 显存降到 10%；DeepSeek-OCR 在 10 倍压缩比下文字还原准确率 97%，单卡日处理超 20 万页。这些数字说明，在各自层级上，近处保真、远处有损的策略确实省下了真金白银的算力。

不过文章也诚实点出了新问题：压缩之后，模型怎么保持对位置远近的感知？文中提了双轨位置尺度、按文档重置坐标、甚至 Kimi K3 直接去掉位置编码这三种解法，但都还处于探索阶段。另外，文章没给出这三种方法在同一个任务上的横向对比，也没讨论压缩策略在需要精确回忆远处细节的场景下会丢多少分。这点先别太激动，等有了更系统的消融实验再看。
