# 有人实测 DeepSeek V4 的百万上下文窗口，发现写代码的最佳区间是 15 万到 25 万 token

> 原标题：Deepseek V4's 1M context window: the breaking point

- 来源：r/LocalLLaMA
- 发布时间：2026-05-17T06:35:44.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/21874
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tfhl0q/deepseek_v4s_1m_context_window_the_breaking_point/

## 摘要

一位 Reddit 用户拿 DeepSeek V4 去啃 4.5 万、18 万和 52 万 token 的代码库，结论是 15 万到 25 万 token 时写代码最顺手。超过 30 万 token 后，模型对具体行号的定位开始不准；到 52 万 token 时，输出明显偏向架构总结，具体实现细节会跳过。帖子正文没披露测试用的具体任务和评估指标，所以这...

## 推荐理由

单篇 Reddit 帖子权威性有限，但 HKR 三项都站得住：有数字、有对比、有明确的失效模式。归入 featured 而不是更高，是因为复现细节和模型版本信息偏薄，先别太激动。

## 锐评

这条 Reddit 帖子给了一个很实用的参考点：DeepSeek V4 标称 100 万 token 的上下文窗口，实际写代码最舒服的区间是 15 万到 25 万 token。超过 30 万 token，模型对具体行号的定位开始不准；到 52 万 token 时，输出明显偏向架构总结，具体实现细节会跳过。这跟很多人的体感一致——长上下文不是越长越好，模型会“偷懒”抓重点，丢掉细粒度信息。

不过得说清楚，帖子正文没披露测试用的具体任务和评估指标。我们不知道是让模型改 bug、加功能还是做代码审查，也不知道“不准”是怎么衡量的。发帖人只给了 token 数和结论，没给原始对话或评分标准。所以这个结论更像一个用户经验，不能当正式基准看。

对实际干活的人来说，这条信息有用：别一上来就塞整个代码库，先控制在 20 万 token 以内试试。但如果你要做精确到行的修改，超过 30 万 token 就得自己多检查。另外，帖子没提不同编程语言或项目结构的影响，这也是个缺口。
