# DeepSeek-V4 把“思考”藏进潜空间，打包成一个能直接部署的完整模型

> 原标题：Show HN: DeepSeek-V4 Latent Reasoning – moving "thinking" into latent space

- 来源：Hacker News 首页
- 发布时间：2026-08-09T11:46:28.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/49600
- 原文：https://blog.n.ichol.ai/packaging-latent-reasoning-as-a-real-model

## 摘要

Nicholai Mitchko 把之前那个需要外挂的 CoLaR 潜空间推理头，做成了一个开箱即用的完整模型。模型本体是 DeepSeek-V4-Flash-0731，用 NVFP4 量化后，两张 GPU 就能跑起来。那个负责“思考”的推理头只有 3570 万参数，现在和模型权重打包在一起了。在 BBH 基准测试里，它零样本总得分 0.94，多步骤状...

## 推荐理由

把CoLaR的潜空间推理从外挂改成内置，工程上有价值，BBH零样本0.94分也拿得出手。但这篇是个人研究博客，没有其他信源交叉验证，受众也窄，所以刚好卡在featured门槛上。

## 锐评

Nicholai Mitchko 把之前需要手动拼装的 CoLaR 潜空间推理头，做成了一个完整的模型。简单说，就是让模型在输出答案前，先在内部向量空间里多“琢磨”几轮，而不是把思考过程写成文字给你看。模型本体是 DeepSeek-V4-Flash，用 NVFP4 量化后，两张 GPU 就能跑，显存占用约 79 GiB 每张卡。那个负责“琢磨”的推理头只有 3570 万参数，很小。

在 BBH 基准测试里，它零样本总分 0.94，多步骤状态追踪拿了满分，说明这种内部思考对复杂逻辑题确实有效。但 Dyck 语言（一种括号匹配语法题）只得了 0.26，短板非常明显。作者自己也说，这更像一个研究验证，不是生产级产品。

目前最大的限制是信息缺口：正文没披露推理延迟增加了多少，也没说这种内部思考的可解释性怎么解决——模型在“想”什么你完全看不到。另外，它依赖一个修改过的 vllm 运行时，部署门槛比普通模型高。如果你对推理效率有极致要求，这点要先打个折。
