# Qwen3.6 新增 preserve_thinking 开关，修了上一代多轮对话“失忆”的 bug

> 原标题：PSA: Qwen3.6 ships with preserve_thinking. Make sure you have it on.

- 来源：r/LocalLLaMA
- 发布时间：2026-04-16T19:41:55.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/39
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1sne4gh/psa_qwen36_ships_with_preserve_thinking_make_sure/

## 摘要

Qwen3.6 模型页面上多了一个 preserve_thinking 参数，默认要打开。它的作用是把模型上一轮的思考过程原样保留在上下文里，而不是像 Qwen3.5 那样每次重新序列化，导致 KV 缓存失效、模型记不住自己刚想过什么。作者给了一个很直观的测试：先让模型想两个 20 位数字，只说出第一个；下一轮再问第二个。开关关掉时模型会说自己没生成过...

## 推荐理由

这条 Reddit PSA 的价值在于挖出了一个藏在模型页里的开关。我会先打个折，因为这不是官方发布说明，而是社区踩坑分享，但信息密度够高：有复现步骤、有根因分析、还顺手标了 LM Studio 和 oMLX 的支持状态。对正在用 Qwen3.6 搭 agent 的人来说，知道 preserve_thinking 能让推理上下文跨轮保留，比看十篇通稿都实在。

## 锐评

Qwen3.6 这次修了一个挺实际的毛病：之前 Qwen3.5 的模板会把模型上一轮的思考过程重新序列化，导致 KV 缓存失效，模型转头就忘了自己刚想过什么。现在加了个 preserve_thinking 参数，默认打开，把思考过程原样留在上下文里。作者用了个很直观的测试——让模型先想两个 20 位数字，只说出第一个，下一轮再问第二个。开关关掉时模型直接说自己没生成过第二个数，打开后能立刻给出。这对 agent 和工具调用场景有用，模型能引用之前的推理，不用每轮从头来，理论上还能省 token。

不过目前支持有限：LM Studio 还没跟上，oMLX 有个 PR 在等合并。正文没提其他推理框架的适配进度，也没给出 preserve_thinking 打开后的延迟或显存开销数据。这点先别太激动，实际部署前最好在自己用的框架上跑一下那个 20 位数字测试，确认开关真的生效了。
