# 修了三个 bug，让 Qwen3.5-122B 在 Mac Studio 上从没法用变成日常主力

> 原标题：Fixed three bugs that made Qwen3.5-122B a daily driver on Mac Studio

- 来源：Hacker News 首页
- 发布时间：2026-07-11T22:54:06.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/43842
- 原文：https://mrzk.io/posts/qmlx-maximising-ai-psychosis-minmaxing-mac-studio/

## 摘要

作者在 M3 Ultra Mac Studio 上跑 Qwen 3.5 122B 做长上下文编程，发现每次追问都要等几分钟才吐出第一个字。问题不在模型，而在推理服务栈里的三个缓存 bug：系统提示词里每轮都塞了不同的消息 ID、对话历史里缺了模型的上一次回复、以及磁盘缓存被旧的脏数据污染。修完之后，13 万 token 上下文的追问延迟从几分钟降到了 ...

## 推荐理由

一篇很实在的本地推理排障记录：修了三个缓存 bug，把 13 万 token 长上下文的追问延迟从几分钟压到能用的程度。bug 描述具体，修完后的数字也给了，对在 Mac 上跑大模型的人有直接参考意义。没给更高分是因为正文没披露修完后精确到多少秒，只说“从几分钟降到了……”，缺一个硬数字收尾。

## 锐评

这篇博客最值钱的部分不是模型选型，而是作者在自家 Mac Studio 上排查出的三个缓存 bug。第一个是系统提示词里每轮都塞了不同的消息 ID，导致推理引擎认为上下文变了，每次都要重新处理全部历史。第二个是对话记录里漏掉了模型上一次的回复，KV 缓存对不上号。第三个是磁盘缓存被旧的脏数据污染，直接让缓存加速失效。这三个问题修完后，13 万 token 上下文的追问延迟从几分钟降到了 11 秒，从没法用变成了能日常对话。

作者用的是一台 M3 Ultra Mac Studio，96GB 统一内存，跑 Qwen 3.5 122B 这个混合专家模型。他明确说了，之前用 DS4 Flash 时长上下文预填充太慢，不适合他那种需要即时反馈的结对编程场景，换模型是匹配问题，不是模型本身差。

正文没披露量化精度和具体功耗，也没给出多轮对话下的显存占用曲线。11 秒的延迟是在修完 bug 后的最优情况下测的，日常使用中随着上下文继续增长会不会又崩，这点还没验证。代码开源在 qMLX，但作者也说了这是从 rapid-mlx 分叉出来的，专门针对混合注意力做了定制，通用性有限。
