跳到正文
Hacker News 首页

修了三个 bug,让 Qwen3.5-122B 在 Mac Studio 上从没法用变成日常主力

Fixed three bugs that made Qwen3.5-122B a daily driver on Mac Studio

作者在 M3 Ultra Mac Studio 上跑 Qwen 3.5 122B 做长上下文编程,发现每次追问都要等几分钟才吐出第一个字。问题不在模型,而在推理服务栈里的三个缓存 bug:系统提示词里每轮都塞了不同的消息 ID、对话历史里缺了模型的上一次回复、以及磁盘缓存被旧的脏数据污染。修完之后,13 万 token 上下文的追问延迟从几分钟降到了 ...

推荐理由:一篇很实在的本地推理排障记录:修了三个缓存 bug,把 13 万 token 长上下文的追问延迟从几分钟压到能用的程度。bug 描述具体,修完后的数字也给了,对在 Mac 上跑大模型的人有直接参考意义。没给更高分是因为正文没披露修完后精确到多少秒,只说“从几分钟降到了……”,缺一个硬数字收尾。

读原文 ↗导出 Markdown