# 本地跑模型终于好用了：Vicki Boykis 的 M2 Mac 实测体验

> 原标题：Running local models is good now

- 来源：Hacker News 首页
- 发布时间：2026-06-16T14:36:57.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/38649
- 原文：https://vickiboykis.com/2026/06/15/running-local-models-is-good-now/

## 摘要

Vicki Boykis 用一台 64GB 内存的 M2 Mac 跑本地模型超过一年，现在她觉得这些模型真的能干活了。她主要用 Gemma 4 的 26B 和更新的 12B qat 版本，通过 Pi 做智能体编程，效果大概能达到顶尖闭源模型的 75%。整套环境跑在权限受限的 Docker 容器里，推理服务用 LM Studio。文章没给具体的生成速度和...

## 推荐理由

Vicki Boykis 是技术圈有口碑的博主，这篇是她自己用了一年多的长期体验报告，有硬件、有模型、有对比，不是软文。分数维持在 featured 门槛 72 分，因为文章缺了关键部署数据——生成速度、延迟这些都没给，我会先打个折。

## 锐评

Vicki Boykis 这篇体验报告挺实在的，没有吹牛。她用一台 64GB 内存的 M2 Mac，把 Gemma 4 的 26B 和更新的 12B qat 版本跑在 Docker 容器里，通过 Pi 做智能体编程。她自己定的标准很简单：需不需要再拿闭源模型的结果来对答案。从 GPT-OSS 开始，她对答案的次数明显少了，到 Gemma 4 已经能在本地跑通重构代码、写单元测试、搭推荐模型原型这些任务，成功率大约到闭源顶尖模型的 75%。

不过文章缺了硬指标。她没提 token 生成速度、首 token 延迟这些关键体验数据，只说了 KV 缓存能把 64GB 内存吃满。另外，所有测试都在权限受限的 Docker 里跑，安全性考虑到了，但这也意味着任务类型偏代码生成和文档查询，没有涉及联网、调 API 这类更复杂的智能体场景。

如果你手头有台大内存 Mac，想试试本地模型能不能替掉一部分 API 调用，这篇值得照着搭一遍。但如果是生产环境或者对延迟敏感的任务，还是先拿自己的场景测过再说。
