# 有人把 HuggingFace 的 AI 研究员搬到了本地，用 llama.cpp 跑通了一条自动微调流水线

> 原标题：Automated AI researcher running locally with llama.cpp

- 来源：r/LocalLLaMA
- 发布时间：2026-05-14T10:32:04.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/20625
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tcu5r8/automated_ai_researcher_running_locally_with/

## 摘要

HuggingFace 之前开源了一个叫 ml-intern 的自动化 AI 研究员，现在社区有人把它接上了 llama.cpp 和 ollama，让整个流程能在本地跑。帖子说用 Qwen3.6-35B-A3B 这个模型就能当大脑，指挥 CPU/GPU 沙箱和 HuggingFace Hub 上的任务，从头到尾完成一次 SFT（有监督微调）。正文没披露...

## 推荐理由

我会先打个折：这是 Reddit 出来的开源工具更新，不是大模型发布。但本地沙箱加 Hub 作业编排能跑通完整微调，对想在自己机器上做自动化实验的人挺实用。正文没披露具体延迟和资源占用，这点先别太激动。

## 锐评

这条消息的亮点是“本地化”：之前 ml-intern 这类自动化研究员通常依赖云端 API，现在社区让它能在自己机器上跑，意味着数据不出门、成本更可控。帖子提到用 Qwen3.6-35B-A3B 当大脑，指挥 CPU/GPU 沙箱和 HuggingFace Hub 上的任务，从头到尾完成一次有监督微调。但关键信息全卡在 Reddit 的 403 错误里——正文没披露一次完整 SFT 要跑多久、吃多少显存、最终模型效果有没有对比基准。这点先别太激动，因为 35B 的 MoE 模型虽然激活参数少，但调度沙箱和 Hub 任务本身也有开销，本地跑通和跑得好是两码事。还缺的是：这套流程能不能稳定复现，以及它比直接用云端 API 到底省了多少成本、延迟高了多少。
