# 用 Hermes Agent 和 qwen3.6-35b 在本地跑深度研究，生成了 21 页报告

> 原标题：Deep research + report &quot;a la McKinsey&quot; with Hermes Agent and qwen3.6-35b-a3b Q6_K.

- 来源：r/LocalLLaMA
- 发布时间：2026-05-04T11:09:01.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/13620
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t3eixr/deep_research_report_a_la_mckinsey_with_hermes/

## 摘要

一位 Reddit 用户用 Hermes Agent 框架搭配 qwen3.6-35b-a3b 的 Q6_K 量化版，在单张 RTX 4060 上跑了 6 轮循环、超过 5 小时，生成了一份 21 页的研究报告。生成速度约每秒 28 个 token。仓库里放了提示词、脚本、中间产物和最终报告。正文没披露报告具体主题和结论质量，也没说这 5 小时里人工干...

## 推荐理由

HKR 三项都站得住：这是一个带硬件型号、运行时长、生成速度和完整产物的本地 agent 实验。来源是 Reddit 个人分享，传播面有限，所以分数放在 72–77 的 featured 门槛区间，不往上拔。

## 锐评

这条分享的价值在于把“本地跑深度研究”的成本和门槛摆出来了：一张 RTX 4060 消费级显卡，用 Hermes Agent 框架搭 qwen3.6-35b-a3b 的 Q6_K 量化版，6 轮循环、超过 5 小时，生成一份 21 页报告，速度约每秒 28 个 token。作者把提示词、脚本和中间产物都放进了仓库，对想复现的人比较友好。

但正文没披露报告的具体主题，也没说结论靠不靠谱。5 小时里人工干了多少活、中间需不需要手动纠偏，这些都没提。每秒 28 token 的速度在本地跑 35B 模型算正常，但放到“深度研究”场景里，意味着出结果要等很久，实际用起来会有点磨人。

还缺两个关键信息：一是报告质量有没有经过人工核对，二是这套流程能不能稳定复现。如果只是跑通了一次，参考价值就打折扣。
