# 一位律师用 12 块 V100 显卡搭本地集群跑法律文书起草，Qwen3.5-122B 模型跑到约 50 token/秒

> 原标题：Update on 12x32gb sxm v100 cluster / local AI for legal drafting

- 来源：r/LocalLLaMA
- 发布时间：2026-05-25T21:50:30.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/27058
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tnn29i/update_on_12x32gb_sxm_v100_cluster_local_ai_for/

## 摘要

Reddit 上一位律师分享了自己用 12 块 32GB 显存的 SXM V100 显卡搭建本地 AI 集群的进展，专门用来起草法律文书。核心模型是 Qwen3.5-122B-A10B，在 4 块 V100 上推理速度大约 50 token/秒。这套流程里还加了一个“验证器”，会在最终文件使用前自动拦截没有真实来源的引用、日期和 Bates 编号（案件...

## 推荐理由

这是一篇来自Reddit的第一手实验记录，不是厂商通稿。律师自己攒16块V100跑Qwen 122B做法律文书，速度约50 tok/s，还加了引用和日期验证器来拦截幻觉，信息量扎实。我会先打个折：来源是个人帖子，权威性有限，所以放在featured低段而不是p1。但HKR三项全中——故事性强、有可复现数字、切中本地部署和合规痛点，对想自己动手的团队是个不错的参照。

## 锐评

这条分享的亮点在于把大模型落地到对准确性要求极高的法律起草场景，而且用的是二手市场淘来的V100，不是最新的H100。作者提到Qwen3.5-122B-A10B在4块V100上能跑到50 token/秒，这个速度对于文书起草来说够用了。更关键的是他加了一个“验证器”，专门拦截模型瞎编的案例引用、日期和案件编号——法律文书最怕的就是这个。

但问题也很明显：Reddit原文被屏蔽了，我们看不到完整的硬件配置、功耗、总成本，也不知道验证器本身是怎么实现的，是规则匹配还是另一个模型。12块32GB V100的集群跑起来，电费和散热成本不会低，作者没提这些。另外，法律文书的准确性验证到底能做到什么程度，有没有和人工校对做过对比测试，正文也没披露。这点先别太激动，等作者补上细节再看。
