# 域模型的第三条路：一家175年公司花4000万美元给出的答案

> 原标题：域模型的第三条路：一个 175 年公司的 $40M 答案

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-08-28T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/53540
- 原文：https://yage.ai/share/domain-model-third-path-20260828.html

## 摘要

Thomson Reuters花了4000万美元，在阿里的开源模型Qwen上做法律数据的后期训练，自报法律评分超过了Anthropic Haiku 4.5。纯算力成本只要10到20万美元，真正烧钱的是他们175年攒下的判例法数据库、几百位专家的人工标注，以及一套能拉开分数差距的评测系统。三年前，Bloomberg烧了多得多的钱从零训练一个500亿参数的...

## 推荐理由

这篇文章给出了一个很具体的行业模型路线：不从头训，也不纯靠API，而是拿开源模型做后期训练，用私有数据和专家标注建立壁垒。Thomson Reuters花了4000万，但纯算力成本低得惊人，真正烧钱的是数据资产和评测体系，这点对从业者很有启发。文章还拉了三年前Bloomberg从零训500亿参数模型的失败案例做对比，让结论更扎实。自报评分超过Haiku 4.5这点我会先打个折，毕竟评测集是自己出的，但整体逻辑和成本透明度足够，不是PR稿，值得推荐。

## 锐评

这条新闻最值得看的是账本结构：4000万美元总投入，纯算力成本压到了10到20万美元，剩下的钱全砸在175年的判例法数据库、几百位法律专家的标注和一套能拉开分数差距的评测系统上。这和2023年Bloomberg烧巨资从零训练50B模型却从未上线的结局形成了直接对比。三年时间，行业路线彻底翻转——开放底座负责通用推理，RAG承载动态事实，私有数据飞轮专门做评测与行为对齐，权重层退成了可以随时替换的零件。

Harvey的案例进一步验证了这个逻辑。他们用全参数强化学习在GLM 5.3 Flash上做法律后训练，自报专业评分正面超过了GPT-5.5和Opus 4.8 Max。技术复盘里有一句话很关键：模型能学到什么，完全取决于评测环境能提供多高区分度的打分信号。换句话说，真正稀缺的不是算力，而是能把领域专家判断转化为连续优化信号的评测体系。

不过正文也坦承了两个风险：领域数据注入导致模型在数学和代码任务上出现可测量的能力回退，以及中国开源厂商正在收紧商业授权条款。这意味着选底座之前必须先过法务关，而且这种垂直后训练模型很可能是一个偏科生，通用能力会打折。信息缺口在于，自报评测的基准和打分器设计细节没有完全公开，外部无法独立验证这些分数在真实法律工作流中的实际表现。
