# 斯坦福和英伟达推出对比语言模型 CLM，做决策比 Jev 快 9 倍

> 原标题：Contrastive Language Models

- 来源：Hacker News 首页
- 发布时间：2026-09-24T04:20:59.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/58619
- 原文：https://contrastive-lm.notion.site/

## 摘要

CLM 的思路和传统语言模型不一样：它不生成文字，而是把“当前状态”和“可选动作”分别编码成向量，用余弦相似度打分，选最匹配的动作。这相当于让模型直接做选择题，省掉了逐字生成的时间。CLM-8B 在电脑操作、游戏和工具调用上效果跟 Jev 持平，但延迟最高能降 9 倍——候选动作越多、动作能跨状态复用时，提速越明显。在 DeepSWE 和 Termin...

## 推荐理由

CLM 提出了一套和自回归生成完全不同的决策架构，用向量相似度代替逐字输出，在 agent 基准上效果持平但延迟降 9 倍，属于少见的范式级探索。我会先打个折：文章是 Notion 页面形式，作者来自学界，离生产落地还有距离，但思路本身值得关注。

## 锐评

CLM 的思路挺直接：把“当前状态”和“可选动作”分别压成向量，算余弦相似度，选最匹配的那个。这等于让模型做选择题，省掉了逐字生成的时间。CLM-8B 在电脑操作、游戏和工具调用上效果跟 Jev 持平，延迟最高降 9 倍——候选动作越多、动作能跨状态复用时，提速越明显。在 DeepSWE 和 Terminal Bench 2.1 上微调后分别跑到 81.6% 和 87.6%，比 Jev 快 4 到 6 倍。

训练成本也压得很低：只训一个 2000 万参数的投影头，底层大模型冻住不动，单张 RTX 4090 上预训练大概一小时。这点先别太激动，因为正文没提 8B 之外有没有更大尺寸的计划，也没说权重是否开源。另外，所有评估都来自作者自己发布的页面，还没有第三方复现或论文审稿记录，验证强度偏弱。如果后续能开源模型和训练配方，这个架构在需要高频决策的场景里会很有看头。
