跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 601–603 条 · 共 603 条

2024年7月17日星期三

OpenAI News

OpenAI 用“证明者-验证者博弈”让大模型写的东西更好懂,人类评估错误率降了一半

OpenAI 让 GPT-4 家族里的大模型和小模型玩一个博弈游戏:大模型当“证明者”负责解题,小模型当“验证者”负责判对错。大模型如果只追求答案正确,写出来的解题步骤会越来越难读——人类评估员在限时条件下,错误率几乎翻倍。换成这种博弈训练后,大模型必须写出连小模型都能看懂的推理过程,结果人类评估的准确率也上来了。

推荐理由:OpenAI 让 GPT-4 家族的大模型当证明者、小模型当验证者进行博弈训练,人类评估错误率从翻倍降至一半,为可扩展监督提供了一条可迁移的训练思路。

2024年6月28日星期五

DeepSeek · API 更新日志

deepseek-chat 升级为 DeepSeek-V2-0628,推理与角色扮演能力提升

deepseek-chat 模型升级为 DeepSeek-V2-0628,推理能力提升,角色扮演能力显著增强。HumanEval Pass@1 从 79.88% 提升至 84.76%,MATH ACC@1 从 55.02% 提升至 71.02%,BBH 从 78.56% 提升至 83.40%。

推荐理由:DeepSeek 升级后的数学基准提升幅度高于代码与推理基准,在 Arena-Hard 中对 GPT-4-0314 的胜率也有提升。

2024年6月14日星期五

DeepSeek · API 更新日志

deepseek-coder 升级为 DeepSeek-Coder-V2-0614

deepseek-coder 模型升级为 DeepSeek-Coder-V2-0614,代码能力显著提升。官方称,其代码生成、代码理解、代码修复和代码补全能力达到 GPT-4-Turbo-0409 的水平,并拥有卓越的数学和推理能力,通用能力与 DeepSeek-V2-0517 持平。

推荐理由:DeepSeek 升级代码模型,将代码生成、理解、修复和补全四项能力对标 GPT-4-Turbo-0409。