跳到正文
热点事件持续更新

12款AI模型推荐共识倾向评测

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

10月8日,Hacker News首页报道了Magic Numbers对12个AI模型开展的推荐答案一致性测试。测试基于数百个英语问题,比较各模型的推荐与其他模型共识的接近程度。结果显示,样本中的5个中国模型平均一致性得分为0.47,6个美国模型为0.38,Mistral为0.36,中国模型整体更接近其他模型的共识。单个模型中,DeepSeek得分最高,Claude Haiku最低。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. Hacker News 首页
    AI 模型群体思维评测:中国模型的推荐更接近共识

    Magic Numbers 对12个 AI 模型进行推荐答案一致性测试,样本中的中国模型整体更接近其他模型的共识。基于数百个英语问题,5个中国模型的平均一致性得分为0.47,6个美国模型为0.38,Mistral 为0.36;DeepSeek 得分最高,Claude Haiku 最低。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。