AI 模型群体思维评测:中国模型的推荐更接近共识
AI Model Groupthink
Magic Numbers 对12个 AI 模型进行推荐答案一致性测试,样本中的中国模型整体更接近其他模型的共识。基于数百个英语问题,5个中国模型的平均一致性得分为0.47,6个美国模型为0.38,Mistral 为0.36;DeepSeek 得分最高,Claude Haiku 最低。
AI Model Groupthink
Magic Numbers 对12个 AI 模型进行推荐答案一致性测试,样本中的中国模型整体更接近其他模型的共识。基于数百个英语问题,5个中国模型的平均一致性得分为0.47,6个美国模型为0.38,Mistral 为0.36;DeepSeek 得分最高,Claude Haiku 最低。