AI Model Groupthink
Magic Numbers 对12个 AI 模型进行推荐答案一致性测试,样本中的中国模型整体更接近其他模型的共识。基于数百个英语问题,5个中国模型的平均一致性得分为0.47,6个美国模型为0.38,Mistral 为0.36;DeepSeek 得分最高,Claude Haiku 最低。
Magic Numbers 对12个 AI 模型进行推荐答案一致性测试,样本中的中国模型整体更接近其他模型的共识。基于数百个英语问题,5个中国模型的平均一致性得分为0.47,6个美国模型为0.38,Mistral 为0.36;DeepSeek 得分最高,Claude Haiku 最低。