跳到正文
MIT Technology Review · AI

MIT 出了七道谜题,顶尖 AI 模型照样翻车,你来试试?

AI models flub these intelligence tests. Can you fare any better?

MIT Technology Review 做了一个互动测试,挑了七道曾让前沿模型栽跟头的谜题。哥伦比亚大学的数据显示,2024 年底最好的模型解《纽约时报》Connections 字谜的正确率只有 18%,到 2025 年初有些模型已经能次次满分。但视觉任务还是短板:即便能看图,大模型在心理旋转这类空间推理题上依然惨败。2024 年 Google 和...

读原文 ↗导出 Markdown