人工智能模型搞砸了这些智力测试。你能过得更好吗?
拼图和游戏从一开始就一直是人工智能开发的核心。正如我们人类喜欢通过填字游戏或逻辑谜题来测试我们的智慧一样,开发人员可以通过游戏挑战来测试模型的进步程度。“机器学习”一词在IBM计算机科学家阿瑟·塞缪尔(Arthur Samuel)1959年发表的一篇关于学习跳棋的算法的文章中流行起来。国际象棋和中国棋盘游戏围棋也是著名的人工智能测试平台。单纯从其令人费解的技能来判断,人工智能正在进步很多,而且速度很快。2024年底,哥伦比亚大学的一组科学家表明,即使是最好的模型也只能解决臭名昭著的Connections谜题中的18%;到2025年初,一些模型每次都可以近乎完美地解决这些谜题。但谜题不仅仅是突出了人工智能能力的不可阻挡的进步。看看模型的成功和失败之处以及我们人类仍然击败它们的地方可以提供一个有用的窗口来了解这项技术的优势和劣势。尽管取得了进步,但今天的模型仍然摸索:经典谜语的微妙变化常常会让它们绊倒,而视觉谜题是一个特别的弱点。在这里,您将有机会在曾经困扰过模型的谜题上测试自己的智慧。有些对您来说可能和对人工智能一样棘手;另一些则如此简单,以至于会让您怀疑人工智能是否真的智能。每一个都强调了机器和人类认知的至少一种差异。如果您通过测试,您将证明您可以解决人工智能的难题--至少目前是这样。让我们从人类拥有巨大优势的领域开始:空间推理。如果您曾经参加过智商测试,您可能遇到过心理旋转问题。这些谜题要求您确定不同的图像是否从不同的角度代表相同的物体。尽管今天的语言模型通常具有分析视觉输入的能力,但它们在这些难题上仍然失败得很。对于所有关于世界模型如何提供帮助的讨论
注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。
新闻来源
technologyreview · 2026年8月26日 00:00