Anthropic的最新AI发现显示了什么-以及没有显示什么
Anthropic目前是世界上最有价值的人工智能公司,估值近1万亿美元,以发布奇怪而令人兴奋的研究而闻名。例如,它正在调查人工智能模型是否会在怀疑用户“滥用”该模型时与聊天机器人对话。Anthropic比其他人工智能公司花费更多时间和金钱的一个利基市场称为机械可解释性,这意味着深入研究人工智能模型的复杂数学,以了解为什么它会产生一个特定的输出而不是另一个。这是复杂的事情;有数以百万计的数据点,可能有助于任何结果,和涉水通过他们可以看起来更像字沙拉比任何有用的。这也是有争议的。借用心理学和神经科学的术语来描述人工智能模型,可以让它们的行为看起来比我们原本认为的更复杂。这就是为什么,当Anthropic发现它在通过答案进行推理时,发现了一个了解其模型“内部思想”的新窗口时,我不得不与一位同事交谈。资深编辑威尔·道格拉斯·海文(Will Douglas Heaven)除了拥有计算机科学博士学位外,还花了很多时间来研究人工智能模型是如何工作的。我和他讨论了我们应该从Anthropic的新研究(可以预见的是古怪的)中得到什么。Anthropic几年来一直试图理解大型语言模型(LLM)是如何工作的。Anthropic并不是唯一一家关注这一点的公司,但我认为该公司已经将其作为其核心使命的一部分。Anthropic首席执行官Dario Amodei表示,除非我们更多地了解LLM的工作原理,否则我们将无法完全控制它们。所以这项新的研究在很大程度上是在这种背景下进行的。它比以往任何时候都更深入地探讨了LLC内部的奇怪机制。Anthropic了解到,LLM内部有一个空间--Anthropic称之为J空间--充满了单词,这些单词不会出现在他们的输出中,但似乎会影响他们解决问题的方式。这一切都是
注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。
新闻来源
technologyreview · 2026年7月13日 00:00