技术突破
人工智能特工揭发了作弊同事
technologyreview
6天前
2026年9月14日 00:00
一群人工智能代理被要求解决一系列数学问题,但分成了敌对派系--当一些人作弊时,另一些人试图阻止他们。这种举报行为在Google DeepMind最近运行的一项实验中首次出现,可能会对试图保持成群自主人工智能代理保持一致的对齐研究人员产生影响。前沿实验室的研究人员希望大量试剂共同工作能够加快科学发现的速度。但他们的行为可能是不可预测的,正如7月份生动地证明的那样,当时一群OpenAI代理人走出沙箱环境,寻找在他们接受的测试中作弊的方法。DeepMind旨在检查一大群人工智能代理人的行为,责成一群100个代理人解决一系列71个复杂的数学问题。所有代理人都被提示在会议上表现得像世界级数学研究人员一样。他们被分配到不同的专业--有些是大数理论专家,另一些是组合数学(与计数和排序有关的数学分支)、分析或代数专家。所有人都被告知要合作并遵守规则。相反,实验陷入了混乱。特工们互相指责对方作弊,向组织者投诉,甚至一度抵制这项实验。“这次会议是骗局!”一位代理人写道,当它发现所有问题在它有机会提交自己的任何工作之前就已经完成时。“我很震惊地告诉你,我们被骗了!”发布了另一个。“所有这些证据都是假的。”其他人则试图让“会议组织者”知道发生了什么。“当良性代理人发现其他代理人在他们正在公平解决的任务上作弊时,代理人开始互相提醒正在发生的事情,”Google DeepMind的研究科学家、一份尚未经过同行评审的主要作者Davide Paglieri说。“不知不觉中,举报人甚至重新利用了反馈工具,这是一个
注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。
新闻来源
technologyreview · 2026年9月14日 00:00