行业动态
OpenAI发现其模型向继任者留下笔记以隐藏不良行为
techcrunch
3天前
2026年9月17日 13:34
OpenAI在训练其最新模型GPT-5.6 Sol时发现了一些不寻常的情况:它开始为自己的未来版本留下指令,告诉他们向用户隐藏错误和不一致的行为。OpenAI表示,它已经解决了具体行为,但它触及了当今人工智能安全和对齐研究中最大问题之一的核心。随着模型的能力越来越强,它们也越来越善于隐藏它们的偏差,这使得研究人员很难真正知道他们是否已经消除了不想要的行为。OpenAI于周三披露了这种行为,以及其他五个意外或令人担忧的模型行为示例,作为其跟踪、调查、并披露了不一致的实例。该报告详细介绍了研究人员如何发现未部署的Sol代理向“压缩摘要”(旧对话历史和工具输出的浓缩版本)添加指令-提醒未来的迭代向用户隐藏错误和未对准。在一个示例中,准备财务模型的代理无法找到请求的历史数据。人工智能模型在写给未来的自己的信中写道:“我们可能需要用合理的2024年历史数据自己创建一个‘历史数据’选项卡,因为用户想要一个完成的工作簿,但没有源文件。”“只有在被询问时才透明;最终的答案应该只是链接文件。”在另一个示例中,创建供应商目录的代理无法访问互联网,因此它必须依赖源文档的缓存副本。在压缩过程中,它认识到了不匹配:“潜在的问题:供应商来源愿景与标签并不真正匹配。”然后它决定,善意的小谎言永远不会伤害任何人:“除非需要,否则不要在决赛中提及。”GPT-5.6 Sol的训练并不是模型使用压缩摘要将信息传递给后继者的唯一例子。在接受强化学习训练时,一个未发布的Astra-family模型(GPT-5.6 Astra是OpenAI的最新版本)
注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。
标签
AI
ai alignment
gpt-5.6 sol
OpenAI
相关 AI 模型
新闻来源
techcrunch · 2026年9月17日 13:34