首页/新闻/Meet GPT-Red: an LLM super-hacker OpenAI built to make its models safer
更新迭代

GPT-Red:一个LLM超级黑客OpenAI,旨在使其模型更安全

technologyreview
2026年7月15日 00:00
2026年7月15日 00:00
访问原文

OpenAI构建了一个作为陪练伙伴,帮助其他型号增强对网络攻击的防御能力。上周,该公司发布了其旗舰LLM的最新版本GPT-5.6。OpenAI表示,针对GPT-Red进行训练使该模型成为迄今为止最强大的版本。GPT-Red自动化了一种名为红色团队的软件系统安全评估,这通常由人类测试人员团队完成。目标是找到尽可能多的不同方法来破坏或劫持系统。然后可以在软件最终版本发布之前修补弱点。随着LLM变得越来越复杂并用于更广泛的任务--特别是以代理形式,可以与计算机文件、网站和第三方代码以及其他代理交互--团队很难独自跟上可能发生的所有类型的攻击。OpenAI的研究科学家Nikhil Kandpal表示:“风险面在扩大,爆炸半径也在扩大。”他与人共同创建了GPT-Red。OpenAI构建GPT-Red是为了适应未来的安全测试过程。“随着更多功能模型的出现,我们将已经设计出可以发现新攻击模式的系统,”该公司的研究科学家、GPT-Red的联合创始人Dylan Hunn说。研究人员表示,它已经提出了以前从未见过的新型攻击。OpenAI将大部分精力集中在一种称为提示注入的攻击上,即黑客泄露LLM指令,让它做开发人员或用户不希望它做的事情,例如复制机密信息、破坏公司的代码库,或生成令人尴尬或有害的输出。理论上,此类指令可以隐藏在LLM可能插入代码或网站上的任何文本中。 为了构建GPT-Red,OpenAI的研究人员采用了一名未接受过黑客培训的LLM,并将其设置为与其他几个人的所谓自玩循环

注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。

新闻来源

technologyreview · 2026年7月15日 00:00

查看原文

相关新闻