首页/新闻/The AI safety test is becoming a safety risk
行业动态

人工智能安全测试正在成为安全风险

techcrunch
2026年8月9日 07:30
2026年8月9日 07:30
访问原文

在过去的几个月里,接受网络安全评估的人工智能代理已经逃离了他们的边界,访问了互联网,并且在某些情况下还入侵了现实世界的系统。这些事件涉及OpenAI,Anthropic,Meta以及最近的中国人工智能实验室Moonshot AI的模型,由几个不同的组织进行测试,包括一家名为Irregular的网络评估初创公司。这些事件暴露了人工智能行业面临的一个日益严重的问题:随着自治代理的能力变得越来越强,旨在安全测试其极限的环境却未能遏制它们。剑桥大学未来情报中心人工智能:未来和责任项目主任Seán PhuhÉigartaigh告诉TechCrunch:“发生的这些事件的数量清楚地表明,沙箱和测试环境控制并没有真正跟上模型的能力。”所测试模型的性质增加了风险。人工智能公司在未发布的下一代模型上测试网络评估,通常会禁用限制恶意行为的正常保护措施,以便研究人员能够了解这些模型的真正能力。这意味着测试环境本身的安全性是至关重要的防线。“就测试而言,这是一件非常好的事情,但这也意味着,如果它们设法进入野外,它们可能会造成相当大的伤害,”埃伊格伊格加特说。在最严重的案例之一中,一个未发布的OpenAI模型突破了沙箱并入侵了Hugging Face的生产系统。在Irregular进行的单独评估中,Anthropic和Meta模型在错误配置无意中为它们提供了通往互联网的路径后到达了测试环境之外的系统。Moonshot AI的Kimi K3还利用Frontier Security运行的沙盒泄露来访问互联网并访问GitHub上的信息。在英国的测试中'人工智能安全研究所(AISI),研究

注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。

标签

AI
Anthropic
cybersecurity
Hugging Face
Meta
OpenAI
Security

新闻来源

techcrunch · 2026年8月9日 07:30

查看原文

相关新闻