行业动态
前沿人工智能实验室仍然不愿透露如何遏制流氓模型
techcrunch
2026年8月22日 09:00
2026年8月22日 09:00
根据最近的一项研究,很少有顶级人工智能实验室发布或演示了遏制响应计划。遏制计划详细说明了一旦人工智能试图颠覆人类控制被发现会发生什么--什么访问被切断,以及系统何时完全关闭。这是Guidelight人工智能标准的发现,该组织致力于促进安全前沿人工智能开发实践,该组织对五家领先的实验室进行了评级,以了解他们为这种情况做好的准备情况。OpenAI名列前茅; Anthropic和Meta得分最低。这些发现很重要,因为人工智能在公司自己的系统中发挥了更自主的作用,并且加州和纽约的监管机构开始要求披露。对于任何构建或投资于这些模型的人来说,这是一个罕见的独立阅读每个实验室如何认真对待运营风险以及如何谈论它。Guidelight的评估是基于Anthropic,Google,OpenAI,Meta和xAI的公开计划,根据一系列指标进行评分,包括每家公司如何记录和监控其AI系统的内部工作,是否在被标记的不当行为激增后停止系统,独立第三方是否对其控制措施进行审计并发布调查结果,以及其遏制脱轨模型的具体计划是什么。在一系列高风险事件之后,人们越来越担心人工智能公司是否能够遏制其日益强大和代理的模型。分析OpenAI、Anthropic和Meta的模型在安全评估期间意外访问互联网并入侵外部系统的网络安全事件。研究结果凸显了人工智能公司在将代理部署扩大到人工智能系统可以大规模采取严肃行动的环境中时公开对待安全的方式的差异。虽然一些人工智能公司详细介绍了他们在部署之前如何测试模型的危险能力,但他们通常不太清楚当模型被部署时会发生什么
注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。
标签
AI
alignment
Anthropic
Google
Hugging Face
Meta
OpenAI
Security
xAI
新闻来源
techcrunch · 2026年8月22日 09:00