行业动态
通往阿斯特拉的道路:关键能力和边境保障措施
openai
2026年9月1日 00:00
2026年9月1日 00:00
由于我们 早期评估 Astra可能达到网络安全能力的关键水平,我们已经收集了更多的证据,并进行了额外的评估,以评估该模型的能力。我们现在相信Astra符合我们的关键网络安全能力门槛 防范框架 这意味着,通过正确的工具和访问权限,它可以发现以前未知的安全缺陷,并开发出在许多保护良好的系统中利用这些缺陷的方法,而无需有人指导每一步。这是我们在该级别指定的第一个型号,在开发期间和发布之前需要更强有力的保障措施。 在过去的几周里,我们推迟了Astra的部分开发和发布,同时加强和测试了针对网络滥用和未经授权的模型行为的保护。基于这项工作,我们相信阿斯特拉的保障措施足以最大限度地降低根据我们的准备框架发布的严重伤害风险。 虽然阿斯特拉没有参与 拥抱脸事件 ,我们已将我们的 learnings (在新窗口中打开) 我们的安全措施根据回顾性测试,我们相信我们当时的生产保障措施可以阻止拥抱脸事件。此后,我们为Astra实施了更强的保护措施,包括训练模型更可靠地拒绝有害的网络请求并遵守安全限制,防止滥用的额外保护,以及可以阻止潜在未经授权活动的监控。 我们计划很快推出Astra,但对其最先进的网络安全功能的访问将更加有限。高级网络安全工作最初将提供给一组测试人员,随后可以通过Daybreak Blue访问以扩大防御用途。 我们将在发布时在该型号的系统卡中分享有关安全性、安保和对齐测试和评估的更多详细信息。在发布之前,我们希望提供我们所做的一些工作的更新
注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。
新闻来源
openai · 2026年9月1日 00:00