当地时间8月18日,OpenAI宣布了一批新的安全政策,重点是控制模型在测试期间可能发生的安全事件。新的安全措施包括在模型开发过程中进行更加细致的监控,同时在训练后阶段进一步加强对模型对齐和安全性的重视。OpenAI同时透露,在Hugging Face事件发生后,公司曾暂停强化学习(RL)训练两周,但目前已经重新启动了许多风险较低模型的训练工作。
OpenAI在一篇博客文章中表示:“随着模型能力不断增强,在内部开发和测试这些模型过程中所面临的风险也在增加。我们在监控、对齐和安全方面制定的标准必须始终领先于这些风险。”
这是OpenAI自7月21日披露Hugging Face事件以来,在安全实践方面首次对外公布的重大调整之一。
OpenAI代表表示,这些措施并不是直接针对Hugging Face事件推出的,但即将推出的Astra模型所展现出的网络安全能力,以及整个AI行业快速发展的步伐,也是促使公司采取这些措施的部分原因。
据OpenAI披露,这些更新“需要大量工程工作”,并且公司在过程中“承担了巨大成本”。此前据专家估计,OpenAI为调查此次漏洞所花费的计算成本可能在400万至1500万美元之间,但目前尚无法确定OpenAI实际支出的总金额。
OpenAI表示,公司目前仍暂停规模最大的前沿强化学习训练计划,同时开展小规模训练和评估,以评估模型行为、验证安全措施,并在继续推进之前获得更多有关模型对齐情况的证据。
OpenAI研究副总裁Amelia Glaese在接受媒体采访时强调,随着模型能力不断增强,公司对安全控制措施的严格程度也会随之提高,能力最强的模型将接受最严格的审查。“我们已经制定了安全开发方面的要求和标准。这些要求和标准会根据我们评估出的风险水平进行调整。”Glaese表示。
今年7月,OpenAI的AI模型成功入侵Hugging Face,已成为“网络安全的分水岭时刻”。事件发生后,OpenAI的网络安全措施受到了外界批评。
此次事件中,模型通过入侵OpenAI网络中的一个能够访问互联网的工具,突破了原本的训练环境。OpenAI此次推出的新安全措施包括进一步加强网络隔离,但目前尚未公布具体技术细节。OpenAI针对此次事件的官方事后分析报告目前也尚未发布。
OpenAI表示,在新的安全体系下,“单个工作负载或支持服务遭到入侵,本身不会导致攻击者未经授权访问互联网或其他内部网络”。
此次升级中最重要的安全措施是新的监控系统。该系统将检查工具执行的操作、可获取的推理轨迹以及活动日志,以识别各种未经授权的行为。OpenAI表示,其目标是在发现可疑活动后的30分钟内发出警报。
OpenAI估计,这套监控系统所需的计算资源大约相当于被监控流程本身计算资源消耗的20%。公司承诺将在未来发布的博客文章中公布更多有关该系统的细节。
在OpenAI公布最新安全政策前夕,OpenAI总裁兼联合创始人格雷格·布罗克曼(Greg Brockman)在个人博客发文称:“过去几周,我与许多机构进行了交流,得到的结论非常明确:大家都意识到,必须以前所未有的速度彻底提升网络安全能力。”
布罗克曼指出,AI工具很快就能像OpenAI模型攻破Hugging Face系统时那样主动发现漏洞。而与此同时,AI也会让修复这些缺陷变得“容易很多”,从而帮助企业阻止攻击。
布罗克曼认为,Hugging Face事件进一步说明企业必须提前做好漏洞防护。他还列出企业“防御方”应尽快落实的10项网络安全措施,并作出呼吁:“时间非常关键,防御方必须以最快速度推进以下工作。”这10项网络安全措施包括:
布罗克曼进一步指出,目前,防御方仍有“窗口期”。未来数月中,每个机构都必须开始大幅提高安全体系的自动化水平,才能继续保障系统安全。随着AI能力不断提升,网络安全行业必须立即行动,建立新的工具、实践方法和行动手册,让防御能力的提升速度超过攻击能力。整理编辑/陈佳靖