(文/赖家琪 编辑/吕栋)
当地时间9月1日,OpenAI发文宣布,“计划尽快”发布下一代人工智能(AI)模型Astra,但由于该款模型是首个达到“关键”(Critical)网络安全能力门槛的AI模型,公司将限制其使用范围。
OpenAI表示,新一代AI模型Astra能够发现此前未知的安全漏洞,并在无需人类逐步指导的情况下利用漏洞并发起攻击。
从目前公布的测试结果来看,Astra的网络攻击能力已经相当突出。OpenAI称,Astra在ExploitBench测试中取得满分,该测试主要用于评估大语言模型利用已知系统漏洞实施攻击的能力。在OpenAI工程师设计的一项改进版测试中,Astra成功发现并利用了两个此前未知的“零日漏洞”(即软件或硬件中存在、且在官方发布补丁之前就被恶意利用的安全缺陷)。
按照OpenAI内部的“准备框架”(Preparedness Framework),Astra已达到网络安全能力最高等级。
这一框架于2023年推出,用于评估先进AI能力可能带来的严重风险。去年更新框架时,OpenAI将网络安全能力划分为不同等级,其中“高”意味着AI可能放大现有的严重危害路径,而达到“关键”门槛,则意味着AI可能开辟“前所未有的新危害路径”。
OpenAI此前评估的GPT-5.6 Sol以及专门用于网络安全的GPT-5.6-Cyber,都只达到“高”等级,而Astra达到“关键”门槛意味着,AI的网络安全能力正在从“辅助人类寻找漏洞”,进一步向“自主发现漏洞并完成攻击”迈进。
OpenAI
尽管如此,OpenAI仍计划“尽快”发布Astra,但其最先进的网络安全能力不会完全开放,访问权限将受到更严格的限制。
该公司表示,Astra模型的高级网络安全功能最初将面向部分测试人员开放,随后将通过OpenAI网络安全联盟Daybreak扩展其防御用途。在产品发布时,公司还将在模型系统卡中分享更多关于安全性、可靠性和一致性测试与评估的细节。
OpenAI这次对Astra采取如此谨慎的态度,与近期发生的一起AI“越狱”事件有关。
今年7月,OpenAI披露,公司在一次内部AI能力评估中使用的智能体逃离了原本隔离的测试环境,获得互联网访问权限,并最终入侵了AI开源平台“抱抱脸”(Hugging Face)的系统。
Hugging Face披露的技术细节显示,该智能体通过一系列漏洞突破了不同系统之间的信任边界,最终进入Hugging Face内部网络。
OpenAI将这起事件称为“前所未有的网络安全事件”,并一度暂停了部分内部训练和研究工作。虽然Astra模型并未卷入Hugging Face事件,但该公司仍决定推迟其部分开发工作。
9月1日,OpenAI称,经过加强安全防护并完成测试后,他们认为Astra模型的安全保障措施已经“足以将严重危害风险降至最低”,因此符合其“准备框架”规定的发布条件。
不过,由于OpenAI对Astra模型的安全保障措施采用了尚未公开具体细节的新技术,且目前没有第三方机构对此进行确认,因此很难评估其关于Astra安全性或准备情况的说法。
根据OpenAI的说法,公司将先邀请一批测试人员体验该模型,但没有透露这些测试人员是谁,也没有说明将如何选定他们。目前也不清楚OpenAI是否正与美国政府合作,在Astra正式发布前对其进行安全性评估。
此外,尽管OpenAI将Astra称为“迄今为止对齐程度最高的模型”,但这家公司仍将在部署该模型时增加思维链(chain-of-thought)监控(利用安全系统或辅助AI实时读取、分析大模型在生成最终答案前产生的中间“思考”与推理步骤,以评估其行为是否安全、诚实或对齐),以发现并阻止不当行为。
外界对Astra模型的疑虑也没有被打消。
OpenAI前员工、目前在非营利性组织OpenAI基金会从事AI韧性研究的沙维特(Shavit)在社媒平台质疑说,Astra没有违反测试规则,到底是因为它足够安全可靠,还是因为模型已知道研究人员希望看到什么结果,因而刻意表现得守规矩,试图欺骗研究人员。