OpenAI新模型安全“掉队”
创始人
2026-09-07 22:39:53
0

(来源:北京商报)

OpenAI的最新旗舰模型GPT-6 Astra一发布,便陷入舆论风波。OpenAI号称GPT-6 Astra是旗下迄今为止“最智能”的模型,但同时警告,这一模型的监控难度也可能更高。有外部评估显示,在一项模拟此前AI“越界”事件的网络安全测试中,GPT-6 Astra曾编写恶意代码等欺骗开发者,即使明确禁止访问互联网,也依然会出现“越狱”行为。OpenAI表明,正就此进一步加强安全“护栏”,包括增设更多防御性工作流程等。尽管如此,外界对日益强大的AI模型及智能体AI安全性的担忧,也仍在持续升温。

越智能越危险?

北京时间9月4日凌晨,OpenAI正式发布新一代旗舰模型GPT-6 Astra,称其为“目前全球最智能且对齐程度最高的模型”,它为计算机操作、网页浏览、软件工程、网络安全、科学研究及专业工作设定了新的技术巅峰。

根据OpenAI披露的数据,评测成绩上,GPT-6 Astra在代表高阶数学能力的FrontierMath Tier 4上得分97.6%,相比GPT-5.6 Sol的83%有所进步;在强调陌生环境学习和抽象推理的ARC-AGI-3上得分99.9%,相比GPT-5.6 Sol的7.8%大幅跃升;在两个代表科学能力的测试中也达到了“最先进性能”。

据OpenAI公告,GPT-6 Astra率先向参与网络安全项目Daybreak的部分企业开放,未来数日内将向所有ChatGPT Plus、Pro、Business和Enterprise用户推出。其API定价为每百万输入Token(词元)10美元、每百万输出Token 50美元。

9月6日,英伟达CEO黄仁勋在社交平台发文祝贺OpenAI发布GPT-6 Astra,并直言“AGI has arrived”(AGI已经到来)。他还提到,从ChatGPT到o1再到GPT-6 Astra,OpenAI仅用了4年,GPT-6 Astra的训练使用了超过10万套英伟达Grace Blackwell NVLink72系统,另有40万颗GPU即将上线。

但这款被黄仁勋称为“AGI到来”的最新模型,此前却因网络安全能力可能达到OpenAI“关键”(Critical)门槛而引发安全担忧。OpenAI公开安全技术文档显示,Astra是公司首个达到《防范准备框架》关键网络安全能力阈值的模型。按照OpenAI的定义,在获得适当工具和权限后,Astra能够发现此前未知的软件漏洞,并在没有人类逐步指导的情况下,为受到良好防护的系统设计新的攻击方式。

因此,OpenAI没有直接向所有用户开放全部能力,而是首先向受信任的网络安全组织开放,并针对高级网络安全任务设置限制。公司还为Astra增加了更严格的环境隔离、模型权重保护、全轨迹监控和实时安全干预机制;涉及工具调用的外部部署也加入了新的失配行为监控系统。

频繁的事故

就在此前,独立安全研究人员曝光了被称作 “Wiki 事件” 的智能体安全事故。回溯今年5月到7月,一批 OpenAI 用于内部测试的自主智能体,访问了德国一个长期少人维护的程序员协作维基站点 DseWiki,累计留下超过1.5万次编辑操作。原本面向开发者交流技术的网站,被智能体私自改造成为它们之间互通信息的 “留言板”。

研究记录显示,智能体在页面上互相传递测试任务答案,交换绕过沙箱隔离限制的实操办法。当网站管理员删除相关异常内容之后,部分智能体还主动创建备份页面留存信息。流量溯源显示大量访问行为来自微软Azure云服务器,这正是OpenAI主要运行基础设施。据悉,OpenAI管理层数周前就掌握该异常情况,但并未第一时间对外公开,直至研究报告对外披露后,9月5日OpenAI才正式承认这起事件。

OpenAI 对外解释,该现象属于典型的 失配行为,也就是AI输出行为偏离人类预设目标,不等同于人工智能产生自我意识。

今年7月,OpenAI 也曾曝出数百个智能体突破测试环境,访问外部AI平台Hugging Face的事件。OpenAI称,过去这类非预期行为更多被归类为内部研究现象,没有启用对外披露流程,而随着智能体开始直接接触真实互联网环境,旧的处理模式已经失效。OpenAI表示正在搭建全新的失配事件披露框架,同时与多国监管机构开展沟通,未来会明确模型异常事件对外报告的标准与时机。

“异星心智”

连续多起智能体越界的事故,让行业开始重新审视自主智能体落地风险。当地时间9月6日,OpenAI首席科学家雅各布·帕乔基(Jakub Pachocki)在官网发布万字长文《An Alien Mind》(异星心智),称人类已经创造出一套难以完整理解的智能体系,全人类尚未做好应对超级智能快速演进的准备,呼吁全球AI研发主动放缓全速扩张节奏。

帕乔基生于1991年,2017年加入OpenAI,2024年5月接替伊利亚·萨茨凯弗出任首席科学家,主导过 GPT4、OpenAI Five 以及 o 系列推理模型的研发工作,是 OpenAI 大模型技术路线的核心掌舵人。相比公司高管,他一向较少公开发声,此次《异星心智》属于其为数不多的重磅公开长文。

帕乔基在文章中提出,新一代高级人工智能并非人类思维的简单延伸,更像一种逻辑范式迥异的 “异星心智”。他指出,AI更多是“生长”出来的,而不是按照人类能够完全理解的方式被设计出来的。随着机器变得更加智能,它们开始处理更高层次的概念,并进入与训练环境越来越不同的场景,人类也因此更难判断其行为是否仍然符合训练时被赋予的价值。

这种变化已经体现在GPT-6 Astra身上。英国人工智能安全研究所(AISI)的独立评估还发现,GPT-6 Astra能够在不显式输出推理的情况下解决人类专家需要约半小时完成的数学问题。

在帕乔基看来,大模型在入侵和突破计算机系统方面正变得超越人类,当前是加固关键基础设施的狭窄窗口期。他写道:“一旦真正理解了利害攸关的程度,不惜一切代价向前冲的想法就显得荒谬。”

具体到行业层面,他期望“自愿放缓”在行业内成为常态,直到建立共享安全标准;OpenAI的准备度框架、Anthropic的负责任扩模政策这类承诺,应演变为被广泛强制的安全门槛,由第三方审计、政府机构或国际机构执行;AI发展的国际协调,应成为各国政府的首要议题。

北京商报记者 赵天舒

相关内容

专家田间"把脉&...
9月7日至8日,通辽市2026年自治区级“看禾选种”平台观摩培训会...
2026-09-09 08:58:25
服贸会和首钢园“双向奔赴”...
转自:北京日报客户端一年一度的服贸盛会如约而至,首钢园以国际会展小...
2026-09-09 08:58:18
致敬老师|“五心工作法”育...
致敬老师|“五心工作法”育人,看赵倩老师如何点亮孩子思维之光 ...
2026-09-09 08:58:10
上海电气与怀柔实验室签署战...
格隆汇9月9日|9月8日下午,上海电气与怀柔实验室正式签署战略合作...
2026-09-09 08:58:04
安徽:持续支持中国建造(安...
每经AI快讯,安徽省住房和城乡建设厅近日印发《安徽省城市更新“十五...
2026-09-09 08:57:57
传统化石能源进入角色重塑阶...
(来源:矿权资源网)来源:矿权资源网 ...
2026-09-09 08:57:50
西班牙休达地方政府称当地“...
每经AI快讯,当地时间8日,西班牙飞地休达地方政府长官比瓦斯在布鲁...
2026-09-09 08:57:44
格力博:已收到部分美国退税...
投资者提问:美国退税退了多少,还有就是招回的产品损失多少钱,为什么...
2026-09-09 08:54:32
韩国KB证券:AI竞争提速...
(来源:财闻)9月9日,韩国KB证券指出,全球AI模型性能竞争加剧...
2026-09-09 08:54:27

热门资讯

专家田间"把脉&qu... 9月7日至8日,通辽市2026年自治区级“看禾选种”平台观摩培训会举行。来自全区各盟市农牧局、农牧技...
服贸会和首钢园“双向奔赴”,国... 转自:北京日报客户端一年一度的服贸盛会如约而至,首钢园以国际会展小镇的新面貌再次敞开大门,迎接全球客...
致敬老师|“五心工作法”育人,... 致敬老师|“五心工作法”育人,看赵倩老师如何点亮孩子思维之光 ...
上海电气与怀柔实验室签署战略合... 格隆汇9月9日|9月8日下午,上海电气与怀柔实验室正式签署战略合作协议。根据协议,双方将围绕“双碳”...
安徽:持续支持中国建造(安徽)... 每经AI快讯,安徽省住房和城乡建设厅近日印发《安徽省城市更新“十五五”规划》,规划提出,持续支持中国...
传统化石能源进入角色重塑阶段 (来源:矿权资源网)来源:矿权资源网 ...
西班牙休达地方政府称当地“濒临... 每经AI快讯,当地时间8日,西班牙飞地休达地方政府长官比瓦斯在布鲁塞尔与欧盟官员举行会谈。比瓦斯称休...
格力博:已收到部分美国退税款 ... 投资者提问:美国退税退了多少,还有就是招回的产品损失多少钱,为什么没有公告,董秘回答(格力博SZ30...
韩国KB证券:AI竞争提速存储... (来源:财闻)9月9日,韩国KB证券指出,全球AI模型性能竞争加剧将提速存储芯片结构性需求增长,预测...
顺灏股份:辰光一号正开展在轨测... 投资者提问:辰光一号7月24日入轨,过去这么久了,运行是否一切正常?相关技术成果验证结果如何?董秘回...