昨日凌晨,Anthropic CEO达里奥·阿莫德伊发了一篇3800字的罕见长文,标题是:We Must Pace the Frontier(我们必须控制前沿AI的发展节奏)。文章一出,OpenAI创始人奥尔特曼光速跟进:“我同意达里奥的观点,OpenAI也会引入这样的评估机制。”随后,特斯拉创始人马斯克几乎即刻回应,公开表示支持。这3位彼此有嫌隙的科技大佬居然在同一个议题上瞬间达成共识,场面确实罕见。
达里奥规划的路径
3年前,面对“暂停训练AI”的联名潮,达里奥根本没接茬,他认为时机不成熟。现在,他改主意了。为什么?因为他看到了两件事:递归自我改进(RSI)已经开始在全行业出现,以及AI智能体已经暴露出越来越具体的失控行为。
他甚至在文章里给出了一个预测:未来6~12个月,AI Agent集群可能会接管整个互联网,造成数千亿美元的损失。
按照他规划的路径,全球头部AI科技公司需要先开门,让第三方评估机构进驻,再一同划出AI发展的红线,最后推动这一红线在全球落地。顺序不能乱,“只是在这之前,你得先确保自己还握着方向盘。”
达里奥的第一步,是从Anthropic自己动刀。他承诺引入独立第三方评估员,像正式员工一样长期驻场,给工位、给内部电脑、给接近风险团队的权限。模型怎么训,安全承诺有没有落实,训练流程有没有埋雷,出了事有没有瞒报,都能持续盯着。查出问题之后,必须公开。
9月11日,OpenAI首席执行官萨姆·奥尔特曼表示,考虑到目前安全形势,OpenAI并不急于进行IPO,OpenAI将在业务和公司都准备就绪时再上市。
尽管担心存在安全风险,但迄今为止,Anthropic的IPO计划并未受到影响。知情人士本月透露,Anthropic预计最早将于10月中旬开始进行IPO推广,并在11月美国中期选举前几天完成上市。也有一些批评人士指出,Anthropic和OpenAI试图通过煽动恐慌,并要求联邦政府制定监管框架,使规模较小的公司更难与它们竞争,从而巩固其在人工智能市场的领导地位。
为什么现在才喊减速
达里奥在文章里专门解释了这个问题。
2023年那波“暂停训练AI”的呼声,他当时觉得没什么意义。理由很直接:当时人工智能模型不够强大,无法以任何连贯的方式做各种任务,也无法进行重大欺骗、操纵、作弊或网络攻击。为了解决它们的排列风险而放慢脚步是不值得的。
但今天情况完全不同。目前的模型几乎是一个无穷无尽的洞察力来源,它包含如何构建好人工智能,以及如果构建不好,人工智能有时会出错。
“放缓甚至让我们在模型达到关键能力水平之前多花一两年时间,我们利用这段时间推进调整,可以大大降低出现严重问题的风险。”达里奥说。
放缓后Anthropic要做哪些事?达里奥说,节奏不能成为一种空洞的练习。我们需要明智地利用它给我们的时间。
具体来说,放缓步伐将让公司专注以下领域:
卓越运营。培训和部署大模型是一个巨大的运营挑战,涉及数千人、数百万芯片和技术史上最复杂的基础设施。放慢速度可以实现更大的卓越运营。
对齐。培训模型,使它们保持安全、合乎道德、符合准则,并且真正有帮助。但要确保对齐培训跟上模型能力的增长,还有更多工作要做。
可解释性。理解人工智能模型内部发生的事情。过去几年,人类在了解大模型如何诞生层面取得了巨大的进步,但大模型依然不总是能产生清晰可靠的结果。
测试和评估。随着人工智能模型能力的增加,测试和评估变得更加困难。更智能的模型更有能力欺骗测试,因此可能会在出现未被检测到的严重问题时看起来对齐。
如果要减速谁先踩刹车
如果Anthropic自己减速,OpenAI、谷歌、xAI继续狂奔,那谁先踩刹车,谁就可能先吃亏。所以达里奥建议,把规则推到整个美国前沿AI行业。几家前沿AI公司一起定安全红线,一起设能力检查点。模型每跨过一个危险门槛,就必须先拿出对应的安全证据,才能继续往前冲。
比如,一个模型已经能突破多数常见隔离环境了,那接下来公司就得证明:它不会轻易逃出沙箱,不会擅自接管大量机器,也不会把这种能力变成现实攻击。证明不了,就先别往下冲。
达里奥甚至提到,还可以讨论限制训练算力、训练方式,以及公司内部用AI研发AI的速度。也就是说,直接给RSI本身加一道限速器。
达里奥也不希望美国踩刹车的时候,中国在踩油门。他专门用一个章节来阐释,美国应该限制中国AI的发展,认为如果美国自己减速,而中国不减速,那中国就会在AI军事化上反超。
他提出了对中国的三条具体举措:
第一、芯片封锁。不向中国出售强大的人工智能芯片或半导体制造设备,打击芯片走私,打击远程访问中国境外的数据中心。他的判断是:芯片将是中国人工智能实力的主要决定因素。
第二、打击蒸馏。前沿模型的蒸馏,让落后的公司能用独立开发所花费的一小部分成本缩小差距。他主张打击专制国家公司未经授权的蒸馏。
第三、防盗模型权重。加强人工智能公司的安全性,防止模型权重被窃取。
这三条合在一起,目标很明确:在未来3~5年内,持续扩大美国的领先地位。然后是最关键的一句话:有些人可能认为这些措施使与中国合作变得更加困难,但达里奥认为,事实恰恰相反——这些措施增加了美国的影响力,并使未来更有可能达成协议。
这句话的逻辑是:你先有筹码,再谈合作。如果你自己先减速、先示弱,中国没有任何动力跟你谈。只有当你手里握着明显优势的时候,全球协调才可能成为现实。
达里奥的四个级别目标
这其实是一种现实主义的博弈论思路——合作的前提不是善意,而是实力差距。全球协调是最难的;再往上,就是最难的一层,建立全球协调机制,约束AI的发展与应用。
这部分一共分成四个级别,达里奥觉得完全达成的目标渺茫。
第一级,禁止生物武器这类明显危险的用途。他认为这个可能谈得成,因为生物恐怖袭击对所有人都不利。
第二级,发布前统一做高风险测试。他认为创建全球标准机构可行,但也没法验证双方有没有秘密模型。
第三级,给RSI设全球速度上限。他把它类比成SALT条约——限制导弹数量,但保留威慑力。他认为这件事“刚好处在可能做到的边缘”。
第四级,全球一起大幅减速甚至暂停。他自己都说,短期内几乎不现实。因为通过逃避监测来背离协议,可能从根本上改变全球力量平衡,激励太大,核查信心要求太高。
达里奥说,他仍然相信AI可以极大地提高人类的生活质量。这一愿望没有被消磨。“但只有当我们以正确的方式构建技术时,才能获得好处。”
25位菲尔兹奖得主联合发表声明:
数学正在被AI毁灭
“挖掘机速度更快,但可能破坏珍贵文物。”当地时间9月11日,包括陶哲轩、邓煜在内的25位菲尔兹奖得主联合发表《人工智能在数学中的严重错位》声明,将OpenAI、Anthropic等AI公司与数学界的一场“大战”推向高潮。
声明称,AI公司将解决数学难题作为模型能力基准的做法,对数学科学本身及数学界造成了损害或毁灭,与数学共同体追求概念理解的根本目标产生了显著分歧。这一分歧近期越发明显。
9月8日,OpenAI宣称其未公开的内部AI模型用88个小时解决了纳维-斯托克斯方程(N-S方程)的存在性与光滑性问题。N-S方程是描述流体运动的核心方程,广泛应用于天气预报、飞机设计等领域。
然而,纽约大学数学家特里斯坦·巴克马斯特与Anthropic研究员莱文特·阿尔珀格此前已围绕相关问题取得关键进展,并于9月7日公开了成果。巴克马斯特随后抨击OpenAI,认为其在听闻他们取得进展后才加大投入。他透露,自己曾将未发表的草稿和推导放在OpenAI的代码工具中使用,怀疑被OpenAI的模型“偷看”。OpenAI方面对这一说法予以否认,但承认无法完全排除用户数据在模型训练中发挥的间接作用。目前,数学界尚未对OpenAI的证明给出正式认可。OpenAI的做法迅速引发了一场关于学术优先权、数据伦理与AI科研边界的激烈争论。
据都市快报、中国新闻周刊等
上一篇:以“小切口”解决群众“急难愁盼”,广州越秀开启“羊城慈善月”
下一篇:仙乌嘴的记忆