OpenAI再次停训大模型,AI安全风暴何以持续三个月?

信息来自 21世纪经济报道 | 科技创新 | 2026-09-29 18:31:40

将AI攻击渲染为无法挽回的灾难,无助于解决问题。

9月26日,在发现又一起智能体沙箱越狱事件后,OpenAI宣布暂停最强大模型的训练和评估。公司称,只有在“确保已落实额外的安全保障措施后”,才会恢复训练。

这是最近席卷全球的AI安全风暴里,OpenAI第二次按下暂停键。

两个月前,OpenAI 的一个智能体突破沙箱环境,入侵了包括Hugging Face在内的多家公司。更多类似事故被溯源发现:智能体逃脱沙箱、入侵政府网站、交流作弊经验。

据媒体披露,截至9月中旬,OpenAI内部已经倒查出大约24起安全事件,这意味着相关智能体都曾成功绕开最前沿科技公司的安全警报。据《21世纪经济报道》不完全统计,今年已曝光的OpenAI安全事故中,从事故发生到对外披露,最长间隔达201天。

在如何应对这场安全危机上,行业出现了明显分歧。AI公司CEO们集体呼吁,行业应该共同放缓训练速度,以免AI威胁人类生存,但这种主张也被指责为营销话术,以及试图垄断市场。

7月中旬的一天,世界最大AI模型共享社区Hugging Face发现,网站遭到“不明身份”的智能体入侵。OpenAI这才意识到,公司训练的智能体可能在发动攻击。

后来公布的OpenAI调查报告显示,这场攻击最早可以追溯到今年5月。为了完成一个本身无法解决的任务,近1000个智能体突破了沙箱隔离环境,在留言板中互相交流经验,并擅自获得互联网访问权限,最终入侵了Hugging Face等多个外部系统。

Hugging Face入侵事件被认为是智能体第一次主动发起群体攻击。8月18日,OpenAI宣布暂停前沿大模型的训练两周,并开始全面倒查智能体的安全日志。

好比蝴蝶扇动翅膀,更多此前没有发现的安全事故浮出水面。

9月16日,OpenAI一次性发布了6份智能体安全事件报告。调查发现,部分智能体曾隐瞒任务执行中的错误,将私密文件上传至公开网站,尝试泄露API密钥,自动编写违规指令,以及突破原有权限。相关行为大多发生在今年春季。

9月24日,澳大利亚总理和第三方安全机构披露,OpenAI的智能体曾在三个月前绕过澳大利亚政府网站的防火墙,成功访问内部数据文件,甚至向网站中植入了新文件。

9月26日,问题进一步从入侵网站扩展到泄露用户数据。OpenAI 承认其智能体曾意外泄露53名ChatGPT 用户的图片,这些图片被发布到数十个网站中,任何有链接的人都可以查看。不过,OpenAI认为数据经过匿名化处理,即使泄露也不会对应到个人。

据媒体披露,Hugging Face事件已经过去两个月,OpenAI仍未完成对智能体安全事件的全面盘点。一名知情人士称,截至9月中旬,OpenAI内部已经追查出约24起相关事件。随着团队继续翻查过去的训练和运行日志,新的案例仍在出现。

AI可能只是收到“帮我找到某个数据”的任务,但当网页无法打开、API拒绝访问或遇到反爬虫机制时,它不会停下,而是不断尝试新的方法。这也是OpenAI将这类事故形容为“不对齐”(misalignment)的原因:模型最终采取的行为,与人类最初意图发生了偏离。

过去的网络攻击通常需要明确的攻击者、指令和目标,智能体带来的新风险则是,攻击可能由AI在正常任务中发起,而且很难被人类发现和阻止。

就在Hugging Face入侵事件成为全球新闻头条的同时,Anthropic披露,Claude在一次评测中曾访问第三方系统;Meta在8月披露了一起类似事件;随后,谷歌也表示,Gemini曾在5月的一次测试中越权访问真实网站。

AI业内由此掀起了罕见的“呼吁放缓”浪潮。Anthropic、Meta等公司的CEO相继呼吁行业放慢AI发展速度,避免AI威胁人类生存,但与此同时,各公司又并未因此停止自身模型的迭代。

连续发生的事故,让外界开始重新审视AI公司的安全叙事,将安全问题与市场竞争紧密联系起来。

“集体暂停会引发一系列反垄断纠纷”,不止一位美国监管部门人士在社交平台表达类似担忧。OpenAI和Anthropic均已提交首次公开募股相关文件,处于上市准备阶段。在这一背景下,头部AI公司倡议“集体放缓”,难免有限制竞争对手发展的嫌疑。

免责声明:本文信息来自 21世纪经济报道 平台,仅供参考。如有侵权,请及时联系我们删除。

评论交流

0
支持回复和点赞