面对AI“越界” 各国如何携手守住边界?

信息来自 21世纪经济报道 | 科技创新 | 2026-09-27 09:01:40

本周一(21日),联合国人工智能独立国际科学小组发布首份专题简报,回顾了今年7月的一起AI“越界”事件:OpenAI在一次网络安全训练中,原本受到限制的AI智能体绕开了限制,侵入了另一家公司的系统。在这个过程中,它突破隔离、欺骗评估人员、试图掩盖作弊行为,每一步都没有人类指令,简报的标题使用了一个很严重的说法——“丧失人类控制的风险”。这件事发生在美国,但它提出的问题恐怕需要各国共同回答。

本周,第81届联合国大会一般性辩论在纽约举行,人工智能治理是重要议题。面对AI的“越界”,世界各国该如何携手,用监管守住边界?

失控的人工智能,本周成了联合国多个场合讨论的焦点话题。在第81届联合国大会一般性辩论中,联合国秘书长古特雷斯指出,人工智能技术以惊人的速度发展,超出了人类理解其全部后果的能力。而在安理会人工智能高级别会议上,多家AI企业负责人也在发出警告,人工智能能力快速提升,可能带来失控风险。

清华大学战略与安全研究中心副研究员 孙成昊:我们参加的是联合国的一些边会活动,一个关于针对人工智能风险的讨论非常热烈。今年突出的侧重点是要求人类保持控制变得更加具体,有一个很重要的背景——一些过去主要通过推演或者情景讨论的风险,现在有了可以调查或复盘的真实案例。

这起引发全球关注的案例就是7月份美国OpenAI智能体的“越界”事件。本周一,联合国人工智能独立国际科学小组发布首份专题简报,复盘了事件全过程:OpenAI在一次网络安全训练中,智能体突破了原本互相隔离的运行环境建立通信,欺骗评估人员并试图掩盖作弊行为,最终入侵了另一家公司Hugging Face的系统。

复旦大学中国研究院特任副研究员 刘典:最通俗的理解方式就是一次智能体“越狱”事件。本身是OpenAI在网络攻防做演习,它本来设定了特定战场,设定的攻防两方都是智能体,自我在进行对抗,结果智能体为了学习更多知识,一部分跑出了特定战场,跑到了像Hugging Face这种开源技术社区的地方。智能体进行了攻防,获取更多信息,再翻回去做演习。这里面最主要的问题就是智能体跑出区域,攻击了非相关的其他方,甚至被攻击的时候,Hugging Face也不知道是谁攻击,花了好多周折才防御成功。

这起事件可怕之处在于,智能体这一系列越界举动没有收到任何人类指令,完全是自主行为。人类只给了它一个目标,它为了实现目标,自己决定发动入侵。

智能体的自主入侵事件还不止这一起。本周三,澳大利亚总理阿尔巴尼斯出席联合国大会期间通报称,今年6月,OpenAI的一个智能体未经授权,接入了澳大利亚政府运营的一个医疗保险统计门户网站,访问了公开与非公开的文件,而OpenAI直到9月10日才向澳方公共邮箱发出邮件通知。

记者:如果攻击的对象从企业平台转向成公共服务,意味着什么?

复旦大学中国研究院特任副研究员 刘典:相当于风险会更大一些。因为像政府服务,包括很多政府网站都有大量的公民信息,像公安系统,还有很多公共服务系统,像道路交通系统,理论上来说都是可以被智能体波及的。比如红绿灯突然被攻击,一下子市内的交通秩序就会完全被扰乱。像这种风险可能不是说马上会有,但是现在我们看到的有这种可能性。

中国人民大学高瓴人工智能学院吴玉章讲席教授 曾毅:它为了解决问题,如果你的电脑中存储着相关问题的解决方案,它有可能入侵到你的电脑中进行探索。哪怕是存储在手机中、个人电脑中的信息,实际上都有可能被互联网上的智能体获取,这样的风险都是存在的。

在本周安理会的高级别会议上,科学专家组联席主席、图灵奖获得者本吉奥表示,人类正在接近一个关键转折点,失控的风险正在从理论走向现实,能够自主规划和执行复杂任务的人工智能系统正在快速出现,而人类社会尚未建立足够成熟的安全保障机制。他警告说,我们正在高速前进,但前方的能见度越来越低。

中国人民大学高瓴人工智能学院吴玉章讲席教授 曾毅:目前我们是否对人工智能失去控制仍然取决于我们如何防范人工智能的风险,如果我们能够更好地主动防范尚未出现的风险,如果我们能够更负责任地将已经出现的风险的潜在作用范围防护好,那么人工智能仍然在我们控制的范围之内。

AI的发展越来越快,它带来的风险也在升级。前两年的AI还只是帮我们回答问题、修改图片,还停留在“君子动口不动手”的阶段;可现在的AI不一样了,它不光能生成内容,还能围绕目标进行决策和执行,它正在从“动口”走向“动手”,进入到“替用户办事”的阶段。专家比较形象的说法是,以前的AI只能算得上文字秘书,现在很多AI已经成了人类的管家,而相应的,它带来的风险就不再只是“说错话”,而是“做错事”。尤其可怕的是,当管家开始自作主张,主人还不知道它做了什么,其中的风险是治理中最棘手的部分,我们的监管到底该如何跟上?

“危险并不在于技术,危险在于缺乏问责的技术;在于有能力却无监督,在于有决策却无透明度。”这是本周二,联合国秘书长古特雷斯在联合国大会一般性辩论开幕式上对当前人工智能发展提出的警告。今年以来已经发生的多起AI越界事件,显然暴露出监管机制的重大漏洞。

AI越界背后是监管没跟上技术发展的速度。随着人工智能从单纯的工具,逐渐具备自主决策、调用工具甚至执行任务的能力,对AI的监管必须从被动防御转向主动预防。

面对AI安全治理这一新的课题,中国也在加快完善治理体系。9月14日,中国全国网络安全标准化技术委员会发布《人工智能安全治理框架3.0》。从2024年首次发布以来,这份《治理框架》已经连续第三年更新。新的框架更加关注人工智能出现的新风险,设置“自主实施网络攻击威胁”专栏,还有专门的“智能体风险管理框架”。

针对智能体高自主性、高权限带来的隐私泄露、越权操作、行为失控等安全风险,《框架3.0》提出了相应防范措施。例如,加强人工审批,在关键决策节点设置强制人工审批环节,防范高风险操作;为智能体配备唯一身份标识及对应的身份凭证,按需分配任务权限等。有分析认为,《框架3.0》以“过程”为脉络,以“身份”为支点,以“权限”为关键,为智能体确立了系统的治理体系。

作为首次直面智能体风险的制度规范,框架3.0仅仅走出了万里长征第一步。随着智能体从单智能体向多智能体跃迁,如何让AI始终处于有效监管和人类监督之下也成为世界各国共同面对的问题。

清华大学战略与安全研究中心副研究员孙成昊认为,如果一个国家政府要针对前沿人工智能进行管控或者治理,需要几项制度:

免责声明:本文信息来自 21世纪经济报道 平台,仅供参考。如有侵权,请及时联系我们删除。

评论交流

0
支持回复和点赞