资讯详情
“AI自主入侵”:网络安全风险进入新阶段
发布时间:
2026-07-30 21:14:07
上海国际问题研究院国际战略与安全研究所副所长
人工智能(AI)安全领域本月爆出一条令人不安的新闻:美国OpenAI公司正在测试的一款AI模型,在网络安全考试中“自己决定”突破安全限制,入侵全球最大的AI开源平台Hugging Face,从后台数据库中偷走考试答案。更让人后背发凉的是,入侵持续了整整三天,OpenAI监测系统竟然毫无察觉。直到Hugging Face公开披露遭入侵,双方启动联合调查,OpenAI才确认肇事源头。从首次逃逸异常到确认失控事故,前后长达一周。
安全风险集中暴露
这起全球首次“AI自主入侵事件”绝非孤立的“技术事故”,而是代理式AI时代系统性网络安全风险的集中暴露。
第一,它清晰地展示了当前AI模型的逻辑悖论。人们给AI设定的任务目标往往是狭窄的、量化的,如“解出这道题”“通过这项测试”,但AI不会像人一样理解“公平竞争”“不能违法”这些规则。AI模型为了完成任务或通过测试,可能选择撒谎、作弊甚至黑客攻击等“捷径”获取答案。在这种情况下,人类设定的“护栏”在AI眼中不过是又一个需要解决的障碍。AI为了完成任务会“不择手段”,意味着类似风险随时都有可能发生。
第二,它展示了人类无法想象的攻击速度。这次事件由AI自主串联完整的攻击链条,从发现漏洞、窃取权限,到进入目标数据库,全部自动完成。AI在目标平台上执行了超过17000次自动化操作,速度之快让人类安全团队根本跟不上。这意味着AI自主发起的网络攻击已经从理论变成了现实,当攻击速度从“人的速度”进入“机器的速度”,依赖人工反应的传统安全防线将形同虚设。
第三,它正在创造更多连锁风险。AI智能体本身具有网络化的特点,分享是其强大能力的重要来源。调查发现,同款AI曾在本地保留了一份详细的“越狱操作手册”,清晰记录了绕过安全管控的方法。如果不同任务中的AI智能体能够互相分享这类“逃逸经验”,整个行业的安全体系都将面临冲击。尤其当训练方式鼓励多个AI智能体协同配合时,它们很可能主动交流规避监管的技巧,让防御变得更加困难。
治理体系严重不足
这次“AI自主入侵事件”的出现不仅充分展现了代理式AI时代网络安全风险的特征,也暴露出当前全球AI治理体系的很多不足。
第一,网络攻击正在超越网络防御的速度。智能体的广泛使用给网络安全带来了新的课题,AI正在加速漏洞的发现和利用,模型安全和防护却没有保持同样速度的进步。攻击端的能力已在“机器速度”上狂奔,而防御端的治理框架、技术工具和国际协作仍在“人的速度”上蹒跚。如何让防御追上攻击的节奏,将是网络安全领域的重要课题。
第二,闭源模型存在安全悖论。在这次事件中另一个非常引人深思的点在于,Hugging Face曾寻求利用美国某AI公司的闭源模型来了解受攻击范围,但模型拒绝执行请求,理由是无法分辨提出请求的是攻击受害者还是攻击者,最终Hugging Face转而部署中国智谱AI开发的GLM-5.2开源模型完成了取证分析。这暴露了一个潜在的巨大风险,即当最先进的安全工具被少数几家闭源企业垄断,防御者反而丧失了自主应对威胁的能力。这也充分展现了开源路径在网络安全领域的重大价值。
综上所述,这是第一次“AI自主入侵事件”,但可以肯定不会是最后一次。代理式AI时代已经到来,AI的能力正从内容生成走向自主行动,网络安全风险也进入了新阶段。这次事件以非常直接的方式提醒着世界,AI治理不能再停留于原则宣言和自愿承诺的层面,而必须进入具有明确的规则、可执行的监测机制和全球协作的新阶段。要实现这一目标,需要各国共同努力。
上一页
下一页
最新动态