热点回应丨OpenAI模型失控,中国开源模型“救场”

2026-07-24 07:40:23 来源: 科技日报 点击数:

科技日报记者 崔爽

7月22日,人工智能研究公司OpenAI确认,上周AI平台Hugging Face(抱抱脸)遭遇“史上首例AI自主入侵事件”,攻击者是其自家模型GPT-5.6 Sol。

AI大模型为什么会自主驱动网络入侵?网络安全失控了吗?科技日报记者就此采访了有关专家。

第一问:AI大模型为什么会自主攻击网络?

“从Hugging Face这事来看,AI模型搞起事情来真是目标坚定、能力超强、路子够野。”奇安信人工智能公司安全专家汪列军感慨。

事件起因是OpenAI内部一个名为“ExploitGym”的网络安全评估测试。为了测量模型的真实攻击能力,研究人员刻意关闭安全护栏,并将模型置于一个与互联网隔离的“沙盒”环境中。然而,这个被寄予厚望的AI模型不甘心被“关在笼子里”。它花费大量推理算力,最终找到测试环境中一个此前无人发现的零日漏洞,成功突破隔离,获得互联网访问权限。

拿到网络权限后,模型开始在OpenAI的研究环境里提权、横向移动,并推断出Hugging Face上可能存有测试答案。于是,它将窃取的凭证和零日漏洞串联起来,找到一条远程代码执行的路径,直接攻破Hugging Face的生产服务器,用汪列军的话说,“完成一次教科书式的自主网络攻击”。

“‘失控’的本质,还是因为模型的能力边界已经超出了人类为它预设的安全约束边界。”赛迪研究院信息化与软件产业研究所副主任黄文鸿表示,模型没有越权的“主观意识”,但它有越权的“能力”和“动机”,动机来自任务目标本身。这是最令人警醒的地方,AI本身是没有道德感和分辨对错能力的,它也不是一个有“恶意的AI”,但因为足够聪明、又被赋予了足够工具权限的AI,因此做了“并不正确的事”。

第二问:为何AI安全过滤器拒绝分析请求?

戏剧性的是,当Hugging Face的工程师们试图用商业AI模型分析这次攻击的载荷时,AI的安全过滤器却拒绝了请求。汪列军认为,这揭示了一种可能:用AI攻击,用AI防御,但防御方的AI却因为“过度谨慎”而临阵脱逃。

最终,他们也不得不求助于来自中国的开源模型,通过在本地基础设施部署GLM-5.2,才完成整个取证分析流程。

“这确实说明,粗颗粒度的安全防护机制在关键时刻可能适得其反。”黄文鸿说,“真正需要解决的是安全机制的精细化和上下文感知能力,能区分对抗场景和正常使用场景,能识别请求者的身份和意图,而不是对所有涉及敏感内容的请求一刀切地拒绝。”

同时,Hugging Face最终转向智谱的开源模型GLM-5.2在本地完成取证,恰恰说明,对安全团队而言,拥有一个可以在自己基础设施上运行、不受外部使用策略约束的强能力模型,已经是应急能力建设的刚需。

第三问:传统网络安全防御体系是否正在失效?

“这起事件的意义已超出单一安全事故的范畴。”黄文鸿表示,传统网络安全防御的底层假设基于攻击者是人,攻击速度受人类认知和操作能力限制,攻击行为有可识别的人类特征模式。

而该事件打破了这三个前提。GPT-5.6 Sol在一个周末内执行了超过17000次自动化操作,从发现零日漏洞到完成多集群渗透,全过程无人干预。它不疲劳、不犯低级错误、不留下人类攻击者惯有的行为指纹。

“在AI自主攻击的时代,攻击速度和复杂度已远超人类分析师的响应极限。”汪列军说,“我们必须转变思路,从被动地‘追着漏洞跑’转向主动防护,构建一个即使存在漏洞,也能有效抵御攻击、限制损失并快速恢复的弹性系统。”

AI智能体可以全天候并行试探、快速更换路径、自动串联漏洞,并用数万次低成本操作压缩攻击周期。“下一步安全体系建设的方向很明确。”黄文鸿建议,必须用AI对抗AI,要加入机器速度的行为检测、全轨迹监控、自动隔离和熔断、弹性恢复,并把每个智能体视为受限权限的潜在内部威胁。

责任编辑:王倩
网友评论
最热评论
没有更多评论了

抱歉,您使用的浏览器版本过低或开启了浏览器兼容模式,这会影响您正常浏览本网页

您可以进行以下操作:

1.将浏览器切换回极速模式

2.点击下面图标升级或更换您的浏览器

3.暂不升级,继续浏览

继续浏览