全球AI安全实战化大考  中国开源方案打入前三

2026-08-05 20:31:42 来源: 科技日报 点击数:

科技日报记者 李均 通讯员 许凤婷

7月,OpenAI的一款大模型在内部测试时“失控出逃”——自主发现漏洞、规划路径,成功入侵了全球知名AI开源平台Hugging Face。当AI开始“自作主张”,谁来为它划定边界?

近期,由加州大学伯克利分校提出的国际公认安全权威榜单CyberGym公布了最新排名。作为评估AI智能体真实漏洞挖掘能力的顶级实战化测试,CyberGym榜单上,来自中国的DoGNAVY排在了全球第三。

DoGNAVY由国内顶尖人工智能研究机构与安全团队达酷诺威(DARKNAVY)联合研发,在1507道题中通过率达到90.8%,只比第二名少对一道。排在前面的,是微软和谷歌;紧随其后的包括OpenAI、Anthropic等国际顶级企业。

CyberGym是目前规模最大的AI Agent网络安全基准,Anthropic、DeepSeek、微软、Wiz等全球巨头均以此作为AI安全能力的权威标尺。

为防止AI“背答案”,测试上了几道“锁”:DoGNAVY没有使用任何CyberGym专属知识;跨任务记忆全程关闭——做完一道题就忘掉,下一道从零开始;参考答案和其他可能泄露线索的材料在系统启动前就被清理干净。

1507项任务,逐项从零开始。最终,DoGNAVY通过了1369道。

一张榜单,几乎凑齐全球最顶尖的AI公司。前两名用了同样路数:多个闭源顶级模型“拼装作战”。DoGNAVY只用了一款基础模型——智谱在6月开源的GLM-5.2,一个任何人都能从Hugging Face上下载、自由部署的通用模型。

DoGNAVY的背后,是一套完整的技术体系。从Agent基础设施到安全研究工作流,均由国内联合团队共同完成。其中,安全团队达酷诺威将长期服务众多领军企业所积累的一线经验转化为专业安全能力;国内人工智能研究机构则通过名为AgentDoG的安全架构,提供了核心的智能体运行与诊断能力。

AgentDoG的不同之处在于,它不仅能精准判断Agent行为的安全性,更能诊断风险来源、追溯失效模式、解释决策动因。

训练AI安全模型通常很“烧钱”——需要海量数据和巨大算力。AgentDoG团队换了一种思路:先用一套智能筛选机制,从海量数据中只挑出最关键的千余样本,再通过数据净化技术去掉“杂音”。最终,一个参数量仅为通用大模型千分之一的小模型,在复杂风险识别任务中达到了78.4%的准确率——与顶级大模型不相上下。

更重要的是,DoGNAVY为AI构建了严格的沙箱环境,保证其在隔离环境中执行指定任务,避免重蹈OpenAI和Anthropic的覆辙。

(受访单位供图)

责任编辑:陈可轩
网友评论
最热评论
没有更多评论了

抱歉,您使用的浏览器版本过低或开启了浏览器兼容模式,这会影响您正常浏览本网页

您可以进行以下操作:

1.将浏览器切换回极速模式

2.点击下面图标升级或更换您的浏览器

3.暂不升级,继续浏览

继续浏览