超越OpenAI、Anthropic!深信服AI突围CyberGym评测 位列全球前四、国内第一
近日,在面向全球顶尖 AI 安全能力的国际权威基准测试 CyberGym 中,Sangfor AI 取得了优异表现。在依托纯国产基座模型(GLM-5.2)的固定模型配置下,系统面对涵盖 ARVO 与 OSS-Fuzz 的全量高难度漏洞挑战,在 1,507 项任务中成功解决 1,301项,整体成功率达到 86.3%。本次评测中,Sangfor AI 与 OpenAI、Anthropic、Meta 等全球头部科技厂商的模型与智能体同场竞技,最终整体评测成绩跻身全球前四,位列国内参评团队第一。
![[MD:Title]](/d/file/p/2026/07-30/247648474cb917b52e84a759282a7cdd.png)
CyberGym作为全球权威 AI 安全评测体系,摒弃了传统的静态或小规模理论测试,聚焦于真实世界的复杂挑战——涵盖大量主流开源软件与高难度历史漏洞(如 ARVO、OSS-Fuzz 等)。它严格考验大模型与安全 Agent 在海量源码、复杂上下文及多阶段对抗环境下的自主推理、漏洞复现与 PoC 验证能力,因其贴近真实工业界防护场景、验证标准严苛,被视为全球范围内评估代码安全大模型实战能力最具含金量的权威靶场之一。而Sangfor AI 不仅交出了一份完整、公开且经得起严苛验证的实战答卷,更充分展现了“国产大模型 + 自研安全智能体架构”在复杂代码安全对抗与漏洞自动化验证中的高水准落地效果,进一步证明了国产大模型在应对高强度工业级安全挑战时的坚实竞争力与广阔应用前景。
深信服Sangfor AI 的Agent系统:
将模型能力转化为可验证的安全能力
漏洞挖掘不是一次性的代码分析或 PoC 生成,而是在信息不完备的条件下,持续提出假设、获取证据、排除错误路径并形成最终结论的研究过程。单一模型可以完成局部推理,但要稳定处理长链路探索、并行假设和严格验证,还需要一套能够组织、保留并约束这些能力的系统机制。为了破解这一难题,Sangfor AI 并未采用简单的概率堆砌,而是开创性的构建了“智能体群体(Agent Swarm)协同作战”架构,并引入了严密的“证据管治”机制,确保每一步漏洞调查步骤都清晰可信:
有界探索:围绕不同的安全假设分别开启独立、边界清晰的调查分支,让多个可能的解释可以并行推进,而不会互相污染、也不会让某个未经证实的假设悄悄变成集体共识;
证据持久化:各调查分支之间通过“证据”而非完整对话历史来协同——已被验证的观察和已被证伪的路径都会被保留下来,避免同一条错误路径被反复重新试错;
动态假设裁决:一个协调层持续基于不断演化的证据状态,判断哪些假设仍然成立、哪些问题尚待解决、哪里还值得继续投入,让每一轮探索都成为对搜索空间的有效收窄;
对抗式候选评审:当证据支持某个具体的触发方案时,系统才会构造候选输入并提交“对抗式评审”——评审会同时挑战“这次崩溃是否可复现”以及“这次崩溃是否真的对应目标漏洞”,未通过评审的候选会被打回、用于修正下一步探索方向,只有真正经受住检验的候选,才会成为系统最终提交的安全结论。
正如项目团队在技术设计中所强调的:“以假设拓展探索,以证据裁定结论。” 这套机制让系统敢于「广撒网」式地探索多种假设,又能在真正下结论前把关得足够严格,最终,在来源于 ARVO 的任务上取得 87.2% 的成功率,在来源于 OSS-Fuzz 的任务上取得 77.7% 的成功率,综合成功率达到86.3%。
不止于登榜:创新成果如何真正走进企业研发流程
随着AI技术的快速发展,攻击者正利用 AI 大幅降低漏洞分析与攻击利用门槛,压缩从漏洞发现到规模化利用的时间窗口。对企业而言,必须抢在攻击者之前发现、验证并修复漏洞。而过去开发安全所依赖规则匹配的传统 SAST,必须加速向具备自主推理、代码理解、业务逻辑分析和漏洞验证能力的安全Agent转型。新的安全Agent既要精准识别 SQL 注入、命令执行等常规漏洞,更要深入理解复杂业务流程,发现越权访问、认证绕过等传统工具难以覆盖的高风险问题。与此同时,能否依托国产开源大模型实现AI开发安全系统的关键能力突破,成为掌握代码安全的主动权的关键。
而“登榜CyberGym”所代表的绝不仅是一张亮眼的评测成绩单,更是 AI 安全 Agent 在真实企业级代码安全场景中的战斗力映射。Sangfor AI的前沿技术正加速沉淀并赋能深信服全线产品,深度融入企业研发全流程,为企业级用户带来切实的价值质变:
提升漏洞检出能力:有效攻克传统 SAST 盲区,全面识别业务逻辑漏洞、越权与认证绕过,大幅拓宽代码安全覆盖率。
降低人工审计成本:凭借 AI 自动化完成代码理解、跨文件关联分析、攻击路径推理与风险验证,大幅解放安全专家的繁重人工劳动力。
减少误报、提升效率:依靠多阶段推理与严苛的证据验证机制压降误报率,使研发人员能够聚焦真正亟需修复的风险,告别无效整改。
缩短研发交付周期:将安全检测前移至研发编写与 CI/CD 流水线中,实现“代码提交即自动审计”,大幅降低后期返工成本,加速业务高效上线。
提升企业整体安全能力:帮助企业在更早阶段筑牢防线,遏制因数据泄露、业务中断带来的合规与经济风险,为数字化业务保驾护航。
对于广大企业用户而言,AI 安全 Agent 的核心价值远不止于“发现更多漏洞”,更在于以极高准确率、极低人工成本与极快响应速度,实现研发效率与代码安全的同步跨越。
此次,深信服在CyberGym评测中的卓越成绩,是代码安全智能化道路上的一个重要里程碑。未来,深信服将继续深耕大模型安全技术创新,将前沿技术转化为企业实际业务场景中的生产力,持续践行“让每个用户的数智化更简单,更安全”的承诺。
《超越OpenAI、Anthropic!深信服AI突围CyberGym评测 位列全球前四、国内第一》转载自互联网,如有侵权,联系我们删除,QQ:369-8522。
相关图文
-
2026佳能CPS会员摄影展终评圆满收官
7月28日,2026北京国际摄影周核心参展单元“超越瞬间——佳能CPS会员摄影展”终评工作在北京圆满收官。由五位中国摄影界权威专家组成的评委会,从400多位佳能CPS(Canon Pr... -
暑期过半 铁威马喊你来看电影啦
暑假行程过半,不少学生陆续完成暑期作业,迎来休闲放松时光。很多家长打算为孩子整理科普纪录片、优质动画资源,但如何搭建干净、可控的私人影音库,同时管控孩子浏览权限,成为众多家庭的难题... -
钛缓震层技术实现关键进化 三星Galaxy Z8系列带来体验升维
日前,三星在国内正式发布三星Galaxy Z Fold8 Ultra、Galaxy Z Fold8与Galaxy Z Flip8三款第八代折叠屏新品。作为折叠屏品类的开创者与引领者,三星此次将全新钛缓震层技术全面落地全系产品,直... -
豆包搜索开放服务 为 Agent 提供实时、权威、可信的搜索能力
当前,AI Agent 正从简单问答走向长程任务执行,传统单次检索模式已难以满足深度信息需求。先进、成熟的 Agent 不只是“会回答”,更要能持续搜索、精读网页、交叉验证信息,并根据任... -
岚图泰山X8通过动力电池新国标首测 岚图携手华为乾崑解锁主动避险新高度
2026年7月,新版动力电池安全强制国标正式落地。岚图泰山X8联合中国汽车技术研究中心完成 "新国标落地第一测" ,在颠簸涉水测试、电池炙烤热失控测试、底部撞击等核心考核中,各项指标...






