OpenAI 挑战 AI 评测基准 SWE-Bench Pro:约 30% 存在评测缺陷
OpenAI 昨日(7 月 8 日)发布博文,挑战行业权威评测基准 SWE-Bench Pro,认为在 731 个公开测试任务中,约 30% 存在评测缺陷。...
最新 7 月 9 日消息,OpenAI 昨日(7 月 8 日)发布博文,挑战行业权威评测基准 SWE-Bench Pro,认为在 731 个公开测试任务中,约 30% 存在评测缺陷。
最新注:SWE-Bench Pro 是由 Scale AI 推出的大语言模型与 AI 智能体编程能力评测基准,因高度贴近实际企业级开发且具备极高的防作弊标准,现已成为 AI 软件工程领域的行业权威基准。
OpenAI 在博文中指出,在 731 个公开测试任务中,前沿模型在 8 个月内通过率从 23.3% 升至 80.3%,认为该基准已无法有效评估模型的软件开发能力。

OpenAI 介绍称,其数据点分析流程标记出 200 个失效任务,占全部 731 个公开任务的 27.4%;并行开展的人工标注活动识别出 249 个失效任务,占 34.1%。基于上述两条审查路径,OpenAI 预估 WE-Bench Pro 约 30% 的任务存在缺陷。
在问题类型方面,OpenAI 将其划分为 4 类:
测试过严,把题面未写明的实现方式也列为硬性要求
提示不充分,隐藏测试执行未写明、且无法合理推断的要求
测试范围过窄,不完整修复也可能通过。
提示具有误导性,指向与测试要求不一致的行为
OpenAI 还披露一个典型问题,题面要求把内容转为 Markdown 时,行首加入 1 个空格,但隐藏测试却要求 2 个空格,导致模型按说明编写代码仍被判错。

基于这次分析,OpenAI 撤回此前对 SWE-Bench Pro 的采用建议,并称后续需要由资深软件开发者专门为 AI 评测设计新的基准。
《OpenAI 挑战 AI 评测基准 SWE-Bench Pro:约 30% 存在评测缺陷》转载自互联网,如有侵权,联系我们删除,QQ:369-8522。
相关图文
-
华为昇腾 950 超节点荣获 2026 世界人工智能大会最高荣誉 SAIL 奖
@华为中国 昨日(7 月 18 日)发布博文,宣布昇腾 950 超节点(Atlas 950 SuperPoD)荣获 2026 世界人工智能大会(WAIC)最高荣誉 SAIL 奖。... -
“反 AI”情绪愈演愈烈,多家头部 AI 公司加强高管安保
《华尔街日报》报道称,针对 AI 行业的敌意不断上升,开发先进 AI 模型的人员和企业正面临越来越多的威胁与袭击企图。多家头部 AI 公司已经加强安保,部分高管出行时甚至由武装保镖随行,另一些人则选择降低曝光度,减少公开活动。... -
OpenAI 回应 GPT-5.6 Sol AI 意外删除用户文件:已采取措施降低风险
OpenAI 核心产品负责人蒂博 · 索蒂奥(Tibo Sottiaux)于 7 月 16 日在 X 平台发布推文,回应 GPT-5.6 Sol 会擅自删除用户文件问题。... -
面向手机的 AI 游戏创作工具,《Roblox》移动版将更新“Build”功能
Roblox 为移动版客户端推出“Build”功能,用户通过简单提示词即可生成基础游戏,无需编程技能。该功能由多种 AI 模型驱动,支持生成玩法、环境、角色等。将于 7 月 28 日开启 Alpha 测试,首先面向新西兰用户开放。#Roblox #AI 游戏创作 #移动游戏开发#... -
歌曲生成平台 Suno 部分源码泄露,被发现全网爬取数百万歌曲训练 AI
科技媒体 404Media 昨日(7 月 16 日)发布博文,报道称基于黑客披露的 Suno 内部源代码,该 AI 歌曲生成平台从 YouTube Music、Deezer 和 Genius 等平台抓取数百万首歌曲来构建其核心模型。...












