自家大模型被友商超越 OpenAI直指AI跑分有猫腻:此前建议大家都用
快科技7月9日消息,马斯克旗下的xAI今天发了Grok 4.5大模型,在编程能力上进步很大,AI基准测试中比GPT-5.5还高,结果OpenAI不乐意了,表示这个项目有问题,撤回之前对它的推荐。这个测试项目...
最新7月9日消息,马斯克旗下的xAI今天发了Grok 4.5大模型,在编程能力上进步很大,AI基准测试中比GPT-5.5还高,结果OpenAI不乐意了,表示这个项目有问题,撤回之前对它的推荐。
这个测试项目是SWE-Bench Pro,在Grok 4.5的发布新闻中,其跑分达到了64.7%,比GPT-5.5的58.6还要高不少。

然而OpenAI突然就不乐意了,公开发文表示他们审核了这个AI编程能力测试项目,认为它已经不能可靠地衡量前沿大模型的编程能力了。
原因是测试项目中有30%的任务有缺陷,有部分任务存在扭曲结果的可能,一些正确的解决方案会因为隐藏要求、相互矛盾的指令、过于严格的测试或不完整的评分标准而失败。
OpenAI还提到他们找了五位资深的工程师做了评审,根据他们的结果他们撤回了此前建议研究者和社区将SWE-Bench Pro作为首要的编程评测基准的推荐。

看到这里大家应该明白了,SWE-Bench Pro评测项目之前是OpenAI力推的AI编程基准测试,那个时候霸占榜单的主要是自家的GPT大模型。
现在是多个大模型都在这个测试中超越了GPT的大模型,有些差距还挺大的,OpenAI显然不乐见这种情况,对SWE-Bench Pro的态度也直接180度大反转,表示测试有猫腻,不再推荐作为标准了。
在外界看来,这种自己占优势的时候就说跑分公平,自己不占优势的时候就掀桌子称跑分有猫腻的做法无疑是赤裸裸的双标,更何况还是OpenAI自己一手把这个项目吹成AI编程基准的,结果现在脸面不要了也要推翻。

《自家大模型被友商超越 OpenAI直指AI跑分有猫腻:此前建议大家都用》转载自互联网,如有侵权,联系我们删除,QQ:369-8522。
相关图文
-
何小鹏:打败特斯拉ModelY应该很快了 但不一定是中国品牌
快科技7月17日消息,据报道,小鹏汽车董事长何小鹏在接受媒体采访时,面对何时能超越特斯拉Model Y这一问题,给出了他独到的判断。何小鹏认为,能够实现对标、超越Model Y的窗口期很快就会到来... -
黄仁勋亲临站台 软银索尼本田等44家日企联手搞AI:力争抗衡中国
快科技7月17日消息,据日经新闻报道,日本国产AI平台企业联盟7月16日正式成立,软银、索尼集团、NEC、本田等44家企业参与,由新公司Noetra负责核心研发。日本政府将提供最多1万亿日元支援,目... -
于东来建议年假休20至40天 希望国家监督落地质量:每周工作40小时 超过就违法
快科技7月17日消息,近日胖东来掌门人于东来公开发声,提出面向全社会推广落实20至40天年休假制度的相关建议,相关内容很快在全网引发大范围讨论。胖东来创始人于东来在社交平台发文表示,希望... -
真顶流!卢本伟现身播放量破500万:登顶B站热榜第一
昨日,知名游戏媒体“STN工作室”发布了一期重量级采访视频,受访对象正是前职业选手、曾红极一时的知名主播“五五开”卢本伟。在经过一天的发酵后,该视频在B站播放量... -
国内首个Agent-native智能客服数字员工平台京小灵亮相WAIC 重新定义企业数字劳动力
2026年,数字员工规模化元年到来。京东在2026WAIC推出国内首个Agent-native(原生智能体架构)智能客服数字员工平台——京小灵(JoySupport),为企业智能化转型提供"即插即用、...






