超 GPT-5.6 Sol:月之暗面 Kimi K3 模型 AI 智能体知识工作跑分仅次于 Claude Fable 5
最新 7 月 24 日消息,Artificial Analysis 于 7 月 22 日更新 AI 智能体知识工作基准 AA-Briefcase,显示 Kimi K3 模型斩获 1543 分,超过 GPT-5.6 Sol(1501 分),仅次于 Claude Fable 5 模型(1574 分)。
最新注:AA-Briefcase 是独立 AI 评测机构 Artificial Analysis 于 2026 年 6 月推出的全新前沿 AI 智能体(Agent)知识工作基准测试。
它专为评估 AI 在处理长周期、高复杂度真实业务中的表现而设计,模拟企业中真实且混乱的办公环境,测试数据科学、产品管理、企业战略等场景,处理海量碎片化上下文(包括 25000+ 条 Slack 消息、3500+ 封电子邮件、会议纪要和财务报表等),并要求生成 Excel 财务模型、董事会汇报 PPT 等实际的商务交付物。

根据最新跑分结果显示,Kimi K3 模型在 AA-Briefcase 上的跑分达到 1543 分,仅次于 Claude Fable 5(1574 分),超过 GPT-5.6 Sol (最高 1501)、Claude Sonnet 5 (最高 1388) 和 Claude Opus 4.8 (最高 1347)。相比较而言 Kimi K2.6 模型在榜单上的成绩为 816 分。



延伸阅读
Kimi K3 模型由月之暗面(Moonshot AI)于 2026 年 7 月 16 日正式上线,是其迄今为止最强的旗舰模型,拥有 2.8 万亿参数和 100 万 Tokens 的上下文窗口,尤其擅长编程、游戏 / 3D 与知识类任务。
在编程能力方面,Kimi K3 在 Frontend Code Arena 基准测试中曾以 1679 分超越 Claude Fable 5 登顶,在品牌营销、数据分析等七个前端领域中的六个位居第一。
Kimi K3 模型采用按量计费,每 100 万 Tokens 的输入费用在缓存命中时为 2 元,未命中时为 20 元,输出费用为 100 元。
近期有报道称,微软正在内部测试 Kimi K3 模型,并评估将其部分接入 Copilot AI 助手的可行性,以降低推理成本。
《超 GPT-5.6 Sol:月之暗面 Kimi K3 模型 AI 智能体知识工作跑分仅次于 Claude Fable 5》转载自互联网,如有侵权,联系我们删除,QQ:369-8522。
相关图文
-
OpenAI 上线 ChatGPT Health:接入苹果 Health 等数据,每周超 3 亿人询问健康问题
科技媒体 AppleInsider 昨日(7 月 23 日)发布博文,报道称 OpenAI 升级其 Health 健康功能,支持接入苹果健康(Apple Health)和数据与医疗记录,让 ChatGPT 分析用户健康情况。... -
OpenAI ChatGPT 桌面应用上线语音模式:用户口述需求,AI 推进多项任务
OpenAI 公司今天(7 月 24 日)发布公告,宣布升级 ChatGPT 桌面应用(已与 Codex 合体),引入由 GPT-Live 模型驱动的 ChatGPT Voice 模式。... -
估值 100 亿美元,消息称海外支付巨头 Stripe 拟收购全球最大 AI 聚合平台 OpenRouter
据传海外支付巨头 Stripe 正洽谈收购全球最大 AI 聚合平台 OpenRouter,估值或达 100 亿美元,较其五月融资估值暴涨数倍。OpenRouter 平台聚合数百 AI 模型,是开发者与企业的关键桥梁。这场跨界收购若成行,将重塑 AI 与支付生态。#Stripe收购OpenRouter# #AI聚合平台#... -
2026 年菲尔兹奖得主 Jacob Tsimerman 宣布加入 OpenAI
前微软副总裁、现 OpenAI 研究员 Sebastien Bubeck,以及 OpenAI 首席研究官 Mark Chen 都确认了这一消息,表示欢迎 Jacob Tsimerman 加入 OpenAI 团队。... -
公安部:上半年共侦办利用 AI 工具生成网络谣言案件 170 余起
当前,利用人工智能实施的新型犯罪主要包括:利用人工智能技术伪造身份,侵入政企信息系统,对他人信息和财产实施盗窃;或者伪装成熟人、权威人士,骗取受害者的信任后实施诈骗;以及利用人工智能工具,生成网络谣言,扰乱社会公共秩序。...












