阿里开源 0.8B 文档解析模型 OvisOCR2,端到端模型首次超越流水线方法
最新 7 月 24 日消息,今日,阿里云开源发布文档解析模型 OvisOCR2。该模型以 96.58 的综合得分刷新 OmniDocBench v1.6 榜单纪录,成为首个超越流水线方法并登顶该榜单的端到端模型,官方称“这是文档解析领域迎来技术路线的重要突破”。
端到端模型首次超越流水线方法
最新从官方公告获悉,文档解析是大模型落地的关键基础设施,企业知识库、RAG 检索、智能问答等场景均需将 PDF、扫描件等非结构化文档转化为结构化文本。
此前该领域由“流水线方法”主导,通常由版面分析模型和内容识别模型两部分组成,前者负责识别文档布局,后者负责文字、公式、表格等内容的识别,最后拼接输出。这种方式虽成熟,但存在维护成本高、误差累积、部署复杂等固有瓶颈。
OvisOCR2 采用端到端技术路线:输入一张文档图像,模型在一次生成中输出符合自然阅读顺序的 Markdown 表示,覆盖文本、公式、表格和视觉区域。过去需要多个模型协作完成的工作,现在由一个模型一步到位。
在 OmniDocBench v1.6 上以 96.58 分登顶,首次证明端到端模型可超越流水线方法。
小参数大能力,0.8B 实现 SOTA
OvisOCR2 由 Qwen3.5-0.8B 后训练得到。团队构建了真实文档与合成文档互补的数据引擎体系,合成文档专门补充表格与公式交织、多栏版式、长输出等复杂场景。训练方案融合监督微调(SFT)、强化学习(RL)、在线策略蒸馏(OPD)和模型融合四阶段流程,形成多阶段递进式的训练流程,充分释放紧凑模型的潜力。

项目已开源发布,无缝融入千问生态
OvisOCR2 以 Apache 2.0 许可证开源,兼容 vLLM 等主流推理框架,与 Qwen3.5 推理生态衔接,开发者无需额外适配即可集成。
模型获取方式
Hugging Face
魔搭
技术报告
《阿里开源 0.8B 文档解析模型 OvisOCR2,端到端模型首次超越流水线方法》转载自互联网,如有侵权,联系我们删除,QQ:369-8522。
相关图文
-
OpenAI 上线 ChatGPT Health:接入苹果 Health 等数据,每周超 3 亿人询问健康问题
科技媒体 AppleInsider 昨日(7 月 23 日)发布博文,报道称 OpenAI 升级其 Health 健康功能,支持接入苹果健康(Apple Health)和数据与医疗记录,让 ChatGPT 分析用户健康情况。... -
OpenAI ChatGPT 桌面应用上线语音模式:用户口述需求,AI 推进多项任务
OpenAI 公司今天(7 月 24 日)发布公告,宣布升级 ChatGPT 桌面应用(已与 Codex 合体),引入由 GPT-Live 模型驱动的 ChatGPT Voice 模式。... -
估值 100 亿美元,消息称海外支付巨头 Stripe 拟收购全球最大 AI 聚合平台 OpenRouter
据传海外支付巨头 Stripe 正洽谈收购全球最大 AI 聚合平台 OpenRouter,估值或达 100 亿美元,较其五月融资估值暴涨数倍。OpenRouter 平台聚合数百 AI 模型,是开发者与企业的关键桥梁。这场跨界收购若成行,将重塑 AI 与支付生态。#Stripe收购OpenRouter# #AI聚合平台#... -
2026 年菲尔兹奖得主 Jacob Tsimerman 宣布加入 OpenAI
前微软副总裁、现 OpenAI 研究员 Sebastien Bubeck,以及 OpenAI 首席研究官 Mark Chen 都确认了这一消息,表示欢迎 Jacob Tsimerman 加入 OpenAI 团队。... -
公安部:上半年共侦办利用 AI 工具生成网络谣言案件 170 余起
当前,利用人工智能实施的新型犯罪主要包括:利用人工智能技术伪造身份,侵入政企信息系统,对他人信息和财产实施盗窃;或者伪装成熟人、权威人士,骗取受害者的信任后实施诈骗;以及利用人工智能工具,生成网络谣言,扰乱社会公共秩序。...












