返回信息流
新闻事件
量子位
1 个来源

MonkeyOCRv2以0.7B参数超越3B模型,登顶多语种文档解析开源榜首

华中科技大学白翔团队发布MonkeyOCRv2,总参数仅0.6B和0.7B,在覆盖17种语言的MDPBench上分别获得82.5和83.3分,超越此前3B参数的开源模型dots.mocr(80.5分)。该模型通过优化视觉编码器,让前端看清字符和版面,减轻语言模型负担,实现了小模型的高性能。

SynthePulse Insight · AI 深度解读

0.7B反超3B:MonkeyOCRv2如何用“视觉记忆”重新定义文档OCR小模型时代

版本 1 · 1 个来源

一年前,3B参数还是“轻量文档模型”的门槛;如今,0.7B的MonkeyOCRv2在MDPBench上以83.3分超越3B的dots.mocr(80.5分)。华中科技大学白翔团队给出的路线不是简单剪枝,而是重新分配系统职责:让前端视觉编码器先看清字符、公式与版面,再让更小的语言模型负责组织理解。核心命题是“重建即视觉记忆”——压缩后视觉Token必须保留足以恢复笔画、符号和结构的信息,而非让后端语言模型去猜测。

  • MonkeyOCRv2-B(0.7B参数)在MDPBench上取得83.3分,超过3B参数的dots.mocr(80.5分),其中0.6B版本也拿到82.5分。
  • 模型由0.1B视觉编码器和0.6B语言模型组成,视觉编码器仅为dots.mocr(约1.2B)的约1/11,但通过像素级文档重建预训练保留了关键细节。
  • 训练数据MonkeyDoc v2包含1.13亿张文档图像,覆盖17种语言,其中6100万真实样本、5200万合成样本,已开源。
  • 同一视觉编码器迁移至文字识别、公式识别、文字检测等七类任务均带来稳定提升,公式识别中110M参数模型反超325M参数模型。
  • DeepSeek-OCR从另一角度压缩视觉Token至100个,但MonkeyOCRv2强调压缩后必须保留视觉记忆,避免后端猜测。
展开章节目录从3B到0.7B:参数减少,性能反升

从3B到0.7B:参数减少,性能反升

一年前,3B参数还可被称为“轻量文档模型”。如今,MonkeyOCRv2-S(0.6B)和MonkeyOCRv2-B(0.7B)在MDPBench上分别取得82.5分和83.3分,超过此前排名最高的开源模型dots.mocr(3B,80.5分)。榜单上体量最小的两个模型站到了开源结果最前面。

MonkeyOCRv2-B由0.1B视觉编码器和0.6B语言模型组成,而dots.mocr约为1.2B视觉编码器加1.8B语言模型。前者总参数不到四分之一,视觉编码器仅约十一分之一。团队并非简单剪枝,而是重新分配职责:视觉端负责提供干净完整的页面证据,语言端不再承担大量补字、猜字工作。

0.7B版本在拍照文档上达到81.7分,在非拉丁文字上达到82.1分,说明优势不只来自规整PDF或常见拉丁文字。

视觉记忆:在压缩中保留关键细节

文档与自然图像的根本差异在于细节决定含义:“王”和“玉”只差一点,o与0宽高比不同。论文展示的案例中,信息图实际写着“700,000”,多种通用视觉编码器却读成“100,000”。MonkeyOCRv2因此采用两种互补预训练目标:图像到文本生成学习“页面写了什么”,像素级文档重建则要求视觉Token保留足以恢复字符笔画、公式符号和版面结构的信息。

重建并非最终输出重建图,而是通过重建训练让更小的视觉编码器在压缩页面时少丢关键细节。团队构建的MonkeyDoc v2包含1.13亿张文档图像,覆盖17种语言,其中800万张完整页面、1.05亿个细粒度元素,约6100万真实样本、5200万合成样本。数据已开源,允许社区从相同起点重新训练。

17种语言对应不同字体、阅读方向和真实文档形态,而非同一模板的多语言翻译。模型学习的不只是更多字符,而是更多种“页面如何成立”的方式。

迁移验证:同一编码器提升七类任务

MonkeyOCRv2视觉编码器被接入文字识别、公式识别、文字检测、文档篡改检测、重叠文字分割、文档解析和文档理解七类任务,均带来稳定提升。在传统文字识别中,CRNN综合结果从58.7提升到67.3;常见OCR基准上平均提升2.3个百分点。

公式识别中,替换为MonkeyOCRv2-S编码器后,约110M参数的UniMERNet-T在总体精确匹配率上超过325M参数的UniMERNet-B,实现“小模型反超大模型”。文字检测、文档篡改检测和重叠文字分割分别提升3.3、7.5和5.3个百分点。

一个底座能同时改善识别、检测、分割、解析与理解,说明它学到的不是某个解码器专用技巧,而是一套可被不同系统继续使用的文档视觉表示。

压缩与记忆:文档OCR的下一个赛点

DeepSeek-OCR提出光学上下文压缩,将效率问题从“模型参数”推进到“一页文档需要多少视觉Token”。其论文报告称,只用100个视觉Token就能超过GOT-OCR2.0;少于800个Token时超过平均使用6000多个Token的MinerU2.0。但压缩后Token保留什么才是关键。

MonkeyOCRv2的“重建即视觉记忆”正是回答这一问题:如果视觉Token仍能恢复字符笔画、字形轮廓和版面结构,说明细节未被轻易忘掉。视觉Token数量衡量压缩程度,重建能力检验压缩后还剩多少可靠证据。

从MonkeyOCR的3B到MonkeyOCRv2的0.7B,路线不是简单减肥,而是不断重新划分模块职责。最终交付的不只是更高分数,而是一套可复现、可比较、可继续改进的文档解析能力。

可信度边界

本文基于量子位对华中科技大学白翔团队MonkeyOCRv2的报道,所有数据、模型参数和基准分数均来自该报道及引用的论文、GitHub仓库。报道为团队投稿,但提供了可验证的论文链接(arxiv.org/abs/2607.11562)和开源数据(modelscope.cn)。DeepSeek-OCR相关描述来自报道中的背景介绍,未提供独立来源。

核心结论

MonkeyOCRv2证明,文档OCR小模型时代的关键不是参数总量,而是参数分工与视觉记忆。0.7B反超3B提醒行业:如果错误能在视觉入口避免,就不应留给后端用更大语言模型补救。压缩决定一页文档能装进多少Token,视觉记忆决定这些Token是否值得相信。

主报道

量子位

主报道来源