百度最近悄然推出了一款名为Unlimited OCR的开源模型,这款模型以其仅30亿的总参数和500M的实际激活参数,展现了在文档解析领域的卓越性能。在OmniDocBenchv1.5基准测试中,Unlimited OCR以93.23%的综合得分刷新了端到端OCR的纪录,而在更新的v1.6版本中,更是将这一成绩提升至93.92%,远超参数规模大数十倍的知名模型如Qwen3-VL和Gemini-2.5Pro。
传统OCR模型在处理长文档时,往往遭遇“逐页失忆”的技术瓶颈,导致跨页信息丢失。这一问题源于标准注意力机制下KV缓存随输出长度的指数级增长,迫使模型牺牲连贯性以保持运行效率。百度的研发团队通过模拟人类抄书时的认知模式,创新性地提出了参考滑动窗口注意力机制(R-SWA),成功突破了这一技术困局。
R-SWA机制的设计理念在于“全局可见、局部记忆”。在视觉输入端,模型始终保持对完整文档图像的全面感知,而在文本输出端,则仅保留最近128个token的上下文记忆。这种设计使得KV缓存形成固定容量的队列结构,无论处理多长的文档,内存占用始终保持恒定。测试数据显示,当输出6144个token时,Unlimited OCR的处理速度比同类模型快35%,且内存占用不随文档长度的增加而变化。
支撑Unlimited OCR性能的另一核心技术是DeepEncoder视觉压缩模块。该模块能够将1024×1024分辨率的PDF页面压缩至256个视觉token,压缩率达16倍。这种极致压缩不仅保留了关键信息,反而通过减少冗余数据提升了模型的处理效率。结合R-SWA机制,该模型在标准32K上下文窗口内,可以一次性完成数十页文档的完整解析。
在具体性能指标上,Unlimited OCR展现了全方位的优势。处理20页文档时,其转录结果与原文的编辑距离仅为0.057;即使输入超过40页,该指标仍控制在0.11以下。在重复内容检测中,Distinct-35指标高达97%,证明模型有效避免了机械性复读。在对文本、公式、表格等九类文档的细分测试中,该模型在七项指标上领先同类产品,特别是在阅读顺序理解和复杂公式识别方面表现突出。
引人注目的还有项目核心成员的署名方式,包括Youyang Yin、Huanhuan Liu和技术总监YY。行业观察者发现,YY的真实身份很可能是前DeepSeek OCR团队负责人魏浩然。这位曾主导开发GOT-OCR2.0和DeepSeek-OCR系列的技术专家,其研究风格与Unlimited OCR展现出的系统化创新特征高度吻合。
此次开源的Unlimited OCR模型已经在GitHub和HuggingFace平台上线,包含完整的代码和预训练权重。该项目的推出标志着OCR技术从工程优化阶段向认知架构创新阶段的跃迁,R-SWA机制被技术文档描述为“通用解析任务的免费午餐”,这暗示着百度可能将该技术扩展至语音识别、机器翻译等领域。研发团队正在探索将上下文窗口扩展至128K的技术路径,展示了Unlimited OCR理解整本书内容的潜力,未来将继续引领文档解析技术的创新与发展。