百度开源Unlimited OCR:AI解析长文档新革命

在数字化信息日益丰富的今天,文档解析的速度与准确性显得尤为重要。6月22日,百度正式开源了Unlimited OCR模型,这一重磅技术的推出将大大提升长文档解析的效率,解决了传统AI模型在处理多页文档时逐渐变慢的痛点。

Unlimited OCR模型总参数量达30亿,但在推理过程中,仅激活5亿参数,极大地优化了计算资源的使用。这种设计旨在减少在生成每个token时对显存的消耗,从而有效降低延迟,使用户体验更加流畅。传统的端到端OCR模型通常需要先检测图像中的文本框,再进行字符识别,而Unlimited OCR则摒弃了这一繁琐的流程,直接将输入图像映射为文本序列,减少了信息丢失和计算冗余。

在技术架构上,Unlimited OCR延续了DeepSeekOCR的设计理念,保留了DeepEncoder和混合专家(Mixture-of-Experts, MoE)解码器的创新。其编码端采用两级视觉编码,并在连接阶段执行16倍的token压缩,能够将1024×1024的PDF图像压缩为仅256个视觉token,从根本上减轻了预填充的负担。这一创新设计使得Unlimited OCR在处理长文档时表现得更加高效。

在训练过程中,Unlimited OCR基于DeepSeekOCR检查点继续进行了4000步的训练,冻结了DeepEncoder,专注于解码器的优化。训练数据涵盖了约200万份文档样本,数据配比为单页与多页样本约9:1,多页样本则通过拼接构造。这一严谨的训练过程确保了模型在实际应用中的高效性和准确性。

根据基准测试结果,Unlimited OCR在OmniDocBenchv1.5上的整体得分为93.23,超越了DeepSeekOCR的87.01和DeepSeekOCR2的89.17,显示出其在文档解析领域的强大实力。其文本编辑距离为0.038,公式CDM为92.61,表格TEDS为90.93,读序编辑距离为0.045,进一步证明了该模型的高精度表现。在OmniDocBenchv1.6上,模型整体得分甚至提升至93.92,显示出持续优化的潜力。

Unlimited OCR的推出,不仅仅是技术层面的革新,更是为文档处理行业带来了新的思考。随着数字化进程的加快,如何高效、准确地处理大量信息,成为了企业和个人面临的共同挑战。Unlimited OCR的开源,不仅促进了技术的普及,也为更多的开发者和企业提供了创新的可能性。未来,我们期待这一模型在实际应用中的表现,推动文档解析技术的进一步发展,让信息获取变得更加高效和便捷。