百度开源Unlimited OCR:AI解析长文档新革命
在数字化信息日益丰富的今天,文档解析的速度与准确性显得尤为重要。6月22日,百度正式开源了Unlimited OCR模型,这一重磅技术的推出将大大提升长文档解析的效率,解决了传统AI模型在处理多页文档时逐渐变慢的痛点。
Unlimited OCR模型总参数量达30亿,但在推理过程中,仅激活5亿参数,极大地优化了计算资源的使用。这种设计旨在减少在生成每个token时对显存的消耗,从而有效降低延迟,使用户体验更加流畅。传统的端到端OCR模型通常需要先检测图像中的文本框,再进行字符识别,而Unlimited OCR则摒弃了这一繁琐的流程,直接将输入图像映射为文本序列,减少了信息丢失和计算冗余。
在技术架构上,Unlimited OCR延续了DeepSeekOCR的设计理念,保留了DeepEncoder和混合专家(Mixture-of-Experts, MoE)解码器的创新。其编码端采用两级视觉编码,并在连接阶段执行16倍的token压缩,能够将1024×1024的PDF图像压缩为仅256个视觉token,从根本上减轻了预填充的负担。这一创新设计使得Unlimited OCR在处理长文档时表现得更加高效。
在训练过程中,Unlimited OCR基于DeepSeekOCR检查点继续进行了4000步的训练,冻结了DeepEncoder,专注于解码器的优化。训练数据涵盖了约200万份文档样本,数据配比为单页与多页样本约9:1,多页样本则通过拼接构造。这一严谨的训练过程确保了模型在实际应用中的高效性和准确性。