百度UnlimitedOCR:开创OCR新纪元,助力长文档解析
在OCR(光学字符识别)领域,百度最近发布的UnlimitedOCR模型无疑引起了业界的广泛关注。作为一种全新的开源OCR解决方案,UnlimitedOCR不仅在长文档解析上实现了突破,更为行业的发展提供了新的思路。
UnlimitedOCR的最大亮点在于其创新的处理方式,区别于传统OCR逐页处理的模式,UnlimitedOCR模仿人类抄录员的工作方式,能够一次性阅读并解析数十页的长文档。这种“连续阅读”的能力,依赖于其独特的参考滑动窗口注意力机制(R-SWA)。该机制允许模型在解析过程中,只保留当前所需的信息,避免了传统方法中随着文档长度增长而导致的显存占用和计算开销的增加。
具体来说,UnlimitedOCR采用了一种类似“软遗忘”的策略,让模型在处理长文档时,能够专注于当前的内容,而不必频繁回溯。这就好比人类在抄书时,不会每写一个字就翻回去查看前面的内容,而是依靠当前的进度和最近的写作状态来继续。这一设计思路不仅提升了模型的效率,也使其在解析长文本时表现得更加稳定。
在实验中,UnlimitedOCR在OmniDocBench评测中表现优异,综合得分达93.92%,超越了此前的DeepSeekOCR。在处理长文本时,即便一次性输入超过40页的内容,模型的解析质量也未出现明显下降,Distinct-35指标高达96.90%,编辑距离维持在0.1069以下。此外,推理速度相比DeepSeekOCR提升约35%,在长文档处理场景下,延迟几乎保持稳定,显示出良好的用户体验。