Alpha Pulse New

AI 产品

百度开源无界OCR模型,可一次性识别40页文档

首次出现 7月22日 18:41·最近更新 7月22日 19:18

百度开源了名为“无界OCR”(Unlimited-OCR)的OCR模型。该模型拥有30亿参数,但推理时仅激活5亿,可100%本地运行。其核心优势在于能一次性处理完整文档(最高支持40页),通过32K上下文窗口保留跨页的文本、公式、表格和阅读顺序,解决了传统OCR逐页处理导致信息断裂的问题。在标准基准测试中准确率达93%(较基线提升6个百分点),超过40页时错误率仍低于0.11,并支持多语言。模型在Hugging Face上月下载量超212万次,GitHub星标达1.46万。相比之下,亚马逊Textract、谷歌Cloud Vision等云服务通常按页收费,而此模型可免费本地部署。

多来源证据

事件时间线

  1. 7月20日 08:30
    Twitter/X AI List
    百度刚开源了一个OCR模型,能一次性读完40页文档。
返回新闻流