AI 产品
百度开源无界OCR模型,可一次性识别40页文档
百度开源了名为“无界OCR”(Unlimited-OCR)的OCR模型。该模型拥有30亿参数,但推理时仅激活5亿,可100%本地运行。其核心优势在于能一次性处理完整文档(最高支持40页),通过32K上下文窗口保留跨页的文本、公式、表格和阅读顺序,解决了传统OCR逐页处理导致信息断裂的问题。在标准基准测试中准确率达93%(较基线提升6个百分点),超过40页时错误率仍低于0.11,并支持多语言。模型在Hugging Face上月下载量超212万次,GitHub星标达1.46万。相比之下,亚马逊Textract、谷歌Cloud Vision等云服务通常按页收费,而此模型可免费本地部署。
多来源证据
事件时间线
- Twitter/X AI List百度刚开源了一个OCR模型,能一次性读完40页文档。