AI 产品
文档提取系统感知盲点研究:ExtractBench基准测试揭示性能差异,Agentic Plus表现最佳
一项名为ExtractBench的基准测试评估了14个文档提取系统在处理非数字化文档时的性能。测试文档包括1950年代的监管文件、手写税表以及因传真、复印机、传感器噪声和手机相机捕获而退化的页面。研究发现,不同系统的感知盲点不重叠:Codex在扫描和手写文档上准确率超过93%,但在旋转或纯图像页面上降至约80%;专业API在旋转和手写上表现良好,但扫描文档准确率仅为81%;Gemini 3.5 Flash在扫描时准确率从88.6%下降到71.1%。相比之下,新推出的Agentic Plus系统在所有类别中均表现优异,准确率在95.9%至93.8%之间,波动仅2个百分点,而其他系统波动超过10个百分点。这表明生产环境中处理老旧或退化文档时,需要关注系统盲点并选择无盲点的解决方案。
多来源证据
事件时间线
- Twitter/X AI List每个文档提取系统都有一个感知盲点。我们绘制了它们。 在ExtractBench中,我们测试了14个系统在处理非数字化文档时的表现:19