Alpha Pulse New

AI 产品

文档提取定位能力基准ExtractBench结果:多数API缺乏来源证据

首次出现 8月18日 03:00·最近更新 8月18日 03:00

ExtractBench基准测试评估了文档提取API的定位能力,即提取值的来源位置。测试采用严格评分标准:字段只有在值及其引用都正确时才计数,使用IoU 0.5的词级框。结果显示:视觉语言模型(VLMs)和编码代理在两个级别上均未返回任何证据,得分为零。在返回定位框的系统中,最佳词级F1分数低于50%。定位能力随文档长度显著下降,例如一个专用API在短文档上页级准确率为61.7%,在长文档上降至0.0%。LlamaExtract Agentic Plus表现领先,页级准确率84.9%,词级46.4%,并在长文档上保持87.1%,而其他系统准确率为零。该基准为文档提取领域提供了可跟踪的基线。

多来源证据

事件时间线

  1. 8月17日 23:59
    Twitter/X AI List
    大多数文档提取API无法告诉你一个值来自哪里。
返回新闻流