AI 产品
ExtractBench基准测试发布,揭示长文档提取挑战并推出Agentic Plus新解决方案
昨日,某公司发布了ExtractBench基准测试,涵盖370个企业文档和14个系统。测试发现,前沿视觉语言模型(VLMs)在处理长列表文档时,精确度高但召回率低,F1分数仅为8.9%至35.8%。主要问题在于缺失行而非错误值,导致抽样检查通过但大部分文档未提取。为此,公司推出了新的Agentic Plus提取层,通过迭代处理长文档,在长列表任务上达到96.1% F1分数,并保持随着文档长度增加的稳定性。所有信息基于证据,区分了已确认事实。
多来源证据
事件时间线
- Twitter/X AI List最危险的文档提取失败不是错误值,而是看起来没问题的缺失行。 我们昨天发布了ExtractBench:37