AI 产品
ExtractBench基准测试发布,揭示企业文档信息提取中商业VLMs的局限
应用研究团队推出ExtractBench,这是一个针对复杂企业文档信息提取的基准测试。测试了14个系统,包括前沿视觉语言模型(VLMs)、编码代理和提取API,覆盖370个企业文档、4869页、67种文档类型。测试完全确定性,无LLM裁判。关键发现:当文档超过50页时,商业VLMs的召回率降至35%以下,尽管精确度保持较高,但会遗漏大部分表格行。
多来源证据
事件时间线
- Twitter/X AI List介绍ExtractBench:最全面的企业文档信息提取基准测试。我们的应用研究团队测试了: