AI 产品
AI新基准AA-AnalystAgent发布:Claude Opus 5在定量分析测试中领先
AA-AnalystAgent是一个新的代理基准,用于测试AI模型在定量分析真实世界电子表格和文档方面的能力。该基准包含80个问题,涵盖14个商业和科学领域。测试结果显示,Claude Opus 5以54%的准确率领先,其次是GPT-5.5(50%)和Claude Fable 5(49%)。基准采用pass^5指标,要求模型在五次独立尝试中都正确完成任务,以确保一致性。证据来自Twitter/X AI List,非官方发布。
多来源证据
事件时间线
- Twitter/X AI List宣布AA-AnalystAgent,我们新的代理基准,用于定量分析真实世界的电子表格和文档。Claude Opus 5以54%领先,其次是