AI 产品
Grok 4.6在AA-Briefcase基准测试中表现优异,成本显著低于其他领先模型
根据Twitter/X AI List上的帖子,AA-Briefcase是一个代理知识工作基准测试,用于评估模型在长期代理知识工作任务上的表现,测试集私有以避免污染。Grok 4.6在该基准上与Claude Fable 5表现相当,置信区间重叠,且成本更低:每项任务成本为$4.42,而Claude Fable 5为$22.30,Claude Opus 5为$17.79,Kimi K3为$6.73。帖子中包含评论称发布令人印象深刻,但来源非官方,需谨慎对待讨论部分。
多来源证据
事件时间线
- Twitter/X AI ListGrok 4.6在AA-Briefcase基准测试中取得显著进展,成本大幅低于其他领先模型