Alpha Pulse New

AI 产品

Grok 4.6在AA-Briefcase基准测试中表现优异,成本显著低于其他领先模型

首次出现 8月13日 02:00·最近更新 8月13日 02:00

根据Twitter/X AI List上的帖子,AA-Briefcase是一个代理知识工作基准测试,用于评估模型在长期代理知识工作任务上的表现,测试集私有以避免污染。Grok 4.6在该基准上与Claude Fable 5表现相当,置信区间重叠,且成本更低:每项任务成本为$4.42,而Claude Fable 5为$22.30,Claude Opus 5为$17.79,Kimi K3为$6.73。帖子中包含评论称发布令人印象深刻,但来源非官方,需谨慎对待讨论部分。

多来源证据

事件时间线

  1. 8月13日 01:55
    Twitter/X AI List
    Grok 4.6在AA-Briefcase基准测试中取得显著进展,成本大幅低于其他领先模型
返回新闻流