AI 产品
Grok 4.6版本在基准测试中表现退步:通过率下降,延迟翻倍
根据测试数据,AI模型Grok 4.6在RipplingBench基准测试中表现不如前一版本Grok 4.5。测试运行了2100次带评分的任务,显示Grok 4.6的通过率从87.3%下降至85.9%,中位数响应延迟从71秒增加到131秒。此外,Grok 4.6错误率更高,频繁出现“出了点问题”的提示,并拒绝回答良性问题(如询问销售部门Google Workspace访问权限),还产生不完整输出但声称任务成功。这些是已确认的测试事实。讨论部分,作者推测表现退步可能与提示调优有关,并认为这些模型在日常业务任务上已接近帕累托前沿,即当前可能达到最优权衡点。详细数据和任务背景可参考原始帖子。
多来源证据
事件时间线
- Twitter/X AI List今天我们运行了2100次带评分的Grok 4.6测试。与4.5相比,通过率从87.3%退步到85.9%,中位数延迟几乎翻倍(71秒 → 131秒)