AI 产品
三个新AI模型在辩论基准测试中超越前代
根据Twitter/X AI List的报道,三个新的AI模型在辩论基准测试中表现优于其前代版本。具体来说,Grok 4.6的得分从1514提升至1628,增加了114分;DeepSeek V4 Pro 0813从1472提升至1596,增加了124分,为最大提升;Gemini 3.7 Flash从1431提升至1476,增加了45分。这显示了AI模型在辩论能力上的进步。
多来源证据
事件时间线
- Twitter/X AI List三个新模型在辩论基准测试中超越前代: Grok 4.6 较4.5版提升:1514 → 1628 (+114分)。 DeepSeek V4 Pro 0813 取得最大提升:1472 → 1596 (+124分)。 Gemini 3.7 Flash 较Gemini 3.5 Flash版进步:1431 → 1476 (+45分)。