AI 产品
AI基准测试因等待Gemini 3.5 Pro发布而推迟运行
基于Twitter/X AI List上的用户分享,一位用户表示推迟了一个被视作衡量LLM能力良好指标的基准测试,以等待Google的Gemini 3.5 Pro模型发布。但用户最终决定不再等待,因为该基准测试每个匹配包含8个LLM,即使Gemini 3.5 Pro很快发布,也不会立即添加到测试中。这反映了AI社区对新模型发布的关注和基准测试安排的调整,属于讨论而非已确认事实。
多来源证据
事件时间线
- Twitter/X AI List我推迟运行这个基准测试,我认为这是一个很好的单一基准测试来衡量LLM能力,同时等待Gemini 3.5 Pro发布