AI 产品
Muse Glimmer AI模型在智能体评估中落后同类,但工具使用表现突出
Muse Glimmer AI模型在多项评估中显示与同类模型的差距。在GDPval-AA v2智能体评估中,其Elo分数为953,低于Qwen3.6 27B和Gemini 3.5 Flash-Lite的1141。在Terminal-Bench v2.1上得分52%,落后于Qwen3.6 27B的61%。幻觉评估AA-Omniscience显示Muse Glimmer为82%,高于Qwen3.6 27B的49%和Flash-Lite的34%(较低更好)。其尺寸相当模型Gemma 4 31B在所有这些方面表现更差。例外是智能体工具使用,Muse Glimmer在Tau3-Banking评估中得分24%,领先于Gemini 3.5 Flash-Lite的18%和Qwen3.6 27B的17%。所有数据均来自评估结果,未涉及互动量或可信度讨论。
多来源证据
事件时间线
- Twitter/X AI ListMuse Glimmer与其同类模型的差距集中在智能体评估中:GDPval-AA v2上Elo分数953,而Qwen3.6 27B(Reasoning)和Gemini 3.5均为1141