AI 产品
研究揭示编码代理框架对模型性能的关键影响:Codex在小型模型上表现不佳
一项研究测试了10个编码代理框架在GLM-5.2和Gemma-4两个模型上的表现,以评估框架对性能的影响。结果显示,Codex在GLM-5.2上排名第2(共10个框架),但在Gemma-4上降至第9位。更换框架可显著改变性能指标pass@1,在GLM-5.2上从23%提升至52%,在Gemma-4上从15%提升至36%,差距超过多数模型升级效果。两个模型的框架排名相关性为-0.05,表明无相关性。模型供应商提供的框架(如Codex、Claude Code、Qwen Code)在小模型上表现下降,而与模型无关的框架(如crush)则表现提升,例如crush在GLM-5.2上排名第7,在Gemma-4上排名第1。这些发现为已确认事实,表明框架选择对模型性能有重大影响,尤其在不同规模模型间。
多来源证据
事件时间线
- Twitter/X AI ListCodex在大型模型上过度优化:在GLM 5.2中排名第2(共10个),但在Gemma-4上降至第9位!