Alpha Pulse New

AI 产品

研究揭示编码代理框架对模型性能的关键影响:Codex在小型模型上表现不佳

首次出现 8月9日 12:34·最近更新 8月10日 08:01

一项研究测试了10个编码代理框架在GLM-5.2和Gemma-4两个模型上的表现,以评估框架对性能的影响。结果显示,Codex在GLM-5.2上排名第2(共10个框架),但在Gemma-4上降至第9位。更换框架可显著改变性能指标pass@1,在GLM-5.2上从23%提升至52%,在Gemma-4上从15%提升至36%,差距超过多数模型升级效果。两个模型的框架排名相关性为-0.05,表明无相关性。模型供应商提供的框架(如Codex、Claude Code、Qwen Code)在小模型上表现下降,而与模型无关的框架(如crush)则表现提升,例如crush在GLM-5.2上排名第7,在Gemma-4上排名第1。这些发现为已确认事实,表明框架选择对模型性能有重大影响,尤其在不同规模模型间。

多来源证据

事件时间线

  1. 8月7日 21:52
    Twitter/X AI List
    Codex在大型模型上过度优化:在GLM 5.2中排名第2(共10个),但在Gemma-4上降至第9位!
返回新闻流