AI 产品
公开最大规模自主代理迭代研究实验:模型性能对比与人类记录差距
一项由Twitter用户分享的公开实验,测试自主代理在研究环境中的迭代能力。实验扩展了运行时、计算、模型和工具多样性,并分享了详细跟踪数据等细节。比较了与OAI/Anthropic系统卡中的类似任务,如Anthropic优化LLM训练和OpenAI GPT 5.6的nanogpt任务。实验显示,尽管数据存在噪音,且任务和环境有差异,不同模型间仍有显著性能差距。其中,Fable 5模型缩小了与当前人类记录82%的差距,Kimi K3模型表现突出。目前正在运行Grok 4.6、DeepSeek V4 Pro、Muse Spark 1.2、Qwen 3.8 Max和GLM 5.3等模型,结果预计下周公布。
多来源证据
事件时间线
- Twitter/X AI List据我所知,这是自主代理在研究环境中迭代的最大公开实验 我们扩展了运行时、计算、模型的多样性