Alpha Pulse New

AI 产品

GPT-5.6 Luna Max在DeepSWE v1.1测试中表现优于Sonnet 5 Max且成本更低

首次出现 8月17日 06:31·最近更新 8月17日 06:31

根据提供的证据,GPT-5.6 Luna Max在DeepSWE v1.1测试中得分67.2%,比Sonnet 5 Max高出13.3分,同时每任务成本为0.61美元,而Sonnet 5 Max的成本是其44倍。DeepSWE v1.1是一个基准测试,评估编码代理在113个原创的长周期工程任务上的表现。此外,Luna还比Gemini 3.7 Flash Medium高出1.7分,成本低70%。这些事实基于社交媒体帖子,来源为Twitter/X AI List,官方性未确认,因此需谨慎对待。

多来源证据

事件时间线

  1. 8月16日 23:00
    Twitter/X AI List
    GPT-5.6 Luna Max在DeepSWE v1.1上得分比Sonnet 5 Max高13.3分,而Sonnet成本高44倍。
返回新闻流