Alpha Pulse New

AI 产品

OSWorld 2.0发布:新基准测试评估计算机使用代理在长期现实世界任务中的表现

首次出现 8月9日 01:34·最近更新 8月9日 01:34

OSWorld 2.0基准测试工具发布,用于评估计算机使用代理在长期现实世界任务中的能力。该测试包含108个真实工作流,每个工作流约需1.6小时完成,平均每个任务涉及约318次工具调用,相比OSWorld 1.0的约30次大幅增加。测试基于真实工件和状态用户档案,捕捉动态环境、流式交互、跨源推理等真实现象。当前最佳结果显示,Claude Opus 4.8达到最高准确率20.6%,而GPT-5.5更注重token效率但准确率约13%,表明无人能接近解决真实计算机使用问题。这些事实基于帖子内容,讨论点如“问题解决了吗”反映技术挑战。

多来源证据

事件时间线

  1. 6月26日 22:40
    Twitter/X AI List
    两年前,我们构建了OSWorld 1.0——成为计算机使用代理标准的基准测试。代理现在得分为83.5%。问题解决了吗? 甚至还没
返回新闻流