AI 产品
AI编程与金融评估基准SWE-Together与FrontierFinance发布
两项新基准SWE-Together和FrontierFinance近日发布,旨在更贴近现实地评估AI智能体能力。SWE-Together基于真实用户与AI的编程会话构建多轮对话基准,包含109个仓库级任务,采用响应式LLM用户模拟器进行回放。该基准将AI作为协作者评估,衡量最终通过率及用户干预次数,当前评估显示Claude-Opus-4.8在测试智能体中领先。FrontierFinance是规模最大的开源金融投资工作流评估基准,包含220个示例和11,543条专家制定的评分标准,覆盖从筛选到监控的全流程。测试涉及Claude、GPT、Gemini及多个开源模型。两项基准均强调在真实、复杂场景中评估AI的推理与执行能力。
多来源证据
SWE-Together介绍:一个基于真实用户-智能体编程会话构建的多轮对话基准
SWE-Together介绍:一个基于真实用户-智能体编程会话构建的多轮对话基准。 编程智能体通常像考生一样被基准评估:预先获得完整规格,然后根据最终代码评分。但真实的编码帮助是一个对话过程——用户会澄清目标、增加约束并在过程中调整方向。 SWE-Together将真实的编码工作转化为可复现、可验证的基准:从11,260个录制会话中精选109个仓库级任务,使用一个保留了原始用户意图的响应式LLM用户模拟器进行回放。 我们将智能体作为协作者而非仅仅是补丁生成器进行评估:衡量最终通过率以及达到该结果所需的用户干预次数。 在本次评估快照中,在测试的7个智能体中,Claude-Opus-4.8
FrontierFinance发布:规模最大、最具挑战性的开放式基准,用于评估AI智能体在完整投资工作流中的表现
FrontierFinance发布:规模最大、最具挑战性的开放式基准,用于评估AI智能体在完整投资工作流中的表现。 FrontierFinance比现有的金融基准更具挑战性:像FinanceBench和Finance Agent等现有基准几乎完全专注于数据提取。 FrontierFinance涵盖了整个投资过程中的多样化用例:筛选与发现、公司研究、行业/板块/宏观、收益与事件,以及覆盖范围与催化剂监控。 专为模糊、长期目标的智能体创建:220个示例配对11,543条专家制定的评分标准,遵循Samaya的Criteria Eval方法。评分标准使我们能够评估真正专家级输出背后的推理和步骤,
事件时间线
- Twitter/X AI ListSWE-Together介绍:一个基于真实用户-智能体编程会话构建的多轮对话基准
- Twitter/X AI ListFrontierFinance发布:规模最大、最具挑战性的开放式基准,用于评估AI智能体在完整投资工作流中的表现