7月29日,实在智能发布消息称,中国芯智能体“实在Agent”,以90.2%的成功率登顶OSWorld榜,为首个突破90%大关的智能体。实在Agent同时拿下总榜第一与Agentic Framework分榜第一,实现双冠,刷新了海外巨头Meta、Anthropic、OpenAI等保持的公开最高纪录。

OSWorld是目前全球公认的“Computer-Use Agent”权威基准,由香港大学、卡内基梅隆大学、滑铁卢大学等机构于2024年发表于人工智能顶级会议NeurIPS。核心定位是让AI智能体在真实的操作系统中,像人类一样通过鼠标、键盘、屏幕截图等接口,完成跨应用的复杂任务。
与仅限网页或API调用的传统基准(如WebArena、MiniWoB++等)不同,OSWorld提供的是完整的真实桌面沙盒环境。OSWorld基准测试包含361个由专家精心设计的实战任务,涵盖办公、编程、UI设计及系统管理等高频场景。智能体是否完成任务,均由机器判定,没有任何人工评价的主观偏差,这也是OSWorld成为权威评测基准的主要原因之一。
在OSWorld全部361个硬核实战课题中,实在Agent最终拿下了325.59分(总成功率 90.2%)。真正让其在榜单上拉开差距的,是OSWorld中公认最难、最考验智能体硬实力的三个“地狱级”场景:跨应用协同、图像处理跟系统底层操作。其中,跨应用协同是任务量最大、最易出错的场景(93个任务)。实在Agent获得78.81分,领先第二名近10个百分点。它模拟的是真实办公中最繁琐的跨系统流程:Chrome下载文件 → LibreOffice编辑数据 → 截图存档 → Thunderbird发送邮件。这种需要连续穿梭四五个软件的长链路任务,展现了其卓越的长链路规划能力。
作为自动化领域的行业领头羊,实在智能已服务了超6000家企业客户,90%为世界500强、央国企、上市企业和地方龙头。这意味着实在智能已在客户侧积累了海量真实桌面环境的操作数据、异常处理机制和行业流程模板。这些场景和数据,正是Harness工程迭代最宝贵的原材料。
实在智能表示,其Agent能拿下90.2%,不是单一模型参数的胜利,而是八年深耕自动化领域的行业Know-how、海量真实业务数据以及Harness工程体系三者叠加的必然结果。