90.2%!国产智能体登顶OSWorld双榜,Computer-Use Agent成功率首破九成

数字经济观察网 小小
2026年7月27日,全球AI智能体权威基准OSWorld排行榜更新,榜首位置被中国团队占据。国内AI企业实在智能自研的“实在Agent”以90.2%的成功率,拿下总榜与Agentic Framework分榜双料冠军,刷新了由OpenAI、Anthropic、Meta等海外巨头保持的公开纪录。

2026年7月27日,全球AI智能体权威基准OSWorld排行榜更新,榜首位置被中国团队占据。国内AI企业实在智能自研的“实在Agent”以90.2%的成功率,拿下总榜与Agentic Framework分榜双料冠军,刷新了由OpenAI、Anthropic、Meta等海外巨头保持的公开纪录。

OSWorld榜单数据显示,该分数领先第二名6.6个百分点,是这一基准自2024年发布以来,首个突破90%大关的计算机使用智能体。

01 OSWorld:AI的“计算机驾照考试”

OSWorld由香港大学、卡内基梅隆大学、滑铁卢大学等机构于2024年在人工智能顶级会议NeurIPS发表,是目前全球公认的“Computer-Use Agent”核心评测基准。

与仅支持网页交互或API调用的传统基准不同,OSWorld在真实Ubuntu虚拟机中部署Chromium、LibreOffice、GIMP、VS Code等应用程序,设置361个实战任务,覆盖办公、编程、UI设计、系统运维全场景。任务是否完成由机器自动判定,无人工主观干预,评测结果客观透明,这使其成为全球科技企业验证智能体实景作业能力的核心标尺。

各大厂发布旗舰模型时几乎必引OSWorld成绩:OpenAI发布GPT-5.4时强调“首次超越人类”,Google发布Gemini 3.6 Flash时标注“83%全场最高分”,Anthropic发布Claude Sonnet 5时突出“81.2%”。

回顾这一榜单的迭代曲线,整个行业的进步速度一目了然:

●2024年,最强智能体成功率仅12.2%;

●2025年先后攀升至22.0%、72.6%,首次超越人类操作基线;

●2026年5月推高至83.6%;

●两个月后,实在Agent将这一数字改写为90.2%。

02 三个数字看清领先身位

在OSWorld全部361个任务中,实在Agent拿下325.59分,整体成功率90.2%。拆解细分领域,其优势并非“偏科”,而是多点领先、核心难点场景大幅拉开差距。

日常高频场景稳居行业顶尖水平:LibreOffice Calc表格处理46.0/47,Writer文档编辑22.0/23,Impress演示文稿42.96/47,VS Code编程22.0/23,VLC多媒体16.89/17,Thunderbird邮件处理13.0/15。这些场景构成了扎实的技术基本盘。

真正拉开分差的,是OSWorld中公认最具挑战性的三类任务:

跨应用协同:93个任务拿下78.81分。这一场景模拟真实办公中繁琐的跨系统流程——Chrome下载文件、LibreOffice编辑数据、截图存档、Thunderbird发送邮件,要求智能体在四五个软件间连续穿梭,对长链路规划与执行能力是极高考验。

图像处理:GIMP非标准界面任务26题中拿下24题,成功率92.3%。GIMP界面充满浮动面板和非标准工具栏,堪称视觉识别的“噩梦级”场景。这一成绩显示出其在非标准界面理解和像素级操作上的突出能力。

系统底层操作:24个任务实现100%满分零失误,覆盖进程管理、权限修改、命令行操作等场景。这些任务“错一步即全盘皆输”,满分表现体现了底层执行闭环的极高稳定性。

03 登顶背后的“Harness密码”

90.2%的成绩背后,一条行业共识逐渐清晰:Agent=Model+Harness。

模型是“大脑”,负责推理与决策;Harness则是包裹模型的完整工程框架——任务拆解、状态管理、工具调用、失败恢复、安全校验,所有让智能体“不掉链子”的机制都归属其中。行业中有句直白的判断:模型决定天花板,Harness决定能不能落地。

这一判断有扎实的实证支撑。Stanford、清华等机构的研究表明,在同一底层模型下,仅优化Harness工程设计,OSWorld等基准上的性能差距可达6-17个百分点。Pi Research的受控实验更为极端:仅改变Harness传递给模型的编辑工具格式,某模型在代码基准上的成功率就从6.7%飙升至68.3%,增长近10倍。Anthropic在工程博客中也明确指出:“当我们评估一个智能体时,我们评估的是harness和model一起工作。”

实在Agent此次提交的是Agentic Framework方案,即通过结构化工作流将通用模型组织为可协作的智能体系统。从其技术路线来看,实在智能自2018年起深耕自动化赛道,长期打磨“API优先、GUI兜底”的类人操作逻辑和多模态感知执行闭环,已在企业客户侧积累了大量真实桌面环境的操作数据、异常处理机制和行业流程模板。这些正是Harness工程迭代最核心的“原材料”——它不是一次技术突击的产物,而是长期工程积累的外显。

有产业分析人士指出,当模型基础能力逐渐拉平,Harness工程化正在成为决定智能体“能不能真干活”的核心变量。对于具备自动化背景、拥有大量真实交互数据的厂商,这是一个结构性窗口。

04 从“驾照高分”到“生产力落地”,还有多远

OSWorld的90.2%,无疑是一次里程碑式的技术验证。

但也需要清醒看到,OSWorld本质上是智能体在受控环境下的“计算机驾照考试”——Ubuntu虚拟机环境干净、任务边界清晰,变量可控。而真实企业的财务、HR、供应链等场景中,充斥着软件版本更新、随机弹窗、系统通知抖动、网络延迟卡顿等非标准干扰。一个直观的对照是:9.8%的失败率放在真实业务中,可能意味着发错一封邮件、填错一笔付款金额——任何一次小概率失误,都可能引发连锁业务风险。

这正是当前行业共同面对的核心命题:榜单高分如何转化为工业级可靠的生产力?

从技术路径来看,答案指向一个清晰的工程方向。实在Agent已在自主执行基础上,构建了人机协同与安全断路器机制——在涉及高风险、敏感数据的操作时自动提权确认,提供操作撤销与回滚能力,不断将工业级可靠性推向99.99%。这背后不是单个环节的修补,而是从任务感知、决策校验到失败恢复的全链路确定性加固。与此同时,跨操作系统与复杂动态环境的抗干扰能力、端云混合推理的成本压降、全链路操作审计与合规,共同构成了智能体从“能用”走向“敢用”的工程拼图。

结论很清楚:当模型能力逐渐同质化,智能体竞争已从“拼参数”进入“拼确定性”阶段。谁能把实验室的90.2%兑现为真实产线上稳定输出的99.99%,谁才能真正定义这个赛道。实在Agent此次登顶,拿到的是一张通往产业深水区的入场券——真正的较量,现在才开始。

请扫码关注数字化经济观察网
责编:左翊琦
参与评论
文明上网,理性发言!请遵守新闻评论服务协议
0/200