中国智能体登顶全球OSWorld榜单,90.2%刷新世界纪录
钛媒体注:本文来自微信公众号实在智能(ID:aiindeed),钛媒体经授权发布。
2026年7月27日,OSWorld榜首易主,归中国团队。
中国芯智能体“实在Agent”,以90.2%的成功率登顶。历史最高分,首个突破90%大关的智能体。
实在Agent同时拿下总榜第一与Agentic Framework分榜第一,实现双冠。刷新了海外巨头Meta、Anthropic、OpenAI等保持的公开最高纪录。

OSWorld排行榜总榜(按得分排序)
01
OSWorld:AI的“计算机驾驶执照考试”
OSWorld是目前全球公认的“Computer-Use Agent”权威基准,由香港大学、卡内基梅隆大学、滑铁卢大学等机构于2024年发表于人工智能顶级会议NeurIPS。
核心定位是让AI智能体在真实的操作系统中,像人类一样通过鼠标、键盘、屏幕截图等接口,完成跨应用的复杂任务。
与仅限网页或API调用的传统基准(如WebArena、MiniWoB++等)不同,OSWorld提供的是完整的真实桌面沙盒环境。
OSWorld基准测试包含361个由专家精心设计的实战任务,涵盖办公、编程、UI设计及系统管理等高频场景。
智能体是否完成任务,均由机器判定,没有任何人工评价的主观偏差,这也是OSWorld成为权威评测基准的主要原因之一。
各大厂在发布旗舰模型时几乎都会引用OSWorld成绩。例如OpenAI发布GPT-5.4时强调“首次超越人类”,Google发布Gemini 3.6 Flash时强调“83%全场最高分”,Anthropic发布Claude Sonnet 5时强调“81.2%”。
回顾OSWorld过往最好成绩,这条曲线见证了整个行业的发展:

2024年:OSWorld刚发布,GPT-4o、Claude-3.5-Sonnet等当时最强智能体的成功率仅12.2%;
2025年5月:UI-Evol增强智能体达到22.0%;
2025年12月:Simular Agent S2达到72.6%,首次超过72.36%的人类基线;
2026年5月:Pointer达到83.6%,再创新高;
2026年7月:实在Agent达到90.2%,登顶OSWorld双榜。
两年时间,从12%到83%,这条曲线已经非常陡峭。而实在Agent的90.2%——在顶端,再跃一步,标志着Computer-Use Agent正式迈入“超高可靠性”的新阶段。

OSWorld首创多模态计算机环境
02
三个数字看懂实在Agent的统治力
在OSWorld全部361个硬核实战课题中,实在Agent最终拿下了325.59分(总成功率 90.2%)。

拆解细分领域得分,实在Agent呈现出一种“多点领先、核心场景大幅领先”的格局:
1. 常用办公与编程场景
表格与文档(Calc/Writer):LibreOffice Calc拿下46.0/47,Writer拿下22.0/23;
编程与多媒体(VS Code/VLC):VS Code拿下22.0/23,VLC播放器拿下16.89/17;
演示与邮件(Impress/Thunderbird):Impress演示文稿拿下42.96/47,Thunderbird邮件处理拿下13.0/15。
在这些日常高频场景中,实在Agent保持着高完成度与稳定领先,奠定了扎实的技术基本盘。
2. 核心难点场景
在这之外,真正让我们在榜单上拉开差距的,是OSWorld中公认最难、最考验智能体硬实力的三个“地狱级”场景:
跨应用协同(multi_apps):78.81/93
这是任务量最大、最易出错的场景(93个任务)。实在Agent获得78.81分,领先第二名近10个百分点。它模拟的是真实办公中最繁琐的跨系统流程:Chrome下载文件 → LibreOffice编辑数据 → 截图存档 → Thunderbird发送邮件。这种需要连续穿梭四五个软件的长链路任务,展现了实在Agent卓越的长链路规划能力。
图像处理(gimp):24.0/26
GIMP界面充满了浮动面板、非标准工具栏和像素级微操,堪称视觉AI的噩梦。在26个任务中,实在Agent拿下24个(成功率92.3%),证明了我们在非标准界面视觉理解上的深厚积累。
系统底层操作(os):24.0/24 (100%满分)
在文件权限修改、进程管理、命令行操作等“错一步即全盘皆输”的任务中,我们实现了零失误,反映了底层执行闭环极高的稳定性。
跨应用领先=长链路规划力。GIMP领先=非标准界面理解力。系统满分=执行闭环可靠性。三项能力叠加,构成了实在Agent在OSWorld上的整体优势。

03
登顶的背后是“八年磨一剑”
智能体领域有一个行业共识:Agent = Model + Harness。
模型(Model)是发动机,提供通用智力和原始动力;Harness(工程套件/整车架构)则是方向盘、变速箱、刹车与安全系统,是把智力转化为“可靠行驶”的完整工程体系。
为什么Harness如此关键?在Stanford、清华等机构的论文中有一个研究证明:在同一个底层模型的前提下,仅改进Harness工程设计,在OSWorld等基准上的性能差距可达6-10个百分点;而在某些复杂任务上,将原生代码Harness优化为自然语言与范式结合的Harness,同一模型的得分甚至能从30.4%跃升至47.2%,差距接近17个百分点!
这说明当模型能力逐渐同质化,Harness工程化才是决定智能体“能不能真干活”的核心变量。
但Harness的可靠性,从来不是某一次技术突破的偶然,而是长期的企业场景沉淀、操作数据积累和工程化迭代的必然。实在智能做智能体有一个“第一性原理”——你不能干的,我能不能干?谁的能力边界更广,谁的成本更低、效率更高?
面对真实的操作环境,API能跑通就跑API,API跑不通就用GUI——像人一样看屏幕、点鼠标,把数据拿回来,把事办成。这套“多模态”的Harness能力,是实在智能从2018年成立第一天起就在打磨的基本功。
此外,作为自动化领域的行业领头羊,实在智能已服务了超6000家企业客户,90%为世界500强、央国企、上市企业和地方龙头。这意味着实在智能已在客户侧积累了海量真实桌面环境的操作数据、异常处理机制和行业流程模板。这些场景和数据,正是Harness工程迭代最宝贵的原材料。
因此,实在Agent能拿下90.2%,不是单一模型参数的胜利,而是八年深耕自动化领域的行业Know-how、海量真实业务数据以及Harness工程体系三者叠加的必然结果。

04
从基准高分走向生产力真正落地
OSWorld榜单的登顶,是技术演进的重要里程碑,但它绝不是终点。
如果说OSWorld是智能体考取“计算机驾照”的考场,那么真正的考验,在于能否驶入复杂、多变的企业真实生产环境。从“榜单高分”到“产业落地”,实在Agent的突破正指向智能体演进的下半场:
1. 从90.2%到工业级99.99%的可靠性跨越
在真实企业的财务、HR或供应链场景中,哪怕9.8%的失败率也可能引发重大业务风险(如发错邮件、错填付款金额)。实在Agent在自主执行的基础上,构建人机协同与安全断路器机制——在涉及高风险、敏感数据的操作时自动提权确认,提供“操作撤销与回滚”能力,不断将工业级可靠性推向99.99%。
2. 跨操作系统与复杂动态环境的抗干扰能力
OSWorld建立了优秀的Ubuntu虚拟机基准,而工业界真实的办公环境充满了软件版本更新、随机广告弹窗、系统通知抖动、网络延迟卡顿等非标准干扰因素。智能体的落地价值,在于即使界面样式微调、弹窗突然打断,也能像人类员工一样灵活应对、自主纠错。
3. 可算账的商业ROI与全链路安全合规
通过端侧轻量模型与云端VLM的混合调度,实在Agent在降低Token推理成本与响应延迟上持续优化,让智能体的运行成本远低于人力成本。同时,打造符合企业级安全标准的沙盒隔离环境与全链路可审计日志,确保智能体每一次点击、输入都可追溯、可归因、可合规。
OSWorld的90.2%,不仅代表着中国团队在智能体工程赛道上的断层领先,更宣告了AI正在摆脱“只会聊天”的对话框形态,真正接管屏幕,成为能够驱动复杂软件系统、创造实际经济价值的数字劳动力。
让AI真正“会干活”,从基准高分走向生产力落地——这是登顶OSWorld的核心,也是实在智能八年未变坚守的底座。
高原之上,再建高峰。
加载中,请稍侯......