实在Agent实现OSWorld里程碑式突破。
2026年7月27日,一款来自中国的智能体,实在Agent以90.2%的成功率登顶OSWorld榜单,同时拿下总榜与分榜双料冠军,刷新了Meta、Anthropic、OpenAI等硅谷巨头保持的公开最高纪录。
这是OSWorld自2024年发布以来,全球首个突破90%成功率的Computer-Use Agent。
这个数字背后的技术路径,比排名本身更值得关注。
1.一个从12%到90%的陡峭曲线
OSWorld由香港大学、卡内基梅隆大学、滑铁卢大学等机构发表于人工智能顶会NeurIPS 2024。与仅支持网页交互或API调用的传统基准不同,OSWorld是首个可扩展的真实计算机环境,支持在Ubuntu、Windows、macOS三大操作系统上进行任务配置、执行式评估和交互学习。
它能够作为一个统一、集成的计算机环境,用于评估涉及任意应用程序的开放式计算机任务。
基于该环境,OSWorld团队构建了包含369个计算机任务的基准,任务来源于真实计算机使用场景,涉及网页应用、桌面应用、操作系统文件I/O以及跨多应用的工作流。每个任务均包含详细的初始状态配置和执行式评估脚本,确保评估的可复现性。其中8个Google Drive任务因网络依赖可能需要人工配置,实际评测中可按361个任务统计。
在评测机制上,OSWorld采用基于执行的自动化评估——任务是否完成由机器脚本闭环校验,没有任何人工评价的主观偏差。
OSWorld团队在论文中披露了一项关键对比数据:在同样的任务集上,人类操作员可以完成超过72.36%的任务,而当时最强的LLM/VLM智能体仅达到12.20%的成功率——且其困难主要集中于GUI定位能力和操作知识的匮乏。
拆解实在Agent的得分,更能看清它的领先从何而来。OSWorld的任务可按应用领域和操作类型进行拆解分析,其中最具挑战性的类别包括:
跨应用协同:93个任务拿下78.81分,领先第二名近10个百分点。这一场景模拟的是真实办公中最繁琐的跨系统流程——Chromium下载文件、LibreOffice编辑数据、截图存档、Thunderbird发送邮件,要求智能体在多个软件间连续穿梭,对长链路规划与执行能力是极高考验。
非标界面图像处理:GIMP的26个任务中拿下24个,成功率92.3%。GIMP界面充满浮动面板和非标准工具栏,堪称视觉识别的“噩梦级”场景。
系统底层操作:24个任务实现100%满分零失误,覆盖进程管理、权限修改、命令行操作。
90.2%这个数字的意义,不仅在于刷新纪录,更在于它跨越了一条隐性的产业红线。而在这个高分背后,一个更深层的技术趋势正在浮出水面。
2.Harness:
决定智能体“能不能落地”的隐形引擎
为什么率先冲过90%关卡的是一家具备Computer Use背景的中国团队,而非硅谷的通用大模型巨头?
答案藏在行业正在形成的一个新共识里:Agent = Model + Harness。
模型是“大脑”,负责推理与决策;Harness则是包裹模型的完整工程框架——任务拆解、状态管理、工具调用、失败恢复、安全校验,所有让智能体“不掉链子”的机制都归属其中。
这一判断有扎实的实证支撑。斯坦福大学与清华大学的研究表明,在同一底层模型的前提下,仅因Harness设计不同,智能体的表现差距可达6%至17%。在编码基准测试中,同一模型仅改变Harness设计,解决率可从约5%跃升至30%以上。
2025年底至2026年初,Harness Engineering从行业前沿概念迅速成为AI工程领域的重要范式转移,随后OpenAI通过技术博客将其推向主流视野。至2026年上半年,这一理念已成为Anthropic、OpenAI、LangChain及国内多家科技公司的实践共识。
中信证券在近期研报中指出,Agent正从“回答问题”走向“交付结果”,模型决定智能上限,而Harness决定模型能力能否稳定、可控、低成本地转化为真实成果。Harness的核心价值一方面在于降低使用门槛,另一方面在于沉淀高质量长程任务轨迹与反馈数据,反哺模型和产品持续优化。
如果说大模型是发动机,Harness就是变速箱、转向系统和刹车——没有这套工程系统,再强大的引擎也无法平稳上路。
3.八年沉淀:实在Agent如何构筑
Harness的“数据飞轮”
理解了Harness的重要性,一个问题自然浮现:一家中国Agent企业如何将它变成一套可运行的工程体系?
实在Agent来自于实在智能这家总部位于杭州的企业,是一家专注于通过“Computer Use”技术打造“数字员工”的企业。在OSWorld登顶之前,实在Agent已通过中国信通院“可信AI智能体平台和工具”评估,获得当前最高评级5级。
八年深耕企业自动化赛道,实在Agent沉淀下来的是一整套“会生长的”Harness工程体系。
第一性原理:API+GUI双轨并行。
实在Agent的核心执行逻辑是“API可行则调用API,无API则GUI可视化操作”。这套逻辑看似简单,背后却是对真实企业IT环境的深刻理解——大量企业老旧系统缺乏开放API,重构接口成本高昂。
实在Agent通过自研的ISSUT(智能屏幕语义理解)技术,让AI能像人一样“看懂”屏幕上的UI界面,在没有数据接口的情况下也能精准获取数据、操作软件。这种“API+GUI”的双轨能力,让智能体能够“短、平、快”地接入企业既有系统。
真实场景的数据飞轮。
过去八年,实在Agent已服务超6000家企业,涵盖大量世界500强、央国企与行业龙头——在人力资源管理岗位上协助筛选简历,在制造业车间自动采集生产数据,在银行系统里精准核对账目,在电商平台中智能调度库存。
每一次真实场景的运行,都是一次Harness的练兵——异常报错如何处理,流程卡顿如何恢复,边界案例如何兜底。千万级异常场景的迭代优化,让实在Agent具备了实验室模型难以企及的“实战免疫力”。
从自动化到Agent的工程跃迁。
实在智能的八年,恰好也是企业自动化从向AI Agent演进的关键周期。自动化时代的流程编排、异常处理、系统集成经验,被完整地继承并升级为Agent时代的Harness能力。这种“工程基因”的延续,是纯粹的模型公司短期内难以复制的。
4.从技术领跑到产业落地的三个命题
当智能体在OSWorld这样的标准化实验室环境中证明了自己能“把事办成”,真正的考验才刚刚开始——从沙盒环境走向企业真实生产线,从361个标准化任务走向千变万化的实际业务场景。越过90%红线之后,智能体赛道的竞争重心正在发生转移。
从产业视角看,接下来的较量将在三个维度展开:
命题一:智能体落地应用的最后一公里
智能体真正的考场,是企业生产线。实在Agent早已不是实验室里的样品——它已经在数千家企业的真实业务场景中跑了起来,覆盖制造、电商、能源、跨境、医药、物流运输等核心行业。
这需要在Harness层面构建一整套工业级保障机制:“安全断路器”在检测到异常执行路径时自动熔断,防止错误扩散;高风险操作触发“人机协同确认”机制,关键决策点交由人类复核;一键撤销回滚能力确保每一次错误操作都可逆、可恢复。
实在Agent在自主执行的基础上,构建人机协同熔断机制——在涉及高风险、敏感数据的操作时自动提权确认,提供“操作撤销与回滚”能力,不断将工业级可靠性推向99.99%。
命题二:算力ROI,技术可行性必须转化为商业可行性
实验室跑分可以不计成本——调用最贵的模型、消耗最多的Token、花最长的时间,只为把分数推高一个百分点。但企业部署必须算账。
一个现实问题是:如果一个智能体完成一项任务所消耗的API调用成本,已经超过了雇佣人类员工来完成同样任务的工时成本,那么这项技术在经济上就不成立。
因此,如何通过“端侧轻量视觉模型+云端高阶大模型”的混合分流架构,将单次动作的Token成本与响应延迟压缩至人力成本以下,是商业化的必答题。Harness层面的工程优化——哪些任务用轻量模型即可胜任、哪些场景必须调用顶尖模型、如何通过缓存和复用减少重复计算——将直接决定智能体业务能否算得过来账。
实在Agent在OSWorld中的高分,部分正得益于其Harness层面的混合模型调度策略——在简单任务上调用轻量级模型快速完成,仅在复杂跨应用场景中启用高阶模型进行深度推理。这种“端云协同”的算力分配方式,使其在保持高成功率的同时,将单次任务的平均推理成本控制在商业可行的区间内。
命题三:从单点智能到智能体网络,价值的指数级释放
单个智能体的能力是孤立的节点。一家制造业需要的是:一个智能体负责制单,另一个排期,第三个反馈信息给销售——它们之间不是各自为政,而是围绕同一个业务流程协同运转,共享上下文,彼此触发,形成一张有机的智能体网络。
而构建这张网络,对Harness提出了全新的工程要求:智能体之间如何共享状态与上下文,任务如何在不同智能体之间动态路由,冲突的执行指令如何仲裁,多个智能体如何围绕同一目标进行协同规划——这些已远远超出了“单个智能体完成任务”的能力范畴。
这恰恰是实在智能在行业know-how方面的积累所在。实在Agent已在多个行业部署运行,覆盖不同场景、不同系统、不同业务逻辑——这些分散在不同企业中的“智能节点”,正在逐步被连接成一张网络。跨行业的部署经验、异构系统的适配能力、以及千万级异常场景的工程锤炼,构成了实在智能从“单点智能”走向“智能体网络”的独特基础设施优势。
AI智能体网络,将成为继电网、互联网之后人类历史上的第三张全球网络,成为人类社会的“智能基建”。它会像电力和互联网一样,成为所有产业之下的新底座,从根本上改变建立在其上的千行百业的产业秩序和价值链生态。
更深层的变化在于商业模式的颠覆。过去二十年,企业软件的商业模式以SaaS卖账号为主。当智能体具备接管操作系统的能力后,企业的付费逻辑或将从购买软件许可,转向按照AI完成的任务成果来买单——从Per-Seat到Per-Outcome,这不是一个定价策略的调整,而是整个企业软件价值交付体系的重构。
OSWorld 90.2%的纪录,是AI从“对话框里的文字游戏”走向“接管屏幕、交付结果”的里程碑。
但通往产业落地的道路才刚刚铺开。下一个阶段的竞争,不属于跑分最高的模型,而属于最懂如何让模型在真实生产环境中“稳定地把事办成”的Harness。
在这场竞赛中,中国团队在工程化落地、GUI多模态操控与真实工作流打通上展现出的攻坚能力,正在定义下一代企业级软件与数字劳动力市场的新规则。
(封面图来源:AI生成)
END.
精彩评论