从对话到操作:智能体在真实操作系统中的能力如何被量化评估
2024年之前,衡量AI能力的方式相对单一——问答准确率、代码生成通过率、数学推理得分。但这些指标衡量的都是“知道什么”,而非“能做什么”。
当智能体从对话框走向电脑屏幕,从“回答问题”转向“操作软件”,一个根本性的问题浮现出来:如何量化评估一个AI在真实操作系统中完成实际工作的能力?
OSWorld的出现,为这个问题提供了一套系统性的答案。
一、为什么需要新的评估方式?
传统AI评估的局限在于:它假设任务可以在一轮交互中完成,且输出形式是文本。但计算机使用智能体(Computer-Use Agent)的工作方式完全不同——它需要观察屏幕、移动鼠标、点击按钮、输入文字,在真实的操作系统中像人类一样操作各类软件,完成跨应用的长链路任务。
这种“操作型”能力,无法用传统的问答或代码生成测试来衡量。
正如OSWorld研究团队所指出的,当时缺乏一个可扩展的真实计算机环境来评估多模态智能体在开放式计算机任务上的表现。
行业需要一个统一的基准——让不同的智能体在同样的真实环境中完成同样的任务,用同样的标准判定成败。

二、OSWorld如何量化评估智能体能力?
OSWorld的评估框架可以拆解为三个核心层次。
-
第一层:真实环境,而非模拟沙盒。
OSWorld不采用简化的模拟环境,而是让智能体在真实的Ubuntu操作系统中运行。被测试的智能体需要像人类一样,通过观察桌面、控制鼠标键盘、与真实应用程序交互,来完成自然语言指令所描述的任务。
这种设计撕下了传统测试的“温室保护罩”——智能体面对的不是预设好的API接口,而是充满不确定性的真实软件界面。
-
第二层:361项实战任务,覆盖高频场景。
OSWorld构建了369个真实计算机任务,涉及真实的网络应用、桌面应用、操作系统文件I/O和多应用工作流。其中8个涉及Google Drive的任务因网络依赖被排除,最终以361项任务作为标准评测集。
这些任务由专家精心设计,涵盖办公、编程、UI设计、系统管理等高频场景。任务类型从单应用内的简单操作,到跨越多应用的长链路工作流,难度梯度覆盖了从基础到高阶的全频谱。
-
第三层:执行式自动验证,排除主观偏差。
OSWorld最关键的评估设计在于其验证机制——每个任务均配备可执行的自动校验脚本。智能体是否真正完成任务,由机器根据预设的验证标准自动判定,而非依赖人工评价。
这种“执行式评估”(execution-based evaluation)确保了评估结果的客观性和可重复性。智能体做对了就是做对了,做错了就是做错了,没有模糊地带。
这种三层架构——真实环境、实战任务、自动验证——共同构成了OSWorld作为量化评估工具的核心价值。它衡量的不是智能体“知道什么”,而是智能体“在真实电脑上能做成什么”。
三、90.2%:一个量化分数背后的能力全景
2026年7月,实在Agent在OSWorld全部361项任务中拿下325.59分,总成功率90.2%。这个量化分数背后,是多项具体能力的系统体现。
-
跨应用协同能力。在93个跨应用任务中,实在Agent获得78.81分。这类任务模拟的是真实办公中最繁琐的流程——在Chrome、LibreOffice、Thunderbird等多个软件之间连续切换完成一个完整工作流。
-
图像处理能力。在GIMP的26个图像处理任务中拿下24个,成功率92.3%。GIMP界面充满浮动面板和非标准工具栏,对视觉理解是极大的考验。
-
系统底层操作能力。在24个系统底层操作任务中实现满分——文件权限修改、进程管理等操作“错一步即全盘皆输”,满分反映了执行链路的极高稳定性。
这三个维度的得分共同说明:OSWorld的量化评估不是单一维度的“通过率”,而是对智能体在真实电脑操作中各项能力的系统扫描。
90.2%这个数字之所以有说服力,正是因为它背后有361个具体任务的支撑——每一个任务都是一次独立的“能力采样”。

四、量化评估的价值与局限
OSWorld式的量化评估,对智能体行业的意义在于三个层面。
-
第一,建立了“可比较”的行业标尺。
在OSWorld出现之前,不同团队开发的智能体缺乏统一的比较基准——“我的智能体比你的强”往往只是主观判断。OSWorld的出现让“强多少”变得可量化、可验证。
OpenAI的Computer-Using Agent在OSWorld上得分为38.1%,Anthropic的Computer Use同样以OSWorld作为基准——同一个考场、同一套试卷、同一个阅卷标准,分数高低一目了然。
-
第二,驱动了技术方向的聚焦。
361项任务的细分得分,可以帮助研究团队识别能力短板。是跨应用协同拖了后腿,还是图像处理有待加强?量化评估让技术迭代有了明确的方向感,而非盲目试错。
-
第三,为产业落地提供了参考依据。
企业在选择智能体方案时,不再仅凭厂商的宣传话术做判断——OSWorld的量化分数提供了一个可验证的第三方参考。361项任务覆盖的场景越全面,这个参考价值的说服力就越强。
当然,量化评估也有其边界。OSWorld衡量的是智能体在受控测试环境中的表现,而真实企业场景中的干扰因素——软件版本更新、随机弹窗、网络波动——远比测试环境复杂。
OSWorld 2.0的发布本身也说明了行业对“更长周期、更复杂任务”评估需求的认知。但从“无法衡量”到“可以衡量”,OSWorld已经迈出了关键的一步。
openEuler 是由开放原子开源基金会孵化的全场景开源操作系统项目,面向数字基础设施四大核心场景(服务器、云计算、边缘计算、嵌入式),全面支持 ARM、x86、RISC-V、loongArch、PowerPC、SW-64 等多样性计算架构
更多推荐


所有评论(0)