ABot-AgentOS:一种具备终身多模态记忆的通用机器人智体操作系统
26年7月来自阿里高德视觉实验室的论文“ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory”。
尽管近期的视觉-语言模型(VLM)和视觉-语言-动作模型(VLA)提升了机器人的感知与动作预测能力,但长程具身智体仍需一个通用的运行时层,以支持推理、记忆、工具使用、验证及跨形态执行等功能。提出 ABot-AgentOS,这是一个位于底层控制器之上的通用机器人智体操作系统(Agent OS)。它提供一个具备深思熟虑能力的智体层,支持基于场景的规划、上下文隔离的技能执行、多阶段验证、多模态记忆以及边缘-云端协同。为评估此类系统,推出 EmbodiedWorldBench,这是一个包含 16 种场景(涵盖室内、室外及混合环境)和四种难度等级的可执行基准测试集,其中包含 200 多项任务,涉及导航、物体搜索、NPC 对话、动态事件及基于轨迹的评分机制。
ABot-AgentOS 进一步引入“通用多模态图记忆”机制,这是一种基于原始数据源的持久化底层架构,能够将对话、视觉观测、空间上下文、时间关系及任务轨迹转化为具有类型的节点与边。系统内置由失败驱动的自我进化循环,将诊断出的记忆故障转化为受控的运行时进化资产;这些资产仅在后续评估阶段启用,从而在实现持续改进的同时,避免了当前评估阶段出现“真值泄露”的问题。
在 EmbodiedWorldBench 的初步子集测试中,ABot-AgentOS 在任务成功率和目标完成率方面均优于单一控制器基线模型。在各项记忆基准测试中,ABot-AgentOS Static 版本表现优异:LoCoMo 得分为 87.5,OpenEQA (EM-EQA) 为 59.9,Mem-Gallery 为 88.6,NExT-QA 的 Acc@All 指标为 76.5;而通过自我进化机制,LoCoMo 得分进一步提升至 88.7,OpenEQA 升至 60.4,Mem-Gallery 升至 89.0。
1 架构概述
ABot-AgentOS 是一款专为具身智能设计的通用机器人智体操作系统(Agent Operating System),在机器人硬件和底层控制器之上提供一个“慎思型智体层”(deliberative agent layer)。ABot-AgentOS 并非旨在替代现有的控制技术栈,而是提供一个统一的认知层,能够跨越人形机器人、四足机器狗、移动操作机器人及机械臂等异构机器人平台,整合多模态感知、记忆、推理、规划与技能执行功能。
如图 1 所示,ABot-AgentOS 接收来自麦克风、移动应用、摄像头及其他传感器的多模态输入,并将其映射到感知、推理与行动的运行时循环中。该运行时系统采用“端云协同”的大语言模型(LLM)架构。在每一次交互轮次中,轻量级的“微型大模型”(Tiny LLM)在边缘端运行,实现低延迟的感知、指令理解、状态追踪及常规决策。当任务涉及更复杂的推理、长程规划或歧义消解时,系统可请求云端“大型大模型”(Large LLM)协助;云端模型按需调用,提供更强大的语义理解与规划能力。

2 智体驾驭(Harness)
针对长程具身任务,提出一种分层式 LLM 智体框架。其核心理念在于:具身智体不仅需要解读自然语言指令,还必须理解指令所处的场景、当前的执行阶段,以及判定任务完成所需的条件。与代码智体或常规工具使用型智体(例如用于软件工程的 SWE-agent [97]、基于 API 的工具使用模型 Toolformer [66] 以及交替进行推理与行动的 ReAct [104])不同,具身智体在执行中间步骤时往往缺乏明确的完成信号。智体可能会发出导航指令却未实际离开当前位置,或者在原地反复旋转碰撞,而在语言层面上却仍认为任务正在推进。因此,本文框架不仅仅是让 LLM 调用更多工具,而是将具身执行过程组织为“推理-执行-验证”的闭环。
该框架将通常耦合在单一控制器中的三种角色进行分离:主 LLM、技能执行器(Skill Runner)和验证器(Verifier)。如图 2 所示,任务首先由主 LLM 进行处理。在记忆与上下文信息的支持下,主大语言模型(LLM)审视任务,结合当前场景进行解读,并制定高层规划。随后,它决定是直接调用工具,还是将包含多个步骤的子任务委派给“技能执行器”(Skill Runner)。技能执行器是一种技能层级的子智体,负责在隔离的局部上下文中管理程序化执行、维护中间状态、处理循环往复的观测与动作,并将压缩后的结果反馈给主 LLM。“验证器”(Verifier)则在执行过程中及任务结束时进行监督,监测执行进度、判断技能是否陷入停滞,并确认任务是否真正具备终止条件。这一循环机制将 LLM 的推理过程建立在环境事实之上,从而减少长程具身任务中常见的程序偏离与过早终止现象。

场景条件任务规划
主LLM在智体驾驭 Agent Harness 中充当语义规划器。它的作用是解释有关当前场景、地图记忆、机器人状态、最近历史记录和可用技能的用户指令,而不是发出每个低级动作。在行动之前,它确定任务是否需要导航、搜索、人机交互、报告、操作或额外观察,并形成一个具有明确完成条件的可修改的高级计划。
这个规划步骤是基于场景的,而不是纯粹的语言。相同的指令可能需要不同的执行策略,具体取决于智体的当前位置、可用的视觉证据、已知的地图结构、可到达的区域、附近的对象和交互历史。因此,主要的LLM会推理哪些信息已经足够,哪些必须观察或查询,哪些技能在当前状态下是可行的,以及哪些可观察的条件将构成完成。
随着新的观察结果、工具结果、技能总结和验证者反馈进入上下文,该规划会进行更新。主要的LLM决定应该追求哪个目标,何时直接使用工具就足够了,何时应将子任务委托给技能运行者,以及何时可以完成任务。通过将本地执行细节排除在主推理线程之外,智体可以保留一致的全局任务状态,同时允许较低级别的技能处理程序细节。
程序执行的技能运行器
Skill Runner 处理需要持续本地执行的子任务。技能不被视为一次性工具调用或简单的动作宏;它由具有隔离本地上下文的技能级子智体执行,其中包括子目标、最近的观察结果、技能状态、失败的尝试和恢复策略。主要LLM收到压缩的技能进步和成果,而不是中间行动的完整序列。
这种上下文隔离对于长期具体任务非常重要,其中本地执行可能涉及重复移动、观察、重新定位、视图调整和恢复。如果每次局部碰撞、短程移动、失败的尝试或视觉调整都附加到主要的LLM背景中,则全局目标将被程序细节所掩盖。 Skill Runner 吸收这种本地复杂性,同时保留主要 LLM 所需的信息以进行更高级别的阶段管理。
在执行过程中,技能运行器通过检查是否取得进展、决定何时需要额外观察或局部恢复以及确定何时应将控制权返回到主LLM来保持程序连续性。终止时,它返回一个紧凑的语义摘要,指示子目标是否实现、如果实现则失败的原因、发现了哪些场景信息、尝试了哪些恢复以及主 LLM 应如何使用结果。
多阶段验证
验证器解决语言级的信念和基于环境的完成之间的不匹配。许多数字任务可以通过测试、API 响应或页面状态等显式外部信号来检查是否成功,而具体化任务通常需要智体声明的进度、执行轨迹和观察到的场景状态之间的一致性。因此,验证者通过检查最近的行为、技能结果和最终答案是否得到环境证据的支持而不仅仅是智体的信念来监督执行。
验证分三个阶段进行。运行时验证监控最近的轨迹和技能状态是否表明有效进展或揭示停滞、重复碰撞、局部循环或与当前计划不一致的行为。技能级别验证检查委派的子任务是否满足其语义目标,而不是仅仅因为工具或子智体正常返回而接受成功。当主 LLM 尝试终止任务时,将执行完成时间验证;它会在允许任务完成之前评估原始指令、当前规划、执行历史记录、技能摘要、观察结果以及交互过程中引入的任何新要求。
因此,验证者不仅仅是最终评估者,而且还是智体驾驭内部的监督信号。通过在委托执行之前、期间和之后应用验证,ABot-AgentOS 可以将缺失的条件返回到推理层,并减少开放式具体任务中的停滞、误判和过早终止。
端云协同路由
在实际部署中,并非所有任务都应由云端规模的大模型处理。常规请求往往可以通过端侧小模型和本地工具完成,而长程具身任务则可能需要更强的场景理解、规划、技能执行及验证能力。因此,ABot-AgentOS 采用了端云协同路由层:端侧模型首先感知任务与上下文,随后决定是在本地处理请求,还是将其上报至云端模型进行更复杂的推理。
这种设计遵循模型路由与分层推理的通用理念,即系统在不同能力与成本的模型之间进行选择 [4, 11, 56]。在方案中,路由策略基于训练样本和执行反馈进行学习,而非依赖固定规则。该策略能够识别哪些请求可通过本地工具可靠解决,哪些需要云端规划,以及哪些在路由前需要进一步的观测。这种机制既能有效控制延迟与部署成本,又能确保在处理需要深度长程推理的任务时,依然能够利用云端规模模型的能力。
3 记忆系统
长时程具身交互需要一种记忆基础,该基础需独立于大语言模型(LLM)的上下文之外,能够跨会话持久保存,并植根于机器人自身的经验。在 ABot-AgentOS 中,记忆系统提供这一基础。它将观测数据、人机对话轮次、模型提取的语义事实、视觉证据、身份信息、物体状态、空间关系及任务轨迹记录为“源可追溯”的记忆条目,并通过可追踪的检索机制,使积累的经验可供后续推理步骤使用。该记忆系统并非简单地存储完整视频、完整对话文本或非结构化图像数据,而是将多模态经验转化为紧凑的图结构记录,其中包含类型化的实体、事件、关系、时间上下文及数据来源信息。这种设计使智体能够回溯人物、动物、物体、地点、事件、时间性事实、空间关系及原始证据,而无需占用过多的在线上下文窗口资源。
记忆系统位于在线运行时(online runtime)之下,与“上下文管理”模块相辅相成。上下文管理模块负责决定哪些信息应纳入当前的提示词(prompt)中,包括当前指令、角色策略、执行规划、近期观测结果及反思总结。记忆系统则负责决定哪些信息需在当前任务周期(episode)结束后持久保存,以及如何将相关的历史证据检索回上下文中。这种分离机制既避免长时记忆退化为杂乱无章的提示词堆砌,又确保在当前任务需要回溯身份、进行时间定位、回忆物体位置或调用基于原始数据的视觉证据时,智体控制器能够利用这些持久化经验。
实用的机器人记忆系统必须满足三个要求。首先,它必须具备多模态特性,因为有价值的经验分布在语言、自我中心视觉、物体状态、空间布局、身份信息及任务轨迹等多种模态中。其次,它必须具备关系特性,因为具身回溯往往依赖于事件参与者、物体最后出现的位置、随时间发生的变化或支持某项断言的具体帧画面。第三,它必须具备可审计性和可改进性:系统给出的每个答案都应展示其依据的证据,以便在出现故障时,能将问题归因于记忆写入、证据选择、时间定位、视觉匹配或答案生成等具体环节。
基于失败驱动的终身自我演化
长期记忆的演化不仅应通过积累新内容来实现,还应通过改进处理证据的流水线(涵盖写入、检索、筛选和使用环节)来推进。否则,即便记忆图谱不断增长,系统仍可能反复犯下同样的错误,例如在信息提取、检索、时间定位、视觉筛选或答案生成等方面出错。这一观点与近期关于自我演化智能体、流式记忆演化及证据可验证改进的研究相一致,这些研究强调从交互轨迹中学习,同时确保更新过程可审计且受控 [5, 9, 25, 46, 47, 50, 83, 110, 111]。
如图3展示系统层面的在线记忆组件与离线自我演化循环,如下一个图4则提供具体示例,说明记忆失败如何转化为针对性的“演化资产”(evo-assets)。将这一过程形式化为长期部署期间的“分段式协议”(或其基准测试近似形式),即表示为一系列不重叠的数据分段序列 D_1, . . ., D_T。在分段 t 期间,ABot-AgentOS 维护两种持久状态:累积记忆图 G_{t-1} 和已提升的演化资产集 A_{<t}。图存储内容层面的经验(包括实体、事件、地点、视觉证据、时间上下文及来源信息),而演化资产则存储流水线层面的改进措施(涉及记忆写入、证据筛选、图扩展、答案生成、帧选择、时间归一化或适配器层面的归一化)。在在线执行过程中,智体将新观测写入记忆,检索用于后续回答任务的证据,并记录当前资产集下的检索与回答轨迹。只有在分段 t 评估完成后,失败案例才会被转化为失败轨迹,并进行处理以寻求改进。在分段t 的推理过程中,不会使用由该分段生成的演化资产;获采纳的资产仅在后续分段中启用。这种“无泄漏”约束将自我演化转变为一个累积性的终身过程,而非一次性的事后修复。


在基准测试场景中,失败情况仅在分段结束后利用标准答案(ground-truth answers)进行识别;而在实际部署中,类似的反馈可源自环境信号、任务成败、人工修正,或是置信度较低的检索与回答轨迹。只有通过筛选机制的资产才会被晋升并用于后续的数据切分阶段。在针对切分 t 进行推理时,不会使用由该切分 t 自身生成的演化资产(evo-asset)。这种基于切分的协议确保演化资产不会利用其评估所在切分的监督信息,从而将自我演化转变为一个累积性的终身过程,而非一次性的事后修正。
在每次拆分(split)之后,收集的追踪记录(traces)会经由一个受约束的“失败-至-资产”(failure-to-asset)循环进行处理。在有监督的情况下,一次失败的 QA 尝试由以下要素表征:问题、检索的证据、预测结果、预期答案、检索追踪记录以及数据集上下文;而在部署阶段,类似的反馈可源自环境信号、任务结果、人工修正或低置信度的追踪记录。该循环负责诊断失败根源,提出修复方案,将修复方案编译为符合受约束 JSON DSL 规范的“演进资产”(evo-asset),并通过目标验证和回归检查对其进行评估。这一过程遵循安全资源演进的通用原则:提示词(prompts)、工具、记忆模块及其他智体资源应当具备版本控制、可审计和可回滚(rollback)的特性,而非通过不受约束的代码生成方式进行更新 [113]。
门控机制(gate)会在目标验证子集和回归子集上评估每一个候选资产。只有当资产 a 能将目标得分提升至少 tau_{gain} 且回归得分的下降幅度不超过 tau_{reg} 时,该资产才会被采纳。
这一标准使得资产的晋升过程较为审慎:一项资产若要获得采纳,既必须改善其针对的特定失效模式,又必须确保在原本表现良好的案例上维持既有行为。
获采纳的“进化资产”(evo-assets)是以 JSON DSL 格式定义的记录,由系统进行生命周期管理,且不直接执行生成的 Python 代码。每项资产均明确声明其作用层级、触发条件、允许的操作、安全约束、来源信息、验证结果及版本 ID。这些资产可针对记忆写入、证据筛选、答案合成、视觉帧选择、时间归一化或适配器层面的归一化等环节发挥作用。除非显式加载获采纳的资产,否则系统的常规问答行为保持不变;其中,涉及写入操作和帧选择策略的资产需要重新构建图结构,而证据筛选与答案生成类的资产则支持在运行时动态加载。通过这种方式,ABot-AgentOS 积累了两种形式的终身知识:存储于记忆图中的内容级经验,以及存在于进化资产集合中的流水线级改进。
边云协同记忆管理
具身智体在与物理世界交互的过程中,会持续获取异构的记忆信息,包括地图、语义地标、障碍物、物体以及与人相关的观测数据。虽然诸如路障、施工区域和导航地标等公共环境记忆在共享后有助于提升多智体协作效率,但涉及隐私的记忆(如人脸、个人物品或与特定个人关联的物体)必须保留在本地。为解决这一冲突,设计一种边云协同记忆系统,将机器人端的私有记忆与云端的公共记忆分离开来。
记忆划分。每个机器人在边缘侧维护一份私有记忆,用于存储所有本地感知的记忆信息,涵盖地图记忆、语义记忆和多模态记忆。云端则维护一份公共记忆,仅包含对群体导航和任务执行有益的、低敏感度的公共记忆信息。该设计遵循“默认私有”原则:除非某项记忆被明确归类为可共享,否则绝不会上传。
隐私-觉察记忆门控机制。对于每一项新生成的记忆,系统在同步前都会进行隐私判定。若某项记忆包含或关联个人可识别信息(如人物、人脸、姓名、个人物品或与特定个人的归属关系),则被视为不可共享;反之,地图、交通锥、路障、路面损坏及静态地标等公共环境信息则被归类为可共享。
为了评估隐私保护机制的可靠性,构建一个专门用于隐私分类和上传决策测试的数据集。实验结果表明,该系统在判断记忆项是否适合云端同步方面,准确率超过 99%。这种高精度的隐私判定显著降低上传敏感用户或特定环境信息的风险,同时允许非敏感的公共知识在不同机器人之间共享。因此,该记忆系统平衡具身智能的两大关键需求:既通过边缘侧私有记忆保护用户隐私,又通过云端公共记忆增强群体协作能力。
近期的具身智能(Embodied AI)基准测试主要沿着两条相对独立的路径发展。在室内领域,BEHAVIOR-1K [44] 定义 1,000 种日常家居活动,EmbodiedBench [100] 评估跨多个室内模拟器的多模态大语言模型(LLM)驱动智体,LongAct [118] 侧重于长程(long-horizon)家庭任务执行——然而,这些工作均局限于封闭的室内环境,无法评估开放空间中的大规模空间推理能力。在室外领域,EmbodiedCity [22] 构建城市级 3D 仿真环境,CityNav [42] 和 OpenFly [26] 提供大规模空中视觉语言导航(VLN)数据集,CityNavAgent [112] 和 GeoNav [91] 推动LLM 驱动的空中导航规划发展,而 GeNIE [77] 和 ODYSSEY [78] 则分别建立地面室外导航和移动操作(mobile manipulation)的基准测试——但这些工作主要关注单一任务模态(如点对点导航或孤立的操作任务),缺乏社交互动和多步推理能力。TongSIM [70]、Wanderland [51] 和 Embodied Web Agents [32] 尝试统一室内外评估,但在结构化多难度任务生成、严格的信息隔离机制或动态 NPC 驱动事件等方面仍显不足。总体而言,现有的基准测试存在三个共同局限:(1) 环境割裂——室内与室外场景的评估相互独立;(2) 任务同质化——仅测试单一能力维度;(3) 静态评估——缺乏动态事件,无法评估智体的自适应重规划能力。
为弥补这些不足,提出一个统一的具身智能评估框架,涵盖室内、室外及混合环境下的 16 个可执行场景,并将任务划分为四个难度等级。与现有工作不同,本框架中的每个评估案例都是一个完整的可执行场景,能够综合测试智体在导航、物体搜索、NPC 对话、动态指令响应及状态追踪方面的能力。该框架设定严格的信息可见性边界:智体仅接收经过筛选的语义地图,必须依赖自主感知与推理来完成任务。这是首个将跨域连续性、社交动态交互与工程严谨性整合于一体的评估系统。
1 概述
本基准测试旨在以结构化、可复现且多维度的方式评估具身智体。与传统的静态数据集不同,这里的每一个评估案例都是一个完整且可运行的场景世界。
图5展示郊区社区中的一个典型场景。在面对一项复合指令时,智体必须按顺序完成四个子目标——检查街道、视察后院泳池、核实室内电器状态以及返回汇报;整个任务路径涵盖室外街道、住宅后院和室内客厅,且均在同一轮交互(episode)中完成。该示例展示每个场景如何综合考察跨场景导航、NPC交互、环境感知和信息汇报等多项能力,而非仅仅孤立地测试单一技能维度。
本基准测试遵循四项设计原则。首先,每个案例必须是可执行的场景,而非单纯的查询指令。其次,单个场景应综合测试多种具身智能能力,而非孤立地评估某项单一技能。第三,所有评估结果必须基于执行轨迹(execution trace)且可追溯、可审计,从而避免评估过程中出现主观的人工评分。第四,基准测试的执行过程必须具备可复现性:在相同的场景配置和模型设置下,评估轨迹与最终得分应保持稳定且可重复。综上所述,这些原则确立本基准测试作为端到端具身智能评估套件的定位,使其区别于单纯的提示词(prompt)集合类基准测试。
2 基准构建
环境与语义地图标注
用 UnrealZoo,这是一套基于 Unreal Engine 5 构建的具有照片级真实感的 3D 环境。它支持基于 NavMesh(导航网格)的导航和可编程的对象生成,并提供涵盖室内、室外及住宅场景的丰富环境。
为了弥合原始引擎级对象与任务级语义之间的鸿沟,启动 UE5 场景,并安排标注人员以第一人称视角在环境中自由漫游。他们遍历所有可达区域,手动标记并命名与评估智体相关的关键对象、兴趣点(POI)、交互目标以及典型导航路径,从而构建出一张结构化的语义地图。该地图构成后续所有任务设计与查询生成工作的基础。
查询生成
“查询”是指向智体(Agent)发出的自然语言指令(例如:“找到那位穿红色羽绒服的老人并报告其位置”),并附带形式化的成功标准及NPC配置信息。为了实现具身任务的可扩展构建,提出一种任务生成框架。
语义地图标准化。通过标准化流程,语义地图中原始标注的路径点(waypoints)被结构化转换为包含点(point)、房间(room)和多边形(polygon)三层结构的统一表征。点层记录空间坐标、语义类型、楼层与房间的关联关系以及物体的视觉属性;房间层将同一区域内的点聚合,形成语义拓扑结构;多边形层自动生成封闭的空间区域,用于判定点所属的区域。该框架目前涵盖了室内、室外及混合环境下的16个可执行场景(包括医院、博物馆、超市和郊区社区),总计包含超过300个标注路径点。
多难度任务生成。基于标准化后的语义地图,该框架自动提取场景能力摘要,包括可用区域、NPC生成点及关键物体清单。针对每个场景,标注人员首先根据场景布局、物体、NPC及可用交互方式,确定一系列可行的任务类型。随后,将这些特定于场景的任务规范输入大语言模型,由其生成简单任务及复合型多阶段任务,并附带相应的自然语言描述与形式化成功标准。最后,人工标注员对生成的候选任务进行审查与优化,以确保任务的可执行性、语义清晰度、评估标准的一致性,以及智体可见指令与隐藏评分字段之间的信息隔离。
为了支持分层能力评估,通过“人在环”(human-in-the-loop)的校准方式,将查询划分为四个难度等级。难度被视为具身执行过程的一种属性,而非仅仅取决于场景、NPC或物体的数量。校准过程主要考量空间探索范围、执行流程长度、交互复杂度、证据需求以及动态适应需求。这种设计使得同一场景既能支持简单的局部任务,也能支持复合型长程任务,同时确保了不同环境之间难度语义的可比性。
可见性隔离与验证。每项任务都设定了严格的信息可见性边界:智体仅能获取语义地图的经筛选子集及自然语言指令,而NPC位置、评估信号及预期轨迹等内部信息则被隔离,从而确保智体必须依靠自主感知与推理来完成任务。所有生成的任务均经过自动化验证,涵盖航点参考的有效性、信息隔离的完整性以及评估覆盖范围,以确保任务的一致性与可复现性。
3 评估流程与指标
具身评估工作流
经核实的查询指令将在 UnrealZoo 中作为闭环具身任务回合(episode)进行执行。在每个回合开始时,环境会根据任务配置进行初始化,而智体仅接收任务指令和经过筛选的语义地图。评估器内部的状态信息、预期轨迹及成功判定信号均不对智能体公开。
该 UE 环境提供基于导航网格(NavMesh)的自主导航功能,从而抽象化底层的路径规划与移动控制。这种设计使基于大语言模型(LLM)的智体能够专注于高层具身决策——例如导航目的地选择、观测时机把握、证据收集以及任务终止时机——而无需处理底层的运动控制细节。视觉信息通过智体基于视觉语言模型(VLM)的观测工具获取,该工具将第一人称视角转换为文本形式的观测证据,供 LLM 控制器使用。在难度较高的场景中,可能包含 NPC 位置变动或物体状态改变等动态事件,这要求智能体在执行过程中动态调整其计划。
每个回合都会生成一条结构化轨迹,包含导航指令、已访问区域轨迹、观测记录、中间输出、最终响应以及可选的视频录像。评估器结合该轨迹与任务预设的隐式标准,执行确定性检查及基于证据的判定,从而实现可复现的评估与细粒度的失败分析。
评估指标
系统采用结构化评估器自动评测智体的执行结果,并监控任务执行过程中的关键事件,包括目标位置到达状态、NPC 对话完成情况以及信息获取的准确性。
评估指标包括任务成功率(TSR)和目标完成率(GCR)。TSR 要求满足任务定义的所有子任务目标及终止条件,方可判定该轨迹执行成功,这是衡量整体表现的最严格指标。GCR 定义为已满足的子任务目标数量占子任务目标总数的比例,能够更细致地反映智体在导航、NPC 对话交互及多阶段推理等维度上的部分完成情况。这两个指标共同刻画了智体在宏观整体与微观细节层面的任务执行能力。
子任务目标的验证采用混合评分方案进行。几何条件(如抵达目标位置或访问航点)通过程序化方式进行核查:即将记录的位姿与任务定义的参考点进行比对,判断其是否处于成功判定半径范围内。语义条件(如智体是否已观测或检查目标)则基于运行期间生成的证据进行评估,这些证据包括智体经由视觉语言模型(VLM)生成的观测记录、中间输出以及最终响应。LLM 评估器仅用于判定上述证据是否符合语义成功标准;它既不直接观测环境,也无法获取任务级评分准则之外的评估器内部状态。每次判定均以结构化结论的形式输出,从而确保语义评分既可追溯,又能与确定性核查保持一致。
1 概述
目标是将 ABot-AgentOS 风格的长程规划与工具使用能力,从大型教师模型迁移至更小巧、可部署的智体模型。为此,设计一个包含四个阶段的闭环训练流程:基于文本的环境构建、教师轨迹蒸馏、监督微调(SFT)以及强化学习(RL)。如图 6 所示,该流程首先构建用于具身工具操作的可控语义沙盒,随后利用强大的教师智体生成工具交互轨迹,最后基于这些轨迹以及由“大语言模型作为裁判(LLM-as-a-Judge)”奖励引擎评估的在线交互过程(rollouts),训练较小的学生策略模型。这一设计顺应当前的趋势,即语言智体应在可执行或具有状态的环境中进行训练,而非仅仅依赖静态的指令-响应对。关于 ReAct、工具使用数据生成、交互式智体基准测试以及合成工具交互环境的既有研究表明,智体要表现出逼真的行为,需要具备持久状态、多轮反馈、可执行动作以及可验证结果的能力 [37, 63, 69, 97, 104, 105, 116]。流程将这一原则应用于具身机器人任务,通过围绕 ABot-AgentOS 技能、人类辅助及物理障碍构建基于文本的语义沙盒来实现。

该沙盒并非旨在替代视觉模拟器,而是提供了一种可扩展的语义接口,用于在受控的状态变化下生成并评估工具使用行为。统一的轨迹格式支持训练的各个阶段:教师生成的交互过程可经筛选转换为 SFT 样本;而在同一沙盒中学生智体的交互过程,则为在线强化学习阶段中“大语言模型-作为-裁判”的奖励机制提供了轨迹依据。
2 基于文本的环境与任务构建
如上图 6(a) 所示,每一条自然语言任务指令都会被转化为一个具有状态的沙盒实例。环境构建器会提示大语言模型生成简单(Easy)、中等(Medium)和困难(Hard)三种变体,每种变体包含三个结构化组件:env_state(指定位置、可达性、物体位置及物体状态)、failure_triggers(定义物理或语义障碍)以及 human_persona(定义人类 NPC 的角色、能力及可能提供的辅助)。由此生成的实例是一个交互式任务环境,而非静态问题。
在执行过程中,智体仅通过工具调用接收反馈。EnvController 根据当前状态和故障触发条件验证 ABot-AgentOS 的技能调用,并相应地返回观测结果或故障信息;HumanAgent 则处理有效的求助请求,并可能执行更新环境状态(env_state)的操作。这种设计将障碍处理、求助、重规划及状态更新纳入训练信号之中。
难度递进机制提供一种简单的课程学习方案。简单场景侧重于任务分解与基础技能选择;中等难度场景引入可恢复的障碍;困难场景则要求多轮交互、持续的目标追踪以及从多次或嵌套故障中恢复的能力。该课程体系在增加行为多样性的同时,保持沙盒环境的可控性,从而支持可扩展的轨迹生成与在线运行。
3 教师轨迹蒸馏与监督微调(SFT)
环境构建完成后,一个强大的教师模型在沙盒中控制 ABot-AgentOS 风格的智体,生成 ReAct 风格的交互轨迹。这些轨迹交织推理过程、工具调用、环境观测、必要时的人类响应以及最终答案 [104]。教师模型复用 ABot-AgentOS 的系统提示词(system prompt)和工具定义,但将执行后端替换为基于文本的沙盒环境。因此,收集到的轨迹不仅包含成功的执行过程,还涵盖失败尝试、求助行为、重试及恢复步骤;这些数据对于训练一个能在面对意外反馈时稳健运行的小型模型至关重要。
为确保数据质量,利用“大模型-作为-裁判”(LLM-as-a-Judge)的方法对蒸馏出的轨迹进行筛选。裁判模型根据任务、初始环境、工具调用序列、观测结果及最终响应,评估任务完成情况、障碍处理、循环规避、工具可行性以及与具体具身能力约束的一致性。只有逻辑一致的轨迹才会被保留。该裁判模型系列随后也被用于在线强化学习(RL)中的奖励评估,配合自进化奖励引擎共同工作。
保留下来的轨迹被转换为工具调用 SFT 样本,这些样本完整保留交互结构,而非将整个回合(episode)扁平化为单一响应。这种方式将学生模型训练为基于 ABot-AgentOS 技能的可执行策略:模型学习任务分解、工具选择、从失败观测中恢复、求助、跨多轮交互保持目标以及规避不支持的操作。由此生成的 SFT 模型为同一沙盒界面中的在线强化学习(RL)提供行为先验。
4 强化学习:基于“LLM作为裁判”奖励的在线探索
在监督微调(SFT)之后,学生策略会在用于轨迹生成的同一文本沙盒环境中,通过在线强化学习(RL)进行进一步训练。该过程不再模仿教师演示,而是让经 SFT 初始化的学生策略在线采样动作,接收来自环境控制器(EnvController)和 NPC 的反馈,并基于奖励引导的策略优化进行更新。这遵循近期多轮智体强化学习系统的趋势,即从静态模仿转向基于交互的改进 [81, 84, 117]。
该强化学习循环包含四个角色。策略是唯一可训练的组件。环境控制器根据当前沙盒状态执行工具调用并返回环境反馈。当策略请求帮助时,NPC 模块提供辅助性响应。作为奖励提供者的“LLM作为裁判”(LLM-as-a-Judge)模块处于冻结状态,负责读取运行轨迹(rollout)数据并分配奖励。这种分离确保在线强化学习专注于优化小型策略,同时沙盒动态、NPC 行为和裁判奖励保持为固定反馈。奖励由“LLM作为裁判”奖励引擎提供,该引擎针对局部动作质量提供轮次级(turn-level)反馈,并针对全局任务完成情况提供回合级(episode-level)反馈。
用 GiGPO [20] 将这些奖励转换为相对优势(relative advantages),而不是直接使用原始分数。对于每个场景,从相同的初始沙盒状态采样多条运行轨迹。GiGPO 比较它们的合并回报以形成回合相对优势,从而识别出哪条完整的运行轨迹能更好地完成任务。它还比较对齐或可比决策步骤上的轮次级奖励,以形成步骤相对优势;这样,当策略遇到类似情况(如相同的受阻通道、附近的 NPC 或候选目标)时,局部的纠正或恢复选择就能得到强化。最终的优势值结合回合级和步骤级的相对比较结果,使策略更新既倾向于表现更好的完整运行轨迹,也倾向于表现更好的局部动作。
5 自进化奖励引擎
如上图 6(b) 所示,设计一种用于具身智体评估与优化的自进化奖励引擎。该引擎将三个功能整合在一个循环中:“LLM-作为-裁判”模块为具身轨迹生成奖励;“元裁判”(Meta-Judge)验证模块检查这些奖励的可靠性;多智体工作流则将低质量的裁判案例转化为局部的提示词(prompt)更新。其目的不仅在于为在线强化学习(RL)提供奖励,还在于随着技能、任务及智能体行为的变化,持续改进奖励提示。
来自“大语言模型-作为-裁判”(LLM-as-a-Judge)的奖励
奖励引擎将每个具身智能轨迹转化为“轮次级”(turn-level)和“回合级”(episode-level)信号。轮次级奖励为单个动作提供密集监督,帮助策略区分有用、冗余、不安全、格式错误或与上下文不一致的步骤。回合级奖励评估任务的整体完成情况,并捕捉那些无法仅凭孤立轮次判断的质量特征。这些信号共同降低长程轨迹中“信用分配”(credit-assignment)的难度,因为在长程任务中,最终的成功或失败信号过于稀疏,难以据此判定具体是哪个中间动作导致了该结果 [82]。
在轮次级,奖励生成过程具备“技能-觉察”能力。引擎根据导航、操作、视觉问答及工具使用等动作各自不同的正确性标准,将其分派至相应的评估准则进行处理。随后,它将基于大语言模型的语义判断与可验证的规则检查相结合,这些规则涵盖无效工具、非法指令、格式错误的参数以及缺失的时间性前提条件等情况。此外,针对那些虽然局部看似合理但跳过必要因果步骤的动作,还引入“动作遗漏惩罚”;例如,在未核实目标前便报告已到达目的地,或在未检查相关环境约束的情况下请求协助,均属于此类情况。
在回合级,裁判会对整个轨迹的效率、一致性和完整性进行综合评估 [30]。该回合级信号即为强化学习(RL)所使用的最终奖励项。
该表述与 GiGPO 所采用的奖励接口相契合,同时明确奖励引擎生成“终止回合级”组件的具体方式。它将作为评判者的 LLM(LLM-as-a-Judge)从静态评估器转变为用于具身智体优化的结构化奖励生成器 [114]。
元判官(Meta-Judge)验证
第二部分旨在验证奖励信号的可靠性。“大语言模型-作为-判官”(LLM-as-a-Judge)的输出可能包含评分错误、证据遗漏、评分标准误用,或看似合理但缺乏依据的推理理由 [68]。在具身智能场景中,此类错误尤为危险,因为正确的判断往往依赖于物理前提、工具约束、时间顺序、能力边界以及特定任务的偏好。
元判官并不直接判定具身智体的行为是否正确,而是接收“一级判官”的输出、关键交互片段以及完整的轨迹上下文作为验证依据,进而根据相关评分标准,核查该判官给出的评分与理由是否可靠。其评估维度包括:准确性、逻辑合理性、完整性、清晰度以及反馈价值。准确性用于核查评分是否有轨迹证据支持;逻辑合理性用于核查解释是否在证据、评分标准与评分之间建立了合理的逻辑联系,且不存在缺乏依据的逻辑跳跃;完整性用于核查是否涵盖了关键的具身约束条件以及被遗漏或冗余的动作;清晰度用于核查证据引用与规则应用是否明确;反馈价值则用于核查推理理由是否足够具体,以便于后续优化提示词(prompt)。
相比二元错误标签,这些案例更有价值,因为它们保留诊断性反馈。它们能够揭示奖励提示是存在定义不充分、歧义性,还是与具身执行约束不匹配,并为下一阶段的优化提供输入信号 [45, 75]。
多智体自我进化
第三个组件将低质量的“裁判(Judge)”案例转化为局部的奖励提示词(reward-prompt)更新。通用的提示词优化方法通常利用任务级反馈来优化一个整体性的提示词 [39, 95]。在设定中,奖励提示词包含针对特定技能的评分标准、时间前置条件规则、推理示例以及输出约束。全局重写可能会在修复某次失败的同时损害另一项稳定的技能,因此将提示词视为可编辑的结构化组件,遵循模块化文本参数及基于执行反馈进行局部文本修改的理念 [31]。
自我进化循环以多智体工作流的形式实现。“聚类(Cluster)”阶段根据技能和失败类型对低质量的裁判案例进行分组。“分析器(Analyzer)”识别有缺陷的评分标准组件或示例模式,并制定修订规划。“精炼器(Refiner)”对相关的评分标准、规则或示例进行局部修改。“验证器(Validator)”随后在完整验证集上评估修订后的提示词,仅在整体质量提升时才接受该更新。
如果候选更新损害了完整集性能、特定技能的表现或“元裁判(Meta-Judge)”的质量,系统将回滚到之前的提示词快照。在当前的验证设置下,初始裁判模型与人类的一致性约为 60%,而由元裁判驱动的自我进化过程将一致性提升到了 90% 以上。这种提升反映了整个循环的协同效应:“大语言模型-作为-裁判(LLM-as-a-Judge)”生成分解后的奖励信号,元裁判将不可靠的判断转化为诊断案例,多智体优化器则将这些案例转化为经过验证的提示词更新。
总体而言,奖励引擎在奖励生成、验证和精炼之间形成闭环,从而确保评估系统在具身技能、任务分布及智体行为不断演变的过程中,依然保持可靠性。
1 智体评估
实验设置
在当前基准测试的一个子集上评估所提出的具身智体。该子集涵盖基准测试考虑的主要场景类型(包括室内、室外及室内外混合环境),并包含多种任务形式,如语义导航、区域性人员或物体搜索、物体检查、NPC 信息查询、状态报告以及多阶段指令遵循。
智体通过记录器(recorder)接口在 UnrealZoo 环境中运行;该接口负责执行基于 NavMesh 的导航指令,并记录产生的移动轨迹与交互过程。智体获取视觉观测信息的方式是利用其基于 VLM的观测工具,而非直接读取环境的特权状态信息。在评估过程中,智体仅能依据任务指令、经筛选的语义地图、可观测反馈及对话事件来采取行动,无法获取评估器的隐藏状态或任务成功信号。
对比三种配置:Qwen3.6-Plus、Qwen3.6-Plus(本文方法)以及 DeepSeek-V4-Pro(本文方法)。其中,Qwen3.6-Plus 作为基线配置,仅采用单一的大语言模型(LLM)作为控制器;而标有“本文方法”的配置则采用提出的分层智体架构,该架构包含局部技能执行、任务记忆以及最终验证等模块。这种设置既能比较同一模型下不同智体架构的效果,也能评估在架构中更换核心 LLM 所带来的影响。在所有智体评估配置中,视觉观测均由同一 Qwen3-VL-Plus 观测工具处理。此处提及的对比模型均指核心 LLM 控制器,该控制器负责执行任务推理、规划、工具选择及终止决策。
器采用基准测试章节中定义的指标,重点报告 TSR(任务成功率)和 GCR(目标完成率)。基于基准测试设定的结构化成功标准与终止条件,TSR 衡量的是任务的整体成功情况,而 GCR 则衡量目标层面的完成程度。
2 记忆评估
所有记忆实验均使用同一混合图检索器;因此,检索本身不作为实验变量。评估围绕五个基准测试展开,这些测试侧重于互补的记忆能力:长期对话回忆、具身问答、多模态身份和关系定位、时间视频推理以及以自我为中心的日常生活记忆。具体而言,在 LoCoMo、OpenEQA、Mem-Gallery、NExT-QA 和 EgoLife [7, 52, 53, 88, 96] 上进行评估。这些基准测试在模态、时间尺度、监督形式和评估指标方面存在显著差异,因此报告特定数据集的结果,而不是对各个基准测试的原始分数进行平均。
实验设置
数据集。使用五个数据集评估记忆模块,这些数据集涵盖长期记忆和具身记忆的互补方面。LoCoMo 评估了超长期多会话对话记忆。OpenEQA 评估了室内环境下的开放词汇具身问答。Mem-Gallery 评估了具有视觉-文本依赖性的多模态长期对话记忆。NExT-QA 评估了时间性、因果性和描述性视频问答。 EgoLife 评估了以自我为中心的日常生活问答的长上下文。由于这些基准测试在模态、上下文长度、问题类型和答案格式方面存在差异,分别报告结果,避免将它们汇总成单一的跨数据集分数。
基础混合检索器。所有实验均使用相同的混合图检索器。给定一个查询,检索器首先使用语义嵌入、词汇匹配、元数据过滤器、来源约束和节点类型约束来选择候选记忆节点。然后,它通过类型化的图边扩展选定的种子节点,以收集支持事件、框架、会话、地点、参与者、身份时间线、来源记录以及空间或交互关系。检索的证据被序列化为紧凑的证据上下文并提供给回答者。这种固定的检索主干能够分离出结构化记忆记录的影响,以及后续终身自我演化资产的影响。
作者和回答者模型。在 ABot-AgentOS 中,记忆写入器将原始观测数据、对话轮次、图像附件、视频帧、时间戳和交互轨迹转换为结构化的、基于源的记忆记录。然后,应答器根据用户查询和检索的证据上下文生成最终响应。根据每个数据集的模态和评估协议,使用特定于基准测试的基础模型来实例化 ABot-AgentOS。对于 OpenEQA,用 GPT-5.4 作为记忆写入器、应答器和 LLM-Match 评判器。对于 LoCoMo,用 Qwen3.6-Plus 同时作为记忆写入器和应答器。对于 Mem-Gallery,用 Qwen3.6-Plus 作为记忆写入器、应答器和 LLM 评判器。对于 NExT-QA,用 Qwen3.6-Plus 来写入结构化的视频记忆。对于 EgoLife,用 Qwen3.5-Flash 来写入以自我为中心的记忆。
比较方法。对于面向记忆的基线方法,将其与涵盖可扩展对话记忆、多模态长期记忆、动态视频记忆和具身场景记忆的代表性方法进行比较。对于直接视觉问答(VQA)基线方法,当数据集支持时,会纳入仅使用盲大语言模型(LLM)或直接视觉/视频问答的结果。由于协议在输入表示、视觉骨干、帧预算、模型规模、评估子集和评判模型方面可能存在差异,因此使用外部结果作为参考点。因此,最可控的比较是在相同的数据集划分、指标和实现下,复现的 ABot-AgentOS Static 和 ABot-AgentOS + Self-evo 运行结果之间的比较。
信息边界。所有非预言机记忆图均仅基于智体在推理时可获得的信息构建:对话轮次、观察结果、帧、时间戳、模型提取的字幕、检测的实体和源元数据。黄金答案、黄金理由、黄金支持证据和基准测试内部标注绝不会用于构建标准记忆图,也绝不会置于回答者的推理上下文中。
openEuler 是由开放原子开源基金会孵化的全场景开源操作系统项目,面向数字基础设施四大核心场景(服务器、云计算、边缘计算、嵌入式),全面支持 ARM、x86、RISC-V、loongArch、PowerPC、SW-64 等多样性计算架构
更多推荐


所有评论(0)