一、引言:当AI Agent拥有“操作系统”

大语言模型(LLM)已展现出惊人的推理与生成能力,但真正的智能体(Agent)远不止于“聊天”——它需要感知环境、做出决策、执行动作,并记住过往经验。这就像计算机需要操作系统管理资源一样,AI Agent同样需要一套精密的架构支撑其持续运行。

OpenClaw 正是一套专为AI Agent设计的“操作系统”。它采用四层架构,以Gateway为心脏,将消息路由、智能决策、技能执行与记忆管理有机整合,构建出一个本地优先、模型无关、技能可扩展且支持多租户隔离的智能体平台。


二、架构总览:四层各司其职,Gateway为核

OpenClaw的架构自上而下分为四层,每一层承担明确的职责,层间通过标准化接口通信。下面以表格形式概括各层定位:

第一层:Gateway(网关层)—— 核心定位是系统的“心脏”与“交通枢纽”,主要职责包括接入所有外部消息,负责路由、会话管理、协议转换和安全验证。

第二层:Agent(智能体层)—— 核心定位是AI的“大脑”与决策引擎,主要职责是基于ReAct循环进行推理、决策,驱动多轮对话与任务执行。

第三层:Skills(技能层)—— 核心定位是AI的“双手”与执行能力,主要职责是提供文件操作、Shell命令、浏览器控制、网络请求、定时任务等具体能力,并支持自定义扩展。

第四层:Memory(记忆层)—— 核心定位是AI的“知识库”与上下文管理,主要职责是管理短期上下文与长期记忆,支持语义检索、自动压缩和摘要提炼。

整个系统的设计遵循四大原则:
第一,本地优先。所有关键组件可本地部署,保障数据隐私与响应速度。
第二,模型无关。Agent层可对接任意LLM(如OpenAI、Claude、Llama等),通过统一接口调用。
第三,技能可扩展。开发者通过标准的 SKILL.md 格式即可添加新技能,无需修改核心代码。
第四,多租户隔离。每个用户或群组拥有独立的Agent实例,会话与记忆相互隔离,安全可控。


三、Gateway网关层:系统的交通枢纽与安检中心

Gateway是唯一的外部流量入口,承担四项核心职责,是整个系统的“咽喉要道”。

职责一:消息路由 —— 精准分发,水平扩展。Gateway内部维护一张全局路由表,存储在Redis中,支持分布式水平扩展。路由表依据 channelId(平台来源,如WhatsApp、Telegram)和 sessionId(会话标识)将每条入站消息映射到对应的Agent实例。这种设计让同一用户可以跨平台(手机、桌面)获得一致的会话体验,同时支持海量并发。

职责二:会话管理 —— 实时通信与状态维护。Gateway维护各平台的基础连接状态,对支持WebSocket的渠道提供全双工实时通信。此外还包括上下文修剪(当对话历史过长时自动截断或摘要)和多维度权限控制(基于用户、群组、角色细粒度限制操作)。

职责三:协议转换 —— 异构消息的统一翻译。OpenClaw支持20余个主流平台(包括WhatsApp、Telegram、飞书、Discord、Slack等),每个平台的消息格式各异。Gateway将这些异构消息统一转换为OpenClaw标准JSON格式,使上层Agent无需关心平台差异。标准消息包含 channelId、sessionId、sender、text、timestamp、attachments 等字段。

职责四:安全验证 —— 四级防护策略。Gateway设计了四层安全防护:第一层沙盒隔离(技能执行受限环境);第二层敏感操作确认(高危动作需二次确认);第三层访问控制(ACL,限制技能调用范围);第四层审计日志(完整记录请求与操作,满足合规追溯)。

补充:启动性能优化(2026年5月更新)。最新版本中,Gateway启动时间从8至12秒优化至2至3秒,秘诀在于增量资源扫描(按需加载,避免全量初始化)和前后端解耦(用户响应即时反馈,后台处理静默执行)。


四、Agent智能体层:AI的“大脑”与决策引擎

Agent层是系统的“大脑”,基于经典的ReAct(Reasoning + Acting)范式循环运转,每一步都经历“思考→行动→观察→迭代”的闭环。

ReAct闭环详解:
第一步,Thought(思考)。根据当前会话状态、用户输入和历史记忆,推理分析用户真实意图。例如用户说“查明天天气”,Agent思考需调用天气API,提取城市和日期。
第二步,Action(行动)。选择合适的Skills并准备参数,如匹配 weather_query 技能,填充参数(城市为北京,日期为2026年8月8日)。
第三步,Observation(观察)。技能执行后接收返回结果,观察是否符合预期,记录执行状态。
第四步,迭代调整。若结果不完整或出错,调整策略重新行动,直至任务完成或终止。

双模式策略 —— 温和版 vs 专业版。OpenClaw允许为不同场景配置不同风格的Agent实例:
温和版(家庭场景):语气亲切友好,适合日常闲聊、生活助手,注重情感交互,响应较快。
专业版(工作场景):响应精准高效,支持复杂任务(数据分析、代码生成、系统运维),语气正式,注重结果准确性。

两种模式共享底层技能与记忆,仅在决策策略、提示词模板和参数阈值上有所区分,体现了架构的灵活性。决策引擎依赖精心设计的系统提示词(包含角色设定、可用技能列表、输出格式要求),并动态调用Memory层检索相关历史,提升决策质量。


五、Skills技能层:AI的“双手”与执行能力

Skills是Agent能力的具象化体现,没有技能,Agent只能“纸上谈兵”。OpenClaw内置了丰富的技能生态,并支持无限自定义扩展。

内置技能一览:
第一,文件操作。包括读写本地文件、管理文档、处理上传附件(如PDF、Word、Excel解析)。
第二,Shell执行。运行命令行脚本、系统自动化、软件安装与配置。
第三,浏览器控制。网页自动化(基于Playwright或Selenium)、数据抓取、表单填写。
第四,网络请求。HTTP调用、RESTful API集成、第三方服务同步。
第五,定时任务。Cron表达式调度、周期性提醒、定时报告生成。

自定义技能 —— 以SKILL.md为例。开发者只需编写一个标准的 SKILL.md 文件即可注入新能力。文件包含元信息(技能名称、描述、参数定义)和执行脚本(Python、Shell等)。Agent在决策时会读取所有已加载技能的元信息,智能匹配用户请求。这种声明式设计使得新技能添加无需修改核心代码,真正实现“即插即用”。

一个简略示例:技能名为 send_email,参数包括收件人(to)、主题(subject)、正文(body),执行脚本为Python调用SMTP发送邮件,并返回状态信息。


六、Memory记忆层:AI的“知识库”与上下文管理

记忆是Agent持续进化的基石。OpenClaw的Memory层采用三层架构,融合短期缓存、长期存储与智能管理策略。

三层架构说明:
第一层,短期记忆(会话上下文)。保存当前对话的最近N轮消息,用于实时推理。
第二层,长期记忆(向量存储)。将历史对话、用户偏好、知识片段进行向量化,支持语义检索。
第三层,结构化记忆(知识图谱或文档)。存储用户自定义的 MEMORY.md 等结构化知识文件,可被显式引用。

记忆工作流程如下:用户消息进入后,首先进行预处理(清洗脱敏),然后进行语义检索,获取Top-K相关历史,接着进行上下文增强,组装完整Prompt,再交由LLM生成回复,最后将对话自动摘要并写入长期记忆。整个流程确保每次请求都能带上最相关的历史信息,同时避免上下文窗口溢出。

记忆压缩机制:当 MEMORY.md 文件超过大小限制或接近模型上下文窗口时,OpenClaw自动触发压缩,提炼旧内容、去重重复信息、生成摘要,仅保留核心要点,避免文件臃肿。这一机制保证了长期记忆的可持续性,同时不丢失关键信息。


七、总结

OpenClaw的四层架构 —— Gateway、Agent、Skills、Memory —— 层层解耦,各司其职,共同构成了一套生产可用的Agent操作系统。Gateway保障了安全与连通性,Agent赋予了智能与决策力,Skills提供了执行力,Memory则沉淀了知识与经验。无论是家庭助手还是企业级自动化,OpenClaw都能灵活适应,且本地优先、模型无关的特性使其在隐私和扩展性上具有独特优势。

这套设计为AI Agent从原型走向实际落地提供了清晰的范本,也值得所有关注智能体架构的开发者深入学习与借鉴。

Logo

openEuler 是由开放原子开源基金会孵化的全场景开源操作系统项目,面向数字基础设施四大核心场景(服务器、云计算、边缘计算、嵌入式),全面支持 ARM、x86、RISC-V、loongArch、PowerPC、SW-64 等多样性计算架构

更多推荐