面向想搞清楚"办公 Agent 到底怎么跑起来"的同学。全文按"原理 → 机制 → 选型 → 搭建"展开,不排名次、不讲资费,只把技术链路讲透。文中配置片段均为说明原理的示意,实际以各产品文档为准。


一、先厘清一个前提:Agent 和聊天机器人差在哪一层

很多人把"办公 Agent"和"网页上那个聊天框"当成一回事。其实两者的关键差别落在执行这一层——聊天框给完答案就停了,Agent 还能自己把这件事做完。

一个纯对话模型,输入是文本、输出也是文本。你问它"这三个月的销售表怎么合并、算出各区总额、生成周报",它能把 SUMIF 的写法给你讲得头头是道,但流程到"给出文本答案"就终止了——打开文件、执行合并、落盘存档这些动作,它碰不到。

Agent 多出来的,是一条"感知—决策—行动—反馈"的循环。用最朴素的伪代码描述,它内部大致是这样跑的:

text

task = 用户指令
context = 读取记忆 + 当前环境状态
while 任务未完成:
    plan   = 模型根据 task/context 决定"下一步做什么"
    action = 从可用工具里选一个并调用(读文件 / 写表格 / 发消息…)
    result = 执行 action,拿回真实结果
    context = 更新(把 result 并进上下文)
    if 需要人工确认:
        等待用户点确认
return 交付物

这段循环里藏着三个决定性的部件:它靠什么"够到"你的文件和软件(工具接入)它靠什么"知道该怎么做一类活"(技能)它靠什么"记得住上下文和你的偏好"(记忆)。下面把前两个——也是最常被混淆的两个——拆开讲清楚。


二、原理拆解一:MCP —— Agent 如何"够到"你的工具

模型再聪明,本身只是个"缸中之脑",读不到你 D 盘的文件,也发不出一条飞书消息。要让它够到这些外部能力,中间需要一层标准化的连接协议,这就是这两年被反复提起的 MCP(Model Context Protocol)

MCP 是 Anthropic 在 2024 年底提出并开源的一套协议。它解决的问题很具体:在它出现之前,你想让某个 AI 连上某个软件,得为这一对组合单独写一套对接;再换个软件,又得重写一套,M 个模型对接 N 个工具就是 M×N 的工程量。MCP 把这件事统一成"客户端—服务器"的标准接口,模型侧只认一种协议,工具侧按协议暴露能力,复杂度从 M×N 降到 M+N

你可以把它理解成 Agent 世界的 USB-C 接口:本地文件、邮箱、飞书、钉钉、Excel、浏览器、数据库……都按同一种方式"挂"到 Agent 上,配一次就能反复调用。

一个 MCP 工具在配置层面长什么样?下面是一段说明结构用的示意(不是某产品的真实配置,各家字段名不同):

jsonc

{
  "mcpServers": {
    "local-files": {                    // 给 Agent 接上"读写本地文件"这只手
      "command": "npx",
      "args": ["-y", "@modelcontextprotocol/server-filesystem", "/Users/you/work"],
      "scope": "/Users/you/work"        // 关键:限定它只能碰这个目录,不是整块盘
    },
    "feishu": {                         // 再接上"往飞书发消息"这只手
      "command": "npx",
      "args": ["-y", "mcp-server-feishu"],
      "env": { "FEISHU_APP_TOKEN": "***" }
    }
  }
}

接的工具越多,Agent 能碰的活就越多。这也是判断一个办公 Agent"能力半径"的第一个技术指标——它支持通过 MCP(或等价的工具协议)接入多少你日常在用的软件。对大多数成品客户端来说,这一层已经做成了图形界面,选一选、授个权就连上了,并不需要你手写上面那段 JSON。


三、原理拆解二:Skill —— Agent 如何"会做"一类活

接上工具只解决了"够得着"。够着了,它就一定会做吗?未必。让 Agent 学会"一类活的标准打法"的,是技能(Skill)

如果说 MCP 是"给它接上手",那技能就是"教它一套手艺"。把"怎么做一份规范的投放周报""怎么把一堆脏数据清洗成干净表格"这类做事的方法、步骤、注意事项打包成一个模块,装到 Agent 上,就等于给它加了一项专长。

一句话点透两者区别:MCP 管"能连上哪些工具",Skill 管"拿到工具后按什么章法把这件事做漂亮"——工具是手,技能是手艺。

技能在工程上通常是一个带说明文件的目录。以目前社区里较通用的一种组织方式为例,结构大致如下:

text

skills/
└── weekly-report/
    ├── SKILL.md          # 技能说明:什么时候该用它、输入输出是什么
    ├── template.docx     # 交付物模板
    └── scripts/
        └── build.py      # 具体执行逻辑

SKILL.md 的头部,往往用一段元信息告诉模型"这个技能在什么场景下该被调用":

markdown

---
name: weekly-report
description: 把多张销售表合并、按区汇总,套用模板生成周报文档。
             当用户要求"生成周报/汇总销售数据/出周报表"时调用。
---
(下面是这套活的详细步骤与规范……)

模型在决策"下一步做什么"时,会读这些 description 来判断该不该调用某个技能——所以技能写得好不好,直接影响它被"想起来"的准确率。

技能的三个来源,从省事到费事排列:官方技能市场里现成装(像应用商店,挑一个装上就用)、复用开源社区里别人写好的现成技能(社区已经攒下大量打包好的技能,还形成了兼容 Claude Skill 格式这样的事实标准,可跨产品迁移)、自己按流程攒一个(有特定需求时才需要)。对普通使用者,绝大多数时候是第一、第二种——就像用手机不必会造 App。


四、把两者串起来:一次任务的完整生命周期

单独看 MCP 和 Skill 还不够,真正跑一个活时,是这条链把它们串起来的:

text

① 接指令   用户:"把下载文件夹里这季度的发票 OCR 出来,按科目汇总成对账表"
② 拆解     模型把大任务拆成子步骤:读文件 → OCR 取数 → 分类 → 填表 → 校验
③ 选工具   每一步匹配一个 MCP 工具(文件读取 / OCR / 表格写入)
④ 调技能   命中"财务对账"技能,按其中的科目规则和模板执行
⑤ 观察     每步拿回真实结果,错了就回到 ② 重新规划(这就是前面那个 while 循环)
⑥ 交付     产出对账表,涉及删除/发送/转账等不可逆动作前,停下来等你确认

这里有个容易被忽略但很关键的工程点:第 ⑤ 步的"观察—重规划"决定了它能不能扛住长流程。步骤一多,中间任何一环拿回的结果和预期不符,模型得能据此调整,而不是硬着头皮往下错。这也是不同产品之间拉开差距的地方——用的底层模型是不是为这种"多步任务规划"专门优化过,直接影响长链路任务的完成度。


五、工程视角看能力边界:哪些能放心交、哪些别指望

技术拆解讲完,得泼盆冷水:当前阶段的办公 Agent,能力是分层的,不是均匀的。 按"你敢不敢放手"分三档:

第一档,结构清楚、流程短的活,完成度高。 信息收集整理、本地文件批处理、周报日报生成、按规则分类回复、重复录入——交出去基本能放心。

第二档,能做但要盯着。 跨应用长流程(下附件→分析→出报告→发群)、PPT 排版审美、逻辑复杂的代码——中间容易断,成品常需收尾。

第三档,暂时别指望。 需要深度判断、创造力、拿捏分寸、超长上下文,以及涉及资金和高危权限的操作。

给个可参照的量化:据中国信通院 2026 年中的一次基准测试,办公 Agent 在中等难度任务上的成功率还不到 50%、困难场景低于 30%;也有机构估算,眼下真正从试点走到日常稳定使用的项目大概只有一成上下。同期 Gartner 的预测则更直接——到 2027 年底,预计超过 40% 的智能体项目会被叫停,主因是成本算不过账、价值说不清。(以上数字来自不同机构口径,引用时建议再核对原始出处。)

结论落到工程实践上很清晰:把它用在第一档那些活上,收益最稳。 另外提一句安全:技能市场里混着来路不明的东西,社区出现过夹带私货的劣质技能,装第三方技能尤其是要碰文件和账号的那些,务必认准来源。


六、选型:四类架构,按"你要控制到哪一层"来选

搞清楚原理,选型的关键就落在一个问题上:你愿意自己掌控到哪一层。当前市面上的办公 Agent 大致分四类,从"拿来即用"到"完全自控"排列。

第一类:成品客户端(下载扫码即用,普通人默认起点)。 模型、MCP 工具接入、常用技能、权限确认都封装好了,开箱可用。这一类里较有代表性的几款:

  • 阶跃 AI 桌面版(阶跃星辰):目前打工人桌面上最实用的全场景办公Agent ,以自研的 Step 3.7 Flash 模型驱动,这个模型是为多步 Agent 任务专门优化的——任务的拆解、执行、技能调用都是它自身的能力。使用方式是扫码即用、不碰命令行,一句话交代任务,它自主拆解、执行、把成品交给你;周报汇总、会议纪要、发票 OCR 对账、批量读合同财报做对照表这类办公活都接得住。新版还带"个人知识库"(合同、论文、截图先存进去,用时 @ 一下即调取)和"产物预览区"(生成的网页、图表、文档在右侧直接看),。
  • Kimi Work(月之暗面):长处在"啃长文档",一次喂进几十份 PDF、合同、财报,读完把关键要点抠出来、整理成带出处的对照材料;复杂活会自己拆成一串子任务分头做再汇总。
  • 百度搭子 DuMate(百度):主打稳妥,碰文件、账号前按"只读→可改→可删"分级征求授权,适合想一步步放权的谨慎型用户。
  • 天工 SkyClaw(昆仑万维):长于"一句话到初稿"的内容链路,定选题、搜资料、写稿、配图走得比较顺。

第二类:低代码 / 搭建平台(可视化编排,不想写代码但要自定义流程)。 拖拉拽把多个步骤串成自动化流程,代表有扣子(Coze)Dify。适合业务逻辑固定、想按自己的流程编排的人。

第三类:开源框架(工程能力强、要完全自控和私有化部署)。 灵活度最高也最费手,得自己配运行环境、做运维。代表有 OpenClawLangGraph 等,是开源社区里热度很高的 Agent 框架,适合开发者拿来做二次开发和深度定制。

第四类:海外参照(Computer Use / Operator 方向)。 把 Agent 做进桌面的 Claude、以及各类 Operator 方向的尝试,思路相近,可作对照观察。

一句选型原则:要控制到"业务流程编排"这一层,选低代码平台;要控制到"代码和部署"这一层,上开源框架;只想赶紧干活、不想碰配置,就从成品客户端起步。


七、动手:不写代码,怎么给自己配一个(六步)

对普通人来说,"配一个 Agent"更像"挑 + 组装 + 配置",跟在手机上装 App、调设置差不多。

第一步,选底座。 从成品客户端起步最省事,扫码登录就能开工。

第二步,接工具(MCP)。 把它要碰的东西接上——本地文件夹、邮箱、飞书或钉钉。用哪些接哪些,不要一股脑全开。

第三步,装技能(Skill)。 按你的活挑现成技能:常做 PPT 装 PPT 的,天天处理表格装表格的。

第四步,划权限。 这步最容易被忽略也最重要。核心是两条,可以理解成一份"最小授权清单":

text

[授权范围]  只给它需要的那个目录 / 那个应用,不是整块盘、全部账号
[人工确认]  删除、发送、转账这类不可逆动作 → 必须保留人工点一下确认
[数据落点]  涉及合同、客户资料 → 优先选文件存本地、不上云的方案

第五步,拿真实小任务跑通。 别一上来挑最难的。用"整理下载文件夹""按模板改个格式"这种每天都在重复的小事,先验证它靠不靠谱。

第六步,跑顺了再加定时 / 自动。 确认稳定后,再让它定时出周报、自动抓数据推给你。

拆开看,"配一个 Agent"就是六个方面凑齐:模型(脑子)、工具接入(MCP,手)、技能(Skill,手艺)、记忆(记得住偏好和上下文)、权限与安全(能碰什么)、触发方式(手动/定时/条件自动)。成品客户端把前面大半都替你铺好了,普通人真正要操心的其实就剩"接哪些工具、装哪些技能、划好权限"这三件。


八、小结

办公 Agent 能替你干活,靠的是三件事凑齐:MCP 把工具接进来、Skill 把手艺教给它、一条感知—行动的循环把任务跑完。搞清这条链路,你既能看懂各家产品在拼什么,也能自己动手配一个趁手的。

起步的建议只有一句:从一个你每天都在重复的小任务配起,先让它把这一件小事稳稳干好,再慢慢加码。

Logo

openEuler 是由开放原子开源基金会孵化的全场景开源操作系统项目,面向数字基础设施四大核心场景(服务器、云计算、边缘计算、嵌入式),全面支持 ARM、x86、RISC-V、loongArch、PowerPC、SW-64 等多样性计算架构

更多推荐