AI WorkOS · 企业级工作操作系统

AI 员工 进入真实业务,
并对结果持续负责

围绕业务责任,把企业知识、规则、判断和执行能力沉淀下来。
智能数字劳动力确定性数字劳动力 合理分工, 并通过观察、评估、反思和受控优化,稳定地交付业务结果。

“从个人 AI 到组织 AI,变化的不是人怎么工作,而是 谁来承担工作。”

11 步建设链路
3 类工作承载者
6 层评估指标
257 历史场景沉淀
01 — FDE 落地方法论

AI 员工进入业务,
不是先做,而是先负责

把"做出来一个 Agent"和"让业务责任被持续做好"分开。 从一段具体工作出发,先定业务责任,再进入真实现场,最后在运行里被持续治理。

  1. 01找工作发现一段具体可验收的工作
  2. 02定主人明确业务 Owner
  3. 03写标准定义结果和验收标准
  4. 04配能力配置上下文、知识、Skill、连接器
  5. 05进业务进入真实系统和业务现场
  6. 06做评估真实运行,按指标评估结果
  7. 07找问题从异常与跨任务规律中定位根因
  8. 08再验证失败案例重放 + 全量回归
  9. 09可治理身份、权限、发布、回滚可追踪
链路口诀 找工作 → 定主人 → 写标准 → 配能力 → 进业务 → 做评估 → 找问题 → 再验证 → 可治理
A
阶段一 · 探索

证明能做

允许手动触发、人工补数据和不完整权限,重点验证核心判断和最难环节。

Demo 成功只证明某个 Case 可以跑通,
不等于 Agent 成功。
B
阶段二 · 试点

证明值得做

使用真实用户、真实数据、真实流程、真实异常。明确业务 Owner、成功评价、试点周期、验收标准与人工兜底。

C
阶段三 · 生产

证明可长期交付

补齐身份权限、系统连接、异常检测与恢复、人工审批边界、数据安全、版本发布与回滚、持续评估。

能力可用 → 真实运行可托付 → 责任配置可切换 → 组织机制可固化。

Agent 是工作承载者之一,业务责任才是企业长期需要保证的对象。

02 — 范式跃迁

从个人 AI 到组织 AI。
变化的不只是工作方式
而是谁来承担

五次认知转换,一个结论。当 AI 开始持续承担一段真实工作,企业的讨论中心 从"AI 能不能做"转向"什么由谁来做"。

  1. I AI 工具 → 个人能力增强 人 + AI → 软件 → 完成工作。
  2. II 个人能力 → 新工作承担者 "人用了 AI" ≠ "AI 开始承担工作"。
  3. III AI 能力 → 工作承担方式 从"AI 能做什么"转向"什么由谁来做"。
  4. IV 承担方式 → 混编责任 人、智能数字劳动力、确定性数字劳动力,比较优势组合。
  5. V 局部混编 → 运行模式变化 协作、信息流、决策、授权、管理对象,开始系统改变。

三类工作承担者,按比较优势重新组合

W₁

Human

  • 目的与价值取舍
  • 复杂关系与信任
  • 高影响判断与重大承诺
  • 最终业务与制度责任
W₂

智能数字劳动力 Agent

  • 多源信息理解与综合
  • 开放判断与动态规划
  • 非结构化信息处理
  • 长尾场景与跨时间持续推进
W₃

确定性数字劳动力 RPA · Workflow · Rule Engine

  • 规则明确、输入稳定
  • 高频、强一致性
  • 易验证、可重试、可恢复
  • 低成本批量执行
·

混编的不是人数,而是责任

·

能用确定性方式可靠完成的,不要为了 AI 化而增加模型不确定性

·

目标不是最大化 AI,而是更合理的工作组合

03 — 持续运营闭环

真实运行决定一切。

检查帮助找到可能的问题,真实运行决定优化是否有效。 观察记录事实,评估判断表现,反思定位根因,进化执行改进。

04 观察Observe
01 评估Evaluate
02 反思Reflect
03 进化Evolve
真实运行 Production Reality
观察 · Observe

记录的是事实,不是结论

  • 谁发起了任务、当时的 Context
  • 使用了哪些知识、规则、Skill、Workflow 与工具
  • 做出了哪些判断和动作、最终结果与异常
评估 · Evaluate · 评估六层

不只看表达,要看结果

  1. 结果准确性
  2. 任务完成率
  3. 企业规则符合度
  4. 执行效率与成本
  5. 用户认可和采纳情况
  6. 最终业务结果

不要把"语言是否流畅、表达是否像专家"当作评估指标。

反思 · Reflect · 反思七类根因

综合多任务,定位跨任务根因

  • 01Context 不完整
  • 02知识缺失或过期
  • 03Agent 角色和规则不清
  • 04Skill 不足或重复
  • 05Workflow 冲突
  • 06工具连接失败
  • 07数据不可靠

反思提供问题线索,真实运行决定优化是否有效。

进化 · Evolve · 受控修改 + 双向验证

改完必须重新验证

  • 失败样本:原失败案例重放,确认问题是否真正解决。
  • 正常样本:原正常历史能力回归,确认没有退化。

反思告诉我们怎么改;重放确认是否修好;回归确认有没有修坏别的地方。

Evaluation 是持续风险筛查,不等同于业务真相
04 — 真实复盘

从"能用"到"持续可靠":
报销审批 Agent 的五个阶段

一个真实业务场景从自然语言原型走向工程化研发、再走向 自动评估与受控反思 的完整路径。

  1. 01
    阶段一 · 自然语言快速构建

    自然语言描述规则,几天跑通 Demo

    "找出差超过 3 天的订单"、"按部门汇总本月费用"、"筛选金额大于 1 万元的记录" → 演示效果不错。

    但生产实际仍暴露问题:花名与真实姓名混淆(如"小明"对应"张三")、跨年时间比较偶发错误(2024-12-31 > 2025-01-01)。

    演示正确,不能证明生产可控。

  2. 02
    阶段二 · 持续修补

    一个问题一条规则,边界无法穷举

    "发票抬头识别错了" → 规则 1。再发现 → 规则 2……规则 n。规则越补越多,Token 同步膨胀,形成"规则债务"

    同步动作:精简输入 JSON,仅保留关键信息,Token 明显下降。

  3. 03
    阶段三 · 整体重构

    先建立结构,再让 Agent 判断

    步骤 1 — 确定性流程脚本化:身份映射、时间比较、金额计算、字段校验 → 脚本工具箱,只处理确定性流程。

    步骤 2 — 引入行程数据结构:费用先归属行程,再执行审核;行程挂载费用、发票、平台订单、补贴津贴。

    结构对了,Agent 的判断才真正可控。

    收益:准确性显著提高、关键逻辑更确定、问题可定位到 Skill 或脚本。
    代价:规则重复与调用链变长、Token 上升。核心问题:如何在不破坏准确性的前提下降低成本?

  4. 04
    阶段四 · 工程优化 · Token 100% → 50% → 25%

    项目进入工程化研发阶段

    为什么引入 Codex + Git:WorkOS 提供真实调用现场(运行 Agent、调用日志、链路追踪、结果查看);Codex 提供更强模型与完整工程上下文(agent.md / skill.md / src/tools.py),能跨多文件保持一致;Git 负责版本管理与回滚。

    两轮全局优化:

    • 第一轮:项目级扫描,去重 agent.md / skill.md / scripts,Token 约降至 50%
    • 第二轮:分析高消耗调用链,精简调用路径,再降低约一半,至 25%
  5. 05
    阶段五 · 自动评估与受控反思【下一阶段】

    自动化发现问题、组装证据、提出修改、运行重放与回归

    六步闭环:线上异常 → 自动评估 → 候选修改 → 失败案例重放 → 全量回归 → 人工审核与发布。

    候选修改不得未经人工审核直接发布。

    评估该做什么(5 步):

    1. 代码测试 —— 确定性流程由代码自动验证,不靠模型判断。
    2. 语义评估 —— 分类、证据选择与规则解释。
    3. 回复评估 —— 无依据陈述必须带依据[1][2],信息不足就追问或转人工。
    4. 版本回归 —— 失败重放 + 全量回归,新版本 vs 上一稳定版本,不通过不能发布
    5. 线上观测 —— Evaluation 持续筛查 + 人工抽检,结合线上 Trace。

    Evaluation 是持续风险筛查,不等同于业务真相。

前四阶段 解决"如何把 Agent 做对"
下一阶段 解决"如何持续知道它做得对不对"
演进路径 能用 → 好用 → 持续可靠
05 — 历史场景沉淀

257 个真实场景,来自持续交付。

全部来自影刀与各行业客户的真实落地。每一个场景都对应一次业务责任、 一种工作承载方式、一段可复用的做法。

— / 257
正在加载场景库…
06 — 一起共创

从一段具体工作开始。
让 AI 员工真正承担业务责任。

我们陪伴你完成一次"从责任 → Owner → Agent 岗位说明书 → 进入现场 → 评估 → 反思 → 进化"的完整闭环。 不做大改造,从一项高价值、有清晰责任与可验收标准的工作开始。

预约共创

围绕贵司一项具体业务责任,1–2 周内完成端到端试点。

  • 明确业务责任与 Owner
  • 完成 Agent 岗位说明书
  • 接入真实系统并完成评估
  • 形成可治理的发布版本

沟通咨询

了解 FDE 团队如何伴随你的 Agent 长期演进。

  • 已有 Agent 的评估与回归
  • 从个人 AI 到组织 AI 的路径设计
  • 人 / Agent / RPA 混编责任分工
  • 持续风险筛查与发布门禁