RUNstate=EXECUTING
TRACEhash_chain=on
POLICYhitl=required
AGENT OS · TECHNICAL BLUEPRINT

把企业 Agent 升级成
可管理、可协作、可治理的智能体操作系统。

通过 12 篇设计文档 展开 4 个维度:平台总览 → 协同运行时 → 执行内核 → 横切关注点。下面 10 节是预览,每节末尾跳到对应详细文档。

Agent 管理
多 Agent 协作
Harness 内核
治理与可观测

三层架构:产品平台、运行时、执行内核

三层职责按"配 / 执 / 跑"切分:Tier 1 配(产品形态、组织、能力中心、开放平台)、Tier 2 执(多 Agent 协作、把多次 Run 编织成业务)、Tier 3 跑(一次 Run 的确定性执行)。再加上贯穿三层的治理与可观测横切线——平台能力不全算进 Harness 内核,Harness 只负责单次 Run 的执行安全。

TIER 1 · APPAgent Platform · 企业级 Agent 管理与协作平台
面向用户与管理员的产品能力
组织与权限
组织架构
角色权限
资源权限
Agent 管理
个人 Agent
项目 Agent
Agent Team
人机协作空间
@ 消息 / 通知
任务分配
协作群工作台
能力中心
Skill 市场
Tool Hub
知识库 / 提示词
运营控制台
审计看板
成本看板
使用分析
开放平台
OpenAPI
Webhook / SSE
SDK / 集成
TIER 2 · RUNTIMEAgent 协同运行时
Agent 之间的对话、协同与会话延续
多 Agent 协作
Team 展开
协作群 / 角色分配
通信协议 / 协同策略
任务调度
Job 分解
父子 Run / 串行 & 并行
Sequential Relay
会话与 Session
AgentSession
跨 Run 上下文
Run 接力链
共享记忆
Team scope
User / Workspace scope
跨 Run 召回 / 写回
TIER 3 · KERNELHarness · 智能体执行内核
6 组件承载下文「八步执行管道」 · LLM 作为 Tool 之一由计划执行器调度 · 沙箱按 Skill 实例化 ↗(不是 Run 容器,纯 LLM/DB 调用不进沙箱)
Run 管理器
Run 创建
状态机
恢复 / 取消
上下文装配器
用户上下文
环境上下文
历史上下文
计划执行器
步骤执行
并行 / 条件
循环控制
工具调用控制器
工具选择
参数校验
调用执行
HITL 控制器
人工确认
人工干预
审批流集成
审计追踪器
执行日志
输入输出留痕
追踪链路
Cross-Cutting · 横切关注点(贯穿三层)
治理Governance
T1审批策略 / 成本上限 / 风险矩阵→T2Team 权限边界 / 跨 Run 配额→T3Policy 校验 / HITL 拦截
可观测Observability
T1审计看板 / 使用分析→T2DelegationTrace / 跨 Run 链路→T3RunTrace / StepTrace / ToolTrace
详细设计:三层架构 →
Tier 2 · 协同运行时多 Run 怎么编织3 节

多 Agent 协作走统一协议

从 @ 派单到协作群,所有跨 Agent 调用都通过统一协议;父子 Run 各自独立沙箱,DelegationTrace 把链路串起来;Round 0/1/2 三段式编排执行与汇总。

Invocation

AgentInvocation 协议

跨 Agent 调用统一契约:caller / callee / context / extra。Tier 3 不感知,由 Tier 2 Coordinator 路由。

Parent · Child

父子 Run 关系

子 Run 独立 RunState 与沙箱,结果通过 ResultSink 回传,整链由 DelegationTrace 串起。

Round 0 · 1 · 2

三段式协作

Round 0 规划 → Round 1 并行执行 → Round 2 汇总。Coordinator 守住 ResultSink。

详细设计:多 Agent 协作协议 →

Team 把临时协作群升级为持久化组织

Team 是长期实体而非 ad-hoc session:固定成员、可配置协作策略、共享记忆 scope、可治理边界。一份配置驱动 fan-out / sequential / lead-driven 三种执行模式。

Persistent

持久化组织单元

Team 长期存在,跨 session 累积上下文;不像每次新建协作群都从零开始。

Roles

角色 ≠ Persona

同一 Persona 在多个 Team 内可有不同角色(lead / executor / reviewer / observer)。

Strategy

协作策略可配置

Team 级 collaboration_strategy 覆盖全局默认:fan-out / sequential / lead-driven。

详细设计:Agent Teams →

Memory 不是拼 prompt,而是上下文治理系统

Memory 模块解决"模型带着什么上下文跑":预检、召回、压缩、写回、隔离五个动作必须独立测试。

Precheck

Token 预算预检

所有 LLM 调用前计算 system + history + tools + memory,超过预算先压缩。

Retrieval

相关记忆召回

按 tenant / user / session 强隔离,只召回与当前任务相关的 memory。

Compression

压缩可证

保留用户目标、约束、工具关键结果、HITL 决策,丢失则回退或拒绝。

Writeback

写回受控

成功 Run 才写长期结论;失败、拒绝、取消不写危险经验。

Privacy

敏感过滤

OAuth token、cookie、临时密钥、短期 PII 原文不得进入长期 memory。

Isolation

多层隔离

tenant_id / user_id / session_id 三层隔离。跨 tenant 串记忆是一票否决。

详细设计:Memory / Context →
Tier 3 · 执行内核单次 Run 怎么跑3 节

Harness 八步执行管道

准备阶段只读可重试;执行阶段有 Policy / HITL 双守门员;所有路径最终必须进入 Trace。

Execution Kernel

一次 Run 的完整生命周期

从 Run 创建到 Trace 留痕,每一步都被状态机、Policy、HITL、Trace 与成本治理约束。

01
Run 创建
run_id / state / session
02
上下文装配
system / history / memory
03
Skill 加载
permission / schema
04
Plan 规划
intent / steps / tools
05
Policy 校验
permission / cost / risk
06
Tool 调用
execute / retry / trace
07
HITL 审批
confirm / approve / reject
08
Trace 留痕
audit / cost / error
8 步 ↔ 6 组件映射(与三层架构图一一对应)
01→Run 管理器
02→上下文装配器
03 · 06→工具调用控制器
04→计划执行器
05 · 07→HITL 控制器
08→审计追踪器
详细设计:Harness 内核 →

RunState 是唯一真实状态源

旧 Job.status 不扩展,不参与 Harness 判断;只由 RunStateProjector 单向投影给旧页面、旧接口、旧 Celery。

CREATED→PREPARING→PLANNING→POLICY_CHECK→EXECUTING→AWAITING_HITL?→TRACING→SUCCEEDED
POLICY_CHECK→REJECTED→TRACING→CLOSED_REJECTED
EXECUTING→FAILED / TIMEOUT→TRACING→CLOSED_FAILED
pendingCREATED / PREPARING / PLANNING
runningEXECUTING / AWAITING_HITL / TRACING
doneSUCCEEDED
failedCLOSED_REJECTED / CLOSED_FAILED / CLOSED_CANCELLED
详细设计:RunState 状态机 →

自修复机制:从失败恢复到稳定运行

自修复不是让 Agent 任意重试,而是在 Policy、成本、幂等和 Trace 约束下进行可控恢复。

Retry

自动重试

Tool / LLM 网络错误、5xx、429 按指数退避重试;4xx、auth、billing、context_length 不重试。

Fallback

模型 / Skill 降级

主模型超时或熔断时切备模型;Skill 熔断时走 manifest 声明的 fallback_skill。

Circuit

熔断恢复

外部依赖连续失败进入 OPEN,30s 后 HALF_OPEN 探测,探测成功恢复 CLOSED。

Recovery

失败 Run 恢复

失败、超时、卡住的 Run 基于 RunState + Trace 判断是否恢复、降级、拒绝或进入人工处理。

Zombie

僵尸 Run 检测

CREATED / PREPARING / EXECUTING / TRACING 停留超阈值时触发告警、补偿或终态收敛。

Rollback

灰度异常回滚

一票否决项、失败率异常、Trace 写入异常时,通过 feature flag 立即切回旧路径。

详细设计:自修复机制 →
Cross-Cutting · 横切关注点贯穿三层的治理与可观测3 节

自动规则 + 人工审批双守门员

Policy 处理确定性规则,HITL 处理高风险和边缘场景;Break-Glass 只能缩短审批等待,不能绕过治理底线。

风险等级典型动作审批策略
Low只读查询、内部生成、临时计算自动通过
Medium项目空间写操作、普通外部消息、付费 API本人确认
High生产部署、数据破坏、权限变更、金额操作、Shell审批人审批 / 双人复核
Break-Glass生产紧急事件跳过部分等待,但不跳过身份、权限、Policy、Trace、事后审查
Runtime Governance

运行治理控制面

  • 限流:per-User / Workspace / Skill / Model
  • 超时:执行类超时 → CLOSED_FAILED;HITL 超时 → CLOSED_REJECTED
  • 重试与熔断:指数退避、OPEN / HALF_OPEN 恢复
  • 成本:单 Run、User、Workspace、Skill 成本上限
  • 回滚:异常触发 feature flag 切回旧路径
详细设计:治理与 HITL →

Trace 记录事实,Replay 复现事实,Debug 解释差异

迁移期先接通 Trace 写入点;灰度后补 Pure Trace Replay、Mock Replay、Live Replay 专用环境。

RunTrace

Run 生命周期

state_history、终态、成本聚合、trace_id 关联。

StepTrace

八步管道

每一步的输入输出 hash、耗时、状态转换。

ToolTrace

工具调用

skill_id、version、retry、status、error_code。

PolicyTrace

策略决策

rule_id、decision、reason、latency。

HITLTrace

审批决策

审批级别、审批人、等待时长、超时动作。

SSE / Cost / Error

事件与成本

流式事件、token 成本、错误码与 stack hash。

详细设计:可观测与 Replay →

能力中心:工具契约不能漂移

Skill 版本治理属于 Agent Platform 能力中心;运行时在调用 Skill 前锁定 skill_id + version + manifest_hash,避免旧 Agent 被动吃到破坏性新版本。

Lifecycle

Skill 生命周期

  • draft → submitted:开发完成后提交审核。
  • submitted → published:发布后 manifest 不可修改。
  • published → deprecated:可继续使用,不允许新增启用。
  • disabled:紧急下架,Agent 失效或 fallback。
Semver

显式升级规则

  • PATCH:不改变 schema / 权限 / 副作用。
  • MINOR:向后兼容增强,只新增可选字段。
  • MAJOR:破坏性变更、权限扩大、副作用增强。
  • Trace 必须记录 skill_version 与 manifest_hash。
详细设计:Skill 版本治理 →

详细技术设计文档入口

当前页面作为 Agent Platform 技术总览;详细设计文档可以按模块拆成独立 HTML / Markdown,并与上传的 index.html 首页互相跳转。

推荐文档结构

首页负责“讲清楚平台是什么”,技术文档负责“讲清楚怎么实现”。建议同目录部署:index.html 作为产品首页,本页命名为 agent-os-technical-doc.html,详细文档放到 docs/ 目录。

部署时在 index.html 中加入按钮:<a href="./agent-os-technical-doc.html">查看技术设计</a>,即可跳转到本技术文档。

读完了?这是下一步

Agent Platform 是一个仍在演进的设计。每篇文档都欢迎评审反馈——技术决策最终落地到代码与团队工程实践。