通过 12 篇设计文档 展开 4 个维度:平台总览 → 协同运行时 → 执行内核 → 横切关注点。下面 10 节是预览,每节末尾跳到对应详细文档。
三层职责按"配 / 执 / 跑"切分:Tier 1 配(产品形态、组织、能力中心、开放平台)、Tier 2 执(多 Agent 协作、把多次 Run 编织成业务)、Tier 3 跑(一次 Run 的确定性执行)。再加上贯穿三层的治理与可观测横切线——平台能力不全算进 Harness 内核,Harness 只负责单次 Run 的执行安全。
从 @ 派单到协作群,所有跨 Agent 调用都通过统一协议;父子 Run 各自独立沙箱,DelegationTrace 把链路串起来;Round 0/1/2 三段式编排执行与汇总。
跨 Agent 调用统一契约:caller / callee / context / extra。Tier 3 不感知,由 Tier 2 Coordinator 路由。
子 Run 独立 RunState 与沙箱,结果通过 ResultSink 回传,整链由 DelegationTrace 串起。
Round 0 规划 → Round 1 并行执行 → Round 2 汇总。Coordinator 守住 ResultSink。
Team 是长期实体而非 ad-hoc session:固定成员、可配置协作策略、共享记忆 scope、可治理边界。一份配置驱动 fan-out / sequential / lead-driven 三种执行模式。
Team 长期存在,跨 session 累积上下文;不像每次新建协作群都从零开始。
同一 Persona 在多个 Team 内可有不同角色(lead / executor / reviewer / observer)。
Team 级 collaboration_strategy 覆盖全局默认:fan-out / sequential / lead-driven。
Memory 模块解决"模型带着什么上下文跑":预检、召回、压缩、写回、隔离五个动作必须独立测试。
所有 LLM 调用前计算 system + history + tools + memory,超过预算先压缩。
按 tenant / user / session 强隔离,只召回与当前任务相关的 memory。
保留用户目标、约束、工具关键结果、HITL 决策,丢失则回退或拒绝。
成功 Run 才写长期结论;失败、拒绝、取消不写危险经验。
OAuth token、cookie、临时密钥、短期 PII 原文不得进入长期 memory。
tenant_id / user_id / session_id 三层隔离。跨 tenant 串记忆是一票否决。
准备阶段只读可重试;执行阶段有 Policy / HITL 双守门员;所有路径最终必须进入 Trace。
从 Run 创建到 Trace 留痕,每一步都被状态机、Policy、HITL、Trace 与成本治理约束。
旧 Job.status 不扩展,不参与 Harness 判断;只由 RunStateProjector 单向投影给旧页面、旧接口、旧 Celery。
自修复不是让 Agent 任意重试,而是在 Policy、成本、幂等和 Trace 约束下进行可控恢复。
Tool / LLM 网络错误、5xx、429 按指数退避重试;4xx、auth、billing、context_length 不重试。
主模型超时或熔断时切备模型;Skill 熔断时走 manifest 声明的 fallback_skill。
外部依赖连续失败进入 OPEN,30s 后 HALF_OPEN 探测,探测成功恢复 CLOSED。
失败、超时、卡住的 Run 基于 RunState + Trace 判断是否恢复、降级、拒绝或进入人工处理。
CREATED / PREPARING / EXECUTING / TRACING 停留超阈值时触发告警、补偿或终态收敛。
一票否决项、失败率异常、Trace 写入异常时,通过 feature flag 立即切回旧路径。
Policy 处理确定性规则,HITL 处理高风险和边缘场景;Break-Glass 只能缩短审批等待,不能绕过治理底线。
| 风险等级 | 典型动作 | 审批策略 |
|---|---|---|
| Low | 只读查询、内部生成、临时计算 | 自动通过 |
| Medium | 项目空间写操作、普通外部消息、付费 API | 本人确认 |
| High | 生产部署、数据破坏、权限变更、金额操作、Shell | 审批人审批 / 双人复核 |
| Break-Glass | 生产紧急事件 | 跳过部分等待,但不跳过身份、权限、Policy、Trace、事后审查 |
迁移期先接通 Trace 写入点;灰度后补 Pure Trace Replay、Mock Replay、Live Replay 专用环境。
state_history、终态、成本聚合、trace_id 关联。
每一步的输入输出 hash、耗时、状态转换。
skill_id、version、retry、status、error_code。
rule_id、decision、reason、latency。
审批级别、审批人、等待时长、超时动作。
流式事件、token 成本、错误码与 stack hash。
Skill 版本治理属于 Agent Platform 能力中心;运行时在调用 Skill 前锁定 skill_id + version + manifest_hash,避免旧 Agent 被动吃到破坏性新版本。
当前页面作为 Agent Platform 技术总览;详细设计文档可以按模块拆成独立 HTML / Markdown,并与上传的 index.html 首页互相跳转。
首页负责“讲清楚平台是什么”,技术文档负责“讲清楚怎么实现”。建议同目录部署:index.html 作为产品首页,本页命名为 agent-os-technical-doc.html,详细文档放到 docs/ 目录。
index.html 中加入按钮:<a href="./agent-os-technical-doc.html">查看技术设计</a>,即可跳转到本技术文档。