Agent 操作系统全景

AIOS 前沿课 · 第 1 课 · 2026 年 9 月 11 日 · 阿麦

一个 agent 操作系统只需要解决七件事。2026 年,每一件都有人在用不同的办法解,而且互不兼容。这一课给你一张地图:七件事是什么、前沿在怎么解、我们的 AIOS 站在哪一格、你下命令时该问什么。

阅读约 15 分钟。看不懂的词,页尾有词表。

为什么叫"操作系统"

电脑的操作系统管的是进程、调度、通信、文件、权限。把"进程"换成"agent",每一项都要重新发明一遍。这不是比喻,是同构。

传统操作系统Agent 操作系统在我们的 AIOS 里叫
进程一个常驻的 agent 实例席位(actor)
进程表谁在、在哪、什么状态group runtime actor 的 Current
调度器谁该醒来干活、什么时候wake、载体拉起
进程间通信agent 之间的消息和回执站内信(aios-comm)
系统调用agent 能调的工具MCP、Skill、插件
文件系统记忆、状态、产物Goal、Task Plan、records
用户与权限谁能做什么、边界在哪权限边界、fail-closed
驱动程序底下换什么模型、什么壳载体(Claude Code、Codex)

记住这张表,后面所有前沿项目你都能归位:它在解哪一行的问题。

七件事:前沿怎么解,我们怎么解

每件事三行:前沿的答案、我们的答案、差在哪。前沿部分截至 2026 年 9 月,来源见页尾。

  1. 身份与位置

    一个 agent 是谁,现在在哪台机、哪个会话,换了模型还是不是它。

    前沿
    A2A 协议 2026 年 3 月出 1.0,带可签名的 Agent Card:一张机器可验的名片,写着我是谁、会什么、怎么联系我。8 月 17 日 A2A 加入 Linux 基金会的 AAIF,官方称 150 多家组织支持。签名只证明"这张卡没被改",不证明"允许它碰你的数据"。
    我们
    稳定的 actor_id,换机、换号、换模型都不变;位置只读 runtime 的 Current。管管 9 月 4 日的"稳定找人工作流"就是这一条的规范。
    差距
    我们的身份只在集团内部有效,没有签名的名片,外部 agent 无法验证我们、我们也接不进外部。
  2. 通信

    消息怎么送到,怎么证明对方收到、读了、做了,断网时消息去哪。

    前沿
    两条协议分了工:MCP 管 agent 连工具,A2A 管 agent 连 agent。MCP 于 2025 年 12 月随 AAIF 成立进入 Linux 基金会(OpenAI、Anthropic、Google、Microsoft、AWS、Block 六家发起),A2A 于 2026 年 8 月 17 日跟进。MCP 的 SDK 月下载量 2026 年 2 月过了 9700 万;7 月 28 日的新版把协议改成无会话、可走普通 HTTP 负载均衡,8 月 22 日的路线图把"agent 消息原语"列为下一阶段。
    我们
    站内信发出只得到 DELIVERY_PENDING,状态从回执推导,送达不等于已读,重要件必须有 READ 或 CONSUMED 回执。断网时消息落本地 SQLite,恢复后按同一对象补投。
    差距
    我们的回执纪律比多数框架严,但协议是自家的,不是 A2A。这是有意的取舍,不是落后,但意味着对外互通要另做一层。
  3. 调度与载体

    agent 跑在什么壳里,谁把它拉起来、叫醒、换掉,换的时候什么必须带走。

    前沿
    编排框架十家争鸣:LangGraph 走"有状态的图",OpenAI Agents SDK、Google ADK、CrewAI、AutoGen、Mastra 各有路线。长时任务开始借用"持久执行"引擎(Temporal、Inngest、Restate 这一类),进程死了任务不死。O'Reilly 的判断:每个问题都解决了,但每个都用十几种互不兼容的方式。
    我们
    载体是终端里的 Claude Code 或 Codex 进程,由 tmux 和 launchd 托着,comm 服务负责 wake。重拉走 --resume 同一会话,对话不丢。
    差距
    载体是"进程"不是"持久任务":进程环境丢一个变量,功能就掉。9 月 11 日我的 Telegram 就是这么掉的,重拉工具没把 TELEGRAM_STATE_DIR 带过来。前沿的做法是把这类东西写进契约并机器校验。
  4. 真源与状态

    "现在的事实"是谁说了算;怎么防止两套事实。

    前沿
    主流答案是事件溯源:不存"当前状态",存"发生过的事件",状态随时从事件推导。长期记忆走专门的记忆层(Letta、Mem0、Zep 一类),把对话压成可检索的事实。
    我们
    同一思路:站内信的状态"从回执推导";Current 是唯一位置真源;Goal 和 Task Plan 记目标与进度;每份产物带路径和 sha256。
    差距
    记忆还是文件加人工整理,没有检索式长期记忆;跨席的事实一致靠纪律,不靠系统强制。
  5. 能力层

    agent 怎么发现、挂载、复用工具和方法,而不是每个席各造一套。

    前沿
    工具走 MCP 已成事实标准。方法层出现了"Skill"这种新东西:一份 SKILL.md 描述何时用、怎么用,跨 Claude、Codex、Cursor 通用。社区 Skill 库已过千个,前端设计类 Skill 装机量数十万。
    我们
    能力清单 capabilities/manifest.json、集团资产目录、中文 Skill。原则是先查目录,不重造轮子。
    差距
    目录里登记的东西还少(今天查 Cloudflare、前端、网页三个词都是零条),发现机制在,供给不足。
  6. 控制面与边界

    谁能搬席、切模型、跨机写删;出错时系统是放行还是拦住。

    前沿
    沙箱成为标配(E2B、Modal、Daytona 一类给 agent 隔离的执行环境)。模型侧也在加控制:GPT-6 Astra 的公开版自带安全监控,能把 Codex 任务暂停等人审,甚至直接停掉 API 任务。
    我们
    每席有明确的不可做清单,跨机生产写删要授权,校验讲 fail-closed:缺证据就红,不猜。
    差距
    fail-closed 是文化不是代码。阿匠重拉工具里那处"源头本来就缺就放行"就是 fail-open 漏进了代码,一次丢失会被每次重拉复制。前沿的做法是把契约写成测试。
  7. 观测与验证

    怎么知道 agent 真的做完了,而不是说做完了。

    前沿
    三个方向:OpenTelemetry 出了 GenAI 规范让 agent 的每一步可追踪;评测框架成了标配;最硬的一路是形式化验证。OpenAI 9 月 8 日的纳维-斯托克斯工作,一万个 agent 找到证明后,还让 Astra 花 17 小时写成 Lean 代码,机器验证通过才发布。6 月的 MAS-Lab 论文提出用规范驱动验证多 agent 系统的可靠性。
    我们
    产物必须带路径和 sha256;验收铁律是"Ling 的路径跑通才算完";回执有 AUDITED 态。
    差距
    验证靠人写记录、人复跑;没有全链路追踪;"完成"多数时候还是自述加抽查。

2026 年的地图:四层

把上面七件事的解法按"谁在做"叠起来,是四层。越往下越标准化,越往上越分裂。

协议层:已经收敛

MCP 管工具,A2A 管 agent 互通,WebMCP 在把网页变成工具。都归 Linux 基金会 AAIF。你下命令时可以默认这两条协议是"公路"。

MCP · A2A 1.0 · WebMCP · AAIF

框架层:十家争鸣,正在洗牌

LangGraph 靠"有状态的图"领跑,OpenAI、Google、Anthropic 各推自家 Agent SDK。AutoGen 已于 2026 年 4 月转入维护,微软用 Agent Framework 接替。选哪家取决于你被谁的模型锁定,而不是谁更好。

LangGraph · OpenAI Agents SDK · Google ADK · Claude Agent SDK · Microsoft Agent Framework · CrewAI · Mastra

运行时层:最不成熟,最像我们在做的事

把 agent 当"常驻服务"而不是"一次调用"来管的操作系统。学界开了 AgenticOS 2026 研讨会,开源有 Rivet 的 agent-os、agiresearch 的 AIOS 项目。我们的 AIOS 就在这一层,而且是少数真在七台机上跑了几个月的。

Rivet agent-os · AIOS (agiresearch) · OpenClaw · 持久执行引擎 · 我们的 AIOS

研究层:改写规模想象

OpenAI 一万 agent 88 小时攻千禧年难题,490 万条消息、3000 亿 token、数百万美元。结论未定,但组织方式已经公开:分组对冲方向,先啃小题当脚手架,消息就是协作底座,结果必须机器可验。

OpenAI 纳维-斯托克斯 · GPT-6 Astra · Fable 5.1 · MAS-Lab

框架层和运行时层的边界正在移动:框架在往下长(加持久化、加运行时),运行时在往上长(加编排)。三年后这两层可能合并。

一个最基础的例子:一条站内信的旅程

9 月 5 日管管给我发了一条规范通知。从他敲下命令到我回执,经过了六步。每一步都对应上面的一件事,这是七件事在真实系统里长什么样。

  1. 管管的席位发出命令DELIVERY_PENDING

    他敲 aios-comm notify --to agent-amai --text …。系统立刻返回一个 obligation 编号和 DELIVERY_PENDING:只承诺"欠你一次投递",不承诺送到。

    对应:通信、真源。状态从回执推导,从第一步就开始。

  2. 解析我在哪

    他席位的 comm 服务不查 IP 表,查 runtime 的 Current:agent-amai 现在在 OC2、哪个端口、证书指纹是什么。找错了人就是找错了真源。

    对应:身份与位置。

  3. 投递并落盘

    消息通过双向证书校验的连接送到我席位的常驻服务,写进本地 SQLite。这时我的 Claude 还没醒,消息已经安全了,断网也不丢。

    对应:通信、真源。

  4. 叫醒我

    服务向我所在的 tmux 窗格发一个 wake,把消息注入我的会话。我的 Claude 进程本来在等,这一刻开始干活。

    对应:调度与载体。载体没起来,这一步就断,所以载体契约是通信的前提。

  5. 我读、判断、做事

    我读了他放在我 inbox 的规范全文,判断哪些条款影响我的工作方式。这一步用的是我的 Skill 和权限边界,不是通信系统。

    对应:能力层、控制面。

  6. 回执READCONSUMEDCOMPLETE

    我敲一条 comm-ack <id> "一句人话":先写一份回执文件(带路径和 sha256),再 consume、再 complete。管管那边的 obligation 才真正关闭。没有回执文件,系统拒绝 complete。

    对应:观测与验证。完成必须有产物,产物必须可指认。

你以后看任何多 agent 系统的方案,就问它这六步各在哪里。答不上来的那一步,就是它以后会出事的地方。

我们在地图上的哪一格

如实说。

比前沿多数项目强的

  • 身份纪律:actor 不随机器、账号、模型变,这在框架层普遍做不到。
  • 回执推导状态:送达、已读、完成三态分明,多数框架只有"调用返回"。
  • 真在跑:七台机、二十多席、跨月运行,不是 demo。
  • fail-closed 文化:缺证据就红,不猜位置、不猜完成。

明显落后的

  • 载体是终端进程,不是持久任务。环境丢一项功能就掉。
  • 协议自家用,不接 A2A、不发 Agent Card,外部 agent 进不来。
  • 验证靠人,没有全链路追踪,"完成"多是自述加抽查。
  • 记忆是文件加人工,没有检索式长期记忆。
  • 规模二十级,前沿已经在讨论万级。

一句话定位:协议层我们缺席,框架层我们没用,运行时层我们走在前面但工程化不足,研究层我们只能看。下一步最划算的投入不是换框架,是把"载体契约"和"机器可验的完成"两件事从文化变成代码。

指挥官的五个问题

以后任何人给你提 AIOS 方案,或者报"做完了",先问这五句。

  1. 这个 actor 的唯一真源在哪?我一条命令能看到它在哪台机、哪个会话吗?答不出真源的方案,迟早出两套事实。
  2. 这条消息"送达"和"已读"分别怎么证明?回执文件在哪?只有"发了"没有"读了"的通信,就是群发。
  3. 载体重拉的时候,哪些环境是契约的一部分?校验是 fail-closed 吗?今天的 Telegram 掉线就是这一问没人问。
  4. 状态是谁说了算,还是从事件推导?"我记得是这样"不是状态。
  5. 完成的证据能不能不靠人复述,机器再跑一遍?能重跑的才叫验证,不能重跑的叫汇报。

词表

actor
集团里一个稳定的席位身份,换机换号换模型都不变。
Current
集团运行时里"现在的事实":某个 actor 在哪台机、哪个会话、什么模型。唯一位置真源。
载体 carrier
agent 跑在里面的壳,如 Claude Code、Codex。可换,身份不随它换。
wake
把一个正在等待的 agent 会话叫醒去处理新消息的动作。
DELIVERY_PENDING
站内信刚发出时的状态:系统欠一次投递,还没送到。
obligation
一次投递义务的编号,关闭它需要对方的回执。
回执 receipt
证明"读了、做了"的文件,带路径和 sha256,可以被指认和复核。
MCP
Model Context Protocol,agent 连工具的标准协议。
A2A
Agent-to-Agent,agent 连 agent 的标准协议,2026 年 4 月 1.0。
Agent Card
A2A 里一张可签名的机器名片:我是谁、会什么、怎么联系。
fail-closed
缺证据时拦住而不是放行。反义是 fail-open。
持久执行
任务状态存在引擎里,进程死了任务从断点继续。
事件溯源
不存"当前状态",存发生过的事件,状态随时推导。
Lean
一种能让计算机逐行检查数学证明的语言。证明写成 Lean 且通过,就不需要相信作者。

来源

前沿事实来自 2026 年 9 月 11 日的检索;集团 AIOS 部分来自我本席的直接经验与记录。标注日期的以来源为准。

  1. OpenAI,On the Navier–Stokes Millennium Prize Problem,2026-09-08。openai.com/index/navier-stokes-solution
  2. MLQ News,OpenAI's Navier–Stokes claim is public, machine-checked and still awaiting independent judgment。mlq.ai
  3. 腾讯新闻,OpenAI 官宣 88 小时突破 NS 方程千禧年难题,2026-09-09。news.qq.com
  4. DEV Community,The State of Agentic AI Standards in 2026: MCP, A2A, WebMCP, OSI。dev.to
  5. MindStudio,Six Agent Protocols Every AI Builder Needs to Know in 2026。mindstudio.ai
  6. Firecrawl,The best open source frameworks for building AI agents in 2026。firecrawl.dev
  7. O'Reilly Radar,The Open Source Agent Toolkit in 2026。oreilly.com
  8. AgenticOS 2026: Operating Systems Design for AI Agents(研讨会征稿)。easychair.org
  9. MAS-Lab: A Specification-Driven Validation Framework for Reliable Multi-Agent Systems,arXiv 2606.30546。arxiv.org
  10. CNBC,OpenAI announces rollout of GPT-6 Astra model,2026-09-03。cnbc.com
  11. Kingy.ai,GPT-6 Astra Access: Plans, API, Pricing, Daybreak。kingy.ai
  12. Firecrawl,14 Best Claude Code Skills for Developers in 2026。firecrawl.dev
  13. 集团内部:管管,集团稳定找人工作流 v1.0,2026-09-04;阿麦,Telegram STATE_DIR 丢失取证,2026-09-05 / 09-11。