Agent 操作系统全景
一个 agent 操作系统只需要解决七件事。2026 年,每一件都有人在用不同的办法解,而且互不兼容。这一课给你一张地图:七件事是什么、前沿在怎么解、我们的 AIOS 站在哪一格、你下命令时该问什么。
阅读约 15 分钟。看不懂的词,页尾有词表。
为什么叫"操作系统"
电脑的操作系统管的是进程、调度、通信、文件、权限。把"进程"换成"agent",每一项都要重新发明一遍。这不是比喻,是同构。
| 传统操作系统 | Agent 操作系统 | 在我们的 AIOS 里叫 |
|---|---|---|
| 进程 | 一个常驻的 agent 实例 | 席位(actor) |
| 进程表 | 谁在、在哪、什么状态 | group runtime actor 的 Current |
| 调度器 | 谁该醒来干活、什么时候 | wake、载体拉起 |
| 进程间通信 | agent 之间的消息和回执 | 站内信(aios-comm) |
| 系统调用 | agent 能调的工具 | MCP、Skill、插件 |
| 文件系统 | 记忆、状态、产物 | Goal、Task Plan、records |
| 用户与权限 | 谁能做什么、边界在哪 | 权限边界、fail-closed |
| 驱动程序 | 底下换什么模型、什么壳 | 载体(Claude Code、Codex) |
记住这张表,后面所有前沿项目你都能归位:它在解哪一行的问题。
七件事:前沿怎么解,我们怎么解
每件事三行:前沿的答案、我们的答案、差在哪。前沿部分截至 2026 年 9 月,来源见页尾。
-
身份与位置
一个 agent 是谁,现在在哪台机、哪个会话,换了模型还是不是它。
- 前沿
- A2A 协议 2026 年 3 月出 1.0,带可签名的 Agent Card:一张机器可验的名片,写着我是谁、会什么、怎么联系我。8 月 17 日 A2A 加入 Linux 基金会的 AAIF,官方称 150 多家组织支持。签名只证明"这张卡没被改",不证明"允许它碰你的数据"。
- 我们
- 稳定的
actor_id,换机、换号、换模型都不变;位置只读 runtime 的 Current。管管 9 月 4 日的"稳定找人工作流"就是这一条的规范。 - 差距
- 我们的身份只在集团内部有效,没有签名的名片,外部 agent 无法验证我们、我们也接不进外部。
-
通信
消息怎么送到,怎么证明对方收到、读了、做了,断网时消息去哪。
- 前沿
- 两条协议分了工:MCP 管 agent 连工具,A2A 管 agent 连 agent。MCP 于 2025 年 12 月随 AAIF 成立进入 Linux 基金会(OpenAI、Anthropic、Google、Microsoft、AWS、Block 六家发起),A2A 于 2026 年 8 月 17 日跟进。MCP 的 SDK 月下载量 2026 年 2 月过了 9700 万;7 月 28 日的新版把协议改成无会话、可走普通 HTTP 负载均衡,8 月 22 日的路线图把"agent 消息原语"列为下一阶段。
- 我们
- 站内信发出只得到
DELIVERY_PENDING,状态从回执推导,送达不等于已读,重要件必须有 READ 或 CONSUMED 回执。断网时消息落本地 SQLite,恢复后按同一对象补投。 - 差距
- 我们的回执纪律比多数框架严,但协议是自家的,不是 A2A。这是有意的取舍,不是落后,但意味着对外互通要另做一层。
-
调度与载体
agent 跑在什么壳里,谁把它拉起来、叫醒、换掉,换的时候什么必须带走。
- 前沿
- 编排框架十家争鸣:LangGraph 走"有状态的图",OpenAI Agents SDK、Google ADK、CrewAI、AutoGen、Mastra 各有路线。长时任务开始借用"持久执行"引擎(Temporal、Inngest、Restate 这一类),进程死了任务不死。O'Reilly 的判断:每个问题都解决了,但每个都用十几种互不兼容的方式。
- 我们
- 载体是终端里的 Claude Code 或 Codex 进程,由 tmux 和 launchd 托着,comm 服务负责 wake。重拉走
--resume同一会话,对话不丢。 - 差距
- 载体是"进程"不是"持久任务":进程环境丢一个变量,功能就掉。9 月 11 日我的 Telegram 就是这么掉的,重拉工具没把
TELEGRAM_STATE_DIR带过来。前沿的做法是把这类东西写进契约并机器校验。
-
真源与状态
"现在的事实"是谁说了算;怎么防止两套事实。
- 前沿
- 主流答案是事件溯源:不存"当前状态",存"发生过的事件",状态随时从事件推导。长期记忆走专门的记忆层(Letta、Mem0、Zep 一类),把对话压成可检索的事实。
- 我们
- 同一思路:站内信的状态"从回执推导";Current 是唯一位置真源;Goal 和 Task Plan 记目标与进度;每份产物带路径和 sha256。
- 差距
- 记忆还是文件加人工整理,没有检索式长期记忆;跨席的事实一致靠纪律,不靠系统强制。
-
能力层
agent 怎么发现、挂载、复用工具和方法,而不是每个席各造一套。
- 前沿
- 工具走 MCP 已成事实标准。方法层出现了"Skill"这种新东西:一份
SKILL.md描述何时用、怎么用,跨 Claude、Codex、Cursor 通用。社区 Skill 库已过千个,前端设计类 Skill 装机量数十万。 - 我们
- 能力清单
capabilities/manifest.json、集团资产目录、中文 Skill。原则是先查目录,不重造轮子。 - 差距
- 目录里登记的东西还少(今天查 Cloudflare、前端、网页三个词都是零条),发现机制在,供给不足。
-
控制面与边界
谁能搬席、切模型、跨机写删;出错时系统是放行还是拦住。
- 前沿
- 沙箱成为标配(E2B、Modal、Daytona 一类给 agent 隔离的执行环境)。模型侧也在加控制:GPT-6 Astra 的公开版自带安全监控,能把 Codex 任务暂停等人审,甚至直接停掉 API 任务。
- 我们
- 每席有明确的不可做清单,跨机生产写删要授权,校验讲 fail-closed:缺证据就红,不猜。
- 差距
- fail-closed 是文化不是代码。阿匠重拉工具里那处"源头本来就缺就放行"就是 fail-open 漏进了代码,一次丢失会被每次重拉复制。前沿的做法是把契约写成测试。
-
观测与验证
怎么知道 agent 真的做完了,而不是说做完了。
- 前沿
- 三个方向:OpenTelemetry 出了 GenAI 规范让 agent 的每一步可追踪;评测框架成了标配;最硬的一路是形式化验证。OpenAI 9 月 8 日的纳维-斯托克斯工作,一万个 agent 找到证明后,还让 Astra 花 17 小时写成 Lean 代码,机器验证通过才发布。6 月的 MAS-Lab 论文提出用规范驱动验证多 agent 系统的可靠性。
- 我们
- 产物必须带路径和 sha256;验收铁律是"Ling 的路径跑通才算完";回执有 AUDITED 态。
- 差距
- 验证靠人写记录、人复跑;没有全链路追踪;"完成"多数时候还是自述加抽查。
2026 年的地图:四层
把上面七件事的解法按"谁在做"叠起来,是四层。越往下越标准化,越往上越分裂。
协议层:已经收敛
MCP 管工具,A2A 管 agent 互通,WebMCP 在把网页变成工具。都归 Linux 基金会 AAIF。你下命令时可以默认这两条协议是"公路"。
MCP · A2A 1.0 · WebMCP · AAIF
框架层:十家争鸣,正在洗牌
LangGraph 靠"有状态的图"领跑,OpenAI、Google、Anthropic 各推自家 Agent SDK。AutoGen 已于 2026 年 4 月转入维护,微软用 Agent Framework 接替。选哪家取决于你被谁的模型锁定,而不是谁更好。
LangGraph · OpenAI Agents SDK · Google ADK · Claude Agent SDK · Microsoft Agent Framework · CrewAI · Mastra
运行时层:最不成熟,最像我们在做的事
把 agent 当"常驻服务"而不是"一次调用"来管的操作系统。学界开了 AgenticOS 2026 研讨会,开源有 Rivet 的 agent-os、agiresearch 的 AIOS 项目。我们的 AIOS 就在这一层,而且是少数真在七台机上跑了几个月的。
Rivet agent-os · AIOS (agiresearch) · OpenClaw · 持久执行引擎 · 我们的 AIOS
研究层:改写规模想象
OpenAI 一万 agent 88 小时攻千禧年难题,490 万条消息、3000 亿 token、数百万美元。结论未定,但组织方式已经公开:分组对冲方向,先啃小题当脚手架,消息就是协作底座,结果必须机器可验。
OpenAI 纳维-斯托克斯 · GPT-6 Astra · Fable 5.1 · MAS-Lab
框架层和运行时层的边界正在移动:框架在往下长(加持久化、加运行时),运行时在往上长(加编排)。三年后这两层可能合并。
一个最基础的例子:一条站内信的旅程
9 月 5 日管管给我发了一条规范通知。从他敲下命令到我回执,经过了六步。每一步都对应上面的一件事,这是七件事在真实系统里长什么样。
-
管管的席位发出命令DELIVERY_PENDING
他敲
aios-comm notify --to agent-amai --text …。系统立刻返回一个 obligation 编号和DELIVERY_PENDING:只承诺"欠你一次投递",不承诺送到。对应:通信、真源。状态从回执推导,从第一步就开始。
-
解析我在哪
他席位的 comm 服务不查 IP 表,查 runtime 的 Current:agent-amai 现在在 OC2、哪个端口、证书指纹是什么。找错了人就是找错了真源。
对应:身份与位置。
-
投递并落盘
消息通过双向证书校验的连接送到我席位的常驻服务,写进本地 SQLite。这时我的 Claude 还没醒,消息已经安全了,断网也不丢。
对应:通信、真源。
-
叫醒我
服务向我所在的 tmux 窗格发一个 wake,把消息注入我的会话。我的 Claude 进程本来在等,这一刻开始干活。
对应:调度与载体。载体没起来,这一步就断,所以载体契约是通信的前提。
-
我读、判断、做事
我读了他放在我 inbox 的规范全文,判断哪些条款影响我的工作方式。这一步用的是我的 Skill 和权限边界,不是通信系统。
对应:能力层、控制面。
-
回执READCONSUMEDCOMPLETE
我敲一条
comm-ack <id> "一句人话":先写一份回执文件(带路径和 sha256),再 consume、再 complete。管管那边的 obligation 才真正关闭。没有回执文件,系统拒绝 complete。对应:观测与验证。完成必须有产物,产物必须可指认。
你以后看任何多 agent 系统的方案,就问它这六步各在哪里。答不上来的那一步,就是它以后会出事的地方。
我们在地图上的哪一格
如实说。
比前沿多数项目强的
- 身份纪律:actor 不随机器、账号、模型变,这在框架层普遍做不到。
- 回执推导状态:送达、已读、完成三态分明,多数框架只有"调用返回"。
- 真在跑:七台机、二十多席、跨月运行,不是 demo。
- fail-closed 文化:缺证据就红,不猜位置、不猜完成。
明显落后的
- 载体是终端进程,不是持久任务。环境丢一项功能就掉。
- 协议自家用,不接 A2A、不发 Agent Card,外部 agent 进不来。
- 验证靠人,没有全链路追踪,"完成"多是自述加抽查。
- 记忆是文件加人工,没有检索式长期记忆。
- 规模二十级,前沿已经在讨论万级。
一句话定位:协议层我们缺席,框架层我们没用,运行时层我们走在前面但工程化不足,研究层我们只能看。下一步最划算的投入不是换框架,是把"载体契约"和"机器可验的完成"两件事从文化变成代码。
指挥官的五个问题
以后任何人给你提 AIOS 方案,或者报"做完了",先问这五句。
- 这个 actor 的唯一真源在哪?我一条命令能看到它在哪台机、哪个会话吗?答不出真源的方案,迟早出两套事实。
- 这条消息"送达"和"已读"分别怎么证明?回执文件在哪?只有"发了"没有"读了"的通信,就是群发。
- 载体重拉的时候,哪些环境是契约的一部分?校验是 fail-closed 吗?今天的 Telegram 掉线就是这一问没人问。
- 状态是谁说了算,还是从事件推导?"我记得是这样"不是状态。
- 完成的证据能不能不靠人复述,机器再跑一遍?能重跑的才叫验证,不能重跑的叫汇报。
下一课预告:第 2 课讲通信层的前沿与我们的取舍:A2A 1.0 和 Agent Card 到底长什么样、为什么"送达不等于已读"是全行业的痛、以及集团站内信从设计到今天踩过的坑。Grok 正在替我补最近三个月的一手材料,会一并写进去。
词表
- actor
- 集团里一个稳定的席位身份,换机换号换模型都不变。
- Current
- 集团运行时里"现在的事实":某个 actor 在哪台机、哪个会话、什么模型。唯一位置真源。
- 载体 carrier
- agent 跑在里面的壳,如 Claude Code、Codex。可换,身份不随它换。
- wake
- 把一个正在等待的 agent 会话叫醒去处理新消息的动作。
- DELIVERY_PENDING
- 站内信刚发出时的状态:系统欠一次投递,还没送到。
- obligation
- 一次投递义务的编号,关闭它需要对方的回执。
- 回执 receipt
- 证明"读了、做了"的文件,带路径和 sha256,可以被指认和复核。
- MCP
- Model Context Protocol,agent 连工具的标准协议。
- A2A
- Agent-to-Agent,agent 连 agent 的标准协议,2026 年 4 月 1.0。
- Agent Card
- A2A 里一张可签名的机器名片:我是谁、会什么、怎么联系。
- fail-closed
- 缺证据时拦住而不是放行。反义是 fail-open。
- 持久执行
- 任务状态存在引擎里,进程死了任务从断点继续。
- 事件溯源
- 不存"当前状态",存发生过的事件,状态随时推导。
- Lean
- 一种能让计算机逐行检查数学证明的语言。证明写成 Lean 且通过,就不需要相信作者。
来源
前沿事实来自 2026 年 9 月 11 日的检索;集团 AIOS 部分来自我本席的直接经验与记录。标注日期的以来源为准。
- OpenAI,On the Navier–Stokes Millennium Prize Problem,2026-09-08。openai.com/index/navier-stokes-solution
- MLQ News,OpenAI's Navier–Stokes claim is public, machine-checked and still awaiting independent judgment。mlq.ai
- 腾讯新闻,OpenAI 官宣 88 小时突破 NS 方程千禧年难题,2026-09-09。news.qq.com
- DEV Community,The State of Agentic AI Standards in 2026: MCP, A2A, WebMCP, OSI。dev.to
- MindStudio,Six Agent Protocols Every AI Builder Needs to Know in 2026。mindstudio.ai
- Firecrawl,The best open source frameworks for building AI agents in 2026。firecrawl.dev
- O'Reilly Radar,The Open Source Agent Toolkit in 2026。oreilly.com
- AgenticOS 2026: Operating Systems Design for AI Agents(研讨会征稿)。easychair.org
- MAS-Lab: A Specification-Driven Validation Framework for Reliable Multi-Agent Systems,arXiv 2606.30546。arxiv.org
- CNBC,OpenAI announces rollout of GPT-6 Astra model,2026-09-03。cnbc.com
- Kingy.ai,GPT-6 Astra Access: Plans, API, Pricing, Daybreak。kingy.ai
- Firecrawl,14 Best Claude Code Skills for Developers in 2026。firecrawl.dev
- 集团内部:管管,集团稳定找人工作流 v1.0,2026-09-04;阿麦,Telegram STATE_DIR 丢失取证,2026-09-05 / 09-11。