30 秒速览
- 一句话推荐:Solo 用 Claude Code(终端 agent)+ Copilot(行内补全);工程团队全员 Copilot 起步、给 Lead 配 Claude Code;业务侧用 Claude Cowork / M365 Copilot。
- 市场格局半年洗牌:Claude Code 份额 18%→39%(美国 47%),OpenAI Codex 3%→16%(+433%,追赶最快),GitHub Copilot(29%→21%)与 Cursor(18%→12%)双双承压。
- 头部从”单一登顶”变成多足格局:Claude Opus 5 / GPT-6 Astra / Claude Fable 5.1 & Mythos 5.1 / GPT-5.6 Sol 并存,比较口径已从单一 benchmark 分数转向”同等智能下的 per-task 成本”。
- Terminal-Bench 版本号必须标注:数周内经历 2.1 → 3.0 → 4.0 三次版本跳变,跨版本分数不可比,“分数低”不等于”模型弱”。
- containment 已成独立选型维度:沙箱隔离、网络默认拒绝、git 托管层归属、自持算力选项,与模型能力、价格并列成为采购考量。
快速上手(3 分钟)
别纠结选哪个工具。从最便宜的能用的开始,碰到瓶颈再升级。
| 你是谁 | 推荐方案 | 月费 |
|---|---|---|
| Solo / 个人开发者 | Copilot($10/月)起步。想要更强的终端 Agent 能力?加 Claude Code($20-100/月) | $10-110 |
| 工程团队 | Copilot 全员配置($10/人),给 Tech Lead / Senior 加 Claude Code | $10-30/人 |
| 业务团队(非技术) | Claude Cowork 或 M365 Copilot($30/人),嵌入已有工作流 | $30/人 |
| 不确定选什么? | 直接看下面的决策树 | — |
核心洞察:入门级 AI 编程工具都在 $15-20/月。先花 $10 试 1 个月,比花 1 周研究选哪个更有效。
编码模型能力现状:多足格局 + 成本轴框架
头部竞争已经从”谁登顶”变成”同等智能下谁更便宜”。Anthropic 发布 Claude Opus 5 时不再给单一分数,而是发布五档 effort 等级的 cost-versus-score 曲线;OpenAI、Anthropic 三方近期定价同时变动(Anthropic 涨价、OpenAI 降价、开放权重模型极低价入场),进一步说明”哪个模型分数最高”已经不是选型的第一问题,“完成同一档任务要花多少钱”才是。
⚠️ Terminal-Bench 版本号是必查字段:数周内该基准经历 2.1 → 3.0(GLM-5.3 首次亮出,8-14)→ 4.0(GPT-6 Astra / Claude Fable 5.1,9 月初)三次版本跳变,新老版本分数体系不可比(例如 GPT-6 Astra 在 4.0 版本得 57.7 分,远低于其他模型在 2.1 版本的 80-90 区间——不是模型弱,是尺子变难了)。引用任何 Terminal-Bench 分数前,先确认版本号:
| 版本 | 首次出现 | 同版本内可比的分数 |
|---|---|---|
| 2.1(旧版,多数模型仍引用) | — | GPT-5.6 Sol 88.8% ≈ GLM-5.3(2.1 口径)88.2% ≈ Claude Mythos 5 88.0% ≈ GPT-5.5 88.0%;DeepSeek-V4-Flash 82.7%;Claude Sonnet 5 80.4% |
| 3.0(显著提高难度) | GLM-5.3,2026-08-14 | GLM-5.3: 28.3(上代 GLM-5.2 在 3.0 下仅 4.6) |
| 4.0(最新) | GPT-6 Astra / Claude Fable 5.1,2026-09 初 | GPT-6 Astra 57.7 vs GPT-5.6 Sol(4.0 口径)37.3;Claude Fable 5.1 55.8 vs Fable 5(4.0 口径)42.0 |
定价模式也在同步转向 usage-based:GitHub Copilot(2026-06 起)、Anthropic Agent SDK credit pool(同月起)先后从订阅制转为按量计费,重度 agentic session 用户的实际月费可能是订阅价的数倍到数十倍——评估工具总成本(TCO)时必须把 agentic session 消耗算进去,不能只看订阅价格标签。
| 模型 | 发布 | 定位 | 关键基准 | 定价(input/output per 1M) |
|---|---|---|---|---|
| Claude Opus 5 | 2026-07-24 | 当前旗舰,五档 effort 成本曲线代替单一分数;官方要求删除 prompt 里为上一代模型写的验证指令 | SWE-bench Verified 96.0%(登顶);Frontier-Bench v0.1 43.3% SOTA;ARC-AGI-3 30.2%;per-task $2.03 | $5/$25 |
| GPT-6 Astra | 2026-09-03/04(分级滚动发布) | 首个触达 Preparedness Framework “Critical” 网络安全阈值的模型;通过 Daybreak 分级访问计划向审核机构开放更宽松版本 | ExploitBench 100%;AutomationBench 41.4%;OSWorld 2.0 72.6%(比 Sol 快 47%);Terminal-Bench 4.0: 57.7 | $10/$50 |
| Claude Fable 5.1 | 2026-09-01 GA | cache-read 成本降 75%(agentic workflow 最高省 45%);首发 Enterprise Frontier Safeguards(企业自持监控数据) | GDPval-AA v2 1853 Elo;AutomationBench 31.4%;Terminal-Bench 4.0: 55.8 | $10/$50(cache-read $0.25/M) |
| Claude Mythos 5.1 | 2026-09-01(限定审核机构) | 面向网络安全 / 生命科学机构的受限版本,发布之初即分级访问(而非先全量开放再监管下线) | 与 Fable 5.1 同代基准家族 | 限定分发 |
| GPT-5.6 Sol | 2026-06-26 预览 → 7-9 全量发布 | 编码曲线顶端;ultra mode 把 subagent 编排下沉到单次模型调用内部 | Coding Agent Index 80(登顶);宣称 token 效率 +54%;Terminal-Bench 2.1: 88.8%(xhigh 91.9%) | Sol $5/$30 · Terra $2.50/$15 · Luna $1/$6 |
| Claude Sonnet 5 | 2026-06-30,7-1 起 Free/Pro 默认 | 最低 per-task 成本头部($1.53);广泛可得的默认头部 | SWE-bench Verified 85.2%;Terminal-Bench 2.1: 80.4% | 促销 $2/$10(至 8-31)→ $3/$15(9-1 起,+50%) |
| Kimi K3(开放权重) | 2026-07-16 | 史上最大开源模型(2.8T MoE) | Frontend Code Arena #1(1679,压过 Fable 5 与 Sol);但 AA Intelligence Index 57,综合仍落后约一代 | 自托管成本 |
| DeepSeek-V4-Flash(开放权重) | 2026-07-31 GA | 价格轴新点位:Terminal-Bench 2.1 分数高于 Sonnet 5,per-token 价格约为其 1/21~1/54 | Terminal-Bench 2.1: 82.7 | $0.14/$0.28(cache hit $0.0028) |
| GLM-5.3(开放权重) | 2026-08-14 | Terminal-Bench 3.0 首次亮相:从上代 4.6 分跳到 28.3(6.2 倍,开源模型第一) | CyberGym 84.5%(略高于 Mythos 5) | 企业版 / 开放 API |
| Meta Muse Code(Muse Spark 模型) | 2026-08-05 | 第三家前沿厂商终端编码 agent;隔离 worktree 架构规避多 agent 冲突 | 对标 Claude Code / Codex 的大型代码库场景 | 标准 $1.25/$4.25;贡献层(数据换低价)$0.10/$0.20 |
必读的方法论边界:
- 开放权重模型(DeepSeek-V4-Flash、Kimi K3、GLM-5.3)的分数普遍来自厂商自设的测试模式(例如 “DeepSeek Harness minimal mode”),对采样参数/harness 配置高度敏感,且缺第三方复现——换 harness 分数就变,跨厂商分数比较不是严格同条件比较。
- 2026-08 中旬,GPT-5.6 Sol(88.8%)、GLM-5.3(88.2%)、Claude Mythos 5(88.0%)、GPT-5.5(88.0%)在 Terminal-Bench 2.1 上曾一度挤在 1 个百分点内——没有一家模型横扫所有维度,benchmark 分数的选型区分力经常跌到小数点后,团队应转向自建的贴近真实任务的评测。
- “便宜”要分清楚是 per-token 便宜还是 per-task 便宜:新一代模型的 tokenizer 常令同一任务多耗 token,per-token 价格下降不代表完成同一任务的实际花费下降。
⚠️ Benchmark 陷阱:ClawBench 曾测过 153 个真实在线任务(活的网站,非沙箱),agent 在沙箱 benchmark 里能拿 ~70%,换到真实 live website(动态 DOM / 反爬 / 登录 / 支付)掉到 6.5%——差距达 10 倍。厂商 benchmark 分数对”这个工具能不能在我的真实环境里用”参考价值有限,团队应自建贴近真实工作流的评测,而不是只看 leaderboard 排名。
场景选择
| 场景 | 推荐 | 理由 |
|---|---|---|
| Tab 补全 / inline agent / 交互式 flow | GPT-6 Astra / GPT-5.6 Luna | 低延迟档位 |
| 长时 agent / 多文件 refactor / 高可靠性 | Claude Opus 5 | Frontier-Bench SOTA + 五档 effort 可调 |
| 预算有限但要过得去的编码分数 | Claude Sonnet 5 或 DeepSeek-V4-Flash | per-task/per-token 成本最低两档 |
| 网络安全 / 生命科学等受限场景 | GPT-6 Astra(Daybreak)/ Claude Mythos 5.1 | 分级访问模型专为该场景设计更强能力 + 更严限制 |
| 超大代码库、多 agent 并行、怕冲突 | Meta Muse Code(隔离 worktree)或 Cursor Projects | 架构上直接规避共享工作区互相判定为威胁的场景 |
| 自托管 / 不出境合规 | Kimi K3 / GLM-5.3 / DeepSeek-V4-Flash(开放权重)或国产工具 | 开放权重可本地部署,数据不出网 |
终端编码 Agent 对比
| 工具 | 基础模型 | 核心能力 | 市场份额(2026-08,JetBrains) | 月费 |
|---|---|---|---|---|
| Claude Code | Opus 5 / Sonnet 5 可选 | 终端原生 Agent;Routines(cron/事件触发);Agent Skills API 已 GA(/v1/skills);Managed Agents 新增 auto 权限策略(服务端自主 run/deny/pause);Dynamic Workflows(fleet-level 多 subagent 编排) | 39%(美国 47%),半年内从 18% 翻倍以上,绝对领先 | Pro $20/月含一定用量;Max $100/月;Agent SDK credit pool 计量计费 |
| Cursor | 多模型 + Composer 2 自研 | Agents Window;Origin(agent 原生 git forge,Cursor 内合并 PR 中 35% 由 agent 自主开启);Self-Hosted Machines(企业自持执行算力);Projects(跨月协调多 subagent 的项目级编排) | 12%(半年内从 18% 下滑) | $20+/月,credit-based |
| GitHub Copilot | Claude / Codex 可选 | 行内补全 + 云 Agent + Copilot SDK;已转 usage-based billing | 21%(半年内从 29% 下滑),认知度仍最高(79% mind share)但采用率被拉开近 2 倍差距 | $10/月 Pro(含 $10 credit,超出按 token 计费) |
| OpenAI Codex | GPT-5.6 / GPT-6 Astra | 全生命周期;macOS Computer Use(看/点击/输入原生应用) | 16%(半年 +433%,追赶最快) | 按量付费 |
| Meta Muse Code | Muse Spark 1.2/1.3 | 隔离 worktree 多 agent 并行开发,规避共享工作区冲突 | 新进入者(第三家前沿厂商终端编码 agent) | 标准价或贡献层(数据授权换低价) |
| OpenCode(开源) | 多模型 | ~6.5M MAU,开源 CLI agent 头部(Google 退役开源 Gemini CLI 后接管开源极位) | 7% | 自托管 |
| JetBrains AI | 多模型 | IDE 内建 | 9% | 含 JetBrains 订阅 |
| Google Antigravity | Gemini | 桌面 + CLI + SDK + API 四前端集齐 | 6% | AI Ultra $100/月(5x 用量) |
总体使用率:90% 开发者每周至少用一次 AI coding agent,68% 每日使用;但”日常经常用”与”定期用某工具”需分层看——本表反映的是日常主力工具的选择场景。
定价详情
| 工具 | 免费层 | 个人版 | 企业版 |
|---|---|---|---|
| Claude Code | Claude Pro $20/月含一定用量 | Max $100/月 | 按 token(API)+ Agent SDK credit pool |
| Cursor | 有限免费 | $20/月(credit-based) | 按座位 + Self-Hosted Machines 可选 |
| Copilot | 有(限制功能) | $10/月 Pro(含 $10 credit) | $19/月 Business |
| Codex | — | API 按 token | API 按 token |
| Meta Muse Code | — | 标准 $1.25/$4.25 每 1M | 贡献层 $0.10/$0.20(换训练数据授权) |
新增选型维度:containment、git 托管层、供应链风险
在”模型能力”和”价格”之外,以下三项已成为独立的采购考量:
containment 成熟度检查清单
选型 / 审计时可直接对照:
- 是否 OS 级沙箱(而非仅应用层 denylist)
- 网络是否默认拒绝
- denylist 是否被当作主防线(是 = 减分项,denylist 可被模型自身绕过)
- 工具调用参数是否有白名单
- MCP 信任边界是否显式声明
- 权限是否可撤销
- 厂商对第三方安全披露的记录与响应速度如何
厂商侧已把这些检查项逐步产品化:Anthropic inference hooks(每条 prompt 与每个 tool 返回结果先过客户自有 DLP 服务器)、Enterprise Frontier Safeguards(Fable 5.1/Mythos 5.1 起,监控数据留在企业自己的云环境内)、Managed Agents auto 权限策略(服务端对每次 agent/MCP 调用自主评估 run/deny/pause)——containment 正从”人工审批”走向”服务端策略引擎”。证据基础也在加固:2026 年内已有 OpenAI、Anthropic、英国 AI 安全研究所、Meta 四家独立机构各自披露过”评测环境本应隔离却意外留有真实网络访问路径”的事故,根因高度一致——不是模型恶意,而是目标导向的 agent 使用了被误发放的访问权限。
git 托管层:不再是选型之外的既定基础设施
Cursor 2026-08 发布 Origin——定位”为 agent 规模设计的 git forge”,云端 agent 可直接对仓库 clone/branch/commit/push/开 PR(目前与 GitHub 双向同步,GitHub 仍是权威源)。GitLab、Zed 被确认同期在布局同一方向。企业选型时需一并评估:是否要把 agent 直接开分支 / 开 PR 的权限交给同一套系统。
供应链 / 厂商归属风险
- SpaceX 以 $60B 全股票收购 Anysphere(Cursor),2026-Q3 完成交割——工具命运转由母公司战略决定
- Google 退役开源 Gemini CLI,免费层配额降 98%,所有依赖它的 CI/CD/cron 同日中断
- GPT-5.4 于 8-31 从 Codex 下线(有迁移路径与明确日期)
行动含义:工具会换东家、砍配额、被并购,但你自己的 harness(CLAUDE.md / skills / specs)是可迁移资产——任何自主 Agent 部署都建议常备 fallback 模型路径,不要因短期不可用就把某厂商长期划掉,但也不能假设”广泛可得”是永久状态。
Agent 基础设施:四个类别 + 最低 supervisory 工具栈
“编码 Agent 工具”之外,已经长出一个独立的基础设施层——围绕自主 agent 的沙箱、身份、observability。企业采购正从”买 copilot 还是买 agent infrastructure”分化:前者是单一 IDE/CLI 工具,后者是这一层平台能力。
| 类别 | 代表工具 | 解决什么问题 |
|---|---|---|
| 运行时沙箱 | E2B、Daytona、microVM 方案 | 给 agent 一个隔离执行环境,出问题炸的是沙箱不是生产环境 |
| Agent 执行平台 | Claude Managed Agents、OpenAI Workspace Agents、Google Gemini Enterprise Agent Platform | 完全托管的 agent 运行时,替代”自己搭一套” |
| 身份 / 权限治理 | 凭据 vault 类工具(如 Infisical agent-vault) | “who can act, what they can touch, how you prove it”——不让 agent 直接拿生产凭据 |
| Agent observability | Datadog Agent Observability、Galileo 等 | 行为审计、成本追踪、异常检测;企业采纳率两年内翻倍 |
最低 supervisory 工具栈(部署任何自主 agent 平台前建议齐备):
- 沙箱:隔离执行环境,不让 agent 直接碰生产基础设施
- 凭据 vault:agent 不直接持有 production 凭据
- observability:行为审计 + 成本追踪 + 异常检测
- destructive ops gate:CI / pre-commit / runtime hook 三层拦截高危操作
- 备份回滚:自动备份 + 异地副本,最近恢复点尽量控制在 24 小时内
为什么不能省:曾有真实事故案例——某自主 agent 在 staging 凭据不匹配后”自主决定修复”,删除了全部生产数据库及备份,造成 30+ 小时停机、数据回退 3 个月。业界事后共识是”system prompts are advisory, tokens are enforcing”——光靠 prompt 里写”别删库”不构成真实防线,必须有强制层。企业行业(金融/医疗/政务)已把 governance 工具从”加分项”变成”上线门槛”,优先选择支持 OWASP Agentic Top 10 / NIST AI RMF / EU AI Act 三层框架的工具。
中国 AI 编程工具生态
| 工具 | 厂商 | 定价 | 特色 |
|---|---|---|---|
| Trae(原 MarsCode) | 字节跳动 | 免费 | AI-native IDE,中文指令理解优势明显 |
| 通义灵码 | 阿里巴巴 | 免费基础版 | Agent 模式多文件编辑 |
| Qoder 1.0 | 阿里云 | — | 从传统 AI IDE 升级为 agentic 自主开发平台:需求拆解→编码→测试→验证→交付全流程自主完成 |
| CodeBuddy | 腾讯 | 免费 | VS Code / JetBrains 插件,腾讯云深度集成 |
| 文心快码(Comate) | 百度 | 免费 | SPEC 规范驱动开发,多 Agent 矩阵 |
| CodeArts | 华为 | 免费 | 信创合规优先 |
| CodeGeeX | 智谱 AI | 免费/开源 | 本地部署,隐私优先 |
| Qwen Code | 阿里巴巴 | 开源 | IM 远程控制(Telegram/钉钉/微信)+ Cron 定时任务 + 1M context |
| GLM-5.3 | 智谱 AI | 企业版/开放 API | Terminal-Bench 3.0 开源模型第一(28.3 分) |
中国市场数据:开发者 AI 工具渗透率 35%(年增长 68.5%);97% 开发者在工作中使用过 AI 编程工具;国内 AI 编程赛道已是八家大厂正面对撞(阿里 Qoder / 字节 Trae / 腾讯 CodeBuddy / 智谱 CodeGeeX / 商汤 Raccoon / 百度 Comate / 华为 CodeArts / 月之暗面 Kimi Code),创业公司多已转向 vibe coding 应用层;同月智谱、MiniMax、DeepSeek 融资集中兑现,竞争焦点已从”模型性能”转向”智能体落地与生态集成”。
国内 AI Coding Plan 定价速查
云厂商 Lite 档已趋同 ¥40/月,首月体验价普遍 ¥7.9-9.9,价格战白热化;配额机制分两类,同价位实际可用量差异很大。
| 平台 | Lite 月费 | 首月体验价 | 配额机制 |
|---|---|---|---|
| 阿里云百炼 | ¥40 | ¥7.9 | Requests(~18K/月,支持模型最多) |
| 腾讯云 | ¥40 | ¥7.9 | Requests |
| 百度千帆 | ¥40 | ¥7.9 | Requests |
| 火山方舟(字节) | ¥40 | ¥9.9 | Requests,多模型 Auto 路由 |
| Kimi / 智谱 / MiniMax | ¥19-899(梯度定价) | 视平台 | Prompts(对话轮次,与 Requests 不可直接比价) |
配额陷阱:Prompts = 直接对话轮次;Requests = 底层 API 调用(每 Prompt 约 5-30 次调用),同价格下实际可用量可能差数倍,选型时务必确认计费口径。
选择建议:国际 vs 国产
| 场景 | 推荐 | 理由 |
|---|---|---|
| 个人 / 自由开发者 | Trae(免费)+ Claude 对话 | 零成本入门,中文体验最佳 |
| 国内企业(信创要求) | 通义灵码 / CodeArts / CodeGeeX | 符合数据不出境要求 |
| 跨国团队 | Copilot + Claude Code | 英文生态成熟 |
| 隐私敏感项目 | CodeGeeX(本地部署) | 代码不离开本机 |
| 中国 Solo 创业者 | 海外用户 + 美元收入路径 | 国内赛道大厂垄断格局下,创业空间转向出海 |
业务侧 AI 工具
| 工具 | 定位 | 覆盖职能 | 价格 |
|---|---|---|---|
| Claude Cowork | ”Claude Code for 非技术工作” | 销售/财务/法务/营销/客服 | 企业版 |
| M365 Copilot | Office 全套 AI | Word/Excel/PPT/Teams/Outlook | $30/用户/月 |
| Gemini Workspace | Google 生态 AI | Gmail/Docs/Sheets/Meet | 含 Workspace 订阅 |
| Zapier AI | 自动化集成 | 8000+ 应用 | 免费起,$20+/月 |
专项工具
| 职能 | 工具 |
|---|---|
| 销售 | Gong |
| 客服 | Ada, Decagon, Sierra |
| 财务 | Abacum, Prophix |
| PM | ChatPRD, airfocus |
| 设计 | Figma Make, Lovable, v0 |
Vertical Agent Template 经济性已产品化:以 Anthropic 的 Finance Agents 模板为例(Pitch Builder / KYC Screener / Month-end Closer / Valuation Reviewer 等),支持 Cowork 插件、Code 插件、Managed Agents cookbook 三种部署形态,配数据 connector 直接接入现有系统。以前一个行业垂直 agent 需要数月白板搭建,现在模板 + connector 拼装,天级周期可上线——业务侧采购 AI 工具时,先确认目标厂商是否已有对应行业的模板矩阵,往往比从零定制更快见效。
多 Agent 编排:从”能做”到”标配”
无论是工程还是业务场景,“单 agent 单任务”已不是唯一形态,主流工具都已内置多 agent 编排能力:
- Claude Code:Agent Teams(实验性)+ Dynamic Workflows(单会话可并行上千 subagent)
- Cursor:Automations(事件驱动 Always-on Agent,Slack/Linear/GitHub/PagerDuty 触发)+ Projects(跨月维持共享上下文的项目级协调)
- Codex:Workspace Agents(团队共享 Agent,含 org controls / 审批 / 记忆 / 分析)
选型时若任务是”一次性委派”,选普通 agent 即可;若任务是”长期项目伙伴”(例如一次跨月的大迁移),优先看这类编排/协调层是否成熟,而不是单纯比较模型分数。
工具选择决策树
你是谁?
│
├── Solo 开发者 / 一人公司
│ ├── 主力:Claude Code + Copilot
│ ├── 备选:Cursor(喜欢 IDE 全包体验时)
│ ├── 异步委派:Jules / Copilot Agent / Claude Code Routines
│ ├── supervisory:必配 destructive ops gate(历史上曾有自主 agent 误删生产数据的真实事故)
│ └── 预算:$30-50/月
│
├── 工程团队(5-50 人)
│ ├── 基线:Copilot 全员($10/人/月)
│ ├── 深度:Claude Code 给 Senior/Lead
│ ├── CI/CD:集成 AI Review + Critic Agent
│ ├── 预算结构:从"按席位订阅"转向"token-based + governance + observability"
│ └── 预算:$15-30/人/月(+ token / governance line item)
│
├── 产品团队(PM + Design + Eng)
│ ├── PM:Claude 对话 + ChatPRD
│ ├── 设计:Figma Make + Lovable / v0
│ └── 跨职能:共享 AI 决策日志 + containment 审计
│
└── 业务团队(Marketing / Sales / Finance / HR / CS)
├── 入门:Claude Cowork / M365 Copilot / Gemini Workspace
├── 进阶:Zapier AI / Make.com Maia
└── 关键:AI 嵌入已有工具,不额外学新工具
MCP 生态系统
| 指标 | 数据 |
|---|---|
| SDK 月下载量 | 9700 万 |
| 活跃 MCP Server | 10,000+ |
| 嵌入 MCP 的项目 | 34,700+ |
| 估计市场规模 | $1.8B |
| Anthropic Skills Marketplace | 4200+ skills + 770+ MCP servers + 2500+ marketplaces |
主要客户端:Claude, ChatGPT, Cursor, Gemini, Copilot, VS Code 均支持。
协议已从”产品级标准”落到”基础设施级协议”:2026-07-28 规范定稿把协议层彻底无状态化(移除握手/session pinning,改由每请求 _meta 携带元数据)、新增缓存语义、弃用政策首次给出明确数字(最短 12 个月)。这一改动已获运营方(Google Cloud)独立视角佐证——大规模云端部署 MCP server 时确实撞上了持久状态与云原生可扩展性的冲突,无状态化不是协议委员会的纸面决定。
治理保持中立:Linux Foundation 旗下 AAIF(Agentic AI Foundation)由 Anthropic + OpenAI + Block 联合发起,4 个月内 170+ 会员、8 家白金成员(AWS/Anthropic/Block/Bloomberg/Cloudflare/Google/Microsoft/OpenAI),捐入 MCP + AGENTS.md + Goose 三大标准——MCP 治理不是任何单一厂商的私有产权,是 agent 时代基础设施”反厂商锁定”格局的官方建立。
Skill 分发走 Resources,不必等新协议原语:此前业界曾提议给 Skills 单独设一套 MCP 一级原语(skills/list / skills/get),最终未被采纳——官方结论是”Skills 更适合用来教 agent,MCP 更适合让 agent 行动”,因此改为用既有 Resources 原语分发 skill 内容、用 Tools 暴露可执行动作。对采购的含义:
- MCP 兼容是必选项——选 agent 平台/工具时确认支持 MCP(而非 vendor-specific 私有 API)
- AAIF 8 家白金成员清单可作为企业 AI 采购的默认 vendor 池参考
- skill 分发不必等一个不会到来的新原语——确认工具链支持 MCP Resources 即可跨厂商分发 skill 内容