打破“云原生过时论”:针对 Agent 带来的单例有状态、冷启动敏感与高并发下执行不可信代码的挑战,云原生并未退场,而是在 Kubernetes、CNCF、Cilium 等主流项目中自下而上进行了一场深刻的“接口级地基重做”;
K8s 调度与资源分配革命:调度单元从单个 Pod 升维为协同作业的 Workload(Gang Scheduling/CompositePodGroup),动态资源分配(DRA)正式成为跨厂商 GPU 标准抽象,结合 In-Place Resize 与缩容到零(Scale to Zero)解决空闲 Agent 算力浪费;
沙箱运行时双线突围:SIG Apps 推进基于强隔离(gVisor/Kata)的通用 Agent Sandbox 原语,而 Google 9 月开源的 AX 与 Agent Substrate 则将调度移出热路径,通过 Actor 多路复用与快照实现秒级挂起与唤醒;
流量层从 Header 走向 Payload:Ingress NGINX 彻底退役,全面押注 Gateway API;AI Gateway 工作组主导请求体深度处理(Prompt 注入防护、MCP 路由),llm-d 落地前缀缓存感知与预填充/解码分离;
安全与可观测性闭环:Cilium 1.20 补齐基于 FQDN 与二进制进程的精准网络策略防护,OpenTelemetry 升级 MCP 与 GenAI 语义约定,为 Agent 编排构筑可审计的证据链,全栈重新收敛于开放标准。
先把“过时论”摆出来,它有三个依据:
Agent 不像微服务。它有状态、忽闲忽忙、要执行不可信代码,Pod 这套抽象看上去不合身。
Kubernetes 太重。集群、镜像仓库、CRD 的运维负担,让不少开发者望而却步。
新一代运行时开始绕开 K8s。Agent Substrate 明确把 Kubernetes 控制面从热路径里拿掉。
这些批评有道理。但同一时期,一些主流项目的官方博客给出的事实却是:
Kubernetes v1.37(代号 Garhwal)2026 年 8 月 26 日发布,据 PerfectScale 统计共 67 项增强,其中 16 项 Stable、23 项 Beta、27 项 Alpha,1 项 deprecation/removal。
Cilium 1.20 的发布说明写明:2,660 多个提交,1,100 多位贡献者。
OpenTelemetry 在 2026 年 5 月 21 日由 CNCF 宣布毕业。
Kubernetes AI Conformance 认证平台从 18 个增长到 31 个,并把 Agent 工作负载纳入验证。
Ingress NGINX 在 2026 年 3 月停止维护。据 Kubernetes 指导委员会引用的数据,约一半云原生环境依赖它,社区仍然选择果断退役。
……
而且,连“绕开 K8s”的 Substrate 也没有离开 K8s:它依然把 Kubernetes 当作基础设施供给层,并以补丁方式对齐上游的 Pod 证书能力。
所以本文的结论是:过时论说对了一半。Agent 确实暴露了旧抽象的不足,但答案不是抛弃云原生,而是在云原生的地基上改造接口、加建楼层。
我们把这两年云原生生态里的典型项目压缩成一张分层图,后文每一节对应图里的一层。
图片
版本 | 发布时间 | 代号 | 与 Agent/AI 相关的关键词 |
v1.33 | 2025.04 | Octarine | 用户命名空间默认开启、In-Place Resize Beta、Image Volumes Beta |
v1.34 | 2025.08 | Of Wind & Will | DRA GA、Pod 级资源 Beta、PSI 指标 Beta |
v1.35 | 2025.12 | Timbernetes | In-Place Resize GA、首次引入工作负载感知调度 |
v1.36 | 2026.04 | Haru | 用户命名空间 GA、拓扑感知调度与工作负载感知抢占(Alpha)、清单式准入控制 |
v1.37 | 2026.08 | Garhwal | Gang Scheduling Beta、DRA Extended Resource GA、HPA 缩容到零 Beta、Metrics API 稳定 |
AI 训练和分布式推理有个共同点:一组 Pod 要么一起跑,要么都别跑。传统调度器逐个 Pod 决策,容易出现“占着资源却凑不齐一组”的死锁。
Kubernetes 的回答是工作负载感知调度(Workload-Aware Scheduling,WAS):
图片
v1.37 最值得关注的是 CompositePodGroup:把 PodGroup 组织成树,支持多层拓扑约束、Gang Scheduling 与抢占策略,官方点名了 JobSet 和 LeaderWorkerSet 这类结构。
要提醒的是:v1.36 曾把 v1alpha1 整体替换为 v1alpha2,v1.37 又引入 v1alpha3,并带来 disruptionMode字段的破坏性变更。KEP-4671 里标注的 Stable 目标是 v1.38,这只是社区目标。想用在生产里,先在预发环境验证。
Dynamic Resource Allocation(DRA)在 v1.34 GA,v1.37 补上几块关键拼图:
Extended Resource 支持 GA:example.com/gpu 这类传统写法可以由 DRA 驱动满足,不必再并存 Device Plugin,存量工作负载不改就能渐进迁移。
设备污点与容忍 GA:可以给过热或待维护的 GPU 打污点,NoSchedule 阻止新调度,NoExecute 驱逐已在使用的 Pod。
标准 NUMA 节点属性:不同厂商的设备可以在同一 NUMA 节点上对比。
PodGroup 共享 ResourceClaim(Beta):避免一组 Pod 各自生成一堆 Claim。
In-Place Pod Resize 在 v1.35 GA,v1.37 又开始做“为原地扩容腾资源的抢占”(Alpha);
“HPA 缩容到零”在 v1.37 进入 Beta;
“用户命名空间”在 v1.36 GA,容器内 root 不再等于宿主机 root;
Memory QoS 在 v1.37 进入 Beta 且默认开启;
清单式准入控制让“删不掉的准入策略”成为可能,适合平台方强制安全底线;
Pod Certificates 与 Cluster Trust Bundles 为工作负载身份打底。
2025 年 11 月 11 日社区宣布退役,2026 年 1 月 29 日指导委员会再发联合声明,3 月停止维护,官方同步发布 Ingress2Gateway 1.0 帮助迁移。社区用一次痛苦的退役,把流量入口的标准明确压在了 Gateway API 上。Gateway API 也在持续发力:v1.5(2026 年 4 月)推进多项特性到 Stable,v1.6(2026 年 8 月)让 TCPRoute 与 UDPRoute 进入 Standard。后文所有 AI 网关能力,都长在这块地基上。
Kubernetes 官博《Running Agents on Kubernetes with Agent Sandbox》把趋势概括为 “AI v2 eating AI v1”:从短命的无状态调用,走向持续运行的多 Agent 协作。Agent 有三个特点,传统原语都难以应付:
单例且有状态:需要持久身份和一个安全的“草稿区”来执行 LLM 生成的不可信代码;
大部分时间空闲,偶尔爆发:需要挂起与快速恢复;
对启动延迟敏感:新起一个 Pod 大约多出一秒开销,Agent 被唤醒时,这一秒足以打断交互的连贯感。
用 StatefulSet 加 Headless Service 再加 PVC 也能拼出来,但官方的评价很直白:规模一大就是运维噩梦。
Agent Sandbox 是 SIG Apps 下开发中的子项目,核心是 Sandbox CRD:
强隔离:原生支持 gVisor、Kata Containers;
生命周期管理:空闲时缩到零,恢复后接着干;
稳定身份:稳定的主机名和网络身份,便于多 Agent 互相发现。
扩展层有三个 CRD:SandboxTemplate(模板)、SandboxClaim(按需申请)、SandboxWarmPool(预热池,压低冷启动)。2025 年 11 月 KubeCon 北美大会上,Google 也宣布了 GKE Agent Sandbox 的技术预览。
图片
GKE 官方文档给出的判断是:标准 Kubernetes 把每个 Agent 绑定到独立 Pod,受制于调度吞吐和 Pod 启动延迟;Kubernetes 也不支持 Pod 休眠,数百万空闲 Agent 常驻会耗尽 Pod 上限和控制面内存。
Substrate 的做法是:把大量“Actor”(Agent)多路复用到少量就绪的“Worker”(Pod)上。Agent 空闲时,系统给它的内存和本地文件打快照,需要时在不到一秒内恢复到某个可用沙箱里。
图片
而 AX 则是 Substrate 之上的、Kubernetes 风格的声明式编排层,Apache 2.0 许可,定义了四个原语:
原语 | 作用 |
Task | 执行生命周期、沙箱资源约束 |
Workspace | 执行前环境装配:挂载 Git 仓库、配置 MCP Server、安装 Skill 包 |
Gateway | 出站网络策略:主机名与端口白名单,并负责凭据注入 |
Model | LLM 提供方参数、运行配置与密钥的统一入口 |
用法上很像 kubectl:
一个耐人寻味的细节:Substrate 仓库里带有一个 Pod 证书签发控制器,仓库自述是一个“补丁式”实现,提供的签发能力将来会由上游 Kubernetes 内置。这恰好对应 v1.37 的 Pod Certificates。也就是说,最激进的 Agent 运行时,也在向上游标准靠拢,而不是另起炉灶。
Hacker News 上的讨论出现分化:基础设施工程师赞赏它解决了“空闲 Agent 烧钱”的问题,也有开发者批评“人体工学”的宣传与 Kubernetes 集群、镜像仓库、CRD 的运维负担不符。
联合创作者 Jaana Dogan 在 HN 上强调,AX 更接近作业编排,不是 Agent 框架。
AX 的 Go 文档标注仍处于活跃早期开发阶段,Substrate 仓库 README 也声明不是 Google 官方支持的产品;目前部署文档面向 GKE Standard 集群。
这些批评确实说明,Kubernetes 不是 Agent 的唯一答案,但没有削弱一个事实:多数团队今天的算力、网络、安全、可观测和身份体系都长在云原生上,绕开它的成本很高。所以更准确的说法是:Agent 时代的地基不是被推倒,而是被拆开重新分层。
传统网关根据 Header 路由;AI 请求的关键信息在 Body 里:哪个模型、什么优先级、Prompt 是否安全。
2025 年 6 月:Gateway API Inference Extension 发布,借助 Envoy 的 ext-proc,把支持 Gateway API 的网关升级为推理网关。项目自述已 GA。
2026 年 3 月:SIG Network 成立 AI Gateway 工作组,方向是给 Gateway API 增加面向 AI 的声明式能力,两个核心提案:
Payload Processing(载荷处理):声明式地处理请求与响应的完整 Body,用于提示注入防护、内容过滤、语义路由、缓存与 RAG 集成;要求处理器有确定的执行顺序和可配置的失败模式,并明确提到要处理 MCP 请求。
Egress(出站):面向 OpenAI、Vertex AI、Bedrock 等外部模型提供方的出站路由。
Agent 网关:由 Solo.io 创建、现属 Linux Foundation 的 agentgateway(Rust 编写)覆盖 MCP、A2A 与 LLM 路由,2026 年 5 月从 kgateway 中拆分为独立项目。kagent(2025 年 5 月进入 CNCF Sandbox)则用 CRD 声明 Agent、模型配置和 MCP 工具。
推理层:llm-d 于 2026 年 3 月 24 日进入 CNCF Sandbox,由 Red Hat、Google Cloud、IBM Research、CoreWeave、NVIDIA 等发起,基于 vLLM 与 Inference Extension,做 Prefill/Decode 分离与前缀缓存感知路由。Google 在博客里披露,这类路由把 Vertex AI 的前缀缓存命中率从 35% 提升到 70%。
Kubernetes AI Conformance(2025 年 11 月启动)要求平台先通过标准 Kubernetes 一致性认证,再额外满足 AI 相关要求。2026 年 3 月的更新有几个信号:
认证平台从 18 个增至 31 个;
新增 KAR(Kubernetes AI Requirements),对齐 v1.35 的技术原语,明确要求稳定的 In-Place Resize 与工作负载感知调度;
验证范围扩展到 Agent 工作负载,并在制定解耦推理、LLM 流量路由、DRA 网络的标准;
路线图:自动化一致性测试,以及包含沙箱和数据隐私要求的主权 AI 标准。
CNCF 在 2026 年 3 月的博客《The great migration》里提出三时代叙事:微服务、数据与训练推理、以 2025 年为起点的 Agent 时代。
CNCF 的 AI Tech Radar 还给出一个数据:41% 的 AI 开发者自认为是云原生开发者。协议层的治理也日渐明朗:MCP 由 Linux Foundation 下的 Agentic AI Foundation 托管,A2A 同样归属 Linux Foundation。
Cilium 1.20(2026 年 9 月)在 CNCF 博客上有两条主线与 Agent 时代直接相关:
Gateway API 成为更完整的流量管理层:支持 ExternalAuth(GEP-1494)、TCPRoute/UDPRoute,并跟进 Gateway API v1.6.1;
网络策略走向标准化:支持上游 ClusterNetworkPolicy,含 Admin 与 Baseline 两级,并让 Hubble 对审计判决做策略关联。
此外还有可扩展数据面(Datapath 插件,云厂商不必 fork)、ENI IPAM 支持 IPv6(Beta)、ztunnel 仍为 Beta、旧的 Mutual Authentication 被标记为废弃、cilium-cni 二进制缩小 80%。
Isovalent 官博里,2026 年 2 月的《From Hyperscalers to Neoclouds》梳理了 18 家以上把 Cilium 作为默认 CNI 的云厂商,包括 CoreWeave 和 OVHcloud;2026 年 9 月 23 日的《Tetragon Network Policy》则宣布 Tetragon 可以按二进制匹配、用 FQDN 书写网络策略。
OpenTelemetry 这两年同时做两件事:夯实底座,追赶 Agent。
底座方面:2026 年 5 月毕业;声明式配置稳定;Profiles 进入公开 Alpha;OBI(eBPF 自动插桩,源自 Grafana Beyla 的捐赠)持续推进;Kubernetes attributes processor 在 2026 年 9 月发布 v1.0.0。与之呼应,Kubernetes v1.37 把原生直方图推进到 Beta 并默认开启。
Agent 方面:
官博 2025 年有《AI Agent Observability》,2026 年有《Inside the LLM Call》;
语义约定 v1.42.0(2026 年 6 月 12 日)把 GenAI、提供方专属约定与 MCP 约定拆到独立仓库 semantic-conventions-genai,以便更快迭代;
约定已覆盖推理、嵌入、检索、记忆操作与工具执行,Agent 与 MCP 都是一等公民;
但整体仍标注为 Development,截至 2026 年 8 月 21 日尚无正式发布版本。
这意味着:现在按 gen_ai.* 插桩是对的,但要预期属性名还会变。
图片
一句话:网关管入口,Sandbox/Substrate 管运行,DRA 与调度管资源,Cilium 管边界,OTel 管证据。这五件事,都发生在云原生的地盘里。而汉荣下一代云原生统一管理平台正是这么一直坚持的技术路线。
五个判断
分层,而不是替换。Kubernetes 核心保持通用,Agent 特有需求由 CRD、子项目和上层系统(Sandbox、Substrate、AX)承接。
调度单元在升级。Pod → Workload/PodGroup → Actor。
网关的关注点从 Header 走向 Payload。
标准先行。AI Conformance 是 CNCF 用“合同”约束生态的方式。
可观测性是 Agent 的“证据链”,但标准尚未定型。
风险清单
工作负载感知调度:v1.36 到 v1.37 API 版本连续变更,勿直接上生产;
AI Gateway 提案未见已合并的 CRD,agentgateway 仍是 v1alpha1;
AX 处于早期开发,Substrate 目前面向 GKE Standard;
OTel GenAI 约定仍是 Development;
Ingress NGINX 的教训:关键组件依赖少数维护者,本身就是风险
白明的赞赏账户