超节点不是终点,AI 基础设施正在从「拥有算力」转向「让算力流动」
过去一年,超节点 SuperNode 正在成为 AI 基础设施的新基本单元。
越来越多训练和推理算力以整机柜、整集群方式交付。GPU、高速网络、存储和软件被绑定在同一个计算域内,带来更高的算力密度,也带来新的问题:高端 AI 任务算力缺口持续扩大,而已经部署的超节点并不总是满载。
单一的企业训练、推理任务具有明显的潮汐特征。一套固定部署的超节点,在业务低谷时可能大量闲置;而另一处业务高峰,却可能正在等待 GPU。
如果这些物理隔离的超节点可以被云端统一发现、调度和调用,它们就不再只是固定资产,而可以成为 AI 云实时智算网络中的计算节点。
AI 基础设施正在从「拥有多少算力」转向「能让多少算力流动起来」。

九章智算云正在尝试构建的,就是连接这两者的一层 AI 基础设施:通过超节点云化、异构资源池化和全局动态调度,将超节点转化为可编排、可复用的 AI 算力资源。
超节点云化:从固定资产到可调度算力
传统云计算解决的是虚拟机、容器和服务器的资源池化,但 SuperPOD 并不是一台普通服务器。它拥有独立的 GPU 拓扑、高速互联、存储和缓存系统,不同 GPU 架构、网络拓扑乃至不同数据中心之间,都存在物理边界。
因此,超节点云化不是简单把 GPU「远程出租」,而是完成三个变化:计算资源统一抽象,数据跨节点流动,任务根据实时状态迁移。
九章智算云通过异构资源抽象和动态感知切片,将本地超节点拆解成云端可以识别、计量和调度的计算单元。对上层应用而言,不同 GPU、网络和存储系统呈现统一 AI 云接口。
真正决定这一体系能否成立的,是资源池化与数据路径。
资源池化的核心不是把硬件「搬到云上」,而是把超节点拆解为「可被 AI 云理解和调度的计算、存储与缓存资源」。通过动态感知切片、资源抽象和数据路径,本地超节点可以向云端暴露统一的算力接口,而底层硬件仍然保持独立。
传统数据路径中,数据往往经历存储→CPU 内存→框架 Buffer→GPU 内存,多次序列化和复制。大模型时代,数据对象又从输入输出扩大到模型权重、上下文和 KV Cache,数据搬运本身开始成为瓶颈。
九章智算云将「零拷贝」的数据流动作为超节点云化的底层能力,通过共享内存、RDMA 和分布式文件系统,减少 CPU 参与和重复拷贝,让数据直接进入计算路径。
其中,分布式文件系统 DingoFS 负责分布式数据底座,高性能 KVCache 缓存 DFKV 则让 KV Cache 从单 GPU 的临时缓存变成可跨节点复用的状态资源。

在公开 vLLM 基准测试中,DingoFS 在 200Gb 网络下传输 4MB 数据的时延约为 220μs;DFKV 在公开 vLLM 测试中总吞吐提升 1245.7%,TTFT 下降 93.4%。
这意味着 AI 云的性能优化正在从「算得快」转向「搬得少、复用多」。超节点由此从「孤岛式集群」变成云化计算单元。
全局调度:AI 云真正调度的是任务和状态
当算力从一个超节点扩展到几十、几百甚至更多节点之后,问题会从「有没有计算能力」变成「计算资源应该服务谁」。
AI 任务不是传统意义上的 CPU Job。一个 Agent 可能连续执行几十、上百次模型调用,一次推理可能经历 Prefill、Decode、KV Cache 读取、工具调用和状态恢复,每个阶段对计算、显存、网络和缓存命中率的需求随时变化。
因此,解决 AI 工作负载动态性特点的 AI 智算调度系统至关重要,理解的不只是 GPU 利用率,还包括:任务是什么、模型是什么、缓存在哪里、下一步要做什么。
九章智算云构建面向 AI 工作负载的全局动态调度系统 Alaya NeW OS,把 AI 任务、模型状态和算力资源放在一起,持续感知 GPU 负载、显存、网络、缓存和任务队列。当某个节点进入业务低谷,系统可以把新的 AI 任务调度过去;业务恢复后,再动态释放资源。
这使超节点从静态资源变成动态资源,调度对象由此从「GPU」升为「AI 工作流」。
对于 Agent 任务,九章智算云调度系统 Alaya NeW OS 还需要尽量将后续请求放到保留上下文和 KV Cache 的节点,避免任务迁移后重新 Prefill。
这意味着 AI 智算云的控制平面正在发生变化:传统云调度的是机器,AI 智算云调度的是计算、状态和工作流、Token 生产过程。
这也是超节点云化真正产生网络效应的地方:节点越多,任务与资源匹配的空间越大;可复用的算力越多,单个节点的闲置价值就越低。
这一能力已经在实际业务中得到验证。公开信息显示,某头部自动驾驶公司借助九章智算云弹性调度实现 GPU 秒级扩容,端到端推理延迟低于 10ms,并节省约 30% 研发人力。
与此同时,九章智算云的 PD 分离和推理专用集群演进:DPU 负责网络、存储和 KV 搬运,释放 CPU 与 GPU;Prefill 和 Decode 进入不同资源池;推理集群结合拓扑感知和专用通信协议,提高 Token 吞吐。
超节点由此从 GPU Scheduler 走向真正的 AI Runtime。
AI Infra:从管理计算到管理状态
超节点提供的是计算密度,但计算密度并不等于 Token 生产效率。
长上下文、Agent 和大 Batch 场景下,GPU 越来越受到显存容量、内存带宽、网络和存储 IO 的共同约束。因此,AI Infra 的核心正在从「增加计算资源」转向:让计算、内存、网络和存储协同工作。

九章智算云围绕 AI Infra 构建了底层工程技术全栈,包括三层缓存体系、KV Fabric、DingoFS、分布式缓存和全链路「零拷贝」数据链路,使模型状态能够在 GPU 显存、主机内存和分布式存储之间进行高效流动。
其中最重要的变化,是重新定义 KV Cache。
传统推理系统把 KV Cache 视作某张 GPU 上的临时数据,九章智算云则把它视为可以被定位、搬运和复用的状态。
一次长上下文请求完成后,KV Block 可以进入分布式缓存。下一次请求到来时,调度器优先寻找拥有相关状态的节点,通过 Cache-aware routing 减少重复 Prefill。
九章智算云公开资料显示,在 Prompt 模板、RAG 等典型场景中,KV Cache 命中率可达到 60%—90%。这意味着部分原本必须重新执行的计算,可以转化为高速状态读取。
这一架构对于本地超节点尤其重要,云化后的超节点真正开始同时调度两种东西:计算在哪里,状态在哪里。
当算力、缓存和任务能够统一调度后,超节点之间才真正具备协同工作的可能。这也是 AI Infra 从「堆 GPU」进入「协同计算、内存、网络和存储」的关键一步。
训推优化:从弹性训练到 Token 生产效率的统一优化
强化学习不是 AI 云上的普通训练任务,它恰恰是验证弹性智算基础设施价值的典型工作负载。
原因很简单:RL 的资源需求天然不稳定。
一次完整 RL 训练通常包含环境模拟、策略执行、轨迹采集、奖励计算、模型更新和推理回传。不同阶段的计算负载差异极大,并且训练过程持续迭代,使 GPU 需求随任务状态不断波动。
固定 GPU 集群会在环境准备、数据回传和任务切换阶段产生资源空转;传统静态云调度则难以应对频繁的环境创建和资源切换。
九章云极的路径不是简单增加 GPU,而是从底层重构整个「训推一体」的工作流。
其强化学习平台将环境模拟、策略执行、奖励反馈、资源编排、容错恢复与推理执行统一封装,使 RL 训练与在线推理共享同一套资源调度与执行框架。GPU 不再绑定于固定训练集群,而是以可弹性伸缩的训练与推理一体化工作流为基本单元,根据任务生命周期在「训练—推理—回收」之间动态流转。
九章智算云进一步将强化学习与全局调度系统结合,根据任务阶段自动选择资源:策略更新阶段分配高算力 GPU,在采样和推理阶段切换至推理优化集群,任务结束后释放资源供其他任务复用。公开资料显示,九章强化学习云平台在部分场景 GPU 利用率超过 95%,TCO 最高降低 60%。
但强化学习的意义并不止于「更高效的训练」。
它更像一项系统级压力测试:如果一个系统能够稳定承载高波动、强状态依赖、频繁训推切换的 RL 工作负载,就具备支撑 Agent 和大规模推理系统的基础能力。
而当强化学习训练与推理共享资源池,一个持续优化闭环也由此形成:推理产生数据→数据进入强化学习/微调→新模型回流推理→再次产生数据。「训练」和「推理」不再是两个孤立阶段,而是同一系统中的两个状态。
在这一基础上,推理优化成为决定系统上限的另一半问题。
资源池化解决「算力在哪里」,全局调度解决「算力给谁」,AI Infra 解决「状态在哪里」,而推理优化则直接决定:同样一颗 GPU,能够生产多少 Token。
九章智算云将 Chunked Prefill、Speculative Decoding、PD 分离与弹性 Batching 纳入统一推理优化体系,使计算、显存与带宽在时间维度上重新对齐。
长上下文场景中,Prefill 阶段往往成为瓶颈。Chunked Prefill 将长 Prompt 拆分为多个计算块,在 Decode 间隙穿插执行,使计算资源得到更充分利用。
Speculative Decoding 则通过小模型生成候选 Token,再由大模型批量验证,减少逐 Token 级别的串行计算开销,提高 Decode 阶段吞吐效率。
PD 分离进一步将 Prefill 与 Decode 解耦,让具有不同计算特征的任务进入不同资源池,减少相互干扰。
这些技术的共同目标,是重新组织计算、显存和带宽的使用方式。
因此,超节点竞争的核心指标也发生变化:不再只是峰值 FLOPS,而是单位 GPU 在单位时间内能够稳定生产的有效 Token。
谁来连接这张算力网络?
当越来越多超节点接入九章智算云,产业分工正在重构。
芯片节点提供算力单元,网络提供连接能力,模型提供智能能力,而 AI 云负责将这些能力组织为统一的计算系统。
过去,这些能力彼此割裂;未来,它们将被一张实时智算网络连接起来:计算、数据、KV Cache、模型与 AI 任务都可以在网络中流动。
在这一体系中,超节点不再只是本地重资产,而成为可被云端动态调度的计算节点;AI 云也不再只是 GPU 资源池,而成为连接算力、数据与模型的实时控制平面。
九章智算云正在构建的,正是这一层基础设施。
超节点商业模式也随之变化:不再是孤立的计算单元,而变成了可调度、可计量、可复用的 Token 生产能力。最终,任何接入网络的设备,都可能获得云端模型与就近算力支持,成为持续在线的智能终端。
超节点提升算力密度,AI 云实现算力流动,而实时智算网络决定 AI 如何抵达终端。
这可能才是超节点规模化之后,AI 基础设施的竞争起点。
来源:互联网


首页




