尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

迎接10亿瓦AI工厂:网络才是决定算力利用率的关键

发布时间:2026/9/26 20:34:19

资讯中心
01
ARTICLE

迎接10亿瓦AI工厂:网络才是决定算力利用率的关键

迎接10亿瓦AI工厂:网络才是决定算力利用率的关键
GTC 2026 的 China AI Networking Day 把主题定在“迎接 10 亿瓦级 AI 工厂的时代”说实话这个标题放在两年前我会觉得是噱头但放到现在我只会觉得它来得太晚了。过去一年我在帮朋友所在的几家单位做大规模 GPU 集群的网络规划和性能调优最直观的感受就是算力从来不是瓶颈能喂饱算力的网络才是。当你面对的不再是一排 8 卡的训练服务器而是几千张卡同时做 All-to-All 通信时网络就不再是“综合布线工程”里的那个配角而是整个 AI 工厂的血液循环系统。这篇文章我不打算复述 GTC 上那些华丽的 PPT我只会从实际落地和工程观察的角度把“10 亿瓦级 AI 工厂”这个概念掰开揉碎讲清楚它背后到底意味着什么、网络在其中扮演什么角色、我们在真实搭建和运维这些系统时到底在折腾什么以及未来几年这个方向会怎么演变。1. 从数据中心到 AI 工厂一盏灯点亮的时代拐点1.1 “10 亿瓦”这个数字到底有多硬核10 亿瓦换算成标准单位就是 1GW也就是 1000MW兆瓦。为了让你对这个数字有体感我先给几组对比数据一个典型的传统互联网数据中心IDC机柜功率在 6kW 到 12kW 之间整栋楼加起来可能只有 20MW 到 40MW一个大中型云计算可用区建设规模在 50MW 到 100MW 已经算相当可观了。而一座 1000MW 的 AI 工厂相当于把 2 万多个标准机柜的电量集中在一个园区里劈头盖脸地灌进去。我做过一个很粗略的账以当前主流 GPU 服务器单机功耗 10kW 左右来算1GW 大约可以支撑 8 万到 10 万台这样的服务器再按一卡一服务器来折算就是 8 万到 10 万张加速卡。这个规模如果放在两年前大家会觉得是天文数字但 2025 年往后多个头部厂商的集群规划都已经明确在朝着 10 万卡、甚至 30 万卡的方向冲。算力疯长之后电力的边际效应就开始显现黄仁勋在多个场合反复强调 AI 工厂AI Factory的概念本质上就是说算力基础设施建设要进入工厂化、规模化的时代了。但我要特别指出一点10 亿瓦不是“目标”而是“结果”。它背后真正驱动的是模型参数量和数据量的持续膨胀。今天的大模型预训练动辄就是几十万亿 token 的数据集模型参数量从千亿走向万亿、十万亿每一次规模跃升对算力的需求不是线性翻倍而是成数量级地跳变。当单集群规模从万卡走向十万卡你不可能再把它们拆成几百个小集群各自为政因为你需要的是海量 GPU 协同完成一次训练任务而不是几百个并行的“小任务”。这时候一个能把这么多加速器高效粘合在一起的巨型系统就不可避免地诞生了而它消耗的电力自然就来到了 1GW 量级。1.2 为什么 AI 终于配得上“工厂”二字我印象非常深的一次对话是和一个做传统企业 IT 的老朋友吃饭。他问“数据中心跟 AI 工厂到底有什么本质区别不都是房子、机柜、空调、电线吗”我当时打了个比方传统数据中心是“库房”你把服务器放进去、托管在机架上跑的是各种 Web 服务、数据库、流媒体——资源被拆成几十万个虚拟机或者容器提供给各种业务使用每一个请求都是轻量的、瞬时的整体模式更像一个“超市”顾客随取随走。AI 工厂则完全不一样它更像一条“流水线”。整座工厂的终极目标不是“把数据存下来”或者“把请求转发出去”而是高效地产出一系列智能模型。GPU 在工厂里就是“机床”数据是“原材料”训练框架是“工艺路线”网络则相当于工厂里的“传送带”。传送带一旦卡住整条流水线都得等。这样一座工厂追求的是“单位能源产出多少有效计算”而不是“单位面积放多少台服务器”。从这个角度看AI 工厂的三大支柱就非常清晰了第一是密集的计算资源也就是大规模 GPU 集群第二是高速、无损、低时延的互联网络把算力组织成一个整体第三是与算力规模精确匹配的能源供给和散热系统。过去几年大部分团队把精力花在第一点上——堆卡今年开始越来越多的团队意识到第二点才是真正拉开差距的地方。一张卡两年前花 3 万美元现在花 4 万美元但你花几千万建好网络之后如果利用率从 40% 优化到 70%相当于凭空多出来一大截算力这笔账怎么算都划算。2. 网络是 AI 工厂的“血液循环系统”2.1 训练一次大模型网络里到底在跑什么很多非网络背景的读者可能对“AI 训练需要网络”这件事感觉很抽象。我换个角度解释假设你要把 100 万个词元的文本送给一个 1 万亿参数的模型去训练这个模型不可能放到一张卡里它必须被切分成许多份——这就像你让一万人每人负责读一本书的一部分然后大家要共同更新对这本书的理解。张量并行Tensor Parallelism是把模型的一层切开让多张卡各算一部分再拼起来数据并行Data Parallelism是把数据切开让不同卡各自算各自的梯度然后汇总专家并行Expert Parallelism则让不同的 token 路由到不同的“专家”模块上去计算。这些并行策略如果只是理论倒是挺简单但落到工程上就会立刻演变成一个可怕的东西通信。在训练一个万亿参数模型时每一轮迭代网络里跑的数据量动不动就是几十 GB 甚至上百 GB而且不是一次性均匀发送是大量的突发式 All-to-All 流量所有卡同时给所有其他卡发数据。你在机房上线前做带宽测试可以轻松跑到 90% 的利用率但真实训练任务一跑起来网络利用率能稳定到 60% 就已经相当了不起剩下 40% 全被拥塞、等待、报文重传吃掉了。为什么等待那么致命因为分布式训练是典型的“木桶效应”每一轮迭代要等所有 GPU 都算完、都通信完才进入下一轮。一张卡掉链子 5 秒整批一万张卡陪着它一起等 5 秒。所以在千卡、万卡集群里哪怕网络平均时延只增加 10 微秒都可能让整体训练效率肉眼可见地下降。这不是玄学这是同步屏障Barrier机制决定的物理现实。我见过最夸张的一个案例某个集群因为交换机的拥塞管理配置不当GPU 利用率从预期的 80% 直接掉到 50% 以下一轮排查过去发现根源仅仅是某个型号交换机的 ECN 阈值设置得过于激进。2.2 Scale-up 与 Scale-out两张网各管一段接触过大规模 AI 集群的人应该都熟悉一个词Scale-up纵向扩展和 Scale-out横向扩展。Scale-up 指的是单个“计算域”内部的 GPU 互联典型代表就是 NVIDIA 的 NVLink 域一张 8 卡的 DGX 服务器内部卡与卡之间通过 NVLink 以每秒 TB 级别带宽直接通信Scale-out 则是把不同的计算域通过外部网络连接起来典型代表是 InfiniBand 或高速以太网带宽以每秒几百 Gbps 到几个 Tbps 为主。为什么要分两段因为一张卡和它最亲密的“伙伴”之间通信量最大、时延要求最苛刻比如张量并行里的 AllReduce那一丁点延迟都会直接变成同步等待而跨域之间的通信虽然带宽要求极高但对时延的敏感度相对没有那么极端。所以网络上普遍的做法是NVLink 域内做“快车道”以极低时延完成细粒度协同域间用 Scale-out 网络做“主干道”保证海量数据快速搬运。这带来一个很有意思的工程变化过去我们选网络设备主要考虑的就是交换容量和端口速率现在选设备还要考虑你能不能在物理上离 GPU 足够近、能不能用铜缆直连、能不能忍受光模块的功耗和散热、能不能做 RDMA——每一项都会体现在真实的训练效率上。在万卡集群里Scale-out 网络动辄几千个端口任何一个端口如果出现微突发丢包都可能引发 PFC 风暴接着是连锁式的性能崩塌。所谓“无损网络”的圣杯就在这几千个端口的恶劣战场上艰难地维持着。2.3 AI 网络与传统数据中心网络最本质的区别做网络的人如果只是把传统数据中心的“大二层 等价多路径”思路照搬到 AI 集群几乎都会栽跟头。原因在于流量模型完全不同。传统数据中心是典型的南北向流量用户请求进来内部服务之间偶有东西向通信但整体流量是碎片化的、小包居多、长短混合网络设备可以依靠缓存和缓冲来“消化”突刺。AI 训练网络则是极端的“大象流”大量节点以近乎线速的方式互相灌数据队列很快就占满传统哈希的负载均衡在这种场景下会频繁失效。另一个本质区别是“流完成时间”的敏感性。传统业务里一个 Web 请求慢个几十毫秒用户可能有感知但业务还在跑AI 训练里一个梯度同步慢 100 毫秒可能就导致整个集群进入同步停滞状态。因此 AI 网络必须引入“拥塞感知”机制比如 RoCEv2 里的 ECN显式拥塞通知、数据中心里常见的 PFC优先级流控、以及更现代的智能拥塞控制算法。这些机制的原理不复杂但配合不当就会互相打架PFC 风暴导致死锁的事故我过去两年里处理过不下五次。每次我都觉得网络工程师的活儿完全变了不再是配置 VLAN、静态路由这么简单而是要从流量的脾气秉性出发去设计整个系统。3. 技术选型专用 InfiniBand 与开放以太网的贴身肉搏3.1 InfiniBand为 AI 而生的专用跑道InfiniBandIB之于 AI 训练集群就像 F1 赛道之于赛车它是极其优秀的专用方案。IB 从设计之初就考虑了高性能计算场景的三大诉求极低时延、极高带宽、无损传输。它的链路层流控机制能保证数据包在传输过程中不因拥塞而丢弃配合自适应路由Adaptive Routing和拥塞控制能把大规模 GPU 集群的通信效率推到非常高的水平。在 GTC 的语境下观察NVIDIA 自家的集群集成基本都以 InfiniBand 为主力网络。过去几年各大厂商的万卡集群绝大多数选择 IB 方案图的就是稳定、确定性强、效果有保障。IB 的运维难度也相对可控——虽然设备贵但它的行为非常规矩可观测性工具也很成熟出了问题能快速定位。某种程度上IB 是“虽然贵但是省心”的选择。但 IB 的代价同样明显第一是成本IB 交换机和光模块的价格明显高于同规格以太网第二是封闭生态它对第三方设备的兼容性有限你很难拿不同厂商的设备混合组网第三是在一些非 AI 业务场景里IB 网络基本是纯浪费。所以 IB 适合的目标非常清晰专门的、专注 AI 训练的大型集群尤其是你要在确定性上追求极致的时候。3.2 以太网阵营的反击Spectrum-X 与超以太网联盟以太网阵营这两年的反攻速度非常快。核心逻辑很简单以太网的生态太庞大了全球各大数据中心已有基础设施几乎都是以太网如果能在此基础上实现高性能无损传输那企业就能“花小钱办大事”。RoCERDMA over Converged Ethernet正是这一思路的产物它把 IB 的 RDMA 语义搬到了以太网上让普通交换机也能跑出接近 IB 的高性能。但 RoCE 最大的毛病是以太网本来就不是为无损设计的丢包、乱序、缓存不足等问题都会让 RDMA 传输效率急剧恶化。早期的 RoCE 部署性能对网络微突发极其敏感很多人因此宁可加钱上 IB。为了补上这个短板业界联合推进了 Ultra Ethernet ConsortiumUEC制定面向 AI 时代的以太网增强标准从拥塞控制、负载均衡、丢包恢复等多个层面重新定义链路行为。NVIDIA 自己也顺势推出了 Spectrum-X 平台通过 BlueField DPU 和 Spectrum 交换机的联动来做端到端的拥塞控制实际效果已经相当接近 IB。我在实际测试中的体感是对于 1K 卡级别集群Spectrum-X 和 IB 的性能差距已经在 5% 以内在 4K 卡以上规模IB 仍然有优势但以太网方案的综合性价比、多厂商竞争带来的灵活性让越来越多新项目开始认真考虑“超以太网”路线。尤其是一些已经有大量以太网资产和数据中心运维经验的公司完全没必要上来就砸重金上全套 IB。3.3 选型不是网络问题而是工程经济学问题关于 IB 和以太网之争我的核心观点是从来不存在“哪个方案绝对更好”只存在“哪个方案适合你的现状和目标”。很多团队在选型时容易犯一个错误就是只盯着带宽和时延的纸面参数忽略了“运维能力和团队熟悉度”这个隐藏成本。IB 如果没人会调买了也白买RoCE 如果调不好图便宜的下场就是天天处理 PFC 死锁。我建议做选型时画一张表把下面几个维度列出来GPU 集群规模1K、4K、10K、模型通信模式稠密 vs 稀疏专家并行、现有网络资产是否已有大量以太网、运维团队技术栈是否熟悉 RDMA以及最重要的——业务对“确定性”还是“性价比”更敏感。如果全部追求极致且预算充足IB 是正确答案如果是多租户混合负载平台以太网反而更务实因为它的通用性允许你在闲时跑一些 HPC 或大数据任务不至于让网络空转。我个人比较看好的一条路径是“以以太网为主体、以智能网卡为补强”的混合架构。拿走 IB 的一点性能劣势换来整个体系的开放性和长期演进空间这在 1GW 级 AI 工厂里不是技术决定而是资本和运维的不可承受之重反过来倒逼技术选择。4. 搭建 AI 工厂网络时真正要命的工程细节4.1 拓扑怎么选不只是胖树还要看“高铁直达率”AI 集群的网络拓扑选择和传统数据中心最大的差异在于你不能再依赖“三层都是全互联”的胖树结构了。胖树的带宽收敛比容易控制但它的时延路径较长而且在大规模 All-to-All 场景下上游链路的拥塞概率极高。所以做 AI 网络的人越来越多会关注“Rail-Optimized”轨道优化拓扑。什么是 Rail-Optimized简单说就是把物理上相邻的一批 GPU 卡尽量放在同一个网络交换域内让它们之间的通信不需要经过多层交换机转发就像一条专门的“高铁线”直连。这样做的好处是分布式训练里最常见的“相邻节点通信”可以走最短路径时延和拥塞都大幅下降但它要求的交换端口数量和布线复杂度也会上升。4K 卡集群用两层 Rail 拓扑还能应付到了 2 万卡以上设计者就得考虑三层或多级结构。另一个在大规模组网里被反复提到的拓扑是 Dragonfly它把网络分成“群Group”“组Pod”层次组内是全互联组间通过少量全局链路相连。它的优势是“用更少的链路达到同等带宽”对机架间的物理布线压力大减在 10 万卡量级这种拓扑的优势不是一点点而是决定性的。但它的代价是路由复杂度和流控算法大幅上升开局配置的难度比 Fat-Tree 高一个数量级。我见过不少团队在 POC 阶段用胖树能跑出漂亮数据真上了 Dragonfly 后因为配置参数没调好性能反而崩了——拓扑本身没有对错只有“你的团队能否驾驭”。4.2 拥塞是无感 AI 工厂里最隐秘的性能杀手我甚至想说大规模 AI 集群的性能杀手不在 GPU而在网络拥塞。它的隐蔽性在于从交换机 SNMP 的端口利用率看一切正常——链路没打满、丢包率看着也低但训练任务的实际吞吐就是上不去。原因往往是瞬时微突发导致的排队、PFC 反压的扩散、ECN 标记阈值和实际队列深度不匹配这些层面的问题根本不会体现在“平均利用率”里。之前处理过一个典型事故集群从 2048 卡扩展到 4096 卡后训练的吞吐没有像预期那样线性提升某些迭代的耗时反而翻倍。排查了很久最后发现是以太网交换机在默认配置下的 PFC 死锁——某个低优先级队列被高优先级流量堵死导致反压信号层层上传最终把多个端口的有效带宽全部拉低。这个问题的“元凶”竟然只是某个交换机的“头阻塞”参数没调对。从此以后我在所有环境上线前都会强制加入“全集群压力测试”让所有 GPU 同时互发数据持续跑足 30 分钟观察 ECN 标记报文比例、PFC 帧数量、队列深度和实际吞吐的对应关系有任何一项偏离基线就停下来排查绝不带着隐患上线。这些“看不见的变数”就是 AI 网络和传统网络最大的不同传统网络的故障是“通”与“不通”的问题AI 网络的故障是“快”与“慢”、“稳”与“抖”的问题后者对运维工具和工程师直觉的要求高得多。4.3 网络可观测性AI 时代的新“必修课”正因为 AI 网络性能衰减如此隐蔽可观测性建设就成了硬需求。传统网络监控工具SNMP 轮询设备和端口状态、ping 测连通性、看丢包率告警这些在我看来已经远远不够了。你要想在 1GW 的 AI 工厂里活得好至少得具备以下几种能力基于流级别的实时遥测能看到某个通信对的流量路径和拥塞点全局拥塞事件的检测与归因能快速判断是哪个上游链路导致的反压扩散以及训练任务与网络指标的关联分析能把一次迭代耗时拉长对应到是哪一阶段的通信拖了后腿。在 NVIDIA 的生态里InfiniBand 过去在可观测性上的优势很大因为它有专门的遥测机制而以太网方案这两年也在快速追赶Spectrum 交换机配合 DOCA 遥测能提供相当细粒度的数据。我自己的经验是无论用哪家方案一定不要把监控数据只留在网络团队手里要把它和训练框架里的迭代耗时、GPU 利用率联合起来看。很多“网络好像没问题”的案子一旦把训练日志里的通信耗时曲线叠加到网络遥测上立刻就能发现“每次同步阶段网络队列就加深”这种强相关性。4.4 供电与散热网络设备也被推着“卷”说到 1GW 的 AI 工厂供电和散热是绕不开的话题。很多人以为这是机电专业的事和网络没关系但实际做下来你会发现算力密度的提升直接改变了网络设备的形态。传统的交换机设备一个框式交换机能胜任接入层任务功耗低、噪声小但在 AI 工厂里接入层基本被 128 端口、单端口 800G 甚至 1.6T 的盒式交换机取代单台交换机的功耗已经逼近甚至超过 1000W机柜级的功耗密度非常高。光模块更是重灾区。一个 800G 的可插拔光模块功耗普遍在 16W 到 20W 之间一张 128 端口交换机光模块总功耗轻松突破 2kW。如果是 10 万卡集群光模块的数量数以十万计总体耗电量惊人。这也是为什么“共封装光学CPO”最近被反复提起——把光引擎直接封装到交换芯片旁边用板载光学替代可插拔模块能把光互连功耗降低一半以上。虽然目前 CPO 的产业链成熟度还在早期但在我接触的几个大型新园区设计中已经预留了 CPO 交换机的机柜空间和制冷余量这种前瞻性是必须的。5. 我看到的 10 亿瓦级 AI 工厂的现实与想象5.1 算力地图上的新基建逻辑从商业布局的视角看1GW 量级的 AI 工厂已经不只是“机房扩建”它正在重塑整个基础设施的投资逻辑。过去数据中心选址看带宽资源、客户分布、骨干网络节点AI 工厂选址的核心只有一个电力资源是否充足、是否便宜、能否持续供电。我见过好几个新规划中的园区直接建设在大规模水电、风电资源附近目的就是锁定长周期的低成本清洁能源。这本质上跟当年把电解铝厂建在电厂旁边一样是“能源密集型工业”对地理位置的硬要求。同时电网侧被迫跟着改造。一个 1GW 的园区其峰值负荷足以顶上一个中型城市的全部用电量这对接入方案、变电站配置、电网调度都是一次从零开始的设计。听起来特别宏大但它真的在发生。我在和一些做电力基建的朋友沟通时发现他们已经在用“数据中心 新能源 储能”的微网模式来规划 AI 园区光伏、储能电池组和算力负载统一调度。未来的 AI 工厂与其叫“数据中心”不如叫“智能算力发电厂”——只不过它输入的是一次能源输出的是模型推理能力。5.2 AI 工厂对产业链的连锁冲击AI 工厂的大规模建设正在带动一连串产业链的连锁反应。最直接的是光模块和光缆800G 光模块还在放量1.6T 已经进入样机阶段后面还会有 3.2T 甚至更高速率这背后是硅光技术、薄膜铌酸锂调制器、高密度封装这些基础研究的快速商业化。铜缆也是一个很有意思的市场——在机柜内部和相邻机柜的短距离连接上无源铜缆DAC凭借极低的功耗和成本反而在 800G 时代继续“统治”了一席之地但更长距离的应用还得靠光。再往上游看交换芯片和数据中心交换机的竞争格局也在悄悄生变。过去以太网交换芯片市场是几家传统厂商的天下现在因为 AI 带来的高速率窗口新的玩家不断涌入。各家都在争夺“AI 网络标准”的定义权不仅有传统兼容路线还有专门为 AI 场景优化的新架构。这些竞争对最终用户来说是绝对的利好——价格的快速下降和产品丰富度的提升让过去“非 IB 不 AI”的格局松动企业有了更多组合选择。5.3 工程师、架构师、研究员的新机会最后聊点实际的——人和团队。1GW 时代对人才的需求已经完全不是传统网络工程师能覆盖的了。过去懂 VLAN、MSTP、OSPF、BGP 就能胜任网络运维现在要想跑好 AI 工厂网络你得懂 RDMA、无损网络、拥塞控制、GPU 拓扑和数据并行语义还得能读懂训练框架的日志理解梯度同步算法的时间线。我认识的几个转型比较成功的传统网络工程师都有一个共同特征他们并没有急着去学“深度学习理论”而是先啃透了 RoCE 的原理、跑通了 PFC/ECN 的配置再通过一次次故障排查把“网络问题”和“训练问题”之间的因果链条建立起来。这个过程非常痛苦但一旦建立起来就像打通了任督二脉你看到一段紧耦合的通信模式就能预判它在哪条链路上会产生拥塞提前把拓扑和阈值调好。这种“跨界”能力在未来几年会越来越值钱。因为纯网络专家不懂算力调度纯算法工程师不懂网络细节能沟通两端的人才是 AI 工厂最稀缺的角色。我一直觉得技术在巨变时最考验的不是“学得快”而是“忘得快”——忘掉过去那些基于传统流量模型建立的经验直觉重新建立一套面向 AI 通信模式的思维方式。GTC 2026 这场活动的意义不在于展示又多了多少 PFlops 的算力而在于让整个行业意识到算力的体量已经大到需要专门为它设计基础设施了网络在其中不再是被动配套而是决定系统上限的主导者之一。如果你所在的团队正准备建设自己的 AI 集群我的建议是别急着下单买卡先把网络方案拿出来请懂行的人认认真真做一轮压力测试和拓扑评审。GPU 贵但闲置的 GPU 更贵而让 GPU 闲置的最大元凶往往就是那条看似“啥都能通”的网络。算力是原材料网络才是生产线生产线不顺畅原材料堆再多也做不出合格的产品。这个时代真正决定 AI 工厂生产力的不是你有多少电和多少卡而是你能不能把这些资源精确、无缝、高效地组织成一台轰鸣的机器。
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。