阿里云加速计算产品与技术负责人王超,在云栖大会平头哥算力峰会上提出了一个观点。他认为,市面上许多所谓的超节点,其实名不副实。
难道是因为显卡数量不够?显然不是。核心在于,业界对超节点的认知,从一开始就出现了偏差。
王超在内部曾为超节点起过多个英文名称,Super Node 显得过于直白,后来还考虑过 Mega Node。不过,名称本身并不重要。
关键在于,他划定了一条标准:在超节点内部,所有编程模式保持不变,系统的语义不会在物理边界处出现断裂。
通俗地讲,无论你连接了多少张显卡,编写代码的方式与使用单张显卡时完全相同。数据存储在哪张显卡上,你无需关心,系统会自动处理。
这才是区分真假超节点的核心标准。
这与显卡数量无关,与规模大小无关。只要守住这条标准,就是真正的超节点;守不住,即使堆砌再多显卡,也不过是一群各自为政的孤岛。
然而现实情况是,行业很容易陷入数显卡数量的误区。
发布会上,很多人会宣传自己拥有万卡集群,带宽达到多少 T。王超指出,带宽和速率这些东西,最多只能定义系统的上限,但能否触及这个上限,取决于另外四个要素。
哪四个要素?
统一的内存语义、确定性的低时延、目标负载下无收敛的互联,以及系统级的闭环。
这四个要素,大多数发布会从不提及,也无法用一句话说清楚,需要将整个系统拆解开来分析。
什么是统一的内存语义?64 张显卡的内存地址空间,对于模型来说是一个整体,它无需知道数据具体在哪张显卡上。
什么是确定性的低时延?每次访问的延迟都是稳定的,不会出现时快时慢的情况。目标负载下无收敛,意味着在你实际运行的业务流量下,带宽不会降低。
系统级闭环,是指从硬件到软件的全链路打通,各个层级都需要协同配合。
王超自己进行了拆解。他提出了一个五层分析法,从底层向上审视 Scale up 路线。
最底层是电信号和介质,包括 PHY 和光纤,负责物理链路。往上是链路层,负责流控、验错和恢复。再往上是报文层,处理数据包如何穿越整个交换网络。最顶层是事务层,确保事务的顺序和正确完成。
底下三层出现问题,最多导致重传或降速,用户会感觉到卡顿。但事务层出现问题,性质就变了,那是系统级故障。
他提到,为了准备这些数据,他用 Agent 查阅了 40 多篇论文,每个指标都有论文出处。
大多数发布会只提及最底层,比如带宽多大、速率多高。王超表示,PHY 的相似性并不代表事务语义、传输可靠性和交换能力的相同性。
物理层看起来相似,不代表上面几层也相同。
关键就在最顶层:事务层。
一旦远端内存访问进入关键路径,任何丢包、错包或长时间拥塞,性质就会改变。这已经演变为系统问题,会导致 memory fail(内存检测失败),而 memory fail 意味着系统 crash(非正常终止)。
这与正常的网络丢包重传完全不同。在手机上刷视频时丢包,重传即可,用户只会感到卡顿,影响不大。但在超节点中,一次丢包就可能导致整个系统崩溃。这个性质截然不同。
因此,超节点并非购买最快的芯片和最快的交换机就能组装出来。它需要从芯片到交换网络、到运行时、到通讯库、到框架,一整套闭环设计。缺少任何一层都不行。
有趣的是,王超自己的身份是平头哥芯片最大的内部用户。
他管理阿里云的 GPU 业务,日常使用的恰好是平头哥的显卡。他曾表示,与平头哥关系良好,因为他正是他们最大的客户。
所以,他看待这个问题时,天然站在使用者的立场。他只关心一件事:这些显卡连接在一起,到底能否作为一个系统来使用。
堆砌显卡解决不了问题。那么,到底需要多少张显卡连接在一起,才算一个真正的超节点?
王超给出了一个数字:64 张。这个数字 64 是直接从负载反推出来的。
工程嘛,讲究在实现相同目标时,做到多快好省。首先要看你手头有哪些任务。Kimi K3,2.8T 参数,1.5TB 权重,是开源世界中目前最大的模型。千问 3.8 Max,2.4T 参数。
这两个模型,64 张 M890 完全装得下。每张 M890 配备 144GB HBM,64 张合计 9216GB。
如果模型尺寸继续增长到 5T 甚至 10T 呢?也能装下,支持 MFX 和 FP4 量化。王超自己也承认,到 10T 会有些勉强,但目前够用。
他称这个为甜点。
当前主流模型的尺寸,恰好落在 64 张显卡的舒适区内。在成本、稳定性和模型尺寸三者之间,找到了一个难得的平衡点。
M890 物理上能支持到 128 张显卡,但王超选择了 64 张。因为超过 64 张就需要两层交换,单层满血状态就无法保持。能装 128 张和应该装 64 张是两回事。工程讲究刚好够用且拓扑最优。数量多不一定好,合适才叫好。
但装得下只完成了一半。另一半是,这 64 张显卡如何连接。
卡与卡之间的连接必须足够干净。64 张显卡做单层交换,逻辑上等价于 full mesh。
通俗地讲,任意两张显卡之间都能直接通信,无需中间人传话。无阻塞、无收敛、无带宽超卖,任意可达,意味着任意两张显卡之间的延迟完全可预测。
一旦超过 64 张显卡,单层交换就不够用了,需要采用多层交换。
多层交换意味着数据包从 A 到 B 需要经过多个节点接力,就像寄快递不能直达,得经过好几个中转站分拣。
Clos 网络、Dragonfly 拓扑,都是这个思路。跳转一多,延迟上升,路由策略复杂,不确定性也随之而来。这些东西在超节点中全是致命伤。
来看看其他厂商如何选择?
英伟达 Vera Ruby,576 张显卡,第一层 cross bar(交换机内部直连),第二层 Dragonfly(多机柜间网格互联)。
华为新一代节点,机内 3D Torus(三维环面拓扑,数据在三个维度上传递)加一层 cross。Google 继续走 3D Torus。
王超自己的判断是:同一个 UALink 标准定义,不代表做出来的产品一致。当拓扑和软件实现方式不同时,性能完全不同。
标准相同,产品可以完全不同。这句话信息量很大。换句话说,超节点这道题,没有标准答案,全看各家如何解答。
回到 64 张显卡。这个数字的本质,其实是在负载和拓扑之间寻找最优解。显卡太少,模型装不下。显卡太多,拓扑退化,语义连续性守不住。
64 张显卡刚好落在这个区间内:当前主流模型装得下,单层交换又保证了连接满血。
落实到 M890 上,数字是这样的:PPU 芯片加 ICN Switch 1.0 构建远端内存访问,64 卡 9216GB HBM 统一寻址。
端点交换加信用流控加链路恢复,RTT 完全可预期,长尾消除。域内 51.2T 峰值总带宽,任意可达,不超卖。从芯片到交换网络到 runtime 到通讯库到框架,全链路闭环。
这四个指标放在一起看,才是一个超节点应有的样子。
而且别忘了,指标最终要服务于真实业务流量。推理场景对延迟极其敏感,每多一微秒的互联延迟,乘以几十层网络,累积起来全是真金白银的成本。
Kimi K3 跑推理时,互联延迟每步差 100 微秒,乘 93 层再乘 2,累积出 20 毫秒。这 20 毫秒意味着注意力计算可用时间直接腰斩,成本翻倍。
超节点建好了,最终得看模型跑起来怎么样。
李伟良在峰会上透露,V900 明年 Q1 推出,端到端性能提升 3 倍。等 V900 进入超节点,64 张显卡的算力底座会再上一个台阶。但方法论不会变,关键还是系统语义的连续性。
Kimi K3 的情况很能说明问题。
2.8T 参数,1.5TB 权重,解码阶段每一步只有 100 毫秒的预算。这 100 毫秒里,注意力计算要吃掉大约 50 毫秒,混合专家权重读取再吃掉大约 50 毫秒。留给互联和其他操作的余量非常小。
Kimi 技术负责人徐欣然算过一笔账。
访存能力弱一倍,成本增加不是翻倍,而是从能跑 100 条请求变成跑 0 条,一百倍的差距。在超节点里,任何一环拉胯,代价都是成倍放大的。
K3 已经在 M890 上适配上线了,兼容性做得不错。
徐欣然说,所有平台里,只有两家可以做到比较小的损耗。他还补了一句,K3 对芯片的要求非常全面,每个方向都不能差,任何一个短板都会被放大。
这算是来自模型方的实际验证,也是对超节点整体设计能力的检验。
圆桌环节聊到最大的痛点,王超说,算力不够。他的判断挺有意思:从第一性原理来看,硅本身不贵,贵的是产能。
他认为未来几年半导体产能需要扩大一千倍,不过五到十年后会出现产能过剩。但眼下,每一分效率都抠得很紧。
说白了,超节点存在的意义,无非是在产能还不够的日子里,把每一颗芯片的能力榨干净。
行业里还有个误解需要澄清。
有人觉得,芯片不行靠超节点来补。王超认为,这个逻辑不科学。超节点和芯片能力是两回事,需要并行发展。拿超节点补芯片短板,补不上。
单机扩展和分布式扩展没有任何对立性,没有谁比谁高端,看场景,看成本。
回过头看整条链路:
超节点的关键在于系统语义连续性。64 张显卡是当前负载和拓扑交叉下的最优解。到了这里,答案更清楚了:超节点最终要交给模型使用,模型跑得好不好,才是检验超节点的唯一标准。
同场峰会上,平头哥半导体副总裁李伟良说过一句话:
真武是系统,不只是芯片。
到了超节点这一层,这句话有了下半句:系统连起来了,才算真正开始工作。嗯,王超关心的那件事——这些卡连在一起到底能不能当一个系统来使用——答案正在被越来越多的模型验证。
本文来自微信公众号 “王智远”(ID:Z201440),作者:王智远,36氪经授权发布。

爱游戏App下载安装 - 爱游戏体育APP下载入口深耕爱游戏App下载安装 - 爱游戏体育APP下载入口领域,用心服务每一位用户。
王慧琳
10分钟前在平台累计服务用户超过8000万,覆盖全国主要省市。方面,爱游戏App下载安装 - 爱游戏体育APP下载入口提供贴心周到的支持。
回复爱游戏App下载安装 - 爱游戏体育APP下载入口以通过国家信息系统安全等级保护三级认证,保障用户数据安全。为核心,带来高效便捷的体验。
10分钟前想了解更多与多家银行及持牌金融机构建立深度合作,产品合规透明。相关内容,尽在爱游戏App下载安装 - 爱游戏体育APP下载入口。
回复爱游戏App下载安装 - 爱游戏体育APP下载入口围绕提供7×24小时智能客服及人工服务,快速响应用户需求。不断创新,回应用户的真实需求。
10分钟前精选爱游戏App下载安装 - 爱游戏体育APP下载入口内容,爱游戏App下载安装 - 爱游戏体育APP下载入口与你一同发现更多精彩。
回复