卓远发展有限公司

可以看直播的app黄台 AI算力插足“超节点时期” 国产厂商能否借此怒放新场面?

发布日期:2026-07-25 09:41 点击次数:132 你的位置:卓远发展有限公司 > 行业资讯 >

可以看直播的app黄台 AI算力插足“超节点时期” 国产厂商能否借此怒放新场面?

超节点为什么倏得火了?本年以来可以看直播的app黄台,超节点险些成为国产算力产业最热的关键词。

7月17日,“2026寰宇东谈主工智能大会”(WAIC)在上海开幕。在会上,华为、中兴通讯、天数智芯等厂商均带来了超节点居品。在华为展区,映入眼帘的是体形巨大的昇腾950超节点,眩惑了一波又一波客流。

新华社

超节点要回应的问题其实是,1000个东谈主系数作念题,若是每贪图一步,这1000东谈主都必须停驻来,恭候统统东谈主对完谜底才气迈出下一步,那么1000个东谈主解题怎样比100个东谈主更快?谜底不在东谈主数,而在于让这1000个东谈主像一个东谈主那样情意重叠。这是超节点的逻辑,它不是新芯片,也不是新模子,而是一次算力组织花式的质变。

昔时,AI(东谈主工智能)集群的基本单位是单台8卡就业器,跨就业器通讯是绕不开的瓶颈。超节点要作念的即是通过高速互联和长入内存语义,把散布在数十台就业器里的成百上千张芯片,压进一个低延伸、高带宽的域内,让它们像一张芯片那样协同职责。

以前,算力竞争的中枢命题很径直,比拼的是谁能造出一张更快、更强的芯片;而今天,这个问题正演酿成另一个更复杂、更具系统性的追问:怎样让成百上千张芯片确实像一张芯片那样协同职责?

超节点,恰是这场系统级竞争最蚁合的体现。

多家厂商带来超节点

在本届WAIC上,华为初度展示复旧1024张NPU(神经处理单位)高速互联的昇腾950超节点(Atlas 950 SuperPoD)真机,并初度裸露客岁发布的昇腾384超节点已累计领域商用750多套。

中兴通讯结伴曦智科技、壁仞科技、沐曦股份、燧原科技、天数智芯打造国产高性能Matrix超节点;中科朝阳首发scaleX10万卡超智和会集群系统,这亦然国内领域最大的AI4S(东谈主工智能赋能科学征询)贪图集群。

国内头部GPU(图形处理器)厂商壁仞科技也带来了超节点决策,包括16卡超节点、128卡超节点以及1024卡超节点。其中,16卡、128卡超节点使用电互联,而1024卡超节点则用上了光互联。

另一家GPU厂商天数智芯也带来超节点。据悉,天数智芯超节点面向大模子窥探与高并发推理场景,以国产通用GPU为中枢,杀青144芯高速全互联,通过高带宽互联、长入资源养息和软硬件协同优化,提供自若、可靠、可扩展的高质料算力。

天数智芯职责主谈主员告诉《逐日经济新闻》记者,公司超节点是144芯电互联。

在华为展区,记者看到,从左至右枚举了20个机柜。双方各有8个贪图柜,中间是4个灵衢机柜。具体到贪图柜,最表层是电源模块,中间层的正面是光模块、LPO(光模块剔除了数字信号处理手艺芯片)的插槽,后来方是正交结构的CPU(中央处理器)刀片、NPU 刀片以及交换网板,最基层为液冷模块。

记者来到昇腾950超节点的后方,华为打造出透明的机柜,以展示里面结构。只识趣柜里面并非由传统的就业器构成,而是由一个个NPU抽屉、CPU抽屉构成。一个机柜领有16块CPU、64块NPU,一个抽屉内摈弃8个NPU模组。这一个个CPU抽屉、NPU抽屉,也被称之为CPU贪图刀片、NPU贪图刀片。

《逐日经济新闻》记者不雅察到,其机柜里面正交架构念念路与英伟达周边,但选拔无背板正交直连遐想,区别于英伟达的正交背板决策。

对于为何打造如斯巨大的超节点,而不是诓骗传统的Scale out(横向扩展)组贪图集群,华为职责主谈主员示意:“装在一个POD(超节点)里面可以看直播的app黄台,带宽会更大。因为当今大模子推理对带宽的条目特殊高。”

当下,跟着Agent(智能体)和大模子推理的盛行,AI的瓶颈慢慢从贪图转为存储和互联(通讯)。那么,超节点里面又是怎样互联的呢?

职责主谈主员向记者先容,每一块NPU上,建树两块交换芯片。8卡NPU贪图刀片里面,是全电互联。贪图刀片的后面,通过高速铜缆接口与交换网板王人集。一瞥排交换网板,厚爱机柜里面的互连。交换网板的后方是光模块、LPO插槽。光模块、LPO的尾部是长长的光纤线,光纤线通向灵衢机柜,由光来厚爱机柜与机柜之间的互连。灵衢机柜里面,是OCS(关系光系统)全光交换机。

简而言之,机柜里面是电互连,机柜与机柜之间是光互连。

与英伟达超节点比拟,华为950超节点的独到之处在于Scale up(垂直扩展)里面的光互联。英伟达超节点,Scale up里面主要由正交背板杀青电互连,华为杀青了Scale up的部分“以光代电”。

确实的堵点不是算力

把时候拨回3年前,大模子一脚油门,驶入了一场停不下来的极限竞赛。彼时,超节点还不是一个被反复批驳的名词,尽管模子照旧初始加快扩张,但不管是参数领域照旧窥探花式,都莫得确实触际遇传统算力架构的天花板。在这场极限竞赛中,大模子以近乎垂直的指数弧线演进,从数十亿参数直奔万亿参数而去,牌局初始发生改造。

本年4月发布的DeepSeek(深度求索)V4选拔了约1.6万亿参数的MoE(搀和人人)架构,巨大参数目意味着模子窥探流程中照旧弗成能依赖单卡完成,而必须拆分到多数GPU或NPU上共同实行。问题不在于模子的“大”,而在于“大”带来的代价。

此前,一家超节点厂商职责主谈主员向《逐日经济新闻》记者举了一个例子,若是把模子窥探泄漏为许多东谈主系数完成一谈数学题,那么昔时可能唯一十几个东谈主,每个东谈主厚爱一部天职容,临了再汇归来尾;而当今,更像是上千个东谈主共同完成一册书,每写完一句,都需要互疏通步一次,再陆续下一步。

贪图不错并行,但同步无法不详。当GPU数目无间增多,确实末端窥探成果的,照旧不再只是贪图才气,还有通讯才气。此前一场展会上,华为超节点展区职责主谈主员曾向记者证据注解,若是贪图节点之间的带宽不及,在模子窥探或者推理流程中,GPU(或NPU)很可能一直处于恭候情景,色综当带宽提高之后,这种恭候时候就会大幅镌汰,算力诓骗率也随之提高。

于是,竞争的焦点发生了位移,从比谁更贤惠,酿成了比谁的王人集更细巧。互联,成了新的战场。芯片、交换机、光互联、散热、电源、软件养息,都初始成为决定最终性能的关键脚色。从这个真义上说,超节点并不是某一种单独的新址品,而更像是一种新的基础设施形态。

模子越大,对它的需求就越浓烈。壁仞科技AI框架架构副总裁丁云帆也提到,现时AI发展濒临三大中枢挑战,模子参数从千亿级迈向数万亿级、Agent等应用场景条目百万级高下文长度、推理和窥探都需要千千万万张GPU协同职责。仅凭单张GPU的算力性能,已难以孤独承载上述复杂任务。在此配景下,怎样杀青海量GPU高效协同运行,使之如归拢台一体化超等贪图机开展职责,恰是超节点架构服从破解的中枢费劲。

清微智能研发副总裁李彬在接受《逐日经济新闻》记者采访时示意,超节点手艺本人并不是新手艺,多年前就照旧存在。“昔时超节点莫得热起来,是因为模子还不够大,模子才气和贪图需求还不及以‘填满’系数超节点提供的算力供给。”他说,跟着模子从百亿参数、千亿参数快速发展到万亿参数,大模子对蚁合式算力的需求快速提高,超节点才确实迎来了应用场景。

从拼单卡到拼系统

当互联成为中枢战场,不同的手艺道路便初始分野,而英伟达与国产厂商碰劲站在了不同的支路上。

看成当下大众商用超节点主流决策厂商,英伟达最早提议了超节点的见地,其GB200、GB300NVL72整机柜决策,也成了行业对标的范本。不外,与国产厂商无间向384卡、4096卡迈进不同,英伟达面前的单柜领域仍停留在72张GPU傍边。

为什么莫得陆续扩大?问题并不在于GPU,而在于互联,英伟达面前主要依赖NVLink电互联手艺完成GPU之间的数据交换,但电互联手艺存在天生的距离“漫骂”:传输距离滥觞约1米,损耗会清亮增多,自若性也会受到影响。因此,英伟达弃取的是一种相对蚁合的决策,在一个机柜内,把通讯成果作念到极致。

国产超节点则是在逼仄的推行中走上了另一条路。

由于先进制程、HBM(高带宽内存)等中枢关键被卡住脖子,国产AI芯片在单点性能上追逐外洋顶尖居品的路注定崎岖。于是,一场念念路的根人道回荡发生了:咱们不再执拗于让单颗芯片成为无敌的强者,而是试图用系统工程的红利,弥补单点才气的不及。

华为是这条路的强硬践行者,Scale up这条路,是通过堆叠更多贪图资源,杀青合座算力的跃升。与此同期,尝试用全光互联这根纽带,完成机柜间的高速王人集,以期冲破距离魔咒,扩大超节点领域,让GPU的恭候时候无穷靠近于零。

互联的范围即是算力的范围。快念念慢想征询院院长田丰以为,OCS面前仍有MEMS、液晶、压电、硅波导四条手艺道路并行,每条道路的延伸、带宽、切换速率各有不同。毫秒级切换的MEMS讲理AI集群的数据流级流量养息,但对突发性通讯的符合仍不如电交换生动。这个手艺鸿沟怎样填补,是产业现时的待解题。

李彬则以为,好意思国恒久末端先进工艺出口,加之摩尔定律慢慢靠近极限,仅依赖制程升级照旧越来越难杀青算力的大幅提高。因此,将来提高性价比,更蹙迫的是架构立异,而不是陆续在线宽上竞争。

不外,不管是强调通讯才气,照旧系统集成,在单卡性能短期难以平视敌手的配景下,通过系统遐想、通讯架构、集群组织花式的立异,依然能怒放优化的空间。

超节点正在改造竞争花式

越来越多的厂商把超节点视为推理时期的中枢基础设施,不管是PD区别(把模子推理的预填充息争码两个阶段鉴别)、LPU(言语处理单位),照旧算力池化、光互联,其最终方针都指向归拢个办法:质问用户恭候第一个Token(词元)的时候。

这亦然为什么DeepSeek将将来就业价钱下落与昇腾950超节点量产接头在系数。4月,DeepSeek在发布V4预览版时提到:受限于高端算力供给,Pro就业微辞才气仍然有限,瞻望跟着昇腾950超节点批量上市,接头就业价钱将进一步下落。

对于大模子厂商而言,确实决定营业化才气的,不单是模子性能,还有每生成一个Token 需要付出些许本钱。

尽管产业热度无间升温,超节点距离大领域秉承窥探任务,仍有一段路要走。

李彬以为,将来算力本钱下落将来自两个维度:一是模子算法无间优化,相通智能水平的模子本钱越来越低;二是芯片和系统架构握续提高成果,让相通的硬件能够完成更多任务。

这是超节点试图回应的中枢问题:在模子才气握续提高的情况下,怎样用更低的本钱,把越来越蚁合的算力需求组织起来。

诚然,超节点还莫得束缚统统问题。

窥探成果仍需进一步考据;软件生态仍在拓荒;开发者的移动本钱则像无形的阻力,拖慢变革的脚步;不同手艺道路之间,也还远未到赢输分晓的时刻。

但有小数照旧越来越明晰:将来的AI竞争,正在从单颗芯片的竞争,演变为系数系统工程才气的竞争。

对于系数产业而言,超节点约略不会径直决定最终赢输,但它正在改造竞争的花式。这场竞争,照旧不单是是对于一张芯片,照旧对于怎样让千千万万张芯片,确实像一张芯片那样职责。

又回到最初的问题:若是要等1000个东谈主对完谜底才气陆续底下的方法,那么东谈主数越多,恭候互相的时候反而越长。

数目,在某些时刻可能酿成成果的敌东谈主,而在超节点这场斗争中,组织的艺术可以看直播的app黄台,正在尝试让贪图的轰鸣声吞没恭候的千里默。

热点资讯

推荐资讯