2026-10-06
10月4日晚ATP500中国网球公开赛男单四分之一决赛,德约科维奇逆转兹维列夫,达成中网32连胜并晋级半决赛。 ... [详细]
徽声在线记者 | 陆柯言 近日,在上海举办的华为全联接(HC)大会期间,华为正式推出了面向AI时代的Peerium计算架构,以及作为其核心互联技术的UnifiedBus灵衢总线,这一发布标志着华为在计算架构领域取得了重要突破。 在传统的大规模AI集群中,服务器和处理器主要依赖网络进行连接,但随着集群规模的扩大,数据传输和通信等待所带来的效率损失问题日益凸显。Peerium计算架构的出现,旨在改变这一现状。它通过灵衢总线将CPU、NPU、内存、存储等计算资源进行高速互联,并采用统一协议打通柜内和柜间互联,使得数十万乃至百万颗处理器能够像一台计算机那样协同工作,从而显著提升整个计算系统的效率和扩展能力。 发布会结束后,华为轮值董事长徐直军与海思首席科学家廖恒,就华为新发布的AI时代Peerium计算架构和灵衢总线(UnifiedBus),与媒体进行了深入的交流。 在交流中,徐直军与廖恒详细讨论了昇腾在中国市场的份额、昇腾950的训练进展、算力芯片的产能情况、NPO光互联技术,以及华为与英伟达在技术路线上的差异等多个备受外界关注的话题。 徐直军透露,基于950DT的超节点目前仍在紧张测试中,预计将于今年年底或明年初开始大规模供货。从目前的测试结果来看,他预计从明年开始,将有大量模型训练构筑在950DT超节点上。目前,制约昇腾进一步放量的主要问题已不再是市场需求,而是供货能力。 在谈及与英伟达的竞争时,徐直军坦言,华为在单芯片方面仍受到国内工艺水平的限制,但在多芯片互联和系统架构上,华为已经形成了自己的技术路线。他认为,推动芯片的全面自主化,以及半导体产业整个链条的全面自主化,是一条必由之路,相信总有一天会变为现实。 以下是交流纪要的详细内容: 徐直军表示,很高兴能与媒体朋友们相聚交流,今天主要聚焦在华为开创的AI时代计算架构和灵衢协议上。他回顾了去年HC大会上发布的昇腾芯片及其路标(950、960、970、超节点与集群解决方案),并宣布了灵衢协议的开放。 在今年的HC大会上,华为展出了昇腾950和Atlas 950超节点。徐直军强调,超节点的真正挑战在于让数千、数万颗处理器组成一台计算机。而今天展出的基于950芯片的超节点,正是华为开创的全新计算架构的体现。这一架构被命名为Peerium,它基于嵌套并行、统一内存寻址、平等互联实现百万级处理器强扩展,突破了图灵范式的串行,提出了Nested BSP。 同时,Peerium也突破了冯·诺依曼单机架构,颠覆了长久以来的主从架构。但现有技术无法支撑这一架构的实现,为此华为发明了关键互联技术——灵衢,最终实现了让百万级处理器真正成为一台更大的计算机。 灵衢是基于一个开放协议、可无限扩展地联接CPU、NPU、内存、SSD、网卡和交换机的高速总线。有了灵衢,计算、存储、网络得以平等互联,从而彻底颠覆了原有的主从架构。 Atlas 950超节点就是华为采用Peerium计算架构的产品,目前25.6万卡规模的集群已经在部署和测试中。 问:廖博士论文中提到的25.6万张卡组成一个超节点,这是该技术的上限吗?目前整体市场需求情况如何? 廖恒解释道,25.6万或约20万这个数字,并非随意而定。 首先,这类大型集群主要用于训练,硬件基础设施需要支撑基础模型训练,而目前模型参数规模已达到5万亿级别。 未来两年内,预计中国将出现约6至7个前沿AI实验室,目标都是训练参数规模在10万亿到40万亿之间的基础语言模型。这些数字与超节点的内存容量和规模大致匹配,因此需要如此规模的基础设施来做训练。 其次,在中国,大多数数据中心都接入了国家电网。考虑到单个区域、单个数据中心园区的电力输送系统设计,20万是一个相对保守的数字。 正如廖恒所说,大家对全球范围内正在发生的AI模型竞赛应该非常熟悉。在中国,至少有3到4家一线参与者已获得广泛认可,并达到了一线地位。 问:华为接下来将如何推动中国的模型厂商将昇腾系列芯片用于训练? 徐直军表示,950率先推出的是PR版,主要面向推理,目前上市量不算大。而基于950DT的超节点则主要用于训练,目前还在测试中,规模供货应该在今年年底或明年初。华为与各家模型厂商进行了很多沟通交流,从目前测试结果来看,950DT的训练表现非常不错。他相信从明年开始,大量模型的训练会构筑在950DT超节点上。未来关键可能不在于华为推动的力度有多大,而在于供货能力有多大。 问:现在美国部分领先模型厂商呼吁放缓AI产业的发展,对此华为怎么看? 徐直军认为,从中美AI发展的水平和节奏来看,中国的模型基本都是开源的,相对而言,发展到哪一步也是透明的;而美国几家主流模型厂商由于拥有更强大的算力,到底发展到了哪一步,目前可能只有他们自己知道。他们感受到的AI风险,在中国可能感受并不强烈。中国现在还是要加快自己的节奏,等真正能够感受到这种风险时,或许会与美国头部模型厂商有同样的感觉。但他一直认为,AI既要发展又要管控风险,要让AI“向善”,而不是“向恶”。 问:950超节点目前有没有在海外扩展的计划?如果有的话,会在哪些市场上开展?国内市场份额情况如何?如何看待芯片自主化率的问题? 徐直军表示,目前昇腾满足国内市场需求还远远不足,所以没有全面拓展海外市场的计划。但确有少数国家非常需要,华为做了测试和供给,但量非常少。 在中国市场要统计英伟达的市场占有率很难,但如果从华为能够统计到的数据看,昇腾应该已经超过了英伟达。 中国推进芯片自主化是一条必然之路。中国有14亿人口,又是一个工业化大国,所有的生活、工作都与芯片相关。中华民族又是一个忧患意识很强的民族,不能一直受制于人。尽管水平可能差一点、先进性差一点,但解决“有无”问题,不要天天提心吊胆,应该是必然之路。相信无论是中国政府还是中国产业界,包括华为在内,推动芯片的全面自主化、推动半导体产业整个链条的全面自主化,肯定是一条必由之路,而且总有一天会变为现实。 问:华为推出了灵衢互联技术,这是基于在计算和通信领域的长期积累,其中有多少是来自华为网络部门的贡献? 徐直军表示,UB不仅仅是华为网络部门的贡献,华为在各种各样的互联协议基础上,最终将其做成一个统一协议。网络领域一般是IP协议,时延都很高。而计算互联和传统网络不一样,华为提的是总线,需要低时延、超高速。当时在决策做这个产品时,华为将其放在计算部门而不是传统的网络部门,这样才能真正做出一个高速、低时延、又统一协议的UB出来。 廖恒补充道,如果把UB看作一群人的智慧结晶,它是由计算机架构师孕育,但是由网络技术抚养长大。 问:UB是一个同时兼顾Scale-out和Scale-up的技术。英伟达分别做了NVLink和InfiniBand。为什么华为把Scale-up和Scale-out做成一个技术?这和现在其他方案相比有什么优势? 徐直军解释道,首先,不是他们不做,而是能不能做出来的问题。当前最新的NVL72柜内带宽很宽,达到1.8TB/s,但一出柜就降到0.2TB/s。要把百万台处理器变成一台计算机,柜间如此低的带宽根本不可能。大家都希望柜内、柜间、数据中心之间乃至跨区,速度最好都一样,那才能让一个巨大的物理空间成为一台计算机。这正是UB的价值,它基于一个统一协议,做到全程高速互联。因此UB技术路线上做的是总线,就像计算机内部的总线一样,而不只是Link。基于UB,华为的柜间带宽最高可达800GB/s。 去年华为开放UB协议后,最大的下载量其实来自硅谷。英伟达最早的目标可能不是做NV72,而是NV256,但最终它的256变成了72;而华为的910C超节点做到了384,还交付了一千多套。最主要的差别在于,华为在910C超节点上采用了UB,而当时英伟达的NVLink主要局限于柜内,柜间网络速度太慢,不可能扩展太多。 廖恒补充道,为何采用单一协议。英伟达及大多数其他厂商至少使用了两种协议,分别应对不同的场景,就像一次旅行往往要同时选择飞机、高铁、汽车等多种交通工具,转换过程相当麻烦费时。而在这些超节点中,大量流量需要中转,如果从NVLink切换到InfiniBand,至少涉及微秒级的转换时间,即从一个协议到另一个协议的中转时间,时延很难满足。而UB采用统一协议,将数据包从scale-up网络传输到scale-out网络,可能只需要大约150纳秒。相比而言,与这些协议转换开销至少可节省一个数量级。 问:在采用灵衢总线(UB)的Atlas 950中,Scale-up场景下光互联和电互联分别占多少?未来柜内有没有可能全部实现光互联,主要障碍是什么? 徐直军表示,华为刚刚发布了基于NPO的Hi-ONE模组,支持7.2T高带宽,光引擎距离主芯片仅约5厘米,只有这部分还需要铜线做电连接,基本可以说是全光的超节点。同时,Hi-ONE模组把光源直接封装进模组内部,实现内置光源。华为预计,未来两到三年内都很难有其他厂商能做出来。这是华为多年来在光电相关领域的积累,才得以实现和量产。 廖恒回忆道,在他职业生涯初期,20年多前就已经在讨论让芯片连接走向光学化。因为光的传输距离和衰减非常小,信号可以高速传输更远。 从电路角度看,Hi-ONE内部其实非常简单,器件并不多。但走向量产这条路,却走得非常艰难:光学技术涉及大量物理原理,温度稍微变化,就会影响二极管的物理特性,改变折射率,影响波导性能,导致无法正常工作。 廖恒认为,全光互联最大的障碍是对可靠性的担忧,因为器件会发生故障。目前大多数厂商选择外置光源路线,用单个光源馈送32路信号,功率就必须放大32倍。如此巨大的功率很容易引发许多问题,在耦合接口及其他各个环节都会出问题。华为选择内置光源方案,是出于工程上的务实选择,Hi-ONE正是经过多次权衡后达成的出色折中方案,很快将进入量产阶段。 问:关于昇腾芯片的工艺和产能问题,目前限制产能进一步释放的主要瓶颈是哪些环节?华为预计还需多久可以实现大规模稳定的算力芯片供应? 徐直军表示,中国的瓶颈问题与全球瓶颈问题基本一致。全球产业界都没有为AI如此浪涌式的发展做好准备。现在所有光模块公司、存储公司之所以能卖高价,并不是因为产品有多好,而是严重供不应求所致。因此,只有全球和中国同时达到供需平衡,瓶颈问题才能彻底结束。他预计全球的供需平衡差不多在2029年能得到解决,中国可能还要慢一点。这里的供需平衡,还要考虑AI发展过程中不断发生的技术变化,包括CPO、NPO等。 从华为的角度讲,相比过去的通信、IT产业,现在华为的供应量已具备相当规模;但如果和当前产业对AI基础设施的需求相比,规模确实又远远不够。要实现客户要多少就能供多少,华为要达成这个平衡,取决于整个中国产业界的平衡。 问:有报道说马来西亚正在考虑基于华为昇腾910C来部署主权AI,华为如何来平衡国内客户和海外客户的需求? 徐直军表示,从客户部署华为解决方案的选择来看,肯定是基于地缘政治和多供应商的考量。每个企业都要为其长远发展消除安全风险,因此昇腾必然是所有客户的一个选项,尽管相比竞争对手它还有差距。至于平衡国内与海外,华为的原则很简单:国内为主,优先供应急需算力的中国客户;海外则服务于少数买不到的客户,或一定要另一个选择的客户。 问:华为在NPO、CPO这两个技术路线上,当时内部选择或者博弈是什么? 徐直军表示,这个问题在华为好像没有过争论。因为华为既做光器件,又做光模块和昇腾芯片,清楚哪种情况才是最佳选择,所以华为很早就达成共识做NPO,没做CPO。而且他认为,在相当长时间里,从工程实现、成本、维护、良率等角度讲,NPO都是最佳选择。 经过产业界这几年关于NPO、CPO的辩论,从两次OIF的讨论来看,产业认知也在进一步清晰。OIF第一次讨论时,有一部分厂家不支持NPO,一心要搞CPO;而最近一次NPO立项时,反对的已经寥寥无几。相比CPO方案,NPO的铜线连接有5厘米左右,比CPO的5毫米左右要长一点,但带来了成本接近40%的下降,同时还带来另一个好处,即一旦光引擎出问题,不会把整个AI芯片一起报废。当然,CPO和NPO并不是谁消灭谁的问题,而是工程、成本、产业链、维护等各个方向上平衡的选择,没有对错。 因此,华为坚定不移走NPO的道路,推动产业界形成标准,全产业链共同把NPO发展好,但也不是说CPO不行。在OIF上NPO得到了40家产业链厂商的支持,应该来讲,大家也看到了NPO的好处。 问:模型厂商对于950DT用在模型训练上,给华为反馈了哪些需要改进的领域和问题?华为对大模型的预训练做了哪些芯片和底层方面的调整和优化? 廖恒表示,此前昇腾芯片遇到的第一个障碍其实并非硬件本身,而主要是生态壁垒。就在两年前,昇腾软件层面仍存在巨大障碍,而CUDA在这方面显然具有压倒性优势,因为整个学术界都是伴随CUDA成长起来的,所有算法开发者都已习惯了PyTorch加CUDA的便利。 但过去18个月发生了巨大变化。首先,模型的数学复杂程度发生了巨大变化,编程复杂度也随之增加。其次,模型正变得非常细粒度,这意味着无法再仅用PyTorch编写程序并保持效率。因此,即便是算法开发者,也必须转向超大规模内核的编程风格,需要新的编程语言,这已经是前沿实验室的发展方向。 如今,随着新的编译器语言出现,它们正在逐步取代并平衡CUDA的壁垒,前沿实验室已不再像两年前那样重视CUDA。这是软件层面的壁垒消解。廖恒认为,华为正在接近甚至达到平衡,差距已大幅缩小。 其次,关于芯片本身,华为拥有自身优势,正如廖恒讲到的UB和Nested BSP模型。这不仅是对单个芯片编程,更是以便捷的方式对大量芯片编程,华为正在提供这些能力。而在芯片内部,华为也吸取了此前的教训,做出了大量改进。 整体上,华为正在缩小英伟达与昇腾之间的差距。廖恒认为,如今主要差异已大幅缩小,当人们使用这些处理器开发时,不再感到陌生。 问:下周有可能中国和美国的元首会面会谈,有人说在AI人工智能方面两位国家元首也会谈一谈。作为中国的企业家,你期待两个国家达成什么样的合作? 徐直军表示,所有中国企业家都有一个共同心声——和平相处,不应以政府行为干扰市场竞争。企业家们都经历过全球化充分竞争的时代,企业靠创新、靠自己的产品赢得客户。但随着地缘政治影响急剧上升,全球化在慢慢远离。对企业而言,都希望做全球市场,都期望靠自己的创新和产品去赢得市场,而不是想买买不到、想卖卖不过去。 华为这三十多年来一直强调靠创新赢得市场,靠持续的压强式研发投入构筑产品竞争力、赢得客户。从2007年到2025年,华为累计研发投入超过1.8万亿人民币,其中还有10%持续投入基础研究。正是过去这种高强度研发投入、强调创新去构筑有竞争力的产品,从竞争中赢得市场,才走到今天。 关注通信业的媒体可能清楚华为过去几十年走过的路。今天的AI,华为也在走一条自己擅长、又能面向未来真正构筑竞争力的路。 问:关于UnifiedBus技术,这是国内在先进制程受限情况下走出的中国特色路线,还是未来全行业都可能的方向,英伟达也有可能往这个方向走吗? 徐直军认为,UB是一条创新之路,也是未来AI计算的必由之路。 因为只有UB这种互联技术,才能实现百万级处理器的巨大计算机。而上百万的处理器像一台计算机一样工作,才能真正实现更好、更高效率的训练和推理,所以它是必由之路。相信过不了几年,大家都会朝着这条路走。 华为之所以开放UB协议,就是因为相信整个产业界会朝着这条路线走。这样,为AI走向AGI,需整个产业界共同努力。廖博士之所以以论文形式公布Peerium计算架构,也是因为这一创新架构就是AI时代的计算架构。960只是节奏变快了,规格和徐直军去年讲的一样;HBM是在960里面的,没有HBM的进步,也没有960的进步。 今天UB互联技术是整个Peerium计算架构实现的基础。无论是UB互联技术还是Peerium计算架构,华为都认为是AI时代的未来之路。 徐直军多次讲过,在单芯片上,华为的设计没有任何问题,只是仍受制于国内的工艺。但将多芯片互联起来成为一台计算机,华为已经处于全球领先的地位。这是基于架构的创新和互联技术的创新,而且这些研究工作不是在制裁后才开始的,而是在制裁之前就开始了。第一颗AI芯片以及华为的整个AI战略,是徐直军在2018年HC大会上发布的;2019年,华为发布了超节点和集群。自那以后华为就认为,AI要支撑大规模的训练和推理,需要新的架构、新的互联技术,也是从那时开始不断投入研究、不断创新,才有了今天讲的创新计算架构和UB互联技术。 徐直军相信,现在产业界面临的问题都是一样的。在多卡计算系统中,MFU(模型浮点算力利用率)是很关键的指标。大模型训练过程中,突然一个卡故障,或一个卡性能忽然下降,都会对训练造成巨大损失。 基于UB互联技术、基于Peerium计算架构做出的超节点和集群,可以大幅提升MFU,这已经被验证了。这也是头部模型厂商采用昇腾950训练最喜欢的一点。华为还能提供原厂服务,让提升MFU更有保障,训练成本反而降低,训练迭代速度加快。 |
2026诺贝尔生理学或医学奖揭晓,三位科学家共享802万奖金 2026-10-06
10月4日晚ATP500中国网球公开赛男单四分之一决赛,德约科维奇逆转兹维列夫,达成中网32连胜并晋级半决赛。 ... [详细]
2026-10-06
德米纳尔在北京赛场逆转卢布列夫,获昵称不倒翁,展现超强逆转能力。同时,萨巴伦卡和莱巴金娜中网爆冷出局,引发网友热议,疑似敷衍应战。 ... [详细]
2026-10-06
2026中国·湛江·至德摩托车越野超级联赛暨城市生活文化周盛大启幕,集专业竞技、文旅体验与消费狂欢于一体,为国庆假期注入无限活力。 ... [详细]
2026-10-06
这是半佛仙人的第2102篇原创1假期不卷,随便写点。早上起床刷到这个新闻的时候,我突然觉得好像被天意操控了。我感觉很神圣,命运在召唤我。我觉得自己是时候成为马拉松网红了。 ... [详细]
啥病人看了这个都得好啊! 副标题 这胸是真的! 副标题 你赢了! 副标题 我是关心这是在哪里
乞丐装的最新境界! 副标题 买家你确定你不是阿宝?? 副标题 这裤子不敢坐下啊! 副标题 颜值
这鼠标垫你看到了什么?邪恶了吧! 副标题 毫无违和感! 副标题 小卖部的这女孩真会选呀! 副
女人真的不容易,怀孕后,内脏被挤压的严重,挺着大肚子干啥都不方便!近日,刘嘉姵和闺蜜集体拍
锤哥的替身也是辣么的帅气! 副标题 锤哥的替身好多啊! 副标题 你杀了你的替身,你可就没替
关于舌钉,一定是从欧美流传过来的朋克风,很多人喜欢在脸上、身上穿各种环,打各种钉,可能是
折耳根是一种在南方很常见的植物,北方人可能很少人知道折耳根是什么。下面就让我们先来
说到卢森堡这个国家,大家都知道这是一个比较小的国家,但是卢森堡的经济是相当的发达的,可