
芯东西(公众号:aichip001)
作家 | ZeR0
编著 | 漠影
芯东西7月26日报谈,谢天下东谈主工智能大会开幕前夜,国内GPU企业摩尔线程重磅露馅其圆善AI技能布局。
濒临生成式AI爆发下的大模子锻真金不怕火成果瓶颈,摩尔线程正通过系统级工程立异,构建新一代AI锻真金不怕火基础设施,为AGI时间打造分娩先进模子的“超等工场”。
这座“AI工场”的产能,由五大中枢要素的公式:
AI工场分娩成果 = 加快策画通用性 × 单芯片有用算力 × 单节点成果 × 集群成果 × 集群踏实性
伸开剩余94%摩尔线程创始东谈主兼CEO张建中示意,摩尔线程是国内少许数原生支执FP8的GPU厂商,亦然国内少许数具备FP8大模子锻真金不怕火的平台。
这座“AI工场”不仅有高效的模子锻真金不怕火,还具备极致的推理考证才略。基于自研MUSA技能栈,摩尔线程构建粉饰诳言语模子、视觉、生成类模子的全历程推连续决决议,打造终了“锻真金不怕火-考证-部署”的无缝衔尾。
左证现场演示,其旗舰产物MTT S5000满血跑DeepSeek R1模子推理,速率达到100 tokens/s,相称快,也曾达到行业首先。
摩尔线程还重磅预热:将于本年10月举办首届MUSA修复者大会,邀公共修复者共建生态。
一、打造先进AI工场,摩尔线程解密五大中枢要素
前沿AI模子正以惊东谈主的速率迭代,从GPT系列、Gemini到DeepSeek、Qwen的快速更新,模子锻真金不怕火迭代时辰已缩小至不及3个月。丰富的模子,快速的更新,对新一代高性能AI策画基础设施提议广漠条款。
对此,摩尔线程提议“AI工场”,要终了从底层芯片架构立异、集群举座架构的优化到软件算法调优和资源退换系统的全面升级,以鼓励AI锻真金不怕火从千卡级向万卡级乃至十万卡级范畴演进。
摩尔线程以全功能GPU通用算力为基石,通过先进架构、芯片算力、单节点成果、集群成果优化、可靠性等协同跃升的深度技能立异,旨在将全功能GPU加快策画平台的坚硬潜能,出动为工程级的锻真金不怕火成果与可靠性保险。
1、全功能GPU,终了加快策画通用性
策画功能的完备性与精度圆善性是撑执多元场景的中枢基石。
摩尔线程以自主研发的全功能GPU为中枢,构建了“功能完备”与“精度圆善”的通用性底座,全面粉饰从AI锻真金不怕火、推理到科学策画的全场景需求。
(1)单芯片粉饰多场景:基于MUSA架构的碎裂性遐想,GPU单芯片即可集成AI策画加快(训推一体)、图形渲染(2D+3D)、物理仿真和科学策画、超高清视频编解码才略,充分适配AI训推、具身智能、AIGC等各种化应用场景。
(2)精度竖立行业标杆:支执从FP64至INT8的圆善精度谱系,原生支执FP8大模子锻真金不怕火及推理,并通过FP8搀和精度技能,在主流前沿大模子锻真金不怕火中终了20%~30%的性能跃升,为国产GPU的算力成果竖立行业标杆。
(3)前瞻支执模子演进:技能体系不仅餍足大模子时间的高效策画需求,更为天下模子和新兴AI架构的演化提供前瞻性撑执。
2、自研MUSA架构,进步单芯片有用算力
摩尔线程基于自研MUSA架构,通过策画、内存、通讯三重碎裂,显耀进步单GPU运算成果。
(1)立异架构碎裂传统圆寂:取舍立异的全功能、多引擎、可设立、可伸缩GPU架构,通过硬件资源池化及动态资源退换技能,构建了全局分享的策画、内存与通讯资源池,允许面向标的阛阓快速编著出优化的芯片设立,大幅胁制了新品芯片的修复老本,在保险通用性的同期显耀进步了资源期骗率。
(2)策画性能显耀进步:AI加快系统(TCE/TME)全面支执INT8/FP8/FP16/BF16/TF32等多种搀和精度策画。其中FP8技能通过快速模样改动、动态范围智能适配、高精度累加器等立异遐想,在保证策画精度的同期,将Transformer策画性能进步约30%。
(3)内存优化:通过多精度近存规约引擎、低延伸Scale-Up、通算并行资源守密等技能,内存系统终澄澈50%的带宽圣洁和60%的延伸胁制,有用进步数据传输才略。
(4)通讯成果优化:创始的ACE异步通讯引擎减少了15%的策画资源损耗;MTLink2.0互连技能提供了首先洋内行业平均水平60%的带宽,为大范畴集群部署奠定了坚实基础。
3、MUSA全栈系统软件,进步单节点策画成果
摩尔线程通过MUSA全栈系统软件终了时弊技能碎裂,鼓励AI工场从单点立异转向系统级效用进步。其中枢立异包括:
(1)任务退换优化:核函数启动(Kernel Launch)时辰缩小50%。
(2)极致性能算子库:GEMM算子算力期骗率达98%,Flash Attention算子算力期骗率碎裂95%。
(3)通讯效用进步:MCCL通讯库终了RDMA网络97%带宽期骗率;基于异步通讯引擎优化策画通讯并行,集群性能进步10%。
(4)低精度策画成果矫正:FP8优化与行业创始细粒度重策画技能,显耀胁制锻真金不怕火支拨。
(5)修复生态完善:基于Triton-MUSA编译器 + MUSA Graph终了DeepSeek-R1推理加快1.5倍,全面兼容Triton等主流框架。
4、自研KUAE策画集群,优化集群成果
单节点成果达到新高度后,下一个挑战是怎样终了大范畴集群的高效互助。
摩尔线程自研KUAE策画集群通过5D大范畴散播式并行策画技能,终了上千节点的高效互助,鼓励AI基础设施从单点优化迈向系统工程级碎裂。
(1)立异5D并行锻真金不怕火:整合数据、模子、张量、活水线和大众并行技能,全面支执Transformer等主流架构,显耀进步大范畴集群锻真金不怕火成果。
(2)性能仿真与优化:自研Simumax器具面向超大范畴集群自动搜索最优并行政策,精确模拟FP8搀和精度锻真金不怕火与算子和会,为DeepSeek等模子缩小锻真金不怕火周期提供科学依据。
(3)秒级备份归附:针对大模子踏实性贫瘠,立异CheckPoint加快决议期骗RDMA技能,将百GB级备份归附时辰从数分钟压缩至1秒,进步GPU有用算力期骗率。
基于平湖架构KUAE2智算集群,不管千卡或更大范畴,在每个应用场景都能作念到比海外主流产物更高的性能和成果,达到行业首先水平。
5、零中断容错技能,进步集群的踏实性和可靠性
在构建高效集群的基础上,踏实可靠的运行环境是“AI工场”执续产出的保险。额外在万卡级AI集群中,硬件故障导致的锻真金不怕火中断会严重糟践算力。
摩尔线程立异推出零中断容错技能,故障发生时仅守密受影响节点组,其余节点不竭锻真金不怕火,备机无缝接入,全程无中断。这一决议使KUAE集群有用锻真金不怕火时辰占比超99%,大幅胁制归附支拨。
同期,KUAE集群通过多维度锻真金不怕火知悉体系终了动态监测与智能会诊,极端处理成果进步50%,让用户看得见和管制得到每一个锻真金不怕火集群的每一派GPU;皆集集群巡检与升起搜检,锻真金不怕火收效率提高10%,为大范畴AI锻真金不怕火提供踏实保险。
二、MUSA软件栈怎样助力KUAE集群?三大亮点技能详解
摩尔线程GPU策画软件修复总监吴庆分享了MUSA软件栈的主要亮点技能。
1、MUSA驱动和运行时库,KUAE集群坚实底座
推理场景对Kernel延时相称敏锐。极致高效的MUSA驱动和运行时库,具有高成果的任务退换才略,使用户的Kernel launch支拨极致缩减。
(1)即时任务下发:通过软硬协同,将核函数启动延伸胁制到业界平均水平的1/2。
(2)批量任务下发:批量下发策画和通讯任务,快要千次下发支拨优化为单次,减少GPU恭候时辰。
(3)引擎间依赖认知:GPU是多引擎可设立的,不同引擎之间要作念依赖认知、交互同步,平湖支执硬件认知引擎间的依赖作念同步,不再回到host,任务流之间的依赖认知延时不错大幅胁制至1.5μs,优于业界头部算力卡。
(4)调优器具接口MUPTI:特意用于性能分析和事件跟踪,匡助修复者优化MUSA应用措施,可基于MUPTI修复第三方的各式丰富器具。
(5)GPU失实转存功能(GPU Core Dump,GCD):高效定位疑难Bug,不需要去退换遍及的集群和东谈主力反复去复现“好景不常”的失实,用于在GPU措施崩溃或发生失及时生成肃肃的信息(肖似CPU措施Core Dump),精确保存失实,提供一个log,极大进步MUSA核函数崩溃、不法显存地址打听、硬件失实等问题定位的成果。
2、MUSA算子库生态日趋完善,性能与广度兼备
算子库的成果胜仗关乎散播式集群的锻真金不怕火成果。MUSA算子库不仅追求极致性能,还兼容粉饰广度和兼容性。
MUSA算子库生态会提供三大算子库:极致性能muDNN、易用MUTLASS、MUSA AI Tensor Engine开源推理算子库。
muDNN,是一款极致性能的开箱即用模范算子库,圆善粉饰常见的前向和反向算子。其中最主要的特点是支执圆善的XMMA,支执Tensor Core全精度及扫数目化阵势,以及常用的神经网络算子操作。
一般来说,矩阵乘的成果大部分不错作念到90%以上,摩尔线程muDNN矩阵乘算子成果不错作念到98%。Flash Attention算子因为多了softmax等操作,基于国际一活水平厂商的Flash Attention 3论文里提到的成果约莫是75%,muDNN的Flash Attention不错作念到95%。
影响FP8 GEMM算子成果的广漠要素是scale阵势,scale是为了幸免精度失掉作念的一个良好化的缩放因子,常见的有Per-Tensor、Per-Block,DeepSeek V3用的是Per-Block。
吴庆打了个譬如,Per-Tensor scale是通盘张量共用一个缩放因子,尽头于一面墙刷一个神态,很好刷;Per-Block scale则是每个小的矩阵块共用一个缩放因子,尽头于一面墙有许多小方块,每个方块单唯独个神态,刷墙的复杂度要高许多,会比一个神态刷一面墙成果低10%-20%。
摩尔线程通过软硬协同的深度算法优化、请示编排,作念到了Per-Block跟Per-Tensor FP8 GEMM策画成果险些尽头,差距不到2%。
MUTLASS,是一个高性能的线性代数模板库,可极大胁制在MUSA环境中自界说算子的修复使命量,尽头于提供了一个可供二次修复的模板。
MUTLASS已在Github上开源,支执平湖架构扫数特点,包括Warp-level MMA、WarpSquad-level MMA、TensorMemoryEngine、AsyncBarrier等原语全面支执,同期提供高性能矩阵乘、卷积算子终了,可在Kernel里调用模板库就不错进行二次修复,摩尔线程也提供Attention最优化的示例,给用户打样,不错参考提供的最好履行,去修复自界说的各式Attention的变种。
MUSA AI Tensor Engine,是摩尔线程行将发布的面向诳言语模子的开源推理算子库,可匡助修复者快速搭建自界说推理引擎。
MUSA AI Tensor Engine,是摩尔线程行将发布的面向诳言语模子的开源推理算子库,可匡助修复者快速搭建自界说推理引擎。 该算子库提供用户友好的Python API,进一步胁制修复者使用门槛,无需花太多时辰学习MUSA C,只消会Python就不错把MTX这个库用起来;将来会支执丰富的后端,包括模板库,对标PTX捏造请示集去修复的极致算子库,也支执类Triton的DSL。
3、高性能聚拢通讯库及通算并行,幸免通讯霸占策画中枢资源
大模子散播式锻真金不怕火的主要瓶颈是通讯。摩尔线程在MTT S5000上支执MTLINK 2.0,配备GPU异步通讯引擎,终澄澈高性能通讯技能与策画高度并行。
最近十几年,跟着模子范畴加多,散播式集群范畴也在加多,通讯瓶颈会越来越赫然。DeepSeek V3呈文中号召硬件厂商提供的芯片能不可作念一个单独的通讯硬件来卸载通讯,幸免通讯跟策画去抢SM策画单位。
平湖遐想阶段远早于DeepSeek V3发布的时辰,彼时摩尔线程已知悉到行业痛点,并提供了处理决议——在GPU上加多了一个异步通讯引擎。
MTT S5000就业器拓扑每节点有8张GPU,通过MTLINK 2.0全互连,每张GPU与其他7张GPU都有直连总线。
每个GPU上设立的异步通讯引擎是原生支执丰富的reduce操作,支执常用的reduce操作有ADD、MIN、MAX(累加、最小值、最大值)等操作,支执Float、FP16、BF16等数据类型,可胜仗通过MTLink进行C2C跨系统的数据通讯。
其ACE通过Zero Copy技能进一步进步性能。一般的聚拢通讯会把数据buffer拷贝到通讯buffer里,再去进行C2C通讯。Zero Copy则幸免了在腹地上的D2D的拷贝,胜仗把数据buffer作念跨卡通讯。
摩尔线程在测度聚拢通讯库性能的时候主如若两大中枢标的:通讯延伸、通讯带宽。
基于全互联(FC8)拓扑的高效通讯算法,可大幅胁制通讯延伸。全互联拓扑中GPU两两互连,在All Reduce场景中不错把其他GPU的数据一次性拿过来,表面上FC8算法比较Ring算法,7步通讯可酿成1步完成。在单机8卡All Reduce延伸场景的实测也差未几,Ring算法大致是53us,用FC8算法可胁制至7.8us,快要缩减至1/7,显耀进步了模子推感性能。
带宽方面,Ring算法与FC8算法成果尽头,以Ring算法为例,摩尔线程把FC8拆成了7个通讯环,每个通讯环皆集通讯Kernel的优化,基于MTLink2.0 + FC8拓扑,节点内充分期骗全互联的拓扑上风,可作念到单机8卡All Reduce带宽期骗率接近85%,与国际第一的厂商在软件成果上对皆,终了高效的Scale-up通讯。
高效Scale-out跨节点通讯方面,摩尔线程皆集通讯库作念了网卡拓扑感知与自顺应优化,每个GPU都能在PCIe拓扑上找到延伸和带宽成果最高的网卡端口进行RDMA通讯,还额外修复了一个插件Smart NIC Adaptor,在设立4张双口网卡时,可终了和8张单口网卡相似的RDMA通讯成果。
经测试,其All Reduce带宽不错作念到194GB/s,RDMA通讯带宽期骗率达到97%,而一般RDMA通讯带宽期骗率约在80%-85%。
除了延伸和带宽以外,摩尔线程还作念了异步通讯引擎的通讯优化。
MPC是策画中枢。传统作念法是通讯也走MPC,就要分走一部分的策画单位。ACE则不错把通讯部分卸载到单独的通讯引擎上,不跟MPC抢策画资源,同期在无数据依赖时透顶作念到overlap,通过优化,皆集MT Transformer Engine,在Llama模子上端到端策画通讯性能可进步10%支配。
三、基于FP8的国产万卡锻真金不怕火,摩尔线程软硬件怎样撑起行业需求?
摩尔线程副总裁王华给基于FP8的国产万卡锻真金不怕火划了3个重心:
1、大模子锻真金不怕火需要更坚硬的智算集群;2、低精度可有用进步锻真金不怕火成果;3、可靠性对大范畴锻真金不怕火至关广漠。
大模子需要大集群已是行业共鸣,无用赘述。
用更低精度的数据类型进行锻真金不怕火,尽头于终澄澈算力翻倍。精度胁制一半,能带来的上风是算力翻倍,显存占用、显存带宽、传输带宽浮滥减半。
但低精度替换只可部分进行,无法透顶替代。一些精度敏锐模样,如非线性函数/归一化操作,仍需保留高精度策画。
从技能演进来看,精度模样正沿着FP32→TF32→FP16/BF16→FP8的旅途发展。近两年,FP8锻真金不怕火技能得回多项证据。
DeepSeek-V3使用了FP8搀和精度锻真金不怕火,主要政策有:前向和后向传播的3次GEMM使用FP8,激活值的缓存和传输使用FP8,Embedding、激活函数等模块使用高精度浮点数,主权重、权重梯度、优化器气象使用高精度浮点数。
摩尔线程的全功能GPU,是率先支执FP8的国产GPU,对FP8的锻真金不怕火提供了软硬件支执,基于摩尔线程软件栈,收效复现了DeepSeek-V3满血版锻真金不怕火。
其软件栈开源了3个组件:
(1)提供MUSA后端加快支执的Torch-MUSA:PyTorch的MUSA插件,最新版块率先在国产GPU上终澄澈对FP8数据类型的圆善支执。
(2)搀和并行锻真金不怕火框架MT-MegatronLM:支执FP8搀和精度锻真金不怕火、高性能muDNN库和MCCL通讯库。
(3)MT-TransformerEngine:主要用于Transformer的高效锻真金不怕火和推理优化,支执FP8搀和精度锻真金不怕火,通过算子和会、并行加快等技能进步训推成果。
经实验,基于摩尔线程KUAE集群,在Llama3 8B、Qwen、DeepSeek-V2 16B、DeepSeek-V3 30B上,取舍FP8搀和锻真金不怕火不错带来20%~30%的性能进步,且引入FP8前后loss弧线基本一致。在取舍FP8锻真金不怕火方面,摩尔线程GPU策画卡与国际主流策画卡的精度对比基本吻合。
在Scaling Factor的取舍上,摩尔线程也作念了许多探索,举例:amax的统计信息标明,Per-Tensor的Scaling Factor适应取舍Delayed Scaling政策,而Per-Block则适应取舍JIT Scaling政策。
摩尔线程还用自家GPU策画卡作念了Smooth SwiGLU论文的复现,发现通过Smooth SwiGLU不错有用胁制outlier的影响。
此外,摩尔线程开源的模拟仿真器Simumax可用于大范畴集群锻真金不怕火,支执多种并行政策、多种模子架构、各式优化政策以及并行政策、超参、优化政策的自动扫描。
临了,大范畴集群锻真金不怕火的可靠性相称广漠。
摩尔线程作念了许多关系使命,进行全生命周期管制监控:
(1)锻真金不怕火搜检(升起、翱游、落地):升起搜检是在锻真金不怕火运行前,对硬软件和通讯的搜检,自动替换故障节点;翱游搜检中,发现锻真金不怕火亚健康问题;落地搜检是停掉锻真金不怕火后,定位故障节点,索求故障凹凸文。
(2)慢节点探伤:散播式锻真金不怕火中慢节点会拖慢通盘锻真金不怕火的速率;升起搜检阶段节点两两配对,搜检小负载的扩充时辰;锻真金不怕火阶段统计每个节点策画和通讯扩充的时辰。
(3)容错锻真金不怕火:大范畴锻真金不怕火场景使用遍及节点,会导致锻真金不怕火故障率指数级升高;同步阵势转成异步阵势,单节点故障就不会影响举座锻真金不怕火;还有高效的故障发现与归附机制。
结语:国产AI策画基础设施,已具备范畴化、高成果、高可靠模子分娩才略
摩尔线程以打造先进的“AI工场”为标的,凭借全功能GPU的通用策画才略、立异的MUSA架构、优化的MUSA软件栈、自研的KUAE集群、零中断容错技能五大中枢要素,构建起高效的“AI工场”,为AI大模子锻真金不怕火提供了坚硬而可靠的基础设施支执。
“唯独这么的组合,才能确保每一个模样都作念到最好,100% X 100% X 100%,才能确保100%的收效率,亦然业界最好的成果。”张建中说。
依托AI工场,摩尔线程收效构建起粉饰”锻真金不怕火-推理-部署”全历程的高效体系。这符号着国产策画基础设施,已具备撑执AGI时间范畴化、高成果、高可靠模子分娩的时弊才略。
从图形渲染基石到AI算力引擎,摩尔线程正以“KUAE+MUSA”为智算业务中枢星kong体育网,鼓励全功能GPU驱动的AI技能在物理仿真、AIGC、科学策画、具身智能、智能体、医疗影像分析、工业大模子等时弊领域的应用与部署。
发布于:北京市