面對英偉達挑戰，國產AI算力難題如何破解？

環球網 · 07/04 13:50

来源：信阳日报

7月3日，上海——摩尔线程重磅宣布其AI旗舰产品夸娥（KUAE）智算集群解决方案实现重大升级，从当前的千卡级别大幅扩展至万卡规模。摩尔线程夸娥（KUAE）万卡智算集群，以全功能GPU为底座，旨在打造国内领先的、能够承载万卡规模、具备万P级浮点运算能力的国产通用加速计算平台，专为万亿参数级别的复杂大模型训练而设计。这一里程碑式的进展，树立了国产GPU技术的新标杆，有助于实现国产智算集群计算能力的全新跨越，将为我国人工智能领域技术与应用创新、科研攻坚和产业升级提供坚实可靠的关键基础设施。

此外，摩尔线程联合中国移动通信集团青海有限公司、中国联通青海公司、北京德道信科集团、中国能源建设股份有限公司总承包公司、桂林华崛大数据科技有限公司（排名不分先后）分别就三个万卡集群项目进行了战略签约，多方聚力共同构建好用的国产GPU集群。

摩尔线程创始人兼CEO张建中表示：“当前，我们正处在生成式人工智能的黄金时代，技术交织催动智能涌现，GPU成为加速新技术浪潮来临的创新引擎。摩尔线程矢志投身于这一历史性的创造进程，致力于向全球提供加速计算的基础设施和一站式解决方案，为融合人工智能和数字孪生的数智世界打造先进的加速计算平台。夸娥万卡智算集群作为摩尔线程全栈AI战略的一块重要拼图，可为各行各业数智化转型提供澎湃算力，不仅有力彰显了摩尔线程在技术创新和工程实践上的实力，更将成为推动AI产业发展的新起点。”

AI主战场，万卡通用算力是标配

大模型自问世以来，关于其未来的走向和发展趋势亟待时间验证，但从当前来看，几种演进趋势值得关注，使得其对算力的核心需求也愈发明晰。

首先，Scaling Law将持续奏效。Scaling Law自2020年提出以来，已揭示了大模型发展背后的“暴力美学”，即通过算力、算法、数据的深度融合与经验积累，实现模型性能的飞跃，这也成为业界公认的将持续影响未来大模型的发展趋势。Scaling Law将持续奏效，需要单点规模够大并且通用的算力才能快速跟上技术演进。

其次，Transformer架构不能实现大一统，和其他架构会持续演进并共存，形成多元化的技术生态。生成式AI的进化并非仅依赖于规模的简单膨胀，技术架构的革新同样至关重要。Transformer架构虽然是当前主流，但新兴架构如Mamba、RWKV和RetNet等不断刷新计算效率，加快创新速度。随着技术迭代与演进，Transformer架构并不能实现大一统，从稠密到稀疏模型，再到多模态模型的融合，技术的进步都展现了对更高性能计算资源的渴望。

与此同时，AI、3D和HPC跨技术与跨领域融合不断加速，推动着空间智能、物理AI和AI 4Science、世界模型等领域的边界拓展，使得大模型的训练和应用环境更加复杂多元，市场对于能够支持AI+3D、AI+物理仿真、AI+科学计算等多元计算融合发展的通用加速计算平台的需求日益迫切。

多元趋势下，AI模型训练的主战场，万卡已是标配。随着计算量不断攀升，大模型训练亟需超级工厂，即一个“大且通用”的加速计算平台，以缩短训练时间，实现模型能力的快速迭代。当前，国际科技巨头都在通过积极部署千卡乃至超万卡规模的计算集群，以确保大模型产品的竞争力。随着模型参数量从千亿迈向万亿，模型能力更加泛化，大模型对底层算力的诉求进一步升级，万卡甚至超万卡集群成为这一轮大模型竞赛的入场券。

然而，构建万卡集群并非一万张GPU卡的简单堆叠，而是一项高度复杂的超级系统工程。它涉及到超大规模的组网互联、高效率的集群计算、长期稳定性和高可用性等诸多技术难题。这是难而正确的事情，摩尔线程希望能够建设一个规模超万卡、场景够通用、生态兼容好的加速计算平台，并优先解决大模型训练的难题。

夸娥：国产万卡万P万亿大模型训练平台

夸娥（KUAE）是摩尔线程智算中心全栈解决方案，是以全功能GPU为底座，软硬一体化、完整的系统级算力解决方案，包括以夸娥计算集群为核心的基础设施、夸娥集群管理平台（KUAE Platform）以及夸娥大模型服务平台（KUAE ModelStudio），旨在以一体化交付的方式解决大规模GPU算力的建设和运营管理问题。

基于对AI算力需求的深刻洞察和前瞻性布局，摩尔线程夸娥智算集群可实现从千卡至万卡集群的无缝扩展，旨在满足大模型时代对于算力“规模够大+计算通用+生态兼容”的核心需求，通过整合超大规模的GPU万卡集群、极致的计算效率优化以及高度稳定的运行环境，以万卡智算集群的新超级工程，重新定义国产集群计算能力的新标准。

夸娥万卡智算解决方案具备多个核心特性：

超大算力，万卡万P：在集群计算性能方面，全新一代夸娥智算集群实现单集群规模超万卡，浮点运算能力达到10Exa-Flops，大幅提升单集群计算性能，能够为万亿参数级别大模型训练提供坚实算力基础。同时，在GPU显存和传输带宽方面，夸娥万卡集群达到PB级的超大显存总容量、每秒PB级的超高速卡间互联总带宽和每秒PB级超高速节点互联总带宽，实现算力、显存和带宽的系统性协同优化，全面提升集群计算性能。

超高稳定，月级长稳训练：稳定性是衡量超万卡集群性能的关键。在集群稳定性方面，摩尔线程夸娥万卡集群平均无故障运行时间超过15天，最长可实现大模型稳定训练30天以上，周均训练有效率在99%以上，远超行业平均水平。这得益于摩尔线程自主研发的一系列可预测、可诊断的多级可靠机制，包括：软硬件故障的自动定位与诊断预测实现分钟级的故障定位，Checkpoint多级存储机制实现内存秒级存储和训练任务分钟级恢复以及高容错高效能的万卡集群管理平台实现秒级纳管分配与作业调度。

极致优化，超高MFU：MFU是评估大模型训练效率的通用指标，可以直接反应端到端的集群训练效率。夸娥万卡集群在系统软件、框架、算法等层面一系列优化，实现大模型的高效率训练，MFU最高可达到60%。其中，在系统软件层面，基于极致的计算和通讯效率优化等技术手段，大幅提升集群的执行效率和性能表现。在框架和算法层面，夸娥万卡集群支持多种自适应混合并行策略与高效显存优化等，可以根据应用负载选择并自动配置最优的并行策略，大幅提升训练效率和显存利用。同时，针对超长序列大模型，夸娥万卡集群通过CP并行、RingAttention等优化技术，有效缩减计算时间和显存占用，大幅提升集群训练效率。

全能通用，生态友好：夸娥万卡集群是一个通用加速计算平台，计算能力为通用场景设计，可加速LLM、MoE、多模态、Mamba等不同架构、不同模态的大模型。同时，基于高效易用的MUSA编程语言、完整兼容CUDA能力和自动化迁移工具Musify，加速新模型“Day0”级迁移，实现生态适配“Instant On”，助力客户业务快速上线。

万众一芯，共建大模型应用生态

万卡集群的建设需要产业界的齐心协力，为实现大模型创新应用的快速落地，让国产算力“为用而建”。发布会现场，摩尔线程携手中国移动通信集团青海有限公司、中国联通青海公司、北京德道信科集团、中国能源建设股份有限公司总承包公司、桂林华崛大数据科技有限公司（排名不分先后），分别就青海零碳产业园万卡集群项目、青海高原夸娥万卡集群项目、广西东盟万卡集群项目进行了战略签约。

借助摩尔线程先进的夸娥全栈智算解决方案，各方将携手共建强大的全国产智算平台，以加速产业数字化转型和高质量发展。夸娥万卡智算集群项目标志着国产AI算力基础设施的又一重大进展，将为各地的数字经济发展注入新活力。

图注：摩尔线程与中国移动通信集团青海有限公司战略签约

图注：摩尔线程与中国联通青海公司、北京德道信科集团战略签约

图注：摩尔线程与中国能源建设股份有限公司总承包公司、桂林华崛大数据科技有限公司战略签约

发布会后，无问芯穹、清程极智、360、京东云、智平方等五家合作伙伴代表纷纷登台，分享了摩尔线程夸娥智算集群如何助力其在大模型训练、大模型推理、具身智能等不同场景和领域的创新，展现了夸娥智算集群在实际应用中的巨大潜力与广泛适用性。

摩尔线程愿与广大行业伙伴并肩同行，发挥全栈AI的力量，加速推动一个由万卡智算集群为强大底座，多领域伙伴共建、广泛赋能数字经济的国产智算生态，共同开启一个属于大模型与生成式人工智能的新时代，为美好世界加速。在WAIC期间，摩尔线程将在上海世博展览馆（H2馆D616）开展“全栈AI 为美好世界加速”的主题成果展示，包括加速卡、服务器、超融合一体机和AIGC应用在内的摩尔线程全栈AI产品悉数亮相，并携手众多行业合作伙伴联合展示基于夸娥智算集群的丰富行业大模型与应用方案。

來源：信陽日報

7月3日，上海——摩爾線程重磅宣佈其AI旗艦產品誇娥（KUAE）智算集群解決方案實現重大升級，從當前的千卡級別大幅擴展至萬卡規模。摩爾線程誇娥（KUAE）萬卡智算集群，以全功能GPU爲底座，旨在打造國內領先的、能夠承載萬卡規模、具備萬P級浮點運算能力的國產通用加速計算平台，專爲萬億參數級別的複雜大模型訓練而設計。這一里程碑式的進展，樹立了國產GPU技術的新標杆，有助於實現國產智算集群計算能力的全新跨越，將爲我國人工智能領域技術與應用創新、科研攻堅和產業升級提供堅實可靠的關鍵基礎設施。

此外，摩爾線程聯合中國移動通信集團青海有限公司、中國聯通青海公司、北京德道信科集團、中國能源建設股份有限公司總承包公司、桂林華崛大數據科技有限公司（排名不分先後）分別就三個萬卡集群項目進行了戰略簽約，多方聚力共同構建好用的國產GPU集群。

摩爾線程創始人兼CEO張建中表示：“當前，我們正處在生成式人工智能的黃金時代，技術交織催動智能湧現，GPU成爲加速新技術浪潮來臨的創新引擎。摩爾線程矢志投身於這一歷史性的創造進程，致力於向全球提供加速計算的基礎設施和一站式解決方案，爲融合人工智能和數字孿生的數智世界打造先進的加速計算平台。誇娥萬卡智算集群作爲摩爾線程全棧AI戰略的一塊重要拼圖，可爲各行各業數智化轉型提供澎湃算力，不僅有力彰顯了摩爾線程在技術創新和工程實踐上的實力，更將成爲推動AI產業發展的新起點。”

AI主戰場，萬卡通用算力是標配

大模型自問世以來，關於其未來的走向和發展趨勢亟待時間驗證，但從當前來看，幾種演進趨勢值得關注，使得其對算力的核心需求也愈發明晰。

首先，Scaling Law將持續奏效。Scaling Law自2020年提出以來，已揭示了大模型發展背後的“暴力美學”，即通過算力、算法、數據的深度融合與經驗積累，實現模型性能的飛躍，這也成爲業界公認的將持續影響未來大模型的發展趨勢。Scaling Law將持續奏效，需要單點規模夠大並且通用的算力才能快速跟上技術演進。

其次，Transformer架構不能實現大一統，和其他架構會持續演進並共存，形成多元化的技術生態。生成式AI的進化並非僅依賴於規模的簡單膨脹，技術架構的革新同樣至關重要。Transformer架構雖然是當前主流，但新興架構如Mamba、RWKV和RetNet等不斷刷新計算效率，加快創新速度。隨着技術迭代與演進，Transformer架構並不能實現大一統，從稠密到稀疏模型，再到多模態模型的融合，技術的進步都展現了對更高性能計算資源的渴望。

與此同時，AI、3D和HPC跨技術與跨領域融合不斷加速，推動着空間智能、物理AI和AI 4Science、世界模型等領域的邊界拓展，使得大模型的訓練和應用環境更加複雜多元，市場對於能夠支持AI+3D、AI+物理仿真、AI+科學計算等多元計算融合發展的通用加速計算平台的需求日益迫切。

多元趨勢下，AI模型訓練的主戰場，萬卡已是標配。隨着計算量不斷攀升，大模型訓練亟需超級工廠，即一個“大且通用”的加速計算平台，以縮短訓練時間，實現模型能力的快速迭代。當前，國際科技巨頭都在通過積極部署千卡乃至超萬卡規模的計算集群，以確保大模型產品的競爭力。隨着模型參數量從千億邁向萬億，模型能力更加泛化，大模型對底層算力的訴求進一步升級，萬卡甚至超萬卡集群成爲這一輪大模型競賽的入場券。

然而，構建萬卡集群並非一萬張GPU卡的簡單堆疊，而是一項高度複雜的超級系統工程。它涉及到超大規模的組網互聯、高效率的集群計算、長期穩定性和高可用性等諸多技術難題。這是難而正確的事情，摩爾線程希望能夠建設一個規模超萬卡、場景夠通用、生態兼容好的加速計算平台，並優先解決大模型訓練的難題。

誇娥：國產萬卡萬P萬億大模型訓練平台

誇娥（KUAE）是摩爾線程智算中心全棧解決方案，是以全功能GPU爲底座，軟硬一體化、完整的系統級算力解決方案，包括以誇娥計算集群爲核心的基礎設施、誇娥集群管理平台（KUAE Platform）以及誇娥大模型服務平台（KUAE ModelStudio），旨在以一體化交付的方式解決大規模GPU算力的建設和運營管理問題。

基於對AI算力需求的深刻洞察和前瞻性佈局，摩爾線程誇娥智算集群可實現從千卡至萬卡集群的無縫擴展，旨在滿足大模型時代對於算力“規模夠大+計算通用+生態兼容”的核心需求，通過整合超大規模的GPU萬卡集群、極致的計算效率優化以及高度穩定的運行環境，以萬卡智算集群的新超級工程，重新定義國產集群計算能力的新標準。

誇娥萬卡智算解決方案具備多個核心特性：

超大算力，萬卡萬P：在集群計算性能方面，全新一代誇娥智算集群實現單集群規模超萬卡，浮點運算能力達到10Exa-Flops，大幅提升單集群計算性能，能夠爲萬億參數級別大模型訓練提供堅實算力基礎。同時，在GPU顯存和傳輸帶寬方面，誇娥萬卡集群達到PB級的超大顯存總容量、每秒PB級的超高速卡間互聯總帶寬和每秒PB級超高速節點互聯總帶寬，實現算力、顯存和帶寬的系統性協同優化，全面提升集群計算性能。

超高穩定，月級長穩訓練：穩定性是衡量超萬卡集群性能的關鍵。在集群穩定性方面，摩爾線程誇娥萬卡集群平均無故障運行時間超過15天，最長可實現大模型穩定訓練30天以上，周均訓練有效率在99%以上，遠超行業平均水平。這得益於摩爾線程自主研發的一系列可預測、可診斷的多級可靠機制，包括：軟硬件故障的自動定位與診斷預測實現分鐘級的故障定位，Checkpoint多級存儲機制實現內存秒級存儲和訓練任務分鐘級恢復以及高容錯高效能的萬卡集群管理平台實現秒級納管分配與作業調度。

極致優化，超高MFU：MFU是評估大模型訓練效率的通用指標，可以直接反應端到端的集群訓練效率。誇娥萬卡集群在系統軟件、框架、算法等層面一系列優化，實現大模型的高效率訓練，MFU最高可達到60%。其中，在系統軟件層面，基於極致的計算和通訊效率優化等技術手段，大幅提升集群的執行效率和性能表現。在框架和算法層面，誇娥萬卡集群支持多種自適應混合並行策略與高效顯存優化等，可以根據應用負載選擇並自動配置最優的並行策略，大幅提升訓練效率和顯存利用。同時，針對超長序列大模型，誇娥萬卡集群通過CP並行、RingAttention等優化技術，有效縮減計算時間和顯存佔用，大幅提升集群訓練效率。

全能通用，生態友好：誇娥萬卡集群是一個通用加速計算平台，計算能力爲通用場景設計，可加速LLM、MoE、多模態、Mamba等不同架構、不同模態的大模型。同時，基於高效易用的MUSA編程語言、完整兼容CUDA能力和自動化遷移工具Musify，加速新模型“Day0”級遷移，實現生態適配“Instant On”，助力客戶業務快速上線。

萬衆一芯，共建大模型應用生態

萬卡集群的建設需要產業界的齊心協力，爲實現大模型創新應用的快速落地，讓國產算力“爲用而建”。發佈會現場，摩爾線程攜手中國移動通信集團青海有限公司、中國聯通青海公司、北京德道信科集團、中國能源建設股份有限公司總承包公司、桂林華崛大數據科技有限公司（排名不分先後），分別就青海零碳產業園萬卡集群項目、青海高原誇娥萬卡集群項目、廣西東盟萬卡集群項目進行了戰略簽約。

藉助摩爾線程先進的誇娥全棧智算解決方案，各方將攜手共建強大的全國產智算平台，以加速產業數字化轉型和高質量發展。誇娥萬卡智算集群項目標誌着國產AI算力基礎設施的又一重大進展，將爲各地的數字經濟發展注入新活力。

圖注：摩爾線程與中國移動通信集團青海有限公司戰略簽約

圖注：摩爾線程與中國聯通青海公司、北京德道信科集團戰略簽約

圖注：摩爾線程與中國能源建設股份有限公司總承包公司、桂林華崛大數據科技有限公司戰略簽約

發佈會後，無問芯穹、清程極智、360、京東雲、智平方等五家合作伙伴代表紛紛登臺，分享了摩爾線程誇娥智算集群如何助力其在大模型訓練、大模型推理、具身智能等不同場景和領域的創新，展現了誇娥智算集群在實際應用中的巨大潛力與廣泛適用性。

摩爾線程願與廣大行業夥伴並肩同行，發揮全棧AI的力量，加速推動一個由萬卡智算集群爲強大底座，多領域夥伴共建、廣泛賦能數字經濟的國產智算生態，共同開啓一個屬於大模型與生成式人工智能的新時代，爲美好世界加速。在WAIC期間，摩爾線程將在上海世博展覽館（H2館D616）開展“全棧AI 爲美好世界加速”的主題成果展示，包括加速卡、服務器、超融合一體機和AIGC應用在內的摩爾線程全棧AI產品悉數亮相，並攜手衆多行業合作伙伴聯合展示基於誇娥智算集群的豐富行業大模型與應用方案。

譯文內容由第三人軟體翻譯。

以上內容僅用作資訊或教育之目的，不構成與富途相關的任何投資建議。富途竭力但無法保證上述全部內容的真實性、準確性和原創性。

面对英伟达挑战，国产AI算力难题如何破解？

面對英偉達挑戰，國產AI算力難題如何破解？

風險及免責聲明

聲明