①DeepSeek開源面向華爲昇騰平台的全套基礎設施組件,與此前面向英偉達平台的開源組件一一對應。②要建立新一代自主可控的GPU軟件生態,首要的事情是先建立一個通用的、編程簡單的、同時能達到硬件性能上限的高級語言。TileLang在這樣的歷史背景下誕生。
《科創板日報》9月30日訊(記者 黃心怡),DeepSeek今日宣佈正式開源面向華爲昇騰平台的全套基礎設施組件,涵蓋編程語言TileLang、計算庫與分佈式通信庫,且與此前面向英偉達平台的開源組件一一對應。
此次開源的核心是TileLang昇騰版本,它對昇騰底層指令進行了封裝,讓開發者能用更簡單的高級語言編程,同時不損失硬件性能,目標是成爲對標英偉達CUDA語言的「工具箱」。
DeepSeek方面表示,要建立新一代自主可控的GPU軟件生態,首要的事情是先建立一個通用的、編程簡單的,同時能達到硬件性能上限的高級語言。TileLang在這樣的歷史背景下誕生。
一方面,相對於英偉達的CUDA語言,TileLang的編程更簡單,能顯著提高開發效率、簡化代碼邏輯。
另一方面,相對於其它同類高級語言,TileLang的編程模型可以充分發揮芯片的特性,達到硬件的性能上限。
TileLang路線首先在英偉達成熟平台上得到了驗證,如今已承載了DeepSeek V4系列模型訓練中大部分算子的實現,是其探索AGI新範式、開發高性能算子的核心工具。
▍雙方共同推進基於昇騰950的128卡超節點方案
從披露的細節看,這並非簡單的單向適配。華爲團隊提供了較大的支持,雙方共同推進了基於昇騰950的128卡超節點方案,並對計算與通信進行了深度優化。
這種「芯模協同」的深度,是組件能達到接近硬件上限性能的關鍵。相關技術成果也已在華爲的CANN社區同步開源,形成了雙向的生態共建。
《科創板日報》記者獲悉,華爲向DeepSeek團隊提供了聯合定義的昇騰超節點SuperPoD Flex和UBL128組網方案,可實現128卡3.2Tbps單層交換Scale-up網絡和256K卡兩層交換Scale-out網絡,可以支持超低時延推理和前沿基座模型的大規模訓練的需求。
基於全互聯的UBL128超節點,昇騰提供了ASC-COMM高性能自定義通信編程庫,支撐用戶通信算子與通算融合算子高性能編程。Deepseek團隊開發了高性能DeepEP通信庫,涵蓋EP/CP/PP/FSDP等模式下的通信算子,爲更大模型向更大集群擴展提供支持,互聯帶寬實測達到Dispatch 375GB/s、Combine 347 GB/s的通信性能,接近硬件上限。
爲支持開發者基於昇騰950及超節點集群部署DeepSeek模型,華爲將此次聯合創新的成果在CANN社區開源,包括大EP低延時推理部署、單卡/單機部署、大規模訓練、超長文本KVcache池化與Agentic RL。其中面向大規模推理場景,基於EP32部署策略,offline推理模式下DeepSeek-V4.1-Flash不帶框架純模型性能可實現TPOT=5ms,每卡輸出吞吐2469tokens/s;TPOT=10ms,每卡輸出吞吐5102 tokens/s。
此外,DeepSeek還開源了五個關鍵的計算與通信組件,覆蓋了模型訓練的核心環節:DeepGEMM加速通用矩陣運算;DeepEP提供高效的大規模跨設備通信;TileKernels提供數據處理所需的常規向量計算和訪存算子;FlashMLA提供稀疏注意力算子,提升長上下文處理效率;DeepSelect則實現了高效的數據篩選。
在多項關鍵測試用例中,上述組件的計算與通信性能已接近硬件上限。多項關鍵測試顯示,這些組件的計算與通信性能均已接近硬件上限。
▍降低大模型訓練與推理代碼的遷移成本
這次開源的戰略意義,遠大於其技術細節。
業內人士王敏堅告訴《科創板日報》記者,過去三年,中國AI芯片的真正瓶頸從來不在晶體管,而在軟件。英偉達的護城河不是芯片算力,而是CUDA十八年積累的軟件生態,數百萬開發者、無數調優過的算子、以及「寫一次到處能跑」的開發體驗。國產芯片算力規格一次次逼近,客戶卻總在最後一步猶豫:遷移成本太高。
DeepSeek在此次公告中提到,DeepSeek訓練中用到的每一個TileLang算子,在昇騰上都有對應的高性能實現。這句表述,翻譯成產業語言就是:訓練DeepSeek級別的前沿模型,從此在軟件棧層面不再唯一依賴英偉達。
王敏堅表示,對國產芯片而言,TileLang的戰略價值在於換軌,與其在CUDA的主場上追模擬生態,不如在更高一層,對硬件中立的算子語言建立新標準。算子寫在TileLang裏,後端可以指向英偉達、昇騰,也可以指向任何願意實現編譯後端的AI芯片。
有券商研報早在去年就指出:TileLang或將解決國產AI芯片高性能計算平台之間接口互不兼容的問題,降低大模型訓練與推理代碼的遷移成本。
▍國產AI芯片有望共享算子生態
根據公開資料,TileLang是一款由北京大學計算機學院團隊主導開發的開源高性能AI算子編程語言,屬於領域特定語言(DSL),於2025年1月開源。其核心設計基於「Tile」(張量分塊)抽象,採用類Python的聲明式語法,開發者可用接近數學公式的形式描述計算意圖,由編譯器自動完成循環優化、內存調度等底層硬件適配,旨在降低AI算子開發門檻並實現「一次編寫,多架構運行」。
TileLang於2025年9月應用於DeepSeek-V3.2-Exp等大模型研發,並與華爲昇騰、摩爾線程、算能、沐曦等硬件廠商達成適配合作。
在華爲全聯接大會2025的開發者日上,TileLang團隊成員董宇騏介紹了TileLang實現FlashAttention算子開發,代碼量從500+行減少至80行,並保持了與官方版本持平的性能。
這次DeepSeek公告中另一句值得細讀的話:TileLang昇騰版本作爲一個開源工作,希望能對更多AI芯片建立高可用軟件生態起到示範作用。
王敏堅認爲,這個示範作用指向的是寒武紀、海光、摩爾線程、沐曦等一衆國產芯片公司:與其各自爲戰地造輪子,不如共同對接TileLang這樣的中立語言層。芯片廠只需提供編譯後端和底層指令接口(昇騰爲此開放了Ascend C與PTO ISA底層指令體系),上層算子生態即可複用。若這一路徑成立,國產AI芯片有望第一次擁有跨芯片共享的算子生態,碎片化困局出現真正的解法。
不過,在肯定此次開源戰略價值的同時,也需看到現實的挑戰。英偉達CUDA生態積累了十餘年,擁有數百萬開發者和海量工具。TileLang昇騰版是一個重要的起點,但要從「可用」到「好用」再到「開發者主動選擇」,仍需持續的社區運營和迭代。
此外,雖然軟件優化能逼近硬件上限,但硬件本身的算力天花板仍是基礎。昇騰芯片的持續迭代能力,將決定這套軟件生態最終能支撐多大的模型和場景。而DeepSeek的示範能否帶動更多模型廠商跟進,則是生態能否真正繁榮的關鍵。
編輯/Deng