百萬顆處理器當成一部電腦用:華為Peerium架構,改的是算力的組裝方式
華為於上海發表Peerium計算架構,以嵌套平行、統一記憶體定址與平等互聯讓百萬級處理器協同工作,本文分析這套架構對AI算力與產業的實際意義。
九月十七日,華為在上海發表了名為Peerium的計算架構,並發布配套的論文。官方的說法很有企圖心:突破圖靈範式與馮諾依曼單機架構的限制,讓百萬級處理器協同工作,如同一臺計算機。這類宣示式的語言在科技發布會上並不罕見,但這次值得停下來看的原因在於,它對準的是當前AI產業最實際的瓶頸:模型越大,需要的算力越像一整座工廠,而現有的電腦體系,骨子裡還是「一部機器」的設計。
要理解Peerium在解決什麼問題,得先回到辦公室的比喻。傳統電腦像一個能力很強的員工:他桌上有一份待辦清單(程式)、一本筆記本(記憶體)、一顆很會算的腦袋(處理器)。馮諾依曼架構七十年來的邏輯就是如此,照順序執行,各單位聽命於控制中心,主從關係清清楚楚。問題是,當AI訓練需要的工作量,相當於幾十萬個這樣的員工同時開工時,麻煩來了:每個員工的筆記本裡只有一小部分資料,彼此要不停借閱、傳真、等對方回覆。花在「溝通」上的時間,往往超過真正做事的時間。這就是大規模AI叢集最頭痛的互聯與記憶體牆問題。
Peerium提出的三個關鍵詞,可以看成對這個問題的三層處理。第一是嵌套平行(Nested BSP):把平行任務分層組織,就像大型工程公司把總工程拆成分項、分項拆成工班,每個層級各自同步節奏,而不是全工地幾十萬人等同一聲哨音。第二是統一記憶體定址:讓所有處理器看到同一本「總帳」,取資料時不必知道它實際放在哪個機櫃、哪張卡上。第三是平等互聯:取消傳統的主從階層,CPU、NPU、記憶體、SSD、網卡在架構裡地位對等,誰都能直接找誰。
靈衢:把「接線」變成開放協定
三個關鍵詞裡,真正決定成敗的其實是連接它們的那條路。華為把實現Peerium的關鍵互聯技術稱為「靈衢」,它基於開放協定,可以把CPU、NPU、記憶體、SSD、網卡與交換機無限擴展地接起來。
這件事可以用水電工程來理解。早年蓋房子,每戶自己拉管線,規格各不相同,大樓越大,管線越亂。後來有了統一的配電標準,任何廠牌的設備都能接上同一套系統,城市才得以長大。資料中心正面臨類似的處境:AI叢集裡,晶片與晶片、節點與節點之間的資料搬移量暴增,互聯從配角變成主角。靈衢走開放協定這條路,意味著華為想把這套接線標準推給整個產業用,而不是只留給自家產品。這個動作與它近年推廣鴻蒙生態的策略是同一個思路:先把自己變成標準的出處地,生態自然往這裡聚攏。這與我們先前分析過的華為在海外中階機讓麒麟晶片與5G同步回歸是同一家公司兩條戰線上的推進,一邊是終端消費市場,一邊是後端的算力基礎設施。
硬體落地的部分,首代產品是Atlas 950超節點。華為表示,25.6萬卡的Atlas 950超節點叢集已在部署中,採用NPO光電封裝技術的Atlas 960系統正在測試。所謂「超節點」,概念上就是把原本分散的許多機櫃,用高頻寬互聯焊接成一個邏輯上的單一電腦。對模型訓練而言,叢集的「顆粒度」越大、越像一臺機器,能訓練的模型規模上限就越高,這是規模競賽裡的硬門檻。
「突破圖靈範式」該怎麼讀
發布會的說法裡,「突破馮諾依曼單機架構」相對好懂:單機的主從結構確實不適合百萬級處理器的協同。但「突破傳統圖靈範式」這句話就需要謹慎對待。圖靈機是計算理論的根基,描述「什麼問題可以被計算」。Peerium的Nested BSP改變的是任務的組織方式,也就是「怎麼把可計算的問題算得更快、更大規模」,這是工程架構層面的躍進。用論文裡的正式表述去讀,它的貢獻在於提出一種可遞迴分層的平行計算範式,讓規模擴展不再受制於單機的順序執行邏輯,而非推翻計算理論本身。讀者在看到「突破圖靈」這類字眼時,把它理解成「擺脫了單機順序執行的思維框架」,會更貼近實情。
華為輪值董事長徐直軍在發布時說,AI時代華為將基於Peerium架構持續打造滿足訓練與推理需求的超節點和叢集,「讓算力無處不在,讓智慧無所不及」。這句話的商業含義,是華為把自己的角色定位在AI時代的基礎設施供應商:賣的不是單顆晶片,而是能把幾十萬顆晶片組成一臺電腦的整套方法。
對一般人的「所以呢」
這套架構離日常很遠嗎?其實不遠。接下來幾年,一般使用者會接觸到的變化大概是三種形態。第一,更強的推理服務:當百萬級處理器能像一臺機器一樣協同,模型回應的速度與成本結構都會改變,體驗上就是更快、更便宜、更複雜的AI功能。第二,算力建設的門檻重新洗牌:過去買一堆伺服器就能搭叢集的做法,在超大模型時代會越來越喫不開,能提供「整臺超大電腦」的廠商,議價能力會明顯上升。第三,對臺灣與全球供應鏈而言,互聯技術(光模組、交換器、先進封裝)的地位會繼續攀升,因為Peerium這類架構的核心支出,有很大一部分正是花在讓晶片彼此講話的那條路上。這個邏輯,與我們之前討論一萬四千噸環軌起重機改變核電施工順序的道理相通:超大規模工程的瓶頸,往往不在單點的力氣,而在把各環節接起來的方式。
當然,架構發布與實際兌現之間還有距離。25.6萬卡叢集仍在部署中,NPO版本還在測試,Nested BSP作為新範式,也需要時間證明它在真實工作負載下的擴展效率與軟體生態成熟度。歷史上平行計算的新架構不少,真正活下來的關鍵通常只有一個:開發者願不願意把程式搬上來。靈衢走開放協定,某種程度就是在為這一步鋪路。
短期內值得觀察的訊號很明確:一看Atlas 950叢集部署完成後的實測表現,二看除了華為自家之外,有多少協力廠商與軟體框架宣布支援靈衢協定,三看論文後續在學界與其他雲端巨頭引發的回應。架構的故事講得再大,最後都要回到這三個可驗證的節點上。算力競賽已經從「誰的晶片快」,進入「誰能把百萬顆晶片變成一臺電腦」的階段,Peerium是這個新階段裡,目前姿態最完整的一份答卷。