鏈式主題 · AI 電力基建:備援拓撲與 BOM 重配 · ISSUE #201
微軟把整棟 GPU 機房的發電機和不斷電系統拆掉了,而且是寫在官網上的
15GW 正在改寫的備援採購清單:拿掉的是哪一層、留下的是什麼、那筆錢流去了誰的口袋。
本系列前十四篇有大半在問同一個問題:電從哪裡來。燃氣機組排到 2030 年、變壓器交期以年計、併網排隊六年起跳,這條線從 5 月中追到現在、將近三個月。現在有一份微軟自己貼在官網上的設計文件,把問題換了一個方向。電進來以後,那套從機房誕生第一天就存在的備援設備,還在不在。答案是有一整棟 GPU 機房,它不在了。
📄微軟自己寫下來的那句話
先看原文。微軟在 2025 年 11 月 12 日的官方部落格裡描述 Fairwater 亞特蘭大園區的電力設計,寫的是這一句:
we can also forgo traditional resiliency approaches for the GPU fleet (such as on-site generation, UPS systems and dual-corded distribution)
中文直譯:我們也可以對 GPU 機群省去傳統的韌性做法,例如現地發電、不斷電系統以及雙路供電。同一篇文章給了這個決定的前提與目標:
The Atlanta site was selected with resilient utility power in mind and is capable of achieving 4×9 availability at 3×9 cost
中文直譯:亞特蘭大這個場址在選址時就把韌性市電納入考量,能夠以三個 9 的成本達成四個 9 的可用度。
這三樣東西被點名拿掉,各自都是機房電氣系統的主結構。現地發電指的是柴油或燃氣發電機組,機房停電時它負責在幾十秒內接手。不斷電系統俗稱 UPS,是介於市電與機櫃之間的那一層儲能與整流設備,負責填補市電中斷到發電機起動之間的空窗。雙路供電則是把每一台設備接到兩條獨立的供電路徑,任何單一路徑故障都不影響運轉。通用雲端機房的可用度承諾靠的就是這三層疊起來;微軟這次把目標寫成四個 9,等於明講 GPU 機群不需要通用雲端那一級。
拿掉之後不是什麼都沒有。微軟在同一篇文章裡描述了電網穩定度的處理方式,三段並行:軟體端在負載低谷插入補充工作負載,讓機房對電網的取電曲線平緩一點;硬體端由 GPU 自行執行功率上限,避免瞬間尖峰;再加上一套現地儲能方案。第三段是關鍵,電池留下來了。
所以這件事的正確描述是:發電機拿掉、中央不斷電系統拿掉、雙路供電拿掉,儲能留下。備援被重新配置,而不是被取消。後面所有推論都建立在「留下的那一層是什麼」上面。
Fairwater 亞特蘭大是微軟第二座 Fairwater,2025 年 11 月上線,機櫃功率密度約 140kW、每列約 1,360kW。這個密度本身就說明了為什麼要重新想備援:每一列 1,360kW 的負載,用傳統中央不斷電系統去撐,設備體積、散熱與轉換損耗都會變成建置速度的敵人。
1.1這份文件為什麼是現在才被大量討論
微軟的部落格是 2025 年 11 月的東西,但這個設計被當成產業現象討論,是 2026 年 8 月的事。中間差了將近九個月,差別在於樣本數。
2026 年 8 月 5 日,SemiAnalysis 的資料中心團隊公布他們的追蹤結果:目前追蹤到 15GW 以上的容量,屬於沒有發電機、沒有中央不斷電系統,或者兩者皆無。這個數字讓一份單一園區的設計文件變成一條產業趨勢線。
必須先說清楚這個數字的性質。15GW 這個量出自 SemiAnalysis 自家的產業模型,外部沒有可比對的公開統計,也沒有第二個機構做過同樣的普查。引用它的正確方式是掛名,寫成「SemiAnalysis 追蹤到 15GW 以上」,不可寫成產業統計。這一點在本篇後面的反方論點段會再處理一次。
同一份追蹤裡點名的清單包含四個對象:微軟 Fairwater 的 GPU 機房完全無後備、發電機只留在網路核心;Anthropic 的機房設計同樣拿掉發電機;Meta 的兩座 AI 機房在衛星影像上看不到發電機;以及在 Colossus 部署的 Tesla Megapack。這四個對象的證據等級差很多,後面兩個要特別小心,本篇第三節會逐一拆。
⚙️為什麼是現在,而且為什麼是訓練機房先動
SemiAnalysis 在同一串貼文裡給了兩個理由,這兩個理由分屬完全不同的性質,混在一起讀會得到錯誤的結論。
第一個理由是技術性的:訓練任務靠持續檢查點機制,本來就容忍中斷。大型模型訓練會定期把模型參數與優化器狀態寫到儲存裝置,機房斷電後從最近一個檢查點續跑,損失的是幾十分鐘到幾小時的算力,不是整個訓練任務。這跟一個線上交易系統斷電十秒就要賠錢,是完全不同的可用度需求。
第二個理由是工期與成本的:砍掉發電機同時砍掉的是採購前置期、許可、試車以及多廠商合約。這四樣全部是時間的問題;SemiAnalysis 另外把資本支出節省單獨列為一項,跟這四樣並列而非重疊。發電機組要環保許可,柴油機組還牽涉排放與噪音的地方審查;試車要協調機組廠商、開關廠商與系統整合商;多廠商合約則意味著任何一家延遲都會拖住整個交付。
把這兩個理由放在一起,去備援的對象範圍就清楚了:它發生在訓練機房,不是發生在所有機房。推論服務、企業雲端、金融與醫療客戶的工作負載,可用度需求沒有降低,那些機房的備援設備不會消失。
拿掉的是為通用雲端設計的冗餘,不等於整體可靠度門檻被調低
我把這件事讀成一體兩面,但重心放在技術性那一半。被拿掉的是為通用雲端多租戶環境設計的冗餘。一座傳統機房要同時服務數千個彼此不相干的客戶,任何一個客戶都可能是那種斷電十秒就出事的應用,所以只能按最嚴格的那個客戶去設計,可用度承諾是被逼出來的下限。AI 訓練機房服務的是單一工作負載,而那個工作負載自己就內建容錯機制。用「壓低可靠度門檻」去描述這件事,對訓練機房是分類錯誤,需求本來就低一階,過去只是沒有專門為它設計的建築。
這條線要盯的是:這套拓撲有沒有外溢到推論機房。訓練負載容忍中斷,推論負載不容忍,如果哪一天出現推論為主的園區也開始拿掉中央不斷電系統,那才代表可靠度門檻真的被整體調低,那時候這個讀法要翻。反過來,只要去備援的樣本仍集中在訓練與大型叢集,這件事就是工程分工變細的結果,跟業者對回報有沒有信心是兩個獨立問題。
微軟自己的財務揭露支持這個讀法。FY26 第四季資本支出含融資租賃 410 億美元、年增 70%,其中約三分之二是中央處理器與繪圖處理器等短壽命資產。把單季 410 億美元的三分之二押在會被技術世代淘汰的東西上面,不是省成本的行為模式。省下來的發電機與不斷電系統,相對於這個量級是小數。
🔀同一家微軟,兩座園區兩種拓撲
到這裡為止,故事聽起來像是一個乾淨的趨勢:業者開始不裝發電機了。但同一家微軟的另一個案子會把這個結論打散。
微軟簽了意向書,採購西維吉尼亞州「Mason County」的「Monarch Compute Campus」約 1.35 至 1.4GW 離網天然氣微電網電力,更大的方案是 2.16GW、864 台往復式引擎。開發商是「Nscale」,引擎點名 Caterpillar,搭配 NVIDIA Vera Rubin GPU,2027 年投產。這個案子選擇離網,直接繞過 PJM 六年以上的併網排隊。Caterpillar 那一端對應的是 2GW 的 G3516 快速反應天然氣發電機組,7 秒可達滿載。
把電網當備援層
GPU 機群省略現地發電、不斷電系統與雙路供電,保留現地儲能。設計目標是以三個 9 的成本達成四個 9 的可用度。機櫃約 140kW、每列約 1,360kW。
前提:選址時就把韌性市電納入考量
把電網整個跳過
約 1.35 至 1.4GW 離網天然氣微電網,更大方案 2.16GW、864 台往復式引擎。開發商 Nscale、引擎點名 Caterpillar、2027 年投產。
前提:繞過 PJM 六年以上的併網排隊
所以同一家公司,在亞特蘭大的 GPU 機群一台發電機都不裝、依 SemiAnalysis 的追蹤只在網路核心留一組,在西維吉尼亞卻買 864 台引擎。
這兩件事不矛盾,因為決定拓撲的變數是場址的電網條件。亞特蘭大的市電被微軟評估為韌性足夠,足夠到可以把電網本身當成備援層,所以才寫得出「以三個 9 的成本達成四個 9 的可用度」。西維吉尼亞的難題在排隊,六年的併網等待等於這個案子在 2032 年前不用談,所以只能自己蓋電廠。
一個是把電網當備援,一個是把電網整個跳過。兩者的共同點是都拒絕了傳統那套「接市電、再疊發電機、再疊中央不斷電系統」的標準堆疊。
3.1Colossus 那條要特別小心
SemiAnalysis 那串貼文的第三則,在點名清單的最後寫了一句:「Elon just parked 168 Megapacks at Colossus instead」,中文直譯是 Elon 剛在 Colossus 擺了 168 台 Megapack 取而代之。這句話有三個問題,寫進投資判斷之前必須拆開。
| 問題 | 證據 | 後果 |
|---|---|---|
| 時間錯了 | 168 台這個數字對應的是 2025 年 5 月 22 日的 Colossus 1,不是 2026 年的新部署 | 用「剛剛」去描述一年多前的事,會讓人以為這是最新的設計轉向 |
| 替換關係不存在 | Colossus 1 在 2025 年 4 月的空拍影像就有約 35 台燃氣渦輪、合計約 422MW;「CNBC」2026 年 8 月 5 日報導明寫 Colossus 與 Colossus 2 同時使用數十台天然氣渦輪 | 電池是疊加在既有供電之上,不是拿來取代發電機 |
| 方向甚至是相反的 | Colossus 現在面對的爭議正是自備發電太多,渦輪的排放與噪音引發社區抗議,並已進入聯邦法院訴訟程序 | 把這個園區當成去備援的代表案例,會把一個疊加更多電源的案子讀成拿掉電源 |
替換關係那一條還可以補上併網容量的變化:Colossus 1 的併網容量從 8MW 升到 150MW。可用的新數字是另一個:SpaceX 於 2026 年第二季採購 2.95 億美元的 Tesla Megapack,上半年累計 3.29 億美元,用於大孟菲斯地區的資料中心。這是儲能採購量體的證據,跟 168 台那個舊數字不是同一件事。
去備援是一道依場址條件分岔的選擇題
去備援是一道依場址條件分岔的選擇題,全產業同步的曲線並不存在。判準只有一個:這個場址能不能拿到夠韌性、而且夠快的市電。拿得到,就把電網當備援層,設備採購清單會往儲能與機櫃級電池傾斜。拿不到,就自己蓋電廠,採購清單會往引擎、渦輪與中壓開關設備傾斜。兩條路都在增加總支出,只是流向不同的供應商。
這決定了怎麼讀設備商的訂單。任何把「AI 機房開始不裝發電機」直接推導成「發電機廠商完蛋」的說法,都跳過了場址條件這一層。微軟一邊示範不裝發電機,一邊是 Caterpillar 2GW 訂單的客戶,這兩件事同時為真。
什麼情況下我會改看法:如果併網排隊的時間開始縮短,離網自建的誘因下降,那麼分岔會收斂到「把電網當備援」這一邊,發電機需求才會真的見頂。目前手上的一手證據都指向反方向,燃氣電廠候補名單已排到 2030 年早期、新建前置期增加 23%、資本支出年增 66%。
🧾這張採購清單怎麼重排
把前面三節的證據合起來,可以畫出一張備援採購清單的重排表。這是本篇最值得存下來的部分。
| 層級 | 傳統機房 | 訓練機房新拓撲 | 誰的訂單受影響 |
|---|---|---|---|
| 現地發電 | 柴油或燃氣發電機組,市電中斷後接手 | 韌性電網場址整層拿掉;離網場址反向放大成自建電廠 | Caterpillar、Cummins 一線;離網案反而是放量來源 |
| 中央不斷電系統 | 機房層級大型不斷電系統與電池室 | 拿掉中央那一套,功能往機櫃層下沉 | Vertiv 交流電力段、Eaton 傳統配電 |
| 機櫃級備援 | 幾乎沒有,或僅小型電池 | 機櫃級電池備援單元成為主要緩衝 | 光寶科、台達電、電池芯與電源管理晶片 |
| 現地儲能 | 少見 | 官方明列保留,作為電網互動與尖峰填補 | Tesla、Fluence 等儲能系統整合商 |
| 雙路供電 | 每台設備兩條獨立路徑 | 拿掉,改由軟體容錯與檢查點承接 | 配電盤與線纜用量下降 |
| 電網互動 | 被動取電 | 軟體插入補充工作負載、GPU 自行執行功率上限 | 電力管理軟體與 GPU 韌體,非傳統設備商 |
這張表的重點在於:六列裡有五列是搬家,只有雙路供電那一列是真正被減掉。
機櫃級電池備援單元這一層最值得看,因為它是「更多電池」這句話真正的產業落點。光寶科的官方技術稿把它的架構寫得很直白:直流耦合備援、電源供應器與電池備援單元韌體協同、零延遲線上切換以及多層電池保護,並且明寫目的之一是降低對機房層級備援設施的依賴。一家供應商把產品目的之一寫成降低對機房層級備援的依賴,方向講得很清楚;但這是廠商自我定位,不等於第三方驗證過的市場結構。
台達電那一端有年報級的一手可接。FY2025 年報列出的研發計畫裡,與 AI 資料中心直接相關且標明民國 115 年量產的項目,包含超高功率單體機 3MW 不斷電系統電力模塊、高功率密度垂直供電電源模組,以及高解熱功率的機櫃內液對氣與液對液冷卻分配單元。要注意這裡的訊號是雙向的,台達電同時在做 3MW 等級的不斷電系統模塊,代表中央那一層並沒有從它的產品路線圖裡消失,只是從固定式機房設備變成模組化電力模塊。