對比研究 · AI 電力基建 · SST 拐點 · ISSUE #061
PyTorch 羞恥工程揭開的 SST 拐點:ENPH 與 SEDG 二元命脈 vs 戴維斯雙擊
AI 訓練讓電網爆掉、工程師寫了一行 PYTORCH_NO_POWERPLANT_BLOWUP=1 暴力解、每年燒幾千萬美元電費。真正的解法是固態變壓器(SST)。兩家跌 90% 的太陽能股正轉軸進這條主軸——但底層投資邏輯完全不同。
⚙️§1. 故事起點:那行燒掉幾千萬美元的旗標
1.1場景:你是電網調度員
想像你的工作是維持加州電網穩定。某天一個新客戶接上你的電網、他們的功耗每幾分鐘擺動 1 GW 到 800 MW 來回。1 GW 大約是一座中型城市的瞬時用電量。
這個客戶是一座 AI 訓練資料中心。裡面 10,000 到 100,000 顆 GPU 同步在跑模型訓練、整個集群作為一個「客戶」連接到你的電網。問題不是它多耗電、是它負載瞬間擺動。
1.2機制:檢查點存檔才是主因、不是跨卡通訊
很多人以為負載擺動的主因是 GPU 之間的跨卡通訊(all-reduce)——某些 GPU 算完等其他 GPU、暫時降載。這是次要原因。
主因是檢查點存檔(checkpoint)。AI 訓練每隔一段時間就要把模型參數寫到磁碟備份、這時整個 GPU 集群暫停運算、功耗瞬間從滿載掉下來。SemiAnalysis 與 ICLR 2025 一篇論文都明確指出:「訓練時功耗穩定、但存檢查點時急速下掉」。
1.3暴力解:PYTORCH_NO_POWERPLANT_BLOWUP=1
工程師面對這個威脅、做了一件很扯但有效的事。PyTorch 加入這個環境變數、當 GPU 處於閒置或部分閒置時、強迫它以最高功耗跑垃圾運算。500W 的 H100 在檢查點存檔期間應該降到 200W、現在永遠保持 500W。從電網公司看到的「客戶」視角:功耗永遠平穩、問題消失。
但這個解法有三個明顯代價:
| 代價 | 說明 |
|---|---|
| 能源帳單 | GW 規模一年燒掉的垃圾運算電費以幾千萬美元計 |
| 冷卻負擔 | 本來能省的閒置散熱完全消失 |
| 碳排放 | 重大 ESG 議題、永遠滿載運算 = 永遠滿載排碳 |
我把這個叫做「羞恥工程」——不是因為它沒效、是因為它把工程責任從電網接入側強行轉到 GPU 機架上、用浪費電力來避免電網不穩。這是變通解、不是真正修復。
1.4接電許可阻塞:更隱形的代價
PyTorch 旗標還不是最大問題。更隱形的代價是:電力公司開始拒絕資料中心的接電許可。理由就是「會破壞電網穩定」。新的資料中心建好了、機架上滿了 GPU、但電力公司不給你接電。
這對「通電時間就是一切」的超大規模雲端業者來說是場災難。微軟、Meta、Google、OpenAI 都需要在 6-12 個月內把新資料中心通電上線、每延遲一個月都是市場領先地位的損失。PyTorch 旗標解不了接電許可問題。
🔌§2. 真正的解法:固態變壓器(SST)
2.1SST 是什麼
傳統變壓器是鐵芯加銅線圈的純被動元件。降壓鏈通常是 100 kV AC → 35 kV AC → 7 kV AC → 240V/120V AC 家用。每一階都是「物理電磁感應」、無法主動調節。
固態變壓器(Solid State Transformer,SST)用碳化矽(SiC)或氮化鎵(GaN)電晶體構建主動電路、做同樣的降壓但加上動態調節能力。關鍵差異就一個概念:負載調節(load regulation)。
2.2負載調節的工程意義
SST 可以即時改變切換頻率——負載上升時用高頻、下降時用低頻——讓兩側的電流電壓保持穩定。傳統被動變壓器做不到這件事、所以負載擺動會反向傳播。SST 把擺動吸收在電網接入側、根本上消除反向傳播。
SST 帶來的三個結構性效果
SST 從「成本上的奢侈品」(過去太貴沒人裝)變成「接電許可上的剛需」。
2.3時程:產業共識 2027 試點、2028 量產
SST 何時上量是個關鍵問題。我把幾個獨立來源的時程預測對齊:
| 來源 | 時程預測 |
|---|---|
| @insane_analyst 訪談(2026-05-15) | 「2027 下半年的故事」、「36 個月內爆發」 |
| SolarEdge 的 SST | 對齊「下一代 AI 機架 ~2027」(執行長 Shuki Nir) |
| Enphase 的 IQ SST | 2026 年底完整系統展示/2027 客戶試點/2028 量產出貨 |
| pv-magazine USA 產業綜評 | SST 試點 2027、廣泛採用 2028 |
2027 試點、2028 量產、是市場共識。股票具有前瞻定價特性、現在已開始反映(2026-05-14/15 的 SEDG +43%、ENPH +27% 就是直接證據)。
🚀§3. 800V DC 架構轉型:催化劑已被 Nvidia 公開確認
過去 SST 故事最大的不確定性是:「超大規模雲端業者真的會往 800V DC 走嗎、還是繼續用傳統 AC 架構?」2026 年 GTC、Nvidia 公開現場展示一座 800V DC 機架。這把問題從「會不會」變成「何時」。
3.1為什麼超大規模雲端業者要走 800V DC
| 轉換階段 | 損失原因 |
|---|---|
| 高壓 AC → 低壓 AC | 變壓器繞組損 |
| 低壓 AC → DC 母線 | 整流器損 |
| DC 母線 → 機架配電 | 配電損 |
| 機架配電 → GPU 板 VRM | 多級調節損 |
| 總計 | 10-30% 入電功耗在抵達 GPU 之前就消失 |
800V DC 架構直接從中壓 AC(13.8-34.5 kV)一階轉到 800V DC、省下多階損失。更重要的是、功率密度大幅提升——同樣機架空間可以塞更多 GPU。
3.2對 SST 廠商的意義
Nvidia 公開背書、等於超大規模雲端業者路線圖確定。SST 不再是「技術可能」、是「部署必需」。任何想做下一代 AI 機架的廠商、都必須有 SST 級別的電力轉換能力。這把 SST 從「投資論點」升級為「已驗證的產業轉折」。