主題深度 · AI 算力推理鏈 · ISSUE #129
TPU 逆襲:推理時代成本說話,Google 自研晶片正咬下 NVIDIA 的推理市佔
訓練看誰最強,推理看誰最便宜。推理用量 2030 年將超過訓練,而 TPU 每一單位有效運算的成本比 NVIDIA 旗艦低 20 到 50%,Gemini 每百萬 token 比對手便宜近六成。這篇拆解這個成本優勢怎麼轉成市佔,以及它的邊界:搶得到份額,但短期不會跟 NVIDIA 平起平坐。
過去兩年,整個 AI 圈比的是訓練:誰的叢集大,誰買的 GPU 多,誰能把更大的模型練出來。這個比法沒有錯,訓練是這輪軍備競賽的起點。但算力的重心正在從訓練移到推理,而推理這塊戰場的規則,跟訓練完全不一樣。
這個轉折,就是 TPU 系列母圖之後要追的主線:訓練看誰最強,推理看誰最便宜。而在推理「比便宜」這件事上,GOOGL 的 TPU 站在結構性的優勢位置。這一篇先把這個引擎拆開,下一篇再講怎麼參與。
🔁推理時代,規則變了
麥肯錫的估算把這個轉折講得很清楚:模型只練一次,但上線後要每天替幾億人回答問題,還要扛起 AI Agent 的每一個步驟,推理的累積用量會遠遠蓋過訓練那筆一次性投入。
| 用電(吉瓦) | 2026 年 | 2030 年 |
|---|---|---|
| 訓練 | 約 31.2 | 約 62.2 |
| 推理 | 約 31.2 | 93.3 |
資料:McKinsey 推理與訓練用電長期預估。2026 年兩者大約各佔一半,到 2030 年推理正式超過訓練。
訓練跟推理要的東西,本來就不一樣。把它們擺在一起對照,差別一眼就看出來:
比的是峰值能力與穩定度
比的是服務一個 token 要花多少錢
差別在這裡:訓練是一次性的資本投入,推理是天天在燒的營運成本。一個模型練一次,卻要服務好幾年。把整個生命週期攤開,推理的累積花費會把訓練的一次性投入比下去。所以在推理端,誰能把單位 token 的成本壓低,誰就握住了定價權與毛利。而壓低單位運算成本,正是 ASIC 這種客製晶片天生的強項。
⚙️TPU 為什麼在推理便宜
道理在母圖那篇講過:GPU 是通用晶片,上面保留了大量為圖形渲染與各種泛用場景準備的電路;ASIC 把這些全砍掉,每一個電晶體都用在矩陣運算上。等大模型的底層演算法穩定下來,同級算力下,ASIC 的單次計算成本與功耗大約只有 GPU 的一半。TPU 就是 Google 為自己的工作負載量身訂做的 ASIC。
這不是紙上談兵。半導體研究機構 SemiAnalysis 把帳算了出來:
| 指標 | TPU | NVIDIA 旗艦 |
|---|---|---|
| 每有效運算總成本 | 低 20 到 50% | GB200/GB300 基準 |
| 每美元效能(每秒 token 數) | 最高約 4 倍 | 1 倍基準 |
| 雲端牌價(每顆每小時) | TPU v6e 約 $2.7 | B200 約 $5.5 |
| 晶片利用率 | 自家編譯器推到約 40% | 一般系統約 30% |
資料:SemiAnalysis。對有規模的大買家,同樣的硬體靠更高的利用率還能榨出更多有效算力。
Google 在 2025 年推出的第七代 TPU Ironwood,更是第一款主打推理的 TPU,把推理速度一口氣拉高約 4 倍。換句話說,TPU 不只是便宜的訓練備胎,它本來就是為推理時代設計的。
💵看得見的證據:Gemini 的 token 價
這些成本優勢不是只活在投影片裡,它已經變成消費者看得到的價格。根據第三方基準站 Artificial Analysis 的定價:
| 模型 | 供應商 | 每百萬 token |
|---|---|---|
| Gemini 3.1 | 約 $1.74 | |
| Claude Opus 4.7 | Anthropic | 約 $4.10 |
| GPT-5.5 | OpenAI | 約 $4.35 |
資料:Artificial Analysis 定價彙整。Gemini 比對手便宜了將近六成;Google 自己也說,2025 年把 Gemini 的單位服務成本砍了 78%。
這裡要誠實講一件事:token 賣得便宜,不全是晶片的功勞,裡面也有 Google 垂直整合、模型效率與訂價策略的成分。但關鍵在於,TPU 把 Google 的成本地板壓得夠低,這個低價才撐得住,不是賠錢搶市場。當對手得用更貴的 GPU 算同一個 token,Google 就有本錢長期把價格壓在那裡。在推理時代,這就是最有力的武器。
🚀逆襲正在發生:TPU 走出 Google
如果 TPU 只有 Google 自己用,那它頂多是 Google 的省錢工具。真正讓「逆襲」這兩個字成立的,是 TPU 正在走出 Google 的圍牆。把這幾步排成時間軸,方向就清楚了:
需求是真的:Anthropic 的年化營收從 2026 年初的 90 億美元,短短幾個月就衝破 470 億美元。把這些拼起來,市場研究機構 New Street Research 估計,到 2028 年 NVIDIA 在推理算力上的份額可能降到兩到三成,而雲端自研 ASIC 以超過四成的年複合成長率往上衝。推理這塊蛋糕,正在被一塊塊切走。
🛑但別過頭:逆襲不等於翻盤
講到這裡要踩一下煞車,免得把故事說過頭。TPU 搶得到推理份額,不代表它要跟 NVIDIA 平起平坐。優勢有它的適用範圍——分清楚 TPU 強在哪、邊界又在哪,比急著押哪一邊更重要。
有規模、養得起工程團隊的玩家
軟體成熟度還追不上 NVIDIA
所以這篇的結論,分寸就在這裡:TPU 在推理端有結構性的成本優勢,會持續從 NVIDIA 手裡咬下市佔,但短期內不會跟 NVIDIA 平起平坐,也不需要。這不是「NVIDIA 完了」的故事,是「推理這塊正在變大的蛋糕,被切走的那一角夠大,也夠值得追」的故事。
🎯怎麼參與這波
最後落到實際。要押 TPU 逆襲,直接買 Google 不是最利落的方式,因為 TPU 對 GOOGL 這種體量的公司只是其中一小塊,會被搜尋、雲端、廣告的營收稀釋掉。
更純的押法,是去找那個不管哪家雲端巨頭自研晶片、都繞不開的角色。設計 Google TPU 的人是誰?把這些晶片連成叢集的交換晶片又是誰的?這條路一路追下去,會收斂到同一個名字。
但博通只是這條鏈的第一站。TPU 結構性便宜的另一面,是把錢重新分配給一條跟輝達很不一樣的供應鏈。同樣是 AI 算力,順著輝達走是一批名字,順著 Google TPU 走是另一批,而且不只是換人,連結構都不同。
| 環節 | TPU 這條鏈 | 輝達那條鏈 |
|---|---|---|
| 運算晶片設計 | AVGO 與聯發科(2454)做客製 ASIC | 輝達自研 |
| HBM 主供 | 三星領頭、約六成 | SK 海力士領頭 |
| 機櫃間互連 | 跨櫃用光串成一個 pod,OCS 主要由 LITE、COHR 供應 | 櫃內銅背板單櫃、走 NVLink |
| 伺服器與機櫃組裝 | 英業達(2356)、CLS | 鴻海(2317)、廣達(2382)、SMCI |
| 代工與先進封裝 | TSM 包辦,N3P 到 N2 再到 CoWoS | 台積電——兩條鏈唯一的交集 |
這張表最值得記住的是三個結構差。
光是 TPU 的神經系統,不是配角
輝達的擴展單位是一個機櫃、用銅背板把幾十顆 GPU 串在櫃內;TPU 的擴展單位是一個 pod、要跨好幾個機櫃用光串起來。
HBM 的排序跟輝達相反
餵 TPU 的高頻寬記憶體是三星領頭、SK 海力士補位;輝達那條剛好調過來,SK 海力士在前。
博通在這條鏈上贏兩次
TPU 運算晶片的主要設計者是它;資料中心那層乙太網路交換器用的高階交換晶片 Tomahawk,也是它。
把這些攤開,會看到一件事:「買 AI 就是買輝達」是這兩年最大的思考慣性。順著 TPU 這條獨立路線走,是一整排各自繞不開的收費站——設計、代工、封裝、HBM、光、組裝、供電與散熱,每一層都有一個換不掉的角色。這條鏈,我們會一站一站拆。第一站、也是最硬的一站,就是設計端的博通。下一篇見。
⚠️風險與注意事項(必讀)
🧭研究結論與追蹤框架
核心結論:推理重心轉移+TPU 結構性成本優勢,是一條會持續發酵的主線;但它是「切蛋糕」不是「翻桌」。要參與,盯的不是單一財報數字,而是「TPU 走出 Google 的速度」與「設計端收費站的訂單」。以下分兩個方向追蹤。
逆襲加速(偏多)追蹤
- 外部客戶擴散:若 Anthropic、Meta 之後再有新雲端/企業採用 TPU → 偏多:外租平台從個案變趨勢。
- 設計端訂單:若博通 AI 營收與客製 ASIC 設計拿單持續上修 → 偏多:收費站確認受惠。
- 價差維持:若 Gemini 與對手 token 價差維持近六成 → 偏多:成本地板撐得住、非賠錢搶市。
逆襲降溫(偏空)追蹤
- 份額不如預期:若 New Street 追蹤的 NVIDIA 推理份額未見鬆動 → 偏空:擴散比樂觀情境慢。
- 軟體生態落差:若 TPU 外部採用仍卡在少數巨頭、中小型部署起不來 → 偏空:CUDA 慣性難破。
- 供應鏈卡口:若 OCS/HBM 等卡口供給吃緊壓制 TPU pod 出貨 → 偏空:放量受限。
📋一頁速看(給沒時間的人)
三大論點、為什麼 TPU 在推理站得住
- 規則變了:2030 年推理用電 93.3 吉瓦超過訓練 62.2 吉瓦,戰場從「算多快」變「一個 token 多少錢」。
- 成本領先:SemiAnalysis 實證 TPU 每有效運算成本低 20-50%、每美元效能最高約 4 倍、利用率約四成。
- 走出圍牆:Anthropic 押 1+3.5 吉瓦、Apollo/Blackstone $350 億把 TPU 外租、Meta 首購。
三大邊界、別把逆襲讀成翻盤
- 訓練端 CUDA 護城河短期未破,最尖端訓練主場仍在 NVIDIA。
- 中小型部署軟體成熟度仍追不上,CUDA 最省事。
- token 低價含垂直整合與訂價策略成分,非純晶片紅利。
怎麼參與
- 直接買 Google 會被搜尋/雲端/廣告稀釋;更純的押法是繞不開的設計端——博通(AVGO)。
- 順著 TPU 走是另一條供應鏈:光(OCS)、HBM 排序、組裝、封裝各有換不掉的角色,下一篇從博通拆起。
📚來源與參考
本文每個關鍵論點都有對應公開來源,按權威分三級列出。所有連結均為公司官方、產業專業研究機構或財經媒體,不引用散戶論壇或無來源 blog。涉及未來預期(份額、容量、投入金額)明確標示為估算或報導,不假裝是已實現財報數字。
第一級公司官方與一手揭露
- Anthropic 官方公告(公司新聞,2026-04/2026-05 Series H):TPU 算力承諾(1 吉瓦+新一代 3.5 吉瓦)與年化營收。
- Google AI 官方部落格(公司部落格):Gemini 單位服務成本下降、Ironwood TPU 推理定位。
- Google Cloud TPU(產品頁):TPU v6e/Ironwood 規格與雲端供應。
第二級產業專業研究與基準
- SemiAnalysis(半導體深度研究):TPU 與 NVIDIA 每有效運算成本、每美元效能、晶片利用率比較與適用場景。
- Artificial Analysis(模型基準與定價):Gemini/Claude/GPT 每百萬 token 定價。
- New Street Research(分析機構):2028 NVIDIA 推理份額與雲端自研 ASIC 成長率預估。
- McKinsey(管理顧問研究):推理與訓練用電的長期預估。
第三級財經與產業媒體
- Bloomberg(財經媒體):Apollo/Blackstone TPU 私募信貸租賃、Meta 外購 TPU 相關報導。
- Data Center Dynamics(DCD)(資料中心專業媒體):第三方資料中心 TPU 部署落地報導。
數據數字與口徑來源
- 成本/效能/利用率與雲端牌價(TPU v6e $2.7、B200 $5.5):SemiAnalysis。
- token 定價(Gemini $1.74、Claude $4.10、GPT $4.35):Artificial Analysis;Gemini 單位成本砍 78%:Google 官方口徑。
- 用電預估(2026 各約 31.2 吉瓦;2030 推理 93.3、訓練 62.2 吉瓦):McKinsey。
方法事實核查方法論
本文每個關鍵論點優先採第一級(公司官方)與第二級(產業專業研究)來源;財經媒體報導僅作佐證、不作唯一依據。涉及未來預期(份額、容量、五年投入金額、私募信貸規模)明確標示為「估算」「報導」或「展望」,不假裝是已實現財報數字。供應鏈節點對照(設計、HBM、光 OCS、組裝、封裝)屬產業普遍認知,以一手機構研究與公司財報口徑為準。各 ticker 在 TPU 鏈的完整角色與一手來源,延續 系列前篇 Google 800 多億發股 TPU 供應鏈深度研究、不在此重列。