TPU 逆襲:推理成本說話,Google 咬下 NVIDIA 推理市佔 | Trend Core
所有研究 AVGO 最純押法 設計端收費站
推理重心轉移 · 成本說話的時代剛開始

主題深度 · AI 算力推理鏈 · ISSUE #129

TPU 逆襲:推理時代成本說話,Google 自研晶片正咬下 NVIDIA 的推理市佔

訓練看誰最強,推理看誰最便宜。推理用量 2030 年將超過訓練,而 TPU 每一單位有效運算的成本比 NVIDIA 旗艦低 20 到 50%,Gemini 每百萬 token 比對手便宜近六成。這篇拆解這個成本優勢怎麼轉成市佔,以及它的邊界:搶得到份額,但短期不會跟 NVIDIA 平起平坐。

TPU 每有效運算成本
低 20-50%
對比 NVIDIA GB200/GB300
Gemini 每百萬 token
$1.74
對手約 $4、便宜近六成
Anthropic 算力承諾
$2,000 億
五年、史上最大一筆
2028 NVIDIA 推理份額
降至 2-3 成
自研 ASIC >40% 年複合成長
SIGNAL #1 · 成本結構
SemiAnalysis 把帳算出來:TPU 每有效運算成本低 20-50%
部分工作負載每美元效能最高約 4 倍;Google 自家編譯器把晶片利用率推到約四成
SIGNAL #2 · 客戶背書
Anthropic 重押、Apollo/Blackstone 把 TPU 外租、Meta 首購
TPU 從只租不賣的自用工具,變成可以對外供應的推理平台
SIGNAL #3 · 市佔轉移
New Street 估 2028 NVIDIA 推理份額降至 2-3 成
雲端自研 ASIC 以超過四成的年複合成長率往上衝
一句話結論
算力重心正從訓練移到推理,而推理比的是「服務一個 token 要花多少錢」。TPU 作為 Google 量身訂做的 ASIC,每有效運算成本比 NVIDIA 旗艦低 20 到 50%,這個成本地板讓 Gemini 的 token 價撐得住、也讓 Anthropic、Meta 願意外用。結論的分寸在這:TPU 會持續從 NVIDIA 手裡咬下推理份額,但短期不會平起平坐。要參與,最純的押法不是直接買 Google,而是繞不開的設計端——博通

過去兩年,整個 AI 圈比的是訓練:誰的叢集大,誰買的 GPU 多,誰能把更大的模型練出來。這個比法沒有錯,訓練是這輪軍備競賽的起點。但算力的重心正在從訓練移到推理,而推理這塊戰場的規則,跟訓練完全不一樣。

這個轉折,就是 TPU 系列母圖之後要追的主線:訓練看誰最強,推理看誰最便宜。而在推理「比便宜」這件事上,GOOGL 的 TPU 站在結構性的優勢位置。這一篇先把這個引擎拆開,下一篇再講怎麼參與。

🔁推理時代,規則變了

麥肯錫的估算把這個轉折講得很清楚:模型只練一次,但上線後要每天替幾億人回答問題,還要扛起 AI Agent 的每一個步驟,推理的累積用量會遠遠蓋過訓練那筆一次性投入。

用電(吉瓦)2026 年2030 年
訓練約 31.2約 62.2
推理約 31.293.3

資料:McKinsey 推理與訓練用電長期預估。2026 年兩者大約各佔一半,到 2030 年推理正式超過訓練。

訓練跟推理要的東西,本來就不一樣。把它們擺在一起對照,差別一眼就看出來:

訓練
比的是峰值能力與穩定度
要什麼超大顯存、極強卡間互聯
成本性質一次性資本投入
在位者NVIDIA 近乎壟斷(CUDA)
推理 · 成本說話
比的是服務一個 token 要花多少錢
要什麼成本夠低、延遲夠短
成本性質天天在燒的營運成本
誰握定價權壓低單位 token 成本者

差別在這裡:訓練是一次性的資本投入,推理是天天在燒的營運成本。一個模型練一次,卻要服務好幾年。把整個生命週期攤開,推理的累積花費會把訓練的一次性投入比下去。所以在推理端,誰能把單位 token 的成本壓低,誰就握住了定價權與毛利。而壓低單位運算成本,正是 ASIC 這種客製晶片天生的強項。


⚙️TPU 為什麼在推理便宜

道理在母圖那篇講過:GPU 是通用晶片,上面保留了大量為圖形渲染與各種泛用場景準備的電路;ASIC 把這些全砍掉,每一個電晶體都用在矩陣運算上。等大模型的底層演算法穩定下來,同級算力下,ASIC 的單次計算成本與功耗大約只有 GPU 的一半。TPU 就是 Google 為自己的工作負載量身訂做的 ASIC。

這不是紙上談兵。半導體研究機構 SemiAnalysis 把帳算了出來:

指標TPUNVIDIA 旗艦
每有效運算總成本低 20 到 50%GB200/GB300 基準
每美元效能(每秒 token 數)最高約 4 倍1 倍基準
雲端牌價(每顆每小時)TPU v6e 約 $2.7B200 約 $5.5
晶片利用率自家編譯器推到約 40%一般系統約 30%

資料:SemiAnalysis。對有規模的大買家,同樣的硬體靠更高的利用率還能榨出更多有效算力。

Google 在 2025 年推出的第七代 TPU Ironwood,更是第一款主打推理的 TPU,把推理速度一口氣拉高約 4 倍。換句話說,TPU 不只是便宜的訓練備胎,它本來就是為推理時代設計的。


💵看得見的證據:Gemini 的 token 價

這些成本優勢不是只活在投影片裡,它已經變成消費者看得到的價格。根據第三方基準站 Artificial Analysis 的定價:

模型供應商每百萬 token
Gemini 3.1Google約 $1.74
Claude Opus 4.7Anthropic約 $4.10
GPT-5.5OpenAI約 $4.35

資料:Artificial Analysis 定價彙整。Gemini 比對手便宜了將近六成;Google 自己也說,2025 年把 Gemini 的單位服務成本砍了 78%。

這裡要誠實講一件事:token 賣得便宜,不全是晶片的功勞,裡面也有 Google 垂直整合、模型效率與訂價策略的成分。但關鍵在於,TPU 把 Google 的成本地板壓得夠低,這個低價才撐得住,不是賠錢搶市場。當對手得用更貴的 GPU 算同一個 token,Google 就有本錢長期把價格壓在那裡。在推理時代,這就是最有力的武器。


🚀逆襲正在發生:TPU 走出 Google

如果 TPU 只有 Google 自己用,那它頂多是 Google 的省錢工具。真正讓「逆襲」這兩個字成立的,是 TPU 正在走出 Google 的圍牆。把這幾步排成時間軸,方向就清楚了:

2026 起
Anthropic 一路加碼 TPU
先讓約一百萬顆 TPU、超過 1 吉瓦的算力上線,再加簽新一代約 3.5 吉瓦容量,從 2027 年起陸續到位,是它有史以來最大的一筆算力承諾。相關報導估計這條 Google 路線五年投入上看 2,000 億美元,遠高於它跟亞馬遜的十年 1,000 億美元。
技術頂尖又能自己挑晶片,仍重押 TPU
2026 年中起
TPU 變成可以賣的商品
Apollo 與 Blackstone 主導一筆約 350 億美元的私募信貸,透過專門設立的載具買下 Google 的 TPU,再租給 Anthropic,在 Google 以外的第三方資料中心落地。TPU 過去是只租不賣的自用工具,這幾步把它推成對外供應的推理平台。
搶市佔的起點
同期
Meta 首度外購 TPU 系統
連自己也在做自研晶片(MTIA)的 Meta,都首度外購 TPU 系統,等於再添一個第三方需求訊號。

需求是真的:Anthropic 的年化營收從 2026 年初的 90 億美元,短短幾個月就衝破 470 億美元。把這些拼起來,市場研究機構 New Street Research 估計,到 2028 年 NVIDIA 在推理算力上的份額可能降到兩到三成,而雲端自研 ASIC 以超過四成的年複合成長率往上衝。推理這塊蛋糕,正在被一塊塊切走。


🛑但別過頭:逆襲不等於翻盤

講到這裡要踩一下煞車,免得把故事說過頭。TPU 搶得到推理份額,不代表它要跟 NVIDIA 平起平坐。優勢有它的適用範圍——分清楚 TPU 強在哪、邊界又在哪,比急著押哪一邊更重要。

TPU 最強的場合
有規模、養得起工程團隊的玩家
場景一大規模訓練
場景二混合專家模型
場景三檢索密集型推理
誰吃得到Google 自己、Anthropic 這種等級
TPU 的邊界
軟體成熟度還追不上 NVIDIA
中小型部署CUDA 隨手就能跑、最省事
訓練端CUDA 護城河短期沒被打破
最尖端訓練主場還是在 NVIDIA

所以這篇的結論,分寸就在這裡:TPU 在推理端有結構性的成本優勢,會持續從 NVIDIA 手裡咬下市佔,但短期內不會跟 NVIDIA 平起平坐,也不需要。這不是「NVIDIA 完了」的故事,是「推理這塊正在變大的蛋糕,被切走的那一角夠大,也夠值得追」的故事。


🎯怎麼參與這波

最後落到實際。要押 TPU 逆襲,直接買 Google 不是最利落的方式,因為 TPU 對 GOOGL 這種體量的公司只是其中一小塊,會被搜尋、雲端、廣告的營收稀釋掉。

更純的押法,是去找那個不管哪家雲端巨頭自研晶片、都繞不開的角色。設計 Google TPU 的人是誰?把這些晶片連成叢集的交換晶片又是誰的?這條路一路追下去,會收斂到同一個名字。

這條鏈的第一站 =
博通 Broadcom

但博通只是這條鏈的第一站。TPU 結構性便宜的另一面,是把錢重新分配給一條跟輝達很不一樣的供應鏈。同樣是 AI 算力,順著輝達走是一批名字,順著 Google TPU 走是另一批,而且不只是換人,連結構都不同。

環節TPU 這條鏈輝達那條鏈
運算晶片設計AVGO 與聯發科(2454)做客製 ASIC輝達自研
HBM 主供三星領頭、約六成SK 海力士領頭
機櫃間互連跨櫃用光串成一個 pod,OCS 主要由 LITECOHR 供應櫃內銅背板單櫃、走 NVLink
伺服器與機櫃組裝英業達(2356)、CLS鴻海(2317)、廣達(2382)、SMCI
代工與先進封裝TSM 包辦,N3P 到 N2 再到 CoWoS台積電——兩條鏈唯一的交集

這張表最值得記住的是三個結構差。

1

光是 TPU 的神經系統,不是配角

輝達的擴展單位是一個機櫃、用銅背板把幾十顆 GPU 串在櫃內;TPU 的擴展單位是一個 pod、要跨好幾個機櫃用光串起來。

命脈
光對 TPU 是命脈,對輝達只是櫃間配角,這是兩家最少人講清楚的結構差。
卡口
負責這層的 OCS,Google 自己設計、對外只向少數幾家採購,能做的就 LumentumCoherent 這麼幾家,門檻極高,是整條鏈裡相對硬的一環。
2

HBM 的排序跟輝達相反

餵 TPU 的高頻寬記憶體是三星領頭、SK 海力士補位;輝達那條剛好調過來,SK 海力士在前。

重點
同一個零件,兩條鏈的主角不一樣。
3

博通在這條鏈上贏兩次

TPU 運算晶片的主要設計者是它;資料中心那層乙太網路交換器用的高階交換晶片 Tomahawk,也是它。

連接三層
pod 內用光、靠 OCS;資料中心網路用晶片、靠博通的 Tomahawk;光模組裡的訊號處理、靠 Marvell 的光 DSP。博通吃到的,是其中運算設計與網路交換這兩塊。

把這些攤開,會看到一件事:「買 AI 就是買輝達」是這兩年最大的思考慣性。順著 TPU 這條獨立路線走,是一整排各自繞不開的收費站——設計、代工、封裝、HBM、光、組裝、供電與散熱,每一層都有一個換不掉的角色。這條鏈,我們會一站一站拆。第一站、也是最硬的一站,就是設計端的博通。下一篇見。


⚠️風險與注意事項(必讀)

01CUDA 護城河沒被打破,訓練主場仍在 NVIDIA
TPU 的優勢在推理與大規模特定場景;最燒錢、最尖端的模型訓練短期仍以 NVIDIA 為主場。把「咬下推理份額」誤讀成「NVIDIA 被翻盤」會押錯方向。
02TPU 軟體成熟度對中小型部署仍是門檻
TPU 最強的場合是有規模、養得起工程團隊把軟硬體一起調校的玩家。中小型部署用 CUDA 仍最省事,外部需求擴散的速度可能比樂觀情境慢。
03token 低價含多重成分、非純晶片紅利
Gemini 便宜也來自垂直整合、模型效率與訂價策略。若把價差全歸因於 TPU 晶片,會高估硬體單一變數的解釋力。
04前瞻數字屬預估、會隨季度修正
2028 份額預估、私募信貸規模、五年投入金額多為第三方研究與報導估算,非已實現財報數字,後續以官方揭露為準。

🧭研究結論與追蹤框架

核心結論:推理重心轉移+TPU 結構性成本優勢,是一條會持續發酵的主線;但它是「切蛋糕」不是「翻桌」。要參與,盯的不是單一財報數字,而是「TPU 走出 Google 的速度」與「設計端收費站的訂單」。以下分兩個方向追蹤。

 逆襲加速(偏多)追蹤
  • 外部客戶擴散:若 Anthropic、Meta 之後再有新雲端/企業採用 TPU → 偏多:外租平台從個案變趨勢。
  • 設計端訂單:若博通 AI 營收與客製 ASIC 設計拿單持續上修 → 偏多:收費站確認受惠。
  • 價差維持:若 Gemini 與對手 token 價差維持近六成 → 偏多:成本地板撐得住、非賠錢搶市。
 逆襲降溫(偏空)追蹤
  • 份額不如預期:若 New Street 追蹤的 NVIDIA 推理份額未見鬆動 → 偏空:擴散比樂觀情境慢。
  • 軟體生態落差:若 TPU 外部採用仍卡在少數巨頭、中小型部署起不來 → 偏空:CUDA 慣性難破。
  • 供應鏈卡口:若 OCS/HBM 等卡口供給吃緊壓制 TPU pod 出貨 → 偏空:放量受限。

📋一頁速看(給沒時間的人)

TPU 推理逆襲 | TPU 系列 02 | 2026-06-21
TPU 成本優勢
低 20-50%
Gemini token 價
$1.74
Anthropic 承諾
$2,000 億
2028 NVDA 推理
2-3 成

三大論點、為什麼 TPU 在推理站得住

  • 規則變了:2030 年推理用電 93.3 吉瓦超過訓練 62.2 吉瓦,戰場從「算多快」變「一個 token 多少錢」。
  • 成本領先:SemiAnalysis 實證 TPU 每有效運算成本低 20-50%、每美元效能最高約 4 倍、利用率約四成。
  • 走出圍牆:Anthropic 押 1+3.5 吉瓦、Apollo/Blackstone $350 億把 TPU 外租、Meta 首購。

三大邊界、別把逆襲讀成翻盤

  • 訓練端 CUDA 護城河短期未破,最尖端訓練主場仍在 NVIDIA。
  • 中小型部署軟體成熟度仍追不上,CUDA 最省事。
  • token 低價含垂直整合與訂價策略成分,非純晶片紅利。

怎麼參與

  • 直接買 Google 會被搜尋/雲端/廣告稀釋;更純的押法是繞不開的設計端——博通(AVGO)。
  • 順著 TPU 走是另一條供應鏈:光(OCS)、HBM 排序、組裝、封裝各有換不掉的角色,下一篇從博通拆起。

📚來源與參考

本文每個關鍵論點都有對應公開來源,按權威分三級列出。所有連結均為公司官方、產業專業研究機構或財經媒體,不引用散戶論壇或無來源 blog。涉及未來預期(份額、容量、投入金額)明確標示為估算或報導,不假裝是已實現財報數字。

第一級公司官方與一手揭露

  • Anthropic 官方公告(公司新聞,2026-04/2026-05 Series H):TPU 算力承諾(1 吉瓦+新一代 3.5 吉瓦)與年化營收。
  • Google AI 官方部落格(公司部落格):Gemini 單位服務成本下降、Ironwood TPU 推理定位。
  • Google Cloud TPU(產品頁):TPU v6e/Ironwood 規格與雲端供應。

第二級產業專業研究與基準

  • SemiAnalysis(半導體深度研究):TPU 與 NVIDIA 每有效運算成本、每美元效能、晶片利用率比較與適用場景。
  • Artificial Analysis(模型基準與定價):Gemini/Claude/GPT 每百萬 token 定價。
  • New Street Research(分析機構):2028 NVIDIA 推理份額與雲端自研 ASIC 成長率預估。
  • McKinsey(管理顧問研究):推理與訓練用電的長期預估。

第三級財經與產業媒體

  • Bloomberg(財經媒體):Apollo/Blackstone TPU 私募信貸租賃、Meta 外購 TPU 相關報導。
  • Data Center Dynamics(DCD)(資料中心專業媒體):第三方資料中心 TPU 部署落地報導。

數據數字與口徑來源

  • 成本/效能/利用率與雲端牌價(TPU v6e $2.7、B200 $5.5):SemiAnalysis。
  • token 定價(Gemini $1.74、Claude $4.10、GPT $4.35):Artificial Analysis;Gemini 單位成本砍 78%:Google 官方口徑。
  • 用電預估(2026 各約 31.2 吉瓦;2030 推理 93.3、訓練 62.2 吉瓦):McKinsey。

方法事實核查方法論

本文每個關鍵論點優先採第一級(公司官方)與第二級(產業專業研究)來源;財經媒體報導僅作佐證、不作唯一依據。涉及未來預期(份額、容量、五年投入金額、私募信貸規模)明確標示為「估算」「報導」或「展望」,不假裝是已實現財報數字。供應鏈節點對照(設計、HBM、光 OCS、組裝、封裝)屬產業普遍認知,以一手機構研究與公司財報口徑為準。各 ticker 在 TPU 鏈的完整角色與一手來源,延續 系列前篇 Google 800 多億發股 TPU 供應鏈深度研究、不在此重列。


本報告為 Trend Core 研究團隊基於公開資料整理之研究內容,不構成投資建議。本文涵蓋之公司(含 AVGO、GOOGL、NVDA、TSM、COHR、LITE、MRVL、CLS、SMCI 等)皆為公開交易股票,存在價格波動、市場、流動性、匯率與政策風險。供應鏈關係、成本比較、市佔預估等資訊來自第三方研究機構與產業媒體,含估算與報導成份,解讀方式存在多種可能,實際以各公司財報與官方揭露為準。過去績效不保證未來結果。投資決策應基於個人財務狀況、風險承受能力,並建議諮詢合格的財務顧問。研究員 / 公司可能持有或於發布後持有文中提及之標的部位。報告中所有時間點的數據以發布日 2026-06-21 為基準,後續變化請以即時資料為準。