算力超週期系列 07 · 推論經濟學 · ISSUE #145
市場還在問「缺不缺 GPU」,但 AI 的錢是照一條曲線算的
SemiAnalysis 創辦人 Dylan Patel 攤開 InferenceX,說了句反直覺的話:別看 token 量,看美元。看懂吞吐與互動性這條母曲線,後面半年那些「缺不缺 GPU」「誰又砍價」的新聞,你就能自己判讀。
SemiAnalysis 創辦人 Dylan Patel 在 Sequoia 的訪談裡攤開一個叫 InferenceX 的平台,每天在約 15 種晶片上自動跑推論基準,業界為它捐了逾 1 億美元硬體。然後他說了句反直覺的話:別看 token 量,看美元。這句話背後,是一條決定 AI 每一分算力值多少錢的曲線。看懂它,後面半年那些「缺不缺 GPU」「誰又砍價」的新聞,你就能自己判讀。
🎯市場在用錯的單位計價 AI
打開財經版面,AI 的算力故事幾乎都繞著同一個問題轉:還缺不缺 GPU、H100 現貨跌了沒、誰又囤了幾萬張卡。這是把算力當成一種同質商品在數,像數油桶一樣數晶片。
但真正在買算力、賣 token 的人,不是這樣算帳的。Dylan Patel 的立場很直白:重要的不是你跑出多少 token,是那些 token 值多少美元。他原話是「誰在乎 token 的量?重點是美元」。這不是玩弄修辭。一台推論伺服器,你可以讓它慢慢地同時服務很多人,也可以讓它飛快地只服務一個人,這兩種用法產出的 token 數量天差地別、值的錢也天差地別,但用的是同一塊矽。
誰在乎 token 的量?重點是美元。
SemiAnalysis 把這件事做成了一個公開平台。InferenceX 前身叫 InferenceMAX,是一個獨立、不偏任何廠商、可重現的開源基準:每天在最新的硬體、最新的模型、最新的推論軟體上自動重跑,因為模型每週在變、推論框架每週改版兩次,任何「拍一張快照」式的基準,發布當天就過時。它同時量三件事對「回應速度」的關係,也就是總吞吐、成本與每瓦產出。
業界埋單的程度,從捐硬體的名單就看得出來:雲端與算力端有 CoreWeave、Crusoe、Nebius、Oracle、微軟、Amazon、Google、OpenAI,加上晶片與軟體生態的協作,涵蓋約 15 種晶片類型、逾 1 億美元的捐贈硬體。當一個平台能同時讓互相競爭的雲廠、晶片廠、模型廠都把機器捐進來跑,代表它量的東西是這個產業真正在乎的。而它量的核心,就是下面這條曲線。
📈那條曲線:吞吐與互動性的拔河
把推論硬體的產出畫成一張圖:橫軸是「互動性」,也就是單一使用者感覺多快,每秒吐幾個 token;縱軸是「吞吐」,也就是這台機器加總起來每秒產出多少 token。兩者是拔河關係,你拉高一邊、另一邊就往下掉。Dylan 給的數字讓這條曲線有了畫面:
| 曲線位置 | 怎麼配置 | 單一使用者速度 | 單機總吞吐 | 每個 token 成本 |
|---|---|---|---|---|
| 批次端 | 一次塞 100 個使用者一起算(大 batch) | 每秒約 10 個 token,慢 | 約 1,000 token/秒 | 最低 |
| 互動端 | 幾乎只服務一個使用者、堆技巧衝速度 | 每秒 250 到 500 個 token,飛快 | 掉到約 250 token/秒 | 貴約 4 倍 |
同一台機器,同樣的矽,光是「你要它慢慢服務一群人,還是飛快服務一個人」這個選擇,每個 token 的成本就差了大約 4 倍。中間還有一整條連續的取捨點。
為什麼有人願意付這 4 倍?Dylan 的答案只有一句:因為用 token 的那個人,比 token 本身貴。如果是整夜慢慢跑的文件批次處理,沒人在乎它跑到天亮,就往批次端擠、把成本壓到最低。但如果 token 餵給的是一個等在螢幕前的工程師,或一個每一秒延遲都在燒錢的即時決策迴圈,那 4 倍溢價就划算。
這條曲線之所以是「母曲線」:硬體、基礎設施、模型、應用層,多數東西都是它的下游。你怎麼設計晶片、怎麼寫 KV cache、模型要多稀疏、產品怎麼定價,追到底,都是在這條曲線上選一個位置。
💵同樣每月 20 美元,你可能讓業者超賺、也可能讓它賠錢
這條曲線聽起來抽象,但它其實就藏在你每個月付的訂閱費裡。SemiAnalysis 有一個觀察:最受歡迎的 AI 訂閱大約是每月 20 美元,但對 Anthropic 這樣的公司,服務同一個使用者的成本依工作負載不同,同一份 20 美元訂閱可以從「超賺」一路滑到「勉強打平」。
差別在哪?就在你把 token 用在曲線的哪一端。一個把 Claude 當偶爾問答的人,跟一個整天掛著 fast mode 跑長脈絡程式任務的人,付一樣的錢,但在這條曲線上站在完全相反的兩端。而定價,已經開始追上這條曲線。這不是預測,是攤在檯面上的產品事實:
定價正在追上曲線
互動端那個「更快、但每個 token 更貴」的位置,已經被明碼標價
連 SemiAnalysis 自己都是這條曲線的重度使用者:它公開揭露自家 token 花費已經來到員工薪資的約三成、年化約 700 萬美元,內部幾乎全用 fast mode,而且逐個任務核算投資報酬率、每天追蹤每個人的 token 花費。一家研究公司自己都在為互動端的速度付溢價,這本身就是曲線分層最好的註腳。
📉成本每年掉 60 倍,錢卻沒有變少
如果推論成本一直往下掉,那 AI 的錢不是應該愈來愈難賺嗎?這是這條曲線最反直覺、也最重要的一段。先看下降有多猛,依 SemiAnalysis 的 InferenceX 量測口徑:
- 等品質的模型,成本每年約降 60 倍
- 每瓦的智慧產出,也就是 intelligence per watt,每年約改善 40 倍
- 光看硬體,Hopper 到 Blackwell 三年,在 DeepSeek 最優部署上約 30 倍改善
這裡有個關鍵的歸因,Dylan 講得很清楚:這 60 倍、40 倍的增益,大宗不是來自更快的晶片,是來自模型層。三年前是 GPT-4,現在換成總參數約 270 億、活躍參數只有 20 億級別的小模型,效果還更強。硬體有貢獻,但真正的爆發在「模型、軟體、晶片一起共同設計」,這條線我們留到下一篇專講。
重點是:成本崩跌,錢卻沒有變少。Dylan 的解釋是一場賽跑,模型能做的、有價值的工作,它的市場規模擴張速度,比算力的擴張速度更快。次世代模型不是把能做的任務變兩倍,是階躍式地打開一整批以前做不了的任務。所以即使每個 token 便宜了 60 倍,能被 token 換成錢的工作總量、以及那些工作的價值,漲得更兇。這就是為什麼一邊喊成本崩跌、一邊還在鬧算力荒:今年約 20GW 上線、明年 30GW 以上,每一季部署的算力都比上一季多,但需求還是追在前面。
這個框架也解釋了「token 價格戰殺不死毛利」的怪象。Dylan 給了一個很硬的錨點,這是他對非上市公司財務的說法、未經 Anthropic 證實,引用請保留這層:他稱 Anthropic 第二季淨利已經轉正、不含股票薪酬,Opus 4.8 的 API 每個 token 毛利率高於 80%。當每加一顆算力都能立刻換成正毛利的 token,價格戰砍掉的是「別人的空間」,不是「自己的命」。
但這套邏輯有一個、而且只有一個致命開關:如果模型進步停滯,這場賽跑的天平就翻過來,算力擴張追過需求擴張、租金鬆動,通縮變成真的通縮。Dylan 的現況判讀是,模型正在幫忙寫基礎設施、加速下一代模型上線,形成一種偽遞迴的自我改進,所以進步還在加速。這條線成不成立,就是整個算力多頭論述的生死線。
🧭曲線兩端,是兩個不同的股票市場
看懂了曲線,最實際的一步是:它其實把 AI 算力切成了兩個不同的股票市場,兩端的贏家邏輯完全不同。先用一張表把三種位置攤開:
| 位置 | 比的是 | 主場硬體 | 選股對應 | 要盯的風險 |
|---|---|---|---|---|
| 批次端 | 每個 token 最便宜 | TPU、Trainium、大 batch GPU | GOOGL 自研鏈、背後 AVGO | 通用算力把成本追回來 |
| 互動端 | 單一串流最快 | Cerebras、Groq | Cerebras(CBRS)純玩家 | 最強模型變大、SRAM 裝不下 |
| 通用算力 | 兩端都能站 | NVIDIA | NVIDIA(NVDA) | 通用性溢價能否維持 |
批次端拚每個 token 最便宜。 這裡的工作負載不在乎單一使用者多快,只在乎單位成本,適合大 batch、高吞吐的部署。對應到選股,這一端把資金導向自研晶片鏈:Google 的 TPU 是批次端代表,而 Broadcom 是這些自研晶片背後的共同設計軍火商,不管哪家雲廠自研,最後很多都繞回它。
互動端拚單一串流最快。 這裡拚的是把單一使用者的速度衝到極限,是 Cerebras、Groq 這類架構的主場。Cerebras 的招式很極端:在單一整片晶圓上做到等同一整個 NVL72 機架,靠繞過缺陷、把資料留在晶片上,避開傳統 GPU 叢集的網路功耗瓶頸。
但互動端有一個 Dylan 點出的結構性風險,值得任何想押 Cerebras、Groq 的人先想清楚。這是一個矛盾:最想用 fast mode 的,是最強的模型;而最強的模型正在變大。一旦旗艦模型走到 10 兆參數以上、還要百萬 token 的長脈絡,SRAM 架構就裝不下、也撐不了那麼長的上下文。「最好的模型才值得用 fast mode」跟「SRAM 裝不下最好的模型」,這兩句話正面對撞。Dylan 給的例外是金融高頻、中頻交易這類小模型的快速推論場景,那裡模型不大、但速度值錢。所以互動端的純玩家不是不能買,是要盯著「最強模型的尺寸走向」這個生死變數。
通用算力是唯一能同時吃兩端的。 NVIDIA 的位置特殊:它是曲線上唯一一個批次端、互動端都能站的通用算力。這也是為什麼即使自研晶片喊得震天價響,通用算力永遠保有一塊結構性席位,因為連實驗室自己,都不知道一年後要用什麼模型架構。
為什麼這對散戶重要。 散戶不該是最後一個知道的人。當市場還在用「缺不缺 GPU」數晶片、為每一則現貨跌價新聞恐慌時,真正在買賣算力的人早就在用這條曲線算帳。你不需要有 InferenceX 那些機器,但你可以拿它的框架:看到任何一則算力或定價新聞,先問它站在曲線哪一端、利多的是哪一批公司。這副眼鏡,比記住任何一檔明牌都耐用。
⚠️風險與注意事項(必讀)
🧭研究結論與追蹤框架
AI 的計價單位不是「缺不缺 GPU」,是吞吐與互動性這條曲線;成本年降 60 倍是通縮力量、但需求擴張更快,所以算力荒與高毛利並存,這套邏輯的存亡全繫於模型是否持續進步。盯這幾條線,數據往哪走、方向就往哪偏:
| 追蹤軸 | 往一個方向 | 往另一個方向 |
|---|---|---|
| 模型尺寸走向 | 若旗艦模型持續往兆級參數加百萬脈絡長 → 偏空 Cerebras/Groq:互動端 SRAM 架構裝不下最值錢的模型,只能守中小模型利基 | 若「小而強」旗艦成常態、小模型打贏大模型 → 偏多 SRAM 快推論陣營:互動端終於跑得動最貴的工作 |
| 等品質成本的年降速率 | 若續維持每年數十倍降幅 → 偏多下游需求端、也就是應用與 API 商:通縮持續擴張可做工作的市場、算力荒延續 | 若年降明顯放緩、模型層增益見頂 → 偏空算力多頭:需求擴張跟不上算力擴張、租金鬆動 |
| 分層定價的滲透 | 若更多實驗室推出批次與即時分明的定價 → 偏多曲線兩端專用硬體:市場承認一體適用時代結束 | 若定價停在一體適用 → 中性:曲線分層的股票含義延後兌現 |
| InferenceX 上的硬體排名 | 若 TPU/Trainium 在批次端的每 token 成本持續領先 → 偏多自研晶片鏈、Google 與 Broadcom:批次端定價權往自研走 | 若 NVIDIA 新世代把批次與互動兩端都吃回去 → 偏多通用算力:一顆晶片通吃全曲線 |
| 模型是否持續進步 (Dylan 的反轉總開關) |
若前沿模型持續階躍、次世代跳升續發生 → 偏多整條算力鏈:偽遞迴自我改進成立、算力荒延續 | 若模型進步撞牆 → 偏空資本支出:通縮擴張邏輯唯一致命傷觸發、算力由荒轉過剩 |
📋一頁速看(給沒時間的人)
五點看懂推論經濟學這條母曲線
- AI 的錢不是照「缺不缺 GPU」算的,是照「吞吐 vs 互動性」這條曲線算的:同一台機器要它快、每個 token 就貴約 4 倍。
- 你每月付一樣的 20 美元,可能讓業者超賺、也可能讓它勉強打平,差別只在你把 token 用在曲線哪一端;fast mode、優先佇列就是這條曲線落到定價上。
- 等品質模型成本每年掉約 60 倍,錢卻沒變少,因為模型能做的有價值工作擴張得更快,這就是成本崩跌與算力荒並存的原因。
- 曲線兩端是兩個股票市場:批次端每 token 最便宜,利好 TPU、Trainium 與背後的 Broadcom;互動端單流最快,是 Cerebras、Groq 的主場,但有「最強模型變大、SRAM 裝不下」的結構風險;NVIDIA 是唯一同時吃兩端的通用算力。
- 整套邏輯的生死線只有一條:模型是否持續進步。停滯的那天,算力荒會翻成算力過剩。
📚來源與參考
本文每個關鍵論點都有對應公開來源、按權威分三級列出。所有連結均為原始公司官方、產業專業媒體或財經媒體分析、不引用散戶論壇或無來源 blog。
第一級公司官方加上 SEC 主要文件
- NVIDIA Blackwell Leads on SemiAnalysis InferenceMAX Benchmarks(NVIDIA 官方技術部落格,確認 InferenceMAX、也就是 InferenceX 前身,為業界採用的獨立推論基準)
- InferenceX by SemiAnalysis — About 與 開源程式碼(平台定位、量測維度、支持機構名單)
第二級產業專業媒體加上分析師報告
- AI Dark Output: The Visible Cost of Invisible Output(SemiAnalysis,AI 產出隱形化與自家 token 花費揭露、約佔薪資三成)
- AI Value Capture — The Shift To Model Labs(SemiAnalysis,價值往模型實驗室集中的論述)
- SemiAnalysis Tokenomics Model(SemiAnalysis 的 token 經濟學研究產品)
第三級財經媒體與 KOL 訪談
- Dylan Patel of SemiAnalysis: Why Hardware-Software Co-Design Is AI's Real 100x(Sequoia Capital「Training Data」節目,本文吞吐-互動性曲線、fast mode 分層、成本年降、算力荒對帳的主要來源)
- SemiAnalysis 創辦人預測:AI 推論將超越石油、2040 年過半算力上太空(財經媒體對同場訪談的整理)
數據股價與目標價來源
- 推論成本、吞吐、每瓦數字:SemiAnalysis InferenceX 公開儀表板 inferencex.semianalysis.com,時間敏感、以當日量測為準。
- 本文未引用個股股價或目標價,提及公司僅為說明曲線角色。
方法事實核查方法論
本文核心框架與數字出自 Dylan Patel 於 Sequoia「Training Data」節目的公開訪談,屬單一來源觀點與 SemiAnalysis 自家量測口徑,正文已逐處標明「依 Dylan Patel」「依 SemiAnalysis InferenceX 口徑」。InferenceX 平台本身以 NVIDIA 官方技術部落格與其開源儲存庫交叉確認存在與定位;SemiAnalysis 自家 token 花費比例以其「AI Dark Output」報告與官方社群貼文交叉。涉及未上市公司財務、也就是 Anthropic 淨利與毛利率,明確標示為受訪者說法、未經當事公司證實,不假裝是事實。
系列內部對讀
- 算力超週期系列 06:NVIDIA 如何用 GPU 配額權力,決定 neocloud 的生死、通用算力為何保有結構性席位的另一半答案。
- 批次端每 token 成本戰:TPU 推論成本反攻、本篇批次端定價權論述的個案延伸。