市場還在問「缺不缺 GPU」,但 AI 的錢是照一條曲線算的|算力超週期系列 07|Trend Core
所有研究 NVDA 通用算力 曲線唯一雙棲
看世界的框架 · 判讀算力與定價新聞的一副眼鏡

算力超週期系列 07 · 推論經濟學 · ISSUE #145

市場還在問「缺不缺 GPU」,但 AI 的錢是照一條曲線算的

SemiAnalysis 創辦人 Dylan Patel 攤開 InferenceX,說了句反直覺的話:別看 token 量,看美元。看懂吞吐與互動性這條母曲線,後面半年那些「缺不缺 GPU」「誰又砍價」的新聞,你就能自己判讀。

同機兩端成本差
4 倍
同一台機器、慢服務一群 vs 快服務一個
等品質模型年降
60 倍
主要來自模型層、非更快的晶片
每日跑基準晶片
~15 種
InferenceX 每天自動重跑
Opus 4.8 每 token 毛利
>80%
依 Dylan 說法、未經 Anthropic 證實
一句話結論
AI 的計價單位不是「缺不缺 GPU」,是吞吐與互動性這條曲線:同一台機器要它跑得快,每個 token 就貴約 4 倍;等品質模型成本每年掉 60 倍,需求擴張卻更快,所以算力荒與高毛利並存。這套邏輯的存亡,全繫於模型是否持續進步這一個開關。

SemiAnalysis 創辦人 Dylan Patel 在 Sequoia 的訪談裡攤開一個叫 InferenceX 的平台,每天在約 15 種晶片上自動跑推論基準,業界為它捐了逾 1 億美元硬體。然後他說了句反直覺的話:別看 token 量,看美元。這句話背後,是一條決定 AI 每一分算力值多少錢的曲線。看懂它,後面半年那些「缺不缺 GPU」「誰又砍價」的新聞,你就能自己判讀。

🎯市場在用錯的單位計價 AI

打開財經版面,AI 的算力故事幾乎都繞著同一個問題轉:還缺不缺 GPU、H100 現貨跌了沒、誰又囤了幾萬張卡。這是把算力當成一種同質商品在數,像數油桶一樣數晶片。

但真正在買算力、賣 token 的人,不是這樣算帳的。Dylan Patel 的立場很直白:重要的不是你跑出多少 token,是那些 token 值多少美元。他原話是「誰在乎 token 的量?重點是美元」。這不是玩弄修辭。一台推論伺服器,你可以讓它慢慢地同時服務很多人,也可以讓它飛快地只服務一個人,這兩種用法產出的 token 數量天差地別、值的錢也天差地別,但用的是同一塊矽。

誰在乎 token 的量?重點是美元。

SemiAnalysis 把這件事做成了一個公開平台。InferenceX 前身叫 InferenceMAX,是一個獨立、不偏任何廠商、可重現的開源基準:每天在最新的硬體、最新的模型、最新的推論軟體上自動重跑,因為模型每週在變、推論框架每週改版兩次,任何「拍一張快照」式的基準,發布當天就過時。它同時量三件事對「回應速度」的關係,也就是總吞吐、成本與每瓦產出。

業界埋單的程度,從捐硬體的名單就看得出來:雲端與算力端有 CoreWeave、Crusoe、Nebius、Oracle、微軟、Amazon、Google、OpenAI,加上晶片與軟體生態的協作,涵蓋約 15 種晶片類型、逾 1 億美元的捐贈硬體。當一個平台能同時讓互相競爭的雲廠、晶片廠、模型廠都把機器捐進來跑,代表它量的東西是這個產業真正在乎的。而它量的核心,就是下面這條曲線。


📈那條曲線:吞吐與互動性的拔河

把推論硬體的產出畫成一張圖:橫軸是「互動性」,也就是單一使用者感覺多快,每秒吐幾個 token;縱軸是「吞吐」,也就是這台機器加總起來每秒產出多少 token。兩者是拔河關係,你拉高一邊、另一邊就往下掉。Dylan 給的數字讓這條曲線有了畫面:

曲線位置怎麼配置單一使用者速度單機總吞吐每個 token 成本
批次端 一次塞 100 個使用者一起算(大 batch) 每秒約 10 個 token,慢 約 1,000 token/秒 最低
互動端 幾乎只服務一個使用者、堆技巧衝速度 每秒 250 到 500 個 token,飛快 掉到約 250 token/秒 貴約 4 倍

同一台機器,同樣的矽,光是「你要它慢慢服務一群人,還是飛快服務一個人」這個選擇,每個 token 的成本就差了大約 4 倍。中間還有一整條連續的取捨點。

為什麼有人願意付這 4 倍?Dylan 的答案只有一句:因為用 token 的那個人,比 token 本身貴。如果是整夜慢慢跑的文件批次處理,沒人在乎它跑到天亮,就往批次端擠、把成本壓到最低。但如果 token 餵給的是一個等在螢幕前的工程師,或一個每一秒延遲都在燒錢的即時決策迴圈,那 4 倍溢價就划算。

這條曲線之所以是「母曲線」:硬體、基礎設施、模型、應用層,多數東西都是它的下游。你怎麼設計晶片、怎麼寫 KV cache、模型要多稀疏、產品怎麼定價,追到底,都是在這條曲線上選一個位置。


💵同樣每月 20 美元,你可能讓業者超賺、也可能讓它賠錢

這條曲線聽起來抽象,但它其實就藏在你每個月付的訂閱費裡。SemiAnalysis 有一個觀察:最受歡迎的 AI 訂閱大約是每月 20 美元,但對 Anthropic 這樣的公司,服務同一個使用者的成本依工作負載不同,同一份 20 美元訂閱可以從「超賺」一路滑到「勉強打平」。

差別在哪?就在你把 token 用在曲線的哪一端。一個把 Claude 當偶爾問答的人,跟一個整天掛著 fast mode 跑長脈絡程式任務的人,付一樣的錢,但在這條曲線上站在完全相反的兩端。而定價,已經開始追上這條曲線。這不是預測,是攤在檯面上的產品事實:

1

定價正在追上曲線

互動端那個「更快、但每個 token 更貴」的位置,已經被明碼標價

互動端
Anthropic 的 fast mode 明顯貴於一般模式,它賣的就是曲線互動端「更快、每個 token 更貴」的位置。
互動端
OpenAI 的 priority queue 優先佇列本質是同一件事:付更多錢,換曲線上更靠互動端的服務。
趨勢
Dylan 判斷 AI 基礎設施現在還被當成「一體適用」,接下來會走向明確分層:批次工作負載一種價、即時工作負載另一種價。

連 SemiAnalysis 自己都是這條曲線的重度使用者:它公開揭露自家 token 花費已經來到員工薪資的約三成、年化約 700 萬美元,內部幾乎全用 fast mode,而且逐個任務核算投資報酬率、每天追蹤每個人的 token 花費。一家研究公司自己都在為互動端的速度付溢價,這本身就是曲線分層最好的註腳。


📉成本每年掉 60 倍,錢卻沒有變少

如果推論成本一直往下掉,那 AI 的錢不是應該愈來愈難賺嗎?這是這條曲線最反直覺、也最重要的一段。先看下降有多猛,依 SemiAnalysis 的 InferenceX 量測口徑:

  • 等品質的模型,成本每年約降 60 倍
  • 每瓦的智慧產出,也就是 intelligence per watt,每年約改善 40 倍
  • 光看硬體,Hopper 到 Blackwell 三年,在 DeepSeek 最優部署上約 30 倍改善

這裡有個關鍵的歸因,Dylan 講得很清楚:這 60 倍、40 倍的增益,大宗不是來自更快的晶片,是來自模型層。三年前是 GPT-4,現在換成總參數約 270 億、活躍參數只有 20 億級別的小模型,效果還更強。硬體有貢獻,但真正的爆發在「模型、軟體、晶片一起共同設計」,這條線我們留到下一篇專講。

重點是:成本崩跌,錢卻沒有變少。Dylan 的解釋是一場賽跑,模型能做的、有價值的工作,它的市場規模擴張速度,比算力的擴張速度更快。次世代模型不是把能做的任務變兩倍,是階躍式地打開一整批以前做不了的任務。所以即使每個 token 便宜了 60 倍,能被 token 換成錢的工作總量、以及那些工作的價值,漲得更兇。這就是為什麼一邊喊成本崩跌、一邊還在鬧算力荒:今年約 20GW 上線、明年 30GW 以上,每一季部署的算力都比上一季多,但需求還是追在前面。

這個框架也解釋了「token 價格戰殺不死毛利」的怪象。Dylan 給了一個很硬的錨點,這是他對非上市公司財務的說法、未經 Anthropic 證實,引用請保留這層:他稱 Anthropic 第二季淨利已經轉正、不含股票薪酬,Opus 4.8 的 API 每個 token 毛利率高於 80%。當每加一顆算力都能立刻換成正毛利的 token,價格戰砍掉的是「別人的空間」,不是「自己的命」。

但這套邏輯有一個、而且只有一個致命開關:如果模型進步停滯,這場賽跑的天平就翻過來,算力擴張追過需求擴張、租金鬆動,通縮變成真的通縮。Dylan 的現況判讀是,模型正在幫忙寫基礎設施、加速下一代模型上線,形成一種偽遞迴的自我改進,所以進步還在加速。這條線成不成立,就是整個算力多頭論述的生死線。


🧭曲線兩端,是兩個不同的股票市場

看懂了曲線,最實際的一步是:它其實把 AI 算力切成了兩個不同的股票市場,兩端的贏家邏輯完全不同。先用一張表把三種位置攤開:

位置比的是主場硬體選股對應要盯的風險
批次端 每個 token 最便宜 TPU、Trainium、大 batch GPU GOOGL 自研鏈、背後 AVGO 通用算力把成本追回來
互動端 單一串流最快 Cerebras、Groq Cerebras(CBRS)純玩家 最強模型變大、SRAM 裝不下
通用算力 兩端都能站 NVIDIA NVIDIA(NVDA 通用性溢價能否維持

批次端拚每個 token 最便宜。 這裡的工作負載不在乎單一使用者多快,只在乎單位成本,適合大 batch、高吞吐的部署。對應到選股,這一端把資金導向自研晶片鏈:Google 的 TPU 是批次端代表,而 Broadcom 是這些自研晶片背後的共同設計軍火商,不管哪家雲廠自研,最後很多都繞回它。

互動端拚單一串流最快。 這裡拚的是把單一使用者的速度衝到極限,是 Cerebras、Groq 這類架構的主場。Cerebras 的招式很極端:在單一整片晶圓上做到等同一整個 NVL72 機架,靠繞過缺陷、把資料留在晶片上,避開傳統 GPU 叢集的網路功耗瓶頸。

但互動端有一個 Dylan 點出的結構性風險,值得任何想押 Cerebras、Groq 的人先想清楚。這是一個矛盾:最想用 fast mode 的,是最強的模型;而最強的模型正在變大。一旦旗艦模型走到 10 兆參數以上、還要百萬 token 的長脈絡,SRAM 架構就裝不下、也撐不了那麼長的上下文。「最好的模型才值得用 fast mode」跟「SRAM 裝不下最好的模型」,這兩句話正面對撞。Dylan 給的例外是金融高頻、中頻交易這類小模型的快速推論場景,那裡模型不大、但速度值錢。所以互動端的純玩家不是不能買,是要盯著「最強模型的尺寸走向」這個生死變數。

通用算力是唯一能同時吃兩端的。 NVIDIA 的位置特殊:它是曲線上唯一一個批次端、互動端都能站的通用算力。這也是為什麼即使自研晶片喊得震天價響,通用算力永遠保有一塊結構性席位,因為連實驗室自己,都不知道一年後要用什麼模型架構。

為什麼這對散戶重要。 散戶不該是最後一個知道的人。當市場還在用「缺不缺 GPU」數晶片、為每一則現貨跌價新聞恐慌時,真正在買賣算力的人早就在用這條曲線算帳。你不需要有 InferenceX 那些機器,但你可以拿它的框架:看到任何一則算力或定價新聞,先問它站在曲線哪一端、利多的是哪一批公司。這副眼鏡,比記住任何一檔明牌都耐用。


⚠️風險與注意事項(必讀)

01通縮擴張的邏輯有唯一死穴:模型進步停滯
整套「成本崩跌但錢沒變少」建立在「模型持續進步、需求擴張追過算力擴張」之上。這個前提一旦破掉,模型撞牆、進步停滯,結論會完全反轉成算力過剩。這不是背景風險,是這篇的中軸假設。
02核心數字幾乎全出自 Dylan Patel 一人口徑
60 倍、40 倍、4 倍、每 GW 的量級、Anthropic 的毛利,都是他在 Sequoia 訪談與 SemiAnalysis 研究裡的說法。InferenceX 是公開可查的平台,但那些「年降倍數」與「未上市公司毛利」屬單一來源。尤其 Anthropic 第二季淨利轉正、Opus 4.8 毛利逾 80%,未經 Anthropic 官方證實,請當成研究框架、不是財報事實。
03這是一條「看世界的曲線」,不是一張買賣清單
文中提及的公司都是為了說明曲線兩端的角色,不代表任何一檔在當前價位可買。框架幫你判讀新聞,不告訴你進場點。
04前瞻性數字請當方向、不當時間表
推論將超越石油、2030 年逾 100GW、2040 年算力過半上太空,這些是 Dylan 的長期預測,時間點與量級都可能大幅位移。

🧭研究結論與追蹤框架

AI 的計價單位不是「缺不缺 GPU」,是吞吐與互動性這條曲線;成本年降 60 倍是通縮力量、但需求擴張更快,所以算力荒與高毛利並存,這套邏輯的存亡全繫於模型是否持續進步。盯這幾條線,數據往哪走、方向就往哪偏:

追蹤軸往一個方向往另一個方向
模型尺寸走向 若旗艦模型持續往兆級參數加百萬脈絡長 → 偏空 Cerebras/Groq:互動端 SRAM 架構裝不下最值錢的模型,只能守中小模型利基 若「小而強」旗艦成常態、小模型打贏大模型 → 偏多 SRAM 快推論陣營:互動端終於跑得動最貴的工作
等品質成本的年降速率 若續維持每年數十倍降幅 → 偏多下游需求端、也就是應用與 API 商:通縮持續擴張可做工作的市場、算力荒延續 若年降明顯放緩、模型層增益見頂 → 偏空算力多頭:需求擴張跟不上算力擴張、租金鬆動
分層定價的滲透 若更多實驗室推出批次與即時分明的定價 → 偏多曲線兩端專用硬體:市場承認一體適用時代結束 若定價停在一體適用 → 中性:曲線分層的股票含義延後兌現
InferenceX 上的硬體排名 若 TPU/Trainium 在批次端的每 token 成本持續領先 → 偏多自研晶片鏈、Google 與 Broadcom:批次端定價權往自研走 若 NVIDIA 新世代把批次與互動兩端都吃回去 → 偏多通用算力:一顆晶片通吃全曲線
模型是否持續進步
(Dylan 的反轉總開關)
若前沿模型持續階躍、次世代跳升續發生 → 偏多整條算力鏈:偽遞迴自我改進成立、算力荒延續 若模型進步撞牆 → 偏空資本支出:通縮擴張邏輯唯一致命傷觸發、算力由荒轉過剩

📋一頁速看(給沒時間的人)

算力超週期系列 07 | Trend Core | 2026-07-04

五點看懂推論經濟學這條母曲線

  • AI 的錢不是照「缺不缺 GPU」算的,是照「吞吐 vs 互動性」這條曲線算的:同一台機器要它快、每個 token 就貴約 4 倍。
  • 你每月付一樣的 20 美元,可能讓業者超賺、也可能讓它勉強打平,差別只在你把 token 用在曲線哪一端;fast mode、優先佇列就是這條曲線落到定價上。
  • 等品質模型成本每年掉約 60 倍,錢卻沒變少,因為模型能做的有價值工作擴張得更快,這就是成本崩跌與算力荒並存的原因。
  • 曲線兩端是兩個股票市場:批次端每 token 最便宜,利好 TPU、Trainium 與背後的 Broadcom;互動端單流最快,是 Cerebras、Groq 的主場,但有「最強模型變大、SRAM 裝不下」的結構風險;NVIDIA 是唯一同時吃兩端的通用算力。
  • 整套邏輯的生死線只有一條:模型是否持續進步。停滯的那天,算力荒會翻成算力過剩。

📚來源與參考

本文每個關鍵論點都有對應公開來源、按權威分三級列出。所有連結均為原始公司官方、產業專業媒體或財經媒體分析、不引用散戶論壇或無來源 blog。

第一級公司官方加上 SEC 主要文件

第二級產業專業媒體加上分析師報告

第三級財經媒體與 KOL 訪談

數據股價與目標價來源

  • 推論成本、吞吐、每瓦數字:SemiAnalysis InferenceX 公開儀表板 inferencex.semianalysis.com,時間敏感、以當日量測為準。
  • 本文未引用個股股價或目標價,提及公司僅為說明曲線角色。

方法事實核查方法論

本文核心框架與數字出自 Dylan Patel 於 Sequoia「Training Data」節目的公開訪談,屬單一來源觀點與 SemiAnalysis 自家量測口徑,正文已逐處標明「依 Dylan Patel」「依 SemiAnalysis InferenceX 口徑」。InferenceX 平台本身以 NVIDIA 官方技術部落格與其開源儲存庫交叉確認存在與定位;SemiAnalysis 自家 token 花費比例以其「AI Dark Output」報告與官方社群貼文交叉。涉及未上市公司財務、也就是 Anthropic 淨利與毛利率,明確標示為受訪者說法、未經當事公司證實,不假裝是事實。

系列內部對讀


本報告為 Trend Core 研究團隊基於公開資料整理之研究內容,不構成投資建議。本文是一套判讀 AI 算力與定價新聞的分析框架,文中提及 NVDA、AVGO、GOOGL、CBRS 等公司僅為說明吞吐-互動性曲線兩端的角色,非對任何單一標的的配置或買賣建議。核心數字多出自單一受訪者口徑與 SemiAnalysis 自家量測,涉及未上市公司財務者未經當事公司證實,請當研究框架、不當財報事實。所有標的均為公開交易股票,存在價格波動、市場、流動性、匯率與政策風險,過去績效不保證未來結果。投資決策應基於個人財務狀況、風險承受能力,並建議諮詢合格的財務顧問。報告中所有時間點的數據以發布日 2026-07-04 為基準,後續變化請以即時資料為準。