推理軸 KV 快取走 PCIe 物理鏈 — 跟一群受惠者怎麼分 | Trend Core
所有研究 ALAB 90% AI 伺服器滲透
系列 Part 2 · 推理軸深度

主題研究 · 算力超週期 · ISSUE #077

CPU 新週期找標的物 Part 2 — 推理軸 KV 快取走 PCIe 的物理鏈、跟一群受惠者怎麼分

Part 1 把架構攤完。這篇進第一條軸:長上下文推論時 KV 快取暴脹走 PCIe 的物理瓶頸。arxiv 論文 + ALAB CEO 在 JPM 大會公開兩層驗證、誰賣這條物理鏈上的零組件、ALAB 是其中一個受惠者但不是唯一。

KV 快取物理瓶頸
arxiv §4.3.2
走 PCIe 頻寬低一個量級
ALAB AI 伺服器滲透率
90%
JPM 分析師第三方背書
ALAB 內容值/平台 4 年
10×
低於 $100 → $1,000+
本系列篇數
2 / 4
推理軸深度
SIGNAL #1 · 物理鏈
KV 快取暴脹走 PCIe 的傳輸停頓
arxiv §4.3.2 原文:KV cache 溢出 host memory、PCIe 頻寬比 GPU 內部記憶體低一個量級、cap end-to-end throughput
SIGNAL #2 · 公司背書
ALAB CEO 在 JPM 大會公開驗證
Mohan:「bottleneck shifts towards memory... this is where we see additional applications for our Leo products」+ 新超大型雲端業者 KV cache custom Leo 設計案、2027 出貨
SIGNAL #3 · 受惠者分散
三段受惠者地圖、ALAB 並列多家
PCIe retimer(ALAB Aries / Microchip / Broadcom / Credo)+ CXL 記憶體(ALAB Leo / Samsung / Micron / Rambus)+ HBM 容量(MU / SK Hynix / Samsung)
一句話結論
推理軸的物理鏈不是猜測、有 arxiv 學術論文 + ALAB CEO 在 JPM 大會公開兩層驗證。Vera 用 NVLink-C2C 私有通道繞掉、但市場 90% 是非 Vera 配置必須走 PCIe、PCIe 跟 CXL 記憶體擴展是雙重剛需。受惠零組件層分三段、ALAB 在三段都有產品、但 MU、SK Hynix、Samsung、Rambus、Microchip、Broadcom、Credo 全部並列、不是 ALAB 獨家賽道。CPU 新週期對 ALAB 是順風不是主成長論點。

🔄先回顧:推理軸的物理特性是什麼

三個之後會反覆出現的技術詞先一句話講白:PCIe 是 CPU 跟 GPU 跟儲存跟網卡之間的高速資料通道、AI 伺服器主板訊號的主幹道。KV 快取 是 LLM 推論時暫存過往 token 中間運算結果的記憶體區、避免每次都重算、讓對話可以接續。CXL 是建在 PCIe 之上的新標準、讓 CPU 跟外掛記憶體能像共用同一塊記憶體那樣讀寫、用來擴大伺服器記憶體容量。

推理導向的 agent 跟動作導向不一樣。少數 sub-agent、每個跑長鏈式思考、80%+ 時間花在 GPU 上做推論。經典案例是 Sekar 報告的 DRAM 2027 展望分析:你給 agent 一份市場研究報告、它拆 10 個子研究領域、每個子代理跑長鏈式思考、產生數百到數千個推論 token 做領域綜合。Agent 在思考、不在做事。

這條軸對 CPU 的關鍵需求跟動作軸截然相反。動作軸要的是核數、L3 快取大小、PCIe 通道數。推理軸要的是每個核跑得多快、CPU 跟 GPU 中間那條通道頻寬多大、CPU 端記憶體容量跟頻寬撐不撐得住長上下文推論。核數反而不重要、因為 agent 數不多、每個都長時間黏在 GPU 上跑。

兩條軸的瓶頸位置完全不同。動作軸的瓶頸在 CPU 本體跟 I/O 子系統。推理軸的瓶頸不在 GPU 算力、而在 GPU 跟 CPU 中間那條通道。這個區別決定了兩條軸的受惠零組件層是完全不同的兩組。


🛡️NVIDIA 的私有解:Vera 把通道做進產品內

Sekar 點名推理軸的標竿是 NVIDIA 自己做的 Vera CPU:88 個自家設計的 Olympus ARM 核、跟 GPU 中間用 NVLink-C2C 私有通道、雙向 1.8 TB/s、可以讓 GPU 直接讀 CPU 的記憶體像讀自己的一樣、1.5 TB LPDDR5 SOCAMM 記憶體放在 CPU 旁邊、頻寬 1.2 TB/s。Sekar 對 Vera 的評語是一句英文:「Nothing else comes close」。

關鍵不在 88 核、是 NVLink-C2C 1.8 TB/s 雙向頻寬把 CPU↔GPU 通道升級到 GPU 內部記憶體頻寬的等級。一般 PCIe Gen 5 x16 全雙工只有 128 GB/s、PCIe Gen 6 翻倍到 256 GB/s。Vera 把這條通道直接拉到 1.8 TB/s、是 PCIe Gen 6 的 7 倍。CPU 端的 LPDDR5 SOCAMM 又比一般 DDR5 RDIMM 快、容量大。整套設計繞掉了一般 reasoning 配置會撞上的物理瓶頸。

但 Vera 是 NVIDIA 生態鎖定。買 Vera 就鎖死 ARM CPU + 必須配 Rubin GPU + 走 NVIDIA 自家 NVLink Fusion。對 NVIDIA 以外的所有人 — 包含使用 AMD MI300、Intel Gaudi、AWS Trainium、Google TPU 的、或在標準 GPU 平台跑開放系統的客戶 — 這條私有解走不通。


📊但市場 90% 是非 Vera 配置

CPU↔GPU 通道在非 Vera 配置裡都是 PCIe。Intel Xeon 配 NVIDIA H200 或 B200 走 PCIe Gen 5/6。AMD EPYC 配 MI300 系列走 PCIe。Intel Xeon 配 Intel Gaudi 走 PCIe。AWS Trainium、Google TPU、Microsoft Maia 這些超大型雲端業者客製 ASIC 大多也是 PCIe 接主機 CPU。

arxiv 那篇 Georgia Tech 跟 Intel 共同發的「A CPU-Centric Perspective on Agentic AI」、編號 2511.00739、實測就是 Intel Emerald Rapids 48 核 + NVIDIA B200 的配置 — 完全符合「非 Vera 市場」場景。下面這段物理鏈論文寫得很清楚。