主題研究 · 算力超週期 · ISSUE #077
CPU 新週期找標的物 Part 2 — 推理軸 KV 快取走 PCIe 的物理鏈、跟一群受惠者怎麼分
Part 1 把架構攤完。這篇進第一條軸:長上下文推論時 KV 快取暴脹走 PCIe 的物理瓶頸。arxiv 論文 + ALAB CEO 在 JPM 大會公開兩層驗證、誰賣這條物理鏈上的零組件、ALAB 是其中一個受惠者但不是唯一。
🔄先回顧:推理軸的物理特性是什麼
三個之後會反覆出現的技術詞先一句話講白:PCIe 是 CPU 跟 GPU 跟儲存跟網卡之間的高速資料通道、AI 伺服器主板訊號的主幹道。KV 快取 是 LLM 推論時暫存過往 token 中間運算結果的記憶體區、避免每次都重算、讓對話可以接續。CXL 是建在 PCIe 之上的新標準、讓 CPU 跟外掛記憶體能像共用同一塊記憶體那樣讀寫、用來擴大伺服器記憶體容量。
推理導向的 agent 跟動作導向不一樣。少數 sub-agent、每個跑長鏈式思考、80%+ 時間花在 GPU 上做推論。經典案例是 Sekar 報告的 DRAM 2027 展望分析:你給 agent 一份市場研究報告、它拆 10 個子研究領域、每個子代理跑長鏈式思考、產生數百到數千個推論 token 做領域綜合。Agent 在思考、不在做事。
這條軸對 CPU 的關鍵需求跟動作軸截然相反。動作軸要的是核數、L3 快取大小、PCIe 通道數。推理軸要的是每個核跑得多快、CPU 跟 GPU 中間那條通道頻寬多大、CPU 端記憶體容量跟頻寬撐不撐得住長上下文推論。核數反而不重要、因為 agent 數不多、每個都長時間黏在 GPU 上跑。
兩條軸的瓶頸位置完全不同。動作軸的瓶頸在 CPU 本體跟 I/O 子系統。推理軸的瓶頸不在 GPU 算力、而在 GPU 跟 CPU 中間那條通道。這個區別決定了兩條軸的受惠零組件層是完全不同的兩組。
🛡️NVIDIA 的私有解:Vera 把通道做進產品內
Sekar 點名推理軸的標竿是 NVIDIA 自己做的 Vera CPU:88 個自家設計的 Olympus ARM 核、跟 GPU 中間用 NVLink-C2C 私有通道、雙向 1.8 TB/s、可以讓 GPU 直接讀 CPU 的記憶體像讀自己的一樣、1.5 TB LPDDR5 SOCAMM 記憶體放在 CPU 旁邊、頻寬 1.2 TB/s。Sekar 對 Vera 的評語是一句英文:「Nothing else comes close」。
關鍵不在 88 核、是 NVLink-C2C 1.8 TB/s 雙向頻寬把 CPU↔GPU 通道升級到 GPU 內部記憶體頻寬的等級。一般 PCIe Gen 5 x16 全雙工只有 128 GB/s、PCIe Gen 6 翻倍到 256 GB/s。Vera 把這條通道直接拉到 1.8 TB/s、是 PCIe Gen 6 的 7 倍。CPU 端的 LPDDR5 SOCAMM 又比一般 DDR5 RDIMM 快、容量大。整套設計繞掉了一般 reasoning 配置會撞上的物理瓶頸。
但 Vera 是 NVIDIA 生態鎖定。買 Vera 就鎖死 ARM CPU + 必須配 Rubin GPU + 走 NVIDIA 自家 NVLink Fusion。對 NVIDIA 以外的所有人 — 包含使用 AMD MI300、Intel Gaudi、AWS Trainium、Google TPU 的、或在標準 GPU 平台跑開放系統的客戶 — 這條私有解走不通。
📊但市場 90% 是非 Vera 配置
CPU↔GPU 通道在非 Vera 配置裡都是 PCIe。Intel Xeon 配 NVIDIA H200 或 B200 走 PCIe Gen 5/6。AMD EPYC 配 MI300 系列走 PCIe。Intel Xeon 配 Intel Gaudi 走 PCIe。AWS Trainium、Google TPU、Microsoft Maia 這些超大型雲端業者客製 ASIC 大多也是 PCIe 接主機 CPU。
arxiv 那篇 Georgia Tech 跟 Intel 共同發的「A CPU-Centric Perspective on Agentic AI」、編號 2511.00739、實測就是 Intel Emerald Rapids 48 核 + NVIDIA B200 的配置 — 完全符合「非 Vera 市場」場景。下面這段物理鏈論文寫得很清楚。