主題研究 · 算力超週期 · ISSUE #076
從 CPU 新週期共識到可布局的標的物 — 借一份半導體老兵的研究報告,把研究架構先攤開
上一篇證據地圖把 CPU 新週期共識面攤完了。這篇借 Vikram Sekar 的研究報告、用第一人稱把 CPU 重新變重要的物理底層再講一次、為下一步挖具體標的開門。
📖借一份報告,把架構重新講一次
上一篇我把 CPU 新週期的證據攤完了:AMD CEO Lisa Su 上修伺服器 CPU 市場規模到 2030 年 $120B、Intel CEO Lip-Bu Tan 公開 CPU:GPU 從 1:8 往 1:1 走、Meta 跟 AWS 簽下數千萬顆 Graviton 核心、Arm 35 年來第一次自己做 AGI CPU。共識面已成、不是反共識的觀點。問題是知道之後、要找哪些標的、這篇開始挖。
三個之後會反覆出現的技術詞先一句話講白:PCIe 是 CPU 跟 GPU 跟儲存跟網卡之間的高速資料通道、AI 伺服器主板訊號的主幹道。KV 快取 是 LLM 推論時暫存過往 token 中間運算結果的記憶體區、避免每次都重算、讓對話可以接續。CXL 是建在 PCIe 之上的新標準、讓 CPU 跟外掛記憶體能像共用同一塊記憶體那樣讀寫、用來擴大伺服器記憶體容量。
第一波 CPU 新週期已經被市場反映過一輪:Intel 30 天 +86%、Dell +65%。如果你只在「Intel 還是 AMD」這層挑、其實是在補位、不是發現超額收益。要找下一波還沒被定價的標的、得往下鑽到 agentic 工作負載物理底層、看是哪些零組件被瓶頸推上來。
我研究這條路的時候找到一份 PDF — Vikram Sekar 寫的《The CPU Bottleneck in Agentic AI》。Sekar 是電子工程博士、半導體業 15 年經驗、自己經營一個叫 SemiExponent 的電子報。這份報告不長、29 頁、把 CPU 重新變重要的物理底層講得乾淨:兩個核心觀察 — agentic 跟過去兩年的純推論是不同物種、推理 vs 動作 是一條光譜跟兩個極端代表 CPU。
下面我借這份報告的論述、用第一人稱把同樣的東西再講一次。不是學術轉述、是把我自己理解的版本給你。讀完你會拿到一張地圖、知道後面要往哪挖標的。
🔄Agentic 跟過去兩年的純推論是不同物種
過去兩年 LLM 用法基本上是這樣:你打字進去、CPU 把文字切分為數字 token、丟給 GPU、GPU 跑模型生回應 token、CPU 再還原成文字回給你。CPU 在這個流程裡只是從屬節點、輕度負載、幾乎不會是瓶頸。所以過去兩年所有敘事都押 GPU、CPU 被當配角、是有道理的。
Agentic AI 的工作流程不一樣。你打字進去、第一次推論不是直接生回應、是生「執行計畫」。這個計畫展開成多個子代理並行跑:有的去打外部 API、有的查資料庫、有的執行 Python 或 Bash 程式、有的做長鏈式思考、有的瀏覽網頁。每個子代理都有自己的推論循環、CPU 要管所有子代理的依賴關係、誰先完成、結果怎麼整合、整合完要不要再跑一輪反思推論。CPU 從輔助配角變成命令中樞。
具體一點:想像一個客服代理上線跑起來。它要讀客戶資料、查訂單狀態打 API、拉物流資料從第三方服務、更新 CRM、產生短回覆、寄信。每次處理一個請求要做 5-10 次工具呼叫、中間夾短推論。尖峰時 500+ 個 agent 並行跑。GPU 只負責中間那短短的推論部分、70-80% 時間花在 CPU 跑工具執行跟 I/O。
這個變化的核心是一句話:CPU 核數、每個核處理的任務量、記憶體階層跟頻寬、決定 GPU 的利用率、整體吞吐量、跟總體擁有成本。CPU 跟不上、GPU 就在等。GPU 利用率掉、總體擁有成本就崩。所以雲端業者花這麼多錢買 GPU、必須把 CPU 端跟著一起升、不然 GPU 是浪費的。
這就是 1:8 走向 1:1 的物理底層。不是「散戶覺得 CPU 變重要」、是物理上 GPU 餵不飽就是浪費、CPU 必須跟上。
⚖️推理 vs 動作 — 一條光譜跟兩個極端 CPU
Agentic 工作負載內部其實還要再切。同樣是 agent 跑、但「思考型」跟「做事型」對 CPU 的需求不一樣。
NVIDIA Vera
AMD Venice Dense
3.1推理導向 — 少量 agent、長鏈式思考、CPU↔GPU 通道是命門
推理導向是這種:你給一個 agent 一份市場研究報告、要它分析 DRAM 2027 展望。Agent 拆成 10 個子研究領域、每個子代理跑長鏈式思考、產生數百到數千個推論 token 做領域綜合。偶爾檢索一下文件、但 80%+ 時間花在 GPU 推論上。Agent 在思考、不在做事。
這條軸對 CPU 的關鍵需求是:每個核跑得多快、CPU 跟 GPU 中間那條通道頻寬多大、CPU 端記憶體容量跟頻寬撐不撐得住長上下文推論。核數反而不是最關鍵 — 因為 agent 數不多、每個都長時間在 GPU 上跑。
這條軸的標竿 CPU 是 NVIDIA 自己做的 Vera:88 個自家設計的 Olympus ARM 核、跟 GPU 中間用 NVLink-C2C 私有通道、雙向 1.8 TB/s、可以讓 GPU 直接讀 CPU 的記憶體像讀自己的一樣、1.5 TB LPDDR5 SOCAMM 記憶體放在 CPU 旁邊、頻寬 1.2 TB/s。Sekar 對 Vera 的評語是一句英文「Nothing else comes close」— 用 NVLink-C2C 把 CPU↔GPU 通道做進產品內、繞掉一般 PCIe 的瓶頸、這是定義推理端的關鍵。
3.2動作導向 — 大量 agent 並行、CPU 核數跟 I/O 是命門
動作導向是另一個極端:剛剛客服代理的例子就是這條軸的典型 — 大量 agent 並行、每個都在密集打工具、推論只佔零頭、CPU 端是火力中心。
這條軸對 CPU 的關鍵需求是:核數要夠多、L3 快取要大、PCIe 通道要多、x86 對工具的相容性要廣、能撐住大批並行的 NUMA 排程。CPU↔GPU 通道反而沒那麼關鍵 — 因為 GPU 在這條軸是配角。
這條軸的標竿 CPU 是 AMD 即將推出的 Venice Dense:256 個 Zen6c 核、開了 SMT 變 512 個執行緒、L3 快取加總 1 GB、x86 對工具的相容性最廣、EPYC 系列傳統的每瓦效能優勢。Sekar 對 Venice Dense 的評語是動作端的標竿、但有缺點 — 256 核用多 chiplet 設計、NUMA domain 多、跨 chiplet 排程要小心。
兩個極端中間還有一堆變體 — AWS Graviton5、Google Axion、Microsoft Cobalt、Arm 自己的 AGI CPU、Ampere、華為崑鵬 — 各自落在這條光譜不同位置。Intel Diamond Rapids 192 核掉 SMT 變成 192 執行緒、被 Venice Dense 512 執行緒直接拉開 2.7 倍執行緒密度差距、是 Sekar 報告裡最大的反方案例。
📊物理證據:一篇 arxiv 論文把數字攤出來
光講框架不夠。Sekar 在報告裡引了一篇 2025 年 11 月 Georgia Tech 跟 Intel 共同發的 arxiv 論文《A CPU-Centric Perspective on Agentic AI》、編號 2511.00739。這篇論文跑了 5 個真實 agent 工作負載 — Toolformer、SWE-Agent、Haystack RAG、ChemCrow、LangChain — 在 Intel Emerald Rapids 48 核加 NVIDIA B200 上實測。三個關鍵數字。
第一、agent 多數時間在做事、不在思考。Haystack RAG 這個工作負載、檢索階段花 6 到 8 秒、佔總執行時間的 84.5 到 90.6%、對應的 LLM 推論部分小於 0.5 秒。SWE-Agent 的 Bash 跟 Python 沙箱執行階段佔 43.8 到 78.7%。論文的話:工具處理在 CPU 上佔 agentic 工作負載總延遲最高 90.6%。
第二、長上下文推論時、KV 快取暴脹超過 GPU 的 HBM 容量、就會溢出到主機記憶體。GPU 跟主機記憶體之間是 PCIe、頻寬比 GPU 內部記憶體低一個量級、這個傳輸停頓直接卡住整體吞吐。推理工作負載的物理瓶頸、不在 GPU 算力、在 GPU 跟 CPU 中間那條通道。Vera 之所以重要、就是因為 NVLink-C2C 1.8 TB/s 把這條通道升級到 GPU 內部記憶體頻寬的等級。
第三、NUMA placement 影響有多大。Agent 落在不同 NUMA node 的記憶體延遲差、可以到上千個 cycle、性能變異到 2.37 倍。這直接點出 Sekar 講的 Venice Dense 256 核問題 — 加核不是萬靈丹、跨 chiplet 排程沒做好就是空有核。
還有一個反直覺的數字。CPU 能耗佔總動態能耗、小 batch 時約 20%、大 batch 推到 128 時上升到 44%、絕對量是小 batch 的 86.7 倍。雲端業者的電費帳單上看得到、agentic 工作負載的總體擁有成本結構跟純推論完全不同。
把這幾個數字攤開、結論很清楚:CPU 升級不是「再加幾顆核」就解決的事、而是記憶體跟 I/O 整個子系統的物理升級。下一步要回答的、是升級哪些零組件、誰賣這些零組件。
🗺️找什麼標的、這個系列接下來這樣挖
從上面的論述、我手上現在有一張地圖。三個受惠軸、每個對應不同零組件層:
| 軸 | 物理瓶頸 | 受惠零組件層 |
|---|---|---|
| 推理軸 | 長上下文推論、KV 快取暴脹、GPU↔CPU 通道是瓶頸 | 高頻寬 CPU-GPU 互連、PCIe 5/6 retimer、CXL 記憶體擴展、HBM 容量 |
| 動作軸 | 大量子代理並行、工具呼叫的 I/O 把 CPU 塞爆 | 高核數 x86 CPU、PCIe 通道數擴張、互連交換器、DPU 卸載、L3 快取大小 |
| 檢索軸 | 向量資料庫規模、RAG 工作流、快取階層 | 向量索引用的記憶體分層、LLC 容量、NVMe 儲存頻寬、CXL 記憶體池 |
這三條軸後面各有不同候選標的 — CPU 本體、記憶體、PCIe 互連架構、智能網卡、儲存陣列、ABF 載板、ODM 系統廠、被動元件。每個軸我會單獨開一篇挖、不會在這篇預設答案。挖的方式是物理底層往上推、不是抄賣方分析師清單、不是憑感覺。
接下來幾篇的目的不是「告訴你買什麼」、是「告訴你怎麼從物理瓶頸推回到零組件、再從零組件推回到上市公司」。最後讀者拿到的不是明牌、是一張可以自己驗證跟更新的地圖。
Sekar 排了 17 個 CPU 的光譜,有一家公司他完全沒提到 — Astera Labs(ALAB)。但這家公司在 2026 年 5 月 J.P. Morgan TMT 大會上,拿到了一個很重的第三方認證:
ALAB 執行長 Jitendra Mohan 同場加碼,親口講出瓶頸遷移方向:
他還揭露一個新超大型雲端業者的 KV cache offload over CXL 客製 Leo 設計,預計 2027 出貨。
2024 IPO:低於 $100 → 現在突破 $1,000
4 年,10 倍。
白話解讀:「單一平台內容值」指每台 AI 伺服器內裝 ALAB 矽片加起來值多少 — IPO 時不到 $100(只有 Aries retimer)、2026 年 5 月已超過 $1,000(加上 Scorpio 交換器、Taurus、Leo),4 年 10 倍。加上未來光連接還會再升。這代表 ALAB 的成長有兩條複合引擎:AI 伺服器出貨變多、加上每台伺服器內含 ALAB 含量也在升。
這家公司剛好站在推理軸的物理鏈上。Part 2 會從這條鏈往下挖。
⚠️風險與注意事項
🧭研究結論與追蹤框架
結論:CPU 新週期是真的、共識已成、第一波 INTC 與 DELL 已被市場反映。下一波的超額收益不在 CPU 本體誰勝誰負、而在推理 / 動作 / 檢索 三條 agentic 工作負載物理瓶頸放大的零組件層。要找標的、要往下挖到記憶體、I/O、PCIe 互連架構、儲存層。
升級訊號 — 系列 3 個 catalyst
- AMD Venice Dense 量產跟雲端業者採用節奏:256 核能不能放量、決定動作端標竿是否站穩
- NVIDIA Vera 量產跟 NVLink Fusion 開放速度:Vera 量產越快、推理端標竿越鎖死、跟周邊基建關係越緊
- AMD 跟 Intel 法說會的 CPU 伺服器占比:看 CPU TAM 上修有沒有兌現到財報
失效訊號
- agentic 採用速度落後:agent framework 從 demo 走到 production 慢於預期、CPU bottleneck 不兌現
- tool execution 搬上 GPU:LLM runtime 把工具呼叫整合進 accelerator、CPU 角色被擠
- hyperscaler 自製 silicon 自給率提升:壓縮 AMD / Intel share、改變受惠者分配
本系列不會直接給進場價。每篇文末會列具體觀察清單跟失效訊號、讓你自己判斷。
📋一頁速看(給沒時間的人)
本系列要回答的問題
- CPU 新週期共識已成、第一波 INTC 加 DELL 已被市場反映、下一波標的在哪
- 從 agentic 物理瓶頸推回零組件、不抄賣方清單、給可驗證的研究架構
本篇核心論點
- agentic 跟純推論是不同物種:CPU 從配角變指揮中樞、CPU:GPU 從 1:8 走向 1:1 是物理必然
- 推理 vs 動作 二軸光譜:兩個極端標竿是 NVIDIA Vera 跟 AMD Venice Dense、中間還有 Graviton / Axion / Cobalt / AGI CPU
- 物理證據:工具處理佔 CPU 延遲最高 90.6%、KV 快取走 PCIe 變瓶頸、NUMA 變異 2.37 倍、CPU 能耗從 20% 升到 44%
- 下一波超額收益在 CPU 周邊:記憶體、I/O、PCIe 互連架構、儲存層、ABF 載板、ODM 系統廠、被動元件
本系列後續
- Part 2:推理軸 — KV 快取走 PCIe 的物理鏈、Vera vs 非 Vera 配置的選擇
- Part 3:動作軸 — 工具呼叫 I/O 跟分散式架構、PCIe 互連架構全棧
- Part 4:檢索軸 — 向量資料庫、RAG、記憶體分層
讀完帶走的判斷力
- 下次看到任何賣方報告或社群帖子在討論 CPU 新週期、你能判斷它是不是只停在 Intel vs AMD 那層
- 如果它沒挖到周邊基建、那篇報告就是已被市場反映那波的敘事、不是找下一波超額收益的工具
📚來源與參考
本文每個關鍵論點都有對應公開來源、按權威分三級列出。所有連結均為原始公司 IR、SEC 申報、產業專業媒體或財經媒體分析、不引用散戶論壇或無來源 blog。
第一級|公司官方加 SEC 主要文件
- AMD:Agentic AI Changes the CPU-GPU Equation — AMD 官方寫伺服器 CPU TAM 2030 達 $120B、年成長 35%+、CPU:GPU 比例 1:4-8 走向 1:1
- Intel Q1 2026 Financial Results — DCAI 營收 $5.1B 年增 22%、Xeon 6 入選 NVIDIA DGX Rubin NVL8 主機 CPU
- Meta x AWS Graviton agentic AI partnership — Meta 部署數千萬 Graviton 核心給 agentic AI
第二級|產業專業媒體加分析師報告
- arXiv 2511.00739:A CPU-Centric Perspective on Agentic AI — Georgia Tech 跟 Intel、5 個 agent 工作負載實測、KV 快取走 PCIe 溢出、NUMA 2.37 倍變異、CPU 能耗 44%
- SemiAnalysis:CPUs are Back — The Datacenter CPU Landscape in 2026 — Dylan Patel 全景專文、含 Vera、Venice Dense、Diamond Rapids 規格詳論
- TrendForce:JEDEC nears 2nd-gen MRDIMM — Samsung 跟 SK Hynix 加速布局 MRDIMM 第二代
第三級|財經媒體與 KOL 訪談
- Vikram Sekar / SemiExponent — The CPU Bottleneck in Agentic AI — 2026 出版報告、推理 vs 動作 二軸框架、17 CPU 評分、Vera 跟 Venice Dense 對位
- AMD CEO Lisa Su 上修伺服器 CPU TAM 至 $120B — 2026-05-12 公開
- Intel CEO Lip-Bu Tan CPU:GPU 比例揭露 — 訓練 1:8、純推論 1:4、agentic 接近 1:1
數據|股價與目標價來源
- 股價、市值、漲跌幅:Yahoo Finance 與 Massive Market Data MCP、截至 2026-05-22
- 公司財務:SEC EDGAR 10-Q 與 10-K
- 分析師目標價:Mizuho、Wells Fargo、Morgan Stanley 官方報告
方法|事實核查方法論
本文每個關鍵論點至少要求 2 個獨立來源、優先第一級公司官方加 SEC。涉及未來預期譬如時程、催化劑、客戶採用、則明確標示為「預期」「展望」或「共識」、不假裝是事實。Sekar 框架是一位專家的論述、有用但非物理常數、明確標示為框架而非定理。arxiv 論文樣本不大、論文自己標多樣化硬體配置仍是未來研究、引用時誠實揭露限制。
系列內部對讀:
- 上一篇:CPU 新週期證據地圖 — 算力超週期系列 Part 02、共識面證據攤完
- Part 2:推理軸 — KV 快取走 PCIe 的物理鏈跟受惠零組件(待發)
- Part 3:動作軸 — 大量子代理並行對 I/O 跟互連架構的壓力(待發)
- Part 4:檢索軸 — 向量資料庫跟 RAG 的記憶體擴展(待發)