從 CPU 新週期到找可布局標的物 — 借一份半導體研究報告把架構攤開 | Trend Core
所有研究 AMD $120B CPU TAM 2030
系列開門 · 框架建立

主題研究 · 算力超週期 · ISSUE #076

從 CPU 新週期共識到可布局的標的物 — 借一份半導體老兵的研究報告,把研究架構先攤開

上一篇證據地圖把 CPU 新週期共識面攤完了。這篇借 Vikram Sekar 的研究報告、用第一人稱把 CPU 重新變重要的物理底層再講一次、為下一步挖具體標的開門。

CPU TAM 2030
$120B
+35% CAGR、AMD 官方上修
CPU:GPU ratio
1:1
agentic 推到 1:1、Intel CEO 公開
工具處理佔 CPU 延遲
90.6%
arxiv 5 個 agent workload 實測
本系列篇數
1 / 4
框架篇、後 3 篇挖三軸標的
SIGNAL #1 · 物種變化
CPU 從配角變指揮中樞
agent orchestration 流程裡、CPU 要管 sub-agent 依賴跟結果整合、不再只是 head node
SIGNAL #2 · 框架
推理 vs 動作 二軸光譜
兩個極端分別是 NVIDIA Vera 跟 AMD Venice Dense、中間還有 Graviton / Axion / Cobalt 變體
SIGNAL #3 · 物理鏈
KV 快取走 PCIe 變瓶頸
長上下文推論時 KV 快取暴脹超過 HBM、溢出到主機記憶體靠 PCIe、頻寬低一個量級
一句話結論
CPU 新週期共識面已成、第一波 INTC 與 DELL 已被市場反映。下一波的超額收益不在 CPU 本體誰勝誰負、而在推理 / 動作 / 檢索 三條 agentic 工作負載物理瓶頸放大的零組件層。要找標的、要往下挖到記憶體、I/O、PCIe 互連架構、儲存層。

📖借一份報告,把架構重新講一次

上一篇我把 CPU 新週期的證據攤完了:AMD CEO Lisa Su 上修伺服器 CPU 市場規模到 2030 年 $120B、Intel CEO Lip-Bu Tan 公開 CPU:GPU 從 1:8 往 1:1 走、Meta 跟 AWS 簽下數千萬顆 Graviton 核心、Arm 35 年來第一次自己做 AGI CPU。共識面已成、不是反共識的觀點。問題是知道之後、要找哪些標的、這篇開始挖。

三個之後會反覆出現的技術詞先一句話講白:PCIe 是 CPU 跟 GPU 跟儲存跟網卡之間的高速資料通道、AI 伺服器主板訊號的主幹道。KV 快取 是 LLM 推論時暫存過往 token 中間運算結果的記憶體區、避免每次都重算、讓對話可以接續。CXL 是建在 PCIe 之上的新標準、讓 CPU 跟外掛記憶體能像共用同一塊記憶體那樣讀寫、用來擴大伺服器記憶體容量。

第一波 CPU 新週期已經被市場反映過一輪:Intel 30 天 +86%、Dell +65%。如果你只在「Intel 還是 AMD」這層挑、其實是在補位、不是發現超額收益。要找下一波還沒被定價的標的、得往下鑽到 agentic 工作負載物理底層、看是哪些零組件被瓶頸推上來。

我研究這條路的時候找到一份 PDF — Vikram Sekar 寫的《The CPU Bottleneck in Agentic AI》。Sekar 是電子工程博士、半導體業 15 年經驗、自己經營一個叫 SemiExponent 的電子報。這份報告不長、29 頁、把 CPU 重新變重要的物理底層講得乾淨:兩個核心觀察 — agentic 跟過去兩年的純推論是不同物種、推理 vs 動作 是一條光譜跟兩個極端代表 CPU。

下面我借這份報告的論述、用第一人稱把同樣的東西再講一次。不是學術轉述、是把我自己理解的版本給你。讀完你會拿到一張地圖、知道後面要往哪挖標的。

🔄Agentic 跟過去兩年的純推論是不同物種

過去兩年 LLM 用法基本上是這樣:你打字進去、CPU 把文字切分為數字 token、丟給 GPU、GPU 跑模型生回應 token、CPU 再還原成文字回給你。CPU 在這個流程裡只是從屬節點、輕度負載、幾乎不會是瓶頸。所以過去兩年所有敘事都押 GPU、CPU 被當配角、是有道理的。

Agentic AI 的工作流程不一樣。你打字進去、第一次推論不是直接生回應、是生「執行計畫」。這個計畫展開成多個子代理並行跑:有的去打外部 API、有的查資料庫、有的執行 Python 或 Bash 程式、有的做長鏈式思考、有的瀏覽網頁。每個子代理都有自己的推論循環、CPU 要管所有子代理的依賴關係、誰先完成、結果怎麼整合、整合完要不要再跑一輪反思推論。CPU 從輔助配角變成命令中樞。

具體一點:想像一個客服代理上線跑起來。它要讀客戶資料、查訂單狀態打 API、拉物流資料從第三方服務、更新 CRM、產生短回覆、寄信。每次處理一個請求要做 5-10 次工具呼叫、中間夾短推論。尖峰時 500+ 個 agent 並行跑。GPU 只負責中間那短短的推論部分、70-80% 時間花在 CPU 跑工具執行跟 I/O。

這個變化的核心是一句話:CPU 核數、每個核處理的任務量、記憶體階層跟頻寬、決定 GPU 的利用率、整體吞吐量、跟總體擁有成本。CPU 跟不上、GPU 就在等。GPU 利用率掉、總體擁有成本就崩。所以雲端業者花這麼多錢買 GPU、必須把 CPU 端跟著一起升、不然 GPU 是浪費的。

這就是 1:8 走向 1:1 的物理底層。不是「散戶覺得 CPU 變重要」、是物理上 GPU 餵不飽就是浪費、CPU 必須跟上。


⚖️推理 vs 動作 — 一條光譜跟兩個極端 CPU

Agentic 工作負載內部其實還要再切。同樣是 agent 跑、但「思考型」跟「做事型」對 CPU 的需求不一樣。

推理導向 · 思考型
NVIDIA Vera
核數88 核 Olympus ARM
CPU↔GPU 通道NVLink-C2C 1.8 TB/s
記憶體1.5 TB LPDDR5、1.2 TB/s
關鍵賣點CPU↔GPU 私有通道
動作導向 · 做事型
AMD Venice Dense
核數256 個 Zen6c
執行緒512 thread、SMT
L3 快取加總 1 GB
關鍵賣點x86 工具相容性最廣

3.1推理導向 — 少量 agent、長鏈式思考、CPU↔GPU 通道是命門

推理導向是這種:你給一個 agent 一份市場研究報告、要它分析 DRAM 2027 展望。Agent 拆成 10 個子研究領域、每個子代理跑長鏈式思考、產生數百到數千個推論 token 做領域綜合。偶爾檢索一下文件、但 80%+ 時間花在 GPU 推論上。Agent 在思考、不在做事。

這條軸對 CPU 的關鍵需求是:每個核跑得多快、CPU 跟 GPU 中間那條通道頻寬多大、CPU 端記憶體容量跟頻寬撐不撐得住長上下文推論。核數反而不是最關鍵 — 因為 agent 數不多、每個都長時間在 GPU 上跑。

這條軸的標竿 CPU 是 NVIDIA 自己做的 Vera:88 個自家設計的 Olympus ARM 核、跟 GPU 中間用 NVLink-C2C 私有通道、雙向 1.8 TB/s、可以讓 GPU 直接讀 CPU 的記憶體像讀自己的一樣、1.5 TB LPDDR5 SOCAMM 記憶體放在 CPU 旁邊、頻寬 1.2 TB/s。Sekar 對 Vera 的評語是一句英文「Nothing else comes close」— 用 NVLink-C2C 把 CPU↔GPU 通道做進產品內、繞掉一般 PCIe 的瓶頸、這是定義推理端的關鍵。

3.2動作導向 — 大量 agent 並行、CPU 核數跟 I/O 是命門

動作導向是另一個極端:剛剛客服代理的例子就是這條軸的典型 — 大量 agent 並行、每個都在密集打工具、推論只佔零頭、CPU 端是火力中心。

這條軸對 CPU 的關鍵需求是:核數要夠多、L3 快取要大、PCIe 通道要多、x86 對工具的相容性要廣、能撐住大批並行的 NUMA 排程。CPU↔GPU 通道反而沒那麼關鍵 — 因為 GPU 在這條軸是配角。

這條軸的標竿 CPU 是 AMD 即將推出的 Venice Dense:256 個 Zen6c 核、開了 SMT 變 512 個執行緒、L3 快取加總 1 GB、x86 對工具的相容性最廣、EPYC 系列傳統的每瓦效能優勢。Sekar 對 Venice Dense 的評語是動作端的標竿、但有缺點 — 256 核用多 chiplet 設計、NUMA domain 多、跨 chiplet 排程要小心。

兩個極端中間還有一堆變體 — AWS Graviton5、Google Axion、Microsoft Cobalt、Arm 自己的 AGI CPU、Ampere、華為崑鵬 — 各自落在這條光譜不同位置。Intel Diamond Rapids 192 核掉 SMT 變成 192 執行緒、被 Venice Dense 512 執行緒直接拉開 2.7 倍執行緒密度差距、是 Sekar 報告裡最大的反方案例。


📊物理證據:一篇 arxiv 論文把數字攤出來

光講框架不夠。Sekar 在報告裡引了一篇 2025 年 11 月 Georgia Tech 跟 Intel 共同發的 arxiv 論文《A CPU-Centric Perspective on Agentic AI》、編號 2511.00739。這篇論文跑了 5 個真實 agent 工作負載 — Toolformer、SWE-Agent、Haystack RAG、ChemCrow、LangChain — 在 Intel Emerald Rapids 48 核加 NVIDIA B200 上實測。三個關鍵數字。

數字 1
工具處理佔 CPU 延遲
Haystack RAG 檢索階段佔總執行時間 84.5–90.6%、LLM 推論 <0.5 秒
agent 多數時間在做事
數字 2
KV 快取走 PCIe 變瓶頸
長上下文推論時 KV 快取暴脹超過 HBM、溢出到主機記憶體、PCIe 頻寬低一個量級
推理瓶頸在 CPU↔GPU 通道
數字 3
NUMA 變異 2.37 倍
agent 落在不同 NUMA node 的記憶體延遲差到上千個 cycle、性能變異 2.37×
加核不是萬靈丹

第一、agent 多數時間在做事、不在思考。Haystack RAG 這個工作負載、檢索階段花 6 到 8 秒、佔總執行時間的 84.5 到 90.6%、對應的 LLM 推論部分小於 0.5 秒。SWE-Agent 的 Bash 跟 Python 沙箱執行階段佔 43.8 到 78.7%。論文的話:工具處理在 CPU 上佔 agentic 工作負載總延遲最高 90.6%。

第二、長上下文推論時、KV 快取暴脹超過 GPU 的 HBM 容量、就會溢出到主機記憶體。GPU 跟主機記憶體之間是 PCIe、頻寬比 GPU 內部記憶體低一個量級、這個傳輸停頓直接卡住整體吞吐。推理工作負載的物理瓶頸、不在 GPU 算力、在 GPU 跟 CPU 中間那條通道。Vera 之所以重要、就是因為 NVLink-C2C 1.8 TB/s 把這條通道升級到 GPU 內部記憶體頻寬的等級。

第三、NUMA placement 影響有多大。Agent 落在不同 NUMA node 的記憶體延遲差、可以到上千個 cycle、性能變異到 2.37 倍。這直接點出 Sekar 講的 Venice Dense 256 核問題 — 加核不是萬靈丹、跨 chiplet 排程沒做好就是空有核。

還有一個反直覺的數字。CPU 能耗佔總動態能耗、小 batch 時約 20%、大 batch 推到 128 時上升到 44%、絕對量是小 batch 的 86.7 倍。雲端業者的電費帳單上看得到、agentic 工作負載的總體擁有成本結構跟純推論完全不同。

把這幾個數字攤開、結論很清楚:CPU 升級不是「再加幾顆核」就解決的事、而是記憶體跟 I/O 整個子系統的物理升級。下一步要回答的、是升級哪些零組件、誰賣這些零組件。


🗺️找什麼標的、這個系列接下來這樣挖

從上面的論述、我手上現在有一張地圖。三個受惠軸、每個對應不同零組件層:

物理瓶頸受惠零組件層
推理軸 長上下文推論、KV 快取暴脹、GPU↔CPU 通道是瓶頸 高頻寬 CPU-GPU 互連、PCIe 5/6 retimer、CXL 記憶體擴展、HBM 容量
動作軸 大量子代理並行、工具呼叫的 I/O 把 CPU 塞爆 高核數 x86 CPU、PCIe 通道數擴張、互連交換器、DPU 卸載、L3 快取大小
檢索軸 向量資料庫規模、RAG 工作流、快取階層 向量索引用的記憶體分層、LLC 容量、NVMe 儲存頻寬、CXL 記憶體池

這三條軸後面各有不同候選標的 — CPU 本體、記憶體、PCIe 互連架構、智能網卡、儲存陣列、ABF 載板、ODM 系統廠、被動元件。每個軸我會單獨開一篇挖、不會在這篇預設答案。挖的方式是物理底層往上推、不是抄賣方分析師清單、不是憑感覺。

接下來幾篇的目的不是「告訴你買什麼」、是「告訴你怎麼從物理瓶頸推回到零組件、再從零組件推回到上市公司」。最後讀者拿到的不是明牌、是一張可以自己驗證跟更新的地圖。

題外訊號

Sekar 排了 17 個 CPU 的光譜,有一家公司他完全沒提到 — Astera Labs(ALAB)。但這家公司在 2026 年 5 月 J.P. Morgan TMT 大會上,拿到了一個很重的第三方認證:

JPM 半導體分析師 Harlan Sur
"ALAB silicon optical software solutions are integrated into 90% of the world's AI compute servers and clusters."

ALAB 執行長 Jitendra Mohan 同場加碼,親口講出瓶頸遷移方向:

ALAB CEO Jitendra Mohan
"As context vendors go up, the bottleneck shifts towards memory... this is where we see additional applications for our Leo products."

他還揭露一個新超大型雲端業者的 KV cache offload over CXL 客製 Leo 設計,預計 2027 出貨

10x
ALAB 單一平台內容值
2024 IPO:低於 $100 → 現在突破 $1,000
4 年,10 倍。

白話解讀:「單一平台內容值」指每台 AI 伺服器內裝 ALAB 矽片加起來值多少 — IPO 時不到 $100(只有 Aries retimer)、2026 年 5 月已超過 $1,000(加上 Scorpio 交換器、Taurus、Leo),4 年 10 倍。加上未來光連接還會再升。這代表 ALAB 的成長有兩條複合引擎:AI 伺服器出貨變多、加上每台伺服器內含 ALAB 含量也在升。

這家公司剛好站在推理軸的物理鏈上。Part 2 會從這條鏈往下挖。

誠實標:ALAB 是其中一個受惠者,不是唯一。CPU 新週期對它是順風,不是主成長論點。

⚠️風險與注意事項

01第一波已被市場反映
Intel +86%、Dell +65% 已經漲過、下一波周邊基建的超額收益存在、但時機跟個股可能漲落不同步。
02Sekar 二軸是一位專家的論述、不是物理常數
推理 vs 動作 是有用的思維框架、實際工作負載通常是兩端混合、不是純一邊。
03arxiv 論文樣本不大
只跑 5 個工作負載、用 Intel Emerald Rapids 加 B200 一個硬體配置、論文自己標註多樣化硬體配置仍是未來研究。
04CPU TAM 上修不等於每家 CPU 廠都贏
AMD / Intel / Arm 三家會分這塊餅、x86 vs ARM 互蝕也會發生、不能假設所有 CPU 廠一起漲。
05數字截至 2026-05-12 公開資料
市場價格可能已動、請以最新公告為準。

🧭研究結論與追蹤框架

結論:CPU 新週期是真的、共識已成、第一波 INTC 與 DELL 已被市場反映。下一波的超額收益不在 CPU 本體誰勝誰負、而在推理 / 動作 / 檢索 三條 agentic 工作負載物理瓶頸放大的零組件層。要找標的、要往下挖到記憶體、I/O、PCIe 互連架構、儲存層。

 升級訊號 — 系列 3 個 catalyst
  • AMD Venice Dense 量產跟雲端業者採用節奏:256 核能不能放量、決定動作端標竿是否站穩
  • NVIDIA Vera 量產跟 NVLink Fusion 開放速度:Vera 量產越快、推理端標竿越鎖死、跟周邊基建關係越緊
  • AMD 跟 Intel 法說會的 CPU 伺服器占比:看 CPU TAM 上修有沒有兌現到財報
 失效訊號
  • agentic 採用速度落後:agent framework 從 demo 走到 production 慢於預期、CPU bottleneck 不兌現
  • tool execution 搬上 GPU:LLM runtime 把工具呼叫整合進 accelerator、CPU 角色被擠
  • hyperscaler 自製 silicon 自給率提升:壓縮 AMD / Intel share、改變受惠者分配

本系列不會直接給進場價。每篇文末會列具體觀察清單跟失效訊號、讓你自己判斷。


📋一頁速看(給沒時間的人)

CPU 新週期找標的物 Part 1 · 框架建立 · 2026-05-26

本系列要回答的問題

  • CPU 新週期共識已成、第一波 INTC 加 DELL 已被市場反映、下一波標的在哪
  • 從 agentic 物理瓶頸推回零組件、不抄賣方清單、給可驗證的研究架構

本篇核心論點

  • agentic 跟純推論是不同物種:CPU 從配角變指揮中樞、CPU:GPU 從 1:8 走向 1:1 是物理必然
  • 推理 vs 動作 二軸光譜:兩個極端標竿是 NVIDIA Vera 跟 AMD Venice Dense、中間還有 Graviton / Axion / Cobalt / AGI CPU
  • 物理證據:工具處理佔 CPU 延遲最高 90.6%、KV 快取走 PCIe 變瓶頸、NUMA 變異 2.37 倍、CPU 能耗從 20% 升到 44%
  • 下一波超額收益在 CPU 周邊:記憶體、I/O、PCIe 互連架構、儲存層、ABF 載板、ODM 系統廠、被動元件

本系列後續

  • Part 2:推理軸 — KV 快取走 PCIe 的物理鏈、Vera vs 非 Vera 配置的選擇
  • Part 3:動作軸 — 工具呼叫 I/O 跟分散式架構、PCIe 互連架構全棧
  • Part 4:檢索軸 — 向量資料庫、RAG、記憶體分層

讀完帶走的判斷力

  • 下次看到任何賣方報告或社群帖子在討論 CPU 新週期、你能判斷它是不是只停在 Intel vs AMD 那層
  • 如果它沒挖到周邊基建、那篇報告就是已被市場反映那波的敘事、不是找下一波超額收益的工具

📚來源與參考

本文每個關鍵論點都有對應公開來源、按權威分三級列出。所有連結均為原始公司 IR、SEC 申報、產業專業媒體或財經媒體分析、不引用散戶論壇或無來源 blog。

第一級|公司官方加 SEC 主要文件

第二級|產業專業媒體加分析師報告

第三級|財經媒體與 KOL 訪談

數據|股價與目標價來源

  • 股價、市值、漲跌幅:Yahoo Finance 與 Massive Market Data MCP、截至 2026-05-22
  • 公司財務:SEC EDGAR 10-Q 與 10-K
  • 分析師目標價:Mizuho、Wells Fargo、Morgan Stanley 官方報告

方法|事實核查方法論

本文每個關鍵論點至少要求 2 個獨立來源、優先第一級公司官方加 SEC。涉及未來預期譬如時程、催化劑、客戶採用、則明確標示為「預期」「展望」或「共識」、不假裝是事實。Sekar 框架是一位專家的論述、有用但非物理常數、明確標示為框架而非定理。arxiv 論文樣本不大、論文自己標多樣化硬體配置仍是未來研究、引用時誠實揭露限制。

系列內部對讀:

  • 上一篇:CPU 新週期證據地圖 — 算力超週期系列 Part 02、共識面證據攤完
  • Part 2:推理軸 — KV 快取走 PCIe 的物理鏈跟受惠零組件(待發)
  • Part 3:動作軸 — 大量子代理並行對 I/O 跟互連架構的壓力(待發)
  • Part 4:檢索軸 — 向量資料庫跟 RAG 的記憶體擴展(待發)

本報告為 Trend Core 研究團隊基於公開資料整理之研究內容、不構成投資建議。所有提及的個股包含 AMD、INTC、ARM、NVDA、DELL、ALAB、MU 等、為公開交易股票、存在價格波動、市場、流動性、匯率與政策風險。內部人交易、機構持股變化等資訊來自監管申報、但解讀方式存在多種可能。過去績效不保證未來結果。投資決策應基於個人財務狀況、風險承受能力、並建議諮詢合格的財務顧問。研究員 / 公司可能持有或於發布後持有上述個股部位。報告中所有時間點的價格、指標數據以發布日 2026-05-26 為基準、後續變化請以即時資料為準。