框架解釋 · 算力超週期 · ISSUE #192
AMD 自報 agent 把 kernel 寫快 3.02 倍,端到端只有 21.8%:NVIDIA 的 CUDA 護城河,移到了「驗得了」
寫 kernel 的成本崩了,驗證的成本沒崩。這個落差把護城河推到一條 2026 年七月還沒有人在追的新軸上。
🎯一份帳單,兩個量級
SemiAnalysis 在第一篇 AMD 軟體報告裡寫下一個很硬的數字:AMD 有 0% 的機會在 AI 加速器上追上 Nvidia。2026-07-24,同一個機構把它改成「只要解決兩大風險,就有很大的成功機會」。
他們給的理由裡最反直覺的一條,是自己那支 2.5 人的團隊配上寫程式 agent,做出了三到六個月前同樣人數不可能有的迭代速度,並據此判斷「測試與寫軟體已經不是去年那種護城河了」。
這是「模型會自己寫程式」第一次有生產環境的帳單可以攤開來看。而帳單上最關鍵的一行不是速度,是驗證。
1.1AMD 官方自報的 kernel 級倍數
AMD 在 Advancing AI 2026 發表 ROCm.ai,核心是一個叫 GEAK 的 agent,全名是「Generating Efficient AI-Centric Kernels」,工作是寫並調校 kernel。AMD 官方在技術部落格上給了自家基準的幾何平均加速:
| 後端語言 | GEAK V3 幾何平均 | 分層表現 |
|---|---|---|
| HIP | 3.02 倍 | L1 4.14 倍、L2 4.20 倍、L3 1.14 倍 |
| Triton | 2.22 倍 | L1 1.75 倍、L2 2.08 倍、L3 2.78 倍 |
| FlyDSL | 1.06 倍 | 未分層 |
同一套系統的前代對照是 GEAK v3 整體 1.95 倍、v2 只有 1.03 倍。這個 1.95 倍與表格裡的 3.02 倍不是打架,前者是跨全部後端的整體口徑,後者只算 HIP 那一條。測試硬體是 MI300X、MI355X 與 Radeon 的 RDNA4。
1.2同一份帳單上的另一個量級
這是 kernel 級的數字。而報告轉述的是另一件事,出處是 GEAK 自己的執行紀錄:同一個 agent 在 MI355X 上把一段 MXFP8 精度、解碼受限的密集線性運算改寫掉,拿到端到端 21.8% 的提升;同一份紀錄裡,grouped-MoE 的 GEMM 卡在大約 1.1 倍的天花板。
三倍與兩成,差了一個量級。這兩個數字不衝突,它們量的根本是不同的東西:一個是把某段 kernel 單獨拉出來跑得多快,一個是整套推論服務端到端快了多少。中間差掉的部分,是資料搬移、是排程、是那些 agent 動不到也不該動的系統層。
這個落差不是 AMD 特有的尷尬,它是所有「AI 幫我優化程式」宣稱的共同結構。而它解釋了一件事:為什麼 AMD 自己要在這個 agent 外面再包一層叫 Hyperloom 的編排器。
這層編排器的定位是「自動化端到端推論工作負載優化」的開源 agentic 系統。官方部落格把閉環寫成剖析、分析、規劃、優化、驗證五步;官方文件則把最內層的引擎寫成思考、決策、實作、跑分。它編排三個角色:TraceLens 做追蹤分析找瓶頸、GEAK 優化熱點 kernel、Arbor 探索搜尋空間。AMD 宣稱它把端到端優化「從數週縮到數小時」,而且已經開源、可以直接取得安裝。
口徑要先擋住:AMD 的兩份官方頁都只寫「驗證通過才交付」,都沒有逐字寫明那個驗證是端到端 A/B。 官方文件的原句是「Once optimizations are identified and validated, Hyperloom prepares the optimized code and generates a report」。「每個候選都要過端到端 A/B 才算數」這個更強的描述,出自 SemiAnalysis 2026-07-24 的那份報告,屬於第三方觀察。引用時兩者要分開掛。
我的判斷:落差本身才是資訊
最關鍵的單一指標不是加速倍數,是端到端驗證有沒有被綁進流程。