框架解析 · 算力與晶片 · ISSUE #155
NVIDIA 200 億美元收編 Groq LPU:拆解 AFD 異構推論,補的是短板還是江山?
帳面是授權外加挖角、不是併購,實質是把最快的推論挑戰者連人帶技術收走,還繞過了併購審查。
🎯先看清楚:200 億買的是「授權外加挖角」
這筆 2025 年 12 月 24 日宣布的交易,結構是非獨家智財授權外加挖角,不是傳統併購。NVIDIA 拿到的是那套語言處理器架構的非獨家授權,以及硬體設計的製造權,而 Groq 的創辦人兼執行長、總裁與多名資深工程師轉入 NVIDIA。至於 Groq 這家公司,仍然獨立營運,由原財務長接任執行長,保有完整智財所有權,可以繼續授權給別人,也繼續經營自家的推論雲端服務。
話是這樣說沒錯,但別讓「授權」這個字把事情講小。實質上,最快的獨立推論挑戰者的創辦人、總裁與核心工程師,現在都替 NVIDIA 工作,這批人是排他的,加上一紙架構授權,等於把對手最關鍵的人與技術一起收了過來。
媒體直接稱它「名義外皆為併購」;Bernstein 分析師 Stacy Rasgon 說這個非獨家結構「維持了競爭的假象」。
非獨家授權外加挖角
把對手核心收走、繞過審查
1.1真正的重點:為什麼要包成授權
用授權外加挖角、而不是直接併購,NVIDIA 就規避了 Hart-Scott-Rodino 的反壟斷併購申報,授權交易免申報、併購要申報,於是這筆交易幾天內就結案,避開了 FTC 可能的調查。放進脈絡看更清楚:NVIDIA 本身正在美國、歐洲與中國多地被反壟斷盯上,AI 晶片市佔約 84%,這個時點若用併購把一個推論競爭者買下來,幾乎必然觸發審查,而授權這層包裝把審查繞過去了。
至於這層結構是不是刻意避審,NVIDIA 沒有明說;但參議員 Warren 與 Blumenthal 已就此對黃仁勳發函質疑,FTC 也曾以幾乎相同的結構調查微軟 2024 年對 Inflection 的授權外加挖角是不是變相併購,監管機關顯然沒把它當一樁單純的授權。價碼本身也是訊號:Groq 2025 年 9 月最近一輪估值 69 億美元,200 億約當它的 2.9 倍,溢價的兩種讀法,技術重估或戰略鎖定,都成立。
⚡語言處理器憑什麼快
語言處理器跟 GPU 的差別,可以濃縮成兩件事:記憶體怎麼放,還有運算怎麼排。它用 SRAM 當主記憶體、把權重直接駐留在上面,而不是像 GPU 那樣拿 SRAM 當快取、把權重放在片外的高頻寬記憶體;同時,它先用編譯器把所有計算任務排成靜態調度,形成固定的計算圖,不存在臨時調度。結果是沒有分支發散的懲罰、沒有快取沒命中的等待,低延遲加確定性,正是推論體驗最看重的兩件事。代價是容量:SRAM 貴、密度低,能塞的遠小於高頻寬記憶體。
算力霸主,但不是推論原生最佳解
為推論延遲量身打造
📐機架規格,跟那個「150 對 22」的陷阱
交易之後大約三個月,NVIDIA 端出了 Groq 3 LPX 這個推論加速器與機架級產品。以下是官方規格。先驗算一下:256 顆乘以每顆 500MB,正好是 128GB,整櫃「128GB 純 SRAM」這個數字內部自洽。
| 層級 | 規格 |
|---|---|
| 每顆晶片 | 500MB SRAM、150 TB/s 片上頻寬、2.5 TB/s 對外互連 |
| 每組 1U 運算單元(8 顆) | 4GB SRAM、1.2 PB/s、9.6 PFLOPS |
| 整櫃(256 顆) | 128GB 總 SRAM、40 PB/s 片上頻寬、640 TB/s 對外互連、315 PFLOPS(FP8) |
| 對照組 Rubin GPU | 288GB 高頻寬記憶體、22 TB/s |
這裡有一個必須點破的陷阱。你會看到「新晶片 150 TB/s、Rubin GPU 只有 22 TB/s」這種對比,數字很唬人,但它不是同類比較。150 是片上 SRAM 的頻寬,22 是 GPU 那顆高頻寬記憶體的頻寬,一個是貼在運算單元旁邊的小容量高速記憶體,一個是容量大得多的片外記憶體,本來就是不同層級的東西。這是廠商慣用的對照口徑,拿來說明它在延遲敏感段的頻寬優勢是公允的,但把它讀成「快七倍」就過度解讀了。
🔀AFD:把注意力和前向傳播拆開跑
它有那麼好的低延遲,是不是要取代 GPU 了?不是。NVIDIA 的定位很明確:這顆晶片是 GPU 的補充、不是替代者。把這件事講清楚的框架,是 NVIDIA 官方命名的 AFD,也就是注意力與前向傳播解耦。一次語言模型推論分成預填與解碼兩個階段,AFD 把這兩個階段裡不同性質的活,分給不同硬體。
一次推論,兩種硬體分工
由 NVIDIA Dynamo 這個編排層分類請求、把不同段路由到不同晶片
看懂這套分工,就會發現一個容易被忽略的重點:核心仍然是 GPU。預填在 GPU、注意力在 GPU,協處理器只是加購上去、專門處理某一段。這套設計是要擴大每一套推論部署裡的 NVIDIA 內容量,不是替代掉 GPU。從賣鏟人的角度看,這是多賣、不是少賣。NVIDIA 官稱這套異構設計讓整套系統的每 MW 推論吞吐最高提升 35 倍、對兆參數模型的營收機會最高 10 倍,這些倍數是官方宣稱、目前沒有第三方獨立基準驗證,引用時一律當廠商說法看。
🧗這步棋剛好繞過了一道天花板
這套分工真正精妙的地方,要放回 SRAM 的那個容量代價才看得懂。獨立的高速記憶體推論陣營,像 Groq 過去單打獨鬥的時候、或是同走這條路的 Cerebras,都被同一道結構問題卡著:最想用極速推論的,是實驗室最強的旗艦模型,而最強的模型正在往兆參數以上、上下文往百萬 token 長,SRAM 容量小,裝不下最大的模型,長上下文也撐不住。
這步棋的巧妙,正是它沒有要那顆晶片一個人扛整個模型。要吃大容量、要存長上下文快取的注意力段,全部留在 GPU 上;協處理器只接解碼裡那段延遲敏感、相對輕的前向傳播。這麼一分工,SRAM 容量上限這個原本的致命弱點,在「GPU 旁邊當協處理器」的定位下就被結構性地繞過去了。同樣一顆晶片,單機扛整個最強模型會撞牆,當協處理器則不會,這是 NVIDIA 這步棋容易被忽略的一層。
⚔️兩條對立的推論劇本:自研平替 vs 解耦補充
把鏡頭拉遠,收編 Groq 這件事,只是推論晶片這個新戰場上兩條對立劇本的其中一條。看懂這兩條劇本的分歧,比記住規格更重要。
自己做一顆,直接換掉 NVIDIA
把最快的挑戰者收編成零件
這兩條劇本正好相反:一條是把 GPU 換掉,一條是在 GPU 旁邊擺一顆。值得一提的是,NVIDIA 早前其實有另一顆推論專用 GPU 叫 Rubin CPX,據硬體供應鏈爆料,它遲遲拿不到記憶體與基板訂單、在 2026 年 3 月的技術大會前後被撤、被現在這條機架路線某種程度取代;這一段屬爆料層級、NVIDIA 未正式說明,但仍說明 NVIDIA 在推論側的產品路徑本身還在調整。
散戶最容易被一句「NVIDIA 買了推論神晶片」帶著走,然後把它當成無腦利多、或無腦利空。研究的價值不在追新聞的第一時間,在看清楚這步棋的邊界:它補了 GPU 的推論延遲短板,用別人已驗證的架構,但買到的是非排他授權,也擋不住客戶繼續用自研晶片把推論負載分流出去。看懂邊界,你才知道之後該盯哪幾條線、什麼時候該改變看法。散戶不該是最後一個知道的人。
⚠️風險與注意事項(必讀)
🧭研究結論與追蹤框架
核心結論:NVIDIA 用 200 億美元的非獨家授權外加挖角,把最快的獨立推論挑戰者 Groq 收編成 GPU 的協處理器,用注意力與前向傳播的異構分工繞過純高速記憶體路線的容量天花板。這一步在戰術上補齊了 GPU 的推論延遲短板、強化了生態鎖定,但它是非排他的,也沒有解決自研客製晶片侵蝕推論市佔的結構問題。往下走,盯這五條線,數據往哪走就知道方向。
| 追蹤軸 | 偏多訊號 | 偏空訊號 |
|---|---|---|
| 第三方推論基準 | 若獨立基準證實接近官稱的 35 倍每 MW:護城河補得是實的 | 若大幅低於官稱、或遲遲不公布:宣稱有灌水成分 |
| 自研客製晶片放量 | 若卡在軟體堆疊、放量不如預期:99% 失敗判斷成立 | 若在推論負載佔比持續上升:NVIDIA 推論依賴度結構性下降 |
| 新機架是否真出貨 | 若拿到記憶體與系統訂單、進超大型雲端業者:不是紙面產品 | 若重演前一顆無訂單的命運:產品路徑又要調整 |
| 每套部署的 NVIDIA 內容量 | 若兩種晶片內容雙增:印證多賣 GPU、不是被拆單 | 若客戶只買協處理器那段、繞開 GPU:解耦給了拆單的縫 |
| 軟體編排層地位 | 若 NVIDIA 編排層成異構推論預設:軟體護城河往上延伸 | 若開源框架不靠它也能調度異構:護城河比想像淺 |
📋一頁速看(給沒時間的人)
這筆交易的實質
- NVIDIA 2025 年 12 月 24 日以 200 億美元收編 Groq,帳面是非獨家授權外加挖角、不是併購;實質是把對手核心團隊與技術收走並規避併購審查,已引來參議員 Warren、Blumenthal 質詢。Groq 公司仍獨立、保有 IP、續營雲端。200 億約當 Groq 69 億美元估值的 2.9 倍。
技術與策略
- 語言處理器快在兩件事:SRAM 當主記憶體、不是快取,再搭配編譯器靜態調度,換低延遲與確定性;代價是容量小。
- 機架整櫃 256 顆、128GB 純 SRAM、315 PFLOPS。留意「150 對 22」是片上 SRAM 對高頻寬記憶體、不是同類比較。
- AFD 把注意力與快取留在 GPU、只把解碼裡的前向傳播交給協處理器,所以是補充不是替代、核心仍是 GPU,也剛好繞過純高速記憶體路線「裝不下最強模型」的天花板。
兩條劇本、雙面讀法
- 自研客製晶片直接換掉 GPU(平替),NVIDIA 的解耦補充把挑戰者收編成零件。補短板成立,但非排他、擋不住平替侵蝕、還踩監管線。
📚來源與參考
本文每個關鍵論點都有對應公開來源、按權威分三級列出。所有連結均為原始公司揭露、官方部落格或產業專業媒體分析、不引用散戶論壇或無來源 blog。
第一級公司官方與政府主要文件
- Inside NVIDIA Groq 3 LPX(NVIDIA 官方部落格,機架規格、AFD 機制、35 倍每 MW 官方宣稱)
- NVIDIA LPX 產品頁(NVIDIA 官方,機架定位與規格)
- 參議員 Warren 與 Blumenthal 致 NVIDIA 函(美國參議院一手文件,質疑是否規避反壟斷法)
- OpenAI and Broadcom unveil LLM-optimized inference chip(OpenAI 官方公告,首款自研推理晶片、9 個月投片)
第二級產業專業媒體與分析師報告
- Nvidia confirms $20 billion Groq deal to bolster AI inference dominance(Tom's Hardware,交易金額與智財授權結構)
- Nvidia-Groq deal is structured to keep 'fiction of competition alive'(CNBC,Bernstein 分析師 Stacy Rasgon 評論)
- SemiAnalysis newsletter(「99% 客製晶片失敗、難在軟體堆疊」判斷出處,2026 年 6 月)
- AI inference chip startup Groq nabs $750M at $6.9B valuation(TechCrunch,Groq 2025 年 9 月 69 億美元估值)
第三級財經媒體與分析
- What the Acqui-Hire Means for AI Investors(TECHi,挖角結構、人員去向、Groq 獨立續存)
- How AI Firms Are Avoiding Antitrust Risk(CIO,授權結構規避 HSR 併購申報、與微軟 Inflection 先例對照)
- Why It Paid 2.9x Valuation for LPU Tech(IntuitionLabs,2.9 倍估值溢價與戰略動機解讀)
數據規格與數字來源
- 機架規格與效能倍數:NVIDIA 官方部落格與 LPX 產品頁揭露
- 本文不涉及個股即時報價或目標價;所引數字均為官方揭露或第三方媒體報導,已於文中逐項標註出處與屬性
方法事實核查方法論
本文每個關鍵論點至少要求 2 個獨立來源、優先採用公司官方揭露。涉及未來預期,例如效能倍數、放量時程、市佔變化,一律明確標示為「官方宣稱」「預期」或「展望」,不假裝是已驗證的事實。特別註明:NVIDIA 的 35 倍每 MW 吞吐與 10 倍營收機會屬廠商宣稱、目前無第三方基準驗證;「150 對 22」為片上 SRAM 對高頻寬記憶體、非同類比較,文中已標明口徑差異。