LPU 是什麼?專為 AI 推論設計的「語言處理單元」,速度快 GPU 10 倍的秘密
你有沒有好奇過,為什麼同樣是問 AI 一個問題,有些服務的回應像打字機般快速流暢,有些卻像卡帶一樣斷斷續續?這背後的關鍵,往往不是 AI 模型本身,而是驅動它的硬體晶片。
GPU(繪圖處理器)長期主宰 AI 運算,但它最初是為了渲染遊戲畫面設計的,並非天生為語言模型量身訂造。而 LPU(Language Processing Unit,語言處理單元) 的出現,正是要顛覆這個局面——一種從零開始、專門為語言 AI 推論設計的晶片架構。
目前 LPU 最具代表性的開發商是美國新創公司 Groq,其推出的 GroqChip 系列已在業界引發廣泛關注,並於 2025 年底獲得 NVIDIA 的技術採納,開始整合進下一代 AI 基礎架構。
如果把 AI 回答問題比喻成工廠出貨,GPU 是一座什麼都能做但很忙碌的大型工廠,而 LPU 則是一條專門處理語言訂單、永不堵線的極速輸送帶。
一句話重點
LPU 是專為大型語言模型「推論階段」設計的 AI 晶片,以確定性靜態排程與片上 SRAM 取代 GPU 的動態排程與外部記憶體,讓每秒可產出的 Token 數量遠超傳統 GPU,特別適合需要極低延遲的即時 AI 應用。
背景:GPU 在 AI 推論上的瓶頸
現在的大型語言模型(LLM)有兩個截然不同的工作階段:
- 訓練(Training):讓模型從數十億筆資料中學習,需要大量平行矩陣運算,GPU 天生擅長這個。
- 推論(Inference):模型回答問題時,逐字(Token)生成回覆,本質上是一個高度序列化(Sequential)的過程——每個字都必須等上一個字生成完才能產出。
這裡就是問題所在。GPU 是為「平行處理」而生,它的設計思維是「同時做很多事」,但語言模型推論偏偏是「一件事做完才做下一件」。這種架構上的錯配,讓 GPU 在推論時有大量運算單元閒置,記憶體頻寬也成為嚴重瓶頸。
LPU 的設計哲學就是:打造一顆天生就為「依序生成 Token」而存在的晶片。
LPU 的核心架構:兩大關鍵設計
1. 確定性靜態排程(Deterministic Static Scheduling)
GPU 在執行任務時,需要一套複雜的動態排程系統,即時決定哪個運算單元做哪件事、從哪裡讀取資料。這套系統雖然靈活,但本身就消耗大量資源,且會帶來不可預測的延遲抖動(Jitter)。
LPU 完全捨棄這套機制。Groq 的做法是讓編譯器(Compiler)在程式執行前,就把所有指令的順序、資料流向、時鐘週期全部規劃好,硬體只需要照著計畫執行,無需任何動態決策。
這種設計的好處是:
- 延遲極低且完全可預測(無快取未命中、無分支預測錯誤)
- 晶片面積不需要浪費在排程控制邏輯
- 適合語言模型推論這種「每次執行路徑都一樣」的工作負載
2. 大量片上 SRAM 取代外部 HBM
GPU 通常依賴外部的高頻寬記憶體(HBM,High Bandwidth Memory)來儲存模型參數。每次運算都需要從外部記憶體讀取資料,速度受到記憶體頻寬的限制,且會產生額外的延遲。
LPU 的策略是:把數百 MB 的 SRAM 直接整合在晶片內部,讓模型參數的讀取速度接近處理器本身的運算速度。
以 Groq 最新的 Groq 3 LPU 為例,片上記憶體頻寬可達 150 TB/s,遠超目前任何 GPU 的 HBM 頻寬(通常在 3–8 TB/s 之間)。代價是單晶片能存放的模型參數較少,但 Groq 透過自家的 RealScale™ 晶片互連技術,將數百乃至數千顆 LPU 串聯,解決大型模型的容量需求。
實際性能:LPU 到底有多快?
Groq LPU 的推論速度(以每秒生成 Token 數計算)已有具體的公開數據:
| AI 模型 | Groq LPU(tokens/s) | 主流 GPU(tokens/s) |
|---|---|---|
| Llama 3 8B | 1,300+ | 約 80–150 |
| Llama 3.1 70B | 394–1,000 | 約 30–60 |
| Llama 2 70B | 300–750+ | 約 20–50 |
以 Llama 3 8B 為例,Groq LPU 的速度約是一般 GPU 推論的 8 到 16 倍。
這樣的速度差距在實際應用中意義重大。以每秒 1,300 個 Token 的速度,AI 幾乎可以在瞬間(不到 1 秒)輸出完整的一段落文字,完全超越人類閱讀速度,使「即時串流回覆」的感受從流暢升級為瞬間完成。
LPU vs GPU:核心比較
| 比較維度 | Groq LPU | NVIDIA GPU |
|---|---|---|
| 設計目標 | 語言模型推論(Inference) | 平行運算(訓練 + 推論) |
| 排程方式 | 靜態確定性排程 | 動態排程 |
| 主要記憶體 | 片上 SRAM(超低延遲) | 外部 HBM(高容量) |
| 記憶體頻寬 | 150 TB/s(Groq 3) | 3–8 TB/s |
| 延遲特性 | 極低且可預測 | 中等,有抖動 |
| Token 生成速度 | 極快(數倍至十倍以上) | 中等 |
| 模型訓練 | 不適合 | 最佳選擇 |
| 多模態處理 | 較弱 | 強 |
| 擴展方式 | RealScale™ 晶片互連 | NVLink / InfiniBand |
| 最佳使用場景 | 即時對話、語音 AI、低延遲推論 | 模型訓練、大批次推論、圖像生成 |
非技術背景的人需要知道什麼?
簡單來說,GPU 就像是一位萬能的大師傅,什麼菜都會做,但每道菜都要花點時間準備食材。
LPU 則像是一位只做一道料理的極速達人——他每天只做拉麵,但他的速度比任何人都快,永遠不會讓客人等。
對企業主來說,這意味著:如果你的 AI 應用需要即時對話、語音互動或高頻率的 API 呼叫,LPU 可能讓你用更低的伺服器成本達到更好的使用者體驗,因為每個請求耗時更短、伺服器的吞吐量自然更高。
LPU 與 GPU 的新分工:合作而非取代
2025 年底,NVIDIA 與 Groq 達成授權協議,將 LPU 技術整合進 NVIDIA 的 Vera Rubin 平台。這標誌著業界正式確立了 GPU 與 LPU「各司其職」的協作模式:
- GPU 負責 Prefill(預填充):處理使用者輸入的長篇提示(Prompt),這個階段高度平行,GPU 最拿手。
- LPU 負責 Decode(解碼):逐字生成回覆,這個階段高度序列化,LPU 最拿手。
這種「異構運算(Heterogeneous Computing)」架構,讓 AI 基礎架構整體效能與成本效益都能進一步提升,也宣告了 AI 晶片不再是 GPU 的一言堂時代。
誰適合關注 LPU?
- AI 應用開發者:若你的產品需要極低延遲的 LLM 回應(例如語音助理、即時翻譯、AI 客服),Groq 的雲端推論服務(GroqCloud)提供免費試用額度,值得評估。
- AI 基礎架構工程師:規劃下一代 AI 推論叢集時,LPU + GPU 的混合架構是未來 2–5 年值得深入研究的方向。
- 投資人與產業觀察者:LPU 代表了 AI 硬體專業化的大趨勢,除了 Groq 以外,Amazon(Trainium)、Google(TPU)、Cerebras 等公司都在以不同方式挑戰 GPU 的霸主地位,值得持續追蹤。
可能不適合哪些情境?
- 需要訓練模型的場景:LPU 目前不適合模型訓練,只針對推論最佳化。
- 多模態任務(圖片、影片處理):LPU 專精語言,對圖像等多模態任務支援有限。
- 需要彈性支援各種模型格式的場景:Groq 的確定性架構對模型結構有較嚴格的限制,不像 GPU 可以自由執行幾乎任何框架的模型。
我們的觀察
LPU 的出現是 AI 晶片史上一個重要的思維轉折:硬體不再以通用性取勝,而是以極致專業化換取極致效能。Groq 用一顆專注「逐字生成」的晶片,撼動了 NVIDIA 長達十年的 AI 硬體壟斷,逼使業界重新思考「什麼樣的任務需要什麼樣的硬體」。
隨著生成式 AI 的應用場景持續擴大,推論效率的重要性將與日俱增。LPU 代表的「專用 AI 晶片」潮流,未來將衍生出更多為不同 AI 任務特化設計的新型處理器,重塑整個 AI 基礎架構的版圖。
來源
- Groq 官方網站:https://groq.com
- Groq 技術白皮書:https://groq.com/technology/
- 查閱日期:2026-07-06