Jasonmel Online

AI 工廠:五層堆疊,逐層拆開

改模型、改並行配置、改請求——這一頁的每個數字都會重新計算

Decode 資源池

機群稼動率會把滿載解析上限折算掉閒置備援、需求不均與營運損失;HBM 裝不下或 TPOT 未達標時,SLA goodput 計為 0。

Prefill 資源池

動畫速度 · 不代表模擬延遲
步驟 0/20累計延遲 0 / 2.53 s

總覽:尚未選擇步驟

畫面會跟著目前尺度移動,也可用縮圖導覽或左右滑動。

① 送出 prompt② 落到哪台機器③ 模型怎麼被切開④ Prefill 讀完 prompt⑤ Decode 一次吐一個字⑥ 送回使用者應用prompt、token、串流模型權重、切分、KV cache基礎設施機櫃、互連、供電、散熱、排程晶片SM、Tensor Core、HBM能源併網容量、電價、碳強度機房12 個機櫃(示意)使用者瀏覽器閘道TLS/限流跨機櫃網路 scale-out:leaf / spine 交換機儲存資料/權重電力:變電、UPS、匯流排散熱:CDU、冷卻水、散熱段一個機櫃64 張卡運算 tray ×8運算 tray ×8交換 tray ×8電源層+匯流排一個運算 tray4 張加速器水冷冷板——冷水進、熱水出加速器 0192 GB HBM1.20 kW網卡 → 跨櫃加速器 1192 GB HBM1.20 kW網卡 → 跨櫃加速器 2192 GB HBM1.20 kW網卡 → 跨櫃加速器 3192 GB HBM1.20 kW網卡 → 跨櫃櫃內 scale-up 互連通往同櫃另外 60 張一顆晶片HBM · L2 · SM 陣列HBMHBMHBMHBM148 個 SM——裡面那格是 Tensor CoreL2 快取——切好的小塊在這裡等互連 I/O——整個機櫃就接在這裡電力:從電網到電晶體進線站69 kV→ 13.8 kV樓板變壓13.8 kV→ 415 V ACUPS/儲能415 V AC→ 415 V AC電源架415 V AC→ 50 V DC板上 DC/DC50 V DC→ 0.8 V 核心五級轉換,每一級都吃掉一點,而且是乘起來的。散熱:熱往哪裡去晶片85 °C冷板貼在封裝上CDU櫃內/廠務隔離散熱段蒸發或乾式Q = ṁ·c·ΔT——溫升 12 K;這是循環流量,不是耗水量首 token 延遲 TTFT85.2 ms每 token 間隔 TPOT9.60 ms每張卡 HBM33.9 GB / 192 GB回到螢幕上的字

達標 goodput:189K token/s/MW · 解析上限 270K

機房 → 機櫃 → tray → 晶片,是同一台機器的四種放大倍率。左邊是依賴關係,右邊追蹤電與熱;按播放或直接選階段。目前計入 1 櫃 prefill 與 1 櫃 decode 資源。

原料prompt token
製程prefill、decode
產出達標 token/s/MW

機房:資源池、scale-out、電力容量

機櫃:scale-up 網域與供電散熱單位

Tray:四張卡、NIC、冷板的實體模組

晶片:HBM、L2、SM 與 tensor core

一般顯卡能跑小模型或量化模型。當記憶體、完成時間、同時使用人數與可靠度把「一張卡會算」變成系統問題,才需要 AI Factory。

prompttoken

目前的瓶頸HBM 記憶體頻寬每 token 9.60 ms · 取樣範圍內 50 ms SLA 最佳 goodput 263K token/s/MW一個 token 走完 2 段管線要讀 41.6 GB(每張卡 20.8 GB),這批預期叫醒 128 / 128 位專家· 簡化的解析模型,不是實機量測

這一頁用到的名詞,一句話一個
token
模型讀取的離散單位,可能是一個字、詞的一部分或標點;切法由模型的詞彙表決定,沒有固定的一字一 token。
Prefill
把整段輸入平行讀完。長 prompt 或每位專家拿到夠多 token 時能吃滿算力;短 prompt 的 MoE 仍可能受 HBM 頻寬限制。
Decode
一次產生一個 token,接回輸入再跑一次。慢在要把整份權重讀過一遍,不是慢在計算。
KV cache
把前面每個 token 的注意力中間結果存起來,免得每生一個字就重算一次。它會隨對話長度一直長大。
TTFT
從送出到看到第一個字的時間,決定「它有沒有在動」的感覺。
TPOT
第一個字之後,每個字之間的間隔,決定「它講得快不快」的感覺。
張量並行 TP
把同一個矩陣縱切給好幾張加速器。每一層都要對答案,所以幾乎一定要留在櫃內;跨櫃不是不能跑,而是每層都付慢速網路的代價。
管線並行 PP
不同加速器負責不同的層,像生產線。只有階段交界要傳東西,所以可以跨機櫃。
專家並行 EP
把混合專家模型的專家分散放,每個 token 只找它被路由到的那幾位。
混合專家 MoE
模型存著許多專科 FFN,但每個 token 只送去少數幾位。少算了很多乘法,所有專家的權重仍得放得下。
SLA
服務承諾的目標。本頁用最大 TPOT 當門檻;超過它的原始吞吐不能算成可用產能。
goodput
同時放得進記憶體、又符合延遲 SLA 的有效產出;和不管品質門檻、只數總量的 throughput 不同。
投機解碼
先讓小模型猜幾個 token,再由大模型一次驗證;省的是大模型前向的次數,不是每次前向的成本。
資料並行 DP
整個模型複製好幾份,各自吃不同的資料,每一步把梯度加起來平均。
HBM
貼在晶片旁邊的高頻寬記憶體。權重和 KV cache 都住在這裡,容量決定能同時服務幾個人。
activation
一層算完交給下一層的中間結果;訓練時反向傳播還會再用到。
all-reduce/all-to-all
前者把各卡的部分結果加總後交還每張卡;後者讓每張卡各自交換不同資料,常用來把 token 送到專家。
算術強度
每搬一 byte 資料能做多少 FLOP;低於模型轉折點通常等記憶體,高於它通常等算力。
micro-batch
把一個很大的訓練 batch 切成較小批,依序塞進管線,讓各段同時有事做。
checkpoint
定期保存權重與優化器狀態;硬體故障或 loss 發散後能回到較早版本,不必整場重來。
scale-up/scale-out
高速、緊密耦合的互連是 scale-up,較大範圍的網路是 scale-out。本頁把界線畫在一櫃,但它是系統設計選擇,不是物理常數。
MFU
實際用到的算力佔理論峰值的比例,也像工廠稼動率:MFU 30% 表示其餘 70% 在等資料、等別人對答案或等管線填滿。
PUE
整廠用電除以 IT 用電。1.15 表示每餵給機器一度電,機房另外要花 0.15 度在散熱與配電上。
卡/加速器/GPU
這一頁裡是同一件事:機櫃裡那一顆負責矩陣運算的處理器。
操作方式、模型範圍與限制

空白鍵播放/暫停,← → 逐步。這是把一個 decoder-only Transformer 放進虛構 64 卡機櫃的瀏覽器解析模型,不是廠商設計、實測 benchmark 或真的模型。它不模擬排隊分布、自動擴縮、TCO、straggler、靜默資料毀損、網路超額訂閱與 rail-optimized placement。

左邊沿用 NVIDIA 的「AI 五層蛋糕」:能源、晶片、基礎設施、模型、應用。它是好用的依賴地圖,不是業界標準。配電、散熱、建築,以及各自獨立的 scale-up、scale-out、儲存與管理網路,都屬於基礎設施。

這些硬體實際在跑的東西,另外有兩頁,尺度小得多:神經網路把鏈鎖律一個節點一個節點拆開;Transformer則在你的瀏覽器裡跑一個真的訓練過的模型。三頁的學習方法相同;這一頁多出來的是讓它在實體世界跑得起來的那一整層——模型怎麼切到很多張卡、梯度怎麼在卡之間搬、記憶體、故障、供電與散熱。

prompt 是走網際網路到機房的,那一段路另外有一頁:封包旅程(DNS、TCP、TLS、request)。