AI 工廠:五層堆疊,逐層拆開
改模型、改並行配置、改請求——這一頁的每個數字都會重新計算
總覽:尚未選擇步驟
畫面會跟著目前尺度移動,也可用縮圖導覽或左右滑動。
達標 goodput:189K token/s/MW · 解析上限 270K
機房 → 機櫃 → tray → 晶片,是同一台機器的四種放大倍率。左邊是依賴關係,右邊追蹤電與熱;按播放或直接選階段。目前計入 1 櫃 prefill 與 1 櫃 decode 資源。
機房:資源池、scale-out、電力容量
機櫃:scale-up 網域與供電散熱單位
Tray:四張卡、NIC、冷板的實體模組
晶片:HBM、L2、SM 與 tensor core
一般顯卡能跑小模型或量化模型。當記憶體、完成時間、同時使用人數與可靠度把「一張卡會算」變成系統問題,才需要 AI Factory。
目前的瓶頸HBM 記憶體頻寬每 token 9.60 ms · 取樣範圍內 50 ms SLA 最佳 goodput 263K token/s/MW一個 token 走完 2 段管線要讀 41.6 GB(每張卡 20.8 GB),這批預期叫醒 128 / 128 位專家· 簡化的解析模型,不是實機量測
這一頁用到的名詞,一句話一個
- token
- 模型讀取的離散單位,可能是一個字、詞的一部分或標點;切法由模型的詞彙表決定,沒有固定的一字一 token。
- Prefill
- 把整段輸入平行讀完。長 prompt 或每位專家拿到夠多 token 時能吃滿算力;短 prompt 的 MoE 仍可能受 HBM 頻寬限制。
- Decode
- 一次產生一個 token,接回輸入再跑一次。慢在要把整份權重讀過一遍,不是慢在計算。
- KV cache
- 把前面每個 token 的注意力中間結果存起來,免得每生一個字就重算一次。它會隨對話長度一直長大。
- TTFT
- 從送出到看到第一個字的時間,決定「它有沒有在動」的感覺。
- TPOT
- 第一個字之後,每個字之間的間隔,決定「它講得快不快」的感覺。
- 張量並行 TP
- 把同一個矩陣縱切給好幾張加速器。每一層都要對答案,所以幾乎一定要留在櫃內;跨櫃不是不能跑,而是每層都付慢速網路的代價。
- 管線並行 PP
- 不同加速器負責不同的層,像生產線。只有階段交界要傳東西,所以可以跨機櫃。
- 專家並行 EP
- 把混合專家模型的專家分散放,每個 token 只找它被路由到的那幾位。
- 混合專家 MoE
- 模型存著許多專科 FFN,但每個 token 只送去少數幾位。少算了很多乘法,所有專家的權重仍得放得下。
- SLA
- 服務承諾的目標。本頁用最大 TPOT 當門檻;超過它的原始吞吐不能算成可用產能。
- goodput
- 同時放得進記憶體、又符合延遲 SLA 的有效產出;和不管品質門檻、只數總量的 throughput 不同。
- 投機解碼
- 先讓小模型猜幾個 token,再由大模型一次驗證;省的是大模型前向的次數,不是每次前向的成本。
- 資料並行 DP
- 整個模型複製好幾份,各自吃不同的資料,每一步把梯度加起來平均。
- HBM
- 貼在晶片旁邊的高頻寬記憶體。權重和 KV cache 都住在這裡,容量決定能同時服務幾個人。
- activation
- 一層算完交給下一層的中間結果;訓練時反向傳播還會再用到。
- all-reduce/all-to-all
- 前者把各卡的部分結果加總後交還每張卡;後者讓每張卡各自交換不同資料,常用來把 token 送到專家。
- 算術強度
- 每搬一 byte 資料能做多少 FLOP;低於模型轉折點通常等記憶體,高於它通常等算力。
- micro-batch
- 把一個很大的訓練 batch 切成較小批,依序塞進管線,讓各段同時有事做。
- checkpoint
- 定期保存權重與優化器狀態;硬體故障或 loss 發散後能回到較早版本,不必整場重來。
- scale-up/scale-out
- 高速、緊密耦合的互連是 scale-up,較大範圍的網路是 scale-out。本頁把界線畫在一櫃,但它是系統設計選擇,不是物理常數。
- MFU
- 實際用到的算力佔理論峰值的比例,也像工廠稼動率:MFU 30% 表示其餘 70% 在等資料、等別人對答案或等管線填滿。
- PUE
- 整廠用電除以 IT 用電。1.15 表示每餵給機器一度電,機房另外要花 0.15 度在散熱與配電上。
- 卡/加速器/GPU
- 這一頁裡是同一件事:機櫃裡那一顆負責矩陣運算的處理器。
操作方式、模型範圍與限制
空白鍵播放/暫停,← → 逐步。這是把一個 decoder-only Transformer 放進虛構 64 卡機櫃的瀏覽器解析模型,不是廠商設計、實測 benchmark 或真的模型。它不模擬排隊分布、自動擴縮、TCO、straggler、靜默資料毀損、網路超額訂閱與 rail-optimized placement。
左邊沿用 NVIDIA 的「AI 五層蛋糕」:能源、晶片、基礎設施、模型、應用。它是好用的依賴地圖,不是業界標準。配電、散熱、建築,以及各自獨立的 scale-up、scale-out、儲存與管理網路,都屬於基礎設施。
這些硬體實際在跑的東西,另外有兩頁,尺度小得多:神經網路把鏈鎖律一個節點一個節點拆開;Transformer則在你的瀏覽器裡跑一個真的訓練過的模型。三頁的學習方法相同;這一頁多出來的是讓它在實體世界跑得起來的那一整層——模型怎麼切到很多張卡、梯度怎麼在卡之間搬、記憶體、故障、供電與散熱。
prompt 是走網際網路到機房的,那一段路另外有一頁:封包旅程(DNS、TCP、TLS、request)。