LLM Infra Visualizer

第一性原理 (First Principles) 硬體極限與 Token 經濟學動態模擬器

動態理論場景:

硬體 & 晶片規格

單卡算力峰值 2250 TFLOPS
HBM 記憶體頻寬 8.0 TB/s
自動推算 GPU 集群大小: 8 張 GPU (TP-8)

模型 & 精度規格

總參數量 (Total Params) 671 B
激活參數量 (Active Params) 37 B
權重精度 (Precision) FP8 (1 Byte)

推論 & 場景參數

批次大小 Batch Size (B) 128
上下文長度 (Context Length / L) 200,000
KV Cache 大小 / Token 2.0 KB
提示詞快取命中率 (Prompt Cache Hit Rate) 0 %

MoE & 機架通訊參數

機架外頻寬降幅 (gamma) 8.0 倍慢
激活專家數 (E_active) 8 個
每個 Stage 層數 (N_layer) 2 層
通訊網路傳輸效率 (eta) 30 %
目前晶片運行瓶頸:MEMORY BANDWIDTH BOUND (記憶體頻寬受限)
Weight Fetch 佔 92.7% 耗時
跨機架通訊狀態:COMMUNICATION SAFE (跨機架通訊安全)
比值 t_scale-up / t_scale-out = 1.20 >= 1
Step 計算耗時 (t_compute)
4.21 ms
Step 記憶體讀取耗時 (t_mem)
90.43 ms
最適權重平衡批次 (B_crossover)
2550 seqs
首字延遲 (TTFT)
120.00 ms

集群機架拓撲與 NVLink 通訊頻寬視覺化

RACK A: NVLINK SUPERPOD (ULTRA LOW LATENCY - SCALE-UP) NVSWITCH FABRIC Non-blocking 7.2 TB/s GPU 1 GPU 2 GPU 3 GPU 4 GPU 5 GPU 6 GPU 7 GPU 8 NVLINK: 1.8 TB/s (無阻塞) RACK A (SCALE-UP) GPU 1 GPU 2 GPU 3 GPU 4 RACK B (SCALE-UP) GPU 5 GPU 6 GPU 7 GPU 8 NVLINK 1.8 TB/s TOR SWITCH Scale-out Node RACK A (EP 1-2) GPU 1 GPU 2 RACK B (EP 3-4) GPU 3 GPU 4 RACK C (EP 5-6) GPU 5 GPU 6 RACK D (EP 7-8) GPU 7 GPU 8 ETHERNET: 網路頻寬嚴重瓶頸

動態 Roofline 分析圖表

KV Cache 多級存儲與移載經濟決策器

基於第一性原理折算:將快取保留在 HBM、移載至 DDR / SSD / HDD,或是直接刪除重算 (Remat) 的機會成本對比。

快取閒置保存時間 (Retention Time) 5 分鐘
300 s
推薦最優策略: FLASH/SSD OFFLOAD
1. Recompute (重新計算) $0.00
重算延遲: -- | 空間持有: --
2. Keep in HBM (保留) $0.00
讀取延遲: -- | 空間持有: --
3. DDR Host Offload (移載) $0.00
讀取延遲: -- | 空間持有: --
4. Flash/SSD Offload (移載) $0.00
讀取延遲: -- | 空間持有: --
5. HDD Offload (慢速移載) $0.00
讀取延遲: -- | 空間持有: --

大模型硬體理論核心庫

1. Roofline Model 與推論瓶頸

解碼階段 (Decode Step) 是自迴歸生成的核心。每生成一個 Token,系統必須在「計算時間」與「記憶體加載時間」兩者間取最大值,這在晶片級限制了效能。

$$t_{\text{step}} \ge \max\left( \frac{2 \cdot B \cdot P_{\text{active}}}{F}, \frac{P_{\text{total}} \cdot W + B \cdot L \cdot K}{BW} \right)$$
「如果你不把許多使用者 Batch 在一起,你得到的經濟效益會差上千倍。」— Reiner Pope

2. 最適權重平衡 Batch 點推導

當不考慮 KV Cache 且算力時間等於記憶體讀取權重的時間時,晶片的使用效率(MFU)最高。此時的臨界 Batch Size ($B_{\text{optimal}}$) 取決於硬體的算力頻寬比與稀疏度。

$$B_{\text{optimal}} \approx \left( \frac{F}{BW} \right) \cdot \left( \frac{P_{\text{total}}}{P_{\text{active}}} \right) \cdot \left( \frac{W}{2} \right)$$
「在現代 GPU 上,算力/頻寬比(FLOPs/Bandwidth)通常維持在非常穩定的 300 左右。」— Reiner Pope

3. 機架通訊與 MoE 部署限制

EP(專家平行)將不同的 MoE 專家分發在不同 GPU 上。但這引發了全對全(All-to-All)通訊瓶頸。NVLink 僅在單機架(Scale-up)內極快,跨機架(Scale-out)會因頻寬驟降而嚴重卡頓。

$$\frac{t_{\text{scale-up}}}{t_{\text{scale-out}}} = \frac{\text{BW}_{\text{scale-out}}}{\text{BW}_{\text{scale-up}}} \cdot \left( 2 \cdot E_{\text{active}} \cdot N_{\text{layer}} \cdot \eta \right) \ge 1$$
「這就是為什麼 Ilya 曾說:『正如我們現在所知,做過細的 Pipelining 是不明智的。』」— Reiner Pope

4. 預算均等與 100 倍 Over-training

為了優化「預訓練、RL 訓練與推理服務」三者的總花費,三者的算力成本應達到 Heuristic 均衡。由於推理量龐大,為了降低推理成本,在預訓練階段超量訓練大約 100 倍是最合適的選擇。

$$C_{\text{PT}} \approx C_{\text{RL}} \approx C_{\text{inf}} \implies D_{\text{PT}} \approx \frac{1}{3} D_{\text{inf}} \gg D_{\text{Chinchilla}}$$
「大模型的最佳預訓練 Token 量,本質上應由該模型在生命週期中將產生的總推理 Token 數決定。」— Reiner Pope

5. Feistel Cipher 與 可逆網絡 RevNets

RevNets 借用了密碼學中 Feistel Cipher 的可逆結構,讓整個 Transformer 的前向傳播在數學上完全可逆。這讓訓練時不需要保留中間 Activation 狀態,在 Backward 時動態反解,極致省下 HBM 空間。

$$x_{i+1} = y_i + f(x_i), \quad y_{i+1} = x_i \implies y_i = x_{i+1} - f(y_{i+1})$$
「這與 KV Cache 剛好相反:RevNets 是多花算力來省記憶體;KV Cache 是多用記憶體來省算力。」— Reiner Pope