硬體 & 晶片規格
模型 & 精度規格
推論 & 場景參數
MoE & 機架通訊參數
集群機架拓撲與 NVLink 通訊頻寬視覺化
動態 Roofline 分析圖表
KV Cache 多級存儲與移載經濟決策器
基於第一性原理折算:將快取保留在 HBM、移載至 DDR / SSD / HDD,或是直接刪除重算 (Remat) 的機會成本對比。
大模型硬體理論核心庫
1. Roofline Model 與推論瓶頸
解碼階段 (Decode Step) 是自迴歸生成的核心。每生成一個 Token,系統必須在「計算時間」與「記憶體加載時間」兩者間取最大值,這在晶片級限制了效能。
2. 最適權重平衡 Batch 點推導
當不考慮 KV Cache 且算力時間等於記憶體讀取權重的時間時,晶片的使用效率(MFU)最高。此時的臨界 Batch Size ($B_{\text{optimal}}$) 取決於硬體的算力頻寬比與稀疏度。
3. 機架通訊與 MoE 部署限制
EP(專家平行)將不同的 MoE 專家分發在不同 GPU 上。但這引發了全對全(All-to-All)通訊瓶頸。NVLink 僅在單機架(Scale-up)內極快,跨機架(Scale-out)會因頻寬驟降而嚴重卡頓。
4. 預算均等與 100 倍 Over-training
為了優化「預訓練、RL 訓練與推理服務」三者的總花費,三者的算力成本應達到 Heuristic 均衡。由於推理量龐大,為了降低推理成本,在預訓練階段超量訓練大約 100 倍是最合適的選擇。
5. Feistel Cipher 與 可逆網絡 RevNets
RevNets 借用了密碼學中 Feistel Cipher 的可逆結構,讓整個 Transformer 的前向傳播在數學上完全可逆。這讓訓練時不需要保留中間 Activation 狀態,在 Backward 時動態反解,極致省下 HBM 空間。