【大模型基础设施工程】14:量化工程 —— INT8 / FP8 / FP4 / AWQ / GPTQ 怎么选
decode 受显存带宽限制,量化把权重从 BF16 压到 FP8 或 INT4 就能直接换来显存和延迟收益。本文讲清 FP8/FP4/MX 数据类型、GPTQ/AWQ/SmoothQuant/旋转法各自解决什么问题、KV Cache 量化的收益边界,给出按硬件选位宽的规则和 AutoAWQ + vLLM、TensorRT-LLM FP8 的落地命令。
Linux 内核、存储与网络、可观测性、系统架构与大模型基础设施的工程笔记:机制拆解、踩坑复盘与可核对证据,少空谈。
共 3 篇文章 · 返回首页
decode 受显存带宽限制,量化把权重从 BF16 压到 FP8 或 INT4 就能直接换来显存和延迟收益。本文讲清 FP8/FP4/MX 数据类型、GPTQ/AWQ/SmoothQuant/旋转法各自解决什么问题、KV Cache 量化的收益边界,给出按硬件选位宽的规则和 AutoAWQ + vLLM、TensorRT-LLM FP8 的落地命令。
算子工程的前沿方向:Hopper 的 TMA 异步搬运与 wgmma、Blackwell 的更低精度、ThunderKittens 等 tile 级库降低门槛、Triton/MLIR 的编译器自动生成算子。本系列测试卡为 Ampere,相关特性为引用与前瞻,明确标注。
从 MoE 激活比、CSA/HCA 混合注意力、mHC、Muon,到磁盘级 KV cache、FP4 QAT 和专家蒸馏,系统拆解 DeepSeek-V4 为什么能把 1M 上下文和强 Agent 能力做得又强又便宜。