【大模型基础设施工程】14:量化工程 —— INT8 / FP8 / FP4 / AWQ / GPTQ 怎么选
decode 受显存带宽限制,量化把权重从 BF16 压到 FP8 或 INT4 就能直接换来显存和延迟收益。本文讲清 FP8/FP4/MX 数据类型、GPTQ/AWQ/SmoothQuant/旋转法各自解决什么问题、KV Cache 量化的收益边界,给出按硬件选位宽的规则和 AutoAWQ + vLLM、TensorRT-LLM FP8 的落地命令。
Linux 内核、存储与网络、可观测性、系统架构与大模型基础设施的工程笔记:机制拆解、踩坑复盘与可核对证据,少空谈。
共 3 篇文章 · 返回首页
decode 受显存带宽限制,量化把权重从 BF16 压到 FP8 或 INT4 就能直接换来显存和延迟收益。本文讲清 FP8/FP4/MX 数据类型、GPTQ/AWQ/SmoothQuant/旋转法各自解决什么问题、KV Cache 量化的收益边界,给出按硬件选位宽的规则和 AutoAWQ + vLLM、TensorRT-LLM FP8 的落地命令。
低精度既省显存带宽又提算力。实测 FP16 逐元素算子比 FP32 快 1.81 倍。讲清量化的对称/非对称、per-tensor/per-channel 粒度、反量化时机、INT8 dp4a 与 Tensor Core 路径,以及精度对齐的工程坑。
算子工程的前沿方向:Hopper 的 TMA 异步搬运与 wgmma、Blackwell 的更低精度、ThunderKittens 等 tile 级库降低门槛、Triton/MLIR 的编译器自动生成算子。本系列测试卡为 Ampere,相关特性为引用与前瞻,明确标注。