NVIDIA 全家桶的模型压缩中枢:量化·剪枝·蒸馏一条龙
更新于 2026-09-25
← 返回汇总把「大模型压小压快」的 SOTA 技术收进一个 Python 库
NVIDIA 官方开源的模型优化库(ModelOpt):PTQ / QAT / 剪枝 / 蒸馏 / 投机解码 / 稀疏六大技术统一 API,输入 HuggingFace / PyTorch / ONNX 模型,产出可直接部署到 vLLM、TensorRT-LLM、SGLang、TensorRT 的量化 checkpoint。适合给推理降本、给显存松绑、把大模型塞进小卡的工程师团队。
641 forks · 416 open issues · Apache-2.0 · 2024-04 创建,2025-01 开源 · 前身 TensorRT Model Optimizer,2025-12 更名 · 采集于 2026-09-25(GitHub API)。
百亿级模型 FP8/NVFP4 化,吞吐可翻倍、checkpoint 缩 2-4 倍——精度还能追回。这是 Blackwell 世代 GPU 的生存法则。
量化、剪枝、蒸馏、投机解码各有论文和散装实现,拼起来工程量惊人。ModelOpt 统一 API,能组合、能导出。
TRT-LLM / vLLM / SGLang 都要吃量化 checkpoint,官方需要一个「所有模型先进这里压一遍」的漏斗。
| 技术 | 做什么 | 适用场景 |
|---|---|---|
PTQ 后训练量化 | 无需重训练,模型压 2-4 倍、推理提速 | 最常用入口:FP8 / NVFP4 / INT8 / INT4 开箱即用 |
QAT / QAD 量化感知训练 | 少量训练步数把量化掉的精度补回来 | 激进量化(W4A4)后精度追平 BF16 |
Pruning 剪枝 | 删掉不重要的权重/通道,模型变小变快 | Minitron 宽度剪枝;Puzzletron 异构 NAS |
Distillation 蒸馏 | 大模型教小模型,小模型继承能力 | 与剪枝/量化串联的两阶段范式 |
Speculative Decoding | 训练 draft 模块一次预测多个 token | 降延迟场景(Medusa 等) |
Sparsity 稀疏 | 只存非零参数及其位置 | 结构化稀疏硬件加速 |
每项技术都有独立 example 目录(examples/hf_ptq、examples/pruning、examples/llm_qat…)+ 官方文档页。
355B → 260B,欧洲主权 AI 模型用 Minitron 剪枝+蒸馏压缩(2026/04 客户案例)。
比原模型小 33%、快 50%、质量保留 90%(2026/03 客户案例)。
Puzzletron(2026/05)把异构剪枝与 NAS 结合成自动架构搜索,从「均匀砍」进化到「按层异构砍」。
| 模型 / 客户 | 优化路径 | 结果 |
|---|---|---|
| Nemotron 3 Ultra 550B | NVFP4 量化 | decode 吞吐 5.9× vs GLM-5.1 754B FP4,精度匹配 BF16 |
| Qwen3.6-35B-A3B | W4A4 NVFP4 PTQ + QAD | vLLM 吞吐 1.30× vs BF16,checkpoint 小 3.1× |
| Nemotron 3 Nano 30B-A3B | 剪枝 + 两阶段蒸馏 + FP8 | 2.6× vLLM 吞吐 + 2.6× 内存缩减 |
| Adobe(扩散模型) | ModelOpt + TensorRT | 扩散延迟 −60%,TCO −40% |
| Llama 3.1 405B | FP8(2024,H200) | 性能 +44% |
| Stable Diffusion | INT8 PTQ(2024) | TensorRT 中接近 2× 提速 |
数据来源:官方 README News 区与 NVIDIA Developer Blog(2024-2026)。
# 安装 pip install -U nvidia-modelopt[all] # PTQ:HuggingFace 模型 → FP8 量化 checkpoint import modelopt.torch.quantization as mtq model = load_hf_model(...) mtq.quantize(model, mtq.FP8_DEFAULT_CFG, forward_loop=calibrate) # 导出后直接给 vLLM / TensorRT-LLM 加载
另有容器路径:nvcr.io/nvidia/pytorch / nemo / tensorrt-llm 已预装。QAT / 剪枝 / 蒸馏见 examples/ 对应目录。甚至提供 Claude Code / Codex 插件,让 agent 直接调用 modelopt 技能。
Playground 是一个优化路径决策器:选模型规模、精度底线、可否重训练、目标(提速/省显存/缩体积)→ 实时推荐 PTQ / QAT / 剪枝+蒸馏 / 投机解码的组合路径,附量化格式建议(INT8/FP8/NVFP4)与预期收益区间。规则表来自 README 技术矩阵与官方案例,全部可追溯。
纯前端实现,零网络依赖 · 决策规则真值表 sandbox 全组合验证 + node 对拍
评分 8.5:NVIDIA 把「模型压缩」做成了事实上的产业漏斗——上游吃 HF/Megatron 训练生态,下游喂 vLLM/TRT-LLM/SGLang 三大推理引擎,中间唯一的官方通道就是它。NVFP4 随 Blackwell 普及只会更关键,预量化 checkpoint 直发 HuggingFace 的打法正在定义「部署即量化」的默认工作流。看点:AutoQuantize 全自动化、Puzzletron NAS、diffusers 图像模型量化扩展。扣分:硬件强绑定限制通用性、pre-1.0 API 漂移、416 open issues 的支持压力。对 NVIDIA 栈用户是必选项,对跨厂商部署则是选项之一。