项目详情

NVIDIA Model Optimizer

NVIDIA 全家桶的模型压缩中枢:量化·剪枝·蒸馏一条龙

GitHub 地址 Apache-2.0 PythonNVFP4 / FP8v0.47

更新于 2026-09-25

← 返回汇总
项目速览

一句话定位

把「大模型压小压快」的 SOTA 技术收进一个 Python 库

NVIDIA 官方开源的模型优化库(ModelOpt):PTQ / QAT / 剪枝 / 蒸馏 / 投机解码 / 稀疏六大技术统一 API,输入 HuggingFace / PyTorch / ONNX 模型,产出可直接部署到 vLLM、TensorRT-LLM、SGLang、TensorRT 的量化 checkpoint。适合给推理降本、给显存松绑、把大模型塞进小卡的工程师团队。

项目速览

核心数据

4.3k
GitHub Stars
6
优化技术
4
部署框架出口
0.47
当前版本(月度发版)

641 forks · 416 open issues · Apache-2.0 · 2024-04 创建,2025-01 开源 · 前身 TensorRT Model Optimizer,2025-12 更名 · 采集于 2026-09-25(GitHub API)。

为什么存在

大模型落地的账算不过来

BF16 太贵

百亿级模型 FP8/NVFP4 化,吞吐可翻倍、checkpoint 缩 2-4 倍——精度还能追回。这是 Blackwell 世代 GPU 的生存法则。

技术散落

量化、剪枝、蒸馏、投机解码各有论文和散装实现,拼起来工程量惊人。ModelOpt 统一 API,能组合、能导出。

NVIDIA 需要入口

TRT-LLM / vLLM / SGLang 都要吃量化 checkpoint,官方需要一个「所有模型先进这里压一遍」的漏斗。

🔥 核心定位

Input → Optimize → Export:三段式流水线

输入 Hugging Face PyTorch ONNX transformers + diffusers 优化(ModelOpt Python API) PTQ(FP8 / NVFP4 / INT8 / INT4) QAT + 量化感知蒸馏(QAD) 剪枝(Minitron / Puzzletron NAS) 蒸馏 · 投机解码 · 稀疏 技术可自由组合 → 导出量化 checkpoint 部署出口 vLLM TensorRT-LLM / TensorRT SGLang 免转换直接加载 → →
本库核心 输入源 部署目标
🔥 技术矩阵

六大优化技术,统一 API 可组合

技术做什么适用场景
PTQ 后训练量化无需重训练,模型压 2-4 倍、推理提速最常用入口:FP8 / NVFP4 / INT8 / INT4 开箱即用
QAT / QAD 量化感知训练少量训练步数把量化掉的精度补回来激进量化(W4A4)后精度追平 BF16
Pruning 剪枝删掉不重要的权重/通道,模型变小变快Minitron 宽度剪枝;Puzzletron 异构 NAS
Distillation 蒸馏大模型教小模型,小模型继承能力与剪枝/量化串联的两阶段范式
Speculative Decoding训练 draft 模块一次预测多个 token降延迟场景(Medusa 等)
Sparsity 稀疏只存非零参数及其位置结构化稀疏硬件加速

每项技术都有独立 example 目录(examples/hf_ptq、examples/pruning、examples/llm_qat…)+ 官方文档页。

核心机制

量化格式谱系:从 INT8 到 NVFP4

INT8 / INT4 → FP8(Hopper) → NVFP4(Blackwell) → W4A4 全 FP4
核心机制

剪枝 + 蒸馏:Minitron 造小模型范式

大模型 → 重要性估计 → 宽度/深度剪枝 → 两阶段蒸馏补课 → 小模型 + 量化
Domyn · Colosseum

355B → 260B,欧洲主权 AI 模型用 Minitron 剪枝+蒸馏压缩(2026/04 客户案例)。

Bielik Minitron 7B

比原模型小 33%、快 50%、质量保留 90%(2026/03 客户案例)。

Puzzletron(2026/05)把异构剪枝与 NAS 结合成自动架构搜索,从「均匀砍」进化到「按层异构砍」。

实战战绩

数字说话:官方与客户案例

模型 / 客户优化路径结果
Nemotron 3 Ultra 550BNVFP4 量化decode 吞吐 5.9× vs GLM-5.1 754B FP4,精度匹配 BF16
Qwen3.6-35B-A3BW4A4 NVFP4 PTQ + QADvLLM 吞吐 1.30× vs BF16,checkpoint 小 3.1×
Nemotron 3 Nano 30B-A3B剪枝 + 两阶段蒸馏 + FP82.6× vLLM 吞吐 + 2.6× 内存缩减
Adobe(扩散模型)ModelOpt + TensorRT扩散延迟 −60%,TCO −40%
Llama 3.1 405BFP8(2024,H200)性能 +44%
Stable DiffusionINT8 PTQ(2024)TensorRT 中接近 2× 提速

数据来源:官方 README News 区与 NVIDIA Developer Blog(2024-2026)。

🔥 生态位

夹在训练框架与推理引擎之间

训练侧集成(QAT / 剪枝 / 蒸馏需要训练循环) Megatron-Bridge Megatron-LM Hugging Face Accelerate NVIDIA NeMo 容器 本库 ModelOpt — nvidia-modelopt · 统一 Python API + HF 导出 推理侧出口 vLLM SGLang TensorRT-LLM TensorRT 预量化 checkpoint 直发 HuggingFace ↓ 量化 checkpoint ↓ ↓
本库 训练侧集成 推理侧出口
快速上手

pip 一装,五行完成 FP8 量化

# 安装
pip install -U nvidia-modelopt[all]

# PTQ:HuggingFace 模型 → FP8 量化 checkpoint
import modelopt.torch.quantization as mtq
model = load_hf_model(...)
mtq.quantize(model, mtq.FP8_DEFAULT_CFG, forward_loop=calibrate)
# 导出后直接给 vLLM / TensorRT-LLM 加载

另有容器路径:nvcr.io/nvidia/pytorch / nemo / tensorrt-llm 已预装。QAT / 剪枝 / 蒸馏见 examples/ 对应目录。甚至提供 Claude Code / Codex 插件,让 agent 直接调用 modelopt 技能。

开箱即用

不想自己压?直接下载官方成品

工程化

把「开源库」当产品运营

  • 月度发版:0.47.0(2026-09-23),rc0→rc2→正式,节奏稳定
  • 弃用政策成文:pre-1.0 阶段,废弃功能给 1 个 release(约 1 个月)迁移期 + 运行时警告
  • 破坏性变更透明:minor 版本也可能移除 API,升级前看 changelog
  • 文档站完整:nvidia.github.io/Model-Optimizer,量化/蒸馏/投机解码各有 guide
  • Roadmap 公开:issue #1699 跟踪
  • 接受社区 PR:2025-01 开源起就明确欢迎贡献
在线体验

你的模型该走哪条优化路?现场选型

Playground 是一个优化路径决策器:选模型规模、精度底线、可否重训练、目标(提速/省显存/缩体积)→ 实时推荐 PTQ / QAT / 剪枝+蒸馏 / 投机解码的组合路径,附量化格式建议(INT8/FP8/NVFP4)与预期收益区间。规则表来自 README 技术矩阵与官方案例,全部可追溯。

打开 Playground

纯前端实现,零网络依赖 · 决策规则真值表 sandbox 全组合验证 + node 对拍

风险提示

需要警惕

潜力评估

未来空间

评分 8.5:NVIDIA 把「模型压缩」做成了事实上的产业漏斗——上游吃 HF/Megatron 训练生态,下游喂 vLLM/TRT-LLM/SGLang 三大推理引擎,中间唯一的官方通道就是它。NVFP4 随 Blackwell 普及只会更关键,预量化 checkpoint 直发 HuggingFace 的打法正在定义「部署即量化」的默认工作流。看点:AutoQuantize 全自动化、Puzzletron NAS、diffusers 图像模型量化扩展。扣分:硬件强绑定限制通用性、pre-1.0 API 漂移、416 open issues 的支持压力。对 NVIDIA 栈用户是必选项,对跨厂商部署则是选项之一。


1 / 16