{"ok":true,"repo":{"id":7,"full_name":"NVIDIA/Model-Optimizer","url":"https://github.com/NVIDIA/Model-Optimizer","description":"A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.","language":"Python","topics":[],"stars":4706,"stars_delta":55,"forks":665,"first_seen":"2026-09-26T16:31:31.880760Z","last_seen":"2026-09-26T20:48:56.914354Z","mentions":1,"platforms":["github"],"score":49.01,"summary":"NVIDIA Model Optimizer (ModelOpt) is a Python library that compresses deep learning models using techniques like quantization, pruning, distillation, sparsity, neural architecture search, and speculative decoding. It takes Hugging Face, PyTorch, or ONNX models, applies optimization via Python APIs, and exports optimized checkpoints ready for deployment in inference frameworks like TensorRT-LLM, TensorRT, vLLM, and SGLang for faster inference.","why":"Recent NVFP4 quantization news and blogs, including Nemotron 3 Ultra 550B NVFP4 checkpoints and W4A4 tutorials, plus new AutoQuantize and quantization-aware distillation posts.","audience":"ML engineers deploying large models on NVIDIA hardware who want smaller, faster inference without rewriting their training pipeline.","tags":["quantization","model-compression","inference","nvidia","python","llm"],"summarized_at":"2026-09-26T16:35:34.147019Z","summary_model":"glm-5.3-flash","fetched_at":"2026-09-26T20:50:01.445860Z","meta":{"license":"Apache-2.0","archived":false,"homepage":"https://nvidia.github.io/Model-Optimizer/","pushed_at":"2026-09-26T06:14:55Z","created_at":"2024-04-23T19:00:54Z","first_stars":4651,"stars_today":354},"pushed_at":"2026-09-26T18:29:27Z","created_at":"2024-04-23T19:00:54Z","watchers":38,"open_issues":421,"mentions_list":[{"platform":"github","url":"https://github.com/NVIDIA/Model-Optimizer","title":"NVIDIA/Model-Optimizer","seen_at":"2026-09-26T20:48:56.914664Z"}],"snapshots":[{"captured_at":"2026-09-26T18:23:03.628920Z","stars":4676,"forks":663},{"captured_at":"2026-09-26T18:23:06.475716Z","stars":4676,"forks":663},{"captured_at":"2026-09-26T18:27:54.917007Z","stars":4678,"forks":663},{"captured_at":"2026-09-26T18:29:31.173646Z","stars":4678,"forks":663},{"captured_at":"2026-09-26T18:44:36.826054Z","stars":4681,"forks":663},{"captured_at":"2026-09-26T18:57:52.012333Z","stars":4685,"forks":663},{"captured_at":"2026-09-26T19:13:01.544021Z","stars":4689,"forks":664},{"captured_at":"2026-09-26T19:16:12.631593Z","stars":4689,"forks":664},{"captured_at":"2026-09-26T19:19:43.888966Z","stars":4689,"forks":664},{"captured_at":"2026-09-26T19:21:45.918628Z","stars":4689,"forks":664},{"captured_at":"2026-09-26T19:28:17.588856Z","stars":4690,"forks":664},{"captured_at":"2026-09-26T19:31:52.546199Z","stars":4691,"forks":664},{"captured_at":"2026-09-26T19:34:57.926285Z","stars":4692,"forks":664},{"captured_at":"2026-09-26T19:49:57.775642Z","stars":4696,"forks":664},{"captured_at":"2026-09-26T20:05:11.027813Z","stars":4697,"forks":664},{"captured_at":"2026-09-26T20:20:03.364136Z","stars":4701,"forks":664},{"captured_at":"2026-09-26T20:35:05.572554Z","stars":4704,"forks":664},{"captured_at":"2026-09-26T20:50:01.446831Z","stars":4706,"forks":665}]}}