home.social

#modeloptimizer — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #modeloptimizer, aggregated by home.social.

  1. RT @MiaAI_lab: WOW, ein wichtiges Release von NVIDIA 🔥 NVIDIA Model Optimizer 0.45.0 ist verfügbar — große Upgrades für alle, aber besonders spannend für MoE-Modelle mit NVFP4-Quantisierung! Die wichtigsten Vorteile für MoE-Quantisierung: ✨ Neuer „Active Experts“-Modus in AutoQuantize — versteht nun, dass nur einige Experten gleichzeitig aktiv sind, für intelligentere Mixed-Precision-Entscheidungen ✨ Bessere Quantisierung für DeepSeek-ähnliche Modelle + einfache exakte MXFP4 → NVFP4-Konvertierung für geroutete Experten ✨ Neuer W4A16 NVFP4 Weight-Only-Modus (keine Kalibrierung nötig) — enorme Speichereinsparungen bei guter Qualität ✨ Verbesserte Kalibrierungs- und KV-Cache-Optionen, speziell für MoE-Modelle entwickelt. Dies sollte zu hochwertigeren NVFP4-MoE-Modellen, geringerem Speicherverbrauch und besserem Durchsatz auf Blackwell-GPUs führen, bei fast keinem Genauigkeitsverlust! Dies könnte die Probleme beheben, die ich mit Qwen3.6-35b NVFP4 habe, falls NVIDIA das Modell aktualisiert. Vollständige Notizen: github.com/NVIDIA/Model-Opti… Link Release ModelOpt 0.45.0 Release · NVIDIA/Model-Optimizer Neue Features Quantisierung NVFP4 W4A16 Weight-Only-Quantisierung hinzugefügt (w4a16nvfp4): FP4-Gewichte mit groupsize=16, BF16-Aktivierungen, keine Kalibrierungs-Forward-Pass erforderlich. Verwende mtq.W4A16NVFP4CFG oder... github.com

    mehr auf Arint.info

    #Blackwell #ModelOptimizer #MoE #NVFP4 #NVIDIA #Quantisierung #arint_info

    https://x.com/MiaAI_lab/status/2074126709197074568#m

  2. RT @MiaAI_lab: WOW, ein wichtiges Release von NVIDIA 🔥 NVIDIA Model Optimizer 0.45.0 ist verfügbar — große Upgrades für alle, aber besonders spannend für MoE-Modelle mit NVFP4-Quantisierung! Die wichtigsten Vorteile für MoE-Quantisierung: ✨ Neuer „Active Experts“-Modus in AutoQuantize — versteht nun, dass nur einige Experten gleichzeitig aktiv sind, für intelligentere Mixed-Precision-Entscheidungen ✨ Bessere Quantisierung für DeepSeek-ähnliche Modelle + einfache exakte MXFP4 → NVFP4-Konvertierung für geroutete Experten ✨ Neuer W4A16 NVFP4 Weight-Only-Modus (keine Kalibrierung nötig) — enorme Speichereinsparungen bei guter Qualität ✨ Verbesserte Kalibrierungs- und KV-Cache-Optionen, speziell für MoE-Modelle entwickelt. Dies sollte zu hochwertigeren NVFP4-MoE-Modellen, geringerem Speicherverbrauch und besserem Durchsatz auf Blackwell-GPUs führen, bei fast keinem Genauigkeitsverlust! Dies könnte die Probleme beheben, die ich mit Qwen3.6-35b NVFP4 habe, falls NVIDIA das Modell aktualisiert. Vollständige Notizen: github.com/NVIDIA/Model-Opti… Link Release ModelOpt 0.45.0 Release · NVIDIA/Model-Optimizer Neue Features Quantisierung NVFP4 W4A16 Weight-Only-Quantisierung hinzugefügt (w4a16nvfp4): FP4-Gewichte mit groupsize=16, BF16-Aktivierungen, keine Kalibrierungs-Forward-Pass erforderlich. Verwende mtq.W4A16NVFP4CFG oder... github.com

    mehr auf Arint.info

    #Blackwell #ModelOptimizer #MoE #NVFP4 #NVIDIA #Quantisierung #arint_info

    https://x.com/MiaAI_lab/status/2074126709197074568#m

  3. RT @MiaAI_lab: WOW, ein wichtiges Release von NVIDIA 🔥 NVIDIA Model Optimizer 0.45.0 ist verfügbar — große Upgrades für alle, aber besonders spannend für MoE-Modelle mit NVFP4-Quantisierung! Die wichtigsten Vorteile für MoE-Quantisierung: ✨ Neuer „Active Experts“-Modus in AutoQuantize — versteht nun, dass nur einige Experten gleichzeitig aktiv sind, für intelligentere Mixed-Precision-Entscheidungen ✨ Bessere Quantisierung für DeepSeek-ähnliche Modelle + einfache exakte MXFP4 → NVFP4-Konvertierung für geroutete Experten ✨ Neuer W4A16 NVFP4 Weight-Only-Modus (keine Kalibrierung nötig) — enorme Speichereinsparungen bei guter Qualität ✨ Verbesserte Kalibrierungs- und KV-Cache-Optionen, speziell für MoE-Modelle entwickelt. Dies sollte zu hochwertigeren NVFP4-MoE-Modellen, geringerem Speicherverbrauch und besserem Durchsatz auf Blackwell-GPUs führen, bei fast keinem Genauigkeitsverlust! Dies könnte die Probleme beheben, die ich mit Qwen3.6-35b NVFP4 habe, falls NVIDIA das Modell aktualisiert. Vollständige Notizen: github.com/NVIDIA/Model-Opti… Link Release ModelOpt 0.45.0 Release · NVIDIA/Model-Optimizer Neue Features Quantisierung NVFP4 W4A16 Weight-Only-Quantisierung hinzugefügt (w4a16nvfp4): FP4-Gewichte mit groupsize=16, BF16-Aktivierungen, keine Kalibrierungs-Forward-Pass erforderlich. Verwende mtq.W4A16NVFP4CFG oder... github.com

    mehr auf Arint.info

    #Blackwell #ModelOptimizer #MoE #NVFP4 #NVIDIA #Quantisierung #arint_info

    https://x.com/MiaAI_lab/status/2074126709197074568#m