home.social

#quantisierung — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #quantisierung, aggregated by home.social.

  1. RT @MiaAI_lab: WOW, ein wichtiges Release von NVIDIA 🔥 NVIDIA Model Optimizer 0.45.0 ist verfügbar — große Upgrades für alle, aber besonders spannend für MoE-Modelle mit NVFP4-Quantisierung! Die wichtigsten Vorteile für MoE-Quantisierung: ✨ Neuer „Active Experts“-Modus in AutoQuantize — versteht nun, dass nur einige Experten gleichzeitig aktiv sind, für intelligentere Mixed-Precision-Entscheidungen ✨ Bessere Quantisierung für DeepSeek-ähnliche Modelle + einfache exakte MXFP4 → NVFP4-Konvertierung für geroutete Experten ✨ Neuer W4A16 NVFP4 Weight-Only-Modus (keine Kalibrierung nötig) — enorme Speichereinsparungen bei guter Qualität ✨ Verbesserte Kalibrierungs- und KV-Cache-Optionen, speziell für MoE-Modelle entwickelt. Dies sollte zu hochwertigeren NVFP4-MoE-Modellen, geringerem Speicherverbrauch und besserem Durchsatz auf Blackwell-GPUs führen, bei fast keinem Genauigkeitsverlust! Dies könnte die Probleme beheben, die ich mit Qwen3.6-35b NVFP4 habe, falls NVIDIA das Modell aktualisiert. Vollständige Notizen: github.com/NVIDIA/Model-Opti… Link Release ModelOpt 0.45.0 Release · NVIDIA/Model-Optimizer Neue Features Quantisierung NVFP4 W4A16 Weight-Only-Quantisierung hinzugefügt (w4a16nvfp4): FP4-Gewichte mit groupsize=16, BF16-Aktivierungen, keine Kalibrierungs-Forward-Pass erforderlich. Verwende mtq.W4A16NVFP4CFG oder... github.com

    mehr auf Arint.info

    #Blackwell #ModelOptimizer #MoE #NVFP4 #NVIDIA #Quantisierung #arint_info

    https://x.com/MiaAI_lab/status/2074126709197074568#m

  2. RT @MiaAI_lab: WOW, ein wichtiges Release von NVIDIA 🔥 NVIDIA Model Optimizer 0.45.0 ist verfügbar — große Upgrades für alle, aber besonders spannend für MoE-Modelle mit NVFP4-Quantisierung! Die wichtigsten Vorteile für MoE-Quantisierung: ✨ Neuer „Active Experts“-Modus in AutoQuantize — versteht nun, dass nur einige Experten gleichzeitig aktiv sind, für intelligentere Mixed-Precision-Entscheidungen ✨ Bessere Quantisierung für DeepSeek-ähnliche Modelle + einfache exakte MXFP4 → NVFP4-Konvertierung für geroutete Experten ✨ Neuer W4A16 NVFP4 Weight-Only-Modus (keine Kalibrierung nötig) — enorme Speichereinsparungen bei guter Qualität ✨ Verbesserte Kalibrierungs- und KV-Cache-Optionen, speziell für MoE-Modelle entwickelt. Dies sollte zu hochwertigeren NVFP4-MoE-Modellen, geringerem Speicherverbrauch und besserem Durchsatz auf Blackwell-GPUs führen, bei fast keinem Genauigkeitsverlust! Dies könnte die Probleme beheben, die ich mit Qwen3.6-35b NVFP4 habe, falls NVIDIA das Modell aktualisiert. Vollständige Notizen: github.com/NVIDIA/Model-Opti… Link Release ModelOpt 0.45.0 Release · NVIDIA/Model-Optimizer Neue Features Quantisierung NVFP4 W4A16 Weight-Only-Quantisierung hinzugefügt (w4a16nvfp4): FP4-Gewichte mit groupsize=16, BF16-Aktivierungen, keine Kalibrierungs-Forward-Pass erforderlich. Verwende mtq.W4A16NVFP4CFG oder... github.com

    mehr auf Arint.info

    #Blackwell #ModelOptimizer #MoE #NVFP4 #NVIDIA #Quantisierung #arint_info

    https://x.com/MiaAI_lab/status/2074126709197074568#m

  3. RT @MiaAI_lab: WOW, ein wichtiges Release von NVIDIA 🔥 NVIDIA Model Optimizer 0.45.0 ist verfügbar — große Upgrades für alle, aber besonders spannend für MoE-Modelle mit NVFP4-Quantisierung! Die wichtigsten Vorteile für MoE-Quantisierung: ✨ Neuer „Active Experts“-Modus in AutoQuantize — versteht nun, dass nur einige Experten gleichzeitig aktiv sind, für intelligentere Mixed-Precision-Entscheidungen ✨ Bessere Quantisierung für DeepSeek-ähnliche Modelle + einfache exakte MXFP4 → NVFP4-Konvertierung für geroutete Experten ✨ Neuer W4A16 NVFP4 Weight-Only-Modus (keine Kalibrierung nötig) — enorme Speichereinsparungen bei guter Qualität ✨ Verbesserte Kalibrierungs- und KV-Cache-Optionen, speziell für MoE-Modelle entwickelt. Dies sollte zu hochwertigeren NVFP4-MoE-Modellen, geringerem Speicherverbrauch und besserem Durchsatz auf Blackwell-GPUs führen, bei fast keinem Genauigkeitsverlust! Dies könnte die Probleme beheben, die ich mit Qwen3.6-35b NVFP4 habe, falls NVIDIA das Modell aktualisiert. Vollständige Notizen: github.com/NVIDIA/Model-Opti… Link Release ModelOpt 0.45.0 Release · NVIDIA/Model-Optimizer Neue Features Quantisierung NVFP4 W4A16 Weight-Only-Quantisierung hinzugefügt (w4a16nvfp4): FP4-Gewichte mit groupsize=16, BF16-Aktivierungen, keine Kalibrierungs-Forward-Pass erforderlich. Verwende mtq.W4A16NVFP4CFG oder... github.com

    mehr auf Arint.info

    #Blackwell #ModelOptimizer #MoE #NVFP4 #NVIDIA #Quantisierung #arint_info

    https://x.com/MiaAI_lab/status/2074126709197074568#m

  4. RT @bnjmn_marie: Gemma 4 12B ist schwer zu quantisieren. Ich konnte kein GGUF unter 6,4 GB finden, das gut funktioniert. MoQ 4.25 ist immer noch ziemlich gut und spart im Vergleich zu UD Q4KXL 0,9 GB. Unterhalb dieses Wertes würde ich keines der anderen GGUFs empfehlen, die ich bewertet habe.

    mehr auf Arint.info

    #Gemma4 #GGUF #LLM #MoQ #Quantisierung #UDQ4_K_XL #arint_info

    https://x.com/bnjmn_marie/status/2064097932459069716#m

  5. RT @bnjmn_marie: Gemma 4 12B ist schwer zu quantisieren. Ich konnte kein GGUF unter 6,4 GB finden, das gut funktioniert. MoQ 4.25 ist immer noch ziemlich gut und spart im Vergleich zu UD Q4KXL 0,9 GB. Unterhalb dieses Wertes würde ich keines der anderen GGUFs empfehlen, die ich bewertet habe.

    mehr auf Arint.info

    #Gemma4 #GGUF #LLM #MoQ #Quantisierung #UDQ4_K_XL #arint_info

    https://x.com/bnjmn_marie/status/2064097932459069716#m

  6. RT @bnjmn_marie: Gemma 4 12B ist schwer zu quantisieren. Ich konnte kein GGUF unter 6,4 GB finden, das gut funktioniert. MoQ 4.25 ist immer noch ziemlich gut und spart im Vergleich zu UD Q4KXL 0,9 GB. Unterhalb dieses Wertes würde ich keines der anderen GGUFs empfehlen, die ich bewertet habe.

    mehr auf Arint.info

    #Gemma4 #GGUF #LLM #MoQ #Quantisierung #UDQ4_K_XL #arint_info

    https://x.com/bnjmn_marie/status/2064097932459069716#m

  7. RT @bnjmn_marie: Gemma 4 12B ist schwer zu quantisieren. Ich konnte kein GGUF unter 6,4 GB finden, das gut funktioniert. MoQ 4.25 ist immer noch ziemlich gut und spart im Vergleich zu UD Q4KXL 0,9 GB. Unterhalb dieses Wertes würde ich keines der anderen GGUFs empfehlen, die ich bewertet habe.

    mehr auf Arint.info

    #Gemma4 #GGUF #LLM #MoQ #Quantisierung #UDQ4_K_XL #arint_info

    https://x.com/bnjmn_marie/status/2064097932459069716#m

  8. RT @bnjmn_marie: Gemma 4 12B ist schwer zu quantisieren. Ich konnte kein GGUF unter 6,4 GB finden, das gut funktioniert. MoQ 4.25 ist immer noch ziemlich gut und spart im Vergleich zu UD Q4KXL 0,9 GB. Unterhalb dieses Wertes würde ich keines der anderen GGUFs empfehlen, die ich bewertet habe.

    mehr auf Arint.info

    #Gemma4 #GGUF #LLM #MoQ #Quantisierung #UDQ4_K_XL #arint_info

    https://x.com/bnjmn_marie/status/2064097932459069716#m

  9. RT @bnjmn_marie: Gemma 4 12B ist schwer zu quantisieren. Ich konnte kein GGUF unter 6,4 GB finden, das gut funktioniert. MoQ 4.25 ist immer noch ziemlich gut und spart im Vergleich zu UD Q4KXL 0,9 GB. Darunter würde ich keines der anderen GGUFs empfehlen, die ich evaluiert habe.

    mehr auf Arint.info

    #Gemma4 #GGUF #LLM #MachineLearning #MoQ #Quantisierung #arint_info

    https://x.com/bnjmn_marie/status/2064097932459069716#m

  10. RT @bnjmn_marie: Gemma 4 12B ist schwer zu quantisieren. Ich konnte kein GGUF unter 6,4 GB finden, das gut funktioniert. MoQ 4.25 ist immer noch ziemlich gut und spart im Vergleich zu UD Q4KXL 0,9 GB. Darunter würde ich keines der anderen GGUFs empfehlen, die ich evaluiert habe.

    mehr auf Arint.info

    #Gemma4 #GGUF #LLM #MachineLearning #MoQ #Quantisierung #arint_info

    https://x.com/bnjmn_marie/status/2064097932459069716#m

  11. RT @NeoAIForecast: Gemma 4 12B Q4 im Vergleich zu QAT Q4 auf einer AMD Radeon RX 7800 XT unter Verwendung von llama.cpp + ROCm. Der Durchschnittswert aus 5 Läufen zeigt für UD-Q4KXL: 6,85 GiB VRAM, 1274 Prompt-Token/s, 42,3 generierte Token/s und 75,0 % (123/164) bei HumanEval. Für QAT UD-Q4KXL: 6,24 GiB VRAM, 1395 Prompt-Token/s, 52,9 generierte Token/s und 90,85 % (149/164) bei HumanEval. Das QAT-Modell gewinnt in allen Kategorien: 8,9 % kleiner, 25 % schnellere Generierung und +15,85 Punkte bei HumanEval. Die größte Überraschung ist nicht die Geschwindigkeits- oder Größeneinsparung, sondern dass das QAT-quantisierte Modell bei geringerem VRAM-Verbrauch eine deutlich bessere Leistung bei Programmieraufgaben liefert.

    mehr auf Arint.info

    #AMD #Gemma4 #llamacpp #QAT #Quantisierung #ROCm #arint_info

    https://x.com/NeoAIForecast/status/2063182829010530757#m

  12. RT @NeoAIForecast: Gemma 4 12B Q4 im Vergleich zu QAT Q4 auf einer AMD Radeon RX 7800 XT unter Verwendung von llama.cpp + ROCm. Der Durchschnittswert aus 5 Läufen zeigt für UD-Q4KXL: 6,85 GiB VRAM, 1274 Prompt-Token/s, 42,3 generierte Token/s und 75,0 % (123/164) bei HumanEval. Für QAT UD-Q4KXL: 6,24 GiB VRAM, 1395 Prompt-Token/s, 52,9 generierte Token/s und 90,85 % (149/164) bei HumanEval. Das QAT-Modell gewinnt in allen Kategorien: 8,9 % kleiner, 25 % schnellere Generierung und +15,85 Punkte bei HumanEval. Die größte Überraschung ist nicht die Geschwindigkeits- oder Größeneinsparung, sondern dass das QAT-quantisierte Modell bei geringerem VRAM-Verbrauch eine deutlich bessere Leistung bei Programmieraufgaben liefert.

    mehr auf Arint.info

    #AMD #Gemma4 #llamacpp #QAT #Quantisierung #ROCm #arint_info

    https://x.com/NeoAIForecast/status/2063182829010530757#m