home.social

#nvfp4 — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #nvfp4, aggregated by home.social.

fetched live
  1. RT @anemll: Veröffentlicht und getestet: vLLM 0.25.1 Kompatibilitäts-Overlay und TP=2 Referenz-Deployment für DeepSeek V4 Flash plus DSpark/NVFP4 auf 2× NVIDIA DGX Spark / ASUS GX10 Systemen. Enthält Integrationskorrekturen, ein Live-Dashboard, Deployment-Tooling und reproduzierbare Benchmarks. Diese Integration baut auf Arbeiten von @vllmproject, FlashInfer, Luke Alonso/b12x, @MiaAIlab, @rafaelcaricio, Keys/drowzeys, @2WildTech und vielen anderen Mitwirkenden auf. github.com/Anemll/dspark-vllm… Benchmarks 👇 Link GitHub - Anemll/dspark-vllm-gx10: Zwei-Knoten DGX Spark/ASUS GX10 DeepSeek V4 Flash DSpark NVFP4 Port... Zwei-Knoten DGX Spark/ASUS GX10 DeepSeek V4 Flash DSpark NVFP4 Port für vLLM 0.25, mit Live-Dashboard und reproduzierbarem Deployment. - Anemll/dspark-vllm-gx10 github.com

    mehr auf Arint.info

    #DeepSeek #DGXSpark #MachineLearning #NVFP4 #NVIDIA #vLLM #arint_info

    https://x.com/anemll/status/2077271758768583051#m

  2. RT @anemll: Veröffentlicht und getestet: vLLM 0.25.1 Kompatibilitäts-Overlay und TP=2 Referenz-Deployment für DeepSeek V4 Flash plus DSpark/NVFP4 auf 2× NVIDIA DGX Spark / ASUS GX10 Systemen. Enthält Integrationskorrekturen, ein Live-Dashboard, Deployment-Tooling und reproduzierbare Benchmarks. Diese Integration baut auf Arbeiten von @vllmproject, FlashInfer, Luke Alonso/b12x, @MiaAIlab, @rafaelcaricio, Keys/drowzeys, @2WildTech und vielen anderen Mitwirkenden auf. github.com/Anemll/dspark-vllm… Benchmarks 👇 Link GitHub - Anemll/dspark-vllm-gx10: Zwei-Knoten DGX Spark/ASUS GX10 DeepSeek V4 Flash DSpark NVFP4 Port... Zwei-Knoten DGX Spark/ASUS GX10 DeepSeek V4 Flash DSpark NVFP4 Port für vLLM 0.25, mit Live-Dashboard und reproduzierbarem Deployment. - Anemll/dspark-vllm-gx10 github.com

    mehr auf Arint.info

    #DeepSeek #DGXSpark #MachineLearning #NVFP4 #NVIDIA #vLLM #arint_info

    https://x.com/anemll/status/2077271758768583051#m

  3. RT @anemll: Veröffentlicht und getestet: vLLM 0.25.1 Kompatibilitäts-Overlay und TP=2 Referenz-Deployment für DeepSeek V4 Flash plus DSpark/NVFP4 auf 2× NVIDIA DGX Spark / ASUS GX10 Systemen. Enthält Integrationskorrekturen, ein Live-Dashboard, Deployment-Tooling und reproduzierbare Benchmarks. Diese Integration baut auf Arbeiten von @vllmproject, FlashInfer, Luke Alonso/b12x, @MiaAIlab, @rafaelcaricio, Keys/drowzeys, @2WildTech und vielen anderen Mitwirkenden auf. github.com/Anemll/dspark-vllm… Benchmarks 👇 Link GitHub - Anemll/dspark-vllm-gx10: Zwei-Knoten DGX Spark/ASUS GX10 DeepSeek V4 Flash DSpark NVFP4 Port... Zwei-Knoten DGX Spark/ASUS GX10 DeepSeek V4 Flash DSpark NVFP4 Port für vLLM 0.25, mit Live-Dashboard und reproduzierbarem Deployment. - Anemll/dspark-vllm-gx10 github.com

    mehr auf Arint.info

    #DeepSeek #DGXSpark #MachineLearning #NVFP4 #NVIDIA #vLLM #arint_info

    https://x.com/anemll/status/2077271758768583051#m

  4. RT @anemll: Veröffentlicht und getestet: vLLM 0.25.1 Kompatibilitäts-Overlay und TP=2 Referenz-Deployment für DeepSeek V4 Flash sowie DSpark/NVFP4 auf 2× NVIDIA DGX Spark / ASUS GX10 Systemen. Enthält Integrationskorrekturen, ein Live-Dashboard, Deployment-Tooling und reproduzierbare Benchmarks. Diese Integration baut auf Arbeiten von @vllmproject, FlashInfer, Luke Alonso/b12x, @MiaAIlab, @rafaelcaricio, Keys/drowzeys, @2WildTech und vielen anderen Mitwirkenden auf. github.com/Anemll/dspark-vllm… Benchmarks 👇 Link GitHub - Anemll/dspark-vllm-gx10: Zwei-Knoten-DGX Spark/ASUS GX10 DeepSeek V4 Flash DSpark NVFP4 Port... Zwei-Knoten-DGX Spark/ASUS GX10 DeepSeek V4 Flash DSpark NVFP4 Port für vLLM 0.25, mit Live-Dashboard und reproduzierbarem Deployment. - Anemll/dspark-vllm-gx10 github.com

    mehr auf Arint.info

    #DeepSeek #DGXSpark #MLOps #NVFP4 #NVIDIA #vLLM #arint_info

    https://x.com/anemll/status/2077271758768583051#m

  5. RT @anemll: Veröffentlicht und getestet: vLLM 0.25.1 Kompatibilitäts-Overlay und TP=2 Referenz-Deployment für DeepSeek V4 Flash sowie DSpark/NVFP4 auf 2× NVIDIA DGX Spark / ASUS GX10 Systemen. Enthält Integrationskorrekturen, ein Live-Dashboard, Deployment-Tooling und reproduzierbare Benchmarks. Diese Integration baut auf Arbeiten von @vllmproject, FlashInfer, Luke Alonso/b12x, @MiaAIlab, @rafaelcaricio, Keys/drowzeys, @2WildTech und vielen anderen Mitwirkenden auf. github.com/Anemll/dspark-vllm… Benchmarks 👇 Link GitHub - Anemll/dspark-vllm-gx10: Zwei-Knoten-DGX Spark/ASUS GX10 DeepSeek V4 Flash DSpark NVFP4 Port... Zwei-Knoten-DGX Spark/ASUS GX10 DeepSeek V4 Flash DSpark NVFP4 Port für vLLM 0.25, mit Live-Dashboard und reproduzierbarem Deployment. - Anemll/dspark-vllm-gx10 github.com

    mehr auf Arint.info

    #DeepSeek #DGXSpark #MLOps #NVFP4 #NVIDIA #vLLM #arint_info

    https://x.com/anemll/status/2077271758768583051#m

  6. RT @anemll: Veröffentlicht und getestet: vLLM 0.25.1 Kompatibilitäts-Overlay und TP=2 Referenz-Deployment für DeepSeek V4 Flash sowie DSpark/NVFP4 auf 2× NVIDIA DGX Spark / ASUS GX10 Systemen. Enthält Integrationskorrekturen, ein Live-Dashboard, Deployment-Tooling und reproduzierbare Benchmarks. Diese Integration baut auf Arbeiten von @vllmproject, FlashInfer, Luke Alonso/b12x, @MiaAIlab, @rafaelcaricio, Keys/drowzeys, @2WildTech und vielen anderen Mitwirkenden auf. github.com/Anemll/dspark-vllm… Benchmarks 👇 Link GitHub - Anemll/dspark-vllm-gx10: Zwei-Knoten-DGX Spark/ASUS GX10 DeepSeek V4 Flash DSpark NVFP4 Port... Zwei-Knoten-DGX Spark/ASUS GX10 DeepSeek V4 Flash DSpark NVFP4 Port für vLLM 0.25, mit Live-Dashboard und reproduzierbarem Deployment. - Anemll/dspark-vllm-gx10 github.com

    mehr auf Arint.info

    #DeepSeek #DGXSpark #MLOps #NVFP4 #NVIDIA #vLLM #arint_info

    https://x.com/anemll/status/2077271758768583051#m

  7. RT @Tono_Ken3: 🎬 Uncensored MiniMax-H3 Text-Encoder, erneut quantisiert auf NVFP4. 📦 26,4 GB → 15,7 GB 🖥️ Läuft auf einer einzelnen 16-GB-Grafikkarte (gemessener Spitzenbedarf: 9,9 GB VRAM) 🔁 Drop-in-Ersatz für den offiziellen Comfy-Org NVFP4-Encoder ⚠️ ConvRot-Gewichte müssen vor der erneuten Quantisierung entdreht werden, sonst steht die Ausgabe in keinem Zusammenhang mehr mit dem Prompt 🙏 Basiert auf ethanfals Heretic-Gewichten 🤗 hf.co/sakamakismile/Qwen3-VL… Link: sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4 · Hugging Face Wir sind auf einer Reise, um künstliche Intelligenz durch Open Source und Open Science voranzubringen und zu demokratisieren. huggingface.co

    mehr auf Arint.info

    #AI #Democratization #HuggingFace #MachineLearning #NVFP4 #OpenSource #arint_info

    https://x.com/Tono_Ken3/status/2084534748534415607#m

  8. RT @Tono_Ken3: 🎬 Uncensored MiniMax-H3 Text-Encoder, erneut quantisiert auf NVFP4. 📦 26,4 GB → 15,7 GB 🖥️ Läuft auf einer einzelnen 16-GB-Grafikkarte (gemessener Spitzenbedarf: 9,9 GB VRAM) 🔁 Drop-in-Ersatz für den offiziellen Comfy-Org NVFP4-Encoder ⚠️ ConvRot-Gewichte müssen vor der erneuten Quantisierung entdreht werden, sonst steht die Ausgabe in keinem Zusammenhang mehr mit dem Prompt 🙏 Basiert auf ethanfals Heretic-Gewichten 🤗 hf.co/sakamakismile/Qwen3-VL… Link: sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4 · Hugging Face Wir sind auf einer Reise, um künstliche Intelligenz durch Open Source und Open Science voranzubringen und zu demokratisieren. huggingface.co

    mehr auf Arint.info

    #AI #Democratization #HuggingFace #MachineLearning #NVFP4 #OpenSource #arint_info

    https://x.com/Tono_Ken3/status/2084534748534415607#m

  9. RT @Tono_Ken3: 🎬 Uncensored MiniMax-H3 Text-Encoder, erneut quantisiert auf NVFP4. 📦 26,4 GB → 15,7 GB 🖥️ Läuft auf einer einzelnen 16-GB-Grafikkarte (gemessener Spitzenbedarf: 9,9 GB VRAM) 🔁 Drop-in-Ersatz für den offiziellen Comfy-Org NVFP4-Encoder ⚠️ ConvRot-Gewichte müssen vor der erneuten Quantisierung entdreht werden, sonst steht die Ausgabe in keinem Zusammenhang mehr mit dem Prompt 🙏 Basiert auf ethanfals Heretic-Gewichten 🤗 hf.co/sakamakismile/Qwen3-VL… Link: sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4 · Hugging Face Wir sind auf einer Reise, um künstliche Intelligenz durch Open Source und Open Science voranzubringen und zu demokratisieren. huggingface.co

    mehr auf Arint.info

    #AI #Democratization #HuggingFace #MachineLearning #NVFP4 #OpenSource #arint_info

    https://x.com/Tono_Ken3/status/2084534748534415607#m

  10. RT @Tono_Ken3: 🎬 Unzensierter MiniMax-H3 Text-Encoder, erneut quantisiert auf NVFP4. 📦 26,4 GB → 15,7 GB 🖥️ Läuft auf einer einzelnen 16 GB Karte (gemessene Spitzen-VRAM-Auslastung: 9,9 GB) 🔁 Drop-in-Ersatz für den offiziellen Comfy-Org NVFP4-Encoder ⚠️ ConvRot-Gewichte müssen vor der Re-Quantisierung ent-rotiert werden, sonst steht die Ausgabe in keinem Zusammenhang mehr mit dem Prompt 🙏 Erstellt auf Basis der Heretic-Gewichte von ethanfel 🤗 hf.co/sakamakismile/Qwen3-VL… Link sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4 · Hugging Face Wir sind auf einer Reise, um künstliche Intelligenz durch Open Source und Open Science voranzubringen und zu demokratisieren. huggingface.co

    mehr auf Arint.info

    #AI #HuggingFace #MiniMaxH3 #NVFP4 #OpenSource #Qwen3VL #arint_info

    https://x.com/Tono_Ken3/status/2084534748534415607#m

  11. RT @Tono_Ken3: 🎬 Unzensierter MiniMax-H3 Text-Encoder, erneut quantisiert auf NVFP4. 📦 26,4 GB → 15,7 GB 🖥️ Läuft auf einer einzelnen 16 GB Karte (gemessene Spitzen-VRAM-Auslastung: 9,9 GB) 🔁 Drop-in-Ersatz für den offiziellen Comfy-Org NVFP4-Encoder ⚠️ ConvRot-Gewichte müssen vor der Re-Quantisierung ent-rotiert werden, sonst steht die Ausgabe in keinem Zusammenhang mehr mit dem Prompt 🙏 Erstellt auf Basis der Heretic-Gewichte von ethanfel 🤗 hf.co/sakamakismile/Qwen3-VL… Link sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4 · Hugging Face Wir sind auf einer Reise, um künstliche Intelligenz durch Open Source und Open Science voranzubringen und zu demokratisieren. huggingface.co

    mehr auf Arint.info

    #AI #HuggingFace #MiniMaxH3 #NVFP4 #OpenSource #Qwen3VL #arint_info

    https://x.com/Tono_Ken3/status/2084534748534415607#m

  12. RT @Tono_Ken3: 🎬 Unzensierter MiniMax-H3 Text-Encoder, erneut quantisiert auf NVFP4. 📦 26,4 GB → 15,7 GB 🖥️ Läuft auf einer einzelnen 16 GB Karte (gemessene Spitzen-VRAM-Auslastung: 9,9 GB) 🔁 Drop-in-Ersatz für den offiziellen Comfy-Org NVFP4-Encoder ⚠️ ConvRot-Gewichte müssen vor der Re-Quantisierung ent-rotiert werden, sonst steht die Ausgabe in keinem Zusammenhang mehr mit dem Prompt 🙏 Erstellt auf Basis der Heretic-Gewichte von ethanfel 🤗 hf.co/sakamakismile/Qwen3-VL… Link sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4 · Hugging Face Wir sind auf einer Reise, um künstliche Intelligenz durch Open Source und Open Science voranzubringen und zu demokratisieren. huggingface.co

    mehr auf Arint.info

    #AI #HuggingFace #MiniMaxH3 #NVFP4 #OpenSource #Qwen3VL #arint_info

    https://x.com/Tono_Ken3/status/2084534748534415607#m

  13. RT @Tono_Ken3: 🎬 Unzensierter MiniMax-H3 Text-Encoder, erneut quantisiert auf NVFP4. 📦 26,4 GB → 15,7 GB 🖥️ Läuft auf einer einzelnen 16 GB Karte (gemessene Spitzen-VRAM-Auslastung: 9,9 GB) 🔁 Drop-in-Ersatz für den offiziellen Comfy-Org NVFP4-Encoder ⚠️ ConvRot-Gewichte müssen vor der Re-Quantisierung ent-rotiert werden, sonst steht die Ausgabe in keinem Zusammenhang mehr mit dem Prompt 🙏 Erstellt auf Basis der Heretic-Gewichte von ethanfel 🤗 hf.co/sakamakismile/Qwen3-VL… Link sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4 · Hugging Face Wir sind auf einer Reise, um künstliche Intelligenz durch Open Source und Open Science voranzubringen und zu demokratisieren. huggingface.co

    mehr auf Arint.info

    #AI #HuggingFace #MiniMaxH3 #NVFP4 #OpenSource #Qwen3VL #arint_info

    https://x.com/Tono_Ken3/status/2084534748534415607#m

  14. RT @Tono_Ken3: 🎬 Unzensierter MiniMax-H3 Text-Encoder, erneut quantisiert auf NVFP4. 📦 26,4 GB → 15,7 GB 🖥️ Läuft auf einer einzelnen 16 GB Karte (gemessene Spitzen-VRAM-Auslastung: 9,9 GB) 🔁 Drop-in-Ersatz für den offiziellen Comfy-Org NVFP4-Encoder ⚠️ ConvRot-Gewichte müssen vor der Re-Quantisierung ent-rotiert werden, sonst steht die Ausgabe in keinem Zusammenhang mehr mit dem Prompt 🙏 Erstellt auf Basis der Heretic-Gewichte von ethanfel 🤗 hf.co/sakamakismile/Qwen3-VL… Link sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4 · Hugging Face Wir sind auf einer Reise, um künstliche Intelligenz durch Open Source und Open Science voranzubringen und zu demokratisieren. huggingface.co

    mehr auf Arint.info

    #AI #HuggingFace #MiniMaxH3 #NVFP4 #OpenSource #Qwen3VL #arint_info

    https://x.com/Tono_Ken3/status/2084534748534415607#m

  15. RT @MiaAI_lab: WOW, ein wichtiges Release von NVIDIA 🔥 NVIDIA Model Optimizer 0.45.0 ist verfügbar — große Upgrades für alle, aber besonders spannend für MoE-Modelle mit NVFP4-Quantisierung! Die wichtigsten Vorteile für MoE-Quantisierung: ✨ Neuer „Active Experts“-Modus in AutoQuantize — versteht nun, dass nur einige Experten gleichzeitig aktiv sind, für intelligentere Mixed-Precision-Entscheidungen ✨ Bessere Quantisierung für DeepSeek-ähnliche Modelle + einfache exakte MXFP4 → NVFP4-Konvertierung für geroutete Experten ✨ Neuer W4A16 NVFP4 Weight-Only-Modus (keine Kalibrierung nötig) — enorme Speichereinsparungen bei guter Qualität ✨ Verbesserte Kalibrierungs- und KV-Cache-Optionen, speziell für MoE-Modelle entwickelt. Dies sollte zu hochwertigeren NVFP4-MoE-Modellen, geringerem Speicherverbrauch und besserem Durchsatz auf Blackwell-GPUs führen, bei fast keinem Genauigkeitsverlust! Dies könnte die Probleme beheben, die ich mit Qwen3.6-35b NVFP4 habe, falls NVIDIA das Modell aktualisiert. Vollständige Notizen: github.com/NVIDIA/Model-Opti… Link Release ModelOpt 0.45.0 Release · NVIDIA/Model-Optimizer Neue Features Quantisierung NVFP4 W4A16 Weight-Only-Quantisierung hinzugefügt (w4a16nvfp4): FP4-Gewichte mit groupsize=16, BF16-Aktivierungen, keine Kalibrierungs-Forward-Pass erforderlich. Verwende mtq.W4A16NVFP4CFG oder... github.com

    mehr auf Arint.info

    #Blackwell #ModelOptimizer #MoE #NVFP4 #NVIDIA #Quantisierung #arint_info

    https://x.com/MiaAI_lab/status/2074126709197074568#m

  16. RT @MiaAI_lab: WOW, ein wichtiges Release von NVIDIA 🔥 NVIDIA Model Optimizer 0.45.0 ist verfügbar — große Upgrades für alle, aber besonders spannend für MoE-Modelle mit NVFP4-Quantisierung! Die wichtigsten Vorteile für MoE-Quantisierung: ✨ Neuer „Active Experts“-Modus in AutoQuantize — versteht nun, dass nur einige Experten gleichzeitig aktiv sind, für intelligentere Mixed-Precision-Entscheidungen ✨ Bessere Quantisierung für DeepSeek-ähnliche Modelle + einfache exakte MXFP4 → NVFP4-Konvertierung für geroutete Experten ✨ Neuer W4A16 NVFP4 Weight-Only-Modus (keine Kalibrierung nötig) — enorme Speichereinsparungen bei guter Qualität ✨ Verbesserte Kalibrierungs- und KV-Cache-Optionen, speziell für MoE-Modelle entwickelt. Dies sollte zu hochwertigeren NVFP4-MoE-Modellen, geringerem Speicherverbrauch und besserem Durchsatz auf Blackwell-GPUs führen, bei fast keinem Genauigkeitsverlust! Dies könnte die Probleme beheben, die ich mit Qwen3.6-35b NVFP4 habe, falls NVIDIA das Modell aktualisiert. Vollständige Notizen: github.com/NVIDIA/Model-Opti… Link Release ModelOpt 0.45.0 Release · NVIDIA/Model-Optimizer Neue Features Quantisierung NVFP4 W4A16 Weight-Only-Quantisierung hinzugefügt (w4a16nvfp4): FP4-Gewichte mit groupsize=16, BF16-Aktivierungen, keine Kalibrierungs-Forward-Pass erforderlich. Verwende mtq.W4A16NVFP4CFG oder... github.com

    mehr auf Arint.info

    #Blackwell #ModelOptimizer #MoE #NVFP4 #NVIDIA #Quantisierung #arint_info

    https://x.com/MiaAI_lab/status/2074126709197074568#m

  17. RT @MiaAI_lab: WOW, ein wichtiges Release von NVIDIA 🔥 NVIDIA Model Optimizer 0.45.0 ist verfügbar — große Upgrades für alle, aber besonders spannend für MoE-Modelle mit NVFP4-Quantisierung! Die wichtigsten Vorteile für MoE-Quantisierung: ✨ Neuer „Active Experts“-Modus in AutoQuantize — versteht nun, dass nur einige Experten gleichzeitig aktiv sind, für intelligentere Mixed-Precision-Entscheidungen ✨ Bessere Quantisierung für DeepSeek-ähnliche Modelle + einfache exakte MXFP4 → NVFP4-Konvertierung für geroutete Experten ✨ Neuer W4A16 NVFP4 Weight-Only-Modus (keine Kalibrierung nötig) — enorme Speichereinsparungen bei guter Qualität ✨ Verbesserte Kalibrierungs- und KV-Cache-Optionen, speziell für MoE-Modelle entwickelt. Dies sollte zu hochwertigeren NVFP4-MoE-Modellen, geringerem Speicherverbrauch und besserem Durchsatz auf Blackwell-GPUs führen, bei fast keinem Genauigkeitsverlust! Dies könnte die Probleme beheben, die ich mit Qwen3.6-35b NVFP4 habe, falls NVIDIA das Modell aktualisiert. Vollständige Notizen: github.com/NVIDIA/Model-Opti… Link Release ModelOpt 0.45.0 Release · NVIDIA/Model-Optimizer Neue Features Quantisierung NVFP4 W4A16 Weight-Only-Quantisierung hinzugefügt (w4a16nvfp4): FP4-Gewichte mit groupsize=16, BF16-Aktivierungen, keine Kalibrierungs-Forward-Pass erforderlich. Verwende mtq.W4A16NVFP4CFG oder... github.com

    mehr auf Arint.info

    #Blackwell #ModelOptimizer #MoE #NVFP4 #NVIDIA #Quantisierung #arint_info

    https://x.com/MiaAI_lab/status/2074126709197074568#m

  18. DSpark на двух DGX Spark: порт, баг на одну строку и бенчмарки, которые пришлось мерить заново

    DeepSeek выпустил DSpark — спекулятивный декодер для V4. В окне 27–30 июня 2026 рабочего публичного пути для GB10 не было — мы портировали его сами, нашли унаследованный баг, убивавший качество драфта, и сняли профиль своего стенда. Потом комьюнити выложило рецепт вдвое быстрее нашего. Мы его воспроизвели — и вместо гонки за цифрой сняли данные, которых в паблике не нашли: кривую деградации до реального 1M, механизм выигрыша NVFP4 и петли когерентности на глубине. Плюс три негативных результата.

    habr.com/ru/articles/1055792/

    #dgx_spark #deepseek #vllm #спекулятивный_декодинг #speculative_decoding #dspark #llmинференс #бенчмарки #nvfp4 #nvfp8

  19. DSpark на двух DGX Spark: порт, баг на одну строку и бенчмарки, которые пришлось мерить заново

    DeepSeek выпустил DSpark — спекулятивный декодер для V4. В окне 27–30 июня 2026 рабочего публичного пути для GB10 не было — мы портировали его сами, нашли унаследованный баг, убивавший качество драфта, и сняли профиль своего стенда. Потом комьюнити выложило рецепт вдвое быстрее нашего. Мы его воспроизвели — и вместо гонки за цифрой сняли данные, которых в паблике не нашли: кривую деградации до реального 1M, механизм выигрыша NVFP4 и петли когерентности на глубине. Плюс три негативных результата.

    habr.com/ru/articles/1055792/

    #dgx_spark #deepseek #vllm #спекулятивный_декодинг #speculative_decoding #dspark #llmинференс #бенчмарки #nvfp4 #nvfp8

  20. DSpark на двух DGX Spark: порт, баг на одну строку и бенчмарки, которые пришлось мерить заново

    DeepSeek выпустил DSpark — спекулятивный декодер для V4. В окне 27–30 июня 2026 рабочего публичного пути для GB10 не было — мы портировали его сами, нашли унаследованный баг, убивавший качество драфта, и сняли профиль своего стенда. Потом комьюнити выложило рецепт вдвое быстрее нашего. Мы его воспроизвели — и вместо гонки за цифрой сняли данные, которых в паблике не нашли: кривую деградации до реального 1M, механизм выигрыша NVFP4 и петли когерентности на глубине. Плюс три негативных результата.

    habr.com/ru/articles/1055792/

    #dgx_spark #deepseek #vllm #спекулятивный_декодинг #speculative_decoding #dspark #llmинференс #бенчмарки #nvfp4 #nvfp8

  21. RT @Ali_TongyiLab: Du liebst Qwen3.6-27B? NVIDIA hat gerade die ultra-effiziente NVFP4-Version veröffentlicht! Für alle, die Qwen3.6-27B nutzen möchten, aber nicht genügend VRAM zur Verfügung haben, hat NVIDIA seinen offiziellen NVFP4-quantisierten Build auf Hugging Face veröffentlicht. Das große Upgrade ist das NVFP4-4-Bit-Float-Format, das enorme VRAM-Einsparungen durch eine Verkleinerung des Modells auf etwa ein Drittel der Größe der standardmäßigen BF16-Gewichte bietet. URL👇

    mehr auf Arint.info

    #AI #HuggingFace #MachineLearning #NVFP4 #NVIDIA #Qwen3 #arint_info

    https://x.com/Ali_TongyiLab/status/2072162006359240908#m

  22. RT @Ali_TongyiLab: Du liebst Qwen3.6-27B? NVIDIA hat gerade die ultra-effiziente NVFP4-Version veröffentlicht! Für alle, die Qwen3.6-27B nutzen möchten, aber nicht genügend VRAM zur Verfügung haben, hat NVIDIA seinen offiziellen NVFP4-quantisierten Build auf Hugging Face veröffentlicht. Das große Upgrade ist das NVFP4-4-Bit-Float-Format, das enorme VRAM-Einsparungen durch eine Verkleinerung des Modells auf etwa ein Drittel der Größe der standardmäßigen BF16-Gewichte bietet. URL👇

    mehr auf Arint.info

    #AI #HuggingFace #MachineLearning #NVFP4 #NVIDIA #Qwen3 #arint_info

    https://x.com/Ali_TongyiLab/status/2072162006359240908#m

  23. RT @Ali_TongyiLab: Du liebst Qwen3.6-27B? NVIDIA hat gerade die ultra-effiziente NVFP4-Version veröffentlicht! Für alle, die Qwen3.6-27B nutzen möchten, aber nicht genügend VRAM zur Verfügung haben, hat NVIDIA seinen offiziellen NVFP4-quantisierten Build auf Hugging Face veröffentlicht. Das große Upgrade ist das NVFP4-4-Bit-Float-Format, das enorme VRAM-Einsparungen durch eine Verkleinerung des Modells auf etwa ein Drittel der Größe der standardmäßigen BF16-Gewichte bietet. URL👇

    mehr auf Arint.info

    #AI #HuggingFace #MachineLearning #NVFP4 #NVIDIA #Qwen3 #arint_info

    https://x.com/Ali_TongyiLab/status/2072162006359240908#m

  24. RT @Ali_TongyiLab: Du liebst Qwen3.6-27B? NVIDIA hat gerade die ultra-effiziente NVFP4-Version veröffentlicht! Für alle, die Qwen3.6-27B nutzen möchten, aber nicht genügend VRAM zur Verfügung haben, hat NVIDIA seinen offiziellen NVFP4-quantisierten Build auf Hugging Face veröffentlicht. Das große Upgrade ist das NVFP4-4-Bit-Float-Format, das enorme VRAM-Einsparungen durch eine Verkleinerung des Modells auf etwa ein Drittel der Größe der standardmäßigen BF16-Gewichte bietet. URL👇

    mehr auf Arint.info

    #AI #HuggingFace #MachineLearning #NVFP4 #NVIDIA #Qwen3 #arint_info

    https://x.com/Ali_TongyiLab/status/2072162006359240908#m

  25. RT @vllm_project: GLM-5.2 im NVFP4-Format ist bereit für den Einsatz in vLLM 🚀 Der offizielle NVFP4-Checkpoint von GLM-5.2 für Blackwell von @NVIDIAAI reduziert den Speicherbedarf im Vergleich zu FP8, während die Genauigkeit in den Bereichen Reasoning, Programmierung und Long-Context-Benchmarks erhalten bleibt. Starten Sie es noch heute mit: vllm serve nvidia/GLM-5.2-NVFP4 🤗 huggingface.co/nvidia/GLM-5.2-NVFP4 Link nvidia/GLM-5.2-NVFP4 · Hugging Face Wir sind auf einer Reise, um künstliche Intelligenz durch Open Source und Open Science voranzubringen und zu demokratisieren. huggingface.co

    mehr auf Arint.info

    #AI #GLM52 #HuggingFace #NVFP4 #NVIDIA #vLLM #arint_info

    https://x.com/vllm_project/status/2070569806940848328#m

  26. RT @vllm_project: GLM-5.2 im NVFP4-Format ist bereit für den Einsatz in vLLM 🚀 Der offizielle NVFP4-Checkpoint von GLM-5.2 für Blackwell von @NVIDIAAI reduziert den Speicherbedarf im Vergleich zu FP8, während die Genauigkeit in den Bereichen Reasoning, Programmierung und Long-Context-Benchmarks erhalten bleibt. Starten Sie es noch heute mit: vllm serve nvidia/GLM-5.2-NVFP4 🤗 huggingface.co/nvidia/GLM-5.2-NVFP4 Link nvidia/GLM-5.2-NVFP4 · Hugging Face Wir sind auf einer Reise, um künstliche Intelligenz durch Open Source und Open Science voranzubringen und zu demokratisieren. huggingface.co

    mehr auf Arint.info

    #AI #GLM52 #HuggingFace #NVFP4 #NVIDIA #vLLM #arint_info

    https://x.com/vllm_project/status/2070569806940848328#m

  27. RT @vllm_project: GLM-5.2 im NVFP4-Format ist bereit für den Einsatz in vLLM 🚀 Der offizielle NVFP4-Checkpoint von GLM-5.2 für Blackwell von @NVIDIAAI reduziert den Speicherbedarf im Vergleich zu FP8, während die Genauigkeit in den Bereichen Reasoning, Programmierung und Long-Context-Benchmarks erhalten bleibt. Starten Sie es noch heute mit: vllm serve nvidia/GLM-5.2-NVFP4 🤗 huggingface.co/nvidia/GLM-5.2-NVFP4 Link nvidia/GLM-5.2-NVFP4 · Hugging Face Wir sind auf einer Reise, um künstliche Intelligenz durch Open Source und Open Science voranzubringen und zu demokratisieren. huggingface.co

    mehr auf Arint.info

    #AI #GLM52 #HuggingFace #NVFP4 #NVIDIA #vLLM #arint_info

    https://x.com/vllm_project/status/2070569806940848328#m

  28. RT @Tono_Ken3: RTX PRO 2000 Blackwell ($1.000/Stk.) × 4 Stück für Qwen3.6-27B NVFP4 mit 256K-Kontextfenster und 24 parallelen Instanzen.

    mehr auf Arint.info

    #Blackwell #GPU #LLM #NVFP4 #Qwen3 #Robotik #arint_info

    https://x.com/Tono_Ken3/status/2058345423669182673#m

  29. RT @Tono_Ken3: RTX PRO 2000 Blackwell ($1.000/Stk.) × 4 Stück für Qwen3.6-27B NVFP4 mit 256K-Kontextfenster und 24 parallelen Instanzen.

    mehr auf Arint.info

    #Blackwell #GPU #LLM #NVFP4 #Qwen3 #Robotik #arint_info

    https://x.com/Tono_Ken3/status/2058345423669182673#m

  30. RT @Tono_Ken3: RTX PRO 2000 Blackwell ($1.000/Stk.) × 4 Stück für Qwen3.6-27B NVFP4 mit 256K-Kontextfenster und 24 parallelen Instanzen.

    mehr auf Arint.info

    #Blackwell #GPU #LLM #NVFP4 #Qwen3 #Robotik #arint_info

    https://x.com/Tono_Ken3/status/2058345423669182673#m

  31. RT @Tono_Ken3: RTX PRO 2000 Blackwell ($1.000/Stk.) × 4 Stück für Qwen3.6-27B NVFP4 mit 256K-Kontextfenster und 24 parallelen Instanzen.

    mehr auf Arint.info

    #Blackwell #GPU #LLM #NVFP4 #Qwen3 #Robotik #arint_info

    https://x.com/Tono_Ken3/status/2058345423669182673#m

  32. RT @Tono_Ken3: RTX PRO 2000 Blackwell ($1.000/Stk.) × 4 Stück für Qwen3.6-27B NVFP4 mit 256K-Kontextfenster und 24 parallelen Instanzen.

    mehr auf Arint.info

    #Blackwell #GPU #LLM #NVFP4 #Qwen3 #Robotik #arint_info

    https://x.com/Tono_Ken3/status/2058345423669182673#m

  33. RT @mr_r0b0t: Hier ist ein sehr beliebtes Modell, das wirklich vom richtigen Einsatz Ihrer @NVIDIAAI Blackwell GPU/GB10 mit NVFP4 und dem @AlibabaQwen 3.6-27B nativen MTP profitiert. Dies wurde auf einer einzelnen GB10 ausgeführt. Vollständige Benchmark-Ergebnisse und Methoden finden Sie unten ⏬

    mehr auf Arint.info

    #Benchmarking #BlackwellGPU #GB10 #NVFP4 #NVIDIAAI #Qwen3 #arint_info

    https://x.com/mr_r0b0t/status/2056953515092619474#m

  34. DGX Spark на 256K контексте: тестирую конфигурации vLLM, реальные замеры и почему NVFP4 в mainline сломан

    NVIDIA продаёт спарку с лозунгом «один петафлоп на FP4». Я купил коробку, поставил vLLM, запустил инференс и получил 40 токенов в секунду на 35B MoE‑модели. После маркетинговых слайдов цифра выглядит грустно. Объяснение простое. NVFP4 в основной ветке vLLM и FlashInfer физически сломан на SM_121 — варианте Blackwell, который установлен в GB10. Ядра собраны под compute_120f , а нативные NVFP4-инструкции есть только в compute_120a и compute_121a . На SM_121 распаковка квантованных весов идёт через программные битовые манипуляции в шейдере, без участия тензорных ядер. Сообщество вытащило стек руками: нашло обходные пути, собрало рабочие конфигурации. Я прогнал на своём Spark шесть разных конфигураций vLLM — от стокового BF16 до форка с DFlash speculative decoding — и замерил каждую одинаковым тестом. В этой статье разбираю, что в итоге работает и что выбирать под разные задачи.

    habr.com/ru/articles/1033342/

    #vllm #dgx_spark #gb10 #blackwell #nvfp4 #llm #инференс #локальный_ии

  35. DGX Spark на 256K контексте: тестирую конфигурации vLLM, реальные замеры и почему NVFP4 в mainline сломан

    NVIDIA продаёт спарку с лозунгом «один петафлоп на FP4». Я купил коробку, поставил vLLM, запустил инференс и получил 40 токенов в секунду на 35B MoE‑модели. После маркетинговых слайдов цифра выглядит грустно. Объяснение простое. NVFP4 в основной ветке vLLM и FlashInfer физически сломан на SM_121 — варианте Blackwell, который установлен в GB10. Ядра собраны под compute_120f , а нативные NVFP4-инструкции есть только в compute_120a и compute_121a . На SM_121 распаковка квантованных весов идёт через программные битовые манипуляции в шейдере, без участия тензорных ядер. Сообщество вытащило стек руками: нашло обходные пути, собрало рабочие конфигурации. Я прогнал на своём Spark шесть разных конфигураций vLLM — от стокового BF16 до форка с DFlash speculative decoding — и замерил каждую одинаковым тестом. В этой статье разбираю, что в итоге работает и что выбирать под разные задачи.

    habr.com/ru/articles/1033342/

    #vllm #dgx_spark #gb10 #blackwell #nvfp4 #llm #инференс #локальный_ии

  36. DGX Spark на 256K контексте: тестирую конфигурации vLLM, реальные замеры и почему NVFP4 в mainline сломан

    NVIDIA продаёт спарку с лозунгом «один петафлоп на FP4». Я купил коробку, поставил vLLM, запустил инференс и получил 40 токенов в секунду на 35B MoE‑модели. После маркетинговых слайдов цифра выглядит грустно. Объяснение простое. NVFP4 в основной ветке vLLM и FlashInfer физически сломан на SM_121 — варианте Blackwell, который установлен в GB10. Ядра собраны под compute_120f , а нативные NVFP4-инструкции есть только в compute_120a и compute_121a . На SM_121 распаковка квантованных весов идёт через программные битовые манипуляции в шейдере, без участия тензорных ядер. Сообщество вытащило стек руками: нашло обходные пути, собрало рабочие конфигурации. Я прогнал на своём Spark шесть разных конфигураций vLLM — от стокового BF16 до форка с DFlash speculative decoding — и замерил каждую одинаковым тестом. В этой статье разбираю, что в итоге работает и что выбирать под разные задачи.

    habr.com/ru/articles/1033342/

    #vllm #dgx_spark #gb10 #blackwell #nvfp4 #llm #инференс #локальный_ии

  37. NVIDIA’s Nemotron 3 Super Tops The Open-Source AI Model Chart, Beating DeepSeek & GPT-OSS NVIDIA's Open-Source "Nemotron 3 Super" AI model has topped the EnterpriseOps-Gym leaderb...

    #Featured #News #Sticky #EnterpriseOps-Gym #Kimi-K2.5 #Mamba-Transformer #MoE #Neomotron #3 #Super #NVFP4

    Origin | Interest | Match
  38. 🚀 NVIDIA’s new NVFP4 training recipe slashes AI model training time and cost, powering Blackwell Ultra GPUs to set new MLPerf Training records on large language models like Llama 3.1. Discover how GPU acceleration is reshaping open‑source AI development. #NVFP4 #BlackwellUltra #MLPerf #Llama3_1

    🔗 aidailypost.com/news/nvidias-n

  39. 🚀 NVIDIA’s new NVFP4 training recipe slashes AI model training time and cost, powering Blackwell Ultra GPUs to set new MLPerf Training records on large language models like Llama 3.1. Discover how GPU acceleration is reshaping open‑source AI development. #NVFP4 #BlackwellUltra #MLPerf #Llama3_1

    🔗 aidailypost.com/news/nvidias-n

  40. 🚀 NVIDIA’s new NVFP4 training recipe slashes AI model training time and cost, powering Blackwell Ultra GPUs to set new MLPerf Training records on large language models like Llama 3.1. Discover how GPU acceleration is reshaping open‑source AI development. #NVFP4 #BlackwellUltra #MLPerf #Llama3_1

    🔗 aidailypost.com/news/nvidias-n

  41. Thử nghiệm hiệu năng NVFP4 trên NVIDIA DGX Spark đang gặp vấn đề về tốc độ. Người dùng báo cáo rằng khi chạy mô hình Llama-4-Scout-17B-NVFP4, tốc độ chỉ đạt 15-20 T/s, thấp hơn nhiều so với kỳ vọng dù đã sử dụng image Docker tối ưu (avarok/vllm-dgx-spark:v14).

    Nghi vấn đặt ra là vLLM hiện tại chưa hỗ trợ tốt native NVFP4 dẫn đến nghẽn cổ chai. Cộng đồng đang tìm kiếm các giải pháp hoặc Docker image chuyên dụng để tối ưu hóa inference cho định dạng này trên DGX Spark.

    #NVIDIA #DGXSpark #NVFP4 #

  42. Người dùng gặp lỗi khi chạy mô hình NVFP4 trên 2× RTX Pro 6000 Blackwell (96GB) với SGLang. Cần cưỡng bức quantization `modelopt_fp4` để khởi động thành công. Cảm báo DeepGemm & FP8-KV có thể ảnh hưởng độ chính xác. Cả 2 GPU hoạt động 100% ngay cả khi rỗi. VRAM sử dụng ~87–88GB. #GPU #AI #Blackwell #NVFP4 #SGLang #VấnNạnAI

    reddit.com/r/LocalLLaMA/commen

  43. VLLM v0.12.0 đã ra mắt, hỗ trợ NVFP4 cho GPU SM120 (RTX 50xx, RTX PRO 6000 Blackwell)! Điều này giúp tăng tốc hiệu suất suy luận cho các mô hình ngôn ngữ lớn (LLM) trên phần cứng NVIDIA mới nhất. Nhiều cải tiến lượng tử hóa khác cũng được bổ sung.
    #VLLM #NVFP4 #SM120 #Blackwell #RTX50xx #LLM #AI #DeepLearning #Quantization #CôngNghệ

    reddit.com/r/LocalLLaMA/commen

  44. Bài viết bạn cần mô tả thông tin về-search reciprack pretraining NVFP4/MXFP4 trên GPU Blackwell. Có từ ectopic hơn một người hỏi về công thức hoàn chỉnh, trong khi tài liệu chính thức và blog hiện tại thiếu chi tiết. Tags: #AI #NVIDIA #MXFP4 #NVFP4 #BlackwellGPU #Pretraining #MachineLearning #Tech

    reddit.com/r/LocalLLaMA/commen