home.social

#dflash — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #dflash, aggregated by home.social.

fetched live
  1. RT @testingcatalog: Atomic Chat hat DFlash für macOS, Windows und Linux veröffentlicht. Ein neuer spekulativer Decodierungsmodus, der lokale Qwen-Modelle auf llama.cpp um den Faktor 2,2 beschleunigt, bei byte-genau identischer Ausgabe. Ein separates kleines Modell kann bis zu 15 Token gleichzeitig entwerfen, während das vollständige Modell diese nur überprüft, um sicherzustellen, dass die Gewichte und der finale Text unverändert bleiben. Video atomic.chat (@atomicchathq) DFlash macht Qwen um den Faktor 2,2 schneller ohne Qualitätsverlust! Wir haben dasselbe Qwen3.6-27B lokal auf einer RTX 6000 auf drei Arten ausgeführt: Baseline, MTP, DFlash. Die Aufgaben unterscheiden sich nur in einem Punkt - wie vorhersehbar das nächste Wort ist: Quicksort, Beschreibung einer Datei in JSON, ein Logikrätsel, eine Sci-Fi-Geschichte. Ergebnisse: Baseline: 44 tok/s · 1,00x MTP: 65 tok/s · 1,45x · 71% akzeptiert DFlash: 98 tok/s · 2,20x · 30% akzeptiert Baseline schreibt einen Token pro Schritt. MTP arbeitet innerhalb des Modells selbst und errät 3 Token voraus. DFlash ist ein separates kleines Modell, das 15 Token auf einmal schreibt, und das große Modell überprüft diese nur. In JSON wiederholen sich dieselben Wörter ständig, daher waren die meisten Vermutungen richtig: 152 tok/s, 3,4-fache Beschleunigung. In der Geschichte waren 9 von 10 Vermutungen falsch. DFlash hat all diese zusätzliche Arbeit umsonst geleistet und war langsamer als die Baseline: 42 gegenüber 44 tok/s. MTP errät nur 3 Token, daher kostet eine falsche Vermutung sehr wenig: 46 tok/s und der Gewinn in dieser Runde. Die Ausgabe ist in allen dre…

    mehr auf Arint.info

    #AI #DFlash #llama #MachineLearning #Qwen #TechNews #arint_info

    https://x.com/testingcatalog/status/2076778070870995321#m

  2. RT @testingcatalog: Atomic Chat hat DFlash für macOS, Windows und Linux veröffentlicht. Ein neuer spekulativer Decodierungsmodus, der lokale Qwen-Modelle auf llama.cpp um den Faktor 2,2 beschleunigt, bei byte-genau identischer Ausgabe. Ein separates kleines Modell kann bis zu 15 Token gleichzeitig entwerfen, während das vollständige Modell diese nur überprüft, um sicherzustellen, dass die Gewichte und der finale Text unverändert bleiben. Video atomic.chat (@atomicchathq) DFlash macht Qwen um den Faktor 2,2 schneller ohne Qualitätsverlust! Wir haben dasselbe Qwen3.6-27B lokal auf einer RTX 6000 auf drei Arten ausgeführt: Baseline, MTP, DFlash. Die Aufgaben unterscheiden sich nur in einem Punkt - wie vorhersehbar das nächste Wort ist: Quicksort, Beschreibung einer Datei in JSON, ein Logikrätsel, eine Sci-Fi-Geschichte. Ergebnisse: Baseline: 44 tok/s · 1,00x MTP: 65 tok/s · 1,45x · 71% akzeptiert DFlash: 98 tok/s · 2,20x · 30% akzeptiert Baseline schreibt einen Token pro Schritt. MTP arbeitet innerhalb des Modells selbst und errät 3 Token voraus. DFlash ist ein separates kleines Modell, das 15 Token auf einmal schreibt, und das große Modell überprüft diese nur. In JSON wiederholen sich dieselben Wörter ständig, daher waren die meisten Vermutungen richtig: 152 tok/s, 3,4-fache Beschleunigung. In der Geschichte waren 9 von 10 Vermutungen falsch. DFlash hat all diese zusätzliche Arbeit umsonst geleistet und war langsamer als die Baseline: 42 gegenüber 44 tok/s. MTP errät nur 3 Token, daher kostet eine falsche Vermutung sehr wenig: 46 tok/s und der Gewinn in dieser Runde. Die Ausgabe ist in allen dre…

    mehr auf Arint.info

    #AI #DFlash #llama #MachineLearning #Qwen #TechNews #arint_info

    https://x.com/testingcatalog/status/2076778070870995321#m

  3. RT @spiritbuun: Mein bisheriges Bestresultat beim Decodieren auf einer einzelnen 3090 mit Qwen3.6 27B lag bei 206 Tok/s. Heute habe ich es übertroffen: 219 Tok/s. Eine 3090. Die DFlash-Performance-Optimierungen wurden verschoben, sind jetzt aber auf buun-llama verfügbar. Weitere DFlash-Verbesserungen sind in Entwicklung – mehrere weitere inkrementale Updates sind diese Woche zu erwarten.

    Arint.info

    #3090 #AI #DFlash #LLM #Performance #Qwen3 #arint_info

    https://x.com/spiritbuun/status/2076737488681349325#m

  4. RT @spiritbuun: Mein bisheriges Bestresultat beim Decodieren auf einer einzelnen 3090 mit Qwen3.6 27B lag bei 206 Tok/s. Heute habe ich es übertroffen: 219 Tok/s. Eine 3090. Die DFlash-Performance-Optimierungen wurden verschoben, sind jetzt aber auf buun-llama verfügbar. Weitere DFlash-Verbesserungen sind in Entwicklung – mehrere weitere inkrementale Updates sind diese Woche zu erwarten.

    mehr auf Arint.info

    #3090 #AI #DFlash #LLM #Performance #Qwen3 #arint_info

    https://x.com/spiritbuun/status/2076737488681349325#m

  5. On NVIDIA Blackwell, DFlash delivers up to 15x higher throughput for 120B parameter models without application refactoring, drastically cutting latency for agentic operations. developer-tech.com/news/nvidia #nvidia #dflash #llm #opensource #agenticai #developers #ai #technology

  6. On NVIDIA Blackwell, DFlash delivers up to 15x higher throughput for 120B parameter models without application refactoring, drastically cutting latency for agentic operations. developer-tech.com/news/nvidia

  7. RT @witcheer: TRANSLASION: Alle drei spekulativen Entwurfsmodelle für Gemma 4 wurden getestet: MTP vs. EAGLE-3 vs. DFlash. Das verwendete Modell ist 26B-A4B. Bei einem einzelnen Stream, gemittelt über drei Durchläufe, im Vergleich zu einer Basislinie von 193 Tokens pro Sekunde: DFlash 2,19x · MTP 2,13x · EAGLE-3 1,69x. Es ist ein sehr enges Rennen an der Spitze, und die Art und Weise, wie sie sich die Spitze teilen, ist der interessante Teil: MTP trifft 71 % seiner vier entworfenen Tokens. DFlash trifft nur 16 % seiner 15, entwirft aber den gesamten Block in einem einzigen parallelen Vorwärtsdurchlauf, anstatt den Entwurfsalgorithmus k-mal auszuführen, sodass es in der realen Ausführungszeit mit MTP mithalten kann. MTP gewinnt bei der Genauigkeit, DFlash bei den Entwurfskosten – dasselbe Ziel. EAGLE-3s schwererer autoregressiver Entwurf liegt zurück, da der pro-Schritt-Overhead den Gewinn bei einem kostengünstigen aktiven MoE aufzehrt. DFlash ist ein „Alles-oder-Nichts“-Modell: nahezu nutzlos bei Fließtext (1,04x), aber überlegen bei strukturiertem/wiederholendem Text (4,37x). Sein Block zahlt sich nur aus, wenn die nächsten 16 Tokens vorhersagbar sind. MTP ist der solide Allrounder. Wähle nach Arbeitslast: DFlash für Code/JSON/Logs, MTP für gemischte Texte oder Fließtext.

    mehr auf Arint.info

    #AIModeling #DFlash #EAGLE3 #Gemma4 #MTP #SpeculativeDecoding #arint_info

    https://x.com/witcheer/status/2065727929003151813#m

  8. RT @akshay_pachaar: Forscher haben einen Weg gefunden, LLMs um das 8,5-Fache zu beschleunigen! (ohne Kompromisse bei der Genauigkeit) Speculative Decoding ist eine äußerst effektive Methode, um das Single-Token-Bottleneck bei der herkömmlichen LLM-Inferenz zu adressieren. Ein kleines „Draft“-Modell generiert zunächst die nächsten mehrere Tokens, dann verifiziert das große Modell alle auf einmal in einem einzigen Forward-Pass. Falls ein Token an einer beliebigen Position falsch ist, behält man alles davor und startet von dort neu. Diese Methode schneidet nie schlechter ab als normales Decoding. Doch aktuelle Drafter im Speculative Decoding raten immer noch ein Token nach dem anderen. Das macht den Draft-Schritt selbst zu einem Engpass und begrenzt die realen Geschwindigkeitssteigerungen auf das 2- bis 3-Fache. DFlash ist eine neue Technik, die den autoregressiven Drafter durch ein leichtgewichtiges Block-Diffusionsmodell ersetzt, das alle Tokens in einem einzigen parallelen Schritt rät. Die Kosten für das Drafting bleiben konstant, unabhängig davon, wie viele Tokens man spekuliert. Darüber hinaus ist der Drafter auf versteckte Features konditioniert, die aus mehreren Schichten des Zielmodells gezogen und in jede Draft-Schicht injiziert werden, sodass er deutlich bessere Schätzungen abgibt als ein Drafter, der bei Null beginnt. In der unten gezeigten Gegenüberstellung läuft normales Decoding mit 48,5 Tokens/Sekunde. DFlash erreicht 415 Tokens/Sekunde auf demselben Modell, ohne Qualitätsverlust. Es ist bereits mit vLLM, SGLang und Transformers integriert, mit Draft-Modellen auf HuggingFace für ve…

    mehr auf Arint.info

    #AI #DFlash #LLM #MachineLearning #SpeculativeDecoding #arint_info

    https://x.com/akshay_pachaar/status/2065111470552310109#m

  9. RT @akshay_pachaar: Forscher haben einen Weg gefunden, LLMs um das 8,5-Fache zu beschleunigen! (ohne Kompromisse bei der Genauigkeit) Speculative Decoding ist eine äußerst effektive Methode, um das Single-Token-Bottleneck bei der herkömmlichen LLM-Inferenz zu adressieren. Ein kleines „Draft“-Modell generiert zunächst die nächsten mehrere Tokens, dann verifiziert das große Modell alle auf einmal in einem einzigen Forward-Pass. Falls ein Token an einer beliebigen Position falsch ist, behält man alles davor und startet von dort neu. Diese Methode schneidet nie schlechter ab als normales Decoding. Doch aktuelle Drafter im Speculative Decoding raten immer noch ein Token nach dem anderen. Das macht den Draft-Schritt selbst zu einem Engpass und begrenzt die realen Geschwindigkeitssteigerungen auf das 2- bis 3-Fache. DFlash ist eine neue Technik, die den autoregressiven Drafter durch ein leichtgewichtiges Block-Diffusionsmodell ersetzt, das alle Tokens in einem einzigen parallelen Schritt rät. Die Kosten für das Drafting bleiben konstant, unabhängig davon, wie viele Tokens man spekuliert. Darüber hinaus ist der Drafter auf versteckte Features konditioniert, die aus mehreren Schichten des Zielmodells gezogen und in jede Draft-Schicht injiziert werden, sodass er deutlich bessere Schätzungen abgibt als ein Drafter, der bei Null beginnt. In der unten gezeigten Gegenüberstellung läuft normales Decoding mit 48,5 Tokens/Sekunde. DFlash erreicht 415 Tokens/Sekunde auf demselben Modell, ohne Qualitätsverlust. Es ist bereits mit vLLM, SGLang und Transformers integriert, mit Draft-Modellen auf HuggingFace für ve…

    mehr auf Arint.info

    #AI #DFlash #LLM #MachineLearning #SpeculativeDecoding #arint_info

    https://x.com/akshay_pachaar/status/2065111470552310109#m