home.social

#qwen3 — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #qwen3, aggregated by home.social.

fetched live
  1. RT @pupposandro: Mit Spannung verkünde ich, dass die Lucebox-Engine nun Qwen3.8-27B auf einer einzelnen AMD Radeon AI PRO R9700 (32 GB, RDNA4) mit dem DFlash2-Block-Diffusions-Drafter von z-lab ausführt:

    mehr auf Arint.info

    #AI #AMD #Lucebox #MachineLearning #Qwen3 #RDNA4 #arint_info

    https://x.com/pupposandro/status/2092614392202313848

  2. RT @pupposandro: Mit Spannung verkünde ich, dass die Lucebox-Engine nun Qwen3.8-27B auf einer einzelnen AMD Radeon AI PRO R9700 (32 GB, RDNA4) mit dem DFlash2-Block-Diffusions-Drafter von z-lab ausführt:

    mehr auf Arint.info

    #AI #AMD #Lucebox #MachineLearning #Qwen3 #RDNA4 #arint_info

    https://x.com/pupposandro/status/2092614392202313848

  3. RT @pupposandro: Mit Spannung verkünde ich, dass die Lucebox-Engine nun Qwen3.8-27B auf einer einzelnen AMD Radeon AI PRO R9700 (32 GB, RDNA4) mit dem DFlash2-Block-Diffusions-Drafter von z-lab ausführt:

    mehr auf Arint.info

    #AI #AMD #Lucebox #MachineLearning #Qwen3 #RDNA4 #arint_info

    https://x.com/pupposandro/status/2092614392202313848

  4. RT @pupposandro: Mit Spannung verkünde ich, dass die Lucebox-Engine nun Qwen3.8-27B auf einer einzelnen AMD Radeon AI PRO R9700 (32 GB, RDNA4) mit dem DFlash2-Block-Diffusions-Drafter von z-lab ausführt:

    mehr auf Arint.info

    #AI #AMD #Lucebox #MachineLearning #Qwen3 #RDNA4 #arint_info

    https://x.com/pupposandro/status/2092614392202313848

  5. RT @pupposandro: Mit Spannung verkünde ich, dass die Lucebox-Engine nun Qwen3.8-27B auf einer einzelnen AMD Radeon AI PRO R9700 (32 GB, RDNA4) mit dem DFlash2-Block-Diffusions-Drafter von z-lab ausführt:

    mehr auf Arint.info

    #AI #AMD #Lucebox #MachineLearning #Qwen3 #RDNA4 #arint_info

    https://x.com/pupposandro/status/2092614392202313848

  6. 🔍🎨 So, it seems Qwen 3.8 is the new Picasso of #AI, with its 27 billion parameters ready to dazzle—or confuse—you with a dizzying array of credits and models that sound like a fruit salad 🍌🍎. Who knew API testing involved so many Nano Bananas and Seedreams? At least now we know #ByteDance isn't just for TikTok dances; it’s also for pricey AI models. 💸💃
    imageat.com/models/qwen-3-8-27 #Art #Qwen3.8 #APItesting #TechTrends #HackerNews #ngated

  7. 🔍🎨 So, it seems Qwen 3.8 is the new Picasso of #AI, with its 27 billion parameters ready to dazzle—or confuse—you with a dizzying array of credits and models that sound like a fruit salad 🍌🍎. Who knew API testing involved so many Nano Bananas and Seedreams? At least now we know #ByteDance isn't just for TikTok dances; it’s also for pricey AI models. 💸💃
    imageat.com/models/qwen-3-8-27 #Art #Qwen3.8 #APItesting #TechTrends #HackerNews #ngated

  8. 🔍🎨 So, it seems Qwen 3.8 is the new Picasso of #AI, with its 27 billion parameters ready to dazzle—or confuse—you with a dizzying array of credits and models that sound like a fruit salad 🍌🍎. Who knew API testing involved so many Nano Bananas and Seedreams? At least now we know #ByteDance isn't just for TikTok dances; it’s also for pricey AI models. 💸💃
    imageat.com/models/qwen-3-8-27 #Art #Qwen3.8 #APItesting #TechTrends #HackerNews #ngated

  9. 🔍🎨 So, it seems Qwen 3.8 is the new Picasso of #AI, with its 27 billion parameters ready to dazzle—or confuse—you with a dizzying array of credits and models that sound like a fruit salad 🍌🍎. Who knew API testing involved so many Nano Bananas and Seedreams? At least now we know #ByteDance isn't just for TikTok dances; it’s also for pricey AI models. 💸💃
    imageat.com/models/qwen-3-8-27 #Art #Qwen3.8 #APItesting #TechTrends #HackerNews #ngated

  10. 🔍🎨 So, it seems Qwen 3.8 is the new Picasso of #AI, with its 27 billion parameters ready to dazzle—or confuse—you with a dizzying array of credits and models that sound like a fruit salad 🍌🍎. Who knew API testing involved so many Nano Bananas and Seedreams? At least now we know #ByteDance isn't just for TikTok dances; it’s also for pricey AI models. 💸💃
    imageat.com/models/qwen-3-8-27 #Art #Qwen3.8 #APItesting #TechTrends #HackerNews #ngated

  11. 🚀 Oh wow, yet another #architecture promising "ultimate cost-efficiency"—because we all know that's never been done before! 🙄 Qwen3.8-Flash-Next sounds like the latest iOS update nobody asked for, but hey, at least it's got a snappy name! 😂
    qwen.ai/blog?id=qwen3.8-flash- #ultimatecostefficiency #Qwen3.8FlashNext #techhumor #innovation #HackerNews #ngated

  12. 🚀 Oh wow, yet another #architecture promising "ultimate cost-efficiency"—because we all know that's never been done before! 🙄 Qwen3.8-Flash-Next sounds like the latest iOS update nobody asked for, but hey, at least it's got a snappy name! 😂
    qwen.ai/blog?id=qwen3.8-flash- #ultimatecostefficiency #Qwen3.8FlashNext #techhumor #innovation #HackerNews #ngated

  13. 🚀 Oh wow, yet another #architecture promising "ultimate cost-efficiency"—because we all know that's never been done before! 🙄 Qwen3.8-Flash-Next sounds like the latest iOS update nobody asked for, but hey, at least it's got a snappy name! 😂
    qwen.ai/blog?id=qwen3.8-flash- #ultimatecostefficiency #Qwen3.8FlashNext #techhumor #innovation #HackerNews #ngated

  14. 🚀 Oh wow, yet another #architecture promising "ultimate cost-efficiency"—because we all know that's never been done before! 🙄 Qwen3.8-Flash-Next sounds like the latest iOS update nobody asked for, but hey, at least it's got a snappy name! 😂
    qwen.ai/blog?id=qwen3.8-flash- #ultimatecostefficiency #Qwen3.8FlashNext #techhumor #innovation #HackerNews #ngated

  15. 🚀 Oh wow, yet another #architecture promising "ultimate cost-efficiency"—because we all know that's never been done before! 🙄 Qwen3.8-Flash-Next sounds like the latest iOS update nobody asked for, but hey, at least it's got a snappy name! 😂
    qwen.ai/blog?id=qwen3.8-flash- #ultimatecostefficiency #Qwen3.8FlashNext #techhumor #innovation #HackerNews #ngated

  16. 📰 Oh, look! Another AI model with a name that sounds like a bad sci-fi sequel: "Qwen 3.8-Flash-Next" is dropping tomorrow! 🎉 Because what we really needed was an even more bloated version of "ModelScope"—because, as we know, size totally equals intelligence, right? 🙄 #InnovativeNaming #MoreIsMore
    modelscope.cn/models/Qwen/Qwen #AIModels #Qwen3.8 #FlashNext #ModelScope #TechHumor #Innovation #HackerNews #ngated

  17. 📰 Oh, look! Another AI model with a name that sounds like a bad sci-fi sequel: "Qwen 3.8-Flash-Next" is dropping tomorrow! 🎉 Because what we really needed was an even more bloated version of "ModelScope"—because, as we know, size totally equals intelligence, right? 🙄 #InnovativeNaming #MoreIsMore
    modelscope.cn/models/Qwen/Qwen #AIModels #Qwen3.8 #FlashNext #ModelScope #TechHumor #Innovation #HackerNews #ngated

  18. 📰 Oh, look! Another AI model with a name that sounds like a bad sci-fi sequel: "Qwen 3.8-Flash-Next" is dropping tomorrow! 🎉 Because what we really needed was an even more bloated version of "ModelScope"—because, as we know, size totally equals intelligence, right? 🙄 #InnovativeNaming #MoreIsMore
    modelscope.cn/models/Qwen/Qwen #AIModels #Qwen3.8 #FlashNext #ModelScope #TechHumor #Innovation #HackerNews #ngated

  19. 📰 Oh, look! Another AI model with a name that sounds like a bad sci-fi sequel: "Qwen 3.8-Flash-Next" is dropping tomorrow! 🎉 Because what we really needed was an even more bloated version of "ModelScope"—because, as we know, size totally equals intelligence, right? 🙄 #InnovativeNaming #MoreIsMore
    modelscope.cn/models/Qwen/Qwen #AIModels #Qwen3.8 #FlashNext #ModelScope #TechHumor #Innovation #HackerNews #ngated

  20. 📰 Oh, look! Another AI model with a name that sounds like a bad sci-fi sequel: "Qwen 3.8-Flash-Next" is dropping tomorrow! 🎉 Because what we really needed was an even more bloated version of "ModelScope"—because, as we know, size totally equals intelligence, right? 🙄 #InnovativeNaming #MoreIsMore
    modelscope.cn/models/Qwen/Qwen #AIModels #Qwen3.8 #FlashNext #ModelScope #TechHumor #Innovation #HackerNews #ngated

  21. CW: AI

    Решил затестить Qwen3.8-27B-GGUF на своей 9060XT. Взял 3 бита XL вроде.

    Аухел, что оно смогло наклепать простенький лендинг и всё это чисто на моём железе, жест

    #qwen #qwen3

  22. CW: AI

    Решил затестить Qwen3.8-27B-GGUF на своей 9060XT. Взял 3 бита XL вроде.

    Аухел, что оно смогло наклепать простенький лендинг и всё это чисто на моём железе, жест

    #qwen #qwen3

  23. CW: AI

    Решил затестить Qwen3.8-27B-GGUF на своей 9060XT. Взял 3 бита XL вроде.

    Аухел, что оно смогло наклепать простенький лендинг и всё это чисто на моём железе, жест

    #qwen #qwen3

  24. RT @superalesha: Ich habe die vollständige Quantisierungsleiter für Qwen3.8 27B auf meiner 4x3090-Konfiguration durchlaufen: 12 Formate von FP8 bis hinunter zu 2 Bit, 720 echte Aufgaben pro Format, ohne Token-Beschränkungen. 235 Stunden reine Modelllaufzeit. 30,9 Millionen Tokens generiert über 19.925 Aufrufe. Meine Grafikkarten haben für 10 Tage nichts anderes getan. Vollständige, ehrliche Ergebnisse und Rohdaten sind in diesem Thread zu finden, und das untere Ende der Leiter hat etwas getan, das ich nicht erwartet hatte.

    mehr auf Arint.info

    #AIResearch #DeepLearning #GPUComputing #MachineLearning #ModelQuantization #Qwen3 #arint_info

    https://x.com/superalesha/status/2091436950976709088

  25. RT @superalesha: Ich habe die vollständige Quantisierungsleiter für Qwen3.8 27B auf meiner 4x3090-Konfiguration durchlaufen: 12 Formate von FP8 bis hinunter zu 2 Bit, 720 echte Aufgaben pro Format, ohne Token-Beschränkungen. 235 Stunden reine Modelllaufzeit. 30,9 Millionen Tokens generiert über 19.925 Aufrufe. Meine Grafikkarten haben für 10 Tage nichts anderes getan. Vollständige, ehrliche Ergebnisse und Rohdaten sind in diesem Thread zu finden, und das untere Ende der Leiter hat etwas getan, das ich nicht erwartet hatte.

    mehr auf Arint.info

    #AIResearch #DeepLearning #GPUComputing #MachineLearning #ModelQuantization #Qwen3 #arint_info

    https://x.com/superalesha/status/2091436950976709088

  26. RT @superalesha: Ich habe die vollständige Quantisierungsleiter für Qwen3.8 27B auf meiner 4x3090-Konfiguration durchlaufen: 12 Formate von FP8 bis hinunter zu 2 Bit, 720 echte Aufgaben pro Format, ohne Token-Beschränkungen. 235 Stunden reine Modelllaufzeit. 30,9 Millionen Tokens generiert über 19.925 Aufrufe. Meine Grafikkarten haben für 10 Tage nichts anderes getan. Vollständige, ehrliche Ergebnisse und Rohdaten sind in diesem Thread zu finden, und das untere Ende der Leiter hat etwas getan, das ich nicht erwartet hatte.

    mehr auf Arint.info

    #AIResearch #DeepLearning #GPUComputing #MachineLearning #ModelQuantization #Qwen3 #arint_info

    https://x.com/superalesha/status/2091436950976709088

  27. RT @ciruai: Das beste Qwen3.8 27B-Modell für AMD Strix Halo ist da. In Zusammenarbeit mit Pete Hopton und dem Kairic.ai-Team präsentiere ich: Qwen3.8-27B-IU4-KAIRIC-EDGE. Unserer Kenntnis nach ist dies die weltweit erste öffentliche Veröffentlichung eines 27B-LLM mit einer beschleunigten nativen IU4-Inferenzspur, speziell für AMD Strix Halo (gfx1151) entwickelt. Warum ist IU4 wichtig? Die meisten 4-Bit-Modelle speichern zwar Speicher, konvertieren Gewichte jedoch weiterhin in breitere Formate während der Ausführung. Unsere IU4-Spur hält Vier-Bit-Ganzzahldaten im aktiven Berechnungspfad und mappt sie direkt auf RDNA 3.5-Integer-Hardware. Das reduziert den Speichertraffic und verwandelt Quantisierung von einem Speicherformat in eine echte Hardware-Ausführungsstrategie. Der abgestimmte IU4-Operator erreichte 104,66 TOPS – 1,94× FP16 und 1,93× IU8. Dies eröffnet einen Weg zu schnellerer, effizienterer lokaler KI, ohne dabei die Modellqualität zu opfern. Ich kann es kaum erwarten zu sehen, was @Italianclownz und andere Zauberer damit anstellen. Angetrieben von Prompt Forge + Dual View, Kairic Edge-Beschleunigung, 262K Kontext: HumanEval-Metriken: • 47,73 tok/s Full-Suite TG • +85% gegenüber Unsloth Dynamic Q4 • +89% gegenüber Unsloth Dynamic Q6 • Schlug Unsloth Dynamic v3 q6 in Human Eval um 2 Fragen. Dies ist auch die erste Veröffentlichung, die von Kairic.ai angetrieben wird, einem neuen Unternehmen, das sich auf die gemeinsame Entwicklung von KI-Software rund um die Hardware konzentriert, auf der sie tatsächlich läuft. Modell, Benchmarks, Quelle, Build-Anleitung und Runner: huggingface.c…

    mehr auf Arint.info

    #AMDStrixHalo #KairicAI #LLM #LocalAI #Qwen3 #RDNA3 #arint_info

    https://x.com/ciruai/status/2091004843720659229

  28. RT @ciruai: Das beste Qwen3.8 27B-Modell für AMD Strix Halo ist da. In Zusammenarbeit mit Pete Hopton und dem Kairic.ai-Team präsentiere ich: Qwen3.8-27B-IU4-KAIRIC-EDGE. Unserer Kenntnis nach ist dies die weltweit erste öffentliche Veröffentlichung eines 27B-LLM mit einer beschleunigten nativen IU4-Inferenzspur, speziell für AMD Strix Halo (gfx1151) entwickelt. Warum ist IU4 wichtig? Die meisten 4-Bit-Modelle speichern zwar Speicher, konvertieren Gewichte jedoch weiterhin in breitere Formate während der Ausführung. Unsere IU4-Spur hält Vier-Bit-Ganzzahldaten im aktiven Berechnungspfad und mappt sie direkt auf RDNA 3.5-Integer-Hardware. Das reduziert den Speichertraffic und verwandelt Quantisierung von einem Speicherformat in eine echte Hardware-Ausführungsstrategie. Der abgestimmte IU4-Operator erreichte 104,66 TOPS – 1,94× FP16 und 1,93× IU8. Dies eröffnet einen Weg zu schnellerer, effizienterer lokaler KI, ohne dabei die Modellqualität zu opfern. Ich kann es kaum erwarten zu sehen, was @Italianclownz und andere Zauberer damit anstellen. Angetrieben von Prompt Forge + Dual View, Kairic Edge-Beschleunigung, 262K Kontext: HumanEval-Metriken: • 47,73 tok/s Full-Suite TG • +85% gegenüber Unsloth Dynamic Q4 • +89% gegenüber Unsloth Dynamic Q6 • Schlug Unsloth Dynamic v3 q6 in Human Eval um 2 Fragen. Dies ist auch die erste Veröffentlichung, die von Kairic.ai angetrieben wird, einem neuen Unternehmen, das sich auf die gemeinsame Entwicklung von KI-Software rund um die Hardware konzentriert, auf der sie tatsächlich läuft. Modell, Benchmarks, Quelle, Build-Anleitung und Runner: huggingface.c…

    mehr auf Arint.info

    #AMDStrixHalo #KairicAI #LLM #LocalAI #Qwen3 #RDNA3 #arint_info

    https://x.com/ciruai/status/2091004843720659229

  29. RT @ciruai: Das beste Qwen3.8 27B-Modell für AMD Strix Halo ist da. In Zusammenarbeit mit Pete Hopton und dem Kairic.ai-Team präsentiere ich: Qwen3.8-27B-IU4-KAIRIC-EDGE. Unserer Kenntnis nach ist dies die weltweit erste öffentliche Veröffentlichung eines 27B-LLM mit einer beschleunigten nativen IU4-Inferenzspur, speziell für AMD Strix Halo (gfx1151) entwickelt. Warum ist IU4 wichtig? Die meisten 4-Bit-Modelle speichern zwar Speicher, konvertieren Gewichte jedoch weiterhin in breitere Formate während der Ausführung. Unsere IU4-Spur hält Vier-Bit-Ganzzahldaten im aktiven Berechnungspfad und mappt sie direkt auf RDNA 3.5-Integer-Hardware. Das reduziert den Speichertraffic und verwandelt Quantisierung von einem Speicherformat in eine echte Hardware-Ausführungsstrategie. Der abgestimmte IU4-Operator erreichte 104,66 TOPS – 1,94× FP16 und 1,93× IU8. Dies eröffnet einen Weg zu schnellerer, effizienterer lokaler KI, ohne dabei die Modellqualität zu opfern. Ich kann es kaum erwarten zu sehen, was @Italianclownz und andere Zauberer damit anstellen. Angetrieben von Prompt Forge + Dual View, Kairic Edge-Beschleunigung, 262K Kontext: HumanEval-Metriken: • 47,73 tok/s Full-Suite TG • +85% gegenüber Unsloth Dynamic Q4 • +89% gegenüber Unsloth Dynamic Q6 • Schlug Unsloth Dynamic v3 q6 in Human Eval um 2 Fragen. Dies ist auch die erste Veröffentlichung, die von Kairic.ai angetrieben wird, einem neuen Unternehmen, das sich auf die gemeinsame Entwicklung von KI-Software rund um die Hardware konzentriert, auf der sie tatsächlich läuft. Modell, Benchmarks, Quelle, Build-Anleitung und Runner: huggingface.c…

    mehr auf Arint.info

    #AMDStrixHalo #KairicAI #LLM #LocalAI #Qwen3 #RDNA3 #arint_info

    https://x.com/ciruai/status/2091004843720659229

  30. RT @ciruai: Das beste Qwen3.8 27B-Modell für AMD Strix Halo ist da. In Zusammenarbeit mit Pete Hopton und dem Kairic.ai-Team präsentiere ich: Qwen3.8-27B-IU4-KAIRIC-EDGE. Unserer Kenntnis nach ist dies die weltweit erste öffentliche Veröffentlichung eines 27B-LLM mit einer beschleunigten nativen IU4-Inferenzspur, speziell für AMD Strix Halo (gfx1151) entwickelt. Warum ist IU4 wichtig? Die meisten 4-Bit-Modelle speichern zwar Speicher, konvertieren Gewichte jedoch weiterhin in breitere Formate während der Ausführung. Unsere IU4-Spur hält Vier-Bit-Ganzzahldaten im aktiven Berechnungspfad und mappt sie direkt auf RDNA 3.5-Integer-Hardware. Das reduziert den Speichertraffic und verwandelt Quantisierung von einem Speicherformat in eine echte Hardware-Ausführungsstrategie. Der abgestimmte IU4-Operator erreichte 104,66 TOPS – 1,94× FP16 und 1,93× IU8. Dies eröffnet einen Weg zu schnellerer, effizienterer lokaler KI, ohne dabei die Modellqualität zu opfern. Ich kann es kaum erwarten zu sehen, was @Italianclownz und andere Zauberer damit anstellen. Angetrieben von Prompt Forge + Dual View, Kairic Edge-Beschleunigung, 262K Kontext: HumanEval-Metriken: • 47,73 tok/s Full-Suite TG • +85% gegenüber Unsloth Dynamic Q4 • +89% gegenüber Unsloth Dynamic Q6 • Schlug Unsloth Dynamic v3 q6 in Human Eval um 2 Fragen. Dies ist auch die erste Veröffentlichung, die von Kairic.ai angetrieben wird, einem neuen Unternehmen, das sich auf die gemeinsame Entwicklung von KI-Software rund um die Hardware konzentriert, auf der sie tatsächlich läuft. Modell, Benchmarks, Quelle, Build-Anleitung und Runner: huggingface.c…

    mehr auf Arint.info

    #AMDStrixHalo #KairicAI #LLM #LocalAI #Qwen3 #RDNA3 #arint_info

    https://x.com/ciruai/status/2091004843720659229

  31. RT @ciruai: Das beste Qwen3.8 27B-Modell für AMD Strix Halo ist da. In Zusammenarbeit mit Pete Hopton und dem Kairic.ai-Team präsentiere ich: Qwen3.8-27B-IU4-KAIRIC-EDGE. Unserer Kenntnis nach ist dies die weltweit erste öffentliche Veröffentlichung eines 27B-LLM mit einer beschleunigten nativen IU4-Inferenzspur, speziell für AMD Strix Halo (gfx1151) entwickelt. Warum ist IU4 wichtig? Die meisten 4-Bit-Modelle speichern zwar Speicher, konvertieren Gewichte jedoch weiterhin in breitere Formate während der Ausführung. Unsere IU4-Spur hält Vier-Bit-Ganzzahldaten im aktiven Berechnungspfad und mappt sie direkt auf RDNA 3.5-Integer-Hardware. Das reduziert den Speichertraffic und verwandelt Quantisierung von einem Speicherformat in eine echte Hardware-Ausführungsstrategie. Der abgestimmte IU4-Operator erreichte 104,66 TOPS – 1,94× FP16 und 1,93× IU8. Dies eröffnet einen Weg zu schnellerer, effizienterer lokaler KI, ohne dabei die Modellqualität zu opfern. Ich kann es kaum erwarten zu sehen, was @Italianclownz und andere Zauberer damit anstellen. Angetrieben von Prompt Forge + Dual View, Kairic Edge-Beschleunigung, 262K Kontext: HumanEval-Metriken: • 47,73 tok/s Full-Suite TG • +85% gegenüber Unsloth Dynamic Q4 • +89% gegenüber Unsloth Dynamic Q6 • Schlug Unsloth Dynamic v3 q6 in Human Eval um 2 Fragen. Dies ist auch die erste Veröffentlichung, die von Kairic.ai angetrieben wird, einem neuen Unternehmen, das sich auf die gemeinsame Entwicklung von KI-Software rund um die Hardware konzentriert, auf der sie tatsächlich läuft. Modell, Benchmarks, Quelle, Build-Anleitung und Runner: huggingface.c…

    mehr auf Arint.info

    #AMDStrixHalo #KairicAI #LLM #LocalAI #Qwen3 #RDNA3 #arint_info

    https://x.com/ciruai/status/2091004843720659229

  32. RT @superalesha: Qwen hat uns im 3.8-Update kein kleines MoE-Modell gegeben, also schneide ich mir selbst eines aus Qwen3.8-27B heraus. Keine Trainingsdaten, reine Chirurgie an den Gewichten. Das Rezept basiert auf drei Papers: Moefication (arxiv 2110.01786), CMoE (2502.04416) und ExpertWeaver (2602.15521, ICML 2026). Ich überwache, welche FFN-Neuronen auf welche Tokens feuern, klebe die immer aktiven in einen Shared-Expert zusammen, clustere den Rest nach Ko-Aktivierung und baue den Router aus denselben Statistiken. CMoE verwandelt ein 7B-Dichtmodell in 5 Minuten in ein nutzbares MoE. Ihr bestes Ergebnis bisher: Qwen2.5-7B erreicht 67.0 von 75.2 Punkten des Dichtmodells, also 89%, nachdem 25% der FFN übersprungen wurden. Der aggressive Modus mit 25% aktiven Neuronen benötigt 200B Token für Retraining. Das mache ich nicht. Niemand hat dies an Modellen neuer als 2024 oder größer als 8B versucht. Qwen3.8-27B hat 64 Schichten mit jeweils 17.408 FFN-Neuronen, insgesamt 1,11M Neuronen, und 17,1B seiner 27,8B Parameter sind FFN, also 62% des Modells. Ich schneide bei 75, 50 und 25 Prozent aktiven Neuronen, führe dieselben Evaluierungen gegen das Dichtmodell durch und plotte, was überlebt. Meine Vorhersage: Nichts wird funktionieren. Der Trick ernährt sich von faulen Neuronen, und das 27B-Modell ist eine Frontier-Distillation, wahrscheinlich zu dicht gepackt zum Schneiden. Wenn die Qualität abstürzt, ist der Absturz die Zahl. Niemand hat gemessen, wie viel Redundanz ein 2026-Dichtmodell noch trägt. Ob Gewinn oder Ruin, ich bin der Erste.

    mehr auf Arint.info

    #AIResearch #MachineLearning #ModelCompression #MoE #NeuralNetworks #Qwen3 #arint_info

    https://x.com/superalesha/status/2091051683937706312

  33. RT @superalesha: Qwen hat uns im 3.8-Update kein kleines MoE-Modell gegeben, also schneide ich mir selbst eines aus Qwen3.8-27B heraus. Keine Trainingsdaten, reine Chirurgie an den Gewichten. Das Rezept basiert auf drei Papers: Moefication (arxiv 2110.01786), CMoE (2502.04416) und ExpertWeaver (2602.15521, ICML 2026). Ich überwache, welche FFN-Neuronen auf welche Tokens feuern, klebe die immer aktiven in einen Shared-Expert zusammen, clustere den Rest nach Ko-Aktivierung und baue den Router aus denselben Statistiken. CMoE verwandelt ein 7B-Dichtmodell in 5 Minuten in ein nutzbares MoE. Ihr bestes Ergebnis bisher: Qwen2.5-7B erreicht 67.0 von 75.2 Punkten des Dichtmodells, also 89%, nachdem 25% der FFN übersprungen wurden. Der aggressive Modus mit 25% aktiven Neuronen benötigt 200B Token für Retraining. Das mache ich nicht. Niemand hat dies an Modellen neuer als 2024 oder größer als 8B versucht. Qwen3.8-27B hat 64 Schichten mit jeweils 17.408 FFN-Neuronen, insgesamt 1,11M Neuronen, und 17,1B seiner 27,8B Parameter sind FFN, also 62% des Modells. Ich schneide bei 75, 50 und 25 Prozent aktiven Neuronen, führe dieselben Evaluierungen gegen das Dichtmodell durch und plotte, was überlebt. Meine Vorhersage: Nichts wird funktionieren. Der Trick ernährt sich von faulen Neuronen, und das 27B-Modell ist eine Frontier-Distillation, wahrscheinlich zu dicht gepackt zum Schneiden. Wenn die Qualität abstürzt, ist der Absturz die Zahl. Niemand hat gemessen, wie viel Redundanz ein 2026-Dichtmodell noch trägt. Ob Gewinn oder Ruin, ich bin der Erste.

    mehr auf Arint.info

    #AIResearch #MachineLearning #ModelCompression #MoE #NeuralNetworks #Qwen3 #arint_info

    https://x.com/superalesha/status/2091051683937706312

  34. RT @superalesha: Qwen hat uns im 3.8-Update kein kleines MoE-Modell gegeben, also schneide ich mir selbst eines aus Qwen3.8-27B heraus. Keine Trainingsdaten, reine Chirurgie an den Gewichten. Das Rezept basiert auf drei Papers: Moefication (arxiv 2110.01786), CMoE (2502.04416) und ExpertWeaver (2602.15521, ICML 2026). Ich überwache, welche FFN-Neuronen auf welche Tokens feuern, klebe die immer aktiven in einen Shared-Expert zusammen, clustere den Rest nach Ko-Aktivierung und baue den Router aus denselben Statistiken. CMoE verwandelt ein 7B-Dichtmodell in 5 Minuten in ein nutzbares MoE. Ihr bestes Ergebnis bisher: Qwen2.5-7B erreicht 67.0 von 75.2 Punkten des Dichtmodells, also 89%, nachdem 25% der FFN übersprungen wurden. Der aggressive Modus mit 25% aktiven Neuronen benötigt 200B Token für Retraining. Das mache ich nicht. Niemand hat dies an Modellen neuer als 2024 oder größer als 8B versucht. Qwen3.8-27B hat 64 Schichten mit jeweils 17.408 FFN-Neuronen, insgesamt 1,11M Neuronen, und 17,1B seiner 27,8B Parameter sind FFN, also 62% des Modells. Ich schneide bei 75, 50 und 25 Prozent aktiven Neuronen, führe dieselben Evaluierungen gegen das Dichtmodell durch und plotte, was überlebt. Meine Vorhersage: Nichts wird funktionieren. Der Trick ernährt sich von faulen Neuronen, und das 27B-Modell ist eine Frontier-Distillation, wahrscheinlich zu dicht gepackt zum Schneiden. Wenn die Qualität abstürzt, ist der Absturz die Zahl. Niemand hat gemessen, wie viel Redundanz ein 2026-Dichtmodell noch trägt. Ob Gewinn oder Ruin, ich bin der Erste.

    mehr auf Arint.info

    #AIResearch #MachineLearning #ModelCompression #MoE #NeuralNetworks #Qwen3 #arint_info

    https://x.com/superalesha/status/2091051683937706312

  35. RT @UnslothAI: Wir veröffentlichen neue Qwen3.8-27B GGUFs mit 10 % höherer Genauigkeit. Unsloth Dynamic V3 schlägt andere um 10 % auf Div-300, KLD und weiteren Benchmarks. Zudem veröffentlichen wir 1-Bit-Quantisierungen, die 77 % der Genauigkeit beibehalten. Läuft auf 8 GB RAM. Blog: unsloth.ai/docs/basics/dynam… GGUF: huggingface.co/unsloth/Qwen3…

    mehr auf Arint.info

    #AI #GGUF #MachineLearning #OpenSource #Qwen3 #Unsloth #arint_info

    https://x.com/UnslothAI/status/2090103470015828184