home.social

#qwen3 — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #qwen3, aggregated by home.social.

  1. 🚀 Wow, "Qwen 3.8" is now hot on the heels of "GPT-5.5 Pro" in the prestigious field of... *reasoning prefills* 🤯. Because, let's face it, who doesn't love a good prefilled reasoning session from the vast wilderness of #GitHub gists? 😜
    gist.github.com/wsxiaoys/e0286 #Qwen3.8 #GPT5.5 #reasoningprefills #gists #AItechnology #HackerNews #ngated

  2. 🚀 Wow, "Qwen 3.8" is now hot on the heels of "GPT-5.5 Pro" in the prestigious field of... *reasoning prefills* 🤯. Because, let's face it, who doesn't love a good prefilled reasoning session from the vast wilderness of #GitHub gists? 😜
    gist.github.com/wsxiaoys/e0286 #Qwen3.8 #GPT5.5 #reasoningprefills #gists #AItechnology #HackerNews #ngated

  3. 🚀 Wow, "Qwen 3.8" is now hot on the heels of "GPT-5.5 Pro" in the prestigious field of... *reasoning prefills* 🤯. Because, let's face it, who doesn't love a good prefilled reasoning session from the vast wilderness of #GitHub gists? 😜
    gist.github.com/wsxiaoys/e0286 #Qwen3.8 #GPT5.5 #reasoningprefills #gists #AItechnology #HackerNews #ngated

  4. 🚀 Wow, "Qwen 3.8" is now hot on the heels of "GPT-5.5 Pro" in the prestigious field of... *reasoning prefills* 🤯. Because, let's face it, who doesn't love a good prefilled reasoning session from the vast wilderness of #GitHub gists? 😜
    gist.github.com/wsxiaoys/e0286 #Qwen3.8 #GPT5.5 #reasoningprefills #gists #AItechnology #HackerNews #ngated

  5. 🚀 Wow, "Qwen 3.8" is now hot on the heels of "GPT-5.5 Pro" in the prestigious field of... *reasoning prefills* 🤯. Because, let's face it, who doesn't love a good prefilled reasoning session from the vast wilderness of #GitHub gists? 😜
    gist.github.com/wsxiaoys/e0286 #Qwen3.8 #GPT5.5 #reasoningprefills #gists #AItechnology #HackerNews #ngated

  6. RT @ciruai: Das beste Qwen3.8 27B-Modell für AMD Strix Halo ist da. In Zusammenarbeit mit Pete Hopton und dem Kairic.ai-Team präsentiere ich: Qwen3.8-27B-IU4-KAIRIC-EDGE. Unserer Kenntnis nach ist dies die weltweit erste öffentliche Veröffentlichung eines 27B-LLM mit einer beschleunigten nativen IU4-Inferenzspur, speziell für AMD Strix Halo (gfx1151) entwickelt. Warum ist IU4 wichtig? Die meisten 4-Bit-Modelle speichern zwar Speicher, konvertieren Gewichte jedoch weiterhin in breitere Formate während der Ausführung. Unsere IU4-Spur hält Vier-Bit-Ganzzahldaten im aktiven Berechnungspfad und mappt sie direkt auf RDNA 3.5-Integer-Hardware. Das reduziert den Speichertraffic und verwandelt Quantisierung von einem Speicherformat in eine echte Hardware-Ausführungsstrategie. Der abgestimmte IU4-Operator erreichte 104,66 TOPS – 1,94× FP16 und 1,93× IU8. Dies eröffnet einen Weg zu schnellerer, effizienterer lokaler KI, ohne dabei die Modellqualität zu opfern. Ich kann es kaum erwarten zu sehen, was @Italianclownz und andere Zauberer damit anstellen. Angetrieben von Prompt Forge + Dual View, Kairic Edge-Beschleunigung, 262K Kontext: HumanEval-Metriken: • 47,73 tok/s Full-Suite TG • +85% gegenüber Unsloth Dynamic Q4 • +89% gegenüber Unsloth Dynamic Q6 • Schlug Unsloth Dynamic v3 q6 in Human Eval um 2 Fragen. Dies ist auch die erste Veröffentlichung, die von Kairic.ai angetrieben wird, einem neuen Unternehmen, das sich auf die gemeinsame Entwicklung von KI-Software rund um die Hardware konzentriert, auf der sie tatsächlich läuft. Modell, Benchmarks, Quelle, Build-Anleitung und Runner: huggingface.c…

    mehr auf Arint.info

    #AMDStrixHalo #KairicAI #LLM #LocalAI #Qwen3 #RDNA3 #arint_info

    https://x.com/ciruai/status/2091004843720659229

  7. RT @ciruai: Das beste Qwen3.8 27B-Modell für AMD Strix Halo ist da. In Zusammenarbeit mit Pete Hopton und dem Kairic.ai-Team präsentiere ich: Qwen3.8-27B-IU4-KAIRIC-EDGE. Unserer Kenntnis nach ist dies die weltweit erste öffentliche Veröffentlichung eines 27B-LLM mit einer beschleunigten nativen IU4-Inferenzspur, speziell für AMD Strix Halo (gfx1151) entwickelt. Warum ist IU4 wichtig? Die meisten 4-Bit-Modelle speichern zwar Speicher, wandeln Gewichte jedoch während der Ausführung weiterhin in breitere Formate um. Unsere IU4-Spur behält die Vier-Bit-Ganzzahldaten im aktiven Berechnungspfad und leitet sie direkt an die RDNA 3.5-Ganzzahlhardware weiter. Das reduziert den Speichertraffic und verwandelt Quantisierung von einem Speicherformat in eine echte Hardware-Ausführungsstrategie. Der abgestimmte IU4-Operator erreichte 104,66 TOPS – 1,94× FP16 und 1,93× IU8. Dies eröffnet einen Weg zu schnellerer, effizienterer lokaler KI, ohne dabei die Modellqualität zu opfern. Ich kann es kaum erwarten zu sehen, was @Italianclownz und andere Experten damit anstellen werden. Getrieben von Prompt Forge + Dual View, Kairic Edge-Beschleunigung, 262K Kontext: HumanEval-Metriken: • 47,73 tok/s Full-Suite TG • +85% gegenüber Unsloth Dynamic Q4 • +89% gegenüber Unsloth Dynamic Q6 • Schlug Unsloth Dynamic v3 q6 in HumanEval um 2 Fragen. Dies ist auch die erste Veröffentlichung, die von Kairic.ai unterstützt wird, einem neuen Unternehmen, das sich auf die gemeinsame Entwicklung von KI-Software rund um die Hardware konzentriert, auf der sie tatsächlich läuft. Modell, Benchmarks, Quelle, Build-Anleitung und Ru…

    mehr auf Arint.info

    #AMDStrixHalo #KairicAI #LLM #LocalAI #Qwen3 #RDNA3 #arint_info

    https://x.com/ciruai/status/2091004843720659229

  8. RT @TeksEdge: ❔Erinnert ihr euch an das Gigabyte AORUS RTX-5060TI eGPU für 699$? Nun ... 🤯Ein Reddit-Nutzer (bygiolasagna) hat es geschafft, das neue Qwen3.8-27B vollständig in eine einzelne RTX 5060 Ti mit 16GB zu pressen. Und es läuft mit fast 48 Token pro Sekunde. Es handelt sich um ein dichtes 27B-Modell. Die Konfiguration: 🔥 RTX 5060 Ti — 16GB 🧠 Qwen3.8-27B dense 🗜️ ~14.60 GiB benutzerdefiniertes IQ4XS GGUF 🦙 llama.cpp CUDA ⚡ Vollständiges GPU-Offloading 🚀 Flash Attention + CUDA Graphs 📚 32K Kontextfenster 💾 Q4 KV-Cache 🧩 MTP-2 Performance: 🐢 Ohne MTP → 25,7 tok/s ⚡ MTP-1 → 40,0 tok/s 🚀 MTP-2 → 47,4–47,6 tok/s Selbst nach einem Prefill von ~30K Token: → 45,7 tok/s Das entspricht einer Steigerung von etwa 85% durch MTP. 👀 Es ist bemerkenswert, dass ein 27B dichtes multimodales/agentic-Modell vollständig auf einer 16GB-Verbraucher-GPU der 700$-Klasse resident ist und mit wirklich interaktiven Geschwindigkeiten läuft.

    mehr auf Arint.info

    #AI #Hardware #LLM #MachineLearning #Qwen3 #RTX5060Ti #arint_info

    https://x.com/TeksEdge/status/2089155254118170941#m