home.social

#qwen3 — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #qwen3, aggregated by home.social.

  1. 🚀 Wow, "Qwen 3.8" is now hot on the heels of "GPT-5.5 Pro" in the prestigious field of... *reasoning prefills* 🤯. Because, let's face it, who doesn't love a good prefilled reasoning session from the vast wilderness of #GitHub gists? 😜
    gist.github.com/wsxiaoys/e0286 #Qwen3.8 #GPT5.5 #reasoningprefills #gists #AItechnology #HackerNews #ngated

  2. 🚀 Wow, "Qwen 3.8" is now hot on the heels of "GPT-5.5 Pro" in the prestigious field of... *reasoning prefills* 🤯. Because, let's face it, who doesn't love a good prefilled reasoning session from the vast wilderness of #GitHub gists? 😜
    gist.github.com/wsxiaoys/e0286 #Qwen3.8 #GPT5.5 #reasoningprefills #gists #AItechnology #HackerNews #ngated

  3. 🚀 Wow, "Qwen 3.8" is now hot on the heels of "GPT-5.5 Pro" in the prestigious field of... *reasoning prefills* 🤯. Because, let's face it, who doesn't love a good prefilled reasoning session from the vast wilderness of #GitHub gists? 😜
    gist.github.com/wsxiaoys/e0286 #Qwen3.8 #GPT5.5 #reasoningprefills #gists #AItechnology #HackerNews #ngated

  4. 🚀 Wow, "Qwen 3.8" is now hot on the heels of "GPT-5.5 Pro" in the prestigious field of... *reasoning prefills* 🤯. Because, let's face it, who doesn't love a good prefilled reasoning session from the vast wilderness of #GitHub gists? 😜
    gist.github.com/wsxiaoys/e0286 #Qwen3.8 #GPT5.5 #reasoningprefills #gists #AItechnology #HackerNews #ngated

  5. 🚀 Wow, "Qwen 3.8" is now hot on the heels of "GPT-5.5 Pro" in the prestigious field of... *reasoning prefills* 🤯. Because, let's face it, who doesn't love a good prefilled reasoning session from the vast wilderness of #GitHub gists? 😜
    gist.github.com/wsxiaoys/e0286 #Qwen3.8 #GPT5.5 #reasoningprefills #gists #AItechnology #HackerNews #ngated

  6. RT @bnjmn_marie: Mein erster vollständiger Durchlauf von Qwen3.8 27B auf DeepSWE 1.1 ist abgeschlossen: Punktzahl: 26,5 Zeit: 45 Stunden Abschluss-Token: 7,45 Mio. Gesamtinput- und Output-Token: 820 Mio. Modellaufrufe: 9.591 Die Punktzahl liegt 16 Punkte unter dem Ergebnis, das vom Qwen-Team veröffentlicht wurde, aber es gibt einige wichtige Unterschiede: Ich habe mini-swe-agent verwendet; sie haben Claude Code verwendet. Ich habe thinking=medium genutzt; sie haben wahrscheinlich xhigh verwendet. Ich hatte 9 Laufzeitfehler aufgrund von Internetproblemen auf meiner Seite (Lala...). Ich sollte diese Aufgaben erneut ausführen. Abgesehen davon habe ich dieselben Hyperparameter verwendet. Ich habe bereits einen weiteren Durchlauf mit derselben Konfiguration gestartet, aber diesmal mit Claude Code. Dennoch ist 26,5 eine deutliche Verbesserung gegenüber den 13 Punkten, die ich mit Qwen3.6 erzielt habe, und liegt 21 Punkte höher als Muse Glimmer im xhigh-Modus.

    mehr auf Arint.info

    #AI #DeepSWE #LLM #MachineLearning #Qwen3 #TechResults #arint_info

    https://x.com/bnjmn_marie/status/2089775546943312076#m

  7. RT @TeksEdge: ❔Erinnert ihr euch an das Gigabyte AORUS RTX-5060TI eGPU für 699$? Nun ... 🤯Ein Reddit-Nutzer (bygiolasagna) hat es geschafft, das neue Qwen3.8-27B vollständig in eine einzelne RTX 5060 Ti mit 16GB zu pressen. Und es läuft mit fast 48 Token pro Sekunde. Es handelt sich um ein dichtes 27B-Modell. Die Konfiguration: 🔥 RTX 5060 Ti — 16GB 🧠 Qwen3.8-27B dense 🗜️ ~14.60 GiB benutzerdefiniertes IQ4XS GGUF 🦙 llama.cpp CUDA ⚡ Vollständiges GPU-Offloading 🚀 Flash Attention + CUDA Graphs 📚 32K Kontextfenster 💾 Q4 KV-Cache 🧩 MTP-2 Performance: 🐢 Ohne MTP → 25,7 tok/s ⚡ MTP-1 → 40,0 tok/s 🚀 MTP-2 → 47,4–47,6 tok/s Selbst nach einem Prefill von ~30K Token: → 45,7 tok/s Das entspricht einer Steigerung von etwa 85% durch MTP. 👀 Es ist bemerkenswert, dass ein 27B dichtes multimodales/agentic-Modell vollständig auf einer 16GB-Verbraucher-GPU der 700$-Klasse resident ist und mit wirklich interaktiven Geschwindigkeiten läuft.

    mehr auf Arint.info

    #AI #Hardware #LLM #MachineLearning #Qwen3 #RTX5060Ti #arint_info

    https://x.com/TeksEdge/status/2089155254118170941#m

  8. 🚀 Introducing Qwen3.8: the #AI model with a scandalously large number of #parameters that somehow still manages to be as dense as its creators. 🤯 With unparalleled ability to shine in "real-world #office #workflows," it raises the question: do we really need yet another AI to tell us how to fill out spreadsheets? 💼
    twitter.com/alibaba_qwen/statu #Qwen3.8 #innovation #HackerNews #ngated

  9. Сжатие декодерных эмбеддеров: как ужать 8B до продакшена без потери recall

    Декодерный эмбеддер 7–8B дает качество, но платит за него памятью, latency и деньгами. Разбираем все оси сжатия - int8, int4, binary + rescoring, PQ, MRL-усечение - на реальных замерах recall@10: где деградация мягкая, а где обрыв. С воспроизводимым кодом и Colab-ноутбуком под Qwen3

    habr.com/ru/articles/1054930/

    #сжатие_эмбеддингов #квантизация #эмбеддинги #embeddings #RAG #Qdrant #Qwen3 #binary_quantization #Matryoshka #retrieval

  10. Retrieval в 2026: как RAG переехал с энкодеров на LLM (и что с этим делать в своём проекте)

    Если вы строили RAG в 2023, ваш стек выглядел плюс-минус одинаково. BERT-семейство (BGE, e5) для семантики, BM25 для буквальных совпадений, cross-encoder для реранкинга, какой-нибудь Qdrant сверху. Этим жили два года, и многие до сих пор так живут. Но если посмотреть, кто реально гоняется в продакшене у команд, которые ушли вперёд, ландшафт другой. Энкодеров там почти нет. Эмбеддит файнтюненная LLM. Реранкер — тоже LLM. Инференс на SGLang, а не на ONNX. И вся обвязка перестроилась под это. Эта статья про то, что поменялось и как переиспользовать этот стек у себя. Особенно если вы работаете в узком домене, где готовых датасетов нет.

    habr.com/ru/articles/1049872/

    #RAG #эмбеддинги #embeddings #retrieval #LLM #Qwen3 #Qdrant #vector_search #hard_negatives #LLM2Vec

  11. Erkenntnis nach Selbstversuch: Wenn acht Sekunden Sample ausreichen, um lokale KI einen aktuellen Text mit meiner Stimme vorlesen zu lassen - das ändert in Sachen Quellenglaubwürdigkeit absehbar alles.

    #qwen3 #selbstversuch #ai #journalism auch im #lokaljournalismus

  12. Vera — ваш личный десктопный агент

    В прошлой статье я описывал свой эксперимент по возможностям маленьких LLM. Эта статья идет как продолжение, в которой я расскажу о проделанной работе по изменению и улучшению функционала голосового агента.

    habr.com/ru/articles/972260/

    #агент #qwen3 #голосовой_ассистент #искусственный_интеллект #пк #python

  13. [Перевод] Видеокарты для нейросетей: две RTX 5060 Ti 16GB или одна RTX 3090 24GB? Тест LLM‑инференса

    Мечтаете запустить нейросеть на компьютере и анализировать целые книги или сложные документы? Тогда объем VRAM и поддержка длинных контекстов — ваши главные приоритеты. С появлением RTX 5060 Ti 16GB открылась интригующая возможность — собрать систему с двумя такими картами за 950 $ , получив целых 32 ГБ VRAM ! Но как этот дуал покажет себя против проверенной временем б/у RTX 3090 (~900 $) , с её внушительными 24 ГБ и легендарной пропускной способностью? Я провел тесты на реальных моделях (Qwen3 30B/32B), чтобы выяснить, какую видеокарту выбрать для нейросети в 2025 году, если ваша цель — запустить LLM на компьютере с максимальной отдачей, особенно для длинных контекстов.

    habr.com/ru/companies/bothub/a

    #видеокарты_для_нейросетей #rtx_5060_ti_16gb #rtx_3090_24gb #qwen3 #железо #тест_иимоделей #инференс #llamacpp #exllamav3 #tabbyapi