#qwen3 — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #qwen3, aggregated by home.social.
-
RT @imnotchalk: Qwen3.8 27B ist jetzt im @cerebras Shared Tier verfügbar mit einer Geschwindigkeit von ~1500 Token pro Sekunde. 🚀
mehr auf Arint.info
#AI #Cerebras #LLM #MachineLearning #Qwen3 #TechNews #arint_info
-
RT @imnotchalk: Qwen3.8 27B ist jetzt im @cerebras Shared Tier verfügbar mit einer Geschwindigkeit von ~1500 Token pro Sekunde. 🚀
mehr auf Arint.info
#AI #Cerebras #LLM #MachineLearning #Qwen3 #TechNews #arint_info
-
RT @imnotchalk: Qwen3.8 27B ist jetzt im @cerebras Shared Tier verfügbar mit einer Geschwindigkeit von ~1500 Token pro Sekunde. 🚀
mehr auf Arint.info
#AI #Cerebras #LLM #MachineLearning #Qwen3 #TechNews #arint_info
-
RT @imnotchalk: Qwen3.8 27B ist jetzt im @cerebras Shared Tier verfügbar mit einer Geschwindigkeit von ~1500 Token pro Sekunde. 🚀
mehr auf Arint.info
#AI #Cerebras #LLM #MachineLearning #Qwen3 #TechNews #arint_info
-
RT @imnotchalk: Qwen3.8 27B ist jetzt im @cerebras Shared Tier verfügbar mit einer Geschwindigkeit von ~1500 Token pro Sekunde. 🚀
mehr auf Arint.info
#AI #Cerebras #LLM #MachineLearning #Qwen3 #TechNews #arint_info
-
Qwen 3.8 27B Uncensored – Testing the Uncensored Qwen Model
https://imageat.com/models/qwen-3-8-27b-uncensored
Comments: https://news.ycombinator.com/item?id=49456134
#HackerNews #Qwen3.8 #Uncensored #AI #Model #Testing #MachineLearning #TechNews
-
RT @Alibaba_Qwen: Ein riesiges Dankeschön an die gesamte Community! Qwen3.8-27B ist jetzt das meistgenutzte Modell auf Hugging Face! 🏆 Probiert es aus und teilt uns eure Meinung mit. 🤗 Julien Chaumond (@julienc) bald 10k — https://nitter.net/julienc/status/2088790179951562797#m
mehr auf Arint.info
#AICommunity #HuggingFace #JulienChaumond #MachineLearning #Qwen3 #TrendingModel #arint_info
-
RT @Alibaba_Qwen: Ein riesiges Dankeschön an die gesamte Community! Qwen3.8-27B ist jetzt das meistgenutzte Modell auf Hugging Face! 🏆 Probiert es aus und teilt uns eure Meinung mit. 🤗 Julien Chaumond (@julienc) bald 10k — https://nitter.net/julienc/status/2088790179951562797#m
mehr auf Arint.info
#AICommunity #HuggingFace #JulienChaumond #MachineLearning #Qwen3 #TrendingModel #arint_info
-
RT @Alibaba_Qwen: Ein riesiges Dankeschön an die gesamte Community! Qwen3.8-27B ist jetzt das meistgenutzte Modell auf Hugging Face! 🏆 Probiert es aus und teilt uns eure Meinung mit. 🤗 Julien Chaumond (@julienc) bald 10k — https://nitter.net/julienc/status/2088790179951562797#m
mehr auf Arint.info
#AICommunity #HuggingFace #JulienChaumond #MachineLearning #Qwen3 #TrendingModel #arint_info
-
RT @TeksEdge: ❔Erinnert ihr euch an das Gigabyte AORUS RTX-5060TI eGPU für 699$? Nun ... 🤯Ein Reddit-Nutzer (bygiolasagna) hat es geschafft, das neue Qwen3.8-27B vollständig in eine einzelne RTX 5060 Ti mit 16GB zu pressen. Und es läuft mit fast 48 Token pro Sekunde. Es handelt sich um ein dichtes 27B-Modell. Die Konfiguration: 🔥 RTX 5060 Ti — 16GB 🧠 Qwen3.8-27B dense 🗜️ ~14.60 GiB benutzerdefiniertes IQ4XS GGUF 🦙 llama.cpp CUDA ⚡ Vollständiges GPU-Offloading 🚀 Flash Attention + CUDA Graphs 📚 32K Kontextfenster 💾 Q4 KV-Cache 🧩 MTP-2 Performance: 🐢 Ohne MTP → 25,7 tok/s ⚡ MTP-1 → 40,0 tok/s 🚀 MTP-2 → 47,4–47,6 tok/s Selbst nach einem Prefill von ~30K Token: → 45,7 tok/s Das entspricht einer Steigerung von etwa 85% durch MTP. 👀 Es ist bemerkenswert, dass ein 27B dichtes multimodales/agentic-Modell vollständig auf einer 16GB-Verbraucher-GPU der 700$-Klasse resident ist und mit wirklich interaktiven Geschwindigkeiten läuft.
mehr auf Arint.info
#AI #Hardware #LLM #MachineLearning #Qwen3 #RTX5060Ti #arint_info
-
Сжатие декодерных эмбеддеров: как ужать 8B до продакшена без потери recall
Декодерный эмбеддер 7–8B дает качество, но платит за него памятью, latency и деньгами. Разбираем все оси сжатия - int8, int4, binary + rescoring, PQ, MRL-усечение - на реальных замерах recall@10: где деградация мягкая, а где обрыв. С воспроизводимым кодом и Colab-ноутбуком под Qwen3
https://habr.com/ru/articles/1054930/
#сжатие_эмбеддингов #квантизация #эмбеддинги #embeddings #RAG #Qdrant #Qwen3 #binary_quantization #Matryoshka #retrieval
-
Krátce jsem zkoušel lokální #LLM modely na mém #frameworklaptop13 a docela zajímavě vypadá "přemýšlivý" qwen3.6:35b-a3b-q4_K_M, který na AMD Ryzen 5 AI 340 + 32GB RAM běží použitelně.
Tento model má redukovaný počet aktivních parametrů pro zpracování jednoho tokenu. Na první pohled, tak méně zatěžuje CPU/GPU a celý notebook méně hučí a topí. Podobně funguje i starší qwen3-coder:30b-a3b-q4_K_M, který "nepřemýšlí" takže odpověď dorazí rychleji.
Každopádně na tomto HW tyto modely generují výstup řádově v nižších desítkách (možná spíš jednotky) tokenů za sekundu. Měřeno pohledem oka. Použitelné to je, ale kdo to s lokálním LLM myslí opravdu vážně, brzy sáhne po něčem výkonnějším.