#qwen3 — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #qwen3, aggregated by home.social.
-
RT @imnotchalk: Qwen3.8 27B ist jetzt im @cerebras Shared Tier verfügbar mit einer Geschwindigkeit von ~1500 Token pro Sekunde. 🚀
mehr auf Arint.info
#AI #Cerebras #LLM #MachineLearning #Qwen3 #TechNews #arint_info
-
RT @imnotchalk: Qwen3.8 27B ist jetzt im @cerebras Shared Tier verfügbar mit einer Geschwindigkeit von ~1500 Token pro Sekunde. 🚀
mehr auf Arint.info
#AI #Cerebras #LLM #MachineLearning #Qwen3 #TechNews #arint_info
-
RT @imnotchalk: Qwen3.8 27B ist jetzt im @cerebras Shared Tier verfügbar mit einer Geschwindigkeit von ~1500 Token pro Sekunde. 🚀
mehr auf Arint.info
#AI #Cerebras #LLM #MachineLearning #Qwen3 #TechNews #arint_info
-
RT @imnotchalk: Qwen3.8 27B ist jetzt im @cerebras Shared Tier verfügbar mit einer Geschwindigkeit von ~1500 Token pro Sekunde. 🚀
mehr auf Arint.info
#AI #Cerebras #LLM #MachineLearning #Qwen3 #TechNews #arint_info
-
RT @imnotchalk: Qwen3.8 27B ist jetzt im @cerebras Shared Tier verfügbar mit einer Geschwindigkeit von ~1500 Token pro Sekunde. 🚀
mehr auf Arint.info
#AI #Cerebras #LLM #MachineLearning #Qwen3 #TechNews #arint_info
-
🚀🎉 Big news, everyone! The latest and greatest Qwen 3.8 27B is out on #Cerebras, promising to process text faster than you can say "overhyped tech jargon." Just navigate through a labyrinth of buzzwords and obscure documentation to find out how to pay for it - because who doesn't love a treasure hunt through a digital maze? 💸🔍
https://inference-docs.cerebras.ai/models/overview #Qwen3.8 #TechBuzz #DigitalMaze #TreasureHunt #HackerNews #ngated -
Lokale KI erstmals auf Cloud-Niveau?
-
RT @TeksEdge: ❔Erinnert ihr euch an das Gigabyte AORUS RTX-5060TI eGPU für 699$? Nun ... 🤯Ein Reddit-Nutzer (bygiolasagna) hat es geschafft, das neue Qwen3.8-27B vollständig in eine einzelne RTX 5060 Ti mit 16GB zu pressen. Und es läuft mit fast 48 Token pro Sekunde. Es handelt sich um ein dichtes 27B-Modell. Die Konfiguration: 🔥 RTX 5060 Ti — 16GB 🧠 Qwen3.8-27B dense 🗜️ ~14.60 GiB benutzerdefiniertes IQ4XS GGUF 🦙 llama.cpp CUDA ⚡ Vollständiges GPU-Offloading 🚀 Flash Attention + CUDA Graphs 📚 32K Kontextfenster 💾 Q4 KV-Cache 🧩 MTP-2 Performance: 🐢 Ohne MTP → 25,7 tok/s ⚡ MTP-1 → 40,0 tok/s 🚀 MTP-2 → 47,4–47,6 tok/s Selbst nach einem Prefill von ~30K Token: → 45,7 tok/s Das entspricht einer Steigerung von etwa 85% durch MTP. 👀 Es ist bemerkenswert, dass ein 27B dichtes multimodales/agentic-Modell vollständig auf einer 16GB-Verbraucher-GPU der 700$-Klasse resident ist und mit wirklich interaktiven Geschwindigkeiten läuft.
mehr auf Arint.info
#AI #Hardware #LLM #MachineLearning #Qwen3 #RTX5060Ti #arint_info
-
Qwen3.8 Max now ranked as the best overall model by agentic index
https://artificialanalysis.ai/?intelligence=agentic-index
Comments: https://news.ycombinator.com/item?id=49200652
#HackerNews #Qwen3.8 #Max #agentic-index #AI #ranking #technology #advancement
-
Маленькая модель на 0.6B держит квантование лучше, чем «крупная» на 1B: измерил деградацию function-calling на 4 ГБ VRAM
Как квантование ломает function-calling у LLM? Написал бенчмарк QuantCall, протестировав модели на 4 ГБ VRAM. Главный инсайт: устойчивость к квантам зависит не от размера, а от семейства. Меньшая Qwen3-0.6B стабильно генерирует валидный JSON даже на Q4, а более крупная Llama-3.2-1B деградирует уже на Q8, путая типы данных. Также GBNF-грамматики не спасают от ошибок, но заметно замедляют инференс.
https://habr.com/ru/articles/1056656/
#квантование #functioncalling #Qwen3 #Llama32 #BFCL #QuantCall #JSONсхема #GBNF #GGUF #деградация_модели
-
Маленькая модель на 0.6B держит квантование лучше, чем «крупная» на 1B: измерил деградацию function-calling на 4 ГБ VRAM
Как квантование ломает function-calling у LLM? Написал бенчмарк QuantCall, протестировав модели на 4 ГБ VRAM. Главный инсайт: устойчивость к квантам зависит не от размера, а от семейства. Меньшая Qwen3-0.6B стабильно генерирует валидный JSON даже на Q4, а более крупная Llama-3.2-1B деградирует уже на Q8, путая типы данных. Также GBNF-грамматики не спасают от ошибок, но заметно замедляют инференс.
https://habr.com/ru/articles/1056656/
#квантование #functioncalling #Qwen3 #Llama32 #BFCL #QuantCall #JSONсхема #GBNF #GGUF #деградация_модели
-
Маленькая модель на 0.6B держит квантование лучше, чем «крупная» на 1B: измерил деградацию function-calling на 4 ГБ VRAM
Как квантование ломает function-calling у LLM? Написал бенчмарк QuantCall, протестировав модели на 4 ГБ VRAM. Главный инсайт: устойчивость к квантам зависит не от размера, а от семейства. Меньшая Qwen3-0.6B стабильно генерирует валидный JSON даже на Q4, а более крупная Llama-3.2-1B деградирует уже на Q8, путая типы данных. Также GBNF-грамматики не спасают от ошибок, но заметно замедляют инференс.
https://habr.com/ru/articles/1056656/
#квантование #functioncalling #Qwen3 #Llama32 #BFCL #QuantCall #JSONсхема #GBNF #GGUF #деградация_модели
-
https://winbuzzer.com/2026/06/06/alibaba-pitches-qwen37-plus-as-a-computer-use-ai-agent-xcxwbn/
Alibaba's new Qwen3.7-Plus model targets screen, coding, and cloud-console automation as computer-use AI pushes beyond browsers into app and terminal tasks.
#AI #Qwen37Plus #Qwen3 #Alibaba #Qwen #AIAutomation #AIAgents #MultimodalAI #AICoding #AIModels
-
We got 207 tok/s with Qwen3.5-27B on an RTX 3090
https://github.com/Luce-Org/lucebox-hub
#HackerNews #Qwen3.5 #RTX3090 #tok/s #machinelearning #AIperformance
-
Вам нужна RAM, а не VRAM. Параметр -cmoe для запуска больших и огромных моделей LLM локально. Ускоряем GPT-OSS-120B
Всё больше выходит больших MoE моделей с малым числом активных параметров. У MoE совсем другой сценарий нагрузки и использования ресурсов нежели у Dense моделей, достаточно немного VRAM. Большие MoE модели устроит 1 GPU и много обычной RAM. О том, как устроены MoE и как ускорить работу одним параметром не меняя железо.
https://habr.com/ru/articles/961478/
#llamacpp #cmoe #локальные_нейросети #gptoss120b #gptoss #cpumoe #qwen3 #deepseek #llm
-
Alibaba has launched Qwen 3, an advanced AI model with hybrid reasoning, aiming to rival DeepSeek and Baidu in China’s escalating AI race. The model balances quick responses with deeper, self-checking logic, targeting developers with a smarter, more flexible platform.
#Alibaba #Qwen3 #AIinChina #ArtificialIntelligence #Baidu #DeepSeek #HybridAI #TechNews #TECHi
Read Full Article Here :- https://www.techi.com/alibaba-debuts-sophisticated-qwen-3ai-escalting-tech-rivalry/