#qwen3 — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #qwen3, aggregated by home.social.
-
RT @OrcaRouter: Jemand hat unabhängig 8 verschiedene Qwen3.8-27B-Modelle ohne Zensur oder Abliteration benchmarkt.
mehr auf Arint.info
#Abliteration #AIResearch #Benchmark #LLM #OrcaRouter #Qwen3 #arint_info
-
RT @OrcaRouter: Jemand hat unabhängig 8 verschiedene Qwen3.8-27B-Modelle ohne Zensur oder Abliteration benchmarkt.
mehr auf Arint.info
#Abliteration #AIResearch #Benchmark #LLM #OrcaRouter #Qwen3 #arint_info
-
RT @OrcaRouter: Jemand hat unabhängig 8 verschiedene Qwen3.8-27B-Modelle ohne Zensur oder Abliteration benchmarkt.
mehr auf Arint.info
#Abliteration #AIResearch #Benchmark #LLM #OrcaRouter #Qwen3 #arint_info
-
RT @OrcaRouter: Jemand hat unabhängig 8 verschiedene Qwen3.8-27B-Modelle ohne Zensur oder Abliteration benchmarkt.
mehr auf Arint.info
#Abliteration #AIResearch #Benchmark #LLM #OrcaRouter #Qwen3 #arint_info
-
RT @OrcaRouter: Jemand hat unabhängig 8 verschiedene Qwen3.8-27B-Modelle ohne Zensur oder Abliteration benchmarkt.
mehr auf Arint.info
#Abliteration #AIResearch #Benchmark #LLM #OrcaRouter #Qwen3 #arint_info
-
RT @imnotchalk: Qwen3.8 27B ist jetzt im @cerebras Shared Tier verfügbar mit einer Geschwindigkeit von ~1500 Token pro Sekunde. 🚀
mehr auf Arint.info
#AI #Cerebras #LLM #MachineLearning #Qwen3 #TechNews #arint_info
-
RT @imnotchalk: Qwen3.8 27B ist jetzt im @cerebras Shared Tier verfügbar mit einer Geschwindigkeit von ~1500 Token pro Sekunde. 🚀
mehr auf Arint.info
#AI #Cerebras #LLM #MachineLearning #Qwen3 #TechNews #arint_info
-
RT @imnotchalk: Qwen3.8 27B ist jetzt im @cerebras Shared Tier verfügbar mit einer Geschwindigkeit von ~1500 Token pro Sekunde. 🚀
mehr auf Arint.info
#AI #Cerebras #LLM #MachineLearning #Qwen3 #TechNews #arint_info
-
RT @imnotchalk: Qwen3.8 27B ist jetzt im @cerebras Shared Tier verfügbar mit einer Geschwindigkeit von ~1500 Token pro Sekunde. 🚀
mehr auf Arint.info
#AI #Cerebras #LLM #MachineLearning #Qwen3 #TechNews #arint_info
-
RT @imnotchalk: Qwen3.8 27B ist jetzt im @cerebras Shared Tier verfügbar mit einer Geschwindigkeit von ~1500 Token pro Sekunde. 🚀
mehr auf Arint.info
#AI #Cerebras #LLM #MachineLearning #Qwen3 #TechNews #arint_info
-
Lokale KI erstmals auf Cloud-Niveau?
-
🚀 Oh look, another tech bro's magnum opus: a riveting tale of running #Qwen3.8 on a Mac Studio, complete with thrilling RAM usage stats and a 20-minute "gotcha" 🙄. Truly, it's the War and Peace of terminal commands! 🍿
https://terminalbytes.com/run-qwen-3-8-27b-locally/ #techbro #tales #MacStudio #RAMusage #terminalcommands #WarandPeace #HackerNews #ngated -
RT @0xBakeer: Qwen3.8-Flash-Next auf einer einzelnen DGX Spark: bis zu 97 Tokens pro Sekunde.
mehr auf Arint.info
#AI #DGXSpark #MachineLearning #NLP #OpenSource #Qwen3 #arint_info
-
RT @0xBakeer: Qwen3.8-Flash-Next auf einer einzelnen DGX Spark: bis zu 97 Tokens pro Sekunde.
mehr auf Arint.info
#AI #DGXSpark #MachineLearning #NLP #OpenSource #Qwen3 #arint_info
-
RT @0xBakeer: Qwen3.8-Flash-Next auf einer einzelnen DGX Spark: bis zu 97 Tokens pro Sekunde.
mehr auf Arint.info
#AI #DGXSpark #MachineLearning #NLP #OpenSource #Qwen3 #arint_info
-
RT @0xBakeer: Qwen3.8-Flash-Next auf einer einzelnen DGX Spark: bis zu 97 Tokens pro Sekunde.
mehr auf Arint.info
#AI #DGXSpark #MachineLearning #NLP #OpenSource #Qwen3 #arint_info
-
RT @0xBakeer: Qwen3.8-Flash-Next auf einer einzelnen DGX Spark: bis zu 97 Tokens pro Sekunde.
mehr auf Arint.info
#AI #DGXSpark #MachineLearning #NLP #OpenSource #Qwen3 #arint_info
-
RT @UnslothAI: Wir veröffentlichen neue Qwen3.8-27B GGUFs mit 10 % höherer Genauigkeit. Unsloth Dynamic V3 schlägt andere um 10 % auf Div-300, KLD und weiteren Benchmarks. Zudem veröffentlichen wir 1-Bit-Quantisierungen, die 77 % der Genauigkeit beibehalten. Läuft auf 8 GB RAM. Blog: unsloth.ai/docs/basics/dynam… GGUF: huggingface.co/unsloth/Qwen3…
mehr auf Arint.info
#AI #GGUF #MachineLearning #OpenSource #Qwen3 #Unsloth #arint_info
-
RT @TeksEdge: ❔Erinnert ihr euch an das Gigabyte AORUS RTX-5060TI eGPU für 699$? Nun ... 🤯Ein Reddit-Nutzer (bygiolasagna) hat es geschafft, das neue Qwen3.8-27B vollständig in eine einzelne RTX 5060 Ti mit 16GB zu pressen. Und es läuft mit fast 48 Token pro Sekunde. Es handelt sich um ein dichtes 27B-Modell. Die Konfiguration: 🔥 RTX 5060 Ti — 16GB 🧠 Qwen3.8-27B dense 🗜️ ~14.60 GiB benutzerdefiniertes IQ4XS GGUF 🦙 llama.cpp CUDA ⚡ Vollständiges GPU-Offloading 🚀 Flash Attention + CUDA Graphs 📚 32K Kontextfenster 💾 Q4 KV-Cache 🧩 MTP-2 Performance: 🐢 Ohne MTP → 25,7 tok/s ⚡ MTP-1 → 40,0 tok/s 🚀 MTP-2 → 47,4–47,6 tok/s Selbst nach einem Prefill von ~30K Token: → 45,7 tok/s Das entspricht einer Steigerung von etwa 85% durch MTP. 👀 Es ist bemerkenswert, dass ein 27B dichtes multimodales/agentic-Modell vollständig auf einer 16GB-Verbraucher-GPU der 700$-Klasse resident ist und mit wirklich interaktiven Geschwindigkeiten läuft.
mehr auf Arint.info
#AI #Hardware #LLM #MachineLearning #Qwen3 #RTX5060Ti #arint_info
-
Update, more slides: Run LLMs Locally
I added sandboxing of OpenCode and llama.cpp with nono and Landlock.
And a new slide to describe jailbreaks with DeepInception.https://github.com/thomas-0816/talks/blob/main/Run_LLMs_Locally_2026_ThomasBley.pdf
#ai #llm #llamacpp #wllama #stablediffusion #qwen3 #glm #localai #gemma4 #webgpu #opencode
-
New week, new slides: Run LLMs Locally
I added virtualization of OpenCode with Matchlock and Firecracker microVMs,
containerization of OpenCode and llama.cpp with Docker
and a new slide for indirect prompt injection attacks.
Matchlock is a great project for sandboxing, bringing the advantages of containers to virtual machines.https://github.com/thomas-0816/talks/blob/main/Run_LLMs_Locally_2026_ThomasBley.pdf
#ai #llm #llamacpp #wllama #stablediffusion #qwen3 #glm #localai #gemma4 #webgpu #opencode #firecracker #docker
-
New week, new slides and small updates: Run LLMs Locally
Added an example to create Mermaid diagrams in llama.cpp UI.
Added QAT (Quantization-Aware Training) variants of Gemma 4 which are 50 percent faster in token generation with my local setup.
Added definitions for Deterministic and Probabilistic results.https://github.com/thomas-0816/talks/blob/main/Run_LLMs_Locally_2026_ThomasBley.pdf
#ai #llm #llamacpp #wllama #stablediffusion #qwen3 #glm #localai #gemma4 #webgpu #opencode #mtp #webassembly #mellum2
-
https://winbuzzer.com/2026/06/06/alibaba-pitches-qwen37-plus-as-a-computer-use-ai-agent-xcxwbn/
Alibaba's new Qwen3.7-Plus model targets screen, coding, and cloud-console automation as computer-use AI pushes beyond browsers into app and terminal tasks.
#AI #Qwen37Plus #Qwen3 #Alibaba #Qwen #AIAutomation #AIAgents #MultimodalAI #AICoding #AIModels
-
New week, beautiful new slides: Run LLMs Locally
Now with Mellum2 from JetBrains!
A very fast coding model, requires only 10 GB RAM.I also added LFM 2.5 from LiquidAI, updated translations with HY-MT2 from Tencent, added examples for wllama using re-ranking and structured output
and added thinking_budget_tokens to the curl examples.https://github.com/thomas-0816/talks/blob/main/Run_LLMs_Locally_2026_ThomasBley.pdf
#ai #llm #llamacpp #wllama #stablediffusion #qwen3 #glm #localai #gemma4 #webgpu #opencode #mtp #webassembly #jetbrains #mellum2
-
New week, more slides: Run LLMs Locally
Now including wllama to run GGUF models inside your browser!
wllama uses llama.cpp, WebAssembly and WebGPU, bringing a completely new experience of LLMs into the web.
It has no 4 GB limitation and is faster than Transformers.js.I also added translations using the HY-MT model from Tencent.
https://github.com/thomas-0816/talks/blob/main/Run_LLMs_Locally_2026_ThomasBley.pdf
#ai #llm #llamacpp #wllama #stablediffusion #qwen3 #glm #localai #gemma4 #webgpu #opencode #mtp #webassembly
-
Erkenntnis nach Selbstversuch: Wenn acht Sekunden Sample ausreichen, um lokale KI einen aktuellen Text mit meiner Stimme vorlesen zu lassen - das ändert in Sachen Quellenglaubwürdigkeit absehbar alles.
#qwen3 #selbstversuch #ai #journalism auch im #lokaljournalismus
-
Krátce jsem zkoušel lokální #LLM modely na mém #frameworklaptop13 a docela zajímavě vypadá "přemýšlivý" qwen3.6:35b-a3b-q4_K_M, který na AMD Ryzen 5 AI 340 + 32GB RAM běží použitelně.
Tento model má redukovaný počet aktivních parametrů pro zpracování jednoho tokenu. Na první pohled, tak méně zatěžuje CPU/GPU a celý notebook méně hučí a topí. Podobně funguje i starší qwen3-coder:30b-a3b-q4_K_M, který "nepřemýšlí" takže odpověď dorazí rychleji.
Každopádně na tomto HW tyto modely generují výstup řádově v nižších desítkách (možná spíš jednotky) tokenů za sekundu. Měřeno pohledem oka. Použitelné to je, ale kdo to s lokálním LLM myslí opravdu vážně, brzy sáhne po něčem výkonnějším.
-
Выбор LLM и фреймворка для ИИ-агентов
Путь от одной A100 в облаке до кластера на H200 — это не просто апгрейд железа, а история о том, как ML-команда перестала искать «ту самую идеальную модель» и начала строить экосистему. Когда под капотом миллионы строк C-кода PostgreSQL, а задачи варьируются от генерации hint-сетов до Graph-RAG, модель превращается из «черного ящика» в обычный заменяемый компонент. Рассказываем, как мы пересобрали стек на базе vLLM и MCP, почему контекст-менеджмент важнее весов модели и как заставить 0.6B-параметров работать не хуже гигантов через GRPO.
https://habr.com/ru/companies/postgrespro/articles/979820/
#llm #aiагент #ииагенты #qwen3 #ragas #finetuning #дообучение #trl #grpo #gspo