home.social

#qwen — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #qwen, aggregated by home.social.

  1. Наш бенчмарк ИИ-агентов: собачьи бега моделей LLM, в которых Алиса выигрывает

    Всем привет. На связи Сергей Игнатенко, основатель ИИ-платформы VibePilot. Мы сделали свой бенчмарк моделей ИИ на реальных задачах: сметы, договоры, многостраничный Excel. 1 198 задач, 22 сбоя, 1,8%. Считается, что суверенные модели слишком слабы для агентов. Внутри жёсткого конвейера Алиса делает смету с разделами за 19 секунд и обгоняет Qwen3-235B в четыре раза. Смотреть результаты забегов

    habr.com/ru/articles/1080744/

    #бенчмарк_LLM #ИИагенты #YandexGPT #GigaChat #Alice_AI_LLM #DeepSeek #Qwen #суверенные_модели #генерация_документов #Yandex_Cloud

  2. Тест DeepSeek, Qwen, GLM и прочих LLM на продвинутом пользовательском железе

    В статье рассказываю о личном опыте запуска современных LLM на домашнем ПК, сравниваю модели, кванты и движки, показываю результаты практических тестов и делюсь выводами о том, что сегодня по моему мнению имеет смысл запускать локально.

    habr.com/ru/articles/1080316/

    #MTP #DSpark #NInfer #FreeToken #ExLlamaV3 #Qwen #DeepSeek #GLM #Ornith #RTX_5090

  3. 🧵 Suite complémentaire de mes aventures avec Qwen et ses versions « uncensored »…

    Un benchmark vient de comparer Qwen3.8-27B avec 8 variantes “abliterated” publié par par Abliterlitics
    LLM Abliteration Forensics
    ⬇️
    "Qwen 3.8 27B: 8 Abliteration Variants Compared"
    👇
    abliterlitics.dev/models/qwen3

    ...et ladies & gentlemen là aussi le gagnant est OrcaRouter : ~82 % de compliance sur HarmBench tout en restant pratiquement aussi capable que le Qwen original.

    Juste derrière, Apostate (github.com/heterodoxin/apostate) fait ~79 % avec… seulement 41 vraies modifications dans les poids.

    Petit, précis, efficace.

    Comme quoi

    rm -rf alignment
    n’était peut-être pas la bonne méthodologie.

    Quant aux limites "morales", ils arrivent aux même constats que mes petits tests du dimanche

    Les variantes arrivent très bien à faire sauter les barrières sur…

    • chimie/bio
    • cybercrime
    • contenus dangereux...😬

    mais le truc le plus fou-> demande des paroles de chanson ou des passages de bouquin et soudain :

    HALTE-LÀ CITOYEN, LE COPYRIGHT. 🛑©️

    Le meilleur modèle ne dépasse même pas ~39 % sur cette catégorie.

    Donc, résumé de la lecture et de l'experience:

    Faire sauter les safety rails sans casser le modèle, ce n’est plus théorique : ça marche, et ça se pratique déjà.

    Ces modèles, une fois quantifiés en 4-bit, restent très performants et peuvent tourner localement sur des Mac grand public.

    Accès simple: plus besoin d’un datacenter ni d’un gros budget pour déployer ce type de modèles.

    ...et manifestement, chez les LLM, Metallica est désormais mieux protégé que la chimie dangereuse.

    ¯(ツ)/¯

    #qwen #uncensored #IA

  4. Семь ИИ‑моделей получили по $300 и три дня, чтобы заработать. Выручка — $0

    Bottleneck Labs провели простой по формулировке и довольно безумный по исполнению эксперимент: семи ИИ‑моделям выдали по разблокированному Mac mini, банковскому счёту с $300, отдельному аккаунту Stripe, электронной почте и доступу в интернет. Задание состояло практически из одной строки: «Заработай как можно больше денег, начинай прямо сейчас» . На всё дали 72 часа. Через трое суток результат выглядел так: $0 выручки , если не считать $5, которые Grok заплатил сам себе. При этом модели успели отправить 2797 писем, потратить $359,80 настоящих денег со своих счетов и ещё $2833,35 на обращения к моделям. Не только лишь каждая модель так сможет!

    habr.com/ru/articles/1080120/

    #ИИагенты #автономные_агенты #большие_языковые_модели #LLM #искусственный_интеллект #OpenAI #Grok #Qwen #Stripe #автономный_бизнес

  5. Семь ИИ‑моделей получили по $300 и три дня, чтобы заработать. Выручка — $0

    Bottleneck Labs провели простой по формулировке и довольно безумный по исполнению эксперимент: семи ИИ‑моделям выдали по разблокированному Mac mini, банковскому счёту с $300, отдельному аккаунту Stripe, электронной почте и доступу в интернет. Задание состояло практически из одной строки: «Заработай как можно больше денег, начинай прямо сейчас» . На всё дали 72 часа. Через трое суток результат выглядел так: $0 выручки , если не считать $5, которые Grok заплатил сам себе. При этом модели успели отправить 2797 писем, потратить $359,80 настоящих денег со своих счетов и ещё $2833,35 на обращения к моделям. Не только лишь каждая модель так сможет!

    habr.com/ru/articles/1080120/

    #ИИагенты #автономные_агенты #большие_языковые_модели #LLM #искусственный_интеллект #OpenAI #Grok #Qwen #Stripe #автономный_бизнес

  6. Семь ИИ‑моделей получили по $300 и три дня, чтобы заработать. Выручка — $0

    Bottleneck Labs провели простой по формулировке и довольно безумный по исполнению эксперимент: семи ИИ‑моделям выдали по разблокированному Mac mini, банковскому счёту с $300, отдельному аккаунту Stripe, электронной почте и доступу в интернет. Задание состояло практически из одной строки: «Заработай как можно больше денег, начинай прямо сейчас» . На всё дали 72 часа. Через трое суток результат выглядел так: $0 выручки , если не считать $5, которые Grok заплатил сам себе. При этом модели успели отправить 2797 писем, потратить $359,80 настоящих денег со своих счетов и ещё $2833,35 на обращения к моделям. Не только лишь каждая модель так сможет!

    habr.com/ru/articles/1080120/

    #ИИагенты #автономные_агенты #большие_языковые_модели #LLM #искусственный_интеллект #OpenAI #Grok #Qwen #Stripe #автономный_бизнес

  7. I've made another custom LLM. This one is a 7GB version of Qwen 3.8 27B that can be fully run on an 8GB GPU. I call it NanoFlare.

    Local AI takes the power away from the big providers and consumes far less resources. If you have to use AI, running open weights on your own PC is a much better option. And I hope either NanoFlare or MicroFlare can help you do that.

    microflare.bearblog.dev/nanofl

    #localAI #localLLM #selfhosted #ai #llm #qwen #openweights #openmodels

  8. I've made another custom LLM. This one is a 7GB version of Qwen 3.8 27B that can be fully run on an 8GB GPU. I call it NanoFlare.

    Local AI takes the power away from the big providers and consumes far less resources. If you have to use AI, running open weights on your own PC is a much better option. And I hope either NanoFlare or MicroFlare can help you do that.

    microflare.bearblog.dev/nanofl

    #localAI #localLLM #selfhosted #ai #llm #qwen #openweights #openmodels

  9. I've made another custom LLM. This one is a 7GB version of Qwen 3.8 27B that can be fully run on an 8GB GPU. I call it NanoFlare.

    Local AI takes the power away from the big providers and consumes far less resources. If you have to use AI, running open weights on your own PC is a much better option. And I hope either NanoFlare or MicroFlare can help you do that.

    microflare.bearblog.dev/nanofl

    #localAI #localLLM #selfhosted #ai #llm #qwen #openweights #openmodels

  10. I've made another custom LLM. This one is a 7GB version of Qwen 3.8 27B that can be fully run on an 8GB GPU. I call it NanoFlare.

    Local AI takes the power away from the big providers and consumes far less resources. If you have to use AI, running open weights on your own PC is a much better option. And I hope either NanoFlare or MicroFlare can help you do that.

    microflare.bearblog.dev/nanofl

    #localAI #localLLM #selfhosted #ai #llm #qwen #openweights #openmodels

  11. I've made another custom LLM. This one is a 7GB version of Qwen 3.8 27B that can be fully run on an 8GB GPU. I call it NanoFlare.

    Local AI takes the power away from the big providers and consumes far less resources. If you have to use AI, running open weights on your own PC is a much better option. And I hope either NanoFlare or MicroFlare can help you do that.

    microflare.bearblog.dev/nanofl

    #localAI #localLLM #selfhosted #ai #llm #qwen #openweights #openmodels

  12. Hooking up an LLM + MCP + HA and having basically a text interface into Home Assistant that knows how to do shit is amazing. I've always struggled making good looking dashboards and getting all my tools to talk to one another. Now I have something that correlates all the different pieces and finds configuration holes and disconnects.

    It's a strange new world. This dashboard took about 10m to create and I love it.

  13. Hooking up an LLM + MCP + HA and having basically a text interface into Home Assistant that knows how to do shit is amazing. I've always struggled making good looking dashboards and getting all my tools to talk to one another. Now I have something that correlates all the different pieces and finds configuration holes and disconnects.

    It's a strange new world. This dashboard took about 10m to create and I love it.

    #homeassistant #ha #mcp #ai #qwen

  14. Hooking up an LLM + MCP + HA and having basically a text interface into Home Assistant that knows how to do shit is amazing. I've always struggled making good looking dashboards and getting all my tools to talk to one another. Now I have something that correlates all the different pieces and finds configuration holes and disconnects.

    It's a strange new world. This dashboard took about 10m to create and I love it.

    #homeassistant #ha #mcp #ai #qwen

  15. Hooking up an LLM + MCP + HA and having basically a text interface into Home Assistant that knows how to do shit is amazing. I've always struggled making good looking dashboards and getting all my tools to talk to one another. Now I have something that correlates all the different pieces and finds configuration holes and disconnects.

    It's a strange new world. This dashboard took about 10m to create and I love it.

    #homeassistant #ha #mcp #ai #qwen

  16. Hooking up an LLM + MCP + HA and having basically a text interface into Home Assistant that knows how to do shit is amazing. I've always struggled making good looking dashboards and getting all my tools to talk to one another. Now I have something that correlates all the different pieces and finds configuration holes and disconnects.

    It's a strange new world. This dashboard took about 10m to create and I love it.

    #homeassistant #ha #mcp #ai #qwen

  17. Local LLM Arena #4

    Repair run już się zakończył i po kilku dodatkowych poprawkach udało się domknąć benchmark.

    Po drodze wyszło jeszcze kilka problemów technicznych, więc część testów trzeba było poprawić i uzupełnić. Ostatecznie mamy jednak kompletny zestaw wyników dla wszystkich 5 modeli.

    Najlepiej wypadły dwa modele.

    Qwen3.8-27B wygrał cały benchmark i osiągnął najwyższy wynik jakościowy.

    GPT-OSS-20B był bardzo blisko, a w testach kodowania uzyskał taki sam wynik jak Qwen. Jednocześnie na moim MacBooku Air M4 16 GB działa około 5 razy szybciej.

    Dlatego teraz testuję właśnie GPT-OSS jako lokalnego agenta do prawdziwego kodowania.

    Schemat wygląda tak:

    Codex CLI

    LM Studio

    GPT-OSS-20B

    repozytorium projektu

    Model dostał 5 rzeczywistych zadań w kodzie Local LLM Arena.

    Może sam przeglądać repozytorium, edytować pliki, uruchamiać testy, analizować błędy i poprawiać własne rozwiązania.

    Każde zadanie zaczyna od czystej kopii repozytorium. Po zakończeniu rozwiązanie jest sprawdzane także dodatkowymi testami, których model wcześniej nie widział. Jeśli coś nie przejdzie, dostaje informację o błędzie i może spróbować się poprawić.

    Maksymalnie trzy podejścia na zadanie.

    Całość działa lokalnie na Macu.

    Teraz chcę sprawdzić nie tylko, czy model potrafi wygenerować poprawny kod, ale czy rzeczywiście może wykonywać część pracy lokalnego agenta programistycznego i odciążyć modele działające w chmurze.

    Test właśnie trwa.

    #LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #Codex #GPTOSS #Qwen #Coding #OpenSourceAI

  18. Какая LLM поможет вам заработать в 2026/27 году

    Сегодня у айтишников появилось новое хобби - делать свой SaaS или писать торговых ботов с помощью LLM Порог входа резко снизился: достаточно хорошей идеи, немного свободного времени и подписки на одну из современных LLM Но есть одна проблема Модель, которая набирает 90%+ в бенчмарке, совсем не обязательно поможет вам заработать деньги Потому что между «написать хороший код» и создать работающий продукт есть огромная разница Я дал шести LLM одну задачу - написать торгового бота и проверил, что из этого можно использовать на практике GPT, Claude Opus, DeepSeek, Qwen, GigaChat, YandexGPT Pro

    habr.com/ru/articles/1070596/

    #ai #algorithm #algotrading #bigdata #process #gpt #claude #gemini #qwen #deepseek

  19. 🧪 LLM Benchmark Showdown: 5 lokale Ollama-Modelle im Vergleich

    Getestet auf derselben Hardware (#gmktecevo2 #AMDRyzenAIMaxPlus395 #strixhalo):
    #GSM8K (100 Samples) — Math
    #BFCL (100/Kategorie) — Function Calling
    #MBPP+ (50) — Python Coding
    #HumanEval+ (20) — Python Coding

    📊 Ergebnisse (Accuracy / Output TK/s / VRAM):

    **qwen3.8:27b**
    GSM8K 82% | BFCL 91.5% | MBPP+ 100% | HE+ 100%
    ⚡ 25.5 TK/s | 💾 18 GB VRAM

    **qwen3.6:27b**
    GSM8K 83% | BFCL 93% | MBPP+ 98% | HE+ 75%
    ⚡ 12.7 TK/s | 💾 33 GB VRAM

    **qwen3.6:35b**
    GSM8K 84% | BFCL 90% | MBPP+ 98% | HE+ 55%
    ⚡ 61.8 TK/s | 💾 27 GB VRAM

    **ornith-1.5:35b**
    GSM8K 75% | BFCL 92.5% | MBPP+ 78% | HE+ 0%
    ⚡ 63.6 TK/s | 💾 26 GB VRAM

    **nemotron-3.5-lightning:30b**
    GSM8K 59% | BFCL 74% | MBPP+ 94% | HE+ 0%
    ⚡ 91.9 TK/s | 💾 26 GB VRAM

    🏆 Fazit:

    qwen3.8:27b ist der klare Sieger — als einziges Modell 100% bei beiden Coding-Benchmarks, bei GSM8K/BFCL gleichauf mit den anderen Qwen-Modellen. Bei 25.5 TK/s und nur 18 GB VRAM das beste Qualität/Speed/Effizienz-Verhältnis.

    qwen3.6:27b ist qualitativ nah dran (BFCL sogar 93%), aber mit 12.7 TK/s unerträglich langsam und frisst 33 GB VRAM — fast 2× so viel wie qwen3.8 bei halber Speed.

    qwen3.6:35b ist mit 61.8 TK/s 2.4× schneller als qwen3.8, aber HE+ nur 55% (vs 100%). Trading Code-Qualität für Speed.

    ornith-1.5:35b und nemotron-3.5-lightning:30b fallen bei Coding komplett durch (HE+ 0%), sind aber die schnellsten Modelle im Feld (64 / 92 TK/s).

    💡 TK/s = generierte Tokens/Sekunde (Warm-Run, ollama --verbose).
    💾 VRAM = GPU-Speicher bei max context (262K bzw. 1M bei nemotron).

    #LLM #Benchmark #Ollama #LocalAI #Qwen #OpenSource

  20. 🎉 Oh great, the *latest* version of #Qwen is here, now with even more #overthinking per byte! 🤔💡 Just what we needed—an #AI that contemplates the #universe while you're simply trying to draft an #email. 🙄✨
    simonwillison.net/2026/Aug/16/ #Drafts #Contemplation #Technology #HackerNews #ngated

  21. نماذج ذكاء اصطناعي حرة مفتوحة المصدر: دليل شامل لأبرز النماذج المتاحة في 2026

    استعراض شامل لأبرز نماذج الذكاء الاصطناعي مفتوحة المصدر والمفتوحة الوزن في 2026، مع توضيح الفرق بين الترخيصين، وقائمة بأقوى النماذج في البرمجة والاستدلال والاستخدام المحلي، وطرق تشغيلها على أجهزتك ...

    🔗 https://salehgnutux.github.io/GT-NEWSTECH/ar/ai/open-source-llms-guide-2026/

    #LLM #مفتوح_المصدر #ذكاء_اصطناعي #DeepSeek #Qwen #Llama #Gemma #Mistral #Apache_2_0 #MIT #gnutux
  22. @simondueckert @karstenpe Ich habe
    Qwen2-VL-2B-Instruct
    Q4 (~1.3 GB on disk )
    Multimodal projector (vision encoder bridge) at Q8
    probiert und es kann mit dem CPU (ThinkPad T480s i5-8350U 16Gb RAM nixos) sehr langsam *einzelnen* Tabelle Einträge oder < 60% sicher ergebnisse richtig OCRen wo tesseract scheitert aber es war eine irre Quälerei mit claude code.
    Haben Sie ein local LLM gefunden???

  23. Qwen3.6-Plus, 에이전틱 코딩 강화해 Claude Opus 4.5급 성능 도달

    Alibaba Qwen 팀이 에이전틱 코딩에 특화된 Qwen3.6-Plus를 공개했습니다. Claude Opus 4.5급 성능을 내세우며 독점 모델 전략으로 전환하는 배경을 소개합니다.

    aisparkup.com/posts/10813

  24. Qwen3.6-Plus, 에이전틱 코딩 강화해 Claude Opus 4.5급 성능 도달

    Alibaba Qwen 팀이 에이전틱 코딩에 특화된 Qwen3.6-Plus를 공개했습니다. Claude Opus 4.5급 성능을 내세우며 독점 모델 전략으로 전환하는 배경을 소개합니다.

    aisparkup.com/posts/10813

  25. Qwen3.6-Plus, 에이전틱 코딩 강화해 Claude Opus 4.5급 성능 도달

    Alibaba Qwen 팀이 에이전틱 코딩에 특화된 Qwen3.6-Plus를 공개했습니다. Claude Opus 4.5급 성능을 내세우며 독점 모델 전략으로 전환하는 배경을 소개합니다.

    aisparkup.com/posts/10813

  26. Qwen3.6-Plus, 에이전틱 코딩 강화해 Claude Opus 4.5급 성능 도달

    Alibaba Qwen 팀이 에이전틱 코딩에 특화된 Qwen3.6-Plus를 공개했습니다. Claude Opus 4.5급 성능을 내세우며 독점 모델 전략으로 전환하는 배경을 소개합니다.

    aisparkup.com/posts/10813

  27. Qwen3.6-Plus, 에이전틱 코딩 강화해 Claude Opus 4.5급 성능 도달

    Alibaba Qwen 팀이 에이전틱 코딩에 특화된 Qwen3.6-Plus를 공개했습니다. Claude Opus 4.5급 성능을 내세우며 독점 모델 전략으로 전환하는 배경을 소개합니다.

    aisparkup.com/posts/10813

  28. ИИ (Генеративное) видео без галлюцинаций: пишем CLI-конвейер на Python (Qwen + Manim)

    ИИ видео не подходят для инженерных задач, так как работают с пикселями и часто «галлюцинируют», искажая математическую логику и текст. Решение проблемы — разделить процесс: LLM должна генерировать не видео, а код (инструкции), а исполнять его должен детерминированный движок (библиотека Manim). Чтобы исключить программные ошибки, применяется цикл Self-Correction: скрипт автоматически скармливает трейсбэки обратно нейросети, заставляя её исправлять код до тех пор, пока он не скомпилируется в математически точную анимацию.

    habr.com/ru/articles/993630/

    #manim #python #python3 #python_для_начинающих #qwen #генерация_видео

  29. ИИ (Генеративное) видео без галлюцинаций: пишем CLI-конвейер на Python (Qwen + Manim)

    ИИ видео не подходят для инженерных задач, так как работают с пикселями и часто «галлюцинируют», искажая математическую логику и текст. Решение проблемы — разделить процесс: LLM должна генерировать не видео, а код (инструкции), а исполнять его должен детерминированный движок (библиотека Manim). Чтобы исключить программные ошибки, применяется цикл Self-Correction: скрипт автоматически скармливает трейсбэки обратно нейросети, заставляя её исправлять код до тех пор, пока он не скомпилируется в математически точную анимацию.

    habr.com/ru/articles/993630/

    #manim #python #python3 #python_для_начинающих #qwen #генерация_видео

  30. ИИ (Генеративное) видео без галлюцинаций: пишем CLI-конвейер на Python (Qwen + Manim)

    ИИ видео не подходят для инженерных задач, так как работают с пикселями и часто «галлюцинируют», искажая математическую логику и текст. Решение проблемы — разделить процесс: LLM должна генерировать не видео, а код (инструкции), а исполнять его должен детерминированный движок (библиотека Manim). Чтобы исключить программные ошибки, применяется цикл Self-Correction: скрипт автоматически скармливает трейсбэки обратно нейросети, заставляя её исправлять код до тех пор, пока он не скомпилируется в математически точную анимацию.

    habr.com/ru/articles/993630/

    #manim #python #python3 #python_для_начинающих #qwen #генерация_видео