home.social

#qwen — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #qwen, aggregated by home.social.

  1. KI-Modelle als Werkzeug für Angriffe auf Behörden und Bildungseinrichtungen in Asien

    Sprachmodelle übernehmen Koordinationsaufgaben, während die eigentliche Ausnutzung von Schwachstellen weiterhin auf klassischen Methoden beruht – öffentlich verfügbarem Exploit-Code, gestohlenen Zugangsdaten, Webshells und selbst entwickelter Schadsoftware.

    all-about-security.de/ki-model

    #hacker #deepseek #claude #qwen #kimodelle #kiagenten #itsicherheit #itsecurity #cybersecurity

  2. 🧪 LLM Benchmark Showdown: 5 lokale Ollama-Modelle im Vergleich

    Getestet auf derselben Hardware (#gmktecevo2 #AMDRyzenAIMaxPlus395 #strixhalo):
    #GSM8K (100 Samples) — Math
    #BFCL (100/Kategorie) — Function Calling
    #MBPP+ (50) — Python Coding
    #HumanEval+ (20) — Python Coding

    📊 Ergebnisse (Accuracy / Output TK/s / VRAM):

    **qwen3.8:27b**
    GSM8K 82% | BFCL 91.5% | MBPP+ 100% | HE+ 100%
    ⚡ 25.5 TK/s | 💾 18 GB VRAM

    **qwen3.6:27b**
    GSM8K 83% | BFCL 93% | MBPP+ 98% | HE+ 75%
    ⚡ 12.7 TK/s | 💾 33 GB VRAM

    **qwen3.6:35b**
    GSM8K 84% | BFCL 90% | MBPP+ 98% | HE+ 55%
    ⚡ 61.8 TK/s | 💾 27 GB VRAM

    **ornith-1.5:35b**
    GSM8K 75% | BFCL 92.5% | MBPP+ 78% | HE+ 0%
    ⚡ 63.6 TK/s | 💾 26 GB VRAM

    **nemotron-3.5-lightning:30b**
    GSM8K 59% | BFCL 74% | MBPP+ 94% | HE+ 0%
    ⚡ 91.9 TK/s | 💾 26 GB VRAM

    🏆 Fazit:

    qwen3.8:27b ist der klare Sieger — als einziges Modell 100% bei beiden Coding-Benchmarks, bei GSM8K/BFCL gleichauf mit den anderen Qwen-Modellen. Bei 25.5 TK/s und nur 18 GB VRAM das beste Qualität/Speed/Effizienz-Verhältnis.

    qwen3.6:27b ist qualitativ nah dran (BFCL sogar 93%), aber mit 12.7 TK/s unerträglich langsam und frisst 33 GB VRAM — fast 2× so viel wie qwen3.8 bei halber Speed.

    qwen3.6:35b ist mit 61.8 TK/s 2.4× schneller als qwen3.8, aber HE+ nur 55% (vs 100%). Trading Code-Qualität für Speed.

    ornith-1.5:35b und nemotron-3.5-lightning:30b fallen bei Coding komplett durch (HE+ 0%), sind aber die schnellsten Modelle im Feld (64 / 92 TK/s).

    💡 TK/s = generierte Tokens/Sekunde (Warm-Run, ollama --verbose).
    💾 VRAM = GPU-Speicher bei max context (262K bzw. 1M bei nemotron).

    #LLM #Benchmark #Ollama #LocalAI #Qwen #OpenSource

  3. [Перевод] Qwen3.8-27B: лучший локальный LLM, который вы, вероятно, не сможете запустить

    В этом месяце Alibaba выпустила две модели, и та, о которой все писали, оказалась не той, что мы ждали. Qwen3.8-Max — это API с 2,4 триллионами параметров, и пару недель назад я с большим энтузиазмом написал о ней обзор. Но релиз, которого я действительно ждал, вышел 14 августа: Qwen3.8-27B, Apache 2.0, веса на Hugging Face, модель достаточно компактна, чтобы работать на ноутбуке. Я должен кое в чем признаться. Я не провел полный тест этой модели. Я попробовал, на своем MacBook Air M4 получал около восьми токенов в секунду и потерял терпение где-то на втором запросе. По большей части этот пост посвящен именно моей неудаче, потому что я подозреваю, что у многих из вас вечер сложится так же, как у меня. Что представляет собой Qwen3.8-27B на самом деле 27,78 миллиарда параметров, плотная модель, включающая в себя визуальный энкодер, о котором никто не объявлял заранее. Принимает на вход текст, изображения и видео. Собственный контекст — 262 144 токена, с помощью YaRN можно увеличить его примерно до миллиона, если запускать модель на сервере. Архитектура — это по-настоящему интересная часть, и это не обычный трансформер. На протяжении 64 слоёв Qwen чередует 48 слоёв Gated DeltaNet (линейное внимание) с 16 полными слоями Gated Attention в соотношении 3:1. Только эти 16 слоёв с полным вниманием имеют KV-кэш. Таким образом, на каждый токен приходится около 64 КБ, что составляет примерно четверть от объёма памяти, необходимого для обычной 64-слойной модели с плотным кодированием. Если вы запомните только одно число из этого поста, пусть это будет именно оно. Всё, что касается того, поместится ли эта модель на вашем компьютере, зависит от объёма KV-кэша.

    habr.com/ru/articles/1072048/

    #qwen #llm #quantization #apple_silicon #lmstudio #ollama

  4. @simondueckert @karstenpe Ich habe
    Qwen2-VL-2B-Instruct
    Q4 (~1.3 GB on disk )
    Multimodal projector (vision encoder bridge) at Q8
    probiert und es kann mit dem CPU (ThinkPad T480s i5-8350U 16Gb RAM nixos) sehr langsam *einzelnen* Tabelle Einträge oder < 60% sicher ergebnisse richtig OCRen wo tesseract scheitert aber es war eine irre Quälerei mit claude code.
    Haben Sie ein local LLM gefunden???

  5. Какая LLM лучше распознает чертежи? Мы сравнили 6 LLM и узнали ответ

    Инженерные чертежи содержат десятки типов размеров и допусков: линейные и угловые, радиальные и диаметральные, справочные и базовые, а также геометрические характеристики вроде плоскостности или перпендикулярности. Для инженера это привычный язык, но для автоматической обработки такие документы представляют серьёзную задачу. С появлением мультимодальных LLM возник вопрос: способны ли они заменить классические OCR-решения и специализированные пайплайны постобработки? Насколько хорошо современные модели справляются с извлечением размеров и допусков из коробки, без дообучения? Какие модели дают максимальную точность, какие быстрее, а какие дешевле? И можно ли комбинировать разные подходы, чтобы повысить результат? Чтобы ответить на эти вопросы, мы протестировали шесть актуальных vision-LLM на одном наборе реальных механических чертежей и сравнили их точность, скорость и стоимость обработки.

    habr.com/ru/articles/946080/

    #llmмодели #chatgpt4 #chatgpt5 #claudeopus4 #gemini_flash #gemini_pro #qwen #языковые_модели #чертежи #обработка_изображений