home.social

#qwen — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #qwen, aggregated by home.social.

fetched live
  1. More #LocalLLM test results:

    #Qwen 3.6 #35B A3B #mmproj on description of foto collection. 2x12GB VRAM (at ~50-60t/s):

    * ca 8800 fotos, 88 GB
    * almost flawlessly accurate scene descriptions
    * perfectly usable for search/retrieval by keywords

    Attached is 1 example, describing the "Papiergießkanne"

    wow.
    Ran at ~250 W for ~10h.

    I get ~25kWh on a sunny day from my roof. 🌄

  2. So I switched from #PicoClaw to #Hermes_agent. Really cool improvement also that I can define different LLMs for different tasks.

    Now my Triage Tasks are done by #Gemma-4-26B-A4B and my main tasks are done by #Qwen-3.8-27B-NVFP4.

    Makes everything much faster and still reliable. Both models co-exist on my #DGXSpark

  3. Свой инференс для 25 разработчиков: 452:1, KV‑пул и почему это не экономит денег

    Для тех, кто держит или собирается держать LLM внутри контура: тимлидов, DevOps, архитекторов. Здесь конфиги, цифры и грабли, а не введение в трансформеры. Что вы унесёте: историю пяти последовательных конфигураций с тем, что каждая дала и чего стоила; рабочий набор флагов vLLM под одну карту Blackwell; три неочевидных бага и обходы; разбор реального счёта с отношением вход/выход 452:1. Главный вывод, если дальше читать некогда: на агентской нагрузке кэш префикса решает больше, чем выбор модели, размер карты и всё остальное вместе взятое. Мы шли к этому через четыре промежуточных стенда и потратили лишние месяцы, потому что не понимали, что именно меряем.

    habr.com/ru/articles/1073300/

    #vLLM #LiteLLM #prefix_caching #KVcache #локальные_LLM #инференс_LLM #Qwen #агентская_разработка #RTX_PRO_6000 #claude

  4. RT @ivanfioravanti: Die einzige Möglichkeit, Qwen 3.8 27B zu nutzen, ist mit reasoninglevel low; alles andere, einschließlich medium, denkt wirklich zu viel.

    mehr auf Arint.info

    #AI #KI #LLM #MachineLearning #Qwen #Tech #arint_info

    https://x.com/ivanfioravanti/status/2090100203537740099

  5. I ran my usual quick speed check on muse-glimmer:30b and qwen3.8:27b in Ollama with a quick “what are your capabilities?”

    Output speed:
    * muse-glimmer:30b
    * eval rate: 1.85 tokens/s

    * qwen3.8:27b
    * eval rate: 1.42 tokens/s

    Two observations:
    1. Muse-Glimmer doesn't say anything about its coding abilities, while Qwen devotes a whole paragraph to it.
    2. Qwen's output is very bursty due to its use of Multi-Token Prediction (MTP).

    #AI #LLM #Qwen #LocalLLM #VibeCoding #Programming #Coding

  6. FWIW, After trying #Qwen 3.8 Q4_K_M for real work, I'm going back to Qwen 3.6 MTP.

    Inference is just WAY too slow.

    I got the same work done with 3.6 MTP in less than 10% of the time.

    Probably its the config, but the recommended configs on #unsloth are very wrong and because of the extreme time it takes to go through one iteration of failure, I don't have time to figure it out.

    I'll wait for a month until they come up with an update (like 3.6 MTP).

    Details matter, feel free to query me.

    #AI

  7. Мой опыт с Hermes Agent — ненависть, любовь, ненависть, любовь

    Началось все с установки. Я пошёл почти по самому простому пути - установил его на Mac, в Docker. Потому что это агент, который работает автономно и так же автономно может сделать атата: выполнить rm -rf или выбраться из клетки и начать всё взламывать :) В рамках настройки я сразу выдал доступ к части файлов только на чтение, и только к Obsidian - на чтение и запись (потому что писать он в данном случае должен), но файлы были под Git.

    habr.com/ru/articles/1072770/

    #hermes_agent #aiагенты #llm #локальный_llm #локальные_модели #qwen #agentic_workflows #ai_automation #workflow #go

  8. Testing #localLLM for #DLTP on my #longterm #preservation #object identifier schema of "CFIDs":

    Collision Friendly IDentifiers.

    A mere 30 MB list of auto-generated CFIDs was enough for #qwen to tell you this much about the test collection!!! 🤯 🤩 - this is powerful. Be careful.

    AND: My IDs work! so beautiful! #ahalodeck

    github.com/ArkThis/AHAlodeck/b

  9. [Перевод] Qwen3.8-27B: лучший локальный LLM, который вы, вероятно, не сможете запустить

    В этом месяце Alibaba выпустила две модели, и та, о которой все писали, оказалась не той, что мы ждали. Qwen3.8-Max — это API с 2,4 триллионами параметров, и пару недель назад я с большим энтузиазмом написал о ней обзор. Но релиз, которого я действительно ждал, вышел 14 августа: Qwen3.8-27B, Apache 2.0, веса на Hugging Face, модель достаточно компактна, чтобы работать на ноутбуке. Я должен кое в чем признаться. Я не провел полный тест этой модели. Я попробовал, на своем MacBook Air M4 получал около восьми токенов в секунду и потерял терпение где-то на втором запросе. По большей части этот пост посвящен именно моей неудаче, потому что я подозреваю, что у многих из вас вечер сложится так же, как у меня. Что представляет собой Qwen3.8-27B на самом деле 27,78 миллиарда параметров, плотная модель, включающая в себя визуальный энкодер, о котором никто не объявлял заранее. Принимает на вход текст, изображения и видео. Собственный контекст — 262 144 токена, с помощью YaRN можно увеличить его примерно до миллиона, если запускать модель на сервере. Архитектура — это по-настоящему интересная часть, и это не обычный трансформер. На протяжении 64 слоёв Qwen чередует 48 слоёв Gated DeltaNet (линейное внимание) с 16 полными слоями Gated Attention в соотношении 3:1. Только эти 16 слоёв с полным вниманием имеют KV-кэш. Таким образом, на каждый токен приходится около 64 КБ, что составляет примерно четверть от объёма памяти, необходимого для обычной 64-слойной модели с плотным кодированием. Если вы запомните только одно число из этого поста, пусть это будет именно оно. Всё, что касается того, поместится ли эта модель на вашем компьютере, зависит от объёма KV-кэша.

    habr.com/ru/articles/1072048/

    #qwen #llm #quantization #apple_silicon #lmstudio #ollama

  10. @peter every time Chinese open-weights model shock the world with a new release USA ai labs try to regain media’s attention.

    artificialanalysis.ai/models/q

    #qwen #llm #openweights

  11. Der nächste DeepSeek-Moment läuft lokal auf dem PC. Qwen 3.8 27B erreicht im Intelligence Index mit 52 Punkten das Niveau von GPT-5.6 Luna. Im Agentic Index schlägt es sogar GPT-5.4. Und für die Forschung gibt es eine komplett unzensierte MLX-Version.

    #Qwen #OpenSourceAI #LocalAI #LLM #AIGeneratedImage

    all-ai.de/news/news26top/top-k

  12. #Qwen 3.8 27B, a 27B parameter vision-capable LLM from #Alibaba, shows impressive self-reported benchmarks. However, its default reasoning effort setting, “xhigh,” leads to excessive overthinking, resulting in slow #performance and unnecessary #complexity for simple tasks. Despite this, the model demonstrates strong capabilities in bounding box generation and driving #codingagents, with potential for improved speed through optimisations. simonwillison.net/2026/Aug/16/ #tech #news #ainews