home.social

#gguf — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #gguf, aggregated by home.social.

  1. 100% local chat with a GGUF model in your browser using WebAssembly.

    Written in @golang compiled with @TinyGo Now runs in Chrome / Firefox & supports WebGPU when available.

    Try it!
    hybridgroup.github.io/yzma-was

    #golang #wasm #llama #tinygo #yzma #gguf #webgpu

  2. Букмарклет вычисляющий скорость gguf модели в llama.cpp на hf

    С приходом нейросетей теперь можно решать задачи гораздо проще, правда и задачи бы такой не стояло не будь нейросетей и llama.cpp, и huggingface. В общем смысл статьи в том чтобы попытаться математически вычислить теоретическую скорость генерации токенов в программе llama.cpp для моделей на hugginface, просто открыв карточку модели и нажав на закладку (букмарклет). Вот как это выглядит: На самом деле этих калькуляторов полно и много, но почему-то у меня они показывают совсем не то что я вижу в реальности. Опять же, для меня было открытие что я могу на своей RTX3070 8Gb запускать MOE модели до 35 млрд параметров на довольно неплохой скорости, просто потому что нейронки в чатах говорят что все - конец - этого не хватит. Я думаю что они остановились в своем развитии где-то год назад и все еще частенько вспоминают про модели llama или mistral но сейчас то уже не совсем актуально, по крайней мере для использования, может для научных изысканий и нет лучше, не знаю. В общем-то и в этом калькуляторе нет никаких новых идей - просто я прогнал на своем компе несколько моделей, замерил скорость,замерил +- максимально возможный контекст, при котором llama.cpp не вылетает по нехватке памяти и попросил нейронку сделать калькулятор, чтобы он показывал цифры близкие мне, потому что расчетные цифры по контексту нейронка занижала в разы. Мне просто стало интересно почему так - она говорит что максимальный контекст 20 тысяч условно, а смог выжать 70 тысяч - разница в разы.

    habr.com/ru/articles/1076284/

    #llamacpp #llmмодели #gguf

  3. Local LLM Arena #2 — dlaczego akurat te 5 modeli?

    Nie szukam modeli najlepszych „na papierze”. Szukam takich, które realnie da się uruchomić lokalnie na MacBooku M4 z 16 GB Unified Memory i które mogą być przydatne na co dzień.

    Dlatego testuję:

    - Gemma 4 12B — Q4_0, 7.15 GB
    Najmniejszy z zestawu i punkt odniesienia. Sprawdzam, czy mniejszy model może nadrobić szybkością i mniejszym zużyciem pamięci.

    - Ternary Bonsai 27B — MLX 2-bit, 8.49 GB
    Najbardziej nietypowy zawodnik. 27B upakowane dzięki ternary/2-bit. Jego integracja wymagała nawet osobnego mostu MLX w Arenie.

    - GPT-OSS-20B — MXFP4, 11.28 GB
    Jeden z cięższych, ale we wcześniejszych testach zdecydowanie najszybszy. Ciekawe, czy szybkość pójdzie w parze z jakością.

    - Qwen3.8-27B — IQ3_XXS, 10.18 GB
    Największe wyzwanie dla M4 16 GB. Przed benchmarkiem przeszedł osobny test 20 zapytań. Pamięć dochodziła do ~15.3 GB i pojawiał się swap, ale bez dalszego narastania. Wynik: STABLE_WITH_SWAP.

    - Mistral Small 3.2 24B — IQ3_XXS, 8.76 GB
    Mocniejsza quantyzacja była świadomym wyborem, żeby pozostawić miejsce dla KV cache i macOS.

    I właśnie o to chodzi w eksperymencie.

    Nie porównuję idealnych modeli na serwerze. Porównuję kompromisy:

    parametry, quantyzacja, jakość, szybkość a pamięć

    na zwykłym laptopie.

    Może wygrać 27B. Ale może się też okazać, że do codziennej pracy znacznie lepszy będzie szybszy 12B lub 20B.

    Obecnie trwa pełny benchmark: 180 zadań — 36 dla każdego modelu.

    #LocalLLM #LLM #AI #MLX #GGUF #AppleSilicon #SelfHosted

  4. Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток/сек на двух RTX 3090

    Плотная 27-миллиардная модель на двух RTX 3090 в llama.cpp из коробки даёт 32 токена в секунду. Интуитивно понятно, что это не предел: две карты по 24 ГБ и 936 ГБ/с каждая не должны выдавать столько, сколько выдаёт одна. Значит, где-то узкое горлышко — и надо разобраться, что и где подкрутить. Горлышек оказалось несколько, и все снимаются флагами запуска: те же веса — 75 токенов в секунду. Под катом каждый флаг описан по одной схеме: зачем, что писать, что даёт в цифрах, где ломается и с какой строкой в логе. В конце — готовый docker run , три проверки после каждой смены флага и список того, что не сработало. Текст можно отдать целиком агенту с доступом к серверу — это инструкция, а не история.

    habr.com/ru/articles/1076080/

    #llm #ai #llamacpp #qwen #qwen38 #gguf #квантование #локальные_нейросети #локальные_модели

  5. RT @TeksEdge: 🤯 Einfach nur erstaunlich. Das Qwen-Team denkt voraus! … ein 177B-Qwen-Modell kann jetzt lokal mit CPU-RAM ausgeführt werden, OHNE GPU-VRAM?! 👈

    mehr auf Arint.info

    #AI #GGUF #LLM #MachineLearning #Qwen #Unsloth #arint_info

    https://x.com/TeksEdge/status/2092646162176291025

  6. RT @UnslothAI: Wir veröffentlichen neue Qwen3.8-27B GGUFs mit 10 % höherer Genauigkeit. Unsloth Dynamic V3 schlägt andere um 10 % auf Div-300, KLD und weiteren Benchmarks. Zudem veröffentlichen wir 1-Bit-Quantisierungen, die 77 % der Genauigkeit beibehalten. Läuft auf 8 GB RAM. Blog: unsloth.ai/docs/basics/dynam… GGUF: huggingface.co/unsloth/Qwen3…

    mehr auf Arint.info

    #AI #GGUF #MachineLearning #OpenSource #Qwen3 #Unsloth #arint_info

    https://x.com/UnslothAI/status/2090103470015828184

  7. Возвращение короля: разбираемся, что такое Qwen3.8 27B

    14 августа 2026 года, 15:00 UTC. CEO Anthropic Дарио Амодей срочно созвал заседание. Экс-глава Apple Тим Кук пожалел, что встроил в айфоны облачную Gemini, так и не дождавшись локальной модели нужного уровня. Где-то в датацентрах Alibaba щёлкнул рубильник, на Hugging Face слетел обратный отсчёт, и в мир вышла Qwen3.8-27B – новая dense-модель на 27 миллиардов параметров, которую даже прозвали «локальным Opus’ом», поскольку она позиционируется как одно из самых мощных открытых решений для локальной генерации. Ждали её всем миром: обратный отсчёт на huggingface, первые пиксельные пеликаны на великах – всё как положено. Если вкратце , это открытая (Apache 2.0) мультимодальная модель, которая понимает текст, картинки и видео, влезает в одну ооочень мощную домашнюю видеокарту, а временами по бенчмаркам обгоняет закрытые облачные модели уровня Claude Opus 4.6. Если не вкратце – читайте дальше, потому что там есть и триумф, и зависания на 49 минут раздумий!

    habr.com/ru/companies/gptunnel

    #Qwen38_27B #Alibaba #плотные_модели #опенсурс #Apache_20 #GGUF #Claude_Opus #Hugging_Face

  8. Всё, что вы хотели знать о локальном ИИ, но стеснялись спросить

    Если вы когда-нибудь смотрели на HF и не понимали, что такое DFlash, квантизация и почему одна и та же модель лежит в десяти репозиториях от десяти разных людей — или давно собирались поднять LLM у себя, но всё не находили повода — выход Muse Glimmer 30B буквально лучший момент начать. Буквально со своего MacBook Air. Ага, да вот уже сейчас прямо. Погрузиться в мир локальных моделей

    habr.com/ru/articles/1069422/

    #llm #локальные_модели #квантизация #llamacpp #apple_silicon #gguf #инференс #moe #meta

  9. RT @UnslothAI: DeepSeek-V4-Flash kann jetzt mit DSpark 2× schneller lokal ausgeführt werden! ⚡️ DSpark ermöglicht es V4-Flash-0731 GGUFs, ~1,4–2× schneller zu generieren, ohne Genauigkeitsverlust. DeepSeek-V4-Flash-0731 erreicht bis zu 120 Token/s. GGUFs: huggingface.co/unsloth/DeepSee Anleitung: unsloth.ai/docs/models/deepsee

    mehr auf Arint.info

    #AI #DeepSeek #GGUF #MachineLearning #OpenSource #Unsloth #arint_info

    https://x.com/UnslothAI/status/2085368138393329703#m

  10. Как я ужал русский эмбеддер до 24 млн параметров — и чуть не испортил его одной цифрой

    TL;DR. У меня локальный RAG на AMD Strix Halo. Памяти там достаточно, но вычислительно всё упирается в один iGPU: его делят эмбеддер, реранкер и периодическая переиндексация, а в одноузловой конфигурации туда же встаёт генеративная LLM. Поэтому мне понадобился не самый точный retriever вообще, а максимально лёгкий русский retriever, который быстрее завершает первую стадию поиска на том же GPU. Насколько это больно, я в итоге померил на живом узле. На синтетической индексирующей нагрузке полной тяги bge‑m3 снизил generation throughput Qwen3.6-35B-A3B на 92%, STRIZH на 28% при примерно 12,6-кратном темпе индексации (окна замера там неравные, 20,6 против 173,6 секунды, потому что задаются временем пяти генераций; равнооконный прогон RAG‑конвейера ниже даёт по батчам в секунду 9,4-кратный отрыв). В полном RAG‑конвейере с четырьмя пользовательскими потоками и фоновой индексацией STRIZH удержал 14,0 транзакции в минуту против 6,0 у bge‑m3 и индексировал 46 батчей в секунду против 4,9. При фиксированных 200 онлайн‑запросах в секунду генерация проседала на 2% со STRIZH и на 7% с bge‑m3. Оговорка сразу: без фоновой индексации STRIZH преимущества не показал : в этом профиле bge‑m3 оказался немного быстрее, а пропускную способность определяли реранк (0,6–0,7 с на транзакцию), prefill и генерация. Я взял 12-слойный RuModernBERT-small , сначала неудачно попытался повторить пространство большого учителя через MSE, затем обучил retrieval‑донор на контрастивной задаче, выбрал из него четыре слоя [0, 5, 9, 11] и доучил student на русских, английских и смешанных парах с hard negatives от BGE‑M3.

    habr.com/ru/articles/1064138/

    #эмбеддинги #RAG #retrieval #энкодеры #RuModernBERT #STRIZH #llamacpp #GGUF #Vulkan #Strix_Halo

  11. Как мы запустили Ornith‑35B на ноутбуке с 8 ГБ VRAM и разогнали её до 99 ток/с на AMD Strix Halo

    Ornith‑1.0‑35B обошла Qwen3.5‑397B в Terminal‑Bench, а на нашем локальном срезе хорошо показала себя в агентном кодинге. Мы решили проверить, насколько быстрее она сможет работать на AMD Strix Halo с пропускной способностью памяти до 256 ГБ/с. В статье — результаты экспериментов с Vulkan, MTP, селективной квантизацией и n‑gram reuse: что не дало прироста, как удалось получить 99 ток/с без потери качества и каким способом 35B‑модель запустилась на Windows‑ноутбуке с 8 ГБ VRAM.

    habr.com/ru/articles/1060632/

    #llamacpp #Vulkan #AMD_Strix_Halo #Ornith #MoE #MTP #speculative_decoding #GGUF #LM_Studio #локальные_LLM