home.social

#gguf — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #gguf, aggregated by home.social.

  1. 100% local chat with a GGUF model in your browser using WebAssembly.

    Written in @golang compiled with @TinyGo Now runs in Chrome / Firefox & supports WebGPU when available.

    Try it!
    hybridgroup.github.io/yzma-was

    #golang #wasm #llama #tinygo #yzma #gguf #webgpu

  2. Local LLM Arena #2 — dlaczego akurat te 5 modeli?

    Nie szukam modeli najlepszych „na papierze”. Szukam takich, które realnie da się uruchomić lokalnie na MacBooku M4 z 16 GB Unified Memory i które mogą być przydatne na co dzień.

    Dlatego testuję:

    - Gemma 4 12B — Q4_0, 7.15 GB
    Najmniejszy z zestawu i punkt odniesienia. Sprawdzam, czy mniejszy model może nadrobić szybkością i mniejszym zużyciem pamięci.

    - Ternary Bonsai 27B — MLX 2-bit, 8.49 GB
    Najbardziej nietypowy zawodnik. 27B upakowane dzięki ternary/2-bit. Jego integracja wymagała nawet osobnego mostu MLX w Arenie.

    - GPT-OSS-20B — MXFP4, 11.28 GB
    Jeden z cięższych, ale we wcześniejszych testach zdecydowanie najszybszy. Ciekawe, czy szybkość pójdzie w parze z jakością.

    - Qwen3.8-27B — IQ3_XXS, 10.18 GB
    Największe wyzwanie dla M4 16 GB. Przed benchmarkiem przeszedł osobny test 20 zapytań. Pamięć dochodziła do ~15.3 GB i pojawiał się swap, ale bez dalszego narastania. Wynik: STABLE_WITH_SWAP.

    - Mistral Small 3.2 24B — IQ3_XXS, 8.76 GB
    Mocniejsza quantyzacja była świadomym wyborem, żeby pozostawić miejsce dla KV cache i macOS.

    I właśnie o to chodzi w eksperymencie.

    Nie porównuję idealnych modeli na serwerze. Porównuję kompromisy:

    parametry, quantyzacja, jakość, szybkość a pamięć

    na zwykłym laptopie.

    Może wygrać 27B. Ale może się też okazać, że do codziennej pracy znacznie lepszy będzie szybszy 12B lub 20B.

    Obecnie trwa pełny benchmark: 180 zadań — 36 dla każdego modelu.

    #LocalLLM #LLM #AI #MLX #GGUF #AppleSilicon #SelfHosted

  3. Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток/сек на двух RTX 3090

    Плотная 27-миллиардная модель на двух RTX 3090 в llama.cpp из коробки даёт 32 токена в секунду. Интуитивно понятно, что это не предел: две карты по 24 ГБ и 936 ГБ/с каждая не должны выдавать столько, сколько выдаёт одна. Значит, где-то узкое горлышко — и надо разобраться, что и где подкрутить. Горлышек оказалось несколько, и все снимаются флагами запуска: те же веса — 75 токенов в секунду. Под катом каждый флаг описан по одной схеме: зачем, что писать, что даёт в цифрах, где ломается и с какой строкой в логе. В конце — готовый docker run , три проверки после каждой смены флага и список того, что не сработало. Текст можно отдать целиком агенту с доступом к серверу — это инструкция, а не история.

    habr.com/ru/articles/1076080/

    #llm #ai #llamacpp #qwen #qwen38 #gguf #квантование #локальные_нейросети #локальные_модели

  4. RT @UnslothAI: Wir veröffentlichen neue Qwen3.8-27B GGUFs mit 10 % höherer Genauigkeit. Unsloth Dynamic V3 schlägt andere um 10 % auf Div-300, KLD und weiteren Benchmarks. Zudem veröffentlichen wir 1-Bit-Quantisierungen, die 77 % der Genauigkeit beibehalten. Läuft auf 8 GB RAM. Blog: unsloth.ai/docs/basics/dynam… GGUF: huggingface.co/unsloth/Qwen3…

    mehr auf Arint.info

    #AI #GGUF #MachineLearning #OpenSource #Qwen3 #Unsloth #arint_info

    https://x.com/UnslothAI/status/2090103470015828184

  5. 🎯 #OuteTTS introduces a novel approach to text-to-speech synthesis using pure #languagemodeling
    🔧 Built on #LLaMa architecture with just 350M parameters, featuring:

    Zero-shot #voicecloning capability
    Integration with #WavTokenizer (75 tokens/sec)
    Local deployment via #llamacpp
    #GGUF format compatibility

    🔍 Technical Implementation:

    Audio tokenization process
    CTC forced alignment
    Structured prompt system
    Temperature-adjustable outputs

    ⚠️ Current Limitations:

    Limited vocabulary range
    String-only input support
    Best performance with shorter sentences
    Variable temperature sensitivity

    github.com/edwko/OuteTTS
    huggingface.co/OuteAI/OuteTTS-