#gguf — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #gguf, aggregated by home.social.
-
RT @UnslothAI: Du kannst jetzt Unsloth GGUFs lokal mit einem einzigen Klick über Hermes ausführen! ✨
mehr auf Arint.info
-
RT @UnslothAI: Du kannst jetzt Unsloth GGUFs lokal mit einem einzigen Klick über Hermes ausführen! ✨
mehr auf Arint.info
-
RT @UnslothAI: Du kannst jetzt Unsloth GGUFs lokal mit einem einzigen Klick über Hermes ausführen! ✨
mehr auf Arint.info
-
100% local chat with a GGUF model in your browser using WebAssembly.
Written in @golang compiled with @TinyGo Now runs in Chrome / Firefox & supports WebGPU when available.
-
Local LLM Arena #2 — dlaczego akurat te 5 modeli?
Nie szukam modeli najlepszych „na papierze”. Szukam takich, które realnie da się uruchomić lokalnie na MacBooku M4 z 16 GB Unified Memory i które mogą być przydatne na co dzień.
Dlatego testuję:
- Gemma 4 12B — Q4_0, 7.15 GB
Najmniejszy z zestawu i punkt odniesienia. Sprawdzam, czy mniejszy model może nadrobić szybkością i mniejszym zużyciem pamięci.- Ternary Bonsai 27B — MLX 2-bit, 8.49 GB
Najbardziej nietypowy zawodnik. 27B upakowane dzięki ternary/2-bit. Jego integracja wymagała nawet osobnego mostu MLX w Arenie.- GPT-OSS-20B — MXFP4, 11.28 GB
Jeden z cięższych, ale we wcześniejszych testach zdecydowanie najszybszy. Ciekawe, czy szybkość pójdzie w parze z jakością.- Qwen3.8-27B — IQ3_XXS, 10.18 GB
Największe wyzwanie dla M4 16 GB. Przed benchmarkiem przeszedł osobny test 20 zapytań. Pamięć dochodziła do ~15.3 GB i pojawiał się swap, ale bez dalszego narastania. Wynik: STABLE_WITH_SWAP.- Mistral Small 3.2 24B — IQ3_XXS, 8.76 GB
Mocniejsza quantyzacja była świadomym wyborem, żeby pozostawić miejsce dla KV cache i macOS.I właśnie o to chodzi w eksperymencie.
Nie porównuję idealnych modeli na serwerze. Porównuję kompromisy:
parametry, quantyzacja, jakość, szybkość a pamięć
na zwykłym laptopie.
Może wygrać 27B. Ale może się też okazać, że do codziennej pracy znacznie lepszy będzie szybszy 12B lub 20B.
Obecnie trwa pełny benchmark: 180 zadań — 36 dla każdego modelu.
-
Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток/сек на двух RTX 3090
Плотная 27-миллиардная модель на двух RTX 3090 в llama.cpp из коробки даёт 32 токена в секунду. Интуитивно понятно, что это не предел: две карты по 24 ГБ и 936 ГБ/с каждая не должны выдавать столько, сколько выдаёт одна. Значит, где-то узкое горлышко — и надо разобраться, что и где подкрутить. Горлышек оказалось несколько, и все снимаются флагами запуска: те же веса — 75 токенов в секунду. Под катом каждый флаг описан по одной схеме: зачем, что писать, что даёт в цифрах, где ломается и с какой строкой в логе. В конце — готовый docker run , три проверки после каждой смены флага и список того, что не сработало. Текст можно отдать целиком агенту с доступом к серверу — это инструкция, а не история.
https://habr.com/ru/articles/1076080/
#llm #ai #llamacpp #qwen #qwen38 #gguf #квантование #локальные_нейросети #локальные_модели
-
RT @UnslothAI: Wir veröffentlichen neue Qwen3.8-27B GGUFs mit 10 % höherer Genauigkeit. Unsloth Dynamic V3 schlägt andere um 10 % auf Div-300, KLD und weiteren Benchmarks. Zudem veröffentlichen wir 1-Bit-Quantisierungen, die 77 % der Genauigkeit beibehalten. Läuft auf 8 GB RAM. Blog: unsloth.ai/docs/basics/dynam… GGUF: huggingface.co/unsloth/Qwen3…
mehr auf Arint.info
#AI #GGUF #MachineLearning #OpenSource #Qwen3 #Unsloth #arint_info
-
🎯 #OuteTTS introduces a novel approach to text-to-speech synthesis using pure #languagemodeling
🔧 Built on #LLaMa architecture with just 350M parameters, featuring:Zero-shot #voicecloning capability
Integration with #WavTokenizer (75 tokens/sec)
Local deployment via #llamacpp
#GGUF format compatibility🔍 Technical Implementation:
Audio tokenization process
CTC forced alignment
Structured prompt system
Temperature-adjustable outputs⚠️ Current Limitations:
Limited vocabulary range
String-only input support
Best performance with shorter sentences
Variable temperature sensitivityhttps://github.com/edwko/OuteTTS
https://huggingface.co/OuteAI/OuteTTS-0.1-350M