#gguf — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #gguf, aggregated by home.social.
-
RT @UnslothAI: Du kannst jetzt Unsloth GGUFs lokal mit einem einzigen Klick über Hermes ausführen! ✨
mehr auf Arint.info
-
RT @UnslothAI: Du kannst jetzt Unsloth GGUFs lokal mit einem einzigen Klick über Hermes ausführen! ✨
mehr auf Arint.info
-
RT @UnslothAI: Du kannst jetzt Unsloth GGUFs lokal mit einem einzigen Klick über Hermes ausführen! ✨
mehr auf Arint.info
-
Local LLM Arena #2 — dlaczego akurat te 5 modeli?
Nie szukam modeli najlepszych „na papierze”. Szukam takich, które realnie da się uruchomić lokalnie na MacBooku M4 z 16 GB Unified Memory i które mogą być przydatne na co dzień.
Dlatego testuję:
- Gemma 4 12B — Q4_0, 7.15 GB
Najmniejszy z zestawu i punkt odniesienia. Sprawdzam, czy mniejszy model może nadrobić szybkością i mniejszym zużyciem pamięci.- Ternary Bonsai 27B — MLX 2-bit, 8.49 GB
Najbardziej nietypowy zawodnik. 27B upakowane dzięki ternary/2-bit. Jego integracja wymagała nawet osobnego mostu MLX w Arenie.- GPT-OSS-20B — MXFP4, 11.28 GB
Jeden z cięższych, ale we wcześniejszych testach zdecydowanie najszybszy. Ciekawe, czy szybkość pójdzie w parze z jakością.- Qwen3.8-27B — IQ3_XXS, 10.18 GB
Największe wyzwanie dla M4 16 GB. Przed benchmarkiem przeszedł osobny test 20 zapytań. Pamięć dochodziła do ~15.3 GB i pojawiał się swap, ale bez dalszego narastania. Wynik: STABLE_WITH_SWAP.- Mistral Small 3.2 24B — IQ3_XXS, 8.76 GB
Mocniejsza quantyzacja była świadomym wyborem, żeby pozostawić miejsce dla KV cache i macOS.I właśnie o to chodzi w eksperymencie.
Nie porównuję idealnych modeli na serwerze. Porównuję kompromisy:
parametry, quantyzacja, jakość, szybkość a pamięć
na zwykłym laptopie.
Może wygrać 27B. Ale może się też okazać, że do codziennej pracy znacznie lepszy będzie szybszy 12B lub 20B.
Obecnie trwa pełny benchmark: 180 zadań — 36 dla każdego modelu.
-
Возвращение короля: разбираемся, что такое Qwen3.8 27B
14 августа 2026 года, 15:00 UTC. CEO Anthropic Дарио Амодей срочно созвал заседание. Экс-глава Apple Тим Кук пожалел, что встроил в айфоны облачную Gemini, так и не дождавшись локальной модели нужного уровня. Где-то в датацентрах Alibaba щёлкнул рубильник, на Hugging Face слетел обратный отсчёт, и в мир вышла Qwen3.8-27B – новая dense-модель на 27 миллиардов параметров, которую даже прозвали «локальным Opus’ом», поскольку она позиционируется как одно из самых мощных открытых решений для локальной генерации. Ждали её всем миром: обратный отсчёт на huggingface, первые пиксельные пеликаны на великах – всё как положено. Если вкратце , это открытая (Apache 2.0) мультимодальная модель, которая понимает текст, картинки и видео, влезает в одну ооочень мощную домашнюю видеокарту, а временами по бенчмаркам обгоняет закрытые облачные модели уровня Claude Opus 4.6. Если не вкратце – читайте дальше, потому что там есть и триумф, и зависания на 49 минут раздумий!
https://habr.com/ru/companies/gptunnel/articles/1071272/
#Qwen38_27B #Alibaba #плотные_модели #опенсурс #Apache_20 #GGUF #Claude_Opus #Hugging_Face
-
Всё, что вы хотели знать о локальном ИИ, но стеснялись спросить
Если вы когда-нибудь смотрели на HF и не понимали, что такое DFlash, квантизация и почему одна и та же модель лежит в десяти репозиториях от десяти разных людей — или давно собирались поднять LLM у себя, но всё не находили повода — выход Muse Glimmer 30B буквально лучший момент начать. Буквально со своего MacBook Air. Ага, да вот уже сейчас прямо. Погрузиться в мир локальных моделей
https://habr.com/ru/articles/1069422/
#llm #локальные_модели #квантизация #llamacpp #apple_silicon #gguf #инференс #moe #meta
-
RT @KyleHessling1: BREAKING! Qwopus 3.6 27B is LIVE! Thank you for your patience on this one, but I believe you'll find the wait was worth it! We've benchmarked this thing up and down, verified that it holds at least a 75.25% (152/202) in the initial 202 SWE bench solves. Not a full run of 500, but it shows the agentic coding quality from the original 27B is retained while adding all of the additional Qwopus benefits across many domains. As always, Jackrong is absolutely cooking here! COT quality has improved significantly through the inversion techniques from our Negentropy proof of concept. It also went through thorough curriculum training. You can check out the MMLU pro benchmarks on the model card, but it improved a whopping 10 points over the base model in physics, as well as meaningful jumps in Chemistry, business, and computer science. However, the best part is that I was able to build an entire survival shooter game using this local model entirely. I genuinely was blown away by the results, which you can play right now on my HF space (link in comments below). "Qwopus Commander" was completed in 9 turns of Qwopus 3.6! To test the new long context training, I made it re-output the entire 3000+ line program each turn, and it would make fixes and add features that I requested in large prompts, while perfectly replicating the entire rest of the game from context. What's more is that I did it all at Q8 KV cache quantization, and never had an issue over the entire 303k token run! IMPORTANT: Run it at --temp 0.75 to 1. Mess with it in that range for your use case. Higher temp actually…
mehr auf Arint.info
#GGUF #huggingface #make #rest #science #SWE #Swe #arint_info