#gguf — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #gguf, aggregated by home.social.
-
RT @UnslothAI: Du kannst jetzt Unsloth GGUFs lokal mit einem einzigen Klick über Hermes ausführen! ✨
mehr auf Arint.info
-
RT @UnslothAI: Du kannst jetzt Unsloth GGUFs lokal mit einem einzigen Klick über Hermes ausführen! ✨
mehr auf Arint.info
-
RT @UnslothAI: Du kannst jetzt Unsloth GGUFs lokal mit einem einzigen Klick über Hermes ausführen! ✨
mehr auf Arint.info
-
100% local chat with a GGUF model in your browser using WebAssembly.
Written in @golang compiled with @TinyGo Now runs in Chrome / Firefox & supports WebGPU when available.
-
Букмарклет вычисляющий скорость gguf модели в llama.cpp на hf
С приходом нейросетей теперь можно решать задачи гораздо проще, правда и задачи бы такой не стояло не будь нейросетей и llama.cpp, и huggingface. В общем смысл статьи в том чтобы попытаться математически вычислить теоретическую скорость генерации токенов в программе llama.cpp для моделей на hugginface, просто открыв карточку модели и нажав на закладку (букмарклет). Вот как это выглядит: На самом деле этих калькуляторов полно и много, но почему-то у меня они показывают совсем не то что я вижу в реальности. Опять же, для меня было открытие что я могу на своей RTX3070 8Gb запускать MOE модели до 35 млрд параметров на довольно неплохой скорости, просто потому что нейронки в чатах говорят что все - конец - этого не хватит. Я думаю что они остановились в своем развитии где-то год назад и все еще частенько вспоминают про модели llama или mistral но сейчас то уже не совсем актуально, по крайней мере для использования, может для научных изысканий и нет лучше, не знаю. В общем-то и в этом калькуляторе нет никаких новых идей - просто я прогнал на своем компе несколько моделей, замерил скорость,замерил +- максимально возможный контекст, при котором llama.cpp не вылетает по нехватке памяти и попросил нейронку сделать калькулятор, чтобы он показывал цифры близкие мне, потому что расчетные цифры по контексту нейронка занижала в разы. Мне просто стало интересно почему так - она говорит что максимальный контекст 20 тысяч условно, а смог выжать 70 тысяч - разница в разы.
-
Local LLM Arena #2 — dlaczego akurat te 5 modeli?
Nie szukam modeli najlepszych „na papierze”. Szukam takich, które realnie da się uruchomić lokalnie na MacBooku M4 z 16 GB Unified Memory i które mogą być przydatne na co dzień.
Dlatego testuję:
- Gemma 4 12B — Q4_0, 7.15 GB
Najmniejszy z zestawu i punkt odniesienia. Sprawdzam, czy mniejszy model może nadrobić szybkością i mniejszym zużyciem pamięci.- Ternary Bonsai 27B — MLX 2-bit, 8.49 GB
Najbardziej nietypowy zawodnik. 27B upakowane dzięki ternary/2-bit. Jego integracja wymagała nawet osobnego mostu MLX w Arenie.- GPT-OSS-20B — MXFP4, 11.28 GB
Jeden z cięższych, ale we wcześniejszych testach zdecydowanie najszybszy. Ciekawe, czy szybkość pójdzie w parze z jakością.- Qwen3.8-27B — IQ3_XXS, 10.18 GB
Największe wyzwanie dla M4 16 GB. Przed benchmarkiem przeszedł osobny test 20 zapytań. Pamięć dochodziła do ~15.3 GB i pojawiał się swap, ale bez dalszego narastania. Wynik: STABLE_WITH_SWAP.- Mistral Small 3.2 24B — IQ3_XXS, 8.76 GB
Mocniejsza quantyzacja była świadomym wyborem, żeby pozostawić miejsce dla KV cache i macOS.I właśnie o to chodzi w eksperymencie.
Nie porównuję idealnych modeli na serwerze. Porównuję kompromisy:
parametry, quantyzacja, jakość, szybkość a pamięć
na zwykłym laptopie.
Może wygrać 27B. Ale może się też okazać, że do codziennej pracy znacznie lepszy będzie szybszy 12B lub 20B.
Obecnie trwa pełny benchmark: 180 zadań — 36 dla każdego modelu.
-
Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток/сек на двух RTX 3090
Плотная 27-миллиардная модель на двух RTX 3090 в llama.cpp из коробки даёт 32 токена в секунду. Интуитивно понятно, что это не предел: две карты по 24 ГБ и 936 ГБ/с каждая не должны выдавать столько, сколько выдаёт одна. Значит, где-то узкое горлышко — и надо разобраться, что и где подкрутить. Горлышек оказалось несколько, и все снимаются флагами запуска: те же веса — 75 токенов в секунду. Под катом каждый флаг описан по одной схеме: зачем, что писать, что даёт в цифрах, где ломается и с какой строкой в логе. В конце — готовый docker run , три проверки после каждой смены флага и список того, что не сработало. Текст можно отдать целиком агенту с доступом к серверу — это инструкция, а не история.
https://habr.com/ru/articles/1076080/
#llm #ai #llamacpp #qwen #qwen38 #gguf #квантование #локальные_нейросети #локальные_модели
-
RT @TeksEdge: 🤯 Einfach nur erstaunlich. Das Qwen-Team denkt voraus! … ein 177B-Qwen-Modell kann jetzt lokal mit CPU-RAM ausgeführt werden, OHNE GPU-VRAM?! 👈
mehr auf Arint.info
-
RT @UnslothAI: Wir veröffentlichen neue Qwen3.8-27B GGUFs mit 10 % höherer Genauigkeit. Unsloth Dynamic V3 schlägt andere um 10 % auf Div-300, KLD und weiteren Benchmarks. Zudem veröffentlichen wir 1-Bit-Quantisierungen, die 77 % der Genauigkeit beibehalten. Läuft auf 8 GB RAM. Blog: unsloth.ai/docs/basics/dynam… GGUF: huggingface.co/unsloth/Qwen3…
mehr auf Arint.info
#AI #GGUF #MachineLearning #OpenSource #Qwen3 #Unsloth #arint_info
-
Возвращение короля: разбираемся, что такое Qwen3.8 27B
14 августа 2026 года, 15:00 UTC. CEO Anthropic Дарио Амодей срочно созвал заседание. Экс-глава Apple Тим Кук пожалел, что встроил в айфоны облачную Gemini, так и не дождавшись локальной модели нужного уровня. Где-то в датацентрах Alibaba щёлкнул рубильник, на Hugging Face слетел обратный отсчёт, и в мир вышла Qwen3.8-27B – новая dense-модель на 27 миллиардов параметров, которую даже прозвали «локальным Opus’ом», поскольку она позиционируется как одно из самых мощных открытых решений для локальной генерации. Ждали её всем миром: обратный отсчёт на huggingface, первые пиксельные пеликаны на великах – всё как положено. Если вкратце , это открытая (Apache 2.0) мультимодальная модель, которая понимает текст, картинки и видео, влезает в одну ооочень мощную домашнюю видеокарту, а временами по бенчмаркам обгоняет закрытые облачные модели уровня Claude Opus 4.6. Если не вкратце – читайте дальше, потому что там есть и триумф, и зависания на 49 минут раздумий!
https://habr.com/ru/companies/gptunnel/articles/1071272/
#Qwen38_27B #Alibaba #плотные_модели #опенсурс #Apache_20 #GGUF #Claude_Opus #Hugging_Face
-
Now that Qwen 3.8 27B released, you may want to know how to create (good) skills for your model:
https://medium.com/p/c8c735847494
#AI #ArtificialIntelligence #Laravel #PHP #Programming #Coding #Code #SoftwareDevelopment #WebDevelopment #WebDev #VibeCoding #VibeCode #Qwen #Qwen38 #LLM #HuggingFace #GGUF #Ollama #LlamaCCP #LMStudio
-
Всё, что вы хотели знать о локальном ИИ, но стеснялись спросить
Если вы когда-нибудь смотрели на HF и не понимали, что такое DFlash, квантизация и почему одна и та же модель лежит в десяти репозиториях от десяти разных людей — или давно собирались поднять LLM у себя, но всё не находили повода — выход Muse Glimmer 30B буквально лучший момент начать. Буквально со своего MacBook Air. Ага, да вот уже сейчас прямо. Погрузиться в мир локальных моделей
https://habr.com/ru/articles/1069422/
#llm #локальные_модели #квантизация #llamacpp #apple_silicon #gguf #инференс #moe #meta
-
RT @UnslothAI: DeepSeek-V4-Flash kann jetzt mit DSpark 2× schneller lokal ausgeführt werden! ⚡️ DSpark ermöglicht es V4-Flash-0731 GGUFs, ~1,4–2× schneller zu generieren, ohne Genauigkeitsverlust. DeepSeek-V4-Flash-0731 erreicht bis zu 120 Token/s. GGUFs: https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF Anleitung: https://unsloth.ai/docs/models/deepseek-v4
mehr auf Arint.info
#AI #DeepSeek #GGUF #MachineLearning #OpenSource #Unsloth #arint_info
-
Как я ужал русский эмбеддер до 24 млн параметров — и чуть не испортил его одной цифрой
TL;DR. У меня локальный RAG на AMD Strix Halo. Памяти там достаточно, но вычислительно всё упирается в один iGPU: его делят эмбеддер, реранкер и периодическая переиндексация, а в одноузловой конфигурации туда же встаёт генеративная LLM. Поэтому мне понадобился не самый точный retriever вообще, а максимально лёгкий русский retriever, который быстрее завершает первую стадию поиска на том же GPU. Насколько это больно, я в итоге померил на живом узле. На синтетической индексирующей нагрузке полной тяги bge‑m3 снизил generation throughput Qwen3.6-35B-A3B на 92%, STRIZH на 28% при примерно 12,6-кратном темпе индексации (окна замера там неравные, 20,6 против 173,6 секунды, потому что задаются временем пяти генераций; равнооконный прогон RAG‑конвейера ниже даёт по батчам в секунду 9,4-кратный отрыв). В полном RAG‑конвейере с четырьмя пользовательскими потоками и фоновой индексацией STRIZH удержал 14,0 транзакции в минуту против 6,0 у bge‑m3 и индексировал 46 батчей в секунду против 4,9. При фиксированных 200 онлайн‑запросах в секунду генерация проседала на 2% со STRIZH и на 7% с bge‑m3. Оговорка сразу: без фоновой индексации STRIZH преимущества не показал : в этом профиле bge‑m3 оказался немного быстрее, а пропускную способность определяли реранк (0,6–0,7 с на транзакцию), prefill и генерация. Я взял 12-слойный RuModernBERT-small , сначала неудачно попытался повторить пространство большого учителя через MSE, затем обучил retrieval‑донор на контрастивной задаче, выбрал из него четыре слоя [0, 5, 9, 11] и доучил student на русских, английских и смешанных парах с hard negatives от BGE‑M3.
https://habr.com/ru/articles/1064138/
#эмбеддинги #RAG #retrieval #энкодеры #RuModernBERT #STRIZH #llamacpp #GGUF #Vulkan #Strix_Halo
-
Как мы запустили Ornith‑35B на ноутбуке с 8 ГБ VRAM и разогнали её до 99 ток/с на AMD Strix Halo
Ornith‑1.0‑35B обошла Qwen3.5‑397B в Terminal‑Bench, а на нашем локальном срезе хорошо показала себя в агентном кодинге. Мы решили проверить, насколько быстрее она сможет работать на AMD Strix Halo с пропускной способностью памяти до 256 ГБ/с. В статье — результаты экспериментов с Vulkan, MTP, селективной квантизацией и n‑gram reuse: что не дало прироста, как удалось получить 99 ток/с без потери качества и каким способом 35B‑модель запустилась на Windows‑ноутбуке с 8 ГБ VRAM.
https://habr.com/ru/articles/1060632/
#llamacpp #Vulkan #AMD_Strix_Halo #Ornith #MoE #MTP #speculative_decoding #GGUF #LM_Studio #локальные_LLM