#gguf — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #gguf, aggregated by home.social.
-
RT @UnslothAI: Du kannst jetzt Unsloth GGUFs lokal mit einem einzigen Klick über Hermes ausführen! ✨
mehr auf Arint.info
-
RT @UnslothAI: Du kannst jetzt Unsloth GGUFs lokal mit einem einzigen Klick über Hermes ausführen! ✨
mehr auf Arint.info
-
RT @UnslothAI: Du kannst jetzt Unsloth GGUFs lokal mit einem einzigen Klick über Hermes ausführen! ✨
mehr auf Arint.info
-
Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток/сек на двух RTX 3090
Плотная 27-миллиардная модель на двух RTX 3090 в llama.cpp из коробки даёт 32 токена в секунду. Интуитивно понятно, что это не предел: две карты по 24 ГБ и 936 ГБ/с каждая не должны выдавать столько, сколько выдаёт одна. Значит, где-то узкое горлышко — и надо разобраться, что и где подкрутить. Горлышек оказалось несколько, и все снимаются флагами запуска: те же веса — 75 токенов в секунду. Под катом каждый флаг описан по одной схеме: зачем, что писать, что даёт в цифрах, где ломается и с какой строкой в логе. В конце — готовый docker run , три проверки после каждой смены флага и список того, что не сработало. Текст можно отдать целиком агенту с доступом к серверу — это инструкция, а не история.
https://habr.com/ru/articles/1076080/
#llm #ai #llamacpp #qwen #qwen38 #gguf #квантование #локальные_нейросети #локальные_модели
-
RT @TeksEdge: 🤯 Einfach nur erstaunlich. Das Qwen-Team denkt voraus! … ein 177B-Qwen-Modell kann jetzt lokal mit CPU-RAM ausgeführt werden, OHNE GPU-VRAM?! 👈
mehr auf Arint.info
-
RT @UnslothAI: Wir veröffentlichen neue Qwen3.8-27B GGUFs mit 10 % höherer Genauigkeit. Unsloth Dynamic V3 schlägt andere um 10 % auf Div-300, KLD und weiteren Benchmarks. Zudem veröffentlichen wir 1-Bit-Quantisierungen, die 77 % der Genauigkeit beibehalten. Läuft auf 8 GB RAM. Blog: unsloth.ai/docs/basics/dynam… GGUF: huggingface.co/unsloth/Qwen3…
mehr auf Arint.info
#AI #GGUF #MachineLearning #OpenSource #Qwen3 #Unsloth #arint_info
-
RT @UnslothAI: DeepSeek-V4-Flash kann jetzt mit DSpark 2× schneller lokal ausgeführt werden! ⚡️ DSpark ermöglicht es V4-Flash-0731 GGUFs, ~1,4–2× schneller zu generieren, ohne Genauigkeitsverlust. DeepSeek-V4-Flash-0731 erreicht bis zu 120 Token/s. GGUFs: https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF Anleitung: https://unsloth.ai/docs/models/deepseek-v4
mehr auf Arint.info
#AI #DeepSeek #GGUF #MachineLearning #OpenSource #Unsloth #arint_info