#gguf — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #gguf, aggregated by home.social.
-
Сайзинг RAM и vCPU для локальной языковой модели: считаем стартовый размер VM
Сайзинг RAM и vCPU для локальной языковой модели начинается с конкретных весов и профиля запросов. Исходные требования self-hosted LLM включают длину входа и ответа, конкурентность, рантайм и схему offload. Расчёт по размеру весов и формуле KV-кэша даёт стартовую конфигурацию, а прогретый тест показывает реальное потребление памяти и точку, где CPU перестаёт помогать.
https://habr.com/ru/articles/1080970/
#локальные_llm #selfhosted #llamacpp #gguf #ram #vcpu #kvcache #квантование #inference #numa
-
Сайзинг RAM и vCPU для локальной языковой модели: считаем стартовый размер VM
Сайзинг RAM и vCPU для локальной языковой модели начинается с конкретных весов и профиля запросов. Исходные требования self-hosted LLM включают длину входа и ответа, конкурентность, рантайм и схему offload. Расчёт по размеру весов и формуле KV-кэша даёт стартовую конфигурацию, а прогретый тест показывает реальное потребление памяти и точку, где CPU перестаёт помогать.
https://habr.com/ru/articles/1080970/
#локальные_llm #selfhosted #llamacpp #gguf #ram #vcpu #kvcache #квантование #inference #numa
-
Сайзинг RAM и vCPU для локальной языковой модели: считаем стартовый размер VM
Сайзинг RAM и vCPU для локальной языковой модели начинается с конкретных весов и профиля запросов. Исходные требования self-hosted LLM включают длину входа и ответа, конкурентность, рантайм и схему offload. Расчёт по размеру весов и формуле KV-кэша даёт стартовую конфигурацию, а прогретый тест показывает реальное потребление памяти и точку, где CPU перестаёт помогать.
https://habr.com/ru/articles/1080970/
#локальные_llm #selfhosted #llamacpp #gguf #ram #vcpu #kvcache #квантование #inference #numa
-
🎯 #OuteTTS introduces a novel approach to text-to-speech synthesis using pure #languagemodeling
🔧 Built on #LLaMa architecture with just 350M parameters, featuring:Zero-shot #voicecloning capability
Integration with #WavTokenizer (75 tokens/sec)
Local deployment via #llamacpp
#GGUF format compatibility🔍 Technical Implementation:
Audio tokenization process
CTC forced alignment
Structured prompt system
Temperature-adjustable outputs⚠️ Current Limitations:
Limited vocabulary range
String-only input support
Best performance with shorter sentences
Variable temperature sensitivityhttps://github.com/edwko/OuteTTS
https://huggingface.co/OuteAI/OuteTTS-0.1-350M