home.social

#gguf — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #gguf, aggregated by home.social.

  1. Сайзинг RAM и vCPU для локальной языковой модели: считаем стартовый размер VM

    Сайзинг RAM и vCPU для локальной языковой модели начинается с конкретных весов и профиля запросов. Исходные требования self-hosted LLM включают длину входа и ответа, конкурентность, рантайм и схему offload. Расчёт по размеру весов и формуле KV-кэша даёт стартовую конфигурацию, а прогретый тест показывает реальное потребление памяти и точку, где CPU перестаёт помогать.

    habr.com/ru/articles/1080970/

    #локальные_llm #selfhosted #llamacpp #gguf #ram #vcpu #kvcache #квантование #inference #numa

  2. Сайзинг RAM и vCPU для локальной языковой модели: считаем стартовый размер VM

    Сайзинг RAM и vCPU для локальной языковой модели начинается с конкретных весов и профиля запросов. Исходные требования self-hosted LLM включают длину входа и ответа, конкурентность, рантайм и схему offload. Расчёт по размеру весов и формуле KV-кэша даёт стартовую конфигурацию, а прогретый тест показывает реальное потребление памяти и точку, где CPU перестаёт помогать.

    habr.com/ru/articles/1080970/

    #локальные_llm #selfhosted #llamacpp #gguf #ram #vcpu #kvcache #квантование #inference #numa

  3. Сайзинг RAM и vCPU для локальной языковой модели: считаем стартовый размер VM

    Сайзинг RAM и vCPU для локальной языковой модели начинается с конкретных весов и профиля запросов. Исходные требования self-hosted LLM включают длину входа и ответа, конкурентность, рантайм и схему offload. Расчёт по размеру весов и формуле KV-кэша даёт стартовую конфигурацию, а прогретый тест показывает реальное потребление памяти и точку, где CPU перестаёт помогать.

    habr.com/ru/articles/1080970/

    #локальные_llm #selfhosted #llamacpp #gguf #ram #vcpu #kvcache #квантование #inference #numa

  4. Возвращение короля: разбираемся, что такое Qwen3.8 27B

    14 августа 2026 года, 15:00 UTC. CEO Anthropic Дарио Амодей срочно созвал заседание. Экс-глава Apple Тим Кук пожалел, что встроил в айфоны облачную Gemini, так и не дождавшись локальной модели нужного уровня. Где-то в датацентрах Alibaba щёлкнул рубильник, на Hugging Face слетел обратный отсчёт, и в мир вышла Qwen3.8-27B – новая dense-модель на 27 миллиардов параметров, которую даже прозвали «локальным Opus’ом», поскольку она позиционируется как одно из самых мощных открытых решений для локальной генерации. Ждали её всем миром: обратный отсчёт на huggingface, первые пиксельные пеликаны на великах – всё как положено. Если вкратце , это открытая (Apache 2.0) мультимодальная модель, которая понимает текст, картинки и видео, влезает в одну ооочень мощную домашнюю видеокарту, а временами по бенчмаркам обгоняет закрытые облачные модели уровня Claude Opus 4.6. Если не вкратце – читайте дальше, потому что там есть и триумф, и зависания на 49 минут раздумий!

    habr.com/ru/companies/gptunnel

    #Qwen38_27B #Alibaba #плотные_модели #опенсурс #Apache_20 #GGUF #Claude_Opus #Hugging_Face