home.social

#gguf — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #gguf, aggregated by home.social.

  1. Сайзинг RAM и vCPU для локальной языковой модели: считаем стартовый размер VM

    Сайзинг RAM и vCPU для локальной языковой модели начинается с конкретных весов и профиля запросов. Исходные требования self-hosted LLM включают длину входа и ответа, конкурентность, рантайм и схему offload. Расчёт по размеру весов и формуле KV-кэша даёт стартовую конфигурацию, а прогретый тест показывает реальное потребление памяти и точку, где CPU перестаёт помогать.

    habr.com/ru/articles/1080970/

    #локальные_llm #selfhosted #llamacpp #gguf #ram #vcpu #kvcache #квантование #inference #numa