home.social

#gbnf — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #gbnf, aggregated by home.social.

  1. Маленькая модель на 0.6B держит квантование лучше, чем «крупная» на 1B: измерил деградацию function-calling на 4 ГБ VRAM

    Как квантование ломает function-calling у LLM? Написал бенчмарк QuantCall, протестировав модели на 4 ГБ VRAM. Главный инсайт: устойчивость к квантам зависит не от размера, а от семейства. Меньшая Qwen3-0.6B стабильно генерирует валидный JSON даже на Q4, а более крупная Llama-3.2-1B деградирует уже на Q8, путая типы данных. Также GBNF-грамматики не спасают от ошибок, но заметно замедляют инференс.

    habr.com/ru/articles/1056656/

    #квантование #functioncalling #Qwen3 #Llama32 #BFCL #QuantCall #JSONсхема #GBNF #GGUF #деградация_модели