#quantcall — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #quantcall, aggregated by home.social.
-
Маленькая модель на 0.6B держит квантование лучше, чем «крупная» на 1B: измерил деградацию function-calling на 4 ГБ VRAM
Как квантование ломает function-calling у LLM? Написал бенчмарк QuantCall, протестировав модели на 4 ГБ VRAM. Главный инсайт: устойчивость к квантам зависит не от размера, а от семейства. Меньшая Qwen3-0.6B стабильно генерирует валидный JSON даже на Q4, а более крупная Llama-3.2-1B деградирует уже на Q8, путая типы данных. Также GBNF-грамматики не спасают от ошибок, но заметно замедляют инференс.
https://habr.com/ru/articles/1056656/
#квантование #functioncalling #Qwen3 #Llama32 #BFCL #QuantCall #JSONсхема #GBNF #GGUF #деградация_модели