home.social

#cache_llm — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #cache_llm, aggregated by home.social.

fetched live
  1. Как и зачем ускоряют LLM

    Мы знаем, что сегодняшние большие языковые модели основаны на архитектуре transformer , а самое важное понятие в трансформере это механизм attention . Вычисление attention происходит путем многократного произведения матриц. Но как модели с миллиардами параметров вычисляют эти матрицы? Почему генерация происходит так быстро? Как можно вычислить следующий токен, без многомиллионного перемножения? Сегодня вы узнаете об одном из самых важных понятий в современном ИИ — о KV cache . Мне нужны ответы!

    habr.com/ru/companies/bothub/a

    #kv_cache #cache #кеширование #ускорить_модель_ии #как_ускорить_ии #как_работает_kv_кеш #кеширование_llm #cache_llm #оптимизация_трансформера

  2. Как и зачем ускоряют LLM

    Мы знаем, что сегодняшние большие языковые модели основаны на архитектуре transformer , а самое важное понятие в трансформере это механизм attention . Вычисление attention происходит путем многократного произведения матриц. Но как модели с миллиардами параметров вычисляют эти матрицы? Почему генерация происходит так быстро? Как можно вычислить следующий токен, без многомиллионного перемножения? Сегодня вы узнаете об одном из самых важных понятий в современном ИИ — о KV cache . Мне нужны ответы!

    habr.com/ru/companies/bothub/a

    #kv_cache #cache #кеширование #ускорить_модель_ии #как_ускорить_ии #как_работает_kv_кеш #кеширование_llm #cache_llm #оптимизация_трансформера

  3. Как и зачем ускоряют LLM

    Мы знаем, что сегодняшние большие языковые модели основаны на архитектуре transformer , а самое важное понятие в трансформере это механизм attention . Вычисление attention происходит путем многократного произведения матриц. Но как модели с миллиардами параметров вычисляют эти матрицы? Почему генерация происходит так быстро? Как можно вычислить следующий токен, без многомиллионного перемножения? Сегодня вы узнаете об одном из самых важных понятий в современном ИИ — о KV cache . Мне нужны ответы!

    habr.com/ru/companies/bothub/a

    #kv_cache #cache #кеширование #ускорить_модель_ии #как_ускорить_ии #как_работает_kv_кеш #кеширование_llm #cache_llm #оптимизация_трансформера