#medusa — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #medusa, aggregated by home.social.
-
Давай по новой, Миша: speculative decoding от черновика до проверки
Маленькая модель быстро набрасывает несколько следующих токенов, а большая проверяет всю пачку за один проход. Совпавшее оставляет, на первом расхождении переписывает продолжение сама, поэтому ускорение не меняет распределение ответа. В speculative decoding большая модель буквально говорит черновой: «Давай по новой, Миша». На первый взгляд кажется, что ускорение здесь обязательно покупается ценой качества. Но нет: это как раз тот случай, когда можно ускорить генерацию без такого компромисса. Далее разберём весь цикл: как работает черновая модель, по какому правилу принимаются токены, какого размера должен быть draft, почему важен одинаковый токенизатор и как всё это включить в Transformers и vLLM. Отдельно посмотрим на подходы, где вторая модель вообще не нужна: EAGLE, Medusa, LayerSkip и DFlash.
https://habr.com/ru/articles/1081826/
#speculative_decoding #llm #инференс #eagle #medusa #vllm #transformers #kv_cache #dflash #оптимизация
-
Давай по новой, Миша: speculative decoding от черновика до проверки
Маленькая модель быстро набрасывает несколько следующих токенов, а большая проверяет всю пачку за один проход. Совпавшее оставляет, на первом расхождении переписывает продолжение сама, поэтому ускорение не меняет распределение ответа. В speculative decoding большая модель буквально говорит черновой: «Давай по новой, Миша». На первый взгляд кажется, что ускорение здесь обязательно покупается ценой качества. Но нет: это как раз тот случай, когда можно ускорить генерацию без такого компромисса. Далее разберём весь цикл: как работает черновая модель, по какому правилу принимаются токены, какого размера должен быть draft, почему важен одинаковый токенизатор и как всё это включить в Transformers и vLLM. Отдельно посмотрим на подходы, где вторая модель вообще не нужна: EAGLE, Medusa, LayerSkip и DFlash.
https://habr.com/ru/articles/1081826/
#speculative_decoding #llm #инференс #eagle #medusa #vllm #transformers #kv_cache #dflash #оптимизация
-
Давай по новой, Миша: speculative decoding от черновика до проверки
Маленькая модель быстро набрасывает несколько следующих токенов, а большая проверяет всю пачку за один проход. Совпавшее оставляет, на первом расхождении переписывает продолжение сама, поэтому ускорение не меняет распределение ответа. В speculative decoding большая модель буквально говорит черновой: «Давай по новой, Миша». На первый взгляд кажется, что ускорение здесь обязательно покупается ценой качества. Но нет: это как раз тот случай, когда можно ускорить генерацию без такого компромисса. Далее разберём весь цикл: как работает черновая модель, по какому правилу принимаются токены, какого размера должен быть draft, почему важен одинаковый токенизатор и как всё это включить в Transformers и vLLM. Отдельно посмотрим на подходы, где вторая модель вообще не нужна: EAGLE, Medusa, LayerSkip и DFlash.
https://habr.com/ru/articles/1081826/
#speculative_decoding #llm #инференс #eagle #medusa #vllm #transformers #kv_cache #dflash #оптимизация
-
Egypt, 4 European countries conduct main phase of the joint “Medusa-15” exercise
The main phase of the joint “Medusa-15” exercise was conducted in Greece following several days of activities, in…
#Europe #EU #Egypt #EgyptianArmy #European #Medusa-15
https://www.europesays.com/europe/142955/