home.social

#medusa — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #medusa, aggregated by home.social.

  1. Давай по новой, Миша: speculative decoding от черновика до проверки

    Маленькая модель быстро набрасывает несколько следующих токенов, а большая проверяет всю пачку за один проход. Совпавшее оставляет, на первом расхождении переписывает продолжение сама, поэтому ускорение не меняет распределение ответа. В speculative decoding большая модель буквально говорит черновой: «Давай по новой, Миша». На первый взгляд кажется, что ускорение здесь обязательно покупается ценой качества. Но нет: это как раз тот случай, когда можно ускорить генерацию без такого компромисса. Далее разберём весь цикл: как работает черновая модель, по какому правилу принимаются токены, какого размера должен быть draft, почему важен одинаковый токенизатор и как всё это включить в Transformers и vLLM. Отдельно посмотрим на подходы, где вторая модель вообще не нужна: EAGLE, Medusa, LayerSkip и DFlash.

    habr.com/ru/articles/1081826/

    #speculative_decoding #llm #инференс #eagle #medusa #vllm #transformers #kv_cache #dflash #оптимизация

  2. Давай по новой, Миша: speculative decoding от черновика до проверки

    Маленькая модель быстро набрасывает несколько следующих токенов, а большая проверяет всю пачку за один проход. Совпавшее оставляет, на первом расхождении переписывает продолжение сама, поэтому ускорение не меняет распределение ответа. В speculative decoding большая модель буквально говорит черновой: «Давай по новой, Миша». На первый взгляд кажется, что ускорение здесь обязательно покупается ценой качества. Но нет: это как раз тот случай, когда можно ускорить генерацию без такого компромисса. Далее разберём весь цикл: как работает черновая модель, по какому правилу принимаются токены, какого размера должен быть draft, почему важен одинаковый токенизатор и как всё это включить в Transformers и vLLM. Отдельно посмотрим на подходы, где вторая модель вообще не нужна: EAGLE, Medusa, LayerSkip и DFlash.

    habr.com/ru/articles/1081826/

    #speculative_decoding #llm #инференс #eagle #medusa #vllm #transformers #kv_cache #dflash #оптимизация

  3. Давай по новой, Миша: speculative decoding от черновика до проверки

    Маленькая модель быстро набрасывает несколько следующих токенов, а большая проверяет всю пачку за один проход. Совпавшее оставляет, на первом расхождении переписывает продолжение сама, поэтому ускорение не меняет распределение ответа. В speculative decoding большая модель буквально говорит черновой: «Давай по новой, Миша». На первый взгляд кажется, что ускорение здесь обязательно покупается ценой качества. Но нет: это как раз тот случай, когда можно ускорить генерацию без такого компромисса. Далее разберём весь цикл: как работает черновая модель, по какому правилу принимаются токены, какого размера должен быть draft, почему важен одинаковый токенизатор и как всё это включить в Transformers и vLLM. Отдельно посмотрим на подходы, где вторая модель вообще не нужна: EAGLE, Medusa, LayerSkip и DFlash.

    habr.com/ru/articles/1081826/

    #speculative_decoding #llm #инференс #eagle #medusa #vllm #transformers #kv_cache #dflash #оптимизация

  4. Egypt, 4 European countries conduct main phase of the joint “Medusa-15” exercise

    The main phase of the joint “Medusa-15” exercise was conducted in Greece following several days of activities, in…
    #Europe #EU #Egypt #EgyptianArmy #European #Medusa-15
    europesays.com/europe/142955/