home.social

#tail_latency — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #tail_latency, aggregated by home.social.

fetched live
  1. Как деградирует продовый LLM-инференс: KV-cache, OOM и хвост p99

    Демо нагрузки и реальная нагрузка различаются. Демо всегда быстрое — если поставить модель и прогнать пару запросов, то latency вас обрадует, а TTFT, вероятнее всего, будет приятным. Но когда сервис неделю живет под реальной нагрузкой, начинаются проблемы: p99 растет, память утекает, а однажды прилетает OOM на запросе, который вчера проходил без проблем. Я Стас Погоржельский, технологический евангелист VK Cloud, неоднократно наблюдал этот сценарий в демонстрационных средах. Инференс редко выходит из строя сразу и явно; как правило, его работа постепенно ухудшается, оставаясь незаметной до достижения критического состояния. Ниже я разберу четыре механизма, приводящие к деградации производственной среды на длительном интервале: фрагментацию KV-кэша, нехватку памяти (OOM) при работе с длинным контекстом, блокировку очереди (head-of-line blocking) внутри батча и расхождение метрик p50 и p99. Для каждого случая опишу внутреннее поведение системы, способы воспроизведения проблемы и метрики, сигнализирующие о надвигающемся инциденте.

    habr.com/ru/companies/vktech/a

    #vk_cloud #llm_inference #kv_cache #gpu_memory #oom #latency_p99 #continuous_batching #paged_attention #vllm #tail_latency

  2. Когда дашборды лгут. Гайд по перцентилям, очередям и e2e-бюджету

    Вы уже научились отслеживать среднюю скорость запросов на проекте, и это большой шаг. Без преувеличений и какой либо иронии. И теперь, когда вы перешли от "не измеряем ничего" до "измеряем среднее" — вы попали в ловушку. Пока вы с удовольствием наблюдаете в отчетах красивые 200ms — ваши пользователи стучат в службу поддержки со словами "у меня все висит". И они не врут, у них действительно TTF порядка 6 секунд . Но и вы не врете, у вас действительно 200ms в отчете ! Врет метрика, а вы ей верите. Давайте разбираться.

    habr.com/ru/articles/959994/

    #latency #перцентиль #slo #закон_литтла #теория_очередей #tail_latency #observability #performance #distributed_systems #e2e_budget