#tritoninferenceserver — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #tritoninferenceserver, aggregated by home.social.
-
Ускорение инференса энкодерной guard‑модели: TensorRT, Triton, vLLM, Ray Serve
Когда в системе есть узел между LLM и пользователем его скорость также важна, как и скорость самой LLM. Когда этот узел сам является моделью (и иногда даже — тоже LLM) — задача ускорения становится совсем веселой и её нужно уметь решать разными способами. В этой работе я опишу процесс ускорения guardrail‑модели — узла, которые проверяет — нет ли на входе или выходе опасного контента. Guard стоит на входе/выходе LLM‑приложения. В статье речь про небольшую модель — чуть больше 0.5 Gb. Но она вызывается дважды за один ход диалога, и сначала пользователь ждет, пока guard проверит его запрос перед отправкой в LLM, затем — пока он проверит сгенерированный ответ перед выдачей пользователю. Моей задачей было ускорить такую небольшую guard‑модель (Locustfile, базовые benchmark‑конфиги и инструкции по воспроизведению экспериментов в репо ). Я потестила пять инструментов: TensorRT, NVIDIA Triton, vLLM, Ray Serve и отдельно — переход бэкбона на Flash DeBERTa. Про допущенные ошибки, результаты и выводы — о том, как бы я построила подобную работу сейчас — ниже. Надеюсь, это сбережет вам время.
https://habr.com/ru/articles/1067008/
#gliner2 #gliner_guard #guardrails #tensorrt #vllm #nvidia #инференс_нейросетей #tritoninferenceserver
-
vLLM vs LMDeploy vs Triton: обзор бэкендов для инференса LLM
Лучший способ сжечь бюджет компании на инфраструктуру — запуск LLM в продакшене. Но только если вы не знаете, какой бэкенд использовать и как его настраивать. Проблема в том, что параметры современных нейросетей растут по экспоненте, а обрабатываемый контекст становится все длиннее. Из-за этого операционные расходы на генерацию текста превращаются в главный барьер для масштабирования сервисов. Обслуживать запросы к LLM в десятки раз сложнее и дороже, чем крутить классический поиск по ключевым словам. Чтобы не разориться на счетах и выжать максимум из дорогостоящих
https://habr.com/ru/companies/selectel/articles/1060180/
#mlops #selectel #ml #nvidia #vllm #tritoninferenceserver #lmdeploy
-
От 0 до 10 миллионов ИИ-проверок в месяц: как мы продуктивизировали CV в Пятёрочке за 8 месяцев
Статья про то, как CV-сервис вырос с MVP до 10 миллионов проверок фото в месяц и не развалился в проде. 🔧 Это не про «у нас классные модели» и не про «просто прикрутили YOLO», а про честную инженерную продуктивизацию. Про то как универсальный классификатор путал фарш с грязью, почему часть анкет всё равно лучше отдавать человеку, зачем отдельно мониторить качество моделей и что приходится чинить, когда реальный мир меняется быстрее обучающей выборки. Внутри: компьютерное зрение, 26 моделей, 62 проверки, CNN, VLM, Triton, vLLM, Kafka, Human-in-the-loop, мониторинг качества, сезонность, баги под нагрузкой и немного «веган-версии ИИ». Заходите, читайте и делитесь своим опытом продакшена ML-сервисов ❤️
https://habr.com/ru/companies/X5Tech/articles/1054688/
#computer_vision #multimodal #yolo #resnet #vlm #cnn #tritoninferenceserver #humanintheloop #kafka #ритейл
-
От 0 до 10 миллионов ИИ-проверок в месяц: как мы продуктивизировали CV в Пятёрочке за 8 месяцев
Статья про то, как CV-сервис вырос с MVP до 10 миллионов проверок фото в месяц и не развалился в проде. 🔧 Это не про «у нас классные модели» и не про «просто прикрутили YOLO», а про честную инженерную продуктивизацию. Про то как универсальный классификатор путал фарш с грязью, почему часть анкет всё равно лучше отдавать человеку, зачем отдельно мониторить качество моделей и что приходится чинить, когда реальный мир меняется быстрее обучающей выборки. Внутри: компьютерное зрение, 26 моделей, 62 проверки, CNN, VLM, Triton, vLLM, Kafka, Human-in-the-loop, мониторинг качества, сезонность, баги под нагрузкой и немного «веган-версии ИИ». Заходите, читайте и делитесь своим опытом продакшена ML-сервисов ❤️
https://habr.com/ru/companies/X5Tech/articles/1047946/
#computer_vision #multimodal #yolo #resnet #vlm #cnn #tritoninferenceserver #humanintheloop #kafka #ритейл
-
Как мы автоматизировали модерацию карточек товаров с помощью Computer Vision в Wildberries
Привет! Я Дмитрий Колесников, Team Lead DS-команды «Платформа модерации» в Wildberries & Russ. В этой статье по мотивам моего доклада на HighLoad расскажу, как у нас получилось превратить сотни Computer Vision моделей в единый масштабируемый пайплайн, который ежедневно обрабатывает 15 млн карточек товаров (50+ млн изображений и 500K видео).
https://habr.com/ru/companies/oleg-bunin/articles/992716/
#ml #machine_learning #data_science #cv #computer_vision #компьютерное_зрение #tritoninferenceserver #highload #wildberries #moderation
-
Nvidia Triton Vulnerabilities Pose Big Risk to AI Models – Source: www.securityweek.com https://ciso2ciso.com/nvidia-triton-vulnerabilities-pose-big-risk-to-ai-models-source-www-securityweek-com/ #rssfeedpostgeneratorecho #ArtificialIntelligence #TritonInferenceServer #CyberSecurityNews #vulnerabilities #securityweekcom #Vulnerability #securityweek #FEATURED #NVIDIA #AI
-
Nvidia Triton Vulnerabilities Pose Big Risk to AI Models https://www.securityweek.com/nvidia-triton-vulnerabilities-pose-big-risk-to-ai-models/ #ArtificialIntelligence #TritonInferenceServer #Vulnerabilities #vulnerability #NVIDIA #AI
-
Nvidia Triton Vulnerabilities Pose Big Risk to AI Models https://www.securityweek.com/nvidia-triton-vulnerabilities-pose-big-risk-to-ai-models/ #ArtificialIntelligence #TritonInferenceServer #Vulnerabilities #vulnerability #NVIDIA #AI