home.social

#tensorrt — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #tensorrt, aggregated by home.social.

fetched live
  1. Ускорение инференса энкодерной guard‑модели: TensorRT, Triton, vLLM, Ray Serve

    Когда в системе есть узел между LLM и пользователем его скорость также важна, как и скорость самой LLM. Когда этот узел сам является моделью (и иногда даже — тоже LLM) — задача ускорения становится совсем веселой и её нужно уметь решать разными способами. В этой работе я опишу процесс ускорения guardrail‑модели — узла, которые проверяет — нет ли на входе или выходе опасного контента. Guard стоит на входе/выходе LLM‑приложения. В статье речь про небольшую модель — чуть больше 0.5 Gb. Но она вызывается дважды за один ход диалога, и сначала пользователь ждет, пока guard проверит его запрос перед отправкой в LLM, затем — пока он проверит сгенерированный ответ перед выдачей пользователю. Моей задачей было ускорить такую небольшую guard‑модель (Locustfile, базовые benchmark‑конфиги и инструкции по воспроизведению экспериментов в репо ). Я потестила пять инструментов: TensorRT, NVIDIA Triton, vLLM, Ray Serve и отдельно — переход бэкбона на Flash DeBERTa. Про допущенные ошибки, результаты и выводы — о том, как бы я построила подобную работу сейчас — ниже. Надеюсь, это сбережет вам время.

    habr.com/ru/articles/1067008/

    #gliner2 #gliner_guard #guardrails #tensorrt #vllm #nvidia #инференс_нейросетей #tritoninferenceserver

  2. Как троттлинг процессора ломает видеокарту через PCIe: хроники абсурда в сервисном центре DNS

    Дисклеймер: все события основаны на реальном кейсе борьбы за гарантийный ремонт топового железа в СЦ DNS. Диалоги воспроизведены по памяти, максимально близко к оригиналу, технический абсурд передан без приукрашиваний. Авторское настроение: «мне нихуя, блять, не смешно». Представьте ситуацию: вы покупаете бескомпромиссную рабочую станцию. Вся система в сборе приобретается в DNS, там же заказывается сборка. Всё официально и находится на гарантии, кроме одной детали — процессора. Он шёл как OEM, и его годовая гарантия уже благополучно истекла, в то время как на остальные ключевые компоненты (включая дорогущую RTX 4090) гарантия продолжает действовать. Запомните этот факт — вокруг него СЦ построит свою главную защитную стратегию. В один прекрасный день ваша ультимативная машина превращается в генератор бесконечных аппаратных ошибок шины данных, а мастера из сервисного центра выдвигают техническую гипотезу, достойную Шнобелевской премии по физике. Они заявляют, что пробой PCIe произошёл из‑за троттлинга процессора, который таким образом «убивает» видеокарту. Такое невозможно придумать самому без использования тяжёлых веществ (которые автор статьи категорически осуждает). В этой статье разберём, почему «волосатый бублик» бессилен против стека ИИ, как контроллер памяти GPU тихо умирает под CUDA‑нагрузкой, и как разворачивался этот комедийный баттл с СЦ DNS.

    habr.com/ru/articles/1055726/

    #DNS #гарантийный_ремонт #ЗоЗПП #RTX_4090 #WHEALogger #PCIe #троттлинг #ComfyUI #деградация_GPU #tensorrt

  3. Нейросетевой апскейлинг: как собрать все грабли и почему очевидные настройки всё портят

    В своих прошлых статьях «Три пути к 4K» и «Нейросетевой апскейлинг дома» я рассказывал о выборе софта, базовых принципах нейросетевого апскейлинга и реставрации исходников уровня DVD и VHS. Но время идёт, навыки растут, и вот от простого (кусок дерева -> игрушка) мы переходим к сложному (игрушка -> коллекционная фигурка), а именно на территорию 720p–1080p исходников, Blu-ray и вебки. И именно здесь для меня началось то, что я назвал «долиной отчаяния». Вы берёте отличный исходник, выбираете крутую open-source модель, запускаете рендер… и всегда получаете что-то странное на выходе. Цвета поплыли, контраст упал, на градиентах неба появились какие-то искажённые линии, а ваш FPS в процессе ужасен. Кажется, что ПО сломано, а ИИ-модели взбесились и вместо «качественного апскейла» портят картинку. Но я не сдался и пробыл в этой кроличьей норе из медиаформатов и апскейлеров более чем полмесяца, собрав все грабли с до смешного прозаичными, но не всегда очевидными решениями. И прежде чем найти истоки проблем, мы кратко разберём теорию, а после — практические решения по каждому из шагов. И, забегая вперёд: на первый взгляд здесь абсолютно всё контринтуитивно.

    habr.com/ru/companies/ruvds/ar

    #апскейлинг #нейросети #реставрация_видео #RVE #FFmpeg #TensorRT #цветовое_пространство #бандинг #open_source #ruvds_статьи

  4. New research shows TensorRT Edge‑LLM can run chain‑of‑thought reasoning directly on devices, boosting physical AI tasks like autonomous‑vehicle perception and MATH500 benchmarks. Efficient, on‑device inference means smarter, safer robots without cloud latency. Dive into the details of this breakthrough for on‑device language models. #TensorRT #EdgeLLM #ChainOfThought #PhysicalAI

    🔗 aidailypost.com/news/tensorrt-

  5. Habe nun seit einer Woche ein vollständig lokales Setup mit #Homeassistant #Voice am laufen.
    #Whisper large v3 und #LLM läuft auf einem Jetson Orin AGX. Allerdings bin ich mit der Geschwindigkeit von #ollama noch nicht zufrieden. Ich muss mal #vllm oder #tensorRT-llm testen. Kann aber auch am Modell #gpt-oss:20b liegen, wobei das zumindest uneindeutige Anfragen gut interpretiert. Aber alles über 10 Sekunden Wartezeit ist zu lang.
    Whisper versteht leider auch Frauenstimmen nicht 100% zuverlässig

  6. Под капотом современных AI-систем: разбираем железо

    Как объединить по сети вычислители? Что происходит при компиляции кода для железа под капотом и какие есть нюансы при работе с AI в пространстве ядра? ИИ с ноги ворвался во все сферы разработки, работы — вагон и маленькая тележка. Но на чём и как она должна ехать? У каждой программы есть свои требования, универсальных советов нет. О новых решениях можно будет узнать на конференции

    habr.com/ru/companies/oleg-bun

    #разработка #конференция #ии #ai #компиляторы #rust #tensorrt #нейросети #архитектура #архитектура_приложений

  7. Эффективный инференс множества LoRA адаптеров

    LoRA — популярный метод дообучения больших моделей на небольших датасетах, однако на этапе инференса низкоранговые адаптеры работают неэффективно, а их объединение с весами требует хранения отдельной полной копии модели для каждого адаптера. MultiLoRA решает эту проблему, позволяя одновременно выполнять инференс с несколькими адаптерами на основе одной базовой модели. В статье мы сравним производительность MultiLoRA-инференса в двух популярных фреймворках — vLLM и TensorRT-LLM . Тесты проведём на готовых релизных Docker-образах, оценивая, какой фреймворк эффективнее обрабатывает батчи запросов в сценариях, близких к офлайн и асинхронному инференсу.

    habr.com/ru/articles/922290/

    #multilora #offline_inference #async_inference #vllm #TensorRTLLM #tensorrt #peft #inference #benchmark #lora

  8. Как просто добавить ИИ в приложения на Rust: универсальный опенсорсный инструмент

    Системный разработчик ИТ-компании «Криптонит» написал статью про новый инструмент на Rust, который облегчает запуск моделей машинного обучения и их внедрение в приложения. Дальше публикуем текст от первого лица. Статья написана по материалам выступления Михаила на RustCon 2024. Посмотреть видеозапись доклада можно в VK Видео .

    habr.com/ru/companies/kryptoni

    #rust #библиотека #машинное_обучение #ml #модели #triton #deepstream #tensorrt #cuda #ии

  9. Fitting an LLM on a GPU is a bit like photography. Model weights = film sensitivity, activation size = shutter speed, I/O tensors = aperture. These 3 dials control your model's memory footprint, just as they shape a photo's exposure.

    Just realised this while trying to fit Llama 3.1 on my 24GB GPU with TRT-LLM: nvidia.github.io/TensorRT-LLM/.

  10. Many companies are currently scrambling for ML infra engineers. They need people that know how to manage AI infrastructure, and that can seriously speed up training and inference with specialized tooling like vLLM, Triton, TensorRT, Torchtune, etc.

  11. Note to self: #NVIDIA have an open-source inference server for machine learning models. (They mostly sell SaaS on top of it)

    Supports #TensorFlow, #PyTorch, #ONNX, #TensorRT, #mxnet.

    Runs on #k8s. Features queue control, monitoring.

    Triton Inference Server github.com/triton-inference-se

  12. Why does #Nvidia #TensorRT have four different installation methods? Two of which will mess up your system in different extremely-hard-to-fix ways, one which won't work on any SRU distribution, and only one that works at all? It's like they are trying to make it as hard as possible to install.

    stackoverflow.com/questions/75

    github.com/NVIDIA/TensorRT/iss