#dgx_spark — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #dgx_spark, aggregated by home.social.
-
Что значит развернуть LLM локально: два дня с vLLM, DGX Spark и настоящими ограничениями
Когда меня однажды спросили, что такое инференс и как выглядит локальное развёртывание модели, я ответил правильно, но слишком общо. Через несколько дней пришлось пройти этот путь целиком: поднять две LLM на NVIDIA DGX Spark, отдельную ASR-модель на AMD GPU и подключить всё к мультиагентной платформе. В статье — инженерный разбор того, почему файлы модели ещё не сервис, как длинный контекст конкурирует с KV-кэшем и параллелизмом, почему tokens/sec не описывают пользовательскую задержку и зачем иногда откатывать более быструю модель из-за качества.
https://habr.com/ru/articles/1081324/
#LLM #inference #vLLM #CUDA #ROCm #DGX_Spark #AIагенты #ASR #KVкэш #локальный_ИИ
-
Что значит развернуть LLM локально: два дня с vLLM, DGX Spark и настоящими ограничениями
Когда меня однажды спросили, что такое инференс и как выглядит локальное развёртывание модели, я ответил правильно, но слишком общо. Через несколько дней пришлось пройти этот путь целиком: поднять две LLM на NVIDIA DGX Spark, отдельную ASR-модель на AMD GPU и подключить всё к мультиагентной платформе. В статье — инженерный разбор того, почему файлы модели ещё не сервис, как длинный контекст конкурирует с KV-кэшем и параллелизмом, почему tokens/sec не описывают пользовательскую задержку и зачем иногда откатывать более быструю модель из-за качества.
https://habr.com/ru/articles/1081324/
#LLM #inference #vLLM #CUDA #ROCm #DGX_Spark #AIагенты #ASR #KVкэш #локальный_ИИ
-
Что значит развернуть LLM локально: два дня с vLLM, DGX Spark и настоящими ограничениями
Когда меня однажды спросили, что такое инференс и как выглядит локальное развёртывание модели, я ответил правильно, но слишком общо. Через несколько дней пришлось пройти этот путь целиком: поднять две LLM на NVIDIA DGX Spark, отдельную ASR-модель на AMD GPU и подключить всё к мультиагентной платформе. В статье — инженерный разбор того, почему файлы модели ещё не сервис, как длинный контекст конкурирует с KV-кэшем и параллелизмом, почему tokens/sec не описывают пользовательскую задержку и зачем иногда откатывать более быструю модель из-за качества.
https://habr.com/ru/articles/1081324/
#LLM #inference #vLLM #CUDA #ROCm #DGX_Spark #AIагенты #ASR #KVкэш #локальный_ИИ