home.social

#selfhosted_llm — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #selfhosted_llm, aggregated by home.social.

fetched live
  1. Локальный запуск LLM для SOC: сколько инцидентов обработает одна GPU? Часть 2

    Всем привет! На связи Сергей Иванов, аналитик технологий машинного обучения R‑Vision. В первой части эксперимента мы выяснили, как на производительность локальной LLM влияют длина контекста, количество параллельных запросов и объем генерируемого ответа. Стресс‑тесты позволили определить границы конфигурации Qwen3.5–122B‑A10B‑GPTQ, vLLM и NVIDIA RTX PRO 6000 Blackwell Max‑Q с 96 GB видеопамяти. Однако предельная конкурентность и скорость генерации сами по себе еще не показывают, насколько такая конфигурация подходит для реального SOC. В промышленном сценарии запросы поступают не равномерно и не изолированно. Они создаются карточками инцидентов, шагами ИИ‑оркестратора и действиями аналитиков, а порядок их выполнения определяется логикой расследования. Во второй части эксперимента мы перешли от лабораторных измерений к моделированию реальной работы SOC. Мы оценили, как GPU справляется с инференсом LLM при разной численности команды и интенсивности потока инцидентов — от спокойной смены до пиковых ситуаций с массовым поступлением новых инцидентов. Важно отметить, что в эксперименте использовались не специально подготовленные тестовые примеры, а анонимизированные реальные инциденты из практики нашего внутреннего SOC. Отдельно остановимся на режиме рассуждений. В сценарии интеграции LLM в конвейер R‑Vision SOAR мы сознательно использовали модель с отключенным thinking mode (режимом рассуждений). Ниже на результатах реальных экспериментов покажем, почему именно такой режим оказался наиболее эффективным для задач SOC.

    habr.com/ru/companies/rvision/

    #llm #soc #gpu #автоматизация_SOC #nvidia_rtx_pro_6000_blackwell #vllm #qwen35 #AI_в_SOC #инференс_llm #selfhosted_llm

  2. Qwen3.5 на двух V100, reverse SSH вместо Cloudflare в Telegram Mini App: собираю AI-репетитора английского

    У меня в углу комнаты стоит сервер с двумя Tesla V100 32GB. Они доcтались мне для другой задачи, которая отвалилась, и полгода стояли мёртвым грузом. Параллельно я в очередной раз пробовал заниматься английским — Simpler, Doalingo, ещё пара продуктов. Хорошие, но мне не подходил формат: я хотел сценарий «открыл телефон дома на семь минут, поговорил, закрыл». Без расписания, без камеры, без поиска тьютора, который понимает мой акцент с пятого раза. Сошлось. Идея: Telegram Mini App, в нём кнопка «говорить», за ней — AI-репетитор, который слышит, что я сказал, отвечает голосом, помнит контекст разговора, тыкает в мои повторяющиеся ошибки и подбрасывает слова, которые я пытаюсь выучить. Полностью бесплатно. Модель Qwen3.5 вышла 25 февраля , я её гоняю всего несколько недель, продукт сырой. Эта статья — про архитектурные решения и про то, на какие грабли я уже успел наступить.

    habr.com/ru/articles/1042166/

    #vllm #qwen35 #telegram_bot #telegram_mini_apps #aiogram_3 #fastapi #selfhosted_llm #kokoro_tts #whisper #tesla_v100

  3. Как мы собрали локальный AI-сервер на 4× RTX 4090 с водянкой — кейс для крупного клиента

    Авантюра на 4× RTX 4090, два блока питания и водяное охлаждение - машину, которую мы собрали для крупного клиента, еле-еле подняли вдвоём. История о том, как мы собрали махину в 96 GB VRAM. Внутри - полная сборка и бенчмарки популярных моделей.

    habr.com/ru/articles/1032698/

    #RTX_4090 #vLLM #onpremise #локальный_AI_сервер #локальный_ИИ_сервер #водяное_охлаждение #LLM_inference #GPU_сервер #речевая____
    __аналитика #selfhosted_LLM

  4. Почему self-hosted LLM падает в проде

    Привет! Меня зовут Андрей Пахомов, я разработчик в AI Platform Битрикс24. Сегодня расскажу, почему self-hosted LLM ломается в проде, где на самом деле возникают проблемы и какие метрики помогают вовремя это увидеть.

    habr.com/ru/companies/bitrix/a

    #selfhosted_LLM #LLM_в_продакшене #vLLM #observability #мониторинг_LLM