home.social

#rtx_5090 — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #rtx_5090, aggregated by home.social.

fetched live
  1. MoE на 5090 недобирает полтора раза, и дело не в маршрутизации

    RTX 5090, одна и та же сборка llama.cpp, один драйвер, батч 1. Плотная Qwen3.5-9B выбирает 72% пропускной способности памяти карты. MoE Qwen3.5-35B-A3B на той же карте выбирает 41%. Маршрутизация экспертов тут почти ни при чём, я её измерил: ядра top-k занимают 7% времени. CUDA-графы захватываются, дыр между запусками нет, занятость SM 97%. Карта работает почти всё время, просто делает работу медленнее, чем позволяет память. Причина оказалась в том, сколько байт читает одно ядро за запуск. Я написал программу на ggml, которая гоняет тот же mul_mat_vec_q на холодных весах, и снял кривую: на 1 МБ ядро берёт 23% полосы, на 4.2 МБ уже 53%, на 33.6 МБ 91%. У MoE на одно ядро приходится 4.6 МБ, у плотной модели 22.2 МБ. Вот и весь разрыв. В статье: разбивка всех 437 матвеков по трассе nsys, четыре способа померить это неправильно и посидеть в каждой ловушке по очереди, проверка модели на другой архитектуре с ошибкой 3.7% и на четырёх глубинах контекста, цена сэмплера и всей обвязки llama-server. Последнее оказалось крупнее всего остального: пользователь видит 225 токенов в секунду там, где бенчмарк показывает 317.

    habr.com/ru/articles/1069574/

    #llamacpp #moe #rtx_5090 #пропускная_способность_памяти #cuda #gpu #инференс_ллм #бенчмарк #профилирование #qwen_35

  2. Миллион токенов за 1 ₽ или за 20 726 ₽: одна RTX 5090, и почему API все равно дешевле

    Разговор повторяется раз в месяц: платим за API прилично, может, купим свою карту? Сел и разложил все в цифры. Час своей 5090 в рублях, пропускная способность по замерам, точка безубыточности против семи сервисов, полная смета первого года. Разницу в 20 тысяч раз делает не железо, а то, сколько часов в сутки оно занято. Посчитать свое

    habr.com/ru/articles/1066424/

    #RTX_5090 #локальный_инференс #стоимость_токена #vLLM #KVкэш #окупаемость_GPU #LLM_на_своём_железе #DeepSeek #YandexGPT #TCO

  3. Т9 за сотню долларов, ассистент за миллиард: сколько на самом деле стоит обучить LLM с нуля

    «Лучший ChatGPT за $100», «китайцы обучили GPT-4 за шесть миллионов», «модель с нуля на одной игровой карте за вечер» — за последний год такие заголовки идут потоком. Почти все цифры в них честные. Беда в том, что они про разные вещи. За словами «обучить LLM» прячется лестница в семь порядков: от десятков долларов на карте под столом до миллиарда на фронтире. На каждой ступени за деньги покупают разное, и перепутать ступени дорого. Я работаю CTO ML-команды. Расчет «взять открытые веса / дообучить / обучить с нуля» мы проделываем регулярно, и почти всегда он заканчивается не там, где ждет заказчик. Ниже — вся лестница с числами и первоисточниками: что реально обучить на RTX 5090, где начинается аренда кластера, из чего складывается смета фронтир-модели и почему «модель за $6 млн» и «компания с инфраструктурой на миллиард» — правда одновременно. Посчитать свою LLM

    habr.com/ru/articles/1060916/

    #LLM #обучение_LLM #pretraining #машинное_обучение #нейросети #GPU #RTX_5090 #H100 #стоимость_обучения_моделей #nanochat

  4. NVIDIA GeForce RTX 5090D V2 и стоит ли её покупать

    Некоторое время назад NVIDIA официально анонсировала GeForce RTX 5090D V2. Не все поняли, что это означает, но «зелёные» любят такой нейминг, чем немного путают тех, кто не очень разбирается в видеокартах. Если коротко, то это специальная версия флагманской видеокарты для китайского рынка. Новая модель заменила оригинальную RTX 5090D на веб-сайте компании, что подтверждает окончание производства предыдущей версии. Давайте разберёмся, что это значит, и стоит ли её покупать.

    habr.com/ru/companies/x-com/ar

    #xcomshop #rtx_5090d #rtx_5090 #RTX_5090D_V2 #ai #гейминг

  5. Почему Galax HOF лучшее исполнение видеокарт или как ставят рекорды разгона

    Я занимаюсь разгоном компьютеров много лет, даже устанавливал мировые рекорды (Золото на HWBOT) и попадал в новости. Приоткрою завесу тайны над софтом и железом, которые скорее всего никогда не попадет к обывателям и обьяснит, почему вас обманывают маркетологи с кучей версий видеокарт и что реально нужно покупать. Сегодня я расскажу вам о том, что не покажут по телевизору, об этом вы не прочитаете в газетах и даже ваши блогеры на ютубе не расскажут.Речь о секретных скрижалях и о том, какое же исполнение видеокарты лучшее без возможности дискуссии.Об этом вам не расскажут полуремонтники полублогеры, с полузнаниями путающие кнопку включения 100% оборотов вентиляторов с кнопкой переключения между биосами. Единственной видеокартой кардинально отличающейся от всех других является Galax/KFA2 HOF, а именно версии 3080ти 3090 3090ти 4090 и будущая 5090.Все остальные карты не имеет смысла обсуждать с точки зрения компонентной базы и прочего, ведь их возможности ограничены.Чем же хорош хоф? Тем что карта изначально проектируется под потребление до 1000ватт и выше. Качественная элементная база и возможность обойти все ограничения Nvidia. Все что дальше распространялось под NDA в западных странах( сам софт) но и о его возможностях нигде не писали, полу ремонтники этого не знают.Специальный софт в комплекте с биосом который в народе называют 1000w позволяет выйти далеко за пределы ограничений nvidia.На 3000 линейке, биос слили в сеть и пользователи с другими картами могли прошить его и выйти за предели 450ватт лимита, но весь остальной функционал у них не работал, т.к аппаратно карты были другие.

    habr.com/ru/articles/882266/

    #видеокарты #разгон #компьютеры #nvidia #rtx_4090 #rtx_3090 #rtx_3080ti #rtx_3090ti #rtx_5090 #софт