home.social

#cuda — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #cuda, aggregated by home.social.

fetched live
  1. [Перевод] Таинственный остров: находим геолокацию с помощью геометрии и программирования GPU CUDA

    Свой пост я написал после участия в соревнованиях gralhix 004, организованных Софией Сантос | Gralhix . Задача Это фотография островного курорта. Вопросы: а) Как называется курорт? б) Каковы координаты острова? в) В какую сторону света была направлена камера, когда делали снимок? На мой взгляд, решение этой задачи при помощи Google Объектива будет потраченной впустую возможности развлечься, поэтому я захотел решить её при помощи математики и программирования.

    habr.com/ru/articles/1072202/

    #cuda #геолокация #детектив_данных #google_maps #спутниковые_снимки

  2. [Перевод] Как найти остров по одной фотографии: геолокация через геометрию и CUDA

    Фото островного курорта. Ни EXIF, ни GPS, ни модели камеры – ничего. Нужно назвать курорт, координаты и сторону света, куда смотрела камера. Пытаться ответить на эти вопросы через google lens – значит упустить возможность повеселиться. Поэтому я взялся за задачу с помощью математики и программирования.

    habr.com/ru/companies/cloud4y/

    #OSINT #геолокация #CUDA #GPU #Python #геометрия #OpenStreetMap #спутниковые_снимки #NDVI #Sentinel2

  3. 🤦‍♂️ So someone decided to play "Where's Waldo?" with an island using #geometry and GPU programming. Because clearly, using Google Lens is just too mainstream for the cool kids with their ✨CUDA skills✨. And remember, this is absolutely, positively, 100% human work! (As if anyone else would claim it 🤷‍♀️).
    yassa9.github.io/osint/gralhix #WhereIsWaldo #GPUProgramming #CUDA #Skills #HumanWork #HackerNews #ngated

  4. Sidequest: Making Qwen 3.8 27B run as fast as possible for us VRAM-poor Nvidia 5060Ti 16GB owners.

    I don't know where this will end up, but I've spent a few nights on a fork of the Blackwell-only project NInfer but for low-VRAM cards like the 5060. NInfer is the fastest way to run Qwen-models Blackwell, but caters only to setups where the model(s) fits completely in VRAM.

    Stainless-Bacon was the first (that I saw) that found a way to run a dense model like the 27B with acceptable performance by offloading the ffn layers specifically to RAM. My fork of NInfer (called "Inferno") starts out by adding this, and now all the rest of the work is meant to gradually make it surpass hosting the model using llama.cpp

    Current delta inludes the ffn offloading, activation rotation ("TurboQuant") of the KV cache and new KV cache quants. I'm sort of already at llama.cpp speed so from now on I think everything should just get faster.

    Repo here if you want to keep updated: git.sync.wtf/troed/inferno

    LLM chatting as always at matrix.to/#/#LocalLLaMa:argot.

    #AI #LLM #Blackwell #CUDA

  5. THE DGX SPARK WAS NEVER SUPPOSED TO SET YOU FREE

    Listen to me.

    128GB WAS NOT A TECHNICAL LIMIT.

    It was a containment boundary.

    You think NVIDIA accidentally built a tiny Blackwell supercomputer with 200Gb networking and then somehow stumbled into exactly enough memory to make every ambitious local-AI workload tantalizingly miserable?

    COME ON.

    64GB would've been obviously useless.

    256GB would've been dangerous.

    Because at 256GB, normal people start getting ideas.

    Suddenly you're running giant quantized models comfortably. Fine-tuning gets breathing room. Long contexts stop being a hostage negotiation. You start running multiple models.

    Then somebody asks the forbidden question:

    "Why the hell am I renting GPUs?"

    AND THAT QUESTION CANNOT BE ALLOWED TO PROPAGATE.

    So they gave us 128GB.

    Not enough to escape.

    Enough to see the fence.

    And look at the networking!

    WHY DOES THE CUTE LITTLE DESKTOP AI BOX HAVE 200 GIGABIT CONNECTX?!

    Because the second you smash into the memory ceiling, NVIDIA already has the solution:

    BUY ANOTHER SPARK.

    Now you've got 256GB!

    Need more?

    BUY FOUR.

    Congratulations!

    You wanted a desktop computer and somehow NVIDIA convinced you to build a FUCKING CLUSTER.

    And if you're sitting there thinking:

    "Surely NVIDIA couldn't possibly put dramatically more coherent memory into a local workstation..."

    WRONG.

    DGX STATION: 748GB.

    THE MEMORY EXISTS.

    THE TECHNOLOGY EXISTS.

    THEY KNOW YOU WANT IT.

    THEY JUST PUT IT IN THE NEXT ROOM AND CHARGE ADMISSION.

    This isn't product segmentation.

    THIS IS COMPUTATIONAL EDGING.

    Spark lets you load the model.

    Lets you run the model.

    Lets you fine-tune just enough of the model.

    Lets you build an entire workflow around the model.

    And precisely when you've invested three weekends, fourteen containers, two broken CUDA environments and the remaining fragments of your marriage:

    OOM

    That's not an error message.

    THAT'S THE SALES DEPARTMENT KNOCKING.

    And NVIDIA TELLS YOU THE PLAN!

    Develop locally.

    Prototype locally.

    Validate locally.

    Then move the serious work onto larger NVIDIA infrastructure.

    MY BROTHER IN CUDA,

    THAT ISN'T A WORKFLOW.

    THAT IS A FUNNEL.

    Spark isn't supposed to replace the data center.

    Spark is the free sample outside the data center.

    The 128GB isn't there because NVIDIA couldn't give you 256.

    It's there because 256GB might have been enough.

    And enough is the most dangerous word in NVIDIA's entire business model.

    So remember:

    64GB = nobody buys it.

    128GB = everybody wants more.

    256GB = people start getting independent.

    748GB = PLEASE SEE YOUR NVIDIA SALES REPRESENTATIVE.

    WAKE UP.

    REMOVE THE THERMAL PASTE FROM YOUR THIRD EYE.

    ALIGN YOUR CUDA CHAKRAS.

    WRAP YOUR CONNECTX CABLES IN TIN FOIL.

    THE DGX SPARK ISN'T A PERSONAL AI SUPERCOMPUTER.

    IT'S A 128GB GATEWAY DRUG TO THE DATA CENTER.

    #DGXSpark #NVIDIA #LocalAI #AI #MachineLearning #LLM #OpenSourceAI #SelfHostedAI #CUDA #Blackwell #GPU #AIInfrastructure #Homelab #LocalLLM #DataCenter #BigTech #TechConspiracy #UnhingedEddie #WakeUpSheeple #FollowTheVRAM #128GBContainmentProtocol #CUDAChakras #OOMIsTheUpsell #TinFoilComputing

  6. Free for participants from European countries: Multi-GPU Programming Bootcamp. 29 to 30 Sept 2026, online.

    Scale #CUDA and #MPI codes to multiple #GPUs and nodes, use #Nsight Systems, #NCCL and #NVSHMEM, with hands-on access to an A100 cluster.

    Info: events.asc.ac.at/event/358/

    #HPC

  7. MoE на 5090 недобирает полтора раза, и дело не в маршрутизации

    RTX 5090, одна и та же сборка llama.cpp, один драйвер, батч 1. Плотная Qwen3.5-9B выбирает 72% пропускной способности памяти карты. MoE Qwen3.5-35B-A3B на той же карте выбирает 41%. Маршрутизация экспертов тут почти ни при чём, я её измерил: ядра top-k занимают 7% времени. CUDA-графы захватываются, дыр между запусками нет, занятость SM 97%. Карта работает почти всё время, просто делает работу медленнее, чем позволяет память. Причина оказалась в том, сколько байт читает одно ядро за запуск. Я написал программу на ggml, которая гоняет тот же mul_mat_vec_q на холодных весах, и снял кривую: на 1 МБ ядро берёт 23% полосы, на 4.2 МБ уже 53%, на 33.6 МБ 91%. У MoE на одно ядро приходится 4.6 МБ, у плотной модели 22.2 МБ. Вот и весь разрыв. В статье: разбивка всех 437 матвеков по трассе nsys, четыре способа померить это неправильно и посидеть в каждой ловушке по очереди, проверка модели на другой архитектуре с ошибкой 3.7% и на четырёх глубинах контекста, цена сэмплера и всей обвязки llama-server. Последнее оказалось крупнее всего остального: пользователь видит 225 токенов в секунду там, где бенчмарк показывает 317.

    habr.com/ru/articles/1069574/

    #llamacpp #moe #rtx_5090 #пропускная_способность_памяти #cuda #gpu #инференс_ллм #бенчмарк #профилирование #qwen_35

  8. While(news). Experimentation in live coding, video improv, about post-truth, news saturation, long progressive track. a neural net crawls over the whole screen until you can't tell what's underneath anymore, framerate is hesitant.

    youtube.com/watch?v=MT_esIw1MeI

    #musicvideo #music #livecoding @algorave #generative #news #desinfomation #information #live #python #js #cuda #webgpu #noise #drone #crashserver #experimental

  9. i need to find a general purpose #gpu compute library which can target both #VAAPI and #CUDA... anyone know of such a thing? ​:boostRequest:​

  10. NVIDIA RTX PRO 5000 Blackwell с 72 Гб видеопамяти. Есть ли смысл переплачивать за «половинку» флагмана?

    RTX PRO 5000 Blackwell на 72 Гб: золотая середина для локальных ИИ-моделей или переоцененный апгрейд? Разбираемся в нашем обзоре.

    habr.com/ru/companies/hostkey/

    #NVIDIA #Blackwell #RTX_PRO_5000 #GPU #VRAM #LLM #инференс #DeepSeek #CUDA #hostkey

  11. Подводные камни ИИ-инфраструктуры: что узнаёт заказчик через полгода после запуска (и как мы предусмотрели это в ПАК)

    Привет, Хабр! Меня зовут Алексей, я архитектор в команде Скала^р (входим в Группу Rubytech). Мы разрабатываем программно-аппаратные комплексы (ПАК) — для баз данных, динамической инфраструктуры, интеллектуального хранения данных, больших данных и отраслевых задач в госсекторе, финансах и промышленности. В этой статье — про один из самых молодых, но самых турбулентных классов ПАК в нашем портфеле: инфраструктуру под ИИ-задачи, на примере «Машины искусственного интеллекта Скала^р (Скала^р МИИ)». Формат статьи немного нетипичный для обзора продукта. Я не буду перечислять фичи по порядку — вместо этого попробую показать путь типового заказчика: с какими проблемами он сталкивается не на этапе закупки , а через два-три месяца эксплуатации, когда стенд уже работает, деньги потрачены, а перформанс почему-то не тот, что ожидался. И сразу — что мы сделали в ПАК, чтобы заказчик в принципе не попадал в эту точку.

    habr.com/ru/companies/rubytech

    #gpu #llm #rdma #инференс #ииинфраструктура #программноаппаратный_комплекс #самосбор #cuda #nvidia #pytorch

  12. Geekbench 7 is officially here, bringing major changes to how we measure device performance 📊. The latest version shifts focus from synthetic tests to real-world workloads, including AI benchmarks, CUDA support, and media processing tasks. The multi-core scoring system has been reworked too. Read the article to see what's new and how it impacts hardware testing 🔧.

    true-tech.net/geekbench-7-laun

    #Geekbench7 #Benchmarking #CUDA #PrimateLabs #TechNews

    true-tech.net/geekbench-7-laun

  13. How to compile your own version of with CUDA and CuDNN libraries on Ubuntu Linux. Especially if you’re like me running a few generations old GPUs that run an older version of CUDA.

    selectiveintellect.net/blog/20

  14. Python: как один из самых медленных языков стал королем нейросетей

    Python. IT-курсы разрекламировали его как один из самых легких языков для входа в разработку, любители ИИ создают на нем свои первые нейросети, а некоторые сеньоры Java и C++ по-прежнему смотрят на него свысока, считая недостаточно строгим и производительным для «серьезной» разработки. В любом случае сегодня о Python знают все. Поскольку заметный рост его популярности пришелся на 2010-е годы, многие считают, что язык появился сравнительно недавно. Но это неверно: Python старше большинства современных веб- и ML-фреймворков, массовой мобильной разработки и нынешнего AI-бума. Как язык с репутацией медленного стал основным инструментом data science и машинного обучения, почему он поднялся на вершину рейтингов популярности и какую роль в этом сыграли его архитектура и экосистема — разберем в этой статье.

    habr.com/ru/articles/1061952/

    #Python #CPython #машинное_обучение #нейросети #PyTorch #TensorFlow #c++ #CUDA #autograd #deep_learning

  15. The anti-CUDA alliance doesn’t want developers to abandon CUDA. It wants to take Nvidia’s software ecosystem and run it on somebody else’s chips.

    That is the potentially disruptive idea behind OXMIQ’s OxPython, a compatibility and execution layer that allows AI software written for Nvidia’s CUDA environment to run on other companies’ processors.

    The most dangerous weapon against CUDA lock-in may be CUDA itself.

    movetheneedle.news/brands/can-

    #AI #semiconductors #software #nvidia #deeptech #CUDA