home.social

#gemm — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #gemm, aggregated by home.social.

fetched live
  1. Микроядро SME2 sgemm: 1024 умножения-сложения за проход

    В этой части мы возьмём первый из пропусков BLIS — микроядро sgemm ; сначала зафиксируем форму аккумулятора 32×32 в четырёх тайлах ZA, затем разберём горячий цикл по K, потом эпилог с alpha , beta и ловушкой NaN, а в конце посмотрим, какие числа производительности даёт именно это ядро. Следующая часть оставит структуру почти той же, но заменит геометрию тайла и условия существования ядра.

    habr.com/ru/articles/1071462/

    #BLIS #GEMM #SME2 #Apple_Silicon #микроядро #кэшблокинг #упаковка_данных #высокопроизводительные_вычисления #линейная_алгебра #BLAS

  2. Микроядро SME2 sgemm: 1024 умножения-сложения за проход

    В этой части мы возьмём первый из пропусков BLIS — микроядро sgemm ; сначала зафиксируем форму аккумулятора 32×32 в четырёх тайлах ZA, затем разберём горячий цикл по K, потом эпилог с alpha , beta и ловушкой NaN, а в конце посмотрим, какие числа производительности даёт именно это ядро. Следующая часть оставит структуру почти той же, но заменит геометрию тайла и условия существования ядра.

    habr.com/ru/articles/1071462/

    #BLIS #GEMM #SME2 #Apple_Silicon #микроядро #кэшблокинг #упаковка_данных #высокопроизводительные_вычисления #линейная_алгебра #BLAS

  3. Микроядро SME2 sgemm: 1024 умножения-сложения за проход

    В этой части мы возьмём первый из пропусков BLIS — микроядро sgemm ; сначала зафиксируем форму аккумулятора 32×32 в четырёх тайлах ZA, затем разберём горячий цикл по K, потом эпилог с alpha , beta и ловушкой NaN, а в конце посмотрим, какие числа производительности даёт именно это ядро. Следующая часть оставит структуру почти той же, но заменит геометрию тайла и условия существования ядра.

    habr.com/ru/articles/1071462/

    #BLIS #GEMM #SME2 #Apple_Silicon #микроядро #кэшблокинг #упаковка_данных #высокопроизводительные_вычисления #линейная_алгебра #BLAS

  4. BLIS: недостающую среднюю ступеньку построили тридцать лет назад

    В этой части мы начнём с тупика, в который приводит голый цикл FMOPA ; затем покажем, какую часть GEMM BLIS уже построил за нас; после этого разберём пять циклов BLIS и место микроядра внутри них. Финал главы должен сделать дальнейший план конкретным: что именно нужно добавить для Apple SME, а что уже относится к готовой «мебели» фреймворка.

    habr.com/ru/articles/1069058/

    #BLIS #GEMM #SME2 #Apple_Silicon #микроядро #кэшблокинг #упаковка_данных #высокопроизводительные_вычисления #линейная_алгебра #BLAS

  5. BLIS: недостающую среднюю ступеньку построили тридцать лет назад

    В этой части мы начнём с тупика, в который приводит голый цикл FMOPA ; затем покажем, какую часть GEMM BLIS уже построил за нас; после этого разберём пять циклов BLIS и место микроядра внутри них. Финал главы должен сделать дальнейший план конкретным: что именно нужно добавить для Apple SME, а что уже относится к готовой «мебели» фреймворка.

    habr.com/ru/articles/1069058/

    #BLIS #GEMM #SME2 #Apple_Silicon #микроядро #кэшблокинг #упаковка_данных #высокопроизводительные_вычисления #линейная_алгебра #BLAS

  6. BLIS: недостающую среднюю ступеньку построили тридцать лет назад

    В этой части мы начнём с тупика, в который приводит голый цикл FMOPA ; затем покажем, какую часть GEMM BLIS уже построил за нас; после этого разберём пять циклов BLIS и место микроядра внутри них. Финал главы должен сделать дальнейший план конкретным: что именно нужно добавить для Apple SME, а что уже относится к готовой «мебели» фреймворка.

    habr.com/ru/articles/1069058/

    #BLIS #GEMM #SME2 #Apple_Silicon #микроядро #кэшблокинг #упаковка_данных #высокопроизводительные_вычисления #линейная_алгебра #BLAS

  7. Re-reading the old BLAS level 3 and #FLAME papers about microkernels and performance for performant #GEMM implementations in #BLAS, #GotoBLAS and #BLIS. I had forgotten how well written they are!

  8. Re-reading the old BLAS level 3 and #FLAME papers about microkernels and performance for performant #GEMM implementations in #BLAS, #GotoBLAS and #BLIS. I had forgotten how well written they are!

  9. Умножение матриц: пример использования расширения ARM SME2 в Apple M4 Pro

    В конце 2020 года я купил MacBook Pro 13 на процессоре Apple M1, очень хотелось испытать процессоры на архитектуре ARM. Почти сразу на чипе Apple M1 был найден вычислительный блок для матричных операций Apple AMX. Для Apple AMX не было документации, он не использовался в Apple Accelerate , но несколько энтузиастов занимались реверс-инжинирингом и анализом производительности ( " github.com/corsix/amx " ). В 2024 году вышли компьютеры на базе семейства процессоров Apple M4, у которых блок AMX задействован для выполнения инструкций из Scalable Matrix Extension 2 (сайт ARM недоступен в РФ) (ARM SME2). В статье рассмотрим использование расширения ARM SME2 на примере умножения заполненных матриц. Увидим, как выжать максимум из процессора и получить прирост производительности в десятки раз.

    habr.com/ru/articles/1012528/

    #ARM_SME #Apple_M #gemm #умножение_матриц #линейная_алгебра #вычислительные_методы #высокопроизводительные_вычисления #оптимизация_кода #векторные_инструкции #векторные_исчисления

  10. Умножение матриц: пример использования расширения ARM SME2 в Apple M4 Pro

    В конце 2020 года я купил MacBook Pro 13 на процессоре Apple M1, очень хотелось испытать процессоры на архитектуре ARM. Почти сразу на чипе Apple M1 был найден вычислительный блок для матричных операций Apple AMX. Для Apple AMX не было документации, он не использовался в Apple Accelerate , но несколько энтузиастов занимались реверс-инжинирингом и анализом производительности ( " github.com/corsix/amx " ). В 2024 году вышли компьютеры на базе семейства процессоров Apple M4, у которых блок AMX задействован для выполнения инструкций из Scalable Matrix Extension 2 (сайт ARM недоступен в РФ) (ARM SME2). В статье рассмотрим использование расширения ARM SME2 на примере умножения заполненных матриц. Увидим, как выжать максимум из процессора и получить прирост производительности в десятки раз.

    habr.com/ru/articles/1012528/

    #ARM_SME #Apple_M #gemm #умножение_матриц #линейная_алгебра #вычислительные_методы #высокопроизводительные_вычисления #оптимизация_кода #векторные_инструкции #векторные_исчисления

  11. Умножение матриц: пример использования расширения ARM SME2 в Apple M4 Pro

    В конце 2020 года я купил MacBook Pro 13 на процессоре Apple M1, очень хотелось испытать процессоры на архитектуре ARM. Почти сразу на чипе Apple M1 был найден вычислительный блок для матричных операций Apple AMX. Для Apple AMX не было документации, он не использовался в Apple Accelerate , но несколько энтузиастов занимались реверс-инжинирингом и анализом производительности ( " github.com/corsix/amx " ). В 2024 году вышли компьютеры на базе семейства процессоров Apple M4, у которых блок AMX задействован для выполнения инструкций из Scalable Matrix Extension 2 (сайт ARM недоступен в РФ) (ARM SME2). В статье рассмотрим использование расширения ARM SME2 на примере умножения заполненных матриц. Увидим, как выжать максимум из процессора и получить прирост производительности в десятки раз.

    habr.com/ru/articles/1012528/

    #ARM_SME #Apple_M #gemm #умножение_матриц #линейная_алгебра #вычислительные_методы #высокопроизводительные_вычисления #оптимизация_кода #векторные_инструкции #векторные_исчисления

  12. Учимся разрабатывать для GPU на примере операции GEMM

    Привет, Хабр! Сегодня я расскажу про реализацию матричного умножения и особенности разработки для GPU. Познакомлю вас с устройством GPU, объясню, чем отличается программирование от привычного для CPU, какие нюансы нужно учитывать для эффективной реализации операций GEMM. А затем сравним производительность разных подходов к реализации.

    habr.com/ru/companies/yadro/ar

    #gpu_вычисления #opencl #gemm

  13. Учимся разрабатывать для GPU на примере операции GEMM

    Привет, Хабр! Сегодня я расскажу про реализацию матричного умножения и особенности разработки для GPU. Познакомлю вас с устройством GPU, объясню, чем отличается программирование от привычного для CPU, какие нюансы нужно учитывать для эффективной реализации операций GEMM. А затем сравним производительность разных подходов к реализации.

    habr.com/ru/companies/yadro/ar

    #gpu_вычисления #opencl #gemm

  14. Учимся разрабатывать для GPU на примере операции GEMM

    Привет, Хабр! Сегодня я расскажу про реализацию матричного умножения и особенности разработки для GPU. Познакомлю вас с устройством GPU, объясню, чем отличается программирование от привычного для CPU, какие нюансы нужно учитывать для эффективной реализации операций GEMM. А затем сравним производительность разных подходов к реализации.

    habr.com/ru/companies/yadro/ar

    #gpu_вычисления #opencl #gemm

  15. OpenBLAS/gemm отстаёт на RISC-V

    В ходе недавних исследований мы выполнили комплексное тестирование производительности математической библиотеки OpenBLAS на платформе RISC‑V и выявили существенную разницу в скорости выполнения ключевой операции матричного умножения cblas_sgemm по сравнению с архитектурой x86 — производительность оказалась значительно ниже. cblas_sgemm — функция для умножения матриц, состоящих из 32-разрядных вещественных чисел. Хотелось бы обратить внимание на то, что функция матричного умножения gemm, соответствующая стандартам BLAS, используется во многих библиотеках и алгоритмах. А OpenBLAS — одна из самых популярных реализаций стандарта BLAS с оптимизацией под различные платформы. Так на x86_64 OpenBlas получает производительность примерно 80–90% от теоретического максимума процессора. А на Risc‑v примерно 20–25%. Также была рассмотрена самостоятельно реализованная функция перемножения матриц mini‑gemm по алгоритму описанному в статье . При этом наша реализация получает производительность 30–35% от максимума. Из чего встает два вопроса: почему на RISC‑V не получили 80%, как на x86_64 и как так вышло, что наша реализация обогнала OpenBLAS.

    habr.com/ru/articles/902442/

    #openblas #gemm #riscv #производительность

  16. OpenBLAS/gemm отстаёт на RISC-V

    В ходе недавних исследований мы выполнили комплексное тестирование производительности математической библиотеки OpenBLAS на платформе RISC‑V и выявили существенную разницу в скорости выполнения ключевой операции матричного умножения cblas_sgemm по сравнению с архитектурой x86 — производительность оказалась значительно ниже. cblas_sgemm — функция для умножения матриц, состоящих из 32-разрядных вещественных чисел. Хотелось бы обратить внимание на то, что функция матричного умножения gemm, соответствующая стандартам BLAS, используется во многих библиотеках и алгоритмах. А OpenBLAS — одна из самых популярных реализаций стандарта BLAS с оптимизацией под различные платформы. Так на x86_64 OpenBlas получает производительность примерно 80–90% от теоретического максимума процессора. А на Risc‑v примерно 20–25%. Также была рассмотрена самостоятельно реализованная функция перемножения матриц mini‑gemm по алгоритму описанному в статье . При этом наша реализация получает производительность 30–35% от максимума. Из чего встает два вопроса: почему на RISC‑V не получили 80%, как на x86_64 и как так вышло, что наша реализация обогнала OpenBLAS.

    habr.com/ru/articles/902442/

    #openblas #gemm #riscv #производительность

  17. OpenBLAS/gemm отстаёт на RISC-V

    В ходе недавних исследований мы выполнили комплексное тестирование производительности математической библиотеки OpenBLAS на платформе RISC‑V и выявили существенную разницу в скорости выполнения ключевой операции матричного умножения cblas_sgemm по сравнению с архитектурой x86 — производительность оказалась значительно ниже. cblas_sgemm — функция для умножения матриц, состоящих из 32-разрядных вещественных чисел. Хотелось бы обратить внимание на то, что функция матричного умножения gemm, соответствующая стандартам BLAS, используется во многих библиотеках и алгоритмах. А OpenBLAS — одна из самых популярных реализаций стандарта BLAS с оптимизацией под различные платформы. Так на x86_64 OpenBlas получает производительность примерно 80–90% от теоретического максимума процессора. А на Risc‑v примерно 20–25%. Также была рассмотрена самостоятельно реализованная функция перемножения матриц mini‑gemm по алгоритму описанному в статье . При этом наша реализация получает производительность 30–35% от максимума. Из чего встает два вопроса: почему на RISC‑V не получили 80%, как на x86_64 и как так вышло, что наша реализация обогнала OpenBLAS.

    habr.com/ru/articles/902442/

    #openblas #gemm #riscv #производительность

  18. 🧐 Welcome to the thrilling world of "#DeepSeek," where they unleash their groundbreaking #FP8 #GEMM #Kernels, as if these buzzwords mean anything to normal humans. 🤖✨ Now you too can revel in the #excitement of "#fine-grained #scaling," because who doesn't dream of spending their weekends scaling kernels? 🎉 #GitHub's #navigation menu is undoubtedly the real star here, stealing the show with its riveting toggle action. 🚀
    github.com/deepseek-ai/DeepGEMM #tech #HackerNews #ngated

  19. 🧐 Welcome to the thrilling world of "#DeepSeek," where they unleash their groundbreaking #FP8 #GEMM #Kernels, as if these buzzwords mean anything to normal humans. 🤖✨ Now you too can revel in the #excitement of "#fine-grained #scaling," because who doesn't dream of spending their weekends scaling kernels? 🎉 #GitHub's #navigation menu is undoubtedly the real star here, stealing the show with its riveting toggle action. 🚀
    github.com/deepseek-ai/DeepGEMM #tech #HackerNews #ngated

  20. 🧐 Welcome to the thrilling world of "#DeepSeek," where they unleash their groundbreaking #FP8 #GEMM #Kernels, as if these buzzwords mean anything to normal humans. 🤖✨ Now you too can revel in the #excitement of "#fine-grained #scaling," because who doesn't dream of spending their weekends scaling kernels? 🎉 #GitHub's #navigation menu is undoubtedly the real star here, stealing the show with its riveting toggle action. 🚀
    github.com/deepseek-ai/DeepGEMM #tech #HackerNews #ngated

  21. 🧐 Welcome to the thrilling world of "#DeepSeek," where they unleash their groundbreaking #FP8 #GEMM #Kernels, as if these buzzwords mean anything to normal humans. 🤖✨ Now you too can revel in the #excitement of "#fine-grained #scaling," because who doesn't dream of spending their weekends scaling kernels? 🎉 #GitHub's #navigation menu is undoubtedly the real star here, stealing the show with its riveting toggle action. 🚀
    github.com/deepseek-ai/DeepGEMM #tech #HackerNews #ngated

  22. 🧐 Welcome to the thrilling world of "#DeepSeek," where they unleash their groundbreaking #FP8 #GEMM #Kernels, as if these buzzwords mean anything to normal humans. 🤖✨ Now you too can revel in the #excitement of "#fine-grained #scaling," because who doesn't dream of spending their weekends scaling kernels? 🎉 #GitHub's #navigation menu is undoubtedly the real star here, stealing the show with its riveting toggle action. 🚀
    github.com/deepseek-ai/DeepGEMM #tech #HackerNews #ngated

  23. Detailing the tiling scheme used for a CUDA kernel doing matrix-matrix multiplication indii.org/blog/gpu-matrix-mult

  24. Amazing work from Sarah El-Kazdadi. #LibXSMM has become standard for applications needing small, dense matrix multiply/tensor contraction. It uses JIT, which was widely believed to be necessary to achieve high performance in this domain. Sarah's new library, #nanogemm, is competitive or better without JIT (modulo a caveat about padding). #Rust #HPC #GEMM

    sarah-ek.veganb.tw/blog/nano-g

  25. Amazing work from Sarah El-Kazdadi. #LibXSMM has become standard for applications needing small, dense matrix multiply/tensor contraction. It uses JIT, which was widely believed to be necessary to achieve high performance in this domain. Sarah's new library, #nanogemm, is competitive or better without JIT (modulo a caveat about padding). #Rust #HPC #GEMM

    sarah-ek.veganb.tw/blog/nano-g

  26. Amazing work from Sarah El-Kazdadi. has become standard for applications needing small, dense matrix multiply/tensor contraction. It uses JIT, which was widely believed to be necessary to achieve high performance in this domain. Sarah's new library, , is competitive or better without JIT (modulo a caveat about padding).

    sarah-ek.veganb.tw/blog/nano-g

  27. Amazing work from Sarah El-Kazdadi. #LibXSMM has become standard for applications needing small, dense matrix multiply/tensor contraction. It uses JIT, which was widely believed to be necessary to achieve high performance in this domain. Sarah's new library, #nanogemm, is competitive or better without JIT (modulo a caveat about padding). #Rust #HPC #GEMM

    sarah-ek.veganb.tw/blog/nano-g

  28. Amazing work from Sarah El-Kazdadi. #LibXSMM has become standard for applications needing small, dense matrix multiply/tensor contraction. It uses JIT, which was widely believed to be necessary to achieve high performance in this domain. Sarah's new library, #nanogemm, is competitive or better without JIT (modulo a caveat about padding). #Rust #HPC #GEMM

    sarah-ek.veganb.tw/blog/nano-g

  29. Первый взгляд на производительность CPU реализации floating-point GEMM на языке Mojo

    Сравниваем производительность реализаций floating-point GEMM из OpenBLAS, Eigen и MKl с реализацией на новом языке программирования Mojo.

    habr.com/ru/articles/783138/

    #mojo #gemm #modular #openblas #eigen #mkl

  30. Первый взгляд на производительность CPU реализации floating-point GEMM на языке Mojo

    Сравниваем производительность реализаций floating-point GEMM из OpenBLAS, Eigen и MKl с реализацией на новом языке программирования Mojo.

    habr.com/ru/articles/783138/

    #mojo #gemm #modular #openblas #eigen #mkl

  31. Первый взгляд на производительность CPU реализации floating-point GEMM на языке Mojo

    Сравниваем производительность реализаций floating-point GEMM из OpenBLAS, Eigen и MKl с реализацией на новом языке программирования Mojo.

    habr.com/ru/articles/783138/

    #mojo #gemm #modular #openblas #eigen #mkl

  32. Discovered this KILLER local Arizona band the other day called Gemm- they kinda remind me of Hum or Catherine Wheel in that kinda 90s/early 2000s heavy, guitarry super melodic rock way. And the dude's voice is great. Are they shoegazey? Maybe. But not super slow. They're really worth a listen.

    This is their newest stuff, their Summer Promo '23: gemmrockaz.bandcamp.com/album/

    #IndieRock #Arizona #AZ #ArizonaBands #AZBands #Gemm #shoegaze #Phoenix #PhoenixAZ #PhoenixBands

  33. Discovered this KILLER local Arizona band the other day called Gemm- they kinda remind me of Hum or Catherine Wheel in that kinda 90s/early 2000s heavy, guitarry super melodic rock way. And the dude's voice is great. Are they shoegazey? Maybe. But not super slow. They're really worth a listen.

    This is their newest stuff, their Summer Promo '23: gemmrockaz.bandcamp.com/album/

    #IndieRock #Arizona #AZ #ArizonaBands #AZBands #Gemm #shoegaze #Phoenix #PhoenixAZ #PhoenixBands

  34. Discovered this KILLER local Arizona band the other day called Gemm- they kinda remind me of Hum or Catherine Wheel in that kinda 90s/early 2000s heavy, guitarry super melodic rock way. And the dude's voice is great. Are they shoegazey? Maybe. But not super slow. They're really worth a listen.

    This is their newest stuff, their Summer Promo '23: gemmrockaz.bandcamp.com/album/

    #IndieRock #Arizona #AZ #ArizonaBands #AZBands #Gemm #shoegaze #Phoenix #PhoenixAZ #PhoenixBands

  35. Discovered this KILLER local Arizona band the other day called Gemm- they kinda remind me of Hum or Catherine Wheel in that kinda 90s/early 2000s heavy, guitarry super melodic rock way. And the dude's voice is great. Are they shoegazey? Maybe. But not super slow. They're really worth a listen.

    This is their newest stuff, their Summer Promo '23: gemmrockaz.bandcamp.com/album/

    #IndieRock #Arizona #AZ #ArizonaBands #AZBands #Gemm #shoegaze #Phoenix #PhoenixAZ #PhoenixBands

  36. Discovered this KILLER local Arizona band the other day called Gemm- they kinda remind me of Hum or Catherine Wheel in that kinda 90s/early 2000s heavy, guitarry super melodic rock way. And the dude's voice is great. Are they shoegazey? Maybe. But not super slow. They're really worth a listen.

    This is their newest stuff, their Summer Promo '23: gemmrockaz.bandcamp.com/album/

    #IndieRock #Arizona #AZ #ArizonaBands #AZBands #Gemm #shoegaze #Phoenix #PhoenixAZ #PhoenixBands