#gemm — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #gemm, aggregated by home.social.
-
Микроядро SME2 sgemm: 1024 умножения-сложения за проход
В этой части мы возьмём первый из пропусков BLIS — микроядро sgemm ; сначала зафиксируем форму аккумулятора 32×32 в четырёх тайлах ZA, затем разберём горячий цикл по K, потом эпилог с alpha , beta и ловушкой NaN, а в конце посмотрим, какие числа производительности даёт именно это ядро. Следующая часть оставит структуру почти той же, но заменит геометрию тайла и условия существования ядра.
https://habr.com/ru/articles/1071462/
#BLIS #GEMM #SME2 #Apple_Silicon #микроядро #кэшблокинг #упаковка_данных #высокопроизводительные_вычисления #линейная_алгебра #BLAS
-
Микроядро SME2 sgemm: 1024 умножения-сложения за проход
В этой части мы возьмём первый из пропусков BLIS — микроядро sgemm ; сначала зафиксируем форму аккумулятора 32×32 в четырёх тайлах ZA, затем разберём горячий цикл по K, потом эпилог с alpha , beta и ловушкой NaN, а в конце посмотрим, какие числа производительности даёт именно это ядро. Следующая часть оставит структуру почти той же, но заменит геометрию тайла и условия существования ядра.
https://habr.com/ru/articles/1071462/
#BLIS #GEMM #SME2 #Apple_Silicon #микроядро #кэшблокинг #упаковка_данных #высокопроизводительные_вычисления #линейная_алгебра #BLAS
-
Микроядро SME2 sgemm: 1024 умножения-сложения за проход
В этой части мы возьмём первый из пропусков BLIS — микроядро sgemm ; сначала зафиксируем форму аккумулятора 32×32 в четырёх тайлах ZA, затем разберём горячий цикл по K, потом эпилог с alpha , beta и ловушкой NaN, а в конце посмотрим, какие числа производительности даёт именно это ядро. Следующая часть оставит структуру почти той же, но заменит геометрию тайла и условия существования ядра.
https://habr.com/ru/articles/1071462/
#BLIS #GEMM #SME2 #Apple_Silicon #микроядро #кэшблокинг #упаковка_данных #высокопроизводительные_вычисления #линейная_алгебра #BLAS
-
BLIS: недостающую среднюю ступеньку построили тридцать лет назад
В этой части мы начнём с тупика, в который приводит голый цикл FMOPA ; затем покажем, какую часть GEMM BLIS уже построил за нас; после этого разберём пять циклов BLIS и место микроядра внутри них. Финал главы должен сделать дальнейший план конкретным: что именно нужно добавить для Apple SME, а что уже относится к готовой «мебели» фреймворка.
https://habr.com/ru/articles/1069058/
#BLIS #GEMM #SME2 #Apple_Silicon #микроядро #кэшблокинг #упаковка_данных #высокопроизводительные_вычисления #линейная_алгебра #BLAS
-
BLIS: недостающую среднюю ступеньку построили тридцать лет назад
В этой части мы начнём с тупика, в который приводит голый цикл FMOPA ; затем покажем, какую часть GEMM BLIS уже построил за нас; после этого разберём пять циклов BLIS и место микроядра внутри них. Финал главы должен сделать дальнейший план конкретным: что именно нужно добавить для Apple SME, а что уже относится к готовой «мебели» фреймворка.
https://habr.com/ru/articles/1069058/
#BLIS #GEMM #SME2 #Apple_Silicon #микроядро #кэшблокинг #упаковка_данных #высокопроизводительные_вычисления #линейная_алгебра #BLAS
-
BLIS: недостающую среднюю ступеньку построили тридцать лет назад
В этой части мы начнём с тупика, в который приводит голый цикл FMOPA ; затем покажем, какую часть GEMM BLIS уже построил за нас; после этого разберём пять циклов BLIS и место микроядра внутри них. Финал главы должен сделать дальнейший план конкретным: что именно нужно добавить для Apple SME, а что уже относится к готовой «мебели» фреймворка.
https://habr.com/ru/articles/1069058/
#BLIS #GEMM #SME2 #Apple_Silicon #микроядро #кэшблокинг #упаковка_данных #высокопроизводительные_вычисления #линейная_алгебра #BLAS
-
CODA: Rewriting Transformer Blocks as GEMM-Epilogue Programs
https://arxiv.org/abs/2605.19269
#HackerNews #CODA #Transformer #GEMM-Epilogue #AI #Research #MachineLearning
-
CODA: Rewriting Transformer Blocks as GEMM-Epilogue Programs
https://arxiv.org/abs/2605.19269
#HackerNews #CODA #Transformer #GEMM-Epilogue #AI #Research #MachineLearning
-
CODA: Rewriting Transformer Blocks as GEMM-Epilogue Programs
https://arxiv.org/abs/2605.19269
#HackerNews #CODA #Transformer #GEMM-Epilogue #AI #Research #MachineLearning
-
CODA: Rewriting Transformer Blocks as GEMM-Epilogue Programs
https://arxiv.org/abs/2605.19269
#HackerNews #CODA #Transformer #GEMM-Epilogue #AI #Research #MachineLearning
-
CODA: Rewriting Transformer Blocks as GEMM-Epilogue Programs
https://arxiv.org/abs/2605.19269
#HackerNews #CODA #Transformer #GEMM-Epilogue #AI #Research #MachineLearning
-
Умножение матриц: пример использования расширения ARM SME2 в Apple M4 Pro
В конце 2020 года я купил MacBook Pro 13 на процессоре Apple M1, очень хотелось испытать процессоры на архитектуре ARM. Почти сразу на чипе Apple M1 был найден вычислительный блок для матричных операций Apple AMX. Для Apple AMX не было документации, он не использовался в Apple Accelerate , но несколько энтузиастов занимались реверс-инжинирингом и анализом производительности ( " https://github.com/corsix/amx " ). В 2024 году вышли компьютеры на базе семейства процессоров Apple M4, у которых блок AMX задействован для выполнения инструкций из Scalable Matrix Extension 2 (сайт ARM недоступен в РФ) (ARM SME2). В статье рассмотрим использование расширения ARM SME2 на примере умножения заполненных матриц. Увидим, как выжать максимум из процессора и получить прирост производительности в десятки раз.
https://habr.com/ru/articles/1012528/
#ARM_SME #Apple_M #gemm #умножение_матриц #линейная_алгебра #вычислительные_методы #высокопроизводительные_вычисления #оптимизация_кода #векторные_инструкции #векторные_исчисления
-
Умножение матриц: пример использования расширения ARM SME2 в Apple M4 Pro
В конце 2020 года я купил MacBook Pro 13 на процессоре Apple M1, очень хотелось испытать процессоры на архитектуре ARM. Почти сразу на чипе Apple M1 был найден вычислительный блок для матричных операций Apple AMX. Для Apple AMX не было документации, он не использовался в Apple Accelerate , но несколько энтузиастов занимались реверс-инжинирингом и анализом производительности ( " https://github.com/corsix/amx " ). В 2024 году вышли компьютеры на базе семейства процессоров Apple M4, у которых блок AMX задействован для выполнения инструкций из Scalable Matrix Extension 2 (сайт ARM недоступен в РФ) (ARM SME2). В статье рассмотрим использование расширения ARM SME2 на примере умножения заполненных матриц. Увидим, как выжать максимум из процессора и получить прирост производительности в десятки раз.
https://habr.com/ru/articles/1012528/
#ARM_SME #Apple_M #gemm #умножение_матриц #линейная_алгебра #вычислительные_методы #высокопроизводительные_вычисления #оптимизация_кода #векторные_инструкции #векторные_исчисления
-
Умножение матриц: пример использования расширения ARM SME2 в Apple M4 Pro
В конце 2020 года я купил MacBook Pro 13 на процессоре Apple M1, очень хотелось испытать процессоры на архитектуре ARM. Почти сразу на чипе Apple M1 был найден вычислительный блок для матричных операций Apple AMX. Для Apple AMX не было документации, он не использовался в Apple Accelerate , но несколько энтузиастов занимались реверс-инжинирингом и анализом производительности ( " https://github.com/corsix/amx " ). В 2024 году вышли компьютеры на базе семейства процессоров Apple M4, у которых блок AMX задействован для выполнения инструкций из Scalable Matrix Extension 2 (сайт ARM недоступен в РФ) (ARM SME2). В статье рассмотрим использование расширения ARM SME2 на примере умножения заполненных матриц. Увидим, как выжать максимум из процессора и получить прирост производительности в десятки раз.
https://habr.com/ru/articles/1012528/
#ARM_SME #Apple_M #gemm #умножение_матриц #линейная_алгебра #вычислительные_методы #высокопроизводительные_вычисления #оптимизация_кода #векторные_инструкции #векторные_исчисления
-
Учимся разрабатывать для GPU на примере операции GEMM
Привет, Хабр! Сегодня я расскажу про реализацию матричного умножения и особенности разработки для GPU. Познакомлю вас с устройством GPU, объясню, чем отличается программирование от привычного для CPU, какие нюансы нужно учитывать для эффективной реализации операций GEMM. А затем сравним производительность разных подходов к реализации.
-
Учимся разрабатывать для GPU на примере операции GEMM
Привет, Хабр! Сегодня я расскажу про реализацию матричного умножения и особенности разработки для GPU. Познакомлю вас с устройством GPU, объясню, чем отличается программирование от привычного для CPU, какие нюансы нужно учитывать для эффективной реализации операций GEMM. А затем сравним производительность разных подходов к реализации.
-
Учимся разрабатывать для GPU на примере операции GEMM
Привет, Хабр! Сегодня я расскажу про реализацию матричного умножения и особенности разработки для GPU. Познакомлю вас с устройством GPU, объясню, чем отличается программирование от привычного для CPU, какие нюансы нужно учитывать для эффективной реализации операций GEMM. А затем сравним производительность разных подходов к реализации.
-
OpenBLAS/gemm отстаёт на RISC-V
В ходе недавних исследований мы выполнили комплексное тестирование производительности математической библиотеки OpenBLAS на платформе RISC‑V и выявили существенную разницу в скорости выполнения ключевой операции матричного умножения cblas_sgemm по сравнению с архитектурой x86 — производительность оказалась значительно ниже. cblas_sgemm — функция для умножения матриц, состоящих из 32-разрядных вещественных чисел. Хотелось бы обратить внимание на то, что функция матричного умножения gemm, соответствующая стандартам BLAS, используется во многих библиотеках и алгоритмах. А OpenBLAS — одна из самых популярных реализаций стандарта BLAS с оптимизацией под различные платформы. Так на x86_64 OpenBlas получает производительность примерно 80–90% от теоретического максимума процессора. А на Risc‑v примерно 20–25%. Также была рассмотрена самостоятельно реализованная функция перемножения матриц mini‑gemm по алгоритму описанному в статье . При этом наша реализация получает производительность 30–35% от максимума. Из чего встает два вопроса: почему на RISC‑V не получили 80%, как на x86_64 и как так вышло, что наша реализация обогнала OpenBLAS.
-
OpenBLAS/gemm отстаёт на RISC-V
В ходе недавних исследований мы выполнили комплексное тестирование производительности математической библиотеки OpenBLAS на платформе RISC‑V и выявили существенную разницу в скорости выполнения ключевой операции матричного умножения cblas_sgemm по сравнению с архитектурой x86 — производительность оказалась значительно ниже. cblas_sgemm — функция для умножения матриц, состоящих из 32-разрядных вещественных чисел. Хотелось бы обратить внимание на то, что функция матричного умножения gemm, соответствующая стандартам BLAS, используется во многих библиотеках и алгоритмах. А OpenBLAS — одна из самых популярных реализаций стандарта BLAS с оптимизацией под различные платформы. Так на x86_64 OpenBlas получает производительность примерно 80–90% от теоретического максимума процессора. А на Risc‑v примерно 20–25%. Также была рассмотрена самостоятельно реализованная функция перемножения матриц mini‑gemm по алгоритму описанному в статье . При этом наша реализация получает производительность 30–35% от максимума. Из чего встает два вопроса: почему на RISC‑V не получили 80%, как на x86_64 и как так вышло, что наша реализация обогнала OpenBLAS.
-
OpenBLAS/gemm отстаёт на RISC-V
В ходе недавних исследований мы выполнили комплексное тестирование производительности математической библиотеки OpenBLAS на платформе RISC‑V и выявили существенную разницу в скорости выполнения ключевой операции матричного умножения cblas_sgemm по сравнению с архитектурой x86 — производительность оказалась значительно ниже. cblas_sgemm — функция для умножения матриц, состоящих из 32-разрядных вещественных чисел. Хотелось бы обратить внимание на то, что функция матричного умножения gemm, соответствующая стандартам BLAS, используется во многих библиотеках и алгоритмах. А OpenBLAS — одна из самых популярных реализаций стандарта BLAS с оптимизацией под различные платформы. Так на x86_64 OpenBlas получает производительность примерно 80–90% от теоретического максимума процессора. А на Risc‑v примерно 20–25%. Также была рассмотрена самостоятельно реализованная функция перемножения матриц mini‑gemm по алгоритму описанному в статье . При этом наша реализация получает производительность 30–35% от максимума. Из чего встает два вопроса: почему на RISC‑V не получили 80%, как на x86_64 и как так вышло, что наша реализация обогнала OpenBLAS.
-
🧐 Welcome to the thrilling world of "#DeepSeek," where they unleash their groundbreaking #FP8 #GEMM #Kernels, as if these buzzwords mean anything to normal humans. 🤖✨ Now you too can revel in the #excitement of "#fine-grained #scaling," because who doesn't dream of spending their weekends scaling kernels? 🎉 #GitHub's #navigation menu is undoubtedly the real star here, stealing the show with its riveting toggle action. 🚀
https://github.com/deepseek-ai/DeepGEMM #tech #HackerNews #ngated -
🧐 Welcome to the thrilling world of "#DeepSeek," where they unleash their groundbreaking #FP8 #GEMM #Kernels, as if these buzzwords mean anything to normal humans. 🤖✨ Now you too can revel in the #excitement of "#fine-grained #scaling," because who doesn't dream of spending their weekends scaling kernels? 🎉 #GitHub's #navigation menu is undoubtedly the real star here, stealing the show with its riveting toggle action. 🚀
https://github.com/deepseek-ai/DeepGEMM #tech #HackerNews #ngated -
🧐 Welcome to the thrilling world of "#DeepSeek," where they unleash their groundbreaking #FP8 #GEMM #Kernels, as if these buzzwords mean anything to normal humans. 🤖✨ Now you too can revel in the #excitement of "#fine-grained #scaling," because who doesn't dream of spending their weekends scaling kernels? 🎉 #GitHub's #navigation menu is undoubtedly the real star here, stealing the show with its riveting toggle action. 🚀
https://github.com/deepseek-ai/DeepGEMM #tech #HackerNews #ngated -
🧐 Welcome to the thrilling world of "#DeepSeek," where they unleash their groundbreaking #FP8 #GEMM #Kernels, as if these buzzwords mean anything to normal humans. 🤖✨ Now you too can revel in the #excitement of "#fine-grained #scaling," because who doesn't dream of spending their weekends scaling kernels? 🎉 #GitHub's #navigation menu is undoubtedly the real star here, stealing the show with its riveting toggle action. 🚀
https://github.com/deepseek-ai/DeepGEMM #tech #HackerNews #ngated -
🧐 Welcome to the thrilling world of "#DeepSeek," where they unleash their groundbreaking #FP8 #GEMM #Kernels, as if these buzzwords mean anything to normal humans. 🤖✨ Now you too can revel in the #excitement of "#fine-grained #scaling," because who doesn't dream of spending their weekends scaling kernels? 🎉 #GitHub's #navigation menu is undoubtedly the real star here, stealing the show with its riveting toggle action. 🚀
https://github.com/deepseek-ai/DeepGEMM #tech #HackerNews #ngated -
Detailing the tiling scheme used for a CUDA kernel doing matrix-matrix multiplication #gpu #cuda #cplusplus #matmul #gemm https://indii.org/blog/gpu-matrix-multiply-tiling/
-
Detailing the tiling scheme used for a CUDA kernel doing matrix-matrix multiplication #gpu #cuda #cplusplus #matmul #gemm https://indii.org/blog/gpu-matrix-multiply-tiling/
-
Detailing the tiling scheme used for a CUDA kernel doing matrix-matrix multiplication #gpu #cuda #cplusplus #matmul #gemm https://indii.org/blog/gpu-matrix-multiply-tiling/
-
Detailing the tiling scheme used for a CUDA kernel doing matrix-matrix multiplication #gpu #cuda #cplusplus #matmul #gemm https://indii.org/blog/gpu-matrix-multiply-tiling/
-
Detailing the tiling scheme used for a CUDA kernel doing matrix-matrix multiplication #gpu #cuda #cplusplus #matmul #gemm https://indii.org/blog/gpu-matrix-multiply-tiling/
-
Amazing work from Sarah El-Kazdadi. #LibXSMM has become standard for applications needing small, dense matrix multiply/tensor contraction. It uses JIT, which was widely believed to be necessary to achieve high performance in this domain. Sarah's new library, #nanogemm, is competitive or better without JIT (modulo a caveat about padding). #Rust #HPC #GEMM
-
Amazing work from Sarah El-Kazdadi. #LibXSMM has become standard for applications needing small, dense matrix multiply/tensor contraction. It uses JIT, which was widely believed to be necessary to achieve high performance in this domain. Sarah's new library, #nanogemm, is competitive or better without JIT (modulo a caveat about padding). #Rust #HPC #GEMM
-
Amazing work from Sarah El-Kazdadi. #LibXSMM has become standard for applications needing small, dense matrix multiply/tensor contraction. It uses JIT, which was widely believed to be necessary to achieve high performance in this domain. Sarah's new library, #nanogemm, is competitive or better without JIT (modulo a caveat about padding). #Rust #HPC #GEMM
-
Amazing work from Sarah El-Kazdadi. #LibXSMM has become standard for applications needing small, dense matrix multiply/tensor contraction. It uses JIT, which was widely believed to be necessary to achieve high performance in this domain. Sarah's new library, #nanogemm, is competitive or better without JIT (modulo a caveat about padding). #Rust #HPC #GEMM
-
Amazing work from Sarah El-Kazdadi. #LibXSMM has become standard for applications needing small, dense matrix multiply/tensor contraction. It uses JIT, which was widely believed to be necessary to achieve high performance in this domain. Sarah's new library, #nanogemm, is competitive or better without JIT (modulo a caveat about padding). #Rust #HPC #GEMM
-
Первый взгляд на производительность CPU реализации floating-point GEMM на языке Mojo
Сравниваем производительность реализаций floating-point GEMM из OpenBLAS, Eigen и MKl с реализацией на новом языке программирования Mojo.
-
Первый взгляд на производительность CPU реализации floating-point GEMM на языке Mojo
Сравниваем производительность реализаций floating-point GEMM из OpenBLAS, Eigen и MKl с реализацией на новом языке программирования Mojo.
-
Первый взгляд на производительность CPU реализации floating-point GEMM на языке Mojo
Сравниваем производительность реализаций floating-point GEMM из OpenBLAS, Eigen и MKl с реализацией на новом языке программирования Mojo.
-
Discovered this KILLER local Arizona band the other day called Gemm- they kinda remind me of Hum or Catherine Wheel in that kinda 90s/early 2000s heavy, guitarry super melodic rock way. And the dude's voice is great. Are they shoegazey? Maybe. But not super slow. They're really worth a listen.
This is their newest stuff, their Summer Promo '23: https://gemmrockaz.bandcamp.com/album/summer-promo-23
#IndieRock #Arizona #AZ #ArizonaBands #AZBands #Gemm #shoegaze #Phoenix #PhoenixAZ #PhoenixBands
-
Discovered this KILLER local Arizona band the other day called Gemm- they kinda remind me of Hum or Catherine Wheel in that kinda 90s/early 2000s heavy, guitarry super melodic rock way. And the dude's voice is great. Are they shoegazey? Maybe. But not super slow. They're really worth a listen.
This is their newest stuff, their Summer Promo '23: https://gemmrockaz.bandcamp.com/album/summer-promo-23
#IndieRock #Arizona #AZ #ArizonaBands #AZBands #Gemm #shoegaze #Phoenix #PhoenixAZ #PhoenixBands
-
Discovered this KILLER local Arizona band the other day called Gemm- they kinda remind me of Hum or Catherine Wheel in that kinda 90s/early 2000s heavy, guitarry super melodic rock way. And the dude's voice is great. Are they shoegazey? Maybe. But not super slow. They're really worth a listen.
This is their newest stuff, their Summer Promo '23: https://gemmrockaz.bandcamp.com/album/summer-promo-23
#IndieRock #Arizona #AZ #ArizonaBands #AZBands #Gemm #shoegaze #Phoenix #PhoenixAZ #PhoenixBands
-
Discovered this KILLER local Arizona band the other day called Gemm- they kinda remind me of Hum or Catherine Wheel in that kinda 90s/early 2000s heavy, guitarry super melodic rock way. And the dude's voice is great. Are they shoegazey? Maybe. But not super slow. They're really worth a listen.
This is their newest stuff, their Summer Promo '23: https://gemmrockaz.bandcamp.com/album/summer-promo-23
#IndieRock #Arizona #AZ #ArizonaBands #AZBands #Gemm #shoegaze #Phoenix #PhoenixAZ #PhoenixBands
-
Discovered this KILLER local Arizona band the other day called Gemm- they kinda remind me of Hum or Catherine Wheel in that kinda 90s/early 2000s heavy, guitarry super melodic rock way. And the dude's voice is great. Are they shoegazey? Maybe. But not super slow. They're really worth a listen.
This is their newest stuff, their Summer Promo '23: https://gemmrockaz.bandcamp.com/album/summer-promo-23
#IndieRock #Arizona #AZ #ArizonaBands #AZBands #Gemm #shoegaze #Phoenix #PhoenixAZ #PhoenixBands