home.social

#sme2 — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #sme2, aggregated by home.social.

fetched live
  1. Упаковщик наносит ответный удар: ZA как машина транспонирования

    В этой части мы вернёмся к работе, которую предыдущие главы принимали как готовую: упаковке. Сначала найдём скалярную ловушку в упаковке B, затем используем ZA как машину транспонирования, после этого разберём 128-битный случай для комплексных чисел и правило корректности для общего PACKM_KER . В финале соберём весь цикл одной дугой: от FMOPA до работающей субконфигурации BLIS для Apple SME.

    habr.com/ru/articles/1080094/

    #SME2 #Apple_Silicon #BLIS #GEMM #ZA #транспонирование #упаковка_панелей #SVE2 #микроядро #высокопроизводительные_вычисления

  2. Комплексный GEMM: четыре вещественных внешних произведения в одном флаконе

    В этой части мы сначала отделим прямой комплексный путь от готового метода 1m; затем покажем конфликт между чередующимся форматом памяти и раздельной арифметикой внешних произведений; после этого разберём четыре вещественных внешних произведения, расслоение через svuzp , эпилог с комплексными alpha и beta , а в конце — почему сопряжение остаётся работой упаковщика. Следующая часть вернёт нас к упаковке и к тому месту, где эта граница ответственности особенно важна.

    habr.com/ru/articles/1076992/

    #SME2 #dgemm #тайлы_ZA64 #FMOPA #динамическая_диспетчеризация #Apple_Silicon #BLIS

  3. Двойная точность: в основном «найти и заменить», плюс два настоящих сюрприза

    В этой части мы используем sgemm как шаблон и проверим, что действительно меняется при переходе к dgemm : сначала пройдём скучную часть с удвоенными ширинами, затем разберём прямоугольный тайл 16×32, после этого — отдельный бит возможностей FEAT_SME_F64F64 и динамическую регистрацию ядра. Следующая часть будет устроена иначе: там меняется не только ширина элемента, но и сама форма данных.

    habr.com/ru/articles/1074022/

    #SME2 #dgemm #двойная_точность #FEAT_SME_F64F64 #тайлы_ZA64 #FMOPA #динамическая_диспетчеризация #Apple_Silicon #BLIS

  4. Микроядро SME2 sgemm: 1024 умножения-сложения за проход

    В этой части мы возьмём первый из пропусков BLIS — микроядро sgemm ; сначала зафиксируем форму аккумулятора 32×32 в четырёх тайлах ZA, затем разберём горячий цикл по K, потом эпилог с alpha , beta и ловушкой NaN, а в конце посмотрим, какие числа производительности даёт именно это ядро. Следующая часть оставит структуру почти той же, но заменит геометрию тайла и условия существования ядра.

    habr.com/ru/articles/1071462/

    #BLIS #GEMM #SME2 #Apple_Silicon #микроядро #кэшблокинг #упаковка_данных #высокопроизводительные_вычисления #линейная_алгебра #BLAS

  5. BLIS: недостающую среднюю ступеньку построили тридцать лет назад

    В этой части мы начнём с тупика, в который приводит голый цикл FMOPA ; затем покажем, какую часть GEMM BLIS уже построил за нас; после этого разберём пять циклов BLIS и место микроядра внутри них. Финал главы должен сделать дальнейший план конкретным: что именно нужно добавить для Apple SME, а что уже относится к готовой «мебели» фреймворка.

    habr.com/ru/articles/1069058/

    #BLIS #GEMM #SME2 #Apple_Silicon #микроядро #кэшблокинг #упаковка_данных #высокопроизводительные_вычисления #линейная_алгебра #BLAS

  6. Попробуйте найти примеры кода для SME — я подожду

    В этой части мы проверим, есть ли у SME учебная дорога, сравнимая с той, которую получили тензорные ядра GPU; затем разберём два реально полезных источника: Arm Learning Path и KleidiAI; после этого отделим то, чему они действительно учат, от того, где они останавливаются. К концу главы станет видно, какая именно «середина лестницы» отсутствует и почему следующая часть неизбежно приводит к BLIS.

    habr.com/ru/articles/1066766/

    #SME2 #ARM #матричное_умножение #микроядро #векторизация #SIMD #SVE #оптимизация #тензорные_ядра #машинное_обучение

  7. What else?

    I do wonder if #MTE will be exposed this time around.

    Other questions? Do we *also* get real (read: full) #SVE and #SVE2
    if so, how wide per core?

    There's also the possibility of #sme2 but that's probably a step too far