home.social

#mnist — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #mnist, aggregated by home.social.

  1. *Run trained neural networks on the GPU — your way, your pipeline.*

    A pragmatic, three-path series: integrate battle-tested libraries (TensorFlow Lite, ONNX Runtime, PyTorch Mobile, DirectML), compile models through an ML compiler (IREE, TVM, OpenXLA), or hand-roll an inference engine in compute shaders when tight Vulkan integration is the whole point.

    docs.vulkan.org/tutorial/lates

  2. Тернарный KAN: не баг, а фича — почему дискретные веса работают лучше

    Это продолжение поста “Две нейросети по 15 КБ” - там были базовые цифры. А тут уже личная история: как делалось, что пошло не так, и что выяснилось по пути. Май 2024 года. Выходит статья “KAN: Kolmogorov-Arnold Networks”. И происходит то, что бывает раз в несколько лет - кто-то предлагает альтернативу MLP. Не модификацию и не лайфхак - альтернативу. В MLP каждый нейрон делает weight × input + bias , и все 80 лет развития - это вариации на тему “как сделать этот вес точнее, быстрее, разреженнее”. KAN предлагает другое: заменить линейный вес на обучаемую функцию. Вроде мелкий трюк, а на практике - меньше параметров при той же точности и встроенная интерпретируемость. К 2026 году уже появились QuantKAN (4-битное квантование), KANtize (2-3-битные B-spline таблицы), BiKA (аппаратный акселератор, вдохновленный KAN). И все они, по сути, про одно - сделать KAN меньше, чтоб работал не только на GPU. Граница в три бита - она же психологическая. Ниже 4 бит у всех начинается «а вдруг всё сломается». И знаете что? Обычно так и есть. Любой, кто квантовал нейросети в 2 бита, знает: точность падает. Не чуть-чуть - катастрофически. Но {-1, 0, +1} - это даже не два бита, это log₂(3) ≈ 1.58 бита. Формально - между binary и ternary, а по ощущениям - чистое безумие. Ну я и решил попробовать.

    habr.com/ru/articles/1049822/

    #KAN #KolmogorovArnold_Networks #тернарные_веса #квантование #QAT #TinyML #Edge_AI #MNIST #регуляризация #STM32

  3. Тернарный KAN: не баг, а фича — почему дискретные веса работают лучше

    Это продолжение поста “Две нейросети по 15 КБ” - там были базовые цифры. А тут уже личная история: как делалось, что пошло не так, и что выяснилось по пути. Май 2024 года. Выходит статья “KAN: Kolmogorov-Arnold Networks”. И происходит то, что бывает раз в несколько лет - кто-то предлагает альтернативу MLP. Не модификацию и не лайфхак - альтернативу. В MLP каждый нейрон делает weight × input + bias , и все 80 лет развития - это вариации на тему “как сделать этот вес точнее, быстрее, разреженнее”. KAN предлагает другое: заменить линейный вес на обучаемую функцию. Вроде мелкий трюк, а на практике - меньше параметров при той же точности и встроенная интерпретируемость. К 2026 году уже появились QuantKAN (4-битное квантование), KANtize (2-3-битные B-spline таблицы), BiKA (аппаратный акселератор, вдохновленный KAN). И все они, по сути, про одно - сделать KAN меньше, чтоб работал не только на GPU. Граница в три бита - она же психологическая. Ниже 4 бит у всех начинается «а вдруг всё сломается». И знаете что? Обычно так и есть. Любой, кто квантовал нейросети в 2 бита, знает: точность падает. Не чуть-чуть - катастрофически. Но {-1, 0, +1} - это даже не два бита, это log₂(3) ≈ 1.58 бита. Формально - между binary и ternary, а по ощущениям - чистое безумие. Ну я и решил попробовать.

    habr.com/ru/articles/1049822/

    #KAN #KolmogorovArnold_Networks #тернарные_веса #квантование #QAT #TinyML #Edge_AI #MNIST #регуляризация #STM32

  4. Тернарный KAN: не баг, а фича — почему дискретные веса работают лучше

    Это продолжение поста “Две нейросети по 15 КБ” - там были базовые цифры. А тут уже личная история: как делалось, что пошло не так, и что выяснилось по пути. Май 2024 года. Выходит статья “KAN: Kolmogorov-Arnold Networks”. И происходит то, что бывает раз в несколько лет - кто-то предлагает альтернативу MLP. Не модификацию и не лайфхак - альтернативу. В MLP каждый нейрон делает weight × input + bias , и все 80 лет развития - это вариации на тему “как сделать этот вес точнее, быстрее, разреженнее”. KAN предлагает другое: заменить линейный вес на обучаемую функцию. Вроде мелкий трюк, а на практике - меньше параметров при той же точности и встроенная интерпретируемость. К 2026 году уже появились QuantKAN (4-битное квантование), KANtize (2-3-битные B-spline таблицы), BiKA (аппаратный акселератор, вдохновленный KAN). И все они, по сути, про одно - сделать KAN меньше, чтоб работал не только на GPU. Граница в три бита - она же психологическая. Ниже 4 бит у всех начинается «а вдруг всё сломается». И знаете что? Обычно так и есть. Любой, кто квантовал нейросети в 2 бита, знает: точность падает. Не чуть-чуть - катастрофически. Но {-1, 0, +1} - это даже не два бита, это log₂(3) ≈ 1.58 бита. Формально - между binary и ternary, а по ощущениям - чистое безумие. Ну я и решил попробовать.

    habr.com/ru/articles/1049822/

    #KAN #KolmogorovArnold_Networks #тернарные_веса #квантование #QAT #TinyML #Edge_AI #MNIST #регуляризация #STM32

  5. Taking this one step further, I also looked at #ConditionalGANs: Extending #GANs by conditioning both generator and discriminator on labels, so you can explicitly control what is generated. In the #MNIST case, this means generating specific digits and even smoothly interpolating between them:

    🌍 fabriziomusacchio.com/blog/202

    #MachineLearning #GenerativeAI #CGAN #GAN

    (The attached GIF shows the interpolation between the digits 6 and 1)

  6. Taking this one step further, I also looked at #ConditionalGANs: Extending #GANs by conditioning both generator and discriminator on labels, so you can explicitly control what is generated. In the #MNIST case, this means generating specific digits and even smoothly interpolating between them:

    🌍 fabriziomusacchio.com/blog/202

    #MachineLearning #GenerativeAI #CGAN #GAN

    (The attached GIF shows the interpolation between the digits 6 and 1)

  7. Taking this one step further, I also looked at #ConditionalGANs: Extending #GANs by conditioning both generator and discriminator on labels, so you can explicitly control what is generated. In the #MNIST case, this means generating specific digits and even smoothly interpolating between them:

    🌍 fabriziomusacchio.com/blog/202

    #MachineLearning #GenerativeAI #CGAN #GAN

    (The attached GIF shows the interpolation between the digits 6 and 1)

  8. Taking this one step further, I also looked at #ConditionalGANs: Extending #GANs by conditioning both generator and discriminator on labels, so you can explicitly control what is generated. In the #MNIST case, this means generating specific digits and even smoothly interpolating between them:

    🌍 fabriziomusacchio.com/blog/202

    #MachineLearning #GenerativeAI #CGAN #GAN

    (The attached GIF shows the interpolation between the digits 6 and 1)

  9. Taking this one step further, I also looked at #ConditionalGANs: Extending #GANs by conditioning both generator and discriminator on labels, so you can explicitly control what is generated. In the #MNIST case, this means generating specific digits and even smoothly interpolating between them:

    🌍 fabriziomusacchio.com/blog/202

    #MachineLearning #GenerativeAI #CGAN #GAN

    (The attached GIF shows the interpolation between the digits 6 and 1)

  10. Just came across an elegant new #SNN framework called #nervos by Maskeen and Lashkare, which implements a two layer SNN w/ local #STDP #learning to classify, e.g., #MNIST digits. Here is an example, where I apply it to a 6-class subset of MNIST. The model reaches around 85% accuracy & the learned synapses show digit-like patterns. Quite impressive in my view, given the simplicity of the architecture & the local learning rule:

    🌍fabriziomusacchio.com/blog/202

    #CompNeuro #Neuroscience #NeuralPlasticity

  11. Just came across an elegant new #SNN framework called #nervos by Maskeen and Lashkare, which implements a two layer SNN w/ local #STDP #learning to classify, e.g., #MNIST digits. Here is an example, where I apply it to a 6-class subset of MNIST. The model reaches around 85% accuracy & the learned synapses show digit-like patterns. Quite impressive in my view, given the simplicity of the architecture & the local learning rule:

    🌍fabriziomusacchio.com/blog/202

    #CompNeuro #Neuroscience #NeuralPlasticity

  12. Just came across an elegant new #SNN framework called #nervos by Maskeen and Lashkare, which implements a two layer SNN w/ local #STDP #learning to classify, e.g., #MNIST digits. Here is an example, where I apply it to a 6-class subset of MNIST. The model reaches around 85% accuracy & the learned synapses show digit-like patterns. Quite impressive in my view, given the simplicity of the architecture & the local learning rule:

    🌍fabriziomusacchio.com/blog/202

    #CompNeuro #Neuroscience #NeuralPlasticity

  13. Just came across an elegant new #SNN framework called #nervos by Maskeen and Lashkare, which implements a two layer SNN w/ local #STDP #learning to classify, e.g., #MNIST digits. Here is an example, where I apply it to a 6-class subset of MNIST. The model reaches around 85% accuracy & the learned synapses show digit-like patterns. Quite impressive in my view, given the simplicity of the architecture & the local learning rule:

    🌍fabriziomusacchio.com/blog/202

    #CompNeuro #Neuroscience #NeuralPlasticity

  14. Just came across an elegant new #SNN framework called #nervos by Maskeen and Lashkare, which implements a two layer SNN w/ local #STDP #learning to classify, e.g., #MNIST digits. Here is an example, where I apply it to a 6-class subset of MNIST. The model reaches around 85% accuracy & the learned synapses show digit-like patterns. Quite impressive in my view, given the simplicity of the architecture & the local learning rule:

    🌍fabriziomusacchio.com/blog/202

    #CompNeuro #Neuroscience #NeuralPlasticity

  15. PyTorch vs TensorFlow: что выбрать для deep learning в 2026 году

    Выбор фреймворка для глубокого обучения — это стратегическое решение, влияющее на скорость разработки, стоимость и масштабируемость. Правило «PyTorch — для исследований, TensorFlow — для продакшена» больше не работает. К 2026 году оба фреймворка активно заимствуют лучшее друг у друга: PyTorch наращивает промышленные возможности (TorchServe, ExecuTorch), а TensorFlow с Keras 3 становится гибче для исследований. Согласно опросу Stack Overflow Developer Survey 2024 , PyTorch (10,6%) и TensorFlow (10,1%) находились примерно на одной отметке по частоте использования у разработчиков, а в исследовательских и AI-first-компаниях уверенно лидирует PyTorch . Но есть нюансы. Разобраться в особенностях фреймворков →

    habr.com/ru/companies/netology

    #pytorch #tensorflow #глубокое_обучение #установка_окружения #MNIST #keras #тензоры #deep_learning #цикл_обучения #нейронные_сети

  16. 🤔 Why use a deep learning library when you can painstakingly recreate one from scratch and rediscover every bug solved since 1970? 🚀 Just grab #NumPy, type until your fingers bleed, and hope for #MNIST magic. 💻✨ Perfect for those who love reinventing the wheel... with square edges. 🛞
    zekcrates.quarto.pub/deep-lear #deep_learning #reinvent_the_wheel #programming #challenges #HackerNews #ngated

  17. 🧠 New paper by Deistler et al: #JAXLEY: differentiable #simulation for large-scale training of detailed #biophysical #models of #NeuralDynamics.

    They present a #differentiable #GPU accelerated #simulator that trains #morphologically detailed biophysical #neuron models with #GradientDescent. JAXLEY fits intracellular #voltage and #calcium data, scales to 1000s of compartments, trains biophys. #RNNs on #WorkingMemory tasks & even solves #MNIST.

    🌍 doi.org/10.1038/s41592-025-028

    #Neuroscience #CompNeuro

  18. 🧠 New paper by Deistler et al: #JAXLEY: differentiable #simulation for large-scale training of detailed #biophysical #models of #NeuralDynamics.

    They present a #differentiable #GPU accelerated #simulator that trains #morphologically detailed biophysical #neuron models with #GradientDescent. JAXLEY fits intracellular #voltage and #calcium data, scales to 1000s of compartments, trains biophys. #RNNs on #WorkingMemory tasks & even solves #MNIST.

    🌍 doi.org/10.1038/s41592-025-028

    #Neuroscience #CompNeuro

  19. 🧠 New paper by Deistler et al: #JAXLEY: differentiable #simulation for large-scale training of detailed #biophysical #models of #NeuralDynamics.

    They present a #differentiable #GPU accelerated #simulator that trains #morphologically detailed biophysical #neuron models with #GradientDescent. JAXLEY fits intracellular #voltage and #calcium data, scales to 1000s of compartments, trains biophys. #RNNs on #WorkingMemory tasks & even solves #MNIST.

    🌍 doi.org/10.1038/s41592-025-028

    #Neuroscience #CompNeuro

  20. 🧠 New paper by Deistler et al: #JAXLEY: differentiable #simulation for large-scale training of detailed #biophysical #models of #NeuralDynamics.

    They present a #differentiable #GPU accelerated #simulator that trains #morphologically detailed biophysical #neuron models with #GradientDescent. JAXLEY fits intracellular #voltage and #calcium data, scales to 1000s of compartments, trains biophys. #RNNs on #WorkingMemory tasks & even solves #MNIST.

    🌍 doi.org/10.1038/s41592-025-028

    #Neuroscience #CompNeuro

  21. [Перевод] Нейронные сети (инференс MNIST) на «3-центовом» микроконтроллере

    Вдохновившись на удивление высокой производительностью нейронных сетей и обучением с учётом квантования на микроконтроллере CH32V003 , я захотел выяснить, как далеко эту идею можно развить. Насколько можно сжать нейронную сеть с сохранением высокой точности тестов на датасете MNIST? Когда речь идёт о крайне дешёвых микроконтроллерах, сложно предположить что-то более подходящее, чем 8-битные Padauk . Эти устройства оптимизированы под простейшие и самые дешёвые приложения из доступных. Самая мелкая модель серии, PMS150C, оснащена однократно программируемой памятью в 1024 13-битных слова и 64 байтами RAM — на порядок меньше, чем в CH32V003. Кроме того, эта модель в противоположность намного более мощному набору инструкций RISC-V содержит коммерческий регистр-аккумулятор на основе 8-битной архитектуры. Возможно ли реализовать механизм инференса MNIST, способный классифицировать рукописные числа, также и на PMS150C?

    habr.com/ru/companies/ruvds/ar

    #ruvds_перевод #машинное_обучение #микроконтроллеры #PMS150C #mnist #CH32V003

  22. Nothing like the #Kaggle #fashion #MNIST variant to make me feel like a real Elle Woods over here doing t-SNE on purses and saliency maps on ankle boots 😅

    github.com/janeadams/fashion_m

    #MachineLearning #WomeninSTEM #AI #ML #tsne #pca #WiDS #Python

  23. MNIST Clock Uses Famous Training Database - When training neural networks to recognise things, what you need is a big pile of training data. You... more: hackaday.com/2020/02/18/mnist- #handwritingrecognition #mnistdatabse #clockhacks #clock #mnist