home.social

#transformer — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #transformer, aggregated by home.social.

fetched live
  1. RT @HowToPrompt__: Chinesische Forscher haben es erneut geschafft! Moonshot AI hat das größte Transformer-Upgrade seit 2015 als Open-Source veröffentlicht. Seit über einem Jahrzehnt verarbeiteten alle Transformer Daten Schicht für Schicht, indem sie blind neue Ausgaben auf alte Ausgaben stapelten. Es gab kein Filtern oder Urteilen. Es war einfach ein massiver Datenstapel, bei dem frühe, grundlegende Konzepte von den lauteren Schichten oben vollständig übertönt wurden. Ingenieure nennen dies PreNorm-Dilution (Verwässerung). In der Praxis bedeutet dies, dass Ihre KI ihre eigene beste Arbeit langsam vergisst, je tiefer sie wird. Also tötete Moonshot AI den festen Stapel. Sie bauten Attention Residuals (Aufmerksamkeits-Residuen). Statt blind alles zu akkumulieren, verwendet jede Schicht nun Softmax-Aufmerksamkeit über die Tiefe. Sie schaut aktiv zurück, bewertet jede vorangehende Schicht und zieht selektiv nur die Daten, die sie tatsächlich benötigt. Das Netzwerk lernte, wie man auswählt, was man sich merken soll. Und die Ergebnisse sind schrecklich effizient: • Sie erreicht die Leistung von Modellen, die mit 25 % mehr Rechenleistung trainiert wurden. • Massive Sprünge in Mathematik (+3,6 auf MATH), Schlussfolgerung (+7,5 auf GPQA) und Programmierung (+3,1 auf HumanEval). • Weniger als 2 % zusätzliche Latenz bei der Inferenz. Sie skalieren es sogar in ein reales Modell mit 48 Milliarden Parametern (Kimi Linear), das auf 1,4 Billionen Token vortrainiert wurde, und beweisen damit, dass es im Unternehmensmaßstab funktioniert. Der Transformer von 2017 ersetzte Rekurrenz durch Aufmerksamkeit über Wört…

    mehr auf Arint.info

    #DeepLearning #KünstlicheIntelligenz #MachineLearning #MoonshotAI #OpenSource #Transformer #arint_info

    https://x.com/HowToPrompt__/status/2087106178451190074#m

  2. RT @HowToPrompt__: Chinesische Forscher haben es erneut geschafft! Moonshot AI hat das größte Transformer-Upgrade seit 2015 open-sourced. Seit über einem Jahrzehnt verarbeiteten alle Transformer Daten schichtweise, indem sie blind neue Ausgaben auf alte Ausgaben stapelten. Es gab kein Filtern und Urteilen. Es war nur ein massiver Stapel von Daten, bei dem frühe, grundlegende Konzepte von den lauteren Schichten oben vollständig übertönt wurden. Ingenieure nennen dies PreNorm-Dilution. In der Praxis bedeutet dies, dass Ihre KI ihre eigene beste Arbeit langsam vergisst, je tiefer sie wird. Also hat Moonshot AI den festen Stapel abgeschafft. Sie bauten Attention Residuals. Anstatt blind alles zu akkumulieren, nutzt jede Schicht nun Softmax-Aufmerksamkeit über die Tiefe. Sie schaut aktiv zurück, bewertet jede vorangehende Schicht und zieht selektiv nur die Daten, die sie tatsächlich benötigt. Das Netzwerk lernte, wie man auswählt, was man sich merken soll. Und die Ergebnisse sind erschreckend effizient: • Es entspricht der Leistung von Modellen, die mit 25 % mehr Rechenleistung trainiert wurden. • Massive Sprünge in Mathematik (+3,6 auf MATH), Schlussfolgerung (+7,5 auf GPQA) und Programmierung (+3,1 auf HumanEval). • Weniger als 2 % Inference-Latenz-Overhead. Sie haben es sogar in ein reales 48-Milliarden-Parameter-Modell (Kimi Linear) hochskaliert, das auf 1,4 Billionen Token vortrainiert wurde, und bewiesen, dass es im Unternehmensmaßstab funktioniert. Der Transformer von 2017 ersetzte Rekurrenz durch Aufmerksamkeit über Wörter hinweg. Dieses Papier tat genau dasselbe über Schichten der Tiefe h…

    mehr auf Arint.info

    #AIResearch #AttentionResiduals #DeepLearning #KimiLinear #MoonshotAI #Transformer #arint_info

    https://x.com/HowToPrompt__/status/2087106178451190074#m

  3. Топ вопросов с NLP собеседований: архитектуры LLM, инференс и оптимизация

    На NLP/LLM собеседованиях все чаще проверяют не только знание трансформеров, но и понимание того, как устроены современные GPT-like модели: почему большинство генеративных LLM используют decoder-only архитектуру, чем LLaMA отличается от ванильного Transformer, зачем нужны RoPE, RMSNorm, SwiGLU и GQA. Почему инференс LLM дорогой и какие оптимизации помогают его ускорять: fused kernels, FlashAttention, KV-cache и PagedAttention, continuous batching, speculative decoding, квантизация и дистилляция. Много схем и картинок, а также полный список вопросов с собесов в конце.

    habr.com/ru/articles/1068944/

    #LLM #архитектура_LLM #инференс_LLM #ускорение_LLM #оптимизация_LLM #Transformer #FlashAttention #KVcache #квантизация_LLM #Mixture_of_Experts

  4. Doing transformer research recently reminded me how simple the concept of attention is. The transformer really just allowed us to scale the fuck out of compute and data (something previous seq2seq architectures failed at).

    I think Dario was right, we were probably on track to create LLMs from the moment we invented the transistor, or "arguably even earlier when we first learned to control fire."

    #Transformer #AIResearch

  5. Doing transformer research recently reminded me how simple the concept of attention is. The transformer really just allowed us to scale the fuck out of compute and data (something previous seq2seq architectures failed at).

    I think Dario was right, we were probably on track to create LLMs from the moment we invented the transistor, or "arguably even earlier when we first learned to control fire."

    #Transformer #AIResearch

  6. Finished my #Lego #Transformer #Soundwave I got for my birthday. Put my original G1 Soundwave next to it for scale.

  7. it's totally normal to update your website to add a page for a #transformer from a few years ago at 1am right? well i just did that for legacy burn out on my #neocities lol

    princess-viola.neocities.org/t

  8. Memorization vs Generalization: что действительно умеет языковая модель (TLM) на 2 160 параметров (v1.1.0)

    Продолжая тему Крошечной Языковой Модели на Nodejs мы поймем где проходит граница ее возможностей. На примере Крошечной Языковой Модели (TLM) из 2 160 параметров мы проведём воспроизводимый эксперимент и увидим в цифрах: знакомый шаблон - 99,93%, перестановка токенов - 81,69%, неизвестная структура -?%.

    habr.com/ru/articles/1065160/

    #machinelearning #machine_learning #backpropagation #selfattention #autograd #nodejs #javascript #sft #нейронная_сеть #transformer

  9. People that still believe, in light of Fable- and Sol-class models, that we're not on the cusp of recursive self improvement, what would change your mind?

    - Google's models already improving scheduling
    - OpenAI using Sol to improve own inference stack and gain 20% lower serving costs and 15% token generation efficiency

    #AI #Transformer #GPU #Inference

  10. People that still believe, in light of Fable- and Sol-class models, that we're not on the cusp of recursive self improvement, what would change your mind?

    - Google's models already improving scheduling
    - OpenAI using Sol to improve own inference stack and gain 20% lower serving costs and 15% token generation efficiency

    #AI #Transformer #GPU #Inference

  11. Bathroom exhaust fan in zone 1

    TL;DR 12V / 150mm bathroom exhaust fans are difficult to find in EU (in online shops), but I found two. If you're in UK, it's Manrose, or Dalap in EU. Intro It looks like there is something German in my Balkan genes: I can't stand stale air indoors, so I open windows all the time and install exhaust fans wherever possible. So I added another one in kid's bathroom. This one was tricky, because the hole through a wall is in Zone 1 (right above the bathtube). Firstly I wanted to install 230V […]

    blog.rozman.info/bathroom-exha

  12. [Перевод] Языковая Модель без магии: Крошечная Language Model на чистом Node.js

    Мы создаем крошечную языковую модель с нуля на чистом Node.js без использования TensorFlow или PyTorch, реализуя нейроны, автоград, эмбеддинги, механизм самовнимания (self-attention), полносвязную сеть (FFN), обратное распространение ошибки и SFT, одновременно наблюдая за тем, как отдельные веса и целые матрицы изменяются в процессе обучения Это не новая GPT и не прод ML...

    habr.com/ru/articles/1063406/

    #machinelearning #machine_learning #backpropagation #selfattention #autograd #nodejs #javascript #sft #нейронная_сеть #transformer

  13. "Attention Is All You Need" is a 2017 research paper in #machineLearning authored by eight scientists and engineers working at #Google. The paper introduced a new #deepLearning architecture known as the #transformer, based on the #attentionMechanism proposed in 2014 by Bahdanau et al. The transformer approach it describes has become the main architecture of a wide variety of artificial intelligence systems, including #largeLanguageModels. At the time.
    youtube.com/watch?v=JR8d4PExrXI

  14. "Attention Is All You Need" is a 2017 research paper in #machineLearning authored by eight scientists and engineers working at #Google. The paper introduced a new #deepLearning architecture known as the #transformer, based on the #attentionMechanism proposed in 2014 by Bahdanau et al. The transformer approach it describes has become the main architecture of a wide variety of artificial intelligence systems, including #largeLanguageModels. At the time.
    youtube.com/watch?v=JR8d4PExrXI

  15. 9 turns of Ethernet pair on a ø2cm plastic bobbin makes a very inefficient but working .
    Signal is distinguishable up to 2MHz, and max voltage is 0.3V. Even though the signal generator outputs 3V without load, it seems to choke on the inductivity and gives only 0.3 at output.

    I think this might be good for transferring data. But how to receive it?

  16. 9 turns of Ethernet pair on a ø2cm plastic bobbin makes a very inefficient but working #transformer .
    Signal is distinguishable up to 2MHz, and max voltage is 0.3V. Even though the signal generator outputs 3V without load, it seems to choke on the inductivity and gives only 0.3 at output.

    I think this might be good for transferring data. But how to receive it?

    #electronics

  17. LE NOM (Kurt Marti)

    Illustration      LE NOM peut-être qu'Heisenberg a vraiment trouvé la formule de l'univers on saura bien ça un jour mais quand mais quand verrons-nous sanctifié ce nom qui eśt plus que mondes et formules ? peut-être que les maîtres de la terre visent vraiment autre chose que l'injustice on saura bien ça un jour mais quand mais quand verrons-nous sanctifié ce nom qui transforme la terre en un soleil de justice ? peut-être que les chrétiens sont vraiment la […]

    arbrealettres.wordpress.com/20