home.social

#sparse_attention — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #sparse_attention, aggregated by home.social.

fetched live
  1. Qwen4: Архитектура будущего

    Тут надо сразу расставить точки, потому что вокруг названия путаница. Полноценного Qwen4 не существует . Есть Qwen3.8-Flash-Next – модель, которую сама команда Qwen называет «экспериментальная версия архитектуры, которая ляжет в основу Qwen4». 26 августа 2026 интернет на пару часов забыл про всё. «Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight!» И цифры… 125 миллиардов параметров всего. Плюс ещё 51 млрд отдельным слоем. А активируется на каждый токен – лишь 6 миллиардов. Первая мысль была: так не бывает.

    habr.com/ru/companies/gptunnel

    #Qwen38FlashNext #архитектура_Qwen4 #Alibaba #MoE #Gated_DeltaNet #sparse_attention #Ngram_embedding #Muon_optimizer #AdamW #GLM53Flash

  2. Как показать модели пальцем, что важно

    Вы наверняка замечали: один и тот же вопрос в ChatGPT или Claude иногда даёт отличный ответ, иногда – качество ответа не соответствует ожиданиям. Многие списывают это на «непредсказуемость AI». На самом деле у этого есть и структурная причина. В апреле 2025 года Anthropic публиковали официальную документацию по промпт-инжинирингу для Claude 4.6 – Prompting Best Practices . Это технический документ для разработчиков API. Массовому пользователю читать его не предполагается. Однако, там есть пара инсайтов, которые работают и буду полезны всем.

    habr.com/ru/articles/1022862/

    #тег #промпт #attention #трансформер #XML #контекст #токен #sparse_attention #промптинжиниринг #LLM