#sparse_attention — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #sparse_attention, aggregated by home.social.
-
Qwen4: Архитектура будущего
Тут надо сразу расставить точки, потому что вокруг названия путаница. Полноценного Qwen4 не существует . Есть Qwen3.8-Flash-Next – модель, которую сама команда Qwen называет «экспериментальная версия архитектуры, которая ляжет в основу Qwen4». 26 августа 2026 интернет на пару часов забыл про всё. «Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight!» И цифры… 125 миллиардов параметров всего. Плюс ещё 51 млрд отдельным слоем. А активируется на каждый токен – лишь 6 миллиардов. Первая мысль была: так не бывает.
https://habr.com/ru/companies/gptunnel/articles/1076382/
#Qwen38FlashNext #архитектура_Qwen4 #Alibaba #MoE #Gated_DeltaNet #sparse_attention #Ngram_embedding #Muon_optimizer #AdamW #GLM53Flash
-
Как показать модели пальцем, что важно
Вы наверняка замечали: один и тот же вопрос в ChatGPT или Claude иногда даёт отличный ответ, иногда – качество ответа не соответствует ожиданиям. Многие списывают это на «непредсказуемость AI». На самом деле у этого есть и структурная причина. В апреле 2025 года Anthropic публиковали официальную документацию по промпт-инжинирингу для Claude 4.6 – Prompting Best Practices . Это технический документ для разработчиков API. Массовому пользователю читать его не предполагается. Однако, там есть пара инсайтов, которые работают и буду полезны всем.
https://habr.com/ru/articles/1022862/
#тег #промпт #attention #трансформер #XML #контекст #токен #sparse_attention #промптинжиниринг #LLM