home.social

#moe — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #moe, aggregated by home.social.

fetched live
  1. Как запустить LLM на 2,8 трлн параметров на ноутбуке

    Локальный запуск больших LLM быстро упирается в память: веса не помещаются, оффлоад режет скорость, а красивые бенчмарки мало говорят о реальной нагрузке. Разбираем эксперимент с Kimi K3 на 2,8 трлн параметров и смотрим, как MoE, квантование, стриминг и иерархия памяти меняют пределы потребительского железа.

    habr.com/ru/companies/otus/art

    #LLM #локальный_запуск_LLM #MoE #Mixture_of_Experts #инференс #квантование_моделей #оффлоад_экспертов #иерархия_памяти #пропускная_способность_памяти #Kimi_K3

  2. Yup. I’m homeschooling. I’m so over this government’s changes to education. This is ridiculous. #aonz #moe #nzpol #māori

  3. MoE на 5090 недобирает полтора раза, и дело не в маршрутизации

    RTX 5090, одна и та же сборка llama.cpp, один драйвер, батч 1. Плотная Qwen3.5-9B выбирает 72% пропускной способности памяти карты. MoE Qwen3.5-35B-A3B на той же карте выбирает 41%. Маршрутизация экспертов тут почти ни при чём, я её измерил: ядра top-k занимают 7% времени. CUDA-графы захватываются, дыр между запусками нет, занятость SM 97%. Карта работает почти всё время, просто делает работу медленнее, чем позволяет память. Причина оказалась в том, сколько байт читает одно ядро за запуск. Я написал программу на ggml, которая гоняет тот же mul_mat_vec_q на холодных весах, и снял кривую: на 1 МБ ядро берёт 23% полосы, на 4.2 МБ уже 53%, на 33.6 МБ 91%. У MoE на одно ядро приходится 4.6 МБ, у плотной модели 22.2 МБ. Вот и весь разрыв. В статье: разбивка всех 437 матвеков по трассе nsys, четыре способа померить это неправильно и посидеть в каждой ловушке по очереди, проверка модели на другой архитектуре с ошибкой 3.7% и на четырёх глубинах контекста, цена сэмплера и всей обвязки llama-server. Последнее оказалось крупнее всего остального: пользователь видит 225 токенов в секунду там, где бенчмарк показывает 317.

    habr.com/ru/articles/1069574/

    #llamacpp #moe #rtx_5090 #пропускная_способность_памяти #cuda #gpu #инференс_ллм #бенчмарк #профилирование #qwen_35

  4. Всё, что вы хотели знать о локальном ИИ, но стеснялись спросить

    Если вы когда-нибудь смотрели на HF и не понимали, что такое DFlash, квантизация и почему одна и та же модель лежит в десяти репозиториях от десяти разных людей — или давно собирались поднять LLM у себя, но всё не находили повода — выход Muse Glimmer 30B буквально лучший момент начать. Буквально со своего MacBook Air. Ага, да вот уже сейчас прямо. Погрузиться в мир локальных моделей

    habr.com/ru/articles/1069422/

    #llm #локальные_модели #квантизация #llamacpp #apple_silicon #gguf #инференс #moe #meta

  5. New #openaccess publication #SciPost #Physics

    Solving the Gross-Pitaevskii equation with quantic tensor trains: Ground states and nonlinear dynamics

    Qian-Can Chen, I-Kang Liu, Jheng-Wei Li, Chia-Min Chung
    SciPost Phys. 21, 035 (2026)
    scipost.org/SciPostPhys.21.2.0

    #NYCU #NTHU #NewcastleUniversity #IRIG #UGA #CENG #GrenobleINP #NCTSPhysics
    #MOE #NSTC

  6. DeepSeek 0731 на DGX Spark: разгоняю до 68 tok/s и разбираюсь, почему у автора карточки 57

    TL;DR Железо: 2× NVIDIA DGX Spark (GB10, SM121), 128 GB unified номинально и около 122 GiB видимых системе на ноду, QSFP 200G / RoCEv2, TP=2, драйвер 580.159.03. Основную часть расхождения объяснила смена runtime‑образа. Переход со сборки на базе vLLM 0.21.1 на образ с 0.25.2 дал около +22% на том же чекпоинте. Конкретный коммит или компонент я не изолировал: поменялся весь пакет. Механика неочевидная: новый образ снизил расчётную частоту verification‑шагов примерно на 17%, но поднял число выходных токенов за шаг с 3.27 до 4.80. Главная находка в конфиге: --moe-backend flashinfer_b12x не выбирается режимом auto . Явное включение дало +13.3% по среднему пяти прогонов на card‑like профиле (59.7 против 67.6) и +16.6% по медиане. B12X работает иначе: поднимает SSE‑derived частоту verification‑шагов на 16–18%, при этом выходные токены за шаг снижаются примерно на 2.5% в обоих профилях. Итоговый прирост клиентской decode‑метрики составил 13.3–14.6% по средним и 15.6–16.6% по медианам. Итог: 67.6 tok/s на одиночном запросе, 260 tok/s суммарно на 12 параллельных запросов. Отрицательные результаты, погрешности и границы применимости вынесены в отдельные разделы.

    habr.com/ru/articles/1066164/

    #DGX_Spark #vLLM #LLM_инференс #бенчмарк #спекулятивное_декодирование #GB10 #MoE #локальные_нейросети #speculative_decoding #DeepSeek_0731

  7. RT @Kimi_Moonshot: Veröffentlichung der Modellgewichte und des technischen Berichts von Kimi K3. Kimi K3 ist unser leistungsfähigstes Modell: ein 2,8-T-Billionen-Parameter-MoE-Modell mit nativem visuellem Verständnis und einem Kontextfenster von 1 Million Token. Neue Modellarchitektur: 2,5-mal mehr Intelligenz pro Recheneinheit, nicht einfach nur mehr Parameter. Parallel zu Kimi K3 stellen wir weitere Komponenten der zugrunde liegenden Infrastruktur frei – hochperformante Attention-Kernels, eine MoE-Kommunikationsbibliothek und Infrastruktur für den skalierbaren Betrieb von Agent-Umgebungen. Modellgewichte: huggingface.co/moonshotai/Kimi Technischer Bericht: github.com/MoonshotAI/Kimi-K3/ Tech-Blog: kimi.com/blog/kimi-k3

    mehr auf Arint.info

    #AI #DeepLearning #KimiK3 #MachineLearning #MoE #OpenSource #arint_info

    https://x.com/Kimi_Moonshot/status/2081760186235289764#m

  8. Kimi K3 — что реально даёт открытие весов самой большой модели

    27 июля Moonshot AI выложила веса Kimi K3 — модели на 2,8 трлн параметров, которая до этого работала только через платный API. Вместе с весами открыли технический отчёт и три внутренних инструмента, на которых модель обучали. Разберём релиз по частям: что подтверждено независимыми замерами, что остаётся заявлением компании и на какие детали стоит посмотреть до того, как планировать внедрение.

    habr.com/ru/articles/1063742/

    #kimi_k3 #kimi #moonshot_ai #открытые_данные #moe #open_source #llm