#moe — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #moe, aggregated by home.social.
-
Popular Mexican chain opens first WA location in Pierce County https://www.diningandcooking.com/restaurants/14216/ #DivisionDrive #MexicanRestaurant #MexicanRestaurants #Moe’sSouthwestGrill
-
Franchisee of major Tex-Mex restaurant chain files for bankruptcy, closes locations https://www.diningandcooking.com/restaurants/14177/ #Chapter11Bankruptcy #FastCompany #Florida #Moe’sSouthwestGrill #PalmBeach #TexMexRestaurant #TexMexRestaurants
-
Как запустить LLM на 2,8 трлн параметров на ноутбуке
Локальный запуск больших LLM быстро упирается в память: веса не помещаются, оффлоад режет скорость, а красивые бенчмарки мало говорят о реальной нагрузке. Разбираем эксперимент с Kimi K3 на 2,8 трлн параметров и смотрим, как MoE, квантование, стриминг и иерархия памяти меняют пределы потребительского железа.
https://habr.com/ru/companies/otus/articles/1067738/
#LLM #локальный_запуск_LLM #MoE #Mixture_of_Experts #инференс #квантование_моделей #оффлоад_экспертов #иерархия_памяти #пропускная_способность_памяти #Kimi_K3
-
MoE на 5090 недобирает полтора раза, и дело не в маршрутизации
RTX 5090, одна и та же сборка llama.cpp, один драйвер, батч 1. Плотная Qwen3.5-9B выбирает 72% пропускной способности памяти карты. MoE Qwen3.5-35B-A3B на той же карте выбирает 41%. Маршрутизация экспертов тут почти ни при чём, я её измерил: ядра top-k занимают 7% времени. CUDA-графы захватываются, дыр между запусками нет, занятость SM 97%. Карта работает почти всё время, просто делает работу медленнее, чем позволяет память. Причина оказалась в том, сколько байт читает одно ядро за запуск. Я написал программу на ggml, которая гоняет тот же mul_mat_vec_q на холодных весах, и снял кривую: на 1 МБ ядро берёт 23% полосы, на 4.2 МБ уже 53%, на 33.6 МБ 91%. У MoE на одно ядро приходится 4.6 МБ, у плотной модели 22.2 МБ. Вот и весь разрыв. В статье: разбивка всех 437 матвеков по трассе nsys, четыре способа померить это неправильно и посидеть в каждой ловушке по очереди, проверка модели на другой архитектуре с ошибкой 3.7% и на четырёх глубинах контекста, цена сэмплера и всей обвязки llama-server. Последнее оказалось крупнее всего остального: пользователь видит 225 токенов в секунду там, где бенчмарк показывает 317.
https://habr.com/ru/articles/1069574/
#llamacpp #moe #rtx_5090 #пропускная_способность_памяти #cuda #gpu #инференс_ллм #бенчмарк #профилирование #qwen_35
-
Всё, что вы хотели знать о локальном ИИ, но стеснялись спросить
Если вы когда-нибудь смотрели на HF и не понимали, что такое DFlash, квантизация и почему одна и та же модель лежит в десяти репозиториях от десяти разных людей — или давно собирались поднять LLM у себя, но всё не находили повода — выход Muse Glimmer 30B буквально лучший момент начать. Буквально со своего MacBook Air. Ага, да вот уже сейчас прямо. Погрузиться в мир локальных моделей
https://habr.com/ru/articles/1069422/
#llm #локальные_модели #квантизация #llamacpp #apple_silicon #gguf #инференс #moe #meta
-
New #openaccess publication #SciPost #Physics
Solving the Gross-Pitaevskii equation with quantic tensor trains: Ground states and nonlinear dynamics
Qian-Can Chen, I-Kang Liu, Jheng-Wei Li, Chia-Min Chung
SciPost Phys. 21, 035 (2026)
https://scipost.org/SciPostPhys.21.2.035#NYCU #NTHU #NewcastleUniversity #IRIG #UGA #CENG #GrenobleINP #NCTSPhysics
#MOE #NSTC -
Maple-Preview – ternary 20B MoE running at 120 tok/s on a iPhone
https://deepgrove.ai/maple-preview
Comments: https://news.ycombinator.com/item?id=49173984
#HackerNews #MaplePreview #MoE #iPhone #AItechnology #120toks
-
DeepSeek 0731 на DGX Spark: разгоняю до 68 tok/s и разбираюсь, почему у автора карточки 57
TL;DR Железо: 2× NVIDIA DGX Spark (GB10, SM121), 128 GB unified номинально и около 122 GiB видимых системе на ноду, QSFP 200G / RoCEv2, TP=2, драйвер 580.159.03. Основную часть расхождения объяснила смена runtime‑образа. Переход со сборки на базе vLLM 0.21.1 на образ с 0.25.2 дал около +22% на том же чекпоинте. Конкретный коммит или компонент я не изолировал: поменялся весь пакет. Механика неочевидная: новый образ снизил расчётную частоту verification‑шагов примерно на 17%, но поднял число выходных токенов за шаг с 3.27 до 4.80. Главная находка в конфиге: --moe-backend flashinfer_b12x не выбирается режимом auto . Явное включение дало +13.3% по среднему пяти прогонов на card‑like профиле (59.7 против 67.6) и +16.6% по медиане. B12X работает иначе: поднимает SSE‑derived частоту verification‑шагов на 16–18%, при этом выходные токены за шаг снижаются примерно на 2.5% в обоих профилях. Итоговый прирост клиентской decode‑метрики составил 13.3–14.6% по средним и 15.6–16.6% по медианам. Итог: 67.6 tok/s на одиночном запросе, 260 tok/s суммарно на 12 параллельных запросов. Отрицательные результаты, погрешности и границы применимости вынесены в отдельные разделы.
https://habr.com/ru/articles/1066164/
#DGX_Spark #vLLM #LLM_инференс #бенчмарк #спекулятивное_декодирование #GB10 #MoE #локальные_нейросети #speculative_decoding #DeepSeek_0731
-
RT @Kimi_Moonshot: Veröffentlichung der Modellgewichte und des technischen Berichts von Kimi K3. Kimi K3 ist unser leistungsfähigstes Modell: ein 2,8-T-Billionen-Parameter-MoE-Modell mit nativem visuellem Verständnis und einem Kontextfenster von 1 Million Token. Neue Modellarchitektur: 2,5-mal mehr Intelligenz pro Recheneinheit, nicht einfach nur mehr Parameter. Parallel zu Kimi K3 stellen wir weitere Komponenten der zugrunde liegenden Infrastruktur frei – hochperformante Attention-Kernels, eine MoE-Kommunikationsbibliothek und Infrastruktur für den skalierbaren Betrieb von Agent-Umgebungen. Modellgewichte: http://huggingface.co/moonshotai/Kimi-K3 Technischer Bericht: http://github.com/MoonshotAI/Kimi-K3/blob/master/k3techreport.pdf Tech-Blog: http://kimi.com/blog/kimi-k3
mehr auf Arint.info
#AI #DeepLearning #KimiK3 #MachineLearning #MoE #OpenSource #arint_info
-
Kimi K3 — что реально даёт открытие весов самой большой модели
27 июля Moonshot AI выложила веса Kimi K3 — модели на 2,8 трлн параметров, которая до этого работала только через платный API. Вместе с весами открыли технический отчёт и три внутренних инструмента, на которых модель обучали. Разберём релиз по частям: что подтверждено независимыми замерами, что остаётся заявлением компании и на какие детали стоит посмотреть до того, как планировать внедрение.
https://habr.com/ru/articles/1063742/
#kimi_k3 #kimi #moonshot_ai #открытые_данные #moe #open_source #llm