#apple_silicon — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #apple_silicon, aggregated by home.social.
-
Дело о лишних размышлениях: почему вредно много думать
…Еще играясь с Qwen3.6 я дал ей стандартную handoff задачу от своей AI команды по проекту SwiftUI и QWEN cli ее так и не решил. Просто ушел в постоянные размышления. В итоге я его просто закрыл и сделал вывод, что Qwen3.6 не может решать такие задачи. И как оказалось я поспешил… В предыдущем расследовании https://habr.com/ru/articles/1075706 мы искали скорость локальной Qwen3.8-27B на Mac Studio. Вывод был довольно жёстким: для интерактивной работы радикально ускорить 27-миллиардную модель можно прежде всего уменьшив объём её весов, то есть квантизацией. В связке с DFlash2 версия 8-bit дошла до 38 токенов в секунду. Но это был только первый вопрос. Быстро отвечать и хорошо работать — не одно и то же. Особенно когда модель должна не пересказать текст, а разобрать инцидент, соблюдать строгий формат, написать и отладить код. Я хотел найти не самую быструю версию Qwen3.8-27B, а модель, которую можно реально использовать каждый день: чтобы не ждать ответ по минуте и не получать взамен очень убедительную чепуху. Казалось, что план очевиден. BF16 берём как эталон качества. 8-bit и 4-bit сравниваем с ним. А чтобы квантизованные версии точно не потеряли в сложных задачах, включаем им максимальный уровень рассуждений — reasoning_effort=xhigh . Это была вполне логичная гипотеза. И она оказалась неверной.
https://habr.com/ru/articles/1079274/
#qwen3827b #omlx #mlx #apple_silicon #mac_studio_m3_ultra #локальные_llm #инференс_llm
-
Дело о 38 токенах в секунду: почему M3 Ultra начинал с двенадцати
Всё началось с простой, на первый взгляд, задачи. Я хотел использовать локально Qwen3.8-27B именно в BF16. Причём не исходный PyTorch-чекпойнт через случайный слой совместимости, а mlx-community/Qwen3.8-27B-bf16 — специально подготовленную в формате MLX версию для Apple Silicon. Вся линейка Qwen3.8 от mlx-community конвертирована именно для запуска на процессорах Apple. То есть модель уже была адаптирована под архитектуру Mac. Без 8-битной или 4-битной квантизации, потому что исходный приоритет был не в том, чтобы любой ценой получить красивую цифру в бенчмарке. Мне нужна была максимальная точность модели для сложного анализа, работы с кодом и длинных рассуждений. Казалось, что с железом проблем точно не будет. Моя конфигурация — Mac Studio 2025 года ( Mac15,14 , заказной номер Z1CE001BMZP/A ) с Apple M3 Ultra: 32 ядра CPU, из них 24 производительных, 80 ядер GPU, 512 ГБ объединённой памяти и SSD на 2 ТБ. Заявленная Apple пропускная способность памяти — 819 ГБ/с . То есть перед нами не ноутбук, который случайно заставили считать большую языковую модель. Это максимальная конфигурация M3 Ultra по CPU, GPU и объёму памяти. И на ней оптимизированная для Apple Silicon версия Qwen3.8-27B в BF16 выдавала всего 12 токенов в секунду . Сначала результат выглядел подозрительно. В машине десятки CPU- и GPU-ядер, модель целиком помещается в память, используется нативный для Apple Silicon фреймворк MLX. Почему тогда скорость совсем не похожа на то, чего ждёшь от топового GPU? Я начал искать узкое место.
https://habr.com/ru/articles/1075706/
#Qwen3827B #DFlash2 #oMLX #MLX #Apple_Silicon #Mac_Studio_M3_Ultra #локальные_LLM #инференс_LLM #speculative_decoding #BF16
-
How to vibe code for free: Running Qwen3 on your Mac, using MLX
https://localforge.dev/blog/running-qwen3-macbook-mlx
#ycombinator #Qwen3 #MLX #macOS #Apple_Silicon #Local_LLM #Localforge #Free_Code_Generation #Ollama #Local_AI #LLM_Agent -
MacやiPhone、iPadに対応したAI画像生成アプリ「Draw Things」が日本語にローカライズ。
https://applech2.com/archives/20250221-draw-things-support-japanese.html#applech2 #ChatGPT_AI #Apple_Silicon #iPad #iPhone #Mac #MacAppStore #Stable_Diffusion #アプリ #日本語