home.social

#llamacpp — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #llamacpp, aggregated by home.social.

fetched live
  1. 753B на одной видеокарте: разбор FreeToken

    Бывает так: сидишь, листаешь ленту, и в очередной раз натыкаешься на пост, где стафф-инженер из солнечной Калифорнии крутит свежую модельку на паре RTX PRO 6000 общей стоимостью с подержанную машину. Ты смотришь на свою RTX 4060 в ноутбуке, который покупал «не только для игр», и понимаешь: ну ладно, это не для нас. Так вот, это как раз для нас. На той самой ноутбучной 4060 с восемью гигабайтами и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде. Вопрос был не в железе, а в софте, который это железо обслуживает. Разбираем FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang. Запустить AGI на слабом железе

    habr.com/ru/articles/1073522/

    #moe #локальные_модели #инференс #llamacpp #llm #оффлоадинг #агенты #cuda #gpu #freetoken

  2. Чем Go полезен при разработке AI-агентов

    Всем привет! Меня зовут Илья Данилкин , я тимлид в Авито Авто . AI-агенты обычно живут рядом с Python, но всё же немало команд выбирают язык Go. Дело в том, что агенты большую часть времени не заняты сложными математическими расчётами, а ждут ответа модели или результата инструмента. А ещё работают в режиме бесконечных параллельных запусков. И если пользователь останавливает задачу, его запрос и следующие вызовы инструментов тоже нужно остановить. Поэтому при выборе языка важны не только библиотеки для работы с моделями, но и то, как язык справляется с одновременными задачами, отменяет операции и насколько просто доставить готовое приложение пользователю. В Go для этого есть дешёвые горутины, context.Context и сборка в один бинарник. В статье на примерах и материалах из Go-сообщества разберу пять сценариев, когда эти и другие свойства Go очень и очень нужны.

    habr.com/ru/companies/avito/ar

    #go #Golang #AIагенты #MCP #contextContext #горутины #llamacpp #локальные_LLM

  3. А все-таки Qwen3.8-27B — думает меньше и быстрее чем 3.6

    В пятницу вышла Qwen3.8-27B. Скажу честно, с середины мая я отказался от подписок и сидел исключительно на локальной Qwen3.6 (для всех своих домашних проектов), у меня даже статья была на эту тему . Поэтому мне было очень интересно увидеть на что способна новая Qwen3.8-27B. Тут на Хабре было несколько статей о том, что 3.8 слишком долго думает и что у 3.8 слишком много галлюцинаций (что как мне кажется не совсем корректно), поэтому я решил поделиться настройками, которые работают (у меня), надеюсь они будут кому-нибудь полезны. Qwen3.8-27B превзошла мои самые смелые ожидания, и уж что-что, а задумчивой ее никак не назовешь.

    habr.com/ru/articles/1071872/

    #qwen3827B #llamacpp #gguf_conversion #llamacpp_settings

  4. Playing with the latest open weight models. Wow they are so good now compared to the last generation. Able to do a lot more on my own infra controlling all aspects! #ai #llamacpp #vllm

  5. 3 бита вместо 16: разбираем TurboQuant и когда его реально стоит включать

    В марте 2026 года Google публикует пост про алгоритм сжатия памяти для языковых моделей. Звучит скучно, правда? Но акции Micron, SanDisk, Samsung, SK Hynix и других производителей памяти за неделю теряют суммарно почти $90 млрд капитализации. Инвесторы паникуют: если модели начнут тратить в разы меньше памяти, то зачем столько железа? Алгоритм, который навел весь этот шум, называется TurboQuant — герой этой статьи. Я не буду говорить, что это «революция» или «переворот в индустрии» — это было бы явное преувеличение. Но штука действительно интересная, и уже есть рабочие реализации. Если вы деплоите LLM в продакшн или просто прогоняете модели локально, то вам 100% будет полезно об этом узнать. Разберем, что из заявленного правда, а что преувеличение, и главное — как это попробовать прямо сейчас.

    habr.com/ru/companies/selectel

    #kv_cache #llm #llamacpp #sglang #vllm #selectel

  6. Qwen3.8-27B (-Q6_K) von Unsloth ist draussen.

    Reasoning auf medium setzen kann helfen. xHigh ist default, das kostet.

    Der Plan den Kilo-Code via qwen3.8-27B erstellt hat ist wirklich klasse

    #localai #llamacpp

  7. MoE на 5090 недобирает полтора раза, и дело не в маршрутизации

    RTX 5090, одна и та же сборка llama.cpp, один драйвер, батч 1. Плотная Qwen3.5-9B выбирает 72% пропускной способности памяти карты. MoE Qwen3.5-35B-A3B на той же карте выбирает 41%. Маршрутизация экспертов тут почти ни при чём, я её измерил: ядра top-k занимают 7% времени. CUDA-графы захватываются, дыр между запусками нет, занятость SM 97%. Карта работает почти всё время, просто делает работу медленнее, чем позволяет память. Причина оказалась в том, сколько байт читает одно ядро за запуск. Я написал программу на ggml, которая гоняет тот же mul_mat_vec_q на холодных весах, и снял кривую: на 1 МБ ядро берёт 23% полосы, на 4.2 МБ уже 53%, на 33.6 МБ 91%. У MoE на одно ядро приходится 4.6 МБ, у плотной модели 22.2 МБ. Вот и весь разрыв. В статье: разбивка всех 437 матвеков по трассе nsys, четыре способа померить это неправильно и посидеть в каждой ловушке по очереди, проверка модели на другой архитектуре с ошибкой 3.7% и на четырёх глубинах контекста, цена сэмплера и всей обвязки llama-server. Последнее оказалось крупнее всего остального: пользователь видит 225 токенов в секунду там, где бенчмарк показывает 317.

    habr.com/ru/articles/1069574/

    #llamacpp #moe #rtx_5090 #пропускная_способность_памяти #cuda #gpu #инференс_ллм #бенчмарк #профилирование #qwen_35

  8. 🐪🚀 Llama.cpp: Because nothing says "cutting-edge AI" like running everything on a dusty old laptop from 2010. 🤖💾 Forget the cloud, the future is apparently local... as in, locally outdated. 🖥️🔧
    llama.app #LlamaCpp #AI #LocalComputing #OutdatedTech #Innovation #HackerNews #ngated

  9. Всё, что вы хотели знать о локальном ИИ, но стеснялись спросить

    Если вы когда-нибудь смотрели на HF и не понимали, что такое DFlash, квантизация и почему одна и та же модель лежит в десяти репозиториях от десяти разных людей — или давно собирались поднять LLM у себя, но всё не находили повода — выход Muse Glimmer 30B буквально лучший момент начать. Буквально со своего MacBook Air. Ага, да вот уже сейчас прямо. Погрузиться в мир локальных моделей

    habr.com/ru/articles/1069422/

    #llm #локальные_модели #квантизация #llamacpp #apple_silicon #gguf #инференс #moe #meta

  10. 'Muse Glimmer 30B' in UD-Q4_K_XL:

    PP: ca. 500 Tokens/s
    TG: ca. 55 Tokens/s

    MB: Asus X870 AM5
    CPU: AMD Ryzen 9900x (64 GB DDR5-RAM)
    GPU: AMD Radeon AI R9700 (32 GB VRAM)
    OS: Arch-Linux

    huggingface.co/unsloth/Muse-Gl

    #localai #llamacpp

  11. Testing #localLLM again. #QuoteOfTheDay

    Q: if humankind has those non-man-given incentives as drivers for "innovation if required", rather than "innovation to sell a product noone wants": what's your opinion?

    A: We would have:

    * A stable climate.
    * Abundant, clean food.
    * Healthy, long-lasting infrastructure.
    * A society that feels secure rather than anxious.

    For long-term human wellbeing and planetary health, this is not just better—it is essential [...]"

    #Qwen3 #llamacpp #FOSS

  12. Тест локальных MOE моделей

    Я тут решил решил чуток заморочиться и протестировать локальные MOE модели на кодинг. Кодинг громко сказано - мои задачи исключительно игры причем на html, css, js. Но зато с таким набором можно сразу в продакшен, легко проверить без компиляций, кроссплатформенность ну и другие известные плюсы и минусы. На тесте побывало 10 моделей: Qwen 3.6 (MTP), KAT Coder V2.5, Gemma 4, Aurora-Code-1, Frontis, GLM 4.7 Flash, Ornith 1.0, Salience 1.5 Pro, Agents A1, GPT-oss 20b. Ссылки на модели есть в таблице результатов на которую ниже будет тоже ссылка. Многие из этих моделей сделаны на базе Qwen и тем интереснее было тестировать, потому что по бенчмаркам в карточках моделей на HF они часто превосходят своего учителя. Правда я сразу был настроен скептически и понимал что вряд ли они смогут составить реальную конкуренцию - хоть и дообучаются на кодинг, но такого рода тесты не очень как будто бы проходят, что собственно и подтверждает итоговая таблица с результатами (подсчитывал результаты Qwen3.8-Max):

    habr.com/ru/articles/1068416/

    #llm #llamacpp #игры #html

  13. First up @goinggo.net lightning talk about kronkai.com here at @gophercon.com
    #gophercon #golang #llm #llamacpp

  14. 📊 Leads every instruction-following benchmark and nearly all tool-use benchmarks against models up to 4x its size, trailing only #Qwen3_5 9B on BFCLv4 — coding remains the weaker area

    🔧 Day-one support for #llamacpp (GGUF), #MLX, #vLLM, #SGLang and #ONNX across Apple, AMD, Qualcomm and NVIDIA hardware

  15. DeepSeek V4 Flash is no longer text-only 👀

    In our internal benchmarks, it delivered significantly better price-performance than others in its class.

    We’ve added vision for screen-level understanding, capabilities needed for WebBrain

    Available on HF:
    huggingface.co/webbrain-one/De

    #deepseek #ai #opensource #llm #llama #llamacpp #ollama

  16. Как я смог запустить 32b модель и сделать ее умнее в два раза на 3050

    Всем здрайвствуйте я Titled и я создал форк llama.cpp где реализовал все свои жаветные мечты сейчас расскажу что это было и почему я написал такооой длиный заголовок. Разберем как я это реализовал и почему это может вам помочь ! жмякай сюды

    habr.com/ru/articles/1064258/

    #ии #форк #llamacpp #нейросети #умно_типа #умножение_матриц

  17. Как я ужал русский эмбеддер до 24 млн параметров — и чуть не испортил его одной цифрой

    TL;DR. У меня локальный RAG на AMD Strix Halo. Памяти там достаточно, но вычислительно всё упирается в один iGPU: его делят эмбеддер, реранкер и периодическая переиндексация, а в одноузловой конфигурации туда же встаёт генеративная LLM. Поэтому мне понадобился не самый точный retriever вообще, а максимально лёгкий русский retriever, который быстрее завершает первую стадию поиска на том же GPU. Насколько это больно, я в итоге померил на живом узле. На синтетической индексирующей нагрузке полной тяги bge‑m3 снизил generation throughput Qwen3.6-35B-A3B на 92%, STRIZH на 28% при примерно 12,6-кратном темпе индексации (окна замера там неравные, 20,6 против 173,6 секунды, потому что задаются временем пяти генераций; равнооконный прогон RAG‑конвейера ниже даёт по батчам в секунду 9,4-кратный отрыв). В полном RAG‑конвейере с четырьмя пользовательскими потоками и фоновой индексацией STRIZH удержал 14,0 транзакции в минуту против 6,0 у bge‑m3 и индексировал 46 батчей в секунду против 4,9. При фиксированных 200 онлайн‑запросах в секунду генерация проседала на 2% со STRIZH и на 7% с bge‑m3. Оговорка сразу: без фоновой индексации STRIZH преимущества не показал : в этом профиле bge‑m3 оказался немного быстрее, а пропускную способность определяли реранк (0,6–0,7 с на транзакцию), prefill и генерация. Я взял 12-слойный RuModernBERT-small , сначала неудачно попытался повторить пространство большого учителя через MSE, затем обучил retrieval‑донор на контрастивной задаче, выбрал из него четыре слоя [0, 5, 9, 11] и доучил student на русских, английских и смешанных парах с hard negatives от BGE‑M3.

    habr.com/ru/articles/1064138/

    #эмбеддинги #RAG #retrieval #энкодеры #RuModernBERT #STRIZH #llamacpp #GGUF #Vulkan #Strix_Halo