#llamacpp — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #llamacpp, aggregated by home.social.
-
753B на одной видеокарте: разбор FreeToken
Бывает так: сидишь, листаешь ленту, и в очередной раз натыкаешься на пост, где стафф-инженер из солнечной Калифорнии крутит свежую модельку на паре RTX PRO 6000 общей стоимостью с подержанную машину. Ты смотришь на свою RTX 4060 в ноутбуке, который покупал «не только для игр», и понимаешь: ну ладно, это не для нас. Так вот, это как раз для нас. На той самой ноутбучной 4060 с восемью гигабайтами и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде. Вопрос был не в железе, а в софте, который это железо обслуживает. Разбираем FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang. Запустить AGI на слабом железе
https://habr.com/ru/articles/1073522/
#moe #локальные_модели #инференс #llamacpp #llm #оффлоадинг #агенты #cuda #gpu #freetoken
-
Statement zu KI und mein teilrückzug aus dem Fediverse
https://friendica.tf-translate.net/display/cafe12d9-116a-8634-5024-1d3980317993
-
Чем Go полезен при разработке AI-агентов
Всем привет! Меня зовут Илья Данилкин , я тимлид в Авито Авто . AI-агенты обычно живут рядом с Python, но всё же немало команд выбирают язык Go. Дело в том, что агенты большую часть времени не заняты сложными математическими расчётами, а ждут ответа модели или результата инструмента. А ещё работают в режиме бесконечных параллельных запусков. И если пользователь останавливает задачу, его запрос и следующие вызовы инструментов тоже нужно остановить. Поэтому при выборе языка важны не только библиотеки для работы с моделями, но и то, как язык справляется с одновременными задачами, отменяет операции и насколько просто доставить готовое приложение пользователю. В Go для этого есть дешёвые горутины, context.Context и сборка в один бинарник. В статье на примерах и материалах из Go-сообщества разберу пять сценариев, когда эти и другие свойства Go очень и очень нужны.
https://habr.com/ru/companies/avito/articles/1069734/
#go #Golang #AIагенты #MCP #contextContext #горутины #llamacpp #локальные_LLM
-
А все-таки Qwen3.8-27B — думает меньше и быстрее чем 3.6
В пятницу вышла Qwen3.8-27B. Скажу честно, с середины мая я отказался от подписок и сидел исключительно на локальной Qwen3.6 (для всех своих домашних проектов), у меня даже статья была на эту тему . Поэтому мне было очень интересно увидеть на что способна новая Qwen3.8-27B. Тут на Хабре было несколько статей о том, что 3.8 слишком долго думает и что у 3.8 слишком много галлюцинаций (что как мне кажется не совсем корректно), поэтому я решил поделиться настройками, которые работают (у меня), надеюсь они будут кому-нибудь полезны. Qwen3.8-27B превзошла мои самые смелые ожидания, и уж что-что, а задумчивой ее никак не назовешь.
-
3 бита вместо 16: разбираем TurboQuant и когда его реально стоит включать
В марте 2026 года Google публикует пост про алгоритм сжатия памяти для языковых моделей. Звучит скучно, правда? Но акции Micron, SanDisk, Samsung, SK Hynix и других производителей памяти за неделю теряют суммарно почти $90 млрд капитализации. Инвесторы паникуют: если модели начнут тратить в разы меньше памяти, то зачем столько железа? Алгоритм, который навел весь этот шум, называется TurboQuant — герой этой статьи. Я не буду говорить, что это «революция» или «переворот в индустрии» — это было бы явное преувеличение. Но штука действительно интересная, и уже есть рабочие реализации. Если вы деплоите LLM в продакшн или просто прогоняете модели локально, то вам 100% будет полезно об этом узнать. Разберем, что из заявленного правда, а что преувеличение, и главное — как это попробовать прямо сейчас.
-
Qwen3.8-27B (-Q6_K) von Unsloth ist draussen.
Reasoning auf medium setzen kann helfen. xHigh ist default, das kostet.
Der Plan den Kilo-Code via qwen3.8-27B erstellt hat ist wirklich klasse
-
Humbled that our number of Chrome-only active users surpassed 1,000 for the first time.
https://github.com/webbrain-one/webbrain
#Chrome #ChromeExtension #WebExtension #Milestone #OpenSource #GitHub #WebBrain #offlinellm #qwen #gemma #ollama #llamacpp
-
MoE на 5090 недобирает полтора раза, и дело не в маршрутизации
RTX 5090, одна и та же сборка llama.cpp, один драйвер, батч 1. Плотная Qwen3.5-9B выбирает 72% пропускной способности памяти карты. MoE Qwen3.5-35B-A3B на той же карте выбирает 41%. Маршрутизация экспертов тут почти ни при чём, я её измерил: ядра top-k занимают 7% времени. CUDA-графы захватываются, дыр между запусками нет, занятость SM 97%. Карта работает почти всё время, просто делает работу медленнее, чем позволяет память. Причина оказалась в том, сколько байт читает одно ядро за запуск. Я написал программу на ggml, которая гоняет тот же mul_mat_vec_q на холодных весах, и снял кривую: на 1 МБ ядро берёт 23% полосы, на 4.2 МБ уже 53%, на 33.6 МБ 91%. У MoE на одно ядро приходится 4.6 МБ, у плотной модели 22.2 МБ. Вот и весь разрыв. В статье: разбивка всех 437 матвеков по трассе nsys, четыре способа померить это неправильно и посидеть в каждой ловушке по очереди, проверка модели на другой архитектуре с ошибкой 3.7% и на четырёх глубинах контекста, цена сэмплера и всей обвязки llama-server. Последнее оказалось крупнее всего остального: пользователь видит 225 токенов в секунду там, где бенчмарк показывает 317.
https://habr.com/ru/articles/1069574/
#llamacpp #moe #rtx_5090 #пропускная_способность_памяти #cuda #gpu #инференс_ллм #бенчмарк #профилирование #qwen_35
-
🐪🚀 Llama.cpp: Because nothing says "cutting-edge AI" like running everything on a dusty old laptop from 2010. 🤖💾 Forget the cloud, the future is apparently local... as in, locally outdated. 🖥️🔧
https://llama.app #LlamaCpp #AI #LocalComputing #OutdatedTech #Innovation #HackerNews #ngated -
Всё, что вы хотели знать о локальном ИИ, но стеснялись спросить
Если вы когда-нибудь смотрели на HF и не понимали, что такое DFlash, квантизация и почему одна и та же модель лежит в десяти репозиториях от десяти разных людей — или давно собирались поднять LLM у себя, но всё не находили повода — выход Muse Glimmer 30B буквально лучший момент начать. Буквально со своего MacBook Air. Ага, да вот уже сейчас прямо. Погрузиться в мир локальных моделей
https://habr.com/ru/articles/1069422/
#llm #локальные_модели #квантизация #llamacpp #apple_silicon #gguf #инференс #moe #meta
-
Apple Silicon and macOS VMs: 11–16× Faster LLM Inference with Llama.cpp
https://github.com/trycua/cua/blob/main/blog/gpu-passthrough-macos-vms.md
Comments: https://news.ycombinator.com/item?id=49259339
#HackerNews #AppleSilicon #macOS #LLMInference #LlamaCpp #VirtualMachines #PerformanceBoost
-
'Muse Glimmer 30B' in UD-Q4_K_XL:
PP: ca. 500 Tokens/s
TG: ca. 55 Tokens/sMB: Asus X870 AM5
CPU: AMD Ryzen 9900x (64 GB DDR5-RAM)
GPU: AMD Radeon AI R9700 (32 GB VRAM)
OS: Arch-Linux -
Testing #localLLM again. #QuoteOfTheDay
Q: if humankind has those non-man-given incentives as drivers for "innovation if required", rather than "innovation to sell a product noone wants": what's your opinion?
A: We would have:
* A stable climate.
* Abundant, clean food.
* Healthy, long-lasting infrastructure.
* A society that feels secure rather than anxious.For long-term human wellbeing and planetary health, this is not just better—it is essential [...]"
-
Open source must win.
-
Тест локальных MOE моделей
Я тут решил решил чуток заморочиться и протестировать локальные MOE модели на кодинг. Кодинг громко сказано - мои задачи исключительно игры причем на html, css, js. Но зато с таким набором можно сразу в продакшен, легко проверить без компиляций, кроссплатформенность ну и другие известные плюсы и минусы. На тесте побывало 10 моделей: Qwen 3.6 (MTP), KAT Coder V2.5, Gemma 4, Aurora-Code-1, Frontis, GLM 4.7 Flash, Ornith 1.0, Salience 1.5 Pro, Agents A1, GPT-oss 20b. Ссылки на модели есть в таблице результатов на которую ниже будет тоже ссылка. Многие из этих моделей сделаны на базе Qwen и тем интереснее было тестировать, потому что по бенчмаркам в карточках моделей на HF они часто превосходят своего учителя. Правда я сразу был настроен скептически и понимал что вряд ли они смогут составить реальную конкуренцию - хоть и дообучаются на кодинг, но такого рода тесты не очень как будто бы проходят, что собственно и подтверждает итоговая таблица с результатами (подсчитывал результаты Qwen3.8-Max):
-
Building a Rust Inference Engine That Matches Llama.cpp
https://www.fratepietro.com/2026/ferrox-rust-gguf-inference-engine/
Comments: https://news.ycombinator.com/item?id=49180302
#HackerNews #Rust #Inference #Engine #LlamaCpp #AI #Development #MachineLearning
-
First up @goinggo.net lightning talk about kronkai.com here at @gophercon.com
#gophercon #golang #llm #llamacpp -
📊 Leads every instruction-following benchmark and nearly all tool-use benchmarks against models up to 4x its size, trailing only #Qwen3_5 9B on BFCLv4 — coding remains the weaker area
🔧 Day-one support for #llamacpp (GGUF), #MLX, #vLLM, #SGLang and #ONNX across Apple, AMD, Qualcomm and NVIDIA hardware
-
DeepSeek V4 Flash is no longer text-only 👀
In our internal benchmarks, it delivered significantly better price-performance than others in its class.
We’ve added vision for screen-level understanding, capabilities needed for WebBrain
Available on HF:
https://huggingface.co/webbrain-one/DeepSeek-V4-Flash-0731-Vision-NVFP4 -
Как я смог запустить 32b модель и сделать ее умнее в два раза на 3050
Всем здрайвствуйте я Titled и я создал форк llama.cpp где реализовал все свои жаветные мечты сейчас расскажу что это было и почему я написал такооой длиный заголовок. Разберем как я это реализовал и почему это может вам помочь ! жмякай сюды
-
Как я ужал русский эмбеддер до 24 млн параметров — и чуть не испортил его одной цифрой
TL;DR. У меня локальный RAG на AMD Strix Halo. Памяти там достаточно, но вычислительно всё упирается в один iGPU: его делят эмбеддер, реранкер и периодическая переиндексация, а в одноузловой конфигурации туда же встаёт генеративная LLM. Поэтому мне понадобился не самый точный retriever вообще, а максимально лёгкий русский retriever, который быстрее завершает первую стадию поиска на том же GPU. Насколько это больно, я в итоге померил на живом узле. На синтетической индексирующей нагрузке полной тяги bge‑m3 снизил generation throughput Qwen3.6-35B-A3B на 92%, STRIZH на 28% при примерно 12,6-кратном темпе индексации (окна замера там неравные, 20,6 против 173,6 секунды, потому что задаются временем пяти генераций; равнооконный прогон RAG‑конвейера ниже даёт по батчам в секунду 9,4-кратный отрыв). В полном RAG‑конвейере с четырьмя пользовательскими потоками и фоновой индексацией STRIZH удержал 14,0 транзакции в минуту против 6,0 у bge‑m3 и индексировал 46 батчей в секунду против 4,9. При фиксированных 200 онлайн‑запросах в секунду генерация проседала на 2% со STRIZH и на 7% с bge‑m3. Оговорка сразу: без фоновой индексации STRIZH преимущества не показал : в этом профиле bge‑m3 оказался немного быстрее, а пропускную способность определяли реранк (0,6–0,7 с на транзакцию), prefill и генерация. Я взял 12-слойный RuModernBERT-small , сначала неудачно попытался повторить пространство большого учителя через MSE, затем обучил retrieval‑донор на контрастивной задаче, выбрал из него четыре слоя [0, 5, 9, 11] и доучил student на русских, английских и смешанных парах с hard negatives от BGE‑M3.
https://habr.com/ru/articles/1064138/
#эмбеддинги #RAG #retrieval #энкодеры #RuModernBERT #STRIZH #llamacpp #GGUF #Vulkan #Strix_Halo