home.social

#llamacpp — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #llamacpp, aggregated by home.social.

fetched live
  1. KV cache streaming - the llama.cpp fork that enables Qwen 3.8 27B at large contexts for 16GB VRAM GPU owners

    video.troed.se/w/x2AxNGkvy21Gb

  2. KV cache streaming - the llama.cpp fork that enables Qwen 3.8 27B at large contexts for 16GB VRAM GPU owners

    video.troed.se/w/x2AxNGkvy21Gb

  3. KV cache streaming - the llama.cpp fork that enables Qwen 3.8 27B at large contexts for 16GB VRAM GPU owners

    video.troed.se/w/x2AxNGkvy21Gb

  4. KV cache streaming - the llama.cpp fork that enables Qwen 3.8 27B at large contexts for 16GB VRAM GPU owners

    video.troed.se/w/x2AxNGkvy21Gb

  5. KV cache streaming - the llama.cpp fork that enables Qwen 3.8 27B at large contexts for 16GB VRAM GPU owners

    video.troed.se/w/x2AxNGkvy21Gb

  6. Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток/сек на двух RTX 3090

    Плотная 27-миллиардная модель на двух RTX 3090 в llama.cpp из коробки даёт 32 токена в секунду. Интуитивно понятно, что это не предел: две карты по 24 ГБ и 936 ГБ/с каждая не должны выдавать столько, сколько выдаёт одна. Значит, где-то узкое горлышко — и надо разобраться, что и где подкрутить. Горлышек оказалось несколько, и все снимаются флагами запуска: те же веса — 75 токенов в секунду. Под катом каждый флаг описан по одной схеме: зачем, что писать, что даёт в цифрах, где ломается и с какой строкой в логе. В конце — готовый docker run , три проверки после каждой смены флага и список того, что не сработало. Текст можно отдать целиком агенту с доступом к серверу — это инструкция, а не история.

    habr.com/ru/articles/1076080/

    #llm #ai #llamacpp #qwen #qwen38 #gguf #квантование #локальные_нейросети #локальные_модели

  7. Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток/сек на двух RTX 3090

    Плотная 27-миллиардная модель на двух RTX 3090 в llama.cpp из коробки даёт 32 токена в секунду. Интуитивно понятно, что это не предел: две карты по 24 ГБ и 936 ГБ/с каждая не должны выдавать столько, сколько выдаёт одна. Значит, где-то узкое горлышко — и надо разобраться, что и где подкрутить. Горлышек оказалось несколько, и все снимаются флагами запуска: те же веса — 75 токенов в секунду. Под катом каждый флаг описан по одной схеме: зачем, что писать, что даёт в цифрах, где ломается и с какой строкой в логе. В конце — готовый docker run , три проверки после каждой смены флага и список того, что не сработало. Текст можно отдать целиком агенту с доступом к серверу — это инструкция, а не история.

    habr.com/ru/articles/1076080/

    #llm #ai #llamacpp #qwen #qwen38 #gguf #квантование #локальные_нейросети #локальные_модели

  8. Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток/сек на двух RTX 3090

    Плотная 27-миллиардная модель на двух RTX 3090 в llama.cpp из коробки даёт 32 токена в секунду. Интуитивно понятно, что это не предел: две карты по 24 ГБ и 936 ГБ/с каждая не должны выдавать столько, сколько выдаёт одна. Значит, где-то узкое горлышко — и надо разобраться, что и где подкрутить. Горлышек оказалось несколько, и все снимаются флагами запуска: те же веса — 75 токенов в секунду. Под катом каждый флаг описан по одной схеме: зачем, что писать, что даёт в цифрах, где ломается и с какой строкой в логе. В конце — готовый docker run , три проверки после каждой смены флага и список того, что не сработало. Текст можно отдать целиком агенту с доступом к серверу — это инструкция, а не история.

    habr.com/ru/articles/1076080/

    #llm #ai #llamacpp #qwen #qwen38 #gguf #квантование #локальные_нейросети #локальные_модели

  9. 753B на одной видеокарте: разбор FreeToken

    Бывает так: сидишь, листаешь ленту, и в очередной раз натыкаешься на пост, где стафф-инженер из солнечной Калифорнии крутит свежую модельку на паре RTX PRO 6000 общей стоимостью с подержанную машину. Ты смотришь на свою RTX 4060 в ноутбуке, который покупал «не только для игр», и понимаешь: ну ладно, это не для нас. Так вот, это как раз для нас. На той самой ноутбучной 4060 с восемью гигабайтами и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде. Вопрос был не в железе, а в софте, который это железо обслуживает. Разбираем FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang. Запустить AGI на слабом железе

    habr.com/ru/articles/1073522/

    #moe #локальные_модели #инференс #llamacpp #llm #оффлоадинг #агенты #cuda #gpu #freetoken

  10. 753B на одной видеокарте: разбор FreeToken

    Бывает так: сидишь, листаешь ленту, и в очередной раз натыкаешься на пост, где стафф-инженер из солнечной Калифорнии крутит свежую модельку на паре RTX PRO 6000 общей стоимостью с подержанную машину. Ты смотришь на свою RTX 4060 в ноутбуке, который покупал «не только для игр», и понимаешь: ну ладно, это не для нас. Так вот, это как раз для нас. На той самой ноутбучной 4060 с восемью гигабайтами и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде. Вопрос был не в железе, а в софте, который это железо обслуживает. Разбираем FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang. Запустить AGI на слабом железе

    habr.com/ru/articles/1073522/

    #moe #локальные_модели #инференс #llamacpp #llm #оффлоадинг #агенты #cuda #gpu #freetoken

  11. 753B на одной видеокарте: разбор FreeToken

    Бывает так: сидишь, листаешь ленту, и в очередной раз натыкаешься на пост, где стафф-инженер из солнечной Калифорнии крутит свежую модельку на паре RTX PRO 6000 общей стоимостью с подержанную машину. Ты смотришь на свою RTX 4060 в ноутбуке, который покупал «не только для игр», и понимаешь: ну ладно, это не для нас. Так вот, это как раз для нас. На той самой ноутбучной 4060 с восемью гигабайтами и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде. Вопрос был не в железе, а в софте, который это железо обслуживает. Разбираем FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang. Запустить AGI на слабом железе

    habr.com/ru/articles/1073522/

    #moe #локальные_модели #инференс #llamacpp #llm #оффлоадинг #агенты #cuda #gpu #freetoken

  12. qwen3.8-27b:q4_K_M running on my RTX-4090 via very nicely. I couldn't make it run on the latest

    I'm tired of using as my primary agent. I'm trialing switching to with and using CC as a subagent.

  13. Чем Go полезен при разработке AI-агентов

    Всем привет! Меня зовут Илья Данилкин , я тимлид в Авито Авто . AI-агенты обычно живут рядом с Python, но всё же немало команд выбирают язык Go. Дело в том, что агенты большую часть времени не заняты сложными математическими расчётами, а ждут ответа модели или результата инструмента. А ещё работают в режиме бесконечных параллельных запусков. И если пользователь останавливает задачу, его запрос и следующие вызовы инструментов тоже нужно остановить. Поэтому при выборе языка важны не только библиотеки для работы с моделями, но и то, как язык справляется с одновременными задачами, отменяет операции и насколько просто доставить готовое приложение пользователю. В Go для этого есть дешёвые горутины, context.Context и сборка в один бинарник. В статье на примерах и материалах из Go-сообщества разберу пять сценариев, когда эти и другие свойства Go очень и очень нужны.

    habr.com/ru/companies/avito/ar

    #go #Golang #AIагенты #MCP #contextContext #горутины #llamacpp #локальные_LLM

  14. Чем Go полезен при разработке AI-агентов

    Всем привет! Меня зовут Илья Данилкин , я тимлид в Авито Авто . AI-агенты обычно живут рядом с Python, но всё же немало команд выбирают язык Go. Дело в том, что агенты большую часть времени не заняты сложными математическими расчётами, а ждут ответа модели или результата инструмента. А ещё работают в режиме бесконечных параллельных запусков. И если пользователь останавливает задачу, его запрос и следующие вызовы инструментов тоже нужно остановить. Поэтому при выборе языка важны не только библиотеки для работы с моделями, но и то, как язык справляется с одновременными задачами, отменяет операции и насколько просто доставить готовое приложение пользователю. В Go для этого есть дешёвые горутины, context.Context и сборка в один бинарник. В статье на примерах и материалах из Go-сообщества разберу пять сценариев, когда эти и другие свойства Go очень и очень нужны.

    habr.com/ru/companies/avito/ar

    #go #Golang #AIагенты #MCP #contextContext #горутины #llamacpp #локальные_LLM

  15. Чем Go полезен при разработке AI-агентов

    Всем привет! Меня зовут Илья Данилкин , я тимлид в Авито Авто . AI-агенты обычно живут рядом с Python, но всё же немало команд выбирают язык Go. Дело в том, что агенты большую часть времени не заняты сложными математическими расчётами, а ждут ответа модели или результата инструмента. А ещё работают в режиме бесконечных параллельных запусков. И если пользователь останавливает задачу, его запрос и следующие вызовы инструментов тоже нужно остановить. Поэтому при выборе языка важны не только библиотеки для работы с моделями, но и то, как язык справляется с одновременными задачами, отменяет операции и насколько просто доставить готовое приложение пользователю. В Go для этого есть дешёвые горутины, context.Context и сборка в один бинарник. В статье на примерах и материалах из Go-сообщества разберу пять сценариев, когда эти и другие свойства Go очень и очень нужны.

    habr.com/ru/companies/avito/ar

    #go #Golang #AIагенты #MCP #contextContext #горутины #llamacpp #локальные_LLM

  16. А все-таки Qwen3.8-27B — думает меньше и быстрее чем 3.6

    В пятницу вышла Qwen3.8-27B. Скажу честно, с середины мая я отказался от подписок и сидел исключительно на локальной Qwen3.6 (для всех своих домашних проектов), у меня даже статья была на эту тему . Поэтому мне было очень интересно увидеть на что способна новая Qwen3.8-27B. Тут на Хабре было несколько статей о том, что 3.8 слишком долго думает и что у 3.8 слишком много галлюцинаций (что как мне кажется не совсем корректно), поэтому я решил поделиться настройками, которые работают (у меня), надеюсь они будут кому-нибудь полезны. Qwen3.8-27B превзошла мои самые смелые ожидания, и уж что-что, а задумчивой ее никак не назовешь.

    habr.com/ru/articles/1071872/

    #qwen3827B #llamacpp #gguf_conversion #llamacpp_settings

  17. А все-таки Qwen3.8-27B — думает меньше и быстрее чем 3.6

    В пятницу вышла Qwen3.8-27B. Скажу честно, с середины мая я отказался от подписок и сидел исключительно на локальной Qwen3.6 (для всех своих домашних проектов), у меня даже статья была на эту тему . Поэтому мне было очень интересно увидеть на что способна новая Qwen3.8-27B. Тут на Хабре было несколько статей о том, что 3.8 слишком долго думает и что у 3.8 слишком много галлюцинаций (что как мне кажется не совсем корректно), поэтому я решил поделиться настройками, которые работают (у меня), надеюсь они будут кому-нибудь полезны. Qwen3.8-27B превзошла мои самые смелые ожидания, и уж что-что, а задумчивой ее никак не назовешь.

    habr.com/ru/articles/1071872/

    #qwen3827B #llamacpp #gguf_conversion #llamacpp_settings

  18. А все-таки Qwen3.8-27B — думает меньше и быстрее чем 3.6

    В пятницу вышла Qwen3.8-27B. Скажу честно, с середины мая я отказался от подписок и сидел исключительно на локальной Qwen3.6 (для всех своих домашних проектов), у меня даже статья была на эту тему . Поэтому мне было очень интересно увидеть на что способна новая Qwen3.8-27B. Тут на Хабре было несколько статей о том, что 3.8 слишком долго думает и что у 3.8 слишком много галлюцинаций (что как мне кажется не совсем корректно), поэтому я решил поделиться настройками, которые работают (у меня), надеюсь они будут кому-нибудь полезны. Qwen3.8-27B превзошла мои самые смелые ожидания, и уж что-что, а задумчивой ее никак не назовешь.

    habr.com/ru/articles/1071872/

    #qwen3827B #llamacpp #gguf_conversion #llamacpp_settings

  19. Playing with the latest open weight models. Wow they are so good now compared to the last generation. Able to do a lot more on my own infra controlling all aspects! #ai #llamacpp #vllm

  20. Playing with the latest open weight models. Wow they are so good now compared to the last generation. Able to do a lot more on my own infra controlling all aspects! #ai #llamacpp #vllm

  21. Playing with the latest open weight models. Wow they are so good now compared to the last generation. Able to do a lot more on my own infra controlling all aspects! #ai #llamacpp #vllm

  22. Playing with the latest open weight models. Wow they are so good now compared to the last generation. Able to do a lot more on my own infra controlling all aspects! #ai #llamacpp #vllm

  23. Playing with the latest open weight models. Wow they are so good now compared to the last generation. Able to do a lot more on my own infra controlling all aspects! #ai #llamacpp #vllm

  24. 3 бита вместо 16: разбираем TurboQuant и когда его реально стоит включать

    В марте 2026 года Google публикует пост про алгоритм сжатия памяти для языковых моделей. Звучит скучно, правда? Но акции Micron, SanDisk, Samsung, SK Hynix и других производителей памяти за неделю теряют суммарно почти $90 млрд капитализации. Инвесторы паникуют: если модели начнут тратить в разы меньше памяти, то зачем столько железа? Алгоритм, который навел весь этот шум, называется TurboQuant — герой этой статьи. Я не буду говорить, что это «революция» или «переворот в индустрии» — это было бы явное преувеличение. Но штука действительно интересная, и уже есть рабочие реализации. Если вы деплоите LLM в продакшн или просто прогоняете модели локально, то вам 100% будет полезно об этом узнать. Разберем, что из заявленного правда, а что преувеличение, и главное — как это попробовать прямо сейчас.

    habr.com/ru/companies/selectel

    #kv_cache #llm #llamacpp #sglang #vllm #selectel

  25. 3 бита вместо 16: разбираем TurboQuant и когда его реально стоит включать

    В марте 2026 года Google публикует пост про алгоритм сжатия памяти для языковых моделей. Звучит скучно, правда? Но акции Micron, SanDisk, Samsung, SK Hynix и других производителей памяти за неделю теряют суммарно почти $90 млрд капитализации. Инвесторы паникуют: если модели начнут тратить в разы меньше памяти, то зачем столько железа? Алгоритм, который навел весь этот шум, называется TurboQuant — герой этой статьи. Я не буду говорить, что это «революция» или «переворот в индустрии» — это было бы явное преувеличение. Но штука действительно интересная, и уже есть рабочие реализации. Если вы деплоите LLM в продакшн или просто прогоняете модели локально, то вам 100% будет полезно об этом узнать. Разберем, что из заявленного правда, а что преувеличение, и главное — как это попробовать прямо сейчас.

    habr.com/ru/companies/selectel

    #kv_cache #llm #llamacpp #sglang #vllm #selectel

  26. 3 бита вместо 16: разбираем TurboQuant и когда его реально стоит включать

    В марте 2026 года Google публикует пост про алгоритм сжатия памяти для языковых моделей. Звучит скучно, правда? Но акции Micron, SanDisk, Samsung, SK Hynix и других производителей памяти за неделю теряют суммарно почти $90 млрд капитализации. Инвесторы паникуют: если модели начнут тратить в разы меньше памяти, то зачем столько железа? Алгоритм, который навел весь этот шум, называется TurboQuant — герой этой статьи. Я не буду говорить, что это «революция» или «переворот в индустрии» — это было бы явное преувеличение. Но штука действительно интересная, и уже есть рабочие реализации. Если вы деплоите LLM в продакшн или просто прогоняете модели локально, то вам 100% будет полезно об этом узнать. Разберем, что из заявленного правда, а что преувеличение, и главное — как это попробовать прямо сейчас.

    habr.com/ru/companies/selectel

    #kv_cache #llm #llamacpp #sglang #vllm #selectel

  27. Qwen3.8-27B (-Q6_K) von Unsloth ist draussen.

    Reasoning auf medium setzen kann helfen. xHigh ist default, das kostet.

    Der Plan den Kilo-Code via qwen3.8-27B erstellt hat ist wirklich klasse

    #localai #llamacpp

  28. Qwen3.8-27B (-Q6_K) von Unsloth ist draussen.

    Reasoning auf medium setzen kann helfen. xHigh ist default, das kostet.

    Der Plan den Kilo-Code via qwen3.8-27B erstellt hat ist wirklich klasse

    #localai #llamacpp

  29. MoE на 5090 недобирает полтора раза, и дело не в маршрутизации

    RTX 5090, одна и та же сборка llama.cpp, один драйвер, батч 1. Плотная Qwen3.5-9B выбирает 72% пропускной способности памяти карты. MoE Qwen3.5-35B-A3B на той же карте выбирает 41%. Маршрутизация экспертов тут почти ни при чём, я её измерил: ядра top-k занимают 7% времени. CUDA-графы захватываются, дыр между запусками нет, занятость SM 97%. Карта работает почти всё время, просто делает работу медленнее, чем позволяет память. Причина оказалась в том, сколько байт читает одно ядро за запуск. Я написал программу на ggml, которая гоняет тот же mul_mat_vec_q на холодных весах, и снял кривую: на 1 МБ ядро берёт 23% полосы, на 4.2 МБ уже 53%, на 33.6 МБ 91%. У MoE на одно ядро приходится 4.6 МБ, у плотной модели 22.2 МБ. Вот и весь разрыв. В статье: разбивка всех 437 матвеков по трассе nsys, четыре способа померить это неправильно и посидеть в каждой ловушке по очереди, проверка модели на другой архитектуре с ошибкой 3.7% и на четырёх глубинах контекста, цена сэмплера и всей обвязки llama-server. Последнее оказалось крупнее всего остального: пользователь видит 225 токенов в секунду там, где бенчмарк показывает 317.

    habr.com/ru/articles/1069574/

    #llamacpp #moe #rtx_5090 #пропускная_способность_памяти #cuda #gpu #инференс_ллм #бенчмарк #профилирование #qwen_35

  30. MoE на 5090 недобирает полтора раза, и дело не в маршрутизации

    RTX 5090, одна и та же сборка llama.cpp, один драйвер, батч 1. Плотная Qwen3.5-9B выбирает 72% пропускной способности памяти карты. MoE Qwen3.5-35B-A3B на той же карте выбирает 41%. Маршрутизация экспертов тут почти ни при чём, я её измерил: ядра top-k занимают 7% времени. CUDA-графы захватываются, дыр между запусками нет, занятость SM 97%. Карта работает почти всё время, просто делает работу медленнее, чем позволяет память. Причина оказалась в том, сколько байт читает одно ядро за запуск. Я написал программу на ggml, которая гоняет тот же mul_mat_vec_q на холодных весах, и снял кривую: на 1 МБ ядро берёт 23% полосы, на 4.2 МБ уже 53%, на 33.6 МБ 91%. У MoE на одно ядро приходится 4.6 МБ, у плотной модели 22.2 МБ. Вот и весь разрыв. В статье: разбивка всех 437 матвеков по трассе nsys, четыре способа померить это неправильно и посидеть в каждой ловушке по очереди, проверка модели на другой архитектуре с ошибкой 3.7% и на четырёх глубинах контекста, цена сэмплера и всей обвязки llama-server. Последнее оказалось крупнее всего остального: пользователь видит 225 токенов в секунду там, где бенчмарк показывает 317.

    habr.com/ru/articles/1069574/

    #llamacpp #moe #rtx_5090 #пропускная_способность_памяти #cuda #gpu #инференс_ллм #бенчмарк #профилирование #qwen_35

  31. MoE на 5090 недобирает полтора раза, и дело не в маршрутизации

    RTX 5090, одна и та же сборка llama.cpp, один драйвер, батч 1. Плотная Qwen3.5-9B выбирает 72% пропускной способности памяти карты. MoE Qwen3.5-35B-A3B на той же карте выбирает 41%. Маршрутизация экспертов тут почти ни при чём, я её измерил: ядра top-k занимают 7% времени. CUDA-графы захватываются, дыр между запусками нет, занятость SM 97%. Карта работает почти всё время, просто делает работу медленнее, чем позволяет память. Причина оказалась в том, сколько байт читает одно ядро за запуск. Я написал программу на ggml, которая гоняет тот же mul_mat_vec_q на холодных весах, и снял кривую: на 1 МБ ядро берёт 23% полосы, на 4.2 МБ уже 53%, на 33.6 МБ 91%. У MoE на одно ядро приходится 4.6 МБ, у плотной модели 22.2 МБ. Вот и весь разрыв. В статье: разбивка всех 437 матвеков по трассе nsys, четыре способа померить это неправильно и посидеть в каждой ловушке по очереди, проверка модели на другой архитектуре с ошибкой 3.7% и на четырёх глубинах контекста, цена сэмплера и всей обвязки llama-server. Последнее оказалось крупнее всего остального: пользователь видит 225 токенов в секунду там, где бенчмарк показывает 317.

    habr.com/ru/articles/1069574/

    #llamacpp #moe #rtx_5090 #пропускная_способность_памяти #cuda #gpu #инференс_ллм #бенчмарк #профилирование #qwen_35

  32. 🐪🚀 Llama.cpp: Because nothing says "cutting-edge AI" like running everything on a dusty old laptop from 2010. 🤖💾 Forget the cloud, the future is apparently local... as in, locally outdated. 🖥️🔧
    llama.app #LlamaCpp #AI #LocalComputing #OutdatedTech #Innovation #HackerNews #ngated

  33. 🐪🚀 Llama.cpp: Because nothing says "cutting-edge AI" like running everything on a dusty old laptop from 2010. 🤖💾 Forget the cloud, the future is apparently local... as in, locally outdated. 🖥️🔧
    llama.app #LlamaCpp #AI #LocalComputing #OutdatedTech #Innovation #HackerNews #ngated

  34. 🐪🚀 Llama.cpp: Because nothing says "cutting-edge AI" like running everything on a dusty old laptop from 2010. 🤖💾 Forget the cloud, the future is apparently local... as in, locally outdated. 🖥️🔧
    llama.app #LlamaCpp #AI #LocalComputing #OutdatedTech #Innovation #HackerNews #ngated

  35. 🐪🚀 Llama.cpp: Because nothing says "cutting-edge AI" like running everything on a dusty old laptop from 2010. 🤖💾 Forget the cloud, the future is apparently local... as in, locally outdated. 🖥️🔧
    llama.app #LlamaCpp #AI #LocalComputing #OutdatedTech #Innovation #HackerNews #ngated

  36. 🐪🚀 Llama.cpp: Because nothing says "cutting-edge AI" like running everything on a dusty old laptop from 2010. 🤖💾 Forget the cloud, the future is apparently local... as in, locally outdated. 🖥️🔧
    llama.app #LlamaCpp #AI #LocalComputing #OutdatedTech #Innovation #HackerNews #ngated

  37. Всё, что вы хотели знать о локальном ИИ, но стеснялись спросить

    Если вы когда-нибудь смотрели на HF и не понимали, что такое DFlash, квантизация и почему одна и та же модель лежит в десяти репозиториях от десяти разных людей — или давно собирались поднять LLM у себя, но всё не находили повода — выход Muse Glimmer 30B буквально лучший момент начать. Буквально со своего MacBook Air. Ага, да вот уже сейчас прямо. Погрузиться в мир локальных моделей

    habr.com/ru/articles/1069422/

    #llm #локальные_модели #квантизация #llamacpp #apple_silicon #gguf #инференс #moe #meta

  38. Всё, что вы хотели знать о локальном ИИ, но стеснялись спросить

    Если вы когда-нибудь смотрели на HF и не понимали, что такое DFlash, квантизация и почему одна и та же модель лежит в десяти репозиториях от десяти разных людей — или давно собирались поднять LLM у себя, но всё не находили повода — выход Muse Glimmer 30B буквально лучший момент начать. Буквально со своего MacBook Air. Ага, да вот уже сейчас прямо. Погрузиться в мир локальных моделей

    habr.com/ru/articles/1069422/

    #llm #локальные_модели #квантизация #llamacpp #apple_silicon #gguf #инференс #moe #meta

  39. Всё, что вы хотели знать о локальном ИИ, но стеснялись спросить

    Если вы когда-нибудь смотрели на HF и не понимали, что такое DFlash, квантизация и почему одна и та же модель лежит в десяти репозиториях от десяти разных людей — или давно собирались поднять LLM у себя, но всё не находили повода — выход Muse Glimmer 30B буквально лучший момент начать. Буквально со своего MacBook Air. Ага, да вот уже сейчас прямо. Погрузиться в мир локальных моделей

    habr.com/ru/articles/1069422/

    #llm #локальные_модели #квантизация #llamacpp #apple_silicon #gguf #инференс #moe #meta

  40. 'Muse Glimmer 30B' in UD-Q4_K_XL:

    PP: ca. 500 Tokens/s
    TG: ca. 55 Tokens/s

    MB: Asus X870 AM5
    CPU: AMD Ryzen 9900x (64 GB DDR5-RAM)
    GPU: AMD Radeon AI R9700 (32 GB VRAM)
    OS: Arch-Linux

    huggingface.co/unsloth/Muse-Gl

    #localai #llamacpp

  41. 'Muse Glimmer 30B' in UD-Q4_K_XL:

    PP: ca. 500 Tokens/s
    TG: ca. 55 Tokens/s

    MB: Asus X870 AM5
    CPU: AMD Ryzen 9900x (64 GB DDR5-RAM)
    GPU: AMD Radeon AI R9700 (32 GB VRAM)
    OS: Arch-Linux

    huggingface.co/unsloth/Muse-Gl

    #localai #llamacpp

  42. Testing #localLLM again. #QuoteOfTheDay

    Q: if humankind has those non-man-given incentives as drivers for "innovation if required", rather than "innovation to sell a product noone wants": what's your opinion?

    A: We would have:

    * A stable climate.
    * Abundant, clean food.
    * Healthy, long-lasting infrastructure.
    * A society that feels secure rather than anxious.

    For long-term human wellbeing and planetary health, this is not just better—it is essential [...]"

    #Qwen3 #llamacpp #FOSS

  43. Testing #localLLM again. #QuoteOfTheDay

    Q: if humankind has those non-man-given incentives as drivers for "innovation if required", rather than "innovation to sell a product noone wants": what's your opinion?

    A: We would have:

    * A stable climate.
    * Abundant, clean food.
    * Healthy, long-lasting infrastructure.
    * A society that feels secure rather than anxious.

    For long-term human wellbeing and planetary health, this is not just better—it is essential [...]"

    #Qwen3 #llamacpp #FOSS