#llamacpp — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #llamacpp, aggregated by home.social.
-
KV cache streaming - the llama.cpp fork that enables Qwen 3.8 27B at large contexts for 16GB VRAM GPU owners
-
KV cache streaming - the llama.cpp fork that enables Qwen 3.8 27B at large contexts for 16GB VRAM GPU owners
-
KV cache streaming - the llama.cpp fork that enables Qwen 3.8 27B at large contexts for 16GB VRAM GPU owners
-
KV cache streaming - the llama.cpp fork that enables Qwen 3.8 27B at large contexts for 16GB VRAM GPU owners
-
KV cache streaming - the llama.cpp fork that enables Qwen 3.8 27B at large contexts for 16GB VRAM GPU owners
-
Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток/сек на двух RTX 3090
Плотная 27-миллиардная модель на двух RTX 3090 в llama.cpp из коробки даёт 32 токена в секунду. Интуитивно понятно, что это не предел: две карты по 24 ГБ и 936 ГБ/с каждая не должны выдавать столько, сколько выдаёт одна. Значит, где-то узкое горлышко — и надо разобраться, что и где подкрутить. Горлышек оказалось несколько, и все снимаются флагами запуска: те же веса — 75 токенов в секунду. Под катом каждый флаг описан по одной схеме: зачем, что писать, что даёт в цифрах, где ломается и с какой строкой в логе. В конце — готовый docker run , три проверки после каждой смены флага и список того, что не сработало. Текст можно отдать целиком агенту с доступом к серверу — это инструкция, а не история.
https://habr.com/ru/articles/1076080/
#llm #ai #llamacpp #qwen #qwen38 #gguf #квантование #локальные_нейросети #локальные_модели
-
Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток/сек на двух RTX 3090
Плотная 27-миллиардная модель на двух RTX 3090 в llama.cpp из коробки даёт 32 токена в секунду. Интуитивно понятно, что это не предел: две карты по 24 ГБ и 936 ГБ/с каждая не должны выдавать столько, сколько выдаёт одна. Значит, где-то узкое горлышко — и надо разобраться, что и где подкрутить. Горлышек оказалось несколько, и все снимаются флагами запуска: те же веса — 75 токенов в секунду. Под катом каждый флаг описан по одной схеме: зачем, что писать, что даёт в цифрах, где ломается и с какой строкой в логе. В конце — готовый docker run , три проверки после каждой смены флага и список того, что не сработало. Текст можно отдать целиком агенту с доступом к серверу — это инструкция, а не история.
https://habr.com/ru/articles/1076080/
#llm #ai #llamacpp #qwen #qwen38 #gguf #квантование #локальные_нейросети #локальные_модели
-
Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток/сек на двух RTX 3090
Плотная 27-миллиардная модель на двух RTX 3090 в llama.cpp из коробки даёт 32 токена в секунду. Интуитивно понятно, что это не предел: две карты по 24 ГБ и 936 ГБ/с каждая не должны выдавать столько, сколько выдаёт одна. Значит, где-то узкое горлышко — и надо разобраться, что и где подкрутить. Горлышек оказалось несколько, и все снимаются флагами запуска: те же веса — 75 токенов в секунду. Под катом каждый флаг описан по одной схеме: зачем, что писать, что даёт в цифрах, где ломается и с какой строкой в логе. В конце — готовый docker run , три проверки после каждой смены флага и список того, что не сработало. Текст можно отдать целиком агенту с доступом к серверу — это инструкция, а не история.
https://habr.com/ru/articles/1076080/
#llm #ai #llamacpp #qwen #qwen38 #gguf #квантование #локальные_нейросети #локальные_модели
-
753B на одной видеокарте: разбор FreeToken
Бывает так: сидишь, листаешь ленту, и в очередной раз натыкаешься на пост, где стафф-инженер из солнечной Калифорнии крутит свежую модельку на паре RTX PRO 6000 общей стоимостью с подержанную машину. Ты смотришь на свою RTX 4060 в ноутбуке, который покупал «не только для игр», и понимаешь: ну ладно, это не для нас. Так вот, это как раз для нас. На той самой ноутбучной 4060 с восемью гигабайтами и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде. Вопрос был не в железе, а в софте, который это железо обслуживает. Разбираем FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang. Запустить AGI на слабом железе
https://habr.com/ru/articles/1073522/
#moe #локальные_модели #инференс #llamacpp #llm #оффлоадинг #агенты #cuda #gpu #freetoken
-
753B на одной видеокарте: разбор FreeToken
Бывает так: сидишь, листаешь ленту, и в очередной раз натыкаешься на пост, где стафф-инженер из солнечной Калифорнии крутит свежую модельку на паре RTX PRO 6000 общей стоимостью с подержанную машину. Ты смотришь на свою RTX 4060 в ноутбуке, который покупал «не только для игр», и понимаешь: ну ладно, это не для нас. Так вот, это как раз для нас. На той самой ноутбучной 4060 с восемью гигабайтами и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде. Вопрос был не в железе, а в софте, который это железо обслуживает. Разбираем FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang. Запустить AGI на слабом железе
https://habr.com/ru/articles/1073522/
#moe #локальные_модели #инференс #llamacpp #llm #оффлоадинг #агенты #cuda #gpu #freetoken
-
753B на одной видеокарте: разбор FreeToken
Бывает так: сидишь, листаешь ленту, и в очередной раз натыкаешься на пост, где стафф-инженер из солнечной Калифорнии крутит свежую модельку на паре RTX PRO 6000 общей стоимостью с подержанную машину. Ты смотришь на свою RTX 4060 в ноутбуке, который покупал «не только для игр», и понимаешь: ну ладно, это не для нас. Так вот, это как раз для нас. На той самой ноутбучной 4060 с восемью гигабайтами и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде. Вопрос был не в железе, а в софте, который это железо обслуживает. Разбираем FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang. Запустить AGI на слабом железе
https://habr.com/ru/articles/1073522/
#moe #локальные_модели #инференс #llamacpp #llm #оффлоадинг #агенты #cuda #gpu #freetoken
-
Statement zu KI und mein teilrückzug aus dem Fediverse
https://friendica.tf-translate.net/display/cafe12d9-116a-8634-5024-1d3980317993
-
Statement zu KI und mein teilrückzug aus dem Fediverse
https://friendica.tf-translate.net/display/cafe12d9-116a-8634-5024-1d3980317993
-
Statement zu KI und mein teilrückzug aus dem Fediverse
https://friendica.tf-translate.net/display/cafe12d9-116a-8634-5024-1d3980317993
-
Statement zu KI und mein teilrückzug aus dem Fediverse
https://friendica.tf-translate.net/display/cafe12d9-116a-8634-5024-1d3980317993
-
Statement zu KI und mein teilrückzug aus dem Fediverse
https://friendica.tf-translate.net/display/cafe12d9-116a-8634-5024-1d3980317993
-
Чем Go полезен при разработке AI-агентов
Всем привет! Меня зовут Илья Данилкин , я тимлид в Авито Авто . AI-агенты обычно живут рядом с Python, но всё же немало команд выбирают язык Go. Дело в том, что агенты большую часть времени не заняты сложными математическими расчётами, а ждут ответа модели или результата инструмента. А ещё работают в режиме бесконечных параллельных запусков. И если пользователь останавливает задачу, его запрос и следующие вызовы инструментов тоже нужно остановить. Поэтому при выборе языка важны не только библиотеки для работы с моделями, но и то, как язык справляется с одновременными задачами, отменяет операции и насколько просто доставить готовое приложение пользователю. В Go для этого есть дешёвые горутины, context.Context и сборка в один бинарник. В статье на примерах и материалах из Go-сообщества разберу пять сценариев, когда эти и другие свойства Go очень и очень нужны.
https://habr.com/ru/companies/avito/articles/1069734/
#go #Golang #AIагенты #MCP #contextContext #горутины #llamacpp #локальные_LLM
-
Чем Go полезен при разработке AI-агентов
Всем привет! Меня зовут Илья Данилкин , я тимлид в Авито Авто . AI-агенты обычно живут рядом с Python, но всё же немало команд выбирают язык Go. Дело в том, что агенты большую часть времени не заняты сложными математическими расчётами, а ждут ответа модели или результата инструмента. А ещё работают в режиме бесконечных параллельных запусков. И если пользователь останавливает задачу, его запрос и следующие вызовы инструментов тоже нужно остановить. Поэтому при выборе языка важны не только библиотеки для работы с моделями, но и то, как язык справляется с одновременными задачами, отменяет операции и насколько просто доставить готовое приложение пользователю. В Go для этого есть дешёвые горутины, context.Context и сборка в один бинарник. В статье на примерах и материалах из Go-сообщества разберу пять сценариев, когда эти и другие свойства Go очень и очень нужны.
https://habr.com/ru/companies/avito/articles/1069734/
#go #Golang #AIагенты #MCP #contextContext #горутины #llamacpp #локальные_LLM
-
Чем Go полезен при разработке AI-агентов
Всем привет! Меня зовут Илья Данилкин , я тимлид в Авито Авто . AI-агенты обычно живут рядом с Python, но всё же немало команд выбирают язык Go. Дело в том, что агенты большую часть времени не заняты сложными математическими расчётами, а ждут ответа модели или результата инструмента. А ещё работают в режиме бесконечных параллельных запусков. И если пользователь останавливает задачу, его запрос и следующие вызовы инструментов тоже нужно остановить. Поэтому при выборе языка важны не только библиотеки для работы с моделями, но и то, как язык справляется с одновременными задачами, отменяет операции и насколько просто доставить готовое приложение пользователю. В Go для этого есть дешёвые горутины, context.Context и сборка в один бинарник. В статье на примерах и материалах из Go-сообщества разберу пять сценариев, когда эти и другие свойства Go очень и очень нужны.
https://habr.com/ru/companies/avito/articles/1069734/
#go #Golang #AIагенты #MCP #contextContext #горутины #llamacpp #локальные_LLM
-
А все-таки Qwen3.8-27B — думает меньше и быстрее чем 3.6
В пятницу вышла Qwen3.8-27B. Скажу честно, с середины мая я отказался от подписок и сидел исключительно на локальной Qwen3.6 (для всех своих домашних проектов), у меня даже статья была на эту тему . Поэтому мне было очень интересно увидеть на что способна новая Qwen3.8-27B. Тут на Хабре было несколько статей о том, что 3.8 слишком долго думает и что у 3.8 слишком много галлюцинаций (что как мне кажется не совсем корректно), поэтому я решил поделиться настройками, которые работают (у меня), надеюсь они будут кому-нибудь полезны. Qwen3.8-27B превзошла мои самые смелые ожидания, и уж что-что, а задумчивой ее никак не назовешь.
-
А все-таки Qwen3.8-27B — думает меньше и быстрее чем 3.6
В пятницу вышла Qwen3.8-27B. Скажу честно, с середины мая я отказался от подписок и сидел исключительно на локальной Qwen3.6 (для всех своих домашних проектов), у меня даже статья была на эту тему . Поэтому мне было очень интересно увидеть на что способна новая Qwen3.8-27B. Тут на Хабре было несколько статей о том, что 3.8 слишком долго думает и что у 3.8 слишком много галлюцинаций (что как мне кажется не совсем корректно), поэтому я решил поделиться настройками, которые работают (у меня), надеюсь они будут кому-нибудь полезны. Qwen3.8-27B превзошла мои самые смелые ожидания, и уж что-что, а задумчивой ее никак не назовешь.
-
А все-таки Qwen3.8-27B — думает меньше и быстрее чем 3.6
В пятницу вышла Qwen3.8-27B. Скажу честно, с середины мая я отказался от подписок и сидел исключительно на локальной Qwen3.6 (для всех своих домашних проектов), у меня даже статья была на эту тему . Поэтому мне было очень интересно увидеть на что способна новая Qwen3.8-27B. Тут на Хабре было несколько статей о том, что 3.8 слишком долго думает и что у 3.8 слишком много галлюцинаций (что как мне кажется не совсем корректно), поэтому я решил поделиться настройками, которые работают (у меня), надеюсь они будут кому-нибудь полезны. Qwen3.8-27B превзошла мои самые смелые ожидания, и уж что-что, а задумчивой ее никак не назовешь.
-
3 бита вместо 16: разбираем TurboQuant и когда его реально стоит включать
В марте 2026 года Google публикует пост про алгоритм сжатия памяти для языковых моделей. Звучит скучно, правда? Но акции Micron, SanDisk, Samsung, SK Hynix и других производителей памяти за неделю теряют суммарно почти $90 млрд капитализации. Инвесторы паникуют: если модели начнут тратить в разы меньше памяти, то зачем столько железа? Алгоритм, который навел весь этот шум, называется TurboQuant — герой этой статьи. Я не буду говорить, что это «революция» или «переворот в индустрии» — это было бы явное преувеличение. Но штука действительно интересная, и уже есть рабочие реализации. Если вы деплоите LLM в продакшн или просто прогоняете модели локально, то вам 100% будет полезно об этом узнать. Разберем, что из заявленного правда, а что преувеличение, и главное — как это попробовать прямо сейчас.
-
3 бита вместо 16: разбираем TurboQuant и когда его реально стоит включать
В марте 2026 года Google публикует пост про алгоритм сжатия памяти для языковых моделей. Звучит скучно, правда? Но акции Micron, SanDisk, Samsung, SK Hynix и других производителей памяти за неделю теряют суммарно почти $90 млрд капитализации. Инвесторы паникуют: если модели начнут тратить в разы меньше памяти, то зачем столько железа? Алгоритм, который навел весь этот шум, называется TurboQuant — герой этой статьи. Я не буду говорить, что это «революция» или «переворот в индустрии» — это было бы явное преувеличение. Но штука действительно интересная, и уже есть рабочие реализации. Если вы деплоите LLM в продакшн или просто прогоняете модели локально, то вам 100% будет полезно об этом узнать. Разберем, что из заявленного правда, а что преувеличение, и главное — как это попробовать прямо сейчас.
-
3 бита вместо 16: разбираем TurboQuant и когда его реально стоит включать
В марте 2026 года Google публикует пост про алгоритм сжатия памяти для языковых моделей. Звучит скучно, правда? Но акции Micron, SanDisk, Samsung, SK Hynix и других производителей памяти за неделю теряют суммарно почти $90 млрд капитализации. Инвесторы паникуют: если модели начнут тратить в разы меньше памяти, то зачем столько железа? Алгоритм, который навел весь этот шум, называется TurboQuant — герой этой статьи. Я не буду говорить, что это «революция» или «переворот в индустрии» — это было бы явное преувеличение. Но штука действительно интересная, и уже есть рабочие реализации. Если вы деплоите LLM в продакшн или просто прогоняете модели локально, то вам 100% будет полезно об этом узнать. Разберем, что из заявленного правда, а что преувеличение, и главное — как это попробовать прямо сейчас.
-
Qwen3.8-27B (-Q6_K) von Unsloth ist draussen.
Reasoning auf medium setzen kann helfen. xHigh ist default, das kostet.
Der Plan den Kilo-Code via qwen3.8-27B erstellt hat ist wirklich klasse
-
Qwen3.8-27B (-Q6_K) von Unsloth ist draussen.
Reasoning auf medium setzen kann helfen. xHigh ist default, das kostet.
Der Plan den Kilo-Code via qwen3.8-27B erstellt hat ist wirklich klasse
-
Humbled that our number of Chrome-only active users surpassed 1,000 for the first time.
https://github.com/webbrain-one/webbrain
#Chrome #ChromeExtension #WebExtension #Milestone #OpenSource #GitHub #WebBrain #offlinellm #qwen #gemma #ollama #llamacpp
-
Humbled that our number of Chrome-only active users surpassed 1,000 for the first time.
https://github.com/webbrain-one/webbrain
#Chrome #ChromeExtension #WebExtension #Milestone #OpenSource #GitHub #WebBrain #offlinellm #qwen #gemma #ollama #llamacpp
-
MoE на 5090 недобирает полтора раза, и дело не в маршрутизации
RTX 5090, одна и та же сборка llama.cpp, один драйвер, батч 1. Плотная Qwen3.5-9B выбирает 72% пропускной способности памяти карты. MoE Qwen3.5-35B-A3B на той же карте выбирает 41%. Маршрутизация экспертов тут почти ни при чём, я её измерил: ядра top-k занимают 7% времени. CUDA-графы захватываются, дыр между запусками нет, занятость SM 97%. Карта работает почти всё время, просто делает работу медленнее, чем позволяет память. Причина оказалась в том, сколько байт читает одно ядро за запуск. Я написал программу на ggml, которая гоняет тот же mul_mat_vec_q на холодных весах, и снял кривую: на 1 МБ ядро берёт 23% полосы, на 4.2 МБ уже 53%, на 33.6 МБ 91%. У MoE на одно ядро приходится 4.6 МБ, у плотной модели 22.2 МБ. Вот и весь разрыв. В статье: разбивка всех 437 матвеков по трассе nsys, четыре способа померить это неправильно и посидеть в каждой ловушке по очереди, проверка модели на другой архитектуре с ошибкой 3.7% и на четырёх глубинах контекста, цена сэмплера и всей обвязки llama-server. Последнее оказалось крупнее всего остального: пользователь видит 225 токенов в секунду там, где бенчмарк показывает 317.
https://habr.com/ru/articles/1069574/
#llamacpp #moe #rtx_5090 #пропускная_способность_памяти #cuda #gpu #инференс_ллм #бенчмарк #профилирование #qwen_35
-
MoE на 5090 недобирает полтора раза, и дело не в маршрутизации
RTX 5090, одна и та же сборка llama.cpp, один драйвер, батч 1. Плотная Qwen3.5-9B выбирает 72% пропускной способности памяти карты. MoE Qwen3.5-35B-A3B на той же карте выбирает 41%. Маршрутизация экспертов тут почти ни при чём, я её измерил: ядра top-k занимают 7% времени. CUDA-графы захватываются, дыр между запусками нет, занятость SM 97%. Карта работает почти всё время, просто делает работу медленнее, чем позволяет память. Причина оказалась в том, сколько байт читает одно ядро за запуск. Я написал программу на ggml, которая гоняет тот же mul_mat_vec_q на холодных весах, и снял кривую: на 1 МБ ядро берёт 23% полосы, на 4.2 МБ уже 53%, на 33.6 МБ 91%. У MoE на одно ядро приходится 4.6 МБ, у плотной модели 22.2 МБ. Вот и весь разрыв. В статье: разбивка всех 437 матвеков по трассе nsys, четыре способа померить это неправильно и посидеть в каждой ловушке по очереди, проверка модели на другой архитектуре с ошибкой 3.7% и на четырёх глубинах контекста, цена сэмплера и всей обвязки llama-server. Последнее оказалось крупнее всего остального: пользователь видит 225 токенов в секунду там, где бенчмарк показывает 317.
https://habr.com/ru/articles/1069574/
#llamacpp #moe #rtx_5090 #пропускная_способность_памяти #cuda #gpu #инференс_ллм #бенчмарк #профилирование #qwen_35
-
MoE на 5090 недобирает полтора раза, и дело не в маршрутизации
RTX 5090, одна и та же сборка llama.cpp, один драйвер, батч 1. Плотная Qwen3.5-9B выбирает 72% пропускной способности памяти карты. MoE Qwen3.5-35B-A3B на той же карте выбирает 41%. Маршрутизация экспертов тут почти ни при чём, я её измерил: ядра top-k занимают 7% времени. CUDA-графы захватываются, дыр между запусками нет, занятость SM 97%. Карта работает почти всё время, просто делает работу медленнее, чем позволяет память. Причина оказалась в том, сколько байт читает одно ядро за запуск. Я написал программу на ggml, которая гоняет тот же mul_mat_vec_q на холодных весах, и снял кривую: на 1 МБ ядро берёт 23% полосы, на 4.2 МБ уже 53%, на 33.6 МБ 91%. У MoE на одно ядро приходится 4.6 МБ, у плотной модели 22.2 МБ. Вот и весь разрыв. В статье: разбивка всех 437 матвеков по трассе nsys, четыре способа померить это неправильно и посидеть в каждой ловушке по очереди, проверка модели на другой архитектуре с ошибкой 3.7% и на четырёх глубинах контекста, цена сэмплера и всей обвязки llama-server. Последнее оказалось крупнее всего остального: пользователь видит 225 токенов в секунду там, где бенчмарк показывает 317.
https://habr.com/ru/articles/1069574/
#llamacpp #moe #rtx_5090 #пропускная_способность_памяти #cuda #gpu #инференс_ллм #бенчмарк #профилирование #qwen_35
-
🐪🚀 Llama.cpp: Because nothing says "cutting-edge AI" like running everything on a dusty old laptop from 2010. 🤖💾 Forget the cloud, the future is apparently local... as in, locally outdated. 🖥️🔧
https://llama.app #LlamaCpp #AI #LocalComputing #OutdatedTech #Innovation #HackerNews #ngated -
🐪🚀 Llama.cpp: Because nothing says "cutting-edge AI" like running everything on a dusty old laptop from 2010. 🤖💾 Forget the cloud, the future is apparently local... as in, locally outdated. 🖥️🔧
https://llama.app #LlamaCpp #AI #LocalComputing #OutdatedTech #Innovation #HackerNews #ngated -
🐪🚀 Llama.cpp: Because nothing says "cutting-edge AI" like running everything on a dusty old laptop from 2010. 🤖💾 Forget the cloud, the future is apparently local... as in, locally outdated. 🖥️🔧
https://llama.app #LlamaCpp #AI #LocalComputing #OutdatedTech #Innovation #HackerNews #ngated -
🐪🚀 Llama.cpp: Because nothing says "cutting-edge AI" like running everything on a dusty old laptop from 2010. 🤖💾 Forget the cloud, the future is apparently local... as in, locally outdated. 🖥️🔧
https://llama.app #LlamaCpp #AI #LocalComputing #OutdatedTech #Innovation #HackerNews #ngated -
🐪🚀 Llama.cpp: Because nothing says "cutting-edge AI" like running everything on a dusty old laptop from 2010. 🤖💾 Forget the cloud, the future is apparently local... as in, locally outdated. 🖥️🔧
https://llama.app #LlamaCpp #AI #LocalComputing #OutdatedTech #Innovation #HackerNews #ngated -
Всё, что вы хотели знать о локальном ИИ, но стеснялись спросить
Если вы когда-нибудь смотрели на HF и не понимали, что такое DFlash, квантизация и почему одна и та же модель лежит в десяти репозиториях от десяти разных людей — или давно собирались поднять LLM у себя, но всё не находили повода — выход Muse Glimmer 30B буквально лучший момент начать. Буквально со своего MacBook Air. Ага, да вот уже сейчас прямо. Погрузиться в мир локальных моделей
https://habr.com/ru/articles/1069422/
#llm #локальные_модели #квантизация #llamacpp #apple_silicon #gguf #инференс #moe #meta
-
Всё, что вы хотели знать о локальном ИИ, но стеснялись спросить
Если вы когда-нибудь смотрели на HF и не понимали, что такое DFlash, квантизация и почему одна и та же модель лежит в десяти репозиториях от десяти разных людей — или давно собирались поднять LLM у себя, но всё не находили повода — выход Muse Glimmer 30B буквально лучший момент начать. Буквально со своего MacBook Air. Ага, да вот уже сейчас прямо. Погрузиться в мир локальных моделей
https://habr.com/ru/articles/1069422/
#llm #локальные_модели #квантизация #llamacpp #apple_silicon #gguf #инференс #moe #meta
-
Всё, что вы хотели знать о локальном ИИ, но стеснялись спросить
Если вы когда-нибудь смотрели на HF и не понимали, что такое DFlash, квантизация и почему одна и та же модель лежит в десяти репозиториях от десяти разных людей — или давно собирались поднять LLM у себя, но всё не находили повода — выход Muse Glimmer 30B буквально лучший момент начать. Буквально со своего MacBook Air. Ага, да вот уже сейчас прямо. Погрузиться в мир локальных моделей
https://habr.com/ru/articles/1069422/
#llm #локальные_модели #квантизация #llamacpp #apple_silicon #gguf #инференс #moe #meta
-
Apple Silicon and macOS VMs: 11–16× Faster LLM Inference with Llama.cpp
https://github.com/trycua/cua/blob/main/blog/gpu-passthrough-macos-vms.md
Comments: https://news.ycombinator.com/item?id=49259339
#HackerNews #AppleSilicon #macOS #LLMInference #LlamaCpp #VirtualMachines #PerformanceBoost
-
Apple Silicon and macOS VMs: 11–16× Faster LLM Inference with Llama.cpp
https://github.com/trycua/cua/blob/main/blog/gpu-passthrough-macos-vms.md
Comments: https://news.ycombinator.com/item?id=49259339
#HackerNews #AppleSilicon #macOS #LLMInference #LlamaCpp #VirtualMachines #PerformanceBoost
-
Apple Silicon and macOS VMs: 11–16× Faster LLM Inference with Llama.cpp
https://github.com/trycua/cua/blob/main/blog/gpu-passthrough-macos-vms.md
Comments: https://news.ycombinator.com/item?id=49259339
#HackerNews #AppleSilicon #macOS #LLMInference #LlamaCpp #VirtualMachines #PerformanceBoost
-
Apple Silicon and macOS VMs: 11–16× Faster LLM Inference with Llama.cpp
https://github.com/trycua/cua/blob/main/blog/gpu-passthrough-macos-vms.md
Comments: https://news.ycombinator.com/item?id=49259339
#HackerNews #AppleSilicon #macOS #LLMInference #LlamaCpp #VirtualMachines #PerformanceBoost
-
Apple Silicon and macOS VMs: 11–16× Faster LLM Inference with Llama.cpp
https://github.com/trycua/cua/blob/main/blog/gpu-passthrough-macos-vms.md
Comments: https://news.ycombinator.com/item?id=49259339
#HackerNews #AppleSilicon #macOS #LLMInference #LlamaCpp #VirtualMachines #PerformanceBoost
-
'Muse Glimmer 30B' in UD-Q4_K_XL:
PP: ca. 500 Tokens/s
TG: ca. 55 Tokens/sMB: Asus X870 AM5
CPU: AMD Ryzen 9900x (64 GB DDR5-RAM)
GPU: AMD Radeon AI R9700 (32 GB VRAM)
OS: Arch-Linux -
'Muse Glimmer 30B' in UD-Q4_K_XL:
PP: ca. 500 Tokens/s
TG: ca. 55 Tokens/sMB: Asus X870 AM5
CPU: AMD Ryzen 9900x (64 GB DDR5-RAM)
GPU: AMD Radeon AI R9700 (32 GB VRAM)
OS: Arch-Linux -
Testing #localLLM again. #QuoteOfTheDay
Q: if humankind has those non-man-given incentives as drivers for "innovation if required", rather than "innovation to sell a product noone wants": what's your opinion?
A: We would have:
* A stable climate.
* Abundant, clean food.
* Healthy, long-lasting infrastructure.
* A society that feels secure rather than anxious.For long-term human wellbeing and planetary health, this is not just better—it is essential [...]"
-
Testing #localLLM again. #QuoteOfTheDay
Q: if humankind has those non-man-given incentives as drivers for "innovation if required", rather than "innovation to sell a product noone wants": what's your opinion?
A: We would have:
* A stable climate.
* Abundant, clean food.
* Healthy, long-lasting infrastructure.
* A society that feels secure rather than anxious.For long-term human wellbeing and planetary health, this is not just better—it is essential [...]"