#freetoken — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #freetoken, aggregated by home.social.
-
👀 FreeToken, il nuovo motore open source di UC Berkeley per far girare modelli MoE in locale su GPU consumer. FreeToken tratta il computer come un unico insieme elastico di risorse 👇
https://gomoot.com/freetoken-il-motore-di-uc-berkeley-per-far-girare-modelli-moe-in-locale-su-gpu-consumer/ -
👀 FreeToken, il nuovo motore open source di UC Berkeley per far girare modelli MoE in locale su GPU consumer. FreeToken tratta il computer come un unico insieme elastico di risorse 👇
https://gomoot.com/freetoken-il-motore-di-uc-berkeley-per-far-girare-modelli-moe-in-locale-su-gpu-consumer/ -
👀 FreeToken, il nuovo motore open source di UC Berkeley per far girare modelli MoE in locale su GPU consumer. FreeToken tratta il computer come un unico insieme elastico di risorse 👇
https://gomoot.com/freetoken-il-motore-di-uc-berkeley-per-far-girare-modelli-moe-in-locale-su-gpu-consumer/ -
👀 FreeToken, il nuovo motore open source di UC Berkeley per far girare modelli MoE in locale su GPU consumer. FreeToken tratta il computer come un unico insieme elastico di risorse 👇
https://gomoot.com/freetoken-il-motore-di-uc-berkeley-per-far-girare-modelli-moe-in-locale-su-gpu-consumer/ -
👀 FreeToken, il nuovo motore open source di UC Berkeley per far girare modelli MoE in locale su GPU consumer. FreeToken tratta il computer come un unico insieme elastico di risorse 👇
https://gomoot.com/freetoken-il-motore-di-uc-berkeley-per-far-girare-modelli-moe-in-locale-su-gpu-consumer/ -
📋 #FreeToken is an edge-native #MoE serving engine for running frontier-scale open-weight models on personal, consumer hardware #opensource #LLM #AI 🧵👇
-
📋 #FreeToken is an edge-native #MoE serving engine for running frontier-scale open-weight models on personal, consumer hardware #opensource #LLM #AI 🧵👇
-
📋 #FreeToken is an edge-native #MoE serving engine for running frontier-scale open-weight models on personal, consumer hardware #opensource #LLM #AI 🧵👇
-
📋 #FreeToken is an edge-native #MoE serving engine for running frontier-scale open-weight models on personal, consumer hardware #opensource #LLM #AI 🧵👇
-
📋 #FreeToken is an edge-native #MoE serving engine for running frontier-scale open-weight models on personal, consumer hardware #opensource #LLM #AI 🧵👇
-
753B на одной видеокарте: разбор FreeToken
Бывает так: сидишь, листаешь ленту, и в очередной раз натыкаешься на пост, где стафф-инженер из солнечной Калифорнии крутит свежую модельку на паре RTX PRO 6000 общей стоимостью с подержанную машину. Ты смотришь на свою RTX 4060 в ноутбуке, который покупал «не только для игр», и понимаешь: ну ладно, это не для нас. Так вот, это как раз для нас. На той самой ноутбучной 4060 с восемью гигабайтами и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде. Вопрос был не в железе, а в софте, который это железо обслуживает. Разбираем FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang. Запустить AGI на слабом железе
https://habr.com/ru/articles/1073522/
#moe #локальные_модели #инференс #llamacpp #llm #оффлоадинг #агенты #cuda #gpu #freetoken
-
753B на одной видеокарте: разбор FreeToken
Бывает так: сидишь, листаешь ленту, и в очередной раз натыкаешься на пост, где стафф-инженер из солнечной Калифорнии крутит свежую модельку на паре RTX PRO 6000 общей стоимостью с подержанную машину. Ты смотришь на свою RTX 4060 в ноутбуке, который покупал «не только для игр», и понимаешь: ну ладно, это не для нас. Так вот, это как раз для нас. На той самой ноутбучной 4060 с восемью гигабайтами и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде. Вопрос был не в железе, а в софте, который это железо обслуживает. Разбираем FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang. Запустить AGI на слабом железе
https://habr.com/ru/articles/1073522/
#moe #локальные_модели #инференс #llamacpp #llm #оффлоадинг #агенты #cuda #gpu #freetoken
-
753B на одной видеокарте: разбор FreeToken
Бывает так: сидишь, листаешь ленту, и в очередной раз натыкаешься на пост, где стафф-инженер из солнечной Калифорнии крутит свежую модельку на паре RTX PRO 6000 общей стоимостью с подержанную машину. Ты смотришь на свою RTX 4060 в ноутбуке, который покупал «не только для игр», и понимаешь: ну ладно, это не для нас. Так вот, это как раз для нас. На той самой ноутбучной 4060 с восемью гигабайтами и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде. Вопрос был не в железе, а в софте, который это железо обслуживает. Разбираем FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang. Запустить AGI на слабом железе
https://habr.com/ru/articles/1073522/
#moe #локальные_модели #инференс #llamacpp #llm #оффлоадинг #агенты #cuda #gpu #freetoken