home.social

#freetoken — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #freetoken, aggregated by home.social.

fetched live
  1. 👀 FreeToken, il nuovo motore open source di UC Berkeley per far girare modelli MoE in locale su GPU consumer. FreeToken tratta il computer come un unico insieme elastico di risorse 👇
    gomoot.com/freetoken-il-motore

    #LocalAI #AI #freetoken #LLM #moe #opensource

  2. 👀 FreeToken, il nuovo motore open source di UC Berkeley per far girare modelli MoE in locale su GPU consumer. FreeToken tratta il computer come un unico insieme elastico di risorse 👇
    gomoot.com/freetoken-il-motore

    #LocalAI #AI #freetoken #LLM #moe #opensource

  3. 👀 FreeToken, il nuovo motore open source di UC Berkeley per far girare modelli MoE in locale su GPU consumer. FreeToken tratta il computer come un unico insieme elastico di risorse 👇
    gomoot.com/freetoken-il-motore

    #LocalAI #AI #freetoken #LLM #moe #opensource

  4. 👀 FreeToken, il nuovo motore open source di UC Berkeley per far girare modelli MoE in locale su GPU consumer. FreeToken tratta il computer come un unico insieme elastico di risorse 👇
    gomoot.com/freetoken-il-motore

    #LocalAI #AI #freetoken #LLM #moe #opensource

  5. 👀 FreeToken, il nuovo motore open source di UC Berkeley per far girare modelli MoE in locale su GPU consumer. FreeToken tratta il computer come un unico insieme elastico di risorse 👇
    gomoot.com/freetoken-il-motore

    #LocalAI #AI #freetoken #LLM #moe #opensource

  6. 📋 #FreeToken is an edge-native #MoE serving engine for running frontier-scale open-weight models on personal, consumer hardware #opensource #LLM #AI 🧵👇

  7. 📋 #FreeToken is an edge-native #MoE serving engine for running frontier-scale open-weight models on personal, consumer hardware #opensource #LLM #AI 🧵👇

  8. 📋 #FreeToken is an edge-native #MoE serving engine for running frontier-scale open-weight models on personal, consumer hardware #opensource #LLM #AI 🧵👇

  9. 📋 #FreeToken is an edge-native #MoE serving engine for running frontier-scale open-weight models on personal, consumer hardware #opensource #LLM #AI 🧵👇

  10. 📋 #FreeToken is an edge-native #MoE serving engine for running frontier-scale open-weight models on personal, consumer hardware #opensource #LLM #AI 🧵👇

  11. 753B на одной видеокарте: разбор FreeToken

    Бывает так: сидишь, листаешь ленту, и в очередной раз натыкаешься на пост, где стафф-инженер из солнечной Калифорнии крутит свежую модельку на паре RTX PRO 6000 общей стоимостью с подержанную машину. Ты смотришь на свою RTX 4060 в ноутбуке, который покупал «не только для игр», и понимаешь: ну ладно, это не для нас. Так вот, это как раз для нас. На той самой ноутбучной 4060 с восемью гигабайтами и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде. Вопрос был не в железе, а в софте, который это железо обслуживает. Разбираем FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang. Запустить AGI на слабом железе

    habr.com/ru/articles/1073522/

    #moe #локальные_модели #инференс #llamacpp #llm #оффлоадинг #агенты #cuda #gpu #freetoken

  12. 753B на одной видеокарте: разбор FreeToken

    Бывает так: сидишь, листаешь ленту, и в очередной раз натыкаешься на пост, где стафф-инженер из солнечной Калифорнии крутит свежую модельку на паре RTX PRO 6000 общей стоимостью с подержанную машину. Ты смотришь на свою RTX 4060 в ноутбуке, который покупал «не только для игр», и понимаешь: ну ладно, это не для нас. Так вот, это как раз для нас. На той самой ноутбучной 4060 с восемью гигабайтами и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде. Вопрос был не в железе, а в софте, который это железо обслуживает. Разбираем FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang. Запустить AGI на слабом железе

    habr.com/ru/articles/1073522/

    #moe #локальные_модели #инференс #llamacpp #llm #оффлоадинг #агенты #cuda #gpu #freetoken

  13. 753B на одной видеокарте: разбор FreeToken

    Бывает так: сидишь, листаешь ленту, и в очередной раз натыкаешься на пост, где стафф-инженер из солнечной Калифорнии крутит свежую модельку на паре RTX PRO 6000 общей стоимостью с подержанную машину. Ты смотришь на свою RTX 4060 в ноутбуке, который покупал «не только для игр», и понимаешь: ну ладно, это не для нас. Так вот, это как раз для нас. На той самой ноутбучной 4060 с восемью гигабайтами и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде. Вопрос был не в железе, а в софте, который это железо обслуживает. Разбираем FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang. Запустить AGI на слабом железе

    habr.com/ru/articles/1073522/

    #moe #локальные_модели #инференс #llamacpp #llm #оффлоадинг #агенты #cuda #gpu #freetoken