home.social
  1. #log #llm #llama.cpp @rf
    Загнал на ноутбучной встройке unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q2_K_XL с оффлоадингом эмбеддингов на nvme - долбит нормально, почему-то после тыщи токенов скорость падает примерно вдвое, но даже на пятидесяти тыщах токенов контекста более-менее терпимые 6 токенов инференса в секунду выдаёт, промпт процессинг примерно на порядок быстрее.
    "create me a animated svg of a goat riding a tractor into a self contained html" без какого-либо харнесса (и вообще нетривиального промптинга) - https://tinystash.undef.im/il/Uz9FinGoRZvTiSYWok2f2FZbhrhTm74H55sSwDQtBLQ4RLTV6YrjKdbx7Ce5dxz9vcLZ2g2w6u2MFyNqqLmc4s1.html
    Каверзные вопросы на логику разгадывает даже с отключенным ризонингом, не исключено впрочем что китайцы их в тренировочные данные засунули. С pi тоже работает, хаскельный код пишет и дебажит на уровне глупого джуна; разумеется проигрывает бесплатным предложениям от nvidia - нетривиальные задачи на ночь надо оставлять или типа того. Ещё я так и не смог разобраться как заприоритизировать что-то в амдшном линуксовом драйвере, так что во время работы нейронки акселерированная графика тормозит.
    Чем бы ещё её загрузить?
Share on Mastodon

Enter the server where you have an account.