#reasoningтокены — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #reasoningтокены, aggregated by home.social.
-
Почему дорогая LLM дороже: экономика инференса, которую видно в твоём 5-часовом лимите
Каждый из вас, кто работал с Claude или с ChatGPT, смотрел на свои лимиты Или задавался вопросом «Да как один запрос съел 10% от лимита» Я потратил неделю на то, чтобы разобраться в том, а что вообще отображают эти лимиты И на свет появилась третья статья из моей серии «А как вообще работают современные LLM» После этой статьи ты разберёшься, что скрыто за 5-часовым лимитом Claude и других LLM и как на этом можно экономить. А еще — из каких примитивов состоят лимиты и какая физика вычислений за этим стоит Ну а если работаешь с моделями по API, то вообще пушка бомба Осторожно: после прочтения вы не сможете смотреть на полоску лимитов как прежде 🥵 Че там Че там 👀
https://habr.com/ru/articles/1055054/
#LLM #MoE #activeпараметры #KVcache #инференс_LLM #outputтокены #reasoningтокены #VRAM #claude_code #codex