#prompt_caching — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #prompt_caching, aggregated by home.social.
-
Одна строка в системном промпте отключала кеш целиком. 1% против 98% на живых вызовах
Токен, прочитанный из кеша, стоит не «немного дешевле». Он дешевле в 10–31 раз : DeepSeek — $0.44 против $0.014 за миллион, OpenAI — $4.00 против $0.40. Кеш провайдера — префиксное дерево по токенам. Он работает ровно до первого расхождения с прошлым запросом. Дальше — всё по полной цене. Поэтому одна строка вида Current time: {datetime.now()} в начале системного промпта отключает кеш целиком: время меняется на четвёртом слове, и остальные две тысячи токенов политик и базы знаний каждый раз оплачиваются заново. Хотя не менялись ни разу. Я замерил это на живых вызовах DeepSeek. Один и тот же агент, одни и те же четыре вопроса, одна и та же минута — разница только в том, куда положить время. Ноль попаданий в кеш против 1152 токенов из 1180. Потом направил профайлер на 97 877 собственных вызовов Claude Code — 32,5 млрд входных токенов, 98% из кеша. Внутри: как найти такой баг у себя, почему совпадение текста на 96% ещё не значит, что кеш работает, и какие поломки не видно глазами вообще — схемы инструментов из словаря с плавающим порядком ключей, база знаний из set() , «префикс совпал, а кеша нет». Плюс отрицательный контроль: сценарий, где фикс не даёт ничего , и инструмент честно об этом пишет. Инструмент открыт: github.com/Isk4R1oT/prefixcash Проверить свой промпт
https://habr.com/ru/articles/1075690/
#prompt_caching #кеширование_промптов #LLM #оптимизация_затрат #prefix_cache #hit_rate #DeepSeek #Anthropic #OpenAI #Python
-
Почему нейросети съедают токены: что происходит с длинными чатами и как снизить расход
Один пользователь Claude утверждает, что прогнал через модель больше миллиарда входных токенов. Другой оставил AI-агента без присмотра и насчитал около $6000 расходов. Цифры из Reddit можно оспаривать, но механизм за ними вполне реальный. Я посмотрел, почему короткий запрос внутри длинного чата может оказаться совсем не коротким для LLM, что происходит, когда контекст разрастается до сотен тысяч токенов, зачем нужен prompt caching и почему большое контекстное окно иногда делает ответы не лучше, а хуже. А заодно собрал несколько способов снизить расход токенов без бессмысленной охоты за каждым словом в промпте. Разобраться с токенами
https://habr.com/ru/companies/syntx_ai/articles/1069310/
#LLM #токены #контекстное_окно #Claude #ChatGPT #context_rot #prompt_caching #AIагенты #context_engineering #расход_токенов
-
Короткий промпт ≠ дешёвый промпт: как оптимизация ломает prefix cache в LLM-агентах
32 tools в промпте - дешевле, чем 7. Да, да - если вы строите агентов, это не опечатка. Это следствие того, как работает prefix cache в агентском цикле, и почему локальная оптимизация одного запроса ломает кэш на всей траектории. Третья статья серии про prefix caching - теперь про этих ваших агентов.
https://habr.com/ru/companies/bitrix/articles/1033822/
#llmагент #prefix_caching #токены #aiагенты #ai #prompt_caching #promptengineering #contextengineering
-
Code with Claude 2026: что Anthropic показали разработчикам на своей конференции
6 мая 2026 года в Сан-Франциско прошла вторая конференция Anthropic для разработчиков — Code with Claude. Площадку для мероприятия в этот раз расширили: в этот раз взяли бывший автосалон SVN West, так как спрос оказался выше. Следующие 2 конференции пройдут в Лондоне и Токио (19 мая и 10 июня), а записи всех докладов должны опубликовать в ближайшее время на YouTube канале Claude Code . Для тех, кто хочет посмотреть все доклады уже сейчас, опубликовал полную запись в ТГК (5+ часов видео). Ниже пройдемся по всем докладам и отметим самое важное.
https://habr.com/ru/articles/1032588/
#Anthropic #Claude_Code #managed_agents #routines #multiagent_orchestration #dreaming #outcomes #GitHub_Copilot #prompt_caching #Opus_47
-
[Перевод] Opus 4.7 использует на 45% больше токенов. Реальные замеры против обещаний Anthropic
В гайде по миграции для Claude Opus 4.7 написано: новый токенайзер использует «примерно в 1.0–1.35 раза больше токенов», чем 4.6. Я замерил и получил 1.47x на технической документации, и 1.45x на реальном CLAUDE.md-файле. Цены те же. Квоты те же. Токенов в промпте больше. Max-план сгорает быстрее. Кешированный префикс стоит дороже за каждую итерацию. Рейтлимит наступает раньше. Значит, Anthropic что-то получили в обмен. Что именно — и стоит ли оно того? Я провёл два эксперимента: первый измерил стоимость, второй проверил заявленные преимущества. Вот что получилось.
https://habr.com/ru/articles/1024958/
#Claude_47 #токенайзер #prompt_caching #Claude_Code #токены #IFEval #instruction_following #Anthropic #стоимость_API #claudeopus47