#prompt_caching — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #prompt_caching, aggregated by home.social.
-
Полез в исходники vLLM, чтобы понять, почему один символ убивает prompt caching
В первой части я вывел одно правило и предложил жить по нему: стабильное в начало, изменчивое в хвост , один символ в системном промпте обнуляет весь кэш. Правило рабочее, я сам собираю агента вокруг него. Но жить по закону, которого не понимаешь, неуютно. vLLM и paged attention я руками не писал, зато исходники открыты, и я полез в них за байтовой причиной. Что физически лежит на GPU в момент попадания в кэш, как движок управляет этой памятью и почему хватает одного символа, чтобы всё посыпалось.
https://habr.com/ru/articles/1054410/
#prompt_caching #KVcache #prefix_caching #PagedAttention #vLLM #LLM #инференс_LLM #GPU #prefill #оптимизация
-
Я собрал линтер для юридического соответствия сайтов. Сложнее всего было отличить Google Analytics от CSS‑переменной
Коротко . Сервис открывает чужой сайт и считает штраф по КоАП. Внутри двухуровневая проверка по 22 правилам: дешёвые эвристики на cheerio там, где хватает регулярок, и Claude через российский прокси там, где нужно понять смысл текста. На выходе балл от 0 до 100, список нарушений со статьями КоАП и вилкой штрафа. Законы в основе: 152-ФЗ о персональных данных, 242-ФЗ о локализации, закон о рекламе, закон о защите прав потребителей. Ниже стек, архитектура и грабли. Самая обидная грабля в том, что \b в JavaScript не образует границу слова перед кириллицей, и детектор молча слепнет на русском тексте. Зачем я вообще это делал У меня небольшой сервисный центр по ремонту техники. В какой‑то момент дошли руки до юридической части собственного сайта, я полез читать 152-ФЗ, и довольно быстро стало ясно: требований к обычному сайту с формой заявки куда больше, чем кажется, и разбросаны они по нескольким законам. В мае 2025 КоАП по части персональных данных переписали: штрафы выросли в разы, появились оборотные за повторные нарушения, отдельная крупная санкция за утечки. При этом требований к сайту наберётся больше двадцати, и они размазаны по нескольким законам и подзаконным актам. Юрист за разовый аудит просит десятки тысяч. Малый бизнес такое не заказывает, пока не прилетит проверка. Захотелось собрать что‑то на стыке юриста и линтера: автоматический сканер, который читает сайт и говорит «вот тут нарушение, вот статья, вот порядок суммы». Сначала для себя и своего центра, потом понял, что это нужно не только мне.
https://habr.com/ru/articles/1050412/
#152ФЗ #персональные_данные #комплаенс #prompt_caching #регулярные_выражения #кириллица #LLM #Playwright #аудит_сайта #Nextjs
-
Сломанный кэш выглядит как рабочий: prompt caching для тех, кто строит LLM-агентов
Кэш режет цену входных токенов в десять раз и держит юнит-экономику агентов, но ломается без единой ошибки в логах. Что на самом деле кэшируется, чем отличаются OpenAI, Anthropic и Google и как собрать промпт, который не убивает собственный кэш.
https://habr.com/ru/articles/1048810/
#prompt_caching #KV_cache #кэширование_контекста #LLMагенты #cache_control #Gemini_context_caching #cache_hit_rate #кэширование_промптов #промпткэш
-
Короткий промпт ≠ дешёвый промпт: как оптимизация ломает prefix cache в LLM-агентах
32 tools в промпте - дешевле, чем 7. Да, да - если вы строите агентов, это не опечатка. Это следствие того, как работает prefix cache в агентском цикле, и почему локальная оптимизация одного запроса ломает кэш на всей траектории. Третья статья серии про prefix caching - теперь про этих ваших агентов.
https://habr.com/ru/companies/bitrix/articles/1033822/
#llmагент #prefix_caching #токены #aiагенты #ai #prompt_caching #promptengineering #contextengineering
-
Code with Claude 2026: что Anthropic показали разработчикам на своей конференции
6 мая 2026 года в Сан-Франциско прошла вторая конференция Anthropic для разработчиков — Code with Claude. Площадку для мероприятия в этот раз расширили: в этот раз взяли бывший автосалон SVN West, так как спрос оказался выше. Следующие 2 конференции пройдут в Лондоне и Токио (19 мая и 10 июня), а записи всех докладов должны опубликовать в ближайшее время на YouTube канале Claude Code . Для тех, кто хочет посмотреть все доклады уже сейчас, опубликовал полную запись в ТГК (5+ часов видео). Ниже пройдемся по всем докладам и отметим самое важное.
https://habr.com/ru/articles/1032588/
#Anthropic #Claude_Code #managed_agents #routines #multiagent_orchestration #dreaming #outcomes #GitHub_Copilot #prompt_caching #Opus_47
-
[Перевод] Opus 4.7 использует на 45% больше токенов. Реальные замеры против обещаний Anthropic
В гайде по миграции для Claude Opus 4.7 написано: новый токенайзер использует «примерно в 1.0–1.35 раза больше токенов», чем 4.6. Я замерил и получил 1.47x на технической документации, и 1.45x на реальном CLAUDE.md-файле. Цены те же. Квоты те же. Токенов в промпте больше. Max-план сгорает быстрее. Кешированный префикс стоит дороже за каждую итерацию. Рейтлимит наступает раньше. Значит, Anthropic что-то получили в обмен. Что именно — и стоит ли оно того? Я провёл два эксперимента: первый измерил стоимость, второй проверил заявленные преимущества. Вот что получилось.
https://habr.com/ru/articles/1024958/
#Claude_47 #токенайзер #prompt_caching #Claude_Code #токены #IFEval #instruction_following #Anthropic #стоимость_API #claudeopus47
-
KV-Cache в LLM: разбираем инференс через 9 ключевых вопросов
Почему Cache Read и Cache Write стоят денег и как работает Prompt Caching? Разбираем KV-Cache через 9 ключевых вопросов. Разобраться
https://habr.com/ru/articles/1021832/
#машинное_обучение #машинное_обучение_нейросети #llm #gpu #transformers #kvcache #prompt_caching #attention #vllm #prefix_caching
-
$20 в месяц на Cursor. Куда уходят токены и что с этим можно сделать
У меня небольшой бюджет на AI-ассистент — $20 в месяц. Хватает, но только если понимаешь как работает тарификация. Я потратил время чтобы разобраться что именно ест токены, и написал framework который пытается решить эти проблемы. Расскажу про оба.
https://habr.com/ru/articles/1002714/
#cursor #cursor_ide #contextengineering #promptengineering #token_management #prompt_caching
-
[Перевод] Как работает кэширование промптов — PagedAttention и автоматическое кэширование префикса плюс практические советы
Prompt caching часто обсуждают как «бонусную опцию» в API-прайсе: мол, попал в кэш — дешевле и быстрее. В статье разбираем, что за этим стоит на самом деле: почему кэш — это не «память диалога», а переиспользование KV-тензоров на уровне одинаковых префиксов, как из этого вырастает PagedAttention/vLLM с блоками и хэш-цепочками, и какие мелкие, но фатальные детали (динамический системный промпт, недетерминированный JSON, перестановка tool defs) мгновенно превращают кэш в тыкву. Как это устроено
https://habr.com/ru/companies/otus/articles/984434/
#prompt_caching #префилл #декодинг #инференс_LLM #vLLM #PagedAttention #prefix_caching #фрагментация_памяти #планировщик_инференса
-
[Перевод] Prompt Caching: токены LLM в 10 раз дешевле — но за счёт чего?
Команда AI for Devs подготовила перевод и разбор статьи о Prompt Caching — технологии, которая делает входные токены LLM в разы дешевле и заметно снижает задержки. Внутри — подробное объяснение, что именно кэшируют OpenAI и Anthropic, как KV-кэш связан с attention в трансформерах и почему это не имеет ничего общего с повторным использованием ответов.
https://habr.com/ru/articles/978498/
#prompt_caching #kv #cache #llm #transformers #attention #inference #embeddings #openai #anthropic