home.social

#context_engineering — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #context_engineering, aggregated by home.social.

fetched live
  1. Эволюция подхода к сжатию контекста в AI Агентах

    AI-агенты - это цикл обмена сообщениями между пользователем и языковой моделью (LLM), где для ответа пользователю модель может обратиться к доступным ей напрямую инструментам (tools) или через настроенные для неё MCP. Каждое такое взаимодействие дописывает историю диалога. Для простоты часто считают, что вся эта история и уходит в любой следующий вызов модели - иначе она «не вспомнит», о чём шла речь, и криво соберёт ответ. История «не резиновая» - у современных моделей контекстное окно может быть огромным, но умение работать с длинным логом сильно зависит от того, насколько он структурирован. Плюс накопленная история разговора и реальный контекст, который модель видит на очередном ходе, не всегда одно и то же. В последнее время это один из фокусов развития агентских систем в рамках context engineering: что сжать, что оставить снаружи, что подтянуть инструментами только когда нужно. В этой статье хочу рассказать про эволюцию подхода работы с длинной историей и где мы находимся сейчас. Примеры будут на LangChain - на открытом стеке легко посмотреть реализацию, которая в готовых продуктах часто спрятана. При этом LangChain достаточно популярный, развивающийся фреймворк - остальные либо делают похожие вещи, либо сами опираются на него как на базу.

    habr.com/ru/articles/1069780/

    #агенты #машинное_обучение #ииагенты #context_engineering #summarization

  2. Эволюция подхода к сжатию контекста в AI Агентах

    AI-агенты - это цикл обмена сообщениями между пользователем и языковой моделью (LLM), где для ответа пользователю модель может обратиться к доступным ей напрямую инструментам (tools) или через настроенные для неё MCP. Каждое такое взаимодействие дописывает историю диалога. Для простоты часто считают, что вся эта история и уходит в любой следующий вызов модели - иначе она «не вспомнит», о чём шла речь, и криво соберёт ответ. История «не резиновая» - у современных моделей контекстное окно может быть огромным, но умение работать с длинным логом сильно зависит от того, насколько он структурирован. Плюс накопленная история разговора и реальный контекст, который модель видит на очередном ходе, не всегда одно и то же. В последнее время это один из фокусов развития агентских систем в рамках context engineering: что сжать, что оставить снаружи, что подтянуть инструментами только когда нужно. В этой статье хочу рассказать про эволюцию подхода работы с длинной историей и где мы находимся сейчас. Примеры будут на LangChain - на открытом стеке легко посмотреть реализацию, которая в готовых продуктах часто спрятана. При этом LangChain достаточно популярный, развивающийся фреймворк - остальные либо делают похожие вещи, либо сами опираются на него как на базу.

    habr.com/ru/articles/1069780/

    #агенты #машинное_обучение #ииагенты #context_engineering #summarization

  3. Эволюция подхода к сжатию контекста в AI Агентах

    AI-агенты - это цикл обмена сообщениями между пользователем и языковой моделью (LLM), где для ответа пользователю модель может обратиться к доступным ей напрямую инструментам (tools) или через настроенные для неё MCP. Каждое такое взаимодействие дописывает историю диалога. Для простоты часто считают, что вся эта история и уходит в любой следующий вызов модели - иначе она «не вспомнит», о чём шла речь, и криво соберёт ответ. История «не резиновая» - у современных моделей контекстное окно может быть огромным, но умение работать с длинным логом сильно зависит от того, насколько он структурирован. Плюс накопленная история разговора и реальный контекст, который модель видит на очередном ходе, не всегда одно и то же. В последнее время это один из фокусов развития агентских систем в рамках context engineering: что сжать, что оставить снаружи, что подтянуть инструментами только когда нужно. В этой статье хочу рассказать про эволюцию подхода работы с длинной историей и где мы находимся сейчас. Примеры будут на LangChain - на открытом стеке легко посмотреть реализацию, которая в готовых продуктах часто спрятана. При этом LangChain достаточно популярный, развивающийся фреймворк - остальные либо делают похожие вещи, либо сами опираются на него как на базу.

    habr.com/ru/articles/1069780/

    #агенты #машинное_обучение #ииагенты #context_engineering #summarization

  4. Status Line для Claude Code CLI. Показывает кэш, git, контекст и лимиты в одном месте

    Сделал Status Line для тех, кто пользуется Claude Code CLI Если вы работаете с клодом в терминале, то в одном месте он показывает: • Модель и Effort; • Текущую рабочую папку и ветку; • Незакоммиченные изменения в GIT в этой папке; • Есть ли что в очереди на push и pull; • Расхождение основных md файлов; • Текущий размер контекстного окна; • Кэш: hit rate & TTL; • Ну и лимиты, конечно же. Очень удобно это все видеть в одном месте. Рассказываю про него в статье. Узнать про Status Line 🥵

    habr.com/ru/articles/1069754/

    #Claude_Code #statusline #терминал #CLI #AIагенты #контекстное_окно #prompt_cache #Git #Nodejs #context_engineering

  5. Status Line для Claude Code CLI. Показывает кэш, git, контекст и лимиты в одном месте

    Сделал Status Line для тех, кто пользуется Claude Code CLI Если вы работаете с клодом в терминале, то в одном месте он показывает: • Модель и Effort; • Текущую рабочую папку и ветку; • Незакоммиченные изменения в GIT в этой папке; • Есть ли что в очереди на push и pull; • Расхождение основных md файлов; • Текущий размер контекстного окна; • Кэш: hit rate & TTL; • Ну и лимиты, конечно же. Очень удобно это все видеть в одном месте. Рассказываю про него в статье. Узнать про Status Line 🥵

    habr.com/ru/articles/1069754/

    #Claude_Code #statusline #терминал #CLI #AIагенты #контекстное_окно #prompt_cache #Git #Nodejs #context_engineering

  6. Status Line для Claude Code CLI. Показывает кэш, git, контекст и лимиты в одном месте

    Сделал Status Line для тех, кто пользуется Claude Code CLI Если вы работаете с клодом в терминале, то в одном месте он показывает: • Модель и Effort; • Текущую рабочую папку и ветку; • Незакоммиченные изменения в GIT в этой папке; • Есть ли что в очереди на push и pull; • Расхождение основных md файлов; • Текущий размер контекстного окна; • Кэш: hit rate & TTL; • Ну и лимиты, конечно же. Очень удобно это все видеть в одном месте. Рассказываю про него в статье. Узнать про Status Line 🥵

    habr.com/ru/articles/1069754/

    #Claude_Code #statusline #терминал #CLI #AIагенты #контекстное_окно #prompt_cache #Git #Nodejs #context_engineering

  7. Почему нейросети съедают токены: что происходит с длинными чатами и как снизить расход

    Один пользователь Claude утверждает, что прогнал через модель больше миллиарда входных токенов. Другой оставил AI-агента без присмотра и насчитал около $6000 расходов. Цифры из Reddit можно оспаривать, но механизм за ними вполне реальный. Я посмотрел, почему короткий запрос внутри длинного чата может оказаться совсем не коротким для LLM, что происходит, когда контекст разрастается до сотен тысяч токенов, зачем нужен prompt caching и почему большое контекстное окно иногда делает ответы не лучше, а хуже. А заодно собрал несколько способов снизить расход токенов без бессмысленной охоты за каждым словом в промпте. Разобраться с токенами

    habr.com/ru/companies/syntx_ai

    #LLM #токены #контекстное_окно #Claude #ChatGPT #context_rot #prompt_caching #AIагенты #context_engineering #расход_токенов

  8. Почему нейросети съедают токены: что происходит с длинными чатами и как снизить расход

    Один пользователь Claude утверждает, что прогнал через модель больше миллиарда входных токенов. Другой оставил AI-агента без присмотра и насчитал около $6000 расходов. Цифры из Reddit можно оспаривать, но механизм за ними вполне реальный. Я посмотрел, почему короткий запрос внутри длинного чата может оказаться совсем не коротким для LLM, что происходит, когда контекст разрастается до сотен тысяч токенов, зачем нужен prompt caching и почему большое контекстное окно иногда делает ответы не лучше, а хуже. А заодно собрал несколько способов снизить расход токенов без бессмысленной охоты за каждым словом в промпте. Разобраться с токенами

    habr.com/ru/companies/syntx_ai

    #LLM #токены #контекстное_окно #Claude #ChatGPT #context_rot #prompt_caching #AIагенты #context_engineering #расход_токенов

  9. Почему нейросети съедают токены: что происходит с длинными чатами и как снизить расход

    Один пользователь Claude утверждает, что прогнал через модель больше миллиарда входных токенов. Другой оставил AI-агента без присмотра и насчитал около $6000 расходов. Цифры из Reddit можно оспаривать, но механизм за ними вполне реальный. Я посмотрел, почему короткий запрос внутри длинного чата может оказаться совсем не коротким для LLM, что происходит, когда контекст разрастается до сотен тысяч токенов, зачем нужен prompt caching и почему большое контекстное окно иногда делает ответы не лучше, а хуже. А заодно собрал несколько способов снизить расход токенов без бессмысленной охоты за каждым словом в промпте. Разобраться с токенами

    habr.com/ru/companies/syntx_ai

    #LLM #токены #контекстное_окно #Claude #ChatGPT #context_rot #prompt_caching #AIагенты #context_engineering #расход_токенов

  10. Я объяснил KERNEL маме за пять минут. Потом проверил, переживёт ли он LLM в production

    Недавно я попробовал объяснить маме, как нормально ставить задачи ChatGPT. Без temperature, context window, system prompt и прочих слов, после которых человек вполне справедливо решает, что проще уже сделать всё самому. Я сказал примерно так: «Сформулируй, что тебе нужно. Объясни, каким должен быть результат. Если есть ограничения, напиши их сразу. Не сваливай пять разных задач в одну. И не заставляй модель угадывать то, что существует только у тебя в голове». На всё ушло минут пять. А потом я понял, что почти дословно пересказал KERNEL, один из фреймворков для написания промптов. И тут стало интереснее: если базовый prompt engineering действительно можно объяснить человеку за пять минут, что происходит, когда LLM переезжает из вкладки браузера в реальный продукт?

    habr.com/ru/companies/syntx_ai

    #LLM #prompt_engineering #KERNEL #промпты #context_engineering #evals #ChatGPT #RAG #AIагенты #LLM_в_production

  11. Я объяснил KERNEL маме за пять минут. Потом проверил, переживёт ли он LLM в production

    Недавно я попробовал объяснить маме, как нормально ставить задачи ChatGPT. Без temperature, context window, system prompt и прочих слов, после которых человек вполне справедливо решает, что проще уже сделать всё самому. Я сказал примерно так: «Сформулируй, что тебе нужно. Объясни, каким должен быть результат. Если есть ограничения, напиши их сразу. Не сваливай пять разных задач в одну. И не заставляй модель угадывать то, что существует только у тебя в голове». На всё ушло минут пять. А потом я понял, что почти дословно пересказал KERNEL, один из фреймворков для написания промптов. И тут стало интереснее: если базовый prompt engineering действительно можно объяснить человеку за пять минут, что происходит, когда LLM переезжает из вкладки браузера в реальный продукт?

    habr.com/ru/companies/syntx_ai

    #LLM #prompt_engineering #KERNEL #промпты #context_engineering #evals #ChatGPT #RAG #AIагенты #LLM_в_production

  12. Я объяснил KERNEL маме за пять минут. Потом проверил, переживёт ли он LLM в production

    Недавно я попробовал объяснить маме, как нормально ставить задачи ChatGPT. Без temperature, context window, system prompt и прочих слов, после которых человек вполне справедливо решает, что проще уже сделать всё самому. Я сказал примерно так: «Сформулируй, что тебе нужно. Объясни, каким должен быть результат. Если есть ограничения, напиши их сразу. Не сваливай пять разных задач в одну. И не заставляй модель угадывать то, что существует только у тебя в голове». На всё ушло минут пять. А потом я понял, что почти дословно пересказал KERNEL, один из фреймворков для написания промптов. И тут стало интереснее: если базовый prompt engineering действительно можно объяснить человеку за пять минут, что происходит, когда LLM переезжает из вкладки браузера в реальный продукт?

    habr.com/ru/companies/syntx_ai

    #LLM #prompt_engineering #KERNEL #промпты #context_engineering #evals #ChatGPT #RAG #AIагенты #LLM_в_production

  13. ИИ‑агенту недостаточно правил: как мы передаём ему инженерный опыт

    Промпты, документация и skills сами по себе не передают ИИ‑агенту инженерный опыт. Рассказываю, как мы выстроили работу через декомпозицию, эталонные реализации, few‑shot и постепенное доверие к тестам — без вайбкодинга и автономной генерации тысяч строк кода. Разобраться в процессе

    habr.com/ru/articles/1066436/

    #ИИагенты #агентная_разработка #разработка_ПО #context_engineering #fewshot #skills #тестирование #code_review #инженерные_практики #автоматизация_разработки

  14. ИИ‑агенту недостаточно правил: как мы передаём ему инженерный опыт

    Промпты, документация и skills сами по себе не передают ИИ‑агенту инженерный опыт. Рассказываю, как мы выстроили работу через декомпозицию, эталонные реализации, few‑shot и постепенное доверие к тестам — без вайбкодинга и автономной генерации тысяч строк кода. Разобраться в процессе

    habr.com/ru/articles/1066436/

    #ИИагенты #агентная_разработка #разработка_ПО #context_engineering #fewshot #skills #тестирование #code_review #инженерные_практики #автоматизация_разработки

  15. ИИ‑агенту недостаточно правил: как мы передаём ему инженерный опыт

    Промпты, документация и skills сами по себе не передают ИИ‑агенту инженерный опыт. Рассказываю, как мы выстроили работу через декомпозицию, эталонные реализации, few‑shot и постепенное доверие к тестам — без вайбкодинга и автономной генерации тысяч строк кода. Разобраться в процессе

    habr.com/ru/articles/1066436/

    #ИИагенты #агентная_разработка #разработка_ПО #context_engineering #fewshot #skills #тестирование #code_review #инженерные_практики #автоматизация_разработки

  16. Ваш агент не тупой — ему просто неудобно

    Инженеры тонут в ревью сгенерированного кода, продакты хвастаются фичами без программистов. Почему агент буксует в вашем репозитории и как это измерить. Читать про Agent Comfort

    habr.com/ru/articles/1064012/

    #context_engineering #агентская_разработка #AIагенты #Claude_Code #code_review #качество_кода #DevOps

  17. Ваш агент не тупой — ему просто неудобно

    Инженеры тонут в ревью сгенерированного кода, продакты хвастаются фичами без программистов. Почему агент буксует в вашем репозитории и как это измерить. Читать про Agent Comfort

    habr.com/ru/articles/1064012/

    #context_engineering #агентская_разработка #AIагенты #Claude_Code #code_review #качество_кода #DevOps

  18. Ваш агент не тупой — ему просто неудобно

    Инженеры тонут в ревью сгенерированного кода, продакты хвастаются фичами без программистов. Почему агент буксует в вашем репозитории и как это измерить. Читать про Agent Comfort

    habr.com/ru/articles/1064012/

    #context_engineering #агентская_разработка #AIагенты #Claude_Code #code_review #качество_кода #DevOps

  19. Инженерия вокруг агента: 10 идей AI Engineer

    10 идей конференции AI Engineer о том, как меняется разработка, когда код пишут агенты. В начале 2026 года небольшая команда OpenAI рассказала о необычном эксперименте. Три инженера за пять месяцев создали внутренний продукт объёмом около миллиона строк кода и провели через репозиторий примерно 1500 pull request’ов. Продуктом пользовались сотни сотрудников. При этом люди не написали вручную ни одной строки: прикладной код, тесты, CI‑конфигурацию, документацию, observability и внутренние инструменты генерировал Codex. По оценке команды, разработка заняла примерно десятую часть времени, которое потребовалось бы при традиционном подходе. Но наиболее интересным результатом эксперимента оказался не миллион строк кода. Им стало открытие нового узкого места. Когда код можно производить практически непрерывно, ограничением становится не скорость печати и даже не интеллект модели. Ограничением становится способность людей объяснить, что именно следует построить , организовать работу автономных исполнителей, проверить результат и не позволить автоматизации разрушить систему быстрее, чем команда успеет это заметить. Именно этот сдвиг лучше всего описывают выступления AI Engineer 2026 — весенней конференции Europe в Лондоне и летней World's Fair в Сан‑Франциско. Доклады посвящены разным темам: контексту, памяти, длительным циклам, командной координации, верификации и безопасности. При этом важно не сводить их к одной заранее выбранной теории. Каждый спикер предлагает собственную модель AI‑first разработки, основанную на своём опыте и профессиональной перспективе.

    habr.com/ru/articles/1063504/

    #AIfirst_разработка #AIагенты #harness_engineering #context_engineering #память_агентов #agent_loops #мультиагентные_системы #верификация_кода #автономность_агентов #agentic_security

  20. Инженерия вокруг агента: 10 идей AI Engineer

    10 идей конференции AI Engineer о том, как меняется разработка, когда код пишут агенты. В начале 2026 года небольшая команда OpenAI рассказала о необычном эксперименте. Три инженера за пять месяцев создали внутренний продукт объёмом около миллиона строк кода и провели через репозиторий примерно 1500 pull request’ов. Продуктом пользовались сотни сотрудников. При этом люди не написали вручную ни одной строки: прикладной код, тесты, CI‑конфигурацию, документацию, observability и внутренние инструменты генерировал Codex. По оценке команды, разработка заняла примерно десятую часть времени, которое потребовалось бы при традиционном подходе. Но наиболее интересным результатом эксперимента оказался не миллион строк кода. Им стало открытие нового узкого места. Когда код можно производить практически непрерывно, ограничением становится не скорость печати и даже не интеллект модели. Ограничением становится способность людей объяснить, что именно следует построить , организовать работу автономных исполнителей, проверить результат и не позволить автоматизации разрушить систему быстрее, чем команда успеет это заметить. Именно этот сдвиг лучше всего описывают выступления AI Engineer 2026 — весенней конференции Europe в Лондоне и летней World's Fair в Сан‑Франциско. Доклады посвящены разным темам: контексту, памяти, длительным циклам, командной координации, верификации и безопасности. При этом важно не сводить их к одной заранее выбранной теории. Каждый спикер предлагает собственную модель AI‑first разработки, основанную на своём опыте и профессиональной перспективе.

    habr.com/ru/articles/1063504/

    #AIfirst_разработка #AIагенты #harness_engineering #context_engineering #память_агентов #agent_loops #мультиагентные_системы #верификация_кода #автономность_агентов #agentic_security

  21. Инженерия вокруг агента: 10 идей AI Engineer

    10 идей конференции AI Engineer о том, как меняется разработка, когда код пишут агенты. В начале 2026 года небольшая команда OpenAI рассказала о необычном эксперименте. Три инженера за пять месяцев создали внутренний продукт объёмом около миллиона строк кода и провели через репозиторий примерно 1500 pull request’ов. Продуктом пользовались сотни сотрудников. При этом люди не написали вручную ни одной строки: прикладной код, тесты, CI‑конфигурацию, документацию, observability и внутренние инструменты генерировал Codex. По оценке команды, разработка заняла примерно десятую часть времени, которое потребовалось бы при традиционном подходе. Но наиболее интересным результатом эксперимента оказался не миллион строк кода. Им стало открытие нового узкого места. Когда код можно производить практически непрерывно, ограничением становится не скорость печати и даже не интеллект модели. Ограничением становится способность людей объяснить, что именно следует построить , организовать работу автономных исполнителей, проверить результат и не позволить автоматизации разрушить систему быстрее, чем команда успеет это заметить. Именно этот сдвиг лучше всего описывают выступления AI Engineer 2026 — весенней конференции Europe в Лондоне и летней World's Fair в Сан‑Франциско. Доклады посвящены разным темам: контексту, памяти, длительным циклам, командной координации, верификации и безопасности. При этом важно не сводить их к одной заранее выбранной теории. Каждый спикер предлагает собственную модель AI‑first разработки, основанную на своём опыте и профессиональной перспективе.

    habr.com/ru/articles/1063504/

    #AIfirst_разработка #AIагенты #harness_engineering #context_engineering #память_агентов #agent_loops #мультиагентные_системы #верификация_кода #автономность_агентов #agentic_security

  22. Роль Solution Architect в эру AI-агентов

    В апреле 2026 года глава Google Сундар Пичаи сказал, что 75% нового кода Google сгенерировано AI . Динамика: 25% в начале 2024 года, 50% к концу 2025 года, 75% к апрелю 2026 года. Согласно Sonar 2026 State of Code Developer Survey , 96% разработчиков не доверяют функциональной корректности AI-кода полностью. 95% тратят время на его проверку, тестирование и исправление, а 38% считают такое ревью более трудоемким, чем проверку кода, написанного человеком. Генерация кода подешевела, контроль за ним - нет. Thoughtworks в Technology Radar vol. 34 (апрель 2026) ввел термин codebase cognitive debt - разрыв в понимании между человеком и кодовой базой, который растет по мере того, как AI генерирует все больший объем кода. Узкое место производственного процесса сместилось с написания спецификаций и кода на постановку задачи AI (intent) и контроль генерации (review): что именно должна делать система, в каких границах и кто проверяет, что AI-агент сделал именно это. Код производится быстрее, чем кто-либо успевает подтвердить его соответствие требованиям. Качество, стабильность и сопровождаемость держатся на том, кто и как организует постановку и проверку. Это зона ответственности архитектуры. Квалификация архитектора смещается от проектирования общих и детальных архитектурных решений к владению контекстом системы, спецификациями и AI-платформой. В этой статье я, Алексей Соболеков, архитектор решений, разберу изменение роли архитектора в агентной разработке. Я прошел три модели архитектурного процесса.

    habr.com/ru/articles/1058748/

    #solution_architect #aiагенты #specdriven_development #llm #архитектура_решений #context_engineering

  23. Роль Solution Architect в эру AI-агентов

    В апреле 2026 года глава Google Сундар Пичаи сказал, что 75% нового кода Google сгенерировано AI . Динамика: 25% в начале 2024 года, 50% к концу 2025 года, 75% к апрелю 2026 года. Согласно Sonar 2026 State of Code Developer Survey , 96% разработчиков не доверяют функциональной корректности AI-кода полностью. 95% тратят время на его проверку, тестирование и исправление, а 38% считают такое ревью более трудоемким, чем проверку кода, написанного человеком. Генерация кода подешевела, контроль за ним - нет. Thoughtworks в Technology Radar vol. 34 (апрель 2026) ввел термин codebase cognitive debt - разрыв в понимании между человеком и кодовой базой, который растет по мере того, как AI генерирует все больший объем кода. Узкое место производственного процесса сместилось с написания спецификаций и кода на постановку задачи AI (intent) и контроль генерации (review): что именно должна делать система, в каких границах и кто проверяет, что AI-агент сделал именно это. Код производится быстрее, чем кто-либо успевает подтвердить его соответствие требованиям. Качество, стабильность и сопровождаемость держатся на том, кто и как организует постановку и проверку. Это зона ответственности архитектуры. Квалификация архитектора смещается от проектирования общих и детальных архитектурных решений к владению контекстом системы, спецификациями и AI-платформой. В этой статье я, Алексей Соболеков, архитектор решений, разберу изменение роли архитектора в агентной разработке. Я прошел три модели архитектурного процесса.

    habr.com/ru/articles/1058748/

    #solution_architect #aiагенты #specdriven_development #llm #архитектура_решений #context_engineering

  24. Роль Solution Architect в эру AI-агентов

    В апреле 2026 года глава Google Сундар Пичаи сказал, что 75% нового кода Google сгенерировано AI . Динамика: 25% в начале 2024 года, 50% к концу 2025 года, 75% к апрелю 2026 года. Согласно Sonar 2026 State of Code Developer Survey , 96% разработчиков не доверяют функциональной корректности AI-кода полностью. 95% тратят время на его проверку, тестирование и исправление, а 38% считают такое ревью более трудоемким, чем проверку кода, написанного человеком. Генерация кода подешевела, контроль за ним - нет. Thoughtworks в Technology Radar vol. 34 (апрель 2026) ввел термин codebase cognitive debt - разрыв в понимании между человеком и кодовой базой, который растет по мере того, как AI генерирует все больший объем кода. Узкое место производственного процесса сместилось с написания спецификаций и кода на постановку задачи AI (intent) и контроль генерации (review): что именно должна делать система, в каких границах и кто проверяет, что AI-агент сделал именно это. Код производится быстрее, чем кто-либо успевает подтвердить его соответствие требованиям. Качество, стабильность и сопровождаемость держатся на том, кто и как организует постановку и проверку. Это зона ответственности архитектуры. Квалификация архитектора смещается от проектирования общих и детальных архитектурных решений к владению контекстом системы, спецификациями и AI-платформой. В этой статье я, Алексей Соболеков, архитектор решений, разберу изменение роли архитектора в агентной разработке. Я прошел три модели архитектурного процесса.

    habr.com/ru/articles/1058748/

    #solution_architect #aiагенты #specdriven_development #llm #архитектура_решений #context_engineering

  25. Контекстная инженерия: что это такое, как работать с контекстом и почему за это начали платить

    Вы собрали диалоговую систему — агента с RAG, инструментами и памятью. На коротких диалогах всё работает: модель выбирает нужный инструмент и достаёт данные. Но через несколько десятков итераций агент уже путает инструменты, тянет в ответ старые вызовы и опирается на ошибку, которая раньше попала в контекст. Новый промпт не всегда решает проблему: важно управлять тем, какая информация попадает к модели перед каждым следующим шагом. Это и называют контекстной инженерией. Разбираемся, чем она отличается от промпт-инжиниринга, RAG и MCP, почему агент начинает ошибаться и какие приёмы помогают собрать контекст так, чтобы модель не путалась в длинных сценариях. Показать на коде →

    habr.com/ru/companies/netology

    #контекстная_инженерия #context_engineering #llm #ииагенты #rag #mcp #промптинжиниринг #контекстное_окно #большие_языковые_модели #tool_calls

  26. Контекстная инженерия: что это такое, как работать с контекстом и почему за это начали платить

    Вы собрали диалоговую систему — агента с RAG, инструментами и памятью. На коротких диалогах всё работает: модель выбирает нужный инструмент и достаёт данные. Но через несколько десятков итераций агент уже путает инструменты, тянет в ответ старые вызовы и опирается на ошибку, которая раньше попала в контекст. Новый промпт не всегда решает проблему: важно управлять тем, какая информация попадает к модели перед каждым следующим шагом. Это и называют контекстной инженерией. Разбираемся, чем она отличается от промпт-инжиниринга, RAG и MCP, почему агент начинает ошибаться и какие приёмы помогают собрать контекст так, чтобы модель не путалась в длинных сценариях. Показать на коде →

    habr.com/ru/companies/netology

    #контекстная_инженерия #context_engineering #llm #ииагенты #rag #mcp #промптинжиниринг #контекстное_окно #большие_языковые_модели #tool_calls

  27. Контекстная инженерия: что это такое, как работать с контекстом и почему за это начали платить

    Вы собрали диалоговую систему — агента с RAG, инструментами и памятью. На коротких диалогах всё работает: модель выбирает нужный инструмент и достаёт данные. Но через несколько десятков итераций агент уже путает инструменты, тянет в ответ старые вызовы и опирается на ошибку, которая раньше попала в контекст. Новый промпт не всегда решает проблему: важно управлять тем, какая информация попадает к модели перед каждым следующим шагом. Это и называют контекстной инженерией. Разбираемся, чем она отличается от промпт-инжиниринга, RAG и MCP, почему агент начинает ошибаться и какие приёмы помогают собрать контекст так, чтобы модель не путалась в длинных сценариях. Показать на коде →

    habr.com/ru/companies/netology

    #контекстная_инженерия #context_engineering #llm #ииагенты #rag #mcp #промптинжиниринг #контекстное_окно #большие_языковые_модели #tool_calls

  28. Токенная диета для ИИ-агентов: Caveman, Ponytail и Headroom

    ИИ-агенты упираются не только в цену модели, но и в лишний контекст: длинные ответы, раздутый код, большие логи и JSON. Разбираю Caveman, Ponytail и Headroom как три разных слоя токенной диеты для агентной разработки.

    habr.com/ru/articles/1056748/

    #ai_agents #llm #context_engineering #codex #claude_code #agentic_coding #оптимизация_токенов

  29. Токенная диета для ИИ-агентов: Caveman, Ponytail и Headroom

    ИИ-агенты упираются не только в цену модели, но и в лишний контекст: длинные ответы, раздутый код, большие логи и JSON. Разбираю Caveman, Ponytail и Headroom как три разных слоя токенной диеты для агентной разработки.

    habr.com/ru/articles/1056748/

    #ai_agents #llm #context_engineering #codex #claude_code #agentic_coding #оптимизация_токенов

  30. Токенная диета для ИИ-агентов: Caveman, Ponytail и Headroom

    ИИ-агенты упираются не только в цену модели, но и в лишний контекст: длинные ответы, раздутый код, большие логи и JSON. Разбираю Caveman, Ponytail и Headroom как три разных слоя токенной диеты для агентной разработки.

    habr.com/ru/articles/1056748/

    #ai_agents #llm #context_engineering #codex #claude_code #agentic_coding #оптимизация_токенов

  31. Когда контекстное окно кончается, а проект — нет

    Браузерная игра на 114 тысяч строк, целиком написанная с помощью нейросетей за три недели. Не про то, что ИИ умеет код, а про то, что удерживает большой проект управляемым, когда кодовая база не влезает в контекстное окно. Осознать масштаб

    habr.com/ru/articles/1050728/

    #context_engineering #agentsmd #архитектура_систем #браузерная_игра #typescript #ralphex #aiагенты_в_работе #оркестратор #ecs #vibecoding

  32. Когда контекстное окно кончается, а проект — нет

    Браузерная игра на 114 тысяч строк, целиком написанная с помощью нейросетей за три недели. Не про то, что ИИ умеет код, а про то, что удерживает большой проект управляемым, когда кодовая база не влезает в контекстное окно. Осознать масштаб

    habr.com/ru/articles/1050728/

    #context_engineering #agentsmd #архитектура_систем #браузерная_игра #typescript #ralphex #aiагенты_в_работе #оркестратор #ecs #vibecoding

  33. Когда контекстное окно кончается, а проект — нет

    Браузерная игра на 114 тысяч строк, целиком написанная с помощью нейросетей за три недели. Не про то, что ИИ умеет код, а про то, что удерживает большой проект управляемым, когда кодовая база не влезает в контекстное окно. Осознать масштаб

    habr.com/ru/articles/1050728/

    #context_engineering #agentsmd #архитектура_систем #браузерная_игра #typescript #ralphex #aiагенты_в_работе #оркестратор #ecs #vibecoding

  34. Почему мы спорим о памяти для AI-агентов

    На днях наткнулся на статью про память для AI-агентов. Сама статья была вполне типичной: SQLite, хранение контекста, поиск по накопленным знаниям, экономия токенов. Но гораздо интереснее оказались комментарии. Под публикацией быстро возник спор, который на первый взгляд выглядел техническим. Одни утверждали:

    habr.com/ru/articles/1046944/

    #AI_Agents #Agent_Memory #LLM #Agentic_AI #Knowledge_Management #Context_Engineering #Longterm_Memory #Project_Memory #Retrieval_Systems #AI_Architecture

  35. Почему мы спорим о памяти для AI-агентов

    На днях наткнулся на статью про память для AI-агентов. Сама статья была вполне типичной: SQLite, хранение контекста, поиск по накопленным знаниям, экономия токенов. Но гораздо интереснее оказались комментарии. Под публикацией быстро возник спор, который на первый взгляд выглядел техническим. Одни утверждали:

    habr.com/ru/articles/1046944/

    #AI_Agents #Agent_Memory #LLM #Agentic_AI #Knowledge_Management #Context_Engineering #Longterm_Memory #Project_Memory #Retrieval_Systems #AI_Architecture

  36. Почему мы спорим о памяти для AI-агентов

    На днях наткнулся на статью про память для AI-агентов. Сама статья была вполне типичной: SQLite, хранение контекста, поиск по накопленным знаниям, экономия токенов. Но гораздо интереснее оказались комментарии. Под публикацией быстро возник спор, который на первый взгляд выглядел техническим. Одни утверждали:

    habr.com/ru/articles/1046944/

    #AI_Agents #Agent_Memory #LLM #Agentic_AI #Knowledge_Management #Context_Engineering #Longterm_Memory #Project_Memory #Retrieval_Systems #AI_Architecture

  37. Самая опасная ошибка AI‑агента — не плохой код

    За последний год вокруг AI-агентов сформировался довольно устойчивый набор ожиданий. Нам обещают всё более умные модели, всё более длинные контекстные окна, всё более автономных агентов. Создаётся впечатление, что осталось решить ещё пару технических проблем — и агент сможет самостоятельно разрабатывать сложные проекты почти без участия человека. Я тоже так думал.

    habr.com/ru/articles/1046920/

    #AI_Agents #LLM #Agentic_AI #Agent_Memory #AI_Governance #AI_Safety #Human_in_the_Loop #Context_Engineering #CapabilityBased_Security #Agent_Workflow

  38. Самая опасная ошибка AI‑агента — не плохой код

    За последний год вокруг AI-агентов сформировался довольно устойчивый набор ожиданий. Нам обещают всё более умные модели, всё более длинные контекстные окна, всё более автономных агентов. Создаётся впечатление, что осталось решить ещё пару технических проблем — и агент сможет самостоятельно разрабатывать сложные проекты почти без участия человека. Я тоже так думал.

    habr.com/ru/articles/1046920/

    #AI_Agents #LLM #Agentic_AI #Agent_Memory #AI_Governance #AI_Safety #Human_in_the_Loop #Context_Engineering #CapabilityBased_Security #Agent_Workflow

  39. Самая опасная ошибка AI‑агента — не плохой код

    За последний год вокруг AI-агентов сформировался довольно устойчивый набор ожиданий. Нам обещают всё более умные модели, всё более длинные контекстные окна, всё более автономных агентов. Создаётся впечатление, что осталось решить ещё пару технических проблем — и агент сможет самостоятельно разрабатывать сложные проекты почти без участия человека. Я тоже так думал.

    habr.com/ru/articles/1046920/

    #AI_Agents #LLM #Agentic_AI #Agent_Memory #AI_Governance #AI_Safety #Human_in_the_Loop #Context_Engineering #CapabilityBased_Security #Agent_Workflow

  40. Харнесс вокруг кодящего агента, или Как я создал собственного монстра

    Качество работы с кодящим агентом почти не зависит от того, какая под капотом модель. Я довольно долго в это не верил — менял модели, крутил промпты, ждал следующий релиз. А разница, оказалось, не в модели. Она в том, что вокруг модели: есть ли у агента память между сессиями, карта проекта, правила, руки и место под результат. Голая модель — это эрудит без рабочего места. Каждый разговор она начинает с чистого листа. Вот это всё вокруг модели — память, карта, правила, руки — и называется харнесс. Ниже — разбор моего харнесса целиком, слой за слоем, на одном реальном проекте: пять сервисов, Kubernetes, прод. Не идеальная схема из README, а то, что видно в логах: что реально вызывается каждый день, а что я нагородил и забыл. Спойлер: половина подключённых MCP-серверов за 98 сессий не вызвалась ни разу. Сразу оговорюсь: сессии сохранились не все — у Claude Code, похоже, есть ротация логов, часть истории потерялась. Так что мои числа — это нижняя граница, реальные ещё выше.

    habr.com/ru/articles/1045348/

    #claude_code #ииагенты_для_разработки #харнесс #context_engineering #agentic_coding

  41. Харнесс вокруг кодящего агента, или Как я создал собственного монстра

    Качество работы с кодящим агентом почти не зависит от того, какая под капотом модель. Я довольно долго в это не верил — менял модели, крутил промпты, ждал следующий релиз. А разница, оказалось, не в модели. Она в том, что вокруг модели: есть ли у агента память между сессиями, карта проекта, правила, руки и место под результат. Голая модель — это эрудит без рабочего места. Каждый разговор она начинает с чистого листа. Вот это всё вокруг модели — память, карта, правила, руки — и называется харнесс. Ниже — разбор моего харнесса целиком, слой за слоем, на одном реальном проекте: пять сервисов, Kubernetes, прод. Не идеальная схема из README, а то, что видно в логах: что реально вызывается каждый день, а что я нагородил и забыл. Спойлер: половина подключённых MCP-серверов за 98 сессий не вызвалась ни разу. Сразу оговорюсь: сессии сохранились не все — у Claude Code, похоже, есть ротация логов, часть истории потерялась. Так что мои числа — это нижняя граница, реальные ещё выше.

    habr.com/ru/articles/1045348/

    #claude_code #ииагенты_для_разработки #харнесс #context_engineering #agentic_coding

  42. Харнесс вокруг кодящего агента, или Как я создал собственного монстра

    Качество работы с кодящим агентом почти не зависит от того, какая под капотом модель. Я довольно долго в это не верил — менял модели, крутил промпты, ждал следующий релиз. А разница, оказалось, не в модели. Она в том, что вокруг модели: есть ли у агента память между сессиями, карта проекта, правила, руки и место под результат. Голая модель — это эрудит без рабочего места. Каждый разговор она начинает с чистого листа. Вот это всё вокруг модели — память, карта, правила, руки — и называется харнесс. Ниже — разбор моего харнесса целиком, слой за слоем, на одном реальном проекте: пять сервисов, Kubernetes, прод. Не идеальная схема из README, а то, что видно в логах: что реально вызывается каждый день, а что я нагородил и забыл. Спойлер: половина подключённых MCP-серверов за 98 сессий не вызвалась ни разу. Сразу оговорюсь: сессии сохранились не все — у Claude Code, похоже, есть ротация логов, часть истории потерялась. Так что мои числа — это нижняя граница, реальные ещё выше.

    habr.com/ru/articles/1045348/

    #claude_code #ииагенты_для_разработки #харнесс #context_engineering #agentic_coding

  43. Evals для чайников. Как тестировать AI-агента, чтобы понимать, где именно он ломается

    Большинство команд оценивают производительность AI-агентов через end-to-end метрики: success rate, количество токенов, tool usage, стоимость запроса, долю успешных задач. Это полезно для общего контроля ситуации, но почти бесполезно для реальной диагностики системы. Например, если success rate упал с 85% до 72%, то само по себе число не объясняет причину деградации. Команда вынуждена гадать, какая часть системы вдруг начала допускать ошибки. Сломался retrieval? Модель хуже начала выбирать инструменты? Контекст загрязняется после нескольких ходов? Или система уперлась в возможности base model? При росте проекта и увеличении сложности кодовой базы, сбои начинают расти мультипликативно – ошибки всех систем начинают перемножаться между собой. В конечном итоге, команда теряет реальный контроль. Проблему решает внедрение покомпонентных eval. Они дополняют end-to-end метрики, показывая, какой слой AI-агента работает, какой деградировал – и где именно искать причину. То есть внедрение evals помогает получать метрики производительности каждого компонента вашего агента.

    habr.com/ru/articles/1042924/

    #aiагенты #llm #rag #evals #orchestration #retrieval #tool_calling #context_engineering #production #ai_infrastructure

  44. Evals для чайников. Как тестировать AI-агента, чтобы понимать, где именно он ломается

    Большинство команд оценивают производительность AI-агентов через end-to-end метрики: success rate, количество токенов, tool usage, стоимость запроса, долю успешных задач. Это полезно для общего контроля ситуации, но почти бесполезно для реальной диагностики системы. Например, если success rate упал с 85% до 72%, то само по себе число не объясняет причину деградации. Команда вынуждена гадать, какая часть системы вдруг начала допускать ошибки. Сломался retrieval? Модель хуже начала выбирать инструменты? Контекст загрязняется после нескольких ходов? Или система уперлась в возможности base model? При росте проекта и увеличении сложности кодовой базы, сбои начинают расти мультипликативно – ошибки всех систем начинают перемножаться между собой. В конечном итоге, команда теряет реальный контроль. Проблему решает внедрение покомпонентных eval. Они дополняют end-to-end метрики, показывая, какой слой AI-агента работает, какой деградировал – и где именно искать причину. То есть внедрение evals помогает получать метрики производительности каждого компонента вашего агента.

    habr.com/ru/articles/1042924/

    #aiагенты #llm #rag #evals #orchestration #retrieval #tool_calling #context_engineering #production #ai_infrastructure

  45. Evals для чайников. Как тестировать AI-агента, чтобы понимать, где именно он ломается

    Большинство команд оценивают производительность AI-агентов через end-to-end метрики: success rate, количество токенов, tool usage, стоимость запроса, долю успешных задач. Это полезно для общего контроля ситуации, но почти бесполезно для реальной диагностики системы. Например, если success rate упал с 85% до 72%, то само по себе число не объясняет причину деградации. Команда вынуждена гадать, какая часть системы вдруг начала допускать ошибки. Сломался retrieval? Модель хуже начала выбирать инструменты? Контекст загрязняется после нескольких ходов? Или система уперлась в возможности base model? При росте проекта и увеличении сложности кодовой базы, сбои начинают расти мультипликативно – ошибки всех систем начинают перемножаться между собой. В конечном итоге, команда теряет реальный контроль. Проблему решает внедрение покомпонентных eval. Они дополняют end-to-end метрики, показывая, какой слой AI-агента работает, какой деградировал – и где именно искать причину. То есть внедрение evals помогает получать метрики производительности каждого компонента вашего агента.

    habr.com/ru/articles/1042924/

    #aiагенты #llm #rag #evals #orchestration #retrieval #tool_calling #context_engineering #production #ai_infrastructure

  46. Чем умнее модель, тем меньше ей нужно: четыре дисциплины production‑агента

    Если твой агент обвешан пошаговыми инструкциями и десятком узких инструментов под каждый шаг — он, скорее всего, работает хуже, чем мог бы. Звучит контр‑интуитивно, но это прямой вывод из инженерных постов Anthropic за последний год: чем умнее становится модель, тем сильнее прежняя обвязка её сдерживает. За год правила производства агентов пересобрались. Появилось семь отдельных дисциплин. Это первая из двух частей: здесь — четыре дисциплины‑фундамента, на которых держится рабочий агент, а не демка. И три из этих четырёх — не про то, что добавить, а про то, что убрать лишнее и довериться модели.

    habr.com/ru/articles/1042514/

    #AIагенты #productionагенты #context_engineering #инженерия_контекста #Anthropic #Claude #LLM #Agent_Skills #промптинжиниринг #tool_design

  47. Чем умнее модель, тем меньше ей нужно: четыре дисциплины production‑агента

    Если твой агент обвешан пошаговыми инструкциями и десятком узких инструментов под каждый шаг — он, скорее всего, работает хуже, чем мог бы. Звучит контр‑интуитивно, но это прямой вывод из инженерных постов Anthropic за последний год: чем умнее становится модель, тем сильнее прежняя обвязка её сдерживает. За год правила производства агентов пересобрались. Появилось семь отдельных дисциплин. Это первая из двух частей: здесь — четыре дисциплины‑фундамента, на которых держится рабочий агент, а не демка. И три из этих четырёх — не про то, что добавить, а про то, что убрать лишнее и довериться модели.

    habr.com/ru/articles/1042514/

    #AIагенты #productionагенты #context_engineering #инженерия_контекста #Anthropic #Claude #LLM #Agent_Skills #промптинжиниринг #tool_design

  48. Чем умнее модель, тем меньше ей нужно: четыре дисциплины production‑агента

    Если твой агент обвешан пошаговыми инструкциями и десятком узких инструментов под каждый шаг — он, скорее всего, работает хуже, чем мог бы. Звучит контр‑интуитивно, но это прямой вывод из инженерных постов Anthropic за последний год: чем умнее становится модель, тем сильнее прежняя обвязка её сдерживает. За год правила производства агентов пересобрались. Появилось семь отдельных дисциплин. Это первая из двух частей: здесь — четыре дисциплины‑фундамента, на которых держится рабочий агент, а не демка. И три из этих четырёх — не про то, что добавить, а про то, что убрать лишнее и довериться модели.

    habr.com/ru/articles/1042514/

    #AIагенты #productionагенты #context_engineering #инженерия_контекста #Anthropic #Claude #LLM #Agent_Skills #промптинжиниринг #tool_design

  49. Мультимодальность в ИИ-агентах: картинки на вход, картинки на выход и отказ от Multimodal RAG

    На связи Сергей Смирнов, AI-инженер и основатель LLMStart.ru. Сегодня разбираем мультимодальность в ИИ-агентах на реальном примере из продакшена. Мы проанализировали 258 диалогов нашего агента-консультанта по 1С и поняли: у входящих и исходящих картинок совершенно разная физика. Для входящих критично качество распознавания, а для исходящих — надежная доставка. В статье я подробно рассказываю, почему мы осознанно отказались от модного Multimodal RAG и как на самом деле нужно выбирать архитектуру под свои данные. Спойлер: экономить копейки на токенах — плохая идея, а усложнять систему стоит только тогда, когда это приносит реальные деньги.

    habr.com/ru/companies/llmstart

    #RAG #multimodal_RAG #мультимодальность #vision_LLM #imageonly #ColPali #CLIP #LLMагенты #LangChain #context_engineering

  50. Мультимодальность в ИИ-агентах: картинки на вход, картинки на выход и отказ от Multimodal RAG

    На связи Сергей Смирнов, AI-инженер и основатель LLMStart.ru. Сегодня разбираем мультимодальность в ИИ-агентах на реальном примере из продакшена. Мы проанализировали 258 диалогов нашего агента-консультанта по 1С и поняли: у входящих и исходящих картинок совершенно разная физика. Для входящих критично качество распознавания, а для исходящих — надежная доставка. В статье я подробно рассказываю, почему мы осознанно отказались от модного Multimodal RAG и как на самом деле нужно выбирать архитектуру под свои данные. Спойлер: экономить копейки на токенах — плохая идея, а усложнять систему стоит только тогда, когда это приносит реальные деньги.

    habr.com/ru/companies/llmstart

    #RAG #multimodal_RAG #мультимодальность #vision_LLM #imageonly #ColPali #CLIP #LLMагенты #LangChain #context_engineering

  51. Мультимодальность в ИИ-агентах: картинки на вход, картинки на выход и отказ от Multimodal RAG

    На связи Сергей Смирнов, AI-инженер и основатель LLMStart.ru. Сегодня разбираем мультимодальность в ИИ-агентах на реальном примере из продакшена. Мы проанализировали 258 диалогов нашего агента-консультанта по 1С и поняли: у входящих и исходящих картинок совершенно разная физика. Для входящих критично качество распознавания, а для исходящих — надежная доставка. В статье я подробно рассказываю, почему мы осознанно отказались от модного Multimodal RAG и как на самом деле нужно выбирать архитектуру под свои данные. Спойлер: экономить копейки на токенах — плохая идея, а усложнять систему стоит только тогда, когда это приносит реальные деньги.

    habr.com/ru/companies/llmstart

    #RAG #multimodal_RAG #мультимодальность #vision_LLM #imageonly #ColPali #CLIP #LLMагенты #LangChain #context_engineering

  52. Память на миллион, а толку ноль: как мы спасали ИИ-агента от «тупости»

    На связи Сергей Смирнов, AI-инженер и основатель LLMStart.ru. Сегодня разбираем горячую тему, на которой спотыкаются многие разработчики ботов — память нейросетей. У всех современных топовых моделей появились гигантские окна контекста — от миллиона токенов. Кажется, что теперь туда можно просто закинуть всю историю переписки, все корпоративные методички, и агент сам во всём разберётся или не разберётся?.. В статье разбираем реальный кейс — как мы управляем памятью ИИ-агента, чтобы он отвечал быстро, точно и не сжигал бюджет на токены впустую. Внутри — наглядные графики, три механизма очистки памяти и хитрый инженерный трюк с изолированным субагентом-аудитором.

    habr.com/ru/companies/llmstart

    #LangChain #ИИагенты #RAG #context_engineering #LLM #AIdriven_разработка #llmstart #контекстинжиниринг #production #productionready

  53. Память на миллион, а толку ноль: как мы спасали ИИ-агента от «тупости»

    На связи Сергей Смирнов, AI-инженер и основатель LLMStart.ru. Сегодня разбираем горячую тему, на которой спотыкаются многие разработчики ботов — память нейросетей. У всех современных топовых моделей появились гигантские окна контекста — от миллиона токенов. Кажется, что теперь туда можно просто закинуть всю историю переписки, все корпоративные методички, и агент сам во всём разберётся или не разберётся?.. В статье разбираем реальный кейс — как мы управляем памятью ИИ-агента, чтобы он отвечал быстро, точно и не сжигал бюджет на токены впустую. Внутри — наглядные графики, три механизма очистки памяти и хитрый инженерный трюк с изолированным субагентом-аудитором.

    habr.com/ru/companies/llmstart

    #LangChain #ИИагенты #RAG #context_engineering #LLM #AIdriven_разработка #llmstart #контекстинжиниринг #production #productionready

  54. Память на миллион, а толку ноль: как мы спасали ИИ-агента от «тупости»

    На связи Сергей Смирнов, AI-инженер и основатель LLMStart.ru. Сегодня разбираем горячую тему, на которой спотыкаются многие разработчики ботов — память нейросетей. У всех современных топовых моделей появились гигантские окна контекста — от миллиона токенов. Кажется, что теперь туда можно просто закинуть всю историю переписки, все корпоративные методички, и агент сам во всём разберётся или не разберётся?.. В статье разбираем реальный кейс — как мы управляем памятью ИИ-агента, чтобы он отвечал быстро, точно и не сжигал бюджет на токены впустую. Внутри — наглядные графики, три механизма очистки памяти и хитрый инженерный трюк с изолированным субагентом-аудитором.

    habr.com/ru/companies/llmstart

    #LangChain #ИИагенты #RAG #context_engineering #LLM #AIdriven_разработка #llmstart #контекстинжиниринг #production #productionready

  55. Почему ломается ваш AI-агент — и почему смена модели обычно его не чинит

    Представьте внутреннего AI-агента, который помогает компании искать общие документы и управлять ими. Он работает. До тех пор, пока 12–15% запросов не начинают падать. Агент возвращает не тот документ, редактирует не тот файл, молча падает или уверенно ссылается на файл, которого не существует. Поиск по фото отказывает с той же частотой. Ошибки размазаны равномерно по пользователям, фичам и запросам. Первое инстинктивное действие — поменять модель. Opus 4.5, GPT 5.5 или что там сейчас в топе лидерборда. Меняете. Счет за инференс растет в 4–5 раз, а общая доля ошибок снижается с 12% до 9%. Пользователи пишут о тех же проблемах. Бюджет следующего квартала сгорает за пару недель ради улучшения в 3 процентных пункта — и вы по-прежнему не понимаете, что именно было не так в системе и как улучшать ее дальше. Эта статья — о том, почему смена модели обычно разочаровывает и куда стоит смотреть в первую очередь. Большинство сбоев AI-систем живет в слое обвязки — orchestration, retrieval, tool definitions, retries, context management, — а не в самой модели. Дальше — метод, как отличить проблемы обвязки от проблем модели, кейс, в котором одно исправление в обвязке подняло completion rate с 26% до 88% без смены модели, и чек-лист, который помогает находить такие сбои в вашей собственной системе. Если вы никогда не делали подобной диагностики — ожидайте найти хотя бы один пункт, который стоит починить.

    habr.com/ru/articles/1039292/

    #aiагенты #llm #rag #orchestration #retrieval #tool_calling #context_engineering #evals #production #ai_infrastructure

  56. Почему ломается ваш AI-агент — и почему смена модели обычно его не чинит

    Представьте внутреннего AI-агента, который помогает компании искать общие документы и управлять ими. Он работает. До тех пор, пока 12–15% запросов не начинают падать. Агент возвращает не тот документ, редактирует не тот файл, молча падает или уверенно ссылается на файл, которого не существует. Поиск по фото отказывает с той же частотой. Ошибки размазаны равномерно по пользователям, фичам и запросам. Первое инстинктивное действие — поменять модель. Opus 4.5, GPT 5.5 или что там сейчас в топе лидерборда. Меняете. Счет за инференс растет в 4–5 раз, а общая доля ошибок снижается с 12% до 9%. Пользователи пишут о тех же проблемах. Бюджет следующего квартала сгорает за пару недель ради улучшения в 3 процентных пункта — и вы по-прежнему не понимаете, что именно было не так в системе и как улучшать ее дальше. Эта статья — о том, почему смена модели обычно разочаровывает и куда стоит смотреть в первую очередь. Большинство сбоев AI-систем живет в слое обвязки — orchestration, retrieval, tool definitions, retries, context management, — а не в самой модели. Дальше — метод, как отличить проблемы обвязки от проблем модели, кейс, в котором одно исправление в обвязке подняло completion rate с 26% до 88% без смены модели, и чек-лист, который помогает находить такие сбои в вашей собственной системе. Если вы никогда не делали подобной диагностики — ожидайте найти хотя бы один пункт, который стоит починить.

    habr.com/ru/articles/1039292/

    #aiагенты #llm #rag #orchestration #retrieval #tool_calling #context_engineering #evals #production #ai_infrastructure

  57. Почему ломается ваш AI-агент — и почему смена модели обычно его не чинит

    Представьте внутреннего AI-агента, который помогает компании искать общие документы и управлять ими. Он работает. До тех пор, пока 12–15% запросов не начинают падать. Агент возвращает не тот документ, редактирует не тот файл, молча падает или уверенно ссылается на файл, которого не существует. Поиск по фото отказывает с той же частотой. Ошибки размазаны равномерно по пользователям, фичам и запросам. Первое инстинктивное действие — поменять модель. Opus 4.5, GPT 5.5 или что там сейчас в топе лидерборда. Меняете. Счет за инференс растет в 4–5 раз, а общая доля ошибок снижается с 12% до 9%. Пользователи пишут о тех же проблемах. Бюджет следующего квартала сгорает за пару недель ради улучшения в 3 процентных пункта — и вы по-прежнему не понимаете, что именно было не так в системе и как улучшать ее дальше. Эта статья — о том, почему смена модели обычно разочаровывает и куда стоит смотреть в первую очередь. Большинство сбоев AI-систем живет в слое обвязки — orchestration, retrieval, tool definitions, retries, context management, — а не в самой модели. Дальше — метод, как отличить проблемы обвязки от проблем модели, кейс, в котором одно исправление в обвязке подняло completion rate с 26% до 88% без смены модели, и чек-лист, который помогает находить такие сбои в вашей собственной системе. Если вы никогда не делали подобной диагностики — ожидайте найти хотя бы один пункт, который стоит починить.

    habr.com/ru/articles/1039292/

    #aiагенты #llm #rag #orchestration #retrieval #tool_calling #context_engineering #evals #production #ai_infrastructure

  58. От RAG-прототипа к агенту в продакшн: путь по метрикам, а не по моде

    На связи Сергей Смирнов, AI-инженер LLMStart.ru. Сегодня расскажу о полноценном кейсе, который мы делали для компании Айтон: агенте-консультанте по 1С:УНФ, который помогает отвечать на вопросы клиентов по базе знаний, реальным диалогам поддержки и контексту конкретного обращения. Разберу всю хронологию, нюансы и путь от первой гипотезы до продакшена, которым уже пользуются клиенты. Для бизнеса этот кейс интересен как пример реальной автоматизации через ИИ: сначала ассистент для сотрудников, потом сервис для клиентов. Для технарей — подходом, где решение эволюционировало от RAG-прототипа к агенту на основании данных и метрик, а не потому, что «так модно».

    habr.com/ru/companies/llmstart

    #RAG #LLM #ИИагенты #LangChain #LangFuse #Ragas #метрики_качества #context_engineering #мультимодальность #ии

  59. От RAG-прототипа к агенту в продакшн: путь по метрикам, а не по моде

    На связи Сергей Смирнов, AI-инженер LLMStart.ru. Сегодня расскажу о полноценном кейсе, который мы делали для компании Айтон: агенте-консультанте по 1С:УНФ, который помогает отвечать на вопросы клиентов по базе знаний, реальным диалогам поддержки и контексту конкретного обращения. Разберу всю хронологию, нюансы и путь от первой гипотезы до продакшена, которым уже пользуются клиенты. Для бизнеса этот кейс интересен как пример реальной автоматизации через ИИ: сначала ассистент для сотрудников, потом сервис для клиентов. Для технарей — подходом, где решение эволюционировало от RAG-прототипа к агенту на основании данных и метрик, а не потому, что «так модно».

    habr.com/ru/companies/llmstart

    #RAG #LLM #ИИагенты #LangChain #LangFuse #Ragas #метрики_качества #context_engineering #мультимодальность #ии

  60. От RAG-прототипа к агенту в продакшн: путь по метрикам, а не по моде

    На связи Сергей Смирнов, AI-инженер LLMStart.ru. Сегодня расскажу о полноценном кейсе, который мы делали для компании Айтон: агенте-консультанте по 1С:УНФ, который помогает отвечать на вопросы клиентов по базе знаний, реальным диалогам поддержки и контексту конкретного обращения. Разберу всю хронологию, нюансы и путь от первой гипотезы до продакшена, которым уже пользуются клиенты. Для бизнеса этот кейс интересен как пример реальной автоматизации через ИИ: сначала ассистент для сотрудников, потом сервис для клиентов. Для технарей — подходом, где решение эволюционировало от RAG-прототипа к агенту на основании данных и метрик, а не потому, что «так модно».

    habr.com/ru/companies/llmstart

    #RAG #LLM #ИИагенты #LangChain #LangFuse #Ragas #метрики_качества #context_engineering #мультимодальность #ии