home.social

#ai_evaluation — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #ai_evaluation, aggregated by home.social.

fetched live
  1. RAG без магии: что действительно влияет на качество системы

    У большинства разработчиков, не работающих с ИИ, ментальная модель RAG либо ошибочна, либо опасно неполна. И дело не в том, что они плохие инженеры, — просто почти всё, что написано про RAG, это либо десятиминутный туториал по фреймворку, за которым не видно ни одного реального решения, либо научная статья для тех, кто и так занимается этим профессионально. Между этими крайностями почти ничего нет. Эта статья — как раз то, что между ними. Недавно я собрал продакшн-систему RAG поверх 62 книг по античной истории (~46 000 чанков) и проверил каждое проектное решение на фиксированном тестовом наборе — включая те решения, которые не сработали. Я пропущу маркетинг фреймворков и расскажу о тех немногих вещах, которые действительно определяют, можно ли доверять вашей RAG-системе, — и подкреплю всё цифрами. Всем привет, меня зовут Лев Рябов, я фронтенд-разработчик в М2 Tech. После прочтения этой статьи вы поймете, что чтобы во всём разобраться, знания ML не нужны. Если вы умеете писать REST API и делать запросы к PostgreSQL, вы сможете построить всё, что здесь описано.

    habr.com/ru/companies/m2tech/a

    #rag #ai #aiагенты #typescript #pgvector #evaluation #ai_evaluation #ai_evals

  2. RAG без магии: что действительно влияет на качество системы

    У большинства разработчиков, не работающих с ИИ, ментальная модель RAG либо ошибочна, либо опасно неполна. И дело не в том, что они плохие инженеры, — просто почти всё, что написано про RAG, это либо десятиминутный туториал по фреймворку, за которым не видно ни одного реального решения, либо научная статья для тех, кто и так занимается этим профессионально. Между этими крайностями почти ничего нет. Эта статья — как раз то, что между ними. Недавно я собрал продакшн-систему RAG поверх 62 книг по античной истории (~46 000 чанков) и проверил каждое проектное решение на фиксированном тестовом наборе — включая те решения, которые не сработали. Я пропущу маркетинг фреймворков и расскажу о тех немногих вещах, которые действительно определяют, можно ли доверять вашей RAG-системе, — и подкреплю всё цифрами. Всем привет, меня зовут Лев Рябов, я фронтенд-разработчик в М2 Tech. После прочтения этой статьи вы поймете, что чтобы во всём разобраться, знания ML не нужны. Если вы умеете писать REST API и делать запросы к PostgreSQL, вы сможете построить всё, что здесь описано.

    habr.com/ru/companies/m2tech/a

    #rag #ai #aiагенты #typescript #pgvector #evaluation #ai_evaluation #ai_evals

  3. RAG без магии: что действительно влияет на качество системы

    У большинства разработчиков, не работающих с ИИ, ментальная модель RAG либо ошибочна, либо опасно неполна. И дело не в том, что они плохие инженеры, — просто почти всё, что написано про RAG, это либо десятиминутный туториал по фреймворку, за которым не видно ни одного реального решения, либо научная статья для тех, кто и так занимается этим профессионально. Между этими крайностями почти ничего нет. Эта статья — как раз то, что между ними. Недавно я собрал продакшн-систему RAG поверх 62 книг по античной истории (~46 000 чанков) и проверил каждое проектное решение на фиксированном тестовом наборе — включая те решения, которые не сработали. Я пропущу маркетинг фреймворков и расскажу о тех немногих вещах, которые действительно определяют, можно ли доверять вашей RAG-системе, — и подкреплю всё цифрами. Всем привет, меня зовут Лев Рябов, я фронтенд-разработчик в М2 Tech. После прочтения этой статьи вы поймете, что чтобы во всём разобраться, знания ML не нужны. Если вы умеете писать REST API и делать запросы к PostgreSQL, вы сможете построить всё, что здесь описано.

    habr.com/ru/companies/m2tech/a

    #rag #ai #aiагенты #typescript #pgvector #evaluation #ai_evaluation #ai_evals

  4. Детектор был прав, разметка врала: как мы искали слепую зону LLM-судей и нашли ошибки в эталоне

    Мы собрали training‑free детектор галлюцинаций из шести готовых языковых моделей, получили хорошие метрики и наткнулись на красивую загадку: группу примеров, которые все судьи единогласно считали корректными, хотя эталонная разметка помечала их как галлюцинации. На первый взгляд это выглядело как универсальная слепая зона LLM‑as‑judge — переносимый и потенциально важный результат. Однако собственная процедура проверки показала обратное: большей части этих меток не удалось пройти сверку с первоисточником. Судьи всё это время были правы. Эта статья не столько о детекторе и не о предполагаемой слепой зоне, сколько о процедуре проверки, которая в итоге поймала нас самих.

    habr.com/ru/articles/1057056/

    #LLM #RAG #LLMasaJudge #RAGTruth #Hallucination_Detection #AI_Evaluation #Галлюцинации_LLM #Генеративный_ИИ #NLP #Machine_Learning

  5. Детектор был прав, разметка врала: как мы искали слепую зону LLM-судей и нашли ошибки в эталоне

    Мы собрали training‑free детектор галлюцинаций из шести готовых языковых моделей, получили хорошие метрики и наткнулись на красивую загадку: группу примеров, которые все судьи единогласно считали корректными, хотя эталонная разметка помечала их как галлюцинации. На первый взгляд это выглядело как универсальная слепая зона LLM‑as‑judge — переносимый и потенциально важный результат. Однако собственная процедура проверки показала обратное: большей части этих меток не удалось пройти сверку с первоисточником. Судьи всё это время были правы. Эта статья не столько о детекторе и не о предполагаемой слепой зоне, сколько о процедуре проверки, которая в итоге поймала нас самих.

    habr.com/ru/articles/1057056/

    #LLM #RAG #LLMasaJudge #RAGTruth #Hallucination_Detection #AI_Evaluation #Галлюцинации_LLM #Генеративный_ИИ #NLP #Machine_Learning

  6. Детектор был прав, разметка врала: как мы искали слепую зону LLM-судей и нашли ошибки в эталоне

    Мы собрали training‑free детектор галлюцинаций из шести готовых языковых моделей, получили хорошие метрики и наткнулись на красивую загадку: группу примеров, которые все судьи единогласно считали корректными, хотя эталонная разметка помечала их как галлюцинации. На первый взгляд это выглядело как универсальная слепая зона LLM‑as‑judge — переносимый и потенциально важный результат. Однако собственная процедура проверки показала обратное: большей части этих меток не удалось пройти сверку с первоисточником. Судьи всё это время были правы. Эта статья не столько о детекторе и не о предполагаемой слепой зоне, сколько о процедуре проверки, которая в итоге поймала нас самих.

    habr.com/ru/articles/1057056/

    #LLM #RAG #LLMasaJudge #RAGTruth #Hallucination_Detection #AI_Evaluation #Галлюцинации_LLM #Генеративный_ИИ #NLP #Machine_Learning

  7. Harness Bench: как оценить агентский harness и выбрать связку с моделью

    Привет! Я Андрей Иванов, NLP-исследователь в R&D-лаборатории red_mad_robot. Когда мы собираем AI-агента, первым делом выбираем модель под задачу. Но в реальном приложении она не работает в одиночку, ей нужен агентский harness — программная обвязка. Поэтому выбирать приходится не просто модель, а связку «модель + harness». Чтобы делать этот выбор осознанно, мы создали Harness Bench — открытый фреймворк, который тестирует связки на реальных задачах в одинаковых условиях. В статье расскажу, как он устроен, разберу баги опенсорсных обвязок, которые ломают автоматический прогон, а потом покажу на цифрах, как смена harness влияет на способности одной и той же модели.

    habr.com/ru/companies/redmadro

    #aiагенты #agent_harness #llm #mcp #ai_evaluation #harness #benchmark

  8. Harness Bench: как оценить агентский harness и выбрать связку с моделью

    Привет! Я Андрей Иванов, NLP-исследователь в R&D-лаборатории red_mad_robot. Когда мы собираем AI-агента, первым делом выбираем модель под задачу. Но в реальном приложении она не работает в одиночку, ей нужен агентский harness — программная обвязка. Поэтому выбирать приходится не просто модель, а связку «модель + harness». Чтобы делать этот выбор осознанно, мы создали Harness Bench — открытый фреймворк, который тестирует связки на реальных задачах в одинаковых условиях. В статье расскажу, как он устроен, разберу баги опенсорсных обвязок, которые ломают автоматический прогон, а потом покажу на цифрах, как смена harness влияет на способности одной и той же модели.

    habr.com/ru/companies/redmadro

    #aiагенты #agent_harness #llm #mcp #ai_evaluation #harness #benchmark

  9. Harness Bench: как оценить агентский harness и выбрать связку с моделью

    Привет! Я Андрей Иванов, NLP-исследователь в R&D-лаборатории red_mad_robot. Когда мы собираем AI-агента, первым делом выбираем модель под задачу. Но в реальном приложении она не работает в одиночку, ей нужен агентский harness — программная обвязка. Поэтому выбирать приходится не просто модель, а связку «модель + harness». Чтобы делать этот выбор осознанно, мы создали Harness Bench — открытый фреймворк, который тестирует связки на реальных задачах в одинаковых условиях. В статье расскажу, как он устроен, разберу баги опенсорсных обвязок, которые ломают автоматический прогон, а потом покажу на цифрах, как смена harness влияет на способности одной и той же модели.

    habr.com/ru/companies/redmadro

    #aiагенты #agent_harness #llm #mcp #ai_evaluation #harness #benchmark

  10. Как оценивать работу агентов

    По мере стремительного развития агентных систем всё больше компаний — как крупных, так и небольших — рассматривают возможность интеграции агентов в свои рабочие процессы. Неудивительно, что многие лица, принимающие решения в этих компаниях, относятся к надёжности агентов с изрядной долей здорового скептицизма. Против недобросовестного сотрудника можно применить дисциплинарные взыскания и другие меры, но что делать с недобросовестным ИИ?

    habr.com/ru/companies/raft/art

    #evals #agentic_evaluation #ai_evaluation #agent_eval #ai_evals

  11. Как оценивать работу агентов

    По мере стремительного развития агентных систем всё больше компаний — как крупных, так и небольших — рассматривают возможность интеграции агентов в свои рабочие процессы. Неудивительно, что многие лица, принимающие решения в этих компаниях, относятся к надёжности агентов с изрядной долей здорового скептицизма. Против недобросовестного сотрудника можно применить дисциплинарные взыскания и другие меры, но что делать с недобросовестным ИИ?

    habr.com/ru/companies/raft/art

    #evals #agentic_evaluation #ai_evaluation #agent_eval #ai_evals

  12. Как оценивать работу агентов

    По мере стремительного развития агентных систем всё больше компаний — как крупных, так и небольших — рассматривают возможность интеграции агентов в свои рабочие процессы. Неудивительно, что многие лица, принимающие решения в этих компаниях, относятся к надёжности агентов с изрядной долей здорового скептицизма. Против недобросовестного сотрудника можно применить дисциплинарные взыскания и другие меры, но что делать с недобросовестным ИИ?

    habr.com/ru/companies/raft/art

    #evals #agentic_evaluation #ai_evaluation #agent_eval #ai_evals

  13. Почему ваше AI-решение не окупается. Фреймворк OpenAI, который все пропустили

    OpenAI опубликовали фреймворк, на который мало кто обратил внимание. Исследование OpenAI (да и не только их) показало: компании внедряют ИИ, но часть из них не получает ожидаемого эффекта. В этом фреймворке на мой взгляд обозначены принципы отделяющие посредственные решения от тех которые делают внедрение AI в бизнес эффективным. openai.com/index/evals-drive-n KPI и OKR остаются бизнес-целями. Evals — метрики, которые показывают, как AI помогает достигать целей. Либо evals становятся частью KPI, либо контролируют качество AI, который двигает показатели вверх. Это нужно, если бизнесу важны: - Понятный путь к окупаемости (ROI) - Свести критические ошибки к минимуму - Предсказуемость результатов для клиентов - AI, который выдерживает рост нагрузки без сбоев Evals – конкурентное преимущество. Промпты скопируют, архитектуру evals – нет. Это скрытый слой, который недоступен ни поставщикам моделей, ни конкурентам.Evals гарантируют стабильность при обновлениях промптов, переходе на другие модели или архитектуру. Так AI-решение постоянно улучшается под задачи бизнеса не теряя в качестве. Фреймворк OpenAI из 3 шагов: 1. Определение – превратите размытые цели в конкретные: "Конвертировать письма компаний с бюджетом 100K+ в демо, сохраняя стиль бренда" 2. Измерение – тестируйте на клиентских запросах и пограничных случаях 3. Улучшение – развивайте на основе результатов тестов, а не надейтесь на удачу Для этого процесса создали BotMetrica.com – слой надёжности, который делает AI готовым к промышленному использованию. В ближайшие дни поделюсь тем, как BotMetrica формализует каждый шаг этого процесса с конкретными примерами. "Don't hope for 'great.' Specify it, measure it, and improve toward it" / "Не полагайтесь на удачу. Определите 'отличное', измерьте и улучшайте" – OpenAI Пишите в личку – отвечу на вопросы и покажу сервис: @ovashchukov или на [email protected]

    habr.com/ru/articles/971432/

    #AI #evals #OpenAI #метрики #KPI #ROI #LLM #prompt_engineering #AI_evaluation #testing

  14. Почему ваше AI-решение не окупается. Фреймворк OpenAI, который все пропустили

    OpenAI опубликовали фреймворк, на который мало кто обратил внимание. Исследование OpenAI (да и не только их) показало: компании внедряют ИИ, но часть из них не получает ожидаемого эффекта. В этом фреймворке на мой взгляд обозначены принципы отделяющие посредственные решения от тех которые делают внедрение AI в бизнес эффективным. openai.com/index/evals-drive-n KPI и OKR остаются бизнес-целями. Evals — метрики, которые показывают, как AI помогает достигать целей. Либо evals становятся частью KPI, либо контролируют качество AI, который двигает показатели вверх. Это нужно, если бизнесу важны: - Понятный путь к окупаемости (ROI) - Свести критические ошибки к минимуму - Предсказуемость результатов для клиентов - AI, который выдерживает рост нагрузки без сбоев Evals – конкурентное преимущество. Промпты скопируют, архитектуру evals – нет. Это скрытый слой, который недоступен ни поставщикам моделей, ни конкурентам.Evals гарантируют стабильность при обновлениях промптов, переходе на другие модели или архитектуру. Так AI-решение постоянно улучшается под задачи бизнеса не теряя в качестве. Фреймворк OpenAI из 3 шагов: 1. Определение – превратите размытые цели в конкретные: "Конвертировать письма компаний с бюджетом 100K+ в демо, сохраняя стиль бренда" 2. Измерение – тестируйте на клиентских запросах и пограничных случаях 3. Улучшение – развивайте на основе результатов тестов, а не надейтесь на удачу Для этого процесса создали BotMetrica.com – слой надёжности, который делает AI готовым к промышленному использованию. В ближайшие дни поделюсь тем, как BotMetrica формализует каждый шаг этого процесса с конкретными примерами. "Don't hope for 'great.' Specify it, measure it, and improve toward it" / "Не полагайтесь на удачу. Определите 'отличное', измерьте и улучшайте" – OpenAI Пишите в личку – отвечу на вопросы и покажу сервис: @ovashchukov или на [email protected]

    habr.com/ru/articles/971432/

    #AI #evals #OpenAI #метрики #KPI #ROI #LLM #prompt_engineering #AI_evaluation #testing

  15. Почему ваше AI-решение не окупается. Фреймворк OpenAI, который все пропустили

    OpenAI опубликовали фреймворк, на который мало кто обратил внимание. Исследование OpenAI (да и не только их) показало: компании внедряют ИИ, но часть из них не получает ожидаемого эффекта. В этом фреймворке на мой взгляд обозначены принципы отделяющие посредственные решения от тех которые делают внедрение AI в бизнес эффективным. openai.com/index/evals-drive-n KPI и OKR остаются бизнес-целями. Evals — метрики, которые показывают, как AI помогает достигать целей. Либо evals становятся частью KPI, либо контролируют качество AI, который двигает показатели вверх. Это нужно, если бизнесу важны: - Понятный путь к окупаемости (ROI) - Свести критические ошибки к минимуму - Предсказуемость результатов для клиентов - AI, который выдерживает рост нагрузки без сбоев Evals – конкурентное преимущество. Промпты скопируют, архитектуру evals – нет. Это скрытый слой, который недоступен ни поставщикам моделей, ни конкурентам.Evals гарантируют стабильность при обновлениях промптов, переходе на другие модели или архитектуру. Так AI-решение постоянно улучшается под задачи бизнеса не теряя в качестве. Фреймворк OpenAI из 3 шагов: 1. Определение – превратите размытые цели в конкретные: "Конвертировать письма компаний с бюджетом 100K+ в демо, сохраняя стиль бренда" 2. Измерение – тестируйте на клиентских запросах и пограничных случаях 3. Улучшение – развивайте на основе результатов тестов, а не надейтесь на удачу Для этого процесса создали BotMetrica.com – слой надёжности, который делает AI готовым к промышленному использованию. В ближайшие дни поделюсь тем, как BotMetrica формализует каждый шаг этого процесса с конкретными примерами. "Don't hope for 'great.' Specify it, measure it, and improve toward it" / "Не полагайтесь на удачу. Определите 'отличное', измерьте и улучшайте" – OpenAI Пишите в личку – отвечу на вопросы и покажу сервис: @ovashchukov или на [email protected]

    habr.com/ru/articles/971432/

    #AI #evals #OpenAI #метрики #KPI #ROI #LLM #prompt_engineering #AI_evaluation #testing