home.social

#ai_evals — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #ai_evals, aggregated by home.social.

fetched live
  1. RAG без магии: что действительно влияет на качество системы

    У большинства разработчиков, не работающих с ИИ, ментальная модель RAG либо ошибочна, либо опасно неполна. И дело не в том, что они плохие инженеры, — просто почти всё, что написано про RAG, это либо десятиминутный туториал по фреймворку, за которым не видно ни одного реального решения, либо научная статья для тех, кто и так занимается этим профессионально. Между этими крайностями почти ничего нет. Эта статья — как раз то, что между ними. Недавно я собрал продакшн-систему RAG поверх 62 книг по античной истории (~46 000 чанков) и проверил каждое проектное решение на фиксированном тестовом наборе — включая те решения, которые не сработали. Я пропущу маркетинг фреймворков и расскажу о тех немногих вещах, которые действительно определяют, можно ли доверять вашей RAG-системе, — и подкреплю всё цифрами. Всем привет, меня зовут Лев Рябов, я фронтенд-разработчик в М2 Tech. После прочтения этой статьи вы поймете, что чтобы во всём разобраться, знания ML не нужны. Если вы умеете писать REST API и делать запросы к PostgreSQL, вы сможете построить всё, что здесь описано.

    habr.com/ru/companies/m2tech/a

    #rag #ai #aiагенты #typescript #pgvector #evaluation #ai_evaluation #ai_evals

  2. Как оценивать работу агентов

    По мере стремительного развития агентных систем всё больше компаний — как крупных, так и небольших — рассматривают возможность интеграции агентов в свои рабочие процессы. Неудивительно, что многие лица, принимающие решения в этих компаниях, относятся к надёжности агентов с изрядной долей здорового скептицизма. Против недобросовестного сотрудника можно применить дисциплинарные взыскания и другие меры, но что делать с недобросовестным ИИ?

    habr.com/ru/companies/raft/art

    #evals #agentic_evaluation #ai_evaluation #agent_eval #ai_evals

  3. [Перевод] Руководство по созданию системы оценки качества AI

    Как создать трехуровневую систему оценки качества работы AI, которая ускорит разработку Основываясь на кейсах 30+ проектов, с примерами и шаблонами

    habr.com/ru/articles/905070/

    #искусственный_интеллект #AI_Evals #продактменеджмент #разработка #llm #тестирование #качество #итерации #finetuning #метрики