#ai_evals — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #ai_evals, aggregated by home.social.
-
RAG без магии: что действительно влияет на качество системы
У большинства разработчиков, не работающих с ИИ, ментальная модель RAG либо ошибочна, либо опасно неполна. И дело не в том, что они плохие инженеры, — просто почти всё, что написано про RAG, это либо десятиминутный туториал по фреймворку, за которым не видно ни одного реального решения, либо научная статья для тех, кто и так занимается этим профессионально. Между этими крайностями почти ничего нет. Эта статья — как раз то, что между ними. Недавно я собрал продакшн-систему RAG поверх 62 книг по античной истории (~46 000 чанков) и проверил каждое проектное решение на фиксированном тестовом наборе — включая те решения, которые не сработали. Я пропущу маркетинг фреймворков и расскажу о тех немногих вещах, которые действительно определяют, можно ли доверять вашей RAG-системе, — и подкреплю всё цифрами. Всем привет, меня зовут Лев Рябов, я фронтенд-разработчик в М2 Tech. После прочтения этой статьи вы поймете, что чтобы во всём разобраться, знания ML не нужны. Если вы умеете писать REST API и делать запросы к PostgreSQL, вы сможете построить всё, что здесь описано.
https://habr.com/ru/companies/m2tech/articles/1070598/
#rag #ai #aiагенты #typescript #pgvector #evaluation #ai_evaluation #ai_evals
-
Как оценивать работу агентов
По мере стремительного развития агентных систем всё больше компаний — как крупных, так и небольших — рассматривают возможность интеграции агентов в свои рабочие процессы. Неудивительно, что многие лица, принимающие решения в этих компаниях, относятся к надёжности агентов с изрядной долей здорового скептицизма. Против недобросовестного сотрудника можно применить дисциплинарные взыскания и другие меры, но что делать с недобросовестным ИИ?
https://habr.com/ru/companies/raft/articles/1028832/
#evals #agentic_evaluation #ai_evaluation #agent_eval #ai_evals
-
[Перевод] Руководство по созданию системы оценки качества AI
Как создать трехуровневую систему оценки качества работы AI, которая ускорит разработку Основываясь на кейсах 30+ проектов, с примерами и шаблонами
https://habr.com/ru/articles/905070/
#искусственный_интеллект #AI_Evals #продактменеджмент #разработка #llm #тестирование #качество #итерации #finetuning #метрики