#agent_eval — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #agent_eval, aggregated by home.social.
-
[Перевод] Как оценить библиотеку для ИИ-агентов без слепой проверки финального ответа
ИИ-агент может вернуть правильную строку и при этом пройти к ней самым дорогим маршрутом: читать лишний код, угадывать API, падать на ошибках и заново собирать решение. Для разработчика библиотеки это уже не косметическая проблема, а новый слой качества инструмента. На примере transformers разбираемся, как устроить стенд оценки, который смотрит на путь агента: трейсы, токены, время, ошибки и поведенческие маркеры.
https://habr.com/ru/companies/otus/articles/1057418/
#ииагенты #бенчмарки #LLM #agent_eval #transformers #hugging_face #открытые_модели #CLI #оценка_инструментов #Skill
-
Как оценивать работу агентов
По мере стремительного развития агентных систем всё больше компаний — как крупных, так и небольших — рассматривают возможность интеграции агентов в свои рабочие процессы. Неудивительно, что многие лица, принимающие решения в этих компаниях, относятся к надёжности агентов с изрядной долей здорового скептицизма. Против недобросовестного сотрудника можно применить дисциплинарные взыскания и другие меры, но что делать с недобросовестным ИИ?
https://habr.com/ru/companies/raft/articles/1028832/
#evals #agentic_evaluation #ai_evaluation #agent_eval #ai_evals