home.social

#production_ai — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #production_ai, aggregated by home.social.

fetched live
  1. ОК или НеОК: как мы строили LLM‑судью и дважды меняли формулу вердикта

    У нашего AI‑агента поддержки было десять метрик и ноль ответов на главный вопрос: какую долю обращений он решает? Судья, который читал только текст диалога, ставил 18/20, а проверка по реальным вызовам инструментов давала 8/20. Текстовые проверки считали правдоподобный ответ верным и не могли отличить его от подтвержденного. Самодельный «процент фантомных эскалаций» оказался измерением того, насколько слова бота согласованы с его же внутренними флагами. Каждая метрика что‑то измеряла, и ничего продуктового Тогда мы решили: оценка качества станет отдельным сервисом с собственным источником истины. В этой статье два переписывания формулы вердикта, несколько пойманных слепот и один эталонный набор, который учил нас доверять неправильным ошибкам.

    habr.com/ru/articles/1071782/

    #LLM_Judge #AIагенты #оценка_AIсистем #evals #RAG #tool_calling #golden_set #каппа_Коэна #production_AI