home.social

#llmasajudge — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #llmasajudge, aggregated by home.social.

fetched live
  1. ИИ-агент вместо тестировщика: 20 копеек за диалог и причина, почему вас не заменит llm

    Привет, Хабр! Меня зовут Никита Хробостов, я QA-инженер в Just AI. Тестирую диалоговые системы: чат-ботов и голосовых ботов, часть из них с обращениями в RAG. Моя работа устроена так: беру схему диалога на Холсте, примеряю на себя роль клиента и последовательно прохожу сценарий. Задаю вопрос и проверяю ответ, соглашаюсь — смотрю, правильно ли сработал переход, отказываюсь — проверяю фолбэк. Так приходится проходить десятки сценариев, которые в крупном проекте быстро складываются в большой объем ручной работы. Чтобы было понятно про объемы. На проекте голосового бота у нас 13 активных сценариев, на чат-боте один. Чтобы проверить один сценарий целиком, нужно от 40 до сотни с лишним звонков, а тест-кейсов при этом в два-четыре раза больше: зависит от дизайна. На полную проверку одного небольшого сценария уходит 5–6 часов. Проблема не столько в количестве тестов, сколько в том, что человек, который прогоняет пятидесятый тест-кейс за день, начинает говорить как автомат: короткими шаблонными фразами, потому что держит в голове покрытие, а не естественность речи. А реальный пользователь говорит совсем иначе. Именно на естественной речи NLU-часть и разваливается, и именно эти баги проще всего пропустить. Идея автоматизировать эту работу с помощью ИИ-агента появилась давно. Расскажу, как я подходил к ней дважды. Во второй раз собрал за один день работающий прототип, который уже находит баги. Материал получился максимально искренним и честным: с цифрами, с провалами и с местами, где решение до сих пор не доделано.

    habr.com/ru/companies/just_ai/

    #llm #тестирование #qa #автоматизация_тестирования #чатботы #голосовые_боты #nlu #llmasajudge #codex

  2. 7 ошибок в оценке качества LLM‑систем в продакшене

    LLM‑фича может месяцами показывать хорошие метрики и при этом регулярно ошибаться на реальных запросах. В статье разберём 7 типичных провалов в оценке качества LLM‑систем: где ломаются эвалы, почему врут дашборды и как выстроить контроль, которому можно доверять в продакшене. Найти ошибки

    habr.com/ru/companies/otus/art

    #LLM #оценка_качества_LLM #LLM_evaluation #LLMasaJudge #наблюдаемость #OpenTelemetry #трассировка #продакшен #метрики_качества #тестирование_LLM

  3. LLM-судье нельзя верить на слово: как построить надёжный гейт и проверить сами тесты

    Как перестать доверять LLM-судье на слово и построить безопасную двухконтурную систему оценки? Внутри статьи: Архитектурный паттерн сдерживания: почему у классической нормализации должно быть право вето. CI-инварианты: как ловить галлюцинации моделей с помощью враждебных фикстур в grounded-judge-gate . Разбор факапов: три реальных бага проектирования, которые едва не увели систему в ложноположительное пике.

    habr.com/ru/articles/1062614/

    #LLM #LLMasajudge #LLMOps #Python #тестирование #валидация_моделей #архитектура_систем #каппа_Коэна #качество_данных

  4. Детектор был прав, разметка врала: как мы искали слепую зону LLM-судей и нашли ошибки в эталоне

    Мы собрали training‑free детектор галлюцинаций из шести готовых языковых моделей, получили хорошие метрики и наткнулись на красивую загадку: группу примеров, которые все судьи единогласно считали корректными, хотя эталонная разметка помечала их как галлюцинации. На первый взгляд это выглядело как универсальная слепая зона LLM‑as‑judge — переносимый и потенциально важный результат. Однако собственная процедура проверки показала обратное: большей части этих меток не удалось пройти сверку с первоисточником. Судьи всё это время были правы. Эта статья не столько о детекторе и не о предполагаемой слепой зоне, сколько о процедуре проверки, которая в итоге поймала нас самих.

    habr.com/ru/articles/1057056/

    #LLM #RAG #LLMasaJudge #RAGTruth #Hallucination_Detection #AI_Evaluation #Галлюцинации_LLM #Генеративный_ИИ #NLP #Machine_Learning

  5. Гибель богов. Fable и ещё 10 LLM реорганизуют код. Сравнение

    Это подробный разбор одного эксперимента. Я взял god node из реального LangGraph агента и попросил 5 американских и 6 китайских моделей сначала предложить, как её распутать, а потом оценить предложения друг друга. Дальше тремя разными способами пытался понять, кому из них в этом деле верить.

    habr.com/ru/articles/1055740/

    #LLM #LangGraph #ИИагенты #рефакторинг #нейросети #DeepSeek #Fable #LLMasajudge #архитектура_ПО #бенчмарки_LLM

  6. Собрал ИИ-бенчмарк под себя из 2 месяцев своих сессий — и дорогие модели проиграли дешёвым

    Два месяца своих сессий с ИИ скормил скрипту и собрал бенчмарк под СВОЮ работу — не под чужой лидерборд. Результат: тройка «лучших открытых моделей» сжалась в ничью, а в практике победила модель в 37 раз дешевле — потому что отвечает мгновенно, а 744B-гигант думает 22 секунды до первого слова. Важным оказался не балл, а телеметрия, которую балл прячет.

    habr.com/ru/articles/1051296/

    #llm #benchmark #llmasajudge #gemma #glm #selfhosting

  7. LLM-судья для нейроразбора резюме на hh

    Создать LLM-судью легко. Гораздо сложнее сделать так, чтобы его оценкам можно было доверять. Мы убедились в этом на практике при разработке нейроразбора резюме для ИИ-помощника hh.ru . Быстро выяснилось, что хороший LLM-судья — это отдельный продукт со своими рубриками, датасетами, метриками качества и стоимостью эксплуатации. Меня зовут Женя Орлов, я LLM Eval Lead. В этой статье расскажу, как мы проектировали систему оценки для нейроразбора резюме, почему отказались от наивных подходов и какие выводы сделали по ходу разработки.

    habr.com/ru/companies/hh/artic

    #llm #llmархитектура #llmasajudge #llmasjudge #ai #ai_quality #quality_assurance

  8. LongConspectWriter: автоматическая генерация структурированных конспектов лекций на потребительском GPU

    Автоматическая генерация структурированных академических конспектов из аудиозаписей лекций по точным и естественным наукам затруднена для локальных малых языковых моделей (small language models, SLM). Транскрипт лекции продолжительностью ≈1,5 ч составляет около 15–20 тыс. токенов и формально умещается в контекстное окно современных локальных SLM, однако при обработке такого контекста single-call SLM систематически деградируют: теряют фрагменты из середины последовательности, не удерживают структуру и галлюцинируют термины и формулы. Это проявление эффекта Lost in the Middle : точность извлечения информации описывает U-образную кривую — высока на краях контекста и падает в середине; в наших условиях используются SLM, поведение которых так же описано в статье, и оно характеризуется выраженным забыванием не только из середины, но также и из начала контекста. Более того, на бюджете 8 ГБ VRAM single-call длинного транскрипта практически неприменим*, что делает декомпозицию не оптимизацией, а необходимым условием работоспособности.

    habr.com/ru/articles/1049640/

    #LLM #локальные_LLM #llamacpp #квантизация #суммаризация_текста #длинный_контекст #мультиагентные_системы #семантическая_кластеризация #LLMasajudge #конспекты_лекций

  9. [Перевод] Месть дата-сайентиста: почему LLM не отменили нашу профессию

    LLM упростили запуск AI-функций до нескольких вызовов API, и дата-сайентисты будто бы выпали из критического пути. На практике именно здесь начинаются самые дорогие ошибки: команды берут готовые метрики, доверяют LLM-судьям и строят evals на синтетике, которая не похожа на прод. В статье — пять типичных ловушек современной AI-разработки и разбор того, почему умение смотреть в данные снова становится ключевой инженерной компетенцией. Разобрать ловушки

    habr.com/ru/companies/otus/art

    #harness #Data_Science #датасайентист #оценка_моделей #llm #llmasajudge #метрики_качества #анализ_ошибок #разметка_данных #mlops

  10. Pollux: LLM-as-a-judge для русского

    Прошло несколько лет с тех пор, как нейросетевые модели стали применимы в генерации текста. Сегодня языковые модели уверенно решают задачи написания кода, поддержки диалогов и планирования маршрутов. Тем не менее, до сих пор не сложилось универсального подхода для валидации LLM перед их внедрением в цифровые продукты. Но у нас есть решение! В этой статье я расскажу, как мы в Sber AI обучили специализированного LLM-судью (LLM-as-a-Judge) Pollux для оценки русскоязычных LLM. Мы выложили его в открытый доступ и вы можете встроить его в свой продукт уже сегодня. Читать далее и оценивать

    habr.com/ru/companies/sberbank

    #llmагент #llmмодели #llm #llmasajudge #rag #метрики_продукта