home.social

#eval — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #eval, aggregated by home.social.

fetched live
  1. Как мы строили eval и автоматизировали оптимизацию AI-агента для умного помощника

    Привет! Меня зовут Алексей, я разработчик в Битрикс24. В первой части рассказывал про retrieval-часть нашего RAG для AI-помощника Марты: как мы перестраивали поиск по базе знаний, подбирали retrieval pipeline под продуктовую документацию и постепенно улучшали качество поиска через серию небольших экспериментов. Ещё разобрал, почему production RAG — это постоянная работа с retrieval, шумом и latency. Сегодня — как мы измеряли качество всей RAG-системы целиком . Расскажу про экспертный и синтетический датасеты, почему retrieval-метрики могут расходиться с реальным качеством ответов и как мы замкнули агентную петлю. В конце покажу финальную картину метрик с замечаниями и поделюсь, какие полезные мысли появились во время работы.

    habr.com/ru/companies/bitrix/a

    #rag #eval #оптимизация #датасет #битрикс24 #база_знаний

  2. Как оценивать ИИ-агентов в проде: нижняя планка, трассы и кодовые проверки

    Если агент уже ходит в инструменты, читает документы, меняет состояние системы и принимает часть решений сам, проверка одного промпта почти ничего не говорит о надежности. Нужно смотреть на весь путь: вход, найденный контекст, вызовы инструментов, промежуточные состояния, итоговый ответ и побочные эффекты. Ниже - рабочая схема, как строить такие проверки до релиза и после выхода в прод.

    habr.com/ru/articles/1040756/

    #eval #ai #aiагенты #llm #тестирование #data_analysis #агенты_в_продакшене #агенты_ии #трассировка #harness_engineering

  3. Сделаем Python безопасным… снова

    Все мы любим Python за то, что он дает нам свободу: динамическую типизацию, кроссплатформенность, огромное количество библиотек и многое другое. Но зачастую эта свобода становится кошмаром для security‑инженеров и архитекторов, когда речь заходит о высоконагруженных системах с серьезными требованиями к безопасности. В этой статье мы поговорим о том, как перехватить выполнение Python‑кода, запретить опасные вызовы и построить систему контрактов без изменения исходников.

    habr.com/ru/companies/otus/art

    #Python #безопасность_Python #audit_hook #syssettrace #AST #байткод #статический_анализ #песочница #eval #runtimeконтроль

  4. Почему AI-агенты сбоят и как сделать, чтобы они перестали

    Привет, хочу поговорить об AI-агентах. Но не об их преимуществах: все и так уже знают, как они ускоряют разработку и освобождают команду от рутины. Здесь я хочу обсудить риски и новые варианты сбоев, которые появляются вместе с внедрением агентов. В реальности даже один AI-агент способен уронить проект быстрее, чем человеческая ошибка. Галлюцинации, удаление нужных данных, иллюзия компетентности — это лишь часть проблем. Когда агентов несколько и они зависят друг от друга, риск сбоев возрастает. Попробую разобраться, от чего зависят типичные проблемы, и расскажу, как я с ними справляюсь.

    habr.com/ru/companies/cloud_ru

    #aiagent #мультиагентные_системы #eval #adk #автономность

  5. すごい!
    Hello from typst!
    #let code = ```typ
    #import "@preview/ansi-render:0.8.0": *
    #ansi-render(read("tmp.txt"), font: "Juisee HWNF")

    Code:
    #code

    Rendered:
    #eval(code.text, mode: "markup")
    ```
  6. すごい!
    Hello from typst!
    #let code = ```typ
    #import "@preview/ansi-render:0.8.0": *
    #ansi-render(read("tmp.txt"), font: "Juisee HWNF")

    Code:
    #code

    Rendered:
    #eval(code.text, mode: "markup")
    ```
  7. Hmmm seems like Typst doesn't have lazy evaluation but it does have #eval() which might work for this...

  8. 20년 개발 경험이 독이 되는 순간: AI 에이전트 엔지니어링의 5가지 함정

    시니어 개발자가 AI 에이전트 개발에서 오히려 고전하는 이유. 전통적 소프트웨어 엔지니어링 원칙과 AI 에이전트 개발의 5가지 근본적 차이점을 소개합니다.

    aisparkup.com/posts/7049

  9. [Перевод] Парадокс безопасности локальных LLM

    Команда AI for Devs подготовила перевод исследования о парадоксе безопасности локальных LLM. Если вы запускаете модели на своём сервере ради приватности, эту статью стоит прочитать. Эксперименты показывают: локальные модели вроде gpt-oss-20b куда легче обмануть, чем облачные аналоги. Они чаще вставляют вредоносный код, не замечая подвоха, и превращаются в идеальную цель для атак.

    habr.com/ru/articles/960132/

    #LLM #безопасность #локальные_модели #атаки #бекдор #eval #exec #RedTeaming #приватность #разработка

  10. @asvhl Leaving my Lean code littered with hashtags like someone desperate for clout #eval #print #check #v[] #guard_msgs #exit

  11. 🔍 Online-Workshop: Praxisnahe Evaluation von #Wissenschaftskommunikation! Teilnehmende entwickelten in unserem Workshop Evaluationspläne für Projekte-von Exzellenzclustern bis hin zu Formaten für Schüler:innen. Der Fokus lag dabei auf Ziel, Methode & Umsetzung. Danke für den inspirierenden Austausch! 🙌💡 #Wisskomm #Eval

  12. 🔍 Online-Workshop: Praxisnahe Evaluation von #Wissenschaftskommunikation! Teilnehmende entwickelten in unserem Workshop Evaluationspläne für Projekte-von Exzellenzclustern bis hin zu Formaten für Schüler:innen. Der Fokus lag dabei auf Ziel, Methode & Umsetzung. Danke für den inspirierenden Austausch! 🙌💡 #Wisskomm #Eval

  13. [Перевод] Хочешь умного агента? Научись оценивать его правильно

    В середине 2024 года AI-агенты стали главной темой обсуждений в технологическом сообществе — с помощью них теперь выполняют множество задач от заказа ингредиентов для ужина до бронирования билетов и записи на прием к врачу. Затем появились вертикальные AI-агенты — узкоспециализированные системы, о которых заговорили как о потенциальной замене привычных SaaS-решений. Но по мере роста влияния агентов увеличиваются и риски, связанные с их преждевременным внедрением. Недостаточно протестированный AI-агент может стать источником множества проблем: от неточных предсказаний и скрытых байасов до плохой адаптивности и уязвимостей в безопасности. Такие ошибки дезориентируют пользователей и подрывают доверие к системе, нарушая принципы fairness и транспарентности. Если вы разрабатываете AI-агента, наличие чёткой стратегии безопасного деплоймента критически важно. В этой статье мы рассмотрим, почему тщательная валидация необходима, разберём пошаговые подходы к тестированию и методы проведения комплексной оценки AI-агентов для обеспечения их надёжного развертывания.

    habr.com/ru/articles/902608/

    #ai_agent #ai_agents #ai_агенты #ии_агент #ai #ии #llm #eval

  14. 🎩 BREAKING NEWS: #JavaScript is weird! 🧙‍♂️ Who would've thought? 🤔 An article reveals the shocking truth that #eval is a #nightmare, #loops are #sneaky, and #ASI is quirkier than your uncle's dance moves at a wedding. 😱 But hey, don't worry, just slap a #linter on it and pretend everything's fine. 🙄
    stack-auth.com/blog/on-javascr #Weirdness #Quirks #Solutions #HackerNews #ngated

  15. XML Odoo Eval tutorial explains how to fix common XML errors, correctly set eval attributes, and add image fields in Odoo modules. Read more for detailed code examples and best practices. Tags: #Odoo #XML #Eval #Tutorial

    teguhteja.id/xml-odoo-eval-cor

  16. My evals.fun web app is really starting to become usable for graphing #LLM #eval results! I’m using it in a client project to embed graphs in GitHub PRs. Try it out, one project is free forever! evals.fun

  17. @brendan I mean, `#eval` can execute arbitrary I/O, so if you are carelessly testing your functions with it and there is some I/O somewhere in the chain of functions, who knows what can be overwritten.

    I once accidentally dumped about 20 GB of noise from /dev/urandom into a temp file because of an #eval. If you have IO functions that do file deletion for cleanup, you better make sure you don't pass those to an #eval by mistake.

    Unlike code you are ready to compile and execute, you can always butterfingers an eval parameter!

  18. @brendan `#eval` is also a great way to delete System32 😅

  19. @jonmsterling @chrisamaphone Yeah, in the past I’ve found that just doing `#eval` in the source file is a great way to interactively explore stuff. And unlike a linear repl you can update previous definitions and those changes will flow through.

  20. BigGen Benchmark🔖
    Coarse grained, large & diverse generation benchmark

    77 tasks
    9 core skills
    103 LMs checked

    Seed examples were created by humans
    the rest by GPT4 and manually validated

    Validate judge quality, data quality...

    arxiv.org/abs/2406.05761
    t.co/2KPchOz8GZ
    #ML #benchmark #evaluation #eval #nlp #Llm #llms #machinelearning

  21. We share code on
    @github

    We share datasets on
    @huggingface
    But where do we share our data processing?

    We prompt, clean, and filter
    but on our own🥺

    Unitxt🦄
    A preprocessing tool
    That we can grow together
    unitxt.rtfd.io

    #data #NLP #ml #LLM #LLMs #evaluation #eval #huggingFace

  22. There is now a hardcover edition of LISP from Nothing, because some people asked. See t3x.org/lfn/
    Nothing new inside, just a hardcover version of the same book about minimal LISP and LISP in the age of mainframe computers.
    #LISP, #eval, #MACLISP, #mainframes, #punchcards, #teletypes, #retrocomputing