#eval — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #eval, aggregated by home.social.
-
Как мы строили eval и автоматизировали оптимизацию AI-агента для умного помощника
Привет! Меня зовут Алексей, я разработчик в Битрикс24. В первой части рассказывал про retrieval-часть нашего RAG для AI-помощника Марты: как мы перестраивали поиск по базе знаний, подбирали retrieval pipeline под продуктовую документацию и постепенно улучшали качество поиска через серию небольших экспериментов. Ещё разобрал, почему production RAG — это постоянная работа с retrieval, шумом и latency. Сегодня — как мы измеряли качество всей RAG-системы целиком . Расскажу про экспертный и синтетический датасеты, почему retrieval-метрики могут расходиться с реальным качеством ответов и как мы замкнули агентную петлю. В конце покажу финальную картину метрик с замечаниями и поделюсь, какие полезные мысли появились во время работы.
-
Как оценивать ИИ-агентов в проде: нижняя планка, трассы и кодовые проверки
Если агент уже ходит в инструменты, читает документы, меняет состояние системы и принимает часть решений сам, проверка одного промпта почти ничего не говорит о надежности. Нужно смотреть на весь путь: вход, найденный контекст, вызовы инструментов, промежуточные состояния, итоговый ответ и побочные эффекты. Ниже - рабочая схема, как строить такие проверки до релиза и после выхода в прод.
https://habr.com/ru/articles/1040756/
#eval #ai #aiагенты #llm #тестирование #data_analysis #агенты_в_продакшене #агенты_ии #трассировка #harness_engineering
-
Agent-skills-eval – Test whether Agent Skills improve outputs
https://github.com/darkrishabh/agent-skills-eval
#HackerNews #AgentSkills #Eval #Testing #Skills #Outputs #AIResearch #MachineLearning
-
Agent-skills-eval – Test whether Agent Skills improve outputs
https://github.com/darkrishabh/agent-skills-eval
#HackerNews #AgentSkills #Eval #Testing #Skills #Outputs #AIResearch #MachineLearning
-
Сделаем Python безопасным… снова
Все мы любим Python за то, что он дает нам свободу: динамическую типизацию, кроссплатформенность, огромное количество библиотек и многое другое. Но зачастую эта свобода становится кошмаром для security‑инженеров и архитекторов, когда речь заходит о высоконагруженных системах с серьезными требованиями к безопасности. В этой статье мы поговорим о том, как перехватить выполнение Python‑кода, запретить опасные вызовы и построить систему контрактов без изменения исходников.
https://habr.com/ru/companies/otus/articles/1029676/
#Python #безопасность_Python #audit_hook #syssettrace #AST #байткод #статический_анализ #песочница #eval #runtimeконтроль
-
Почему AI-агенты сбоят и как сделать, чтобы они перестали
Привет, хочу поговорить об AI-агентах. Но не об их преимуществах: все и так уже знают, как они ускоряют разработку и освобождают команду от рутины. Здесь я хочу обсудить риски и новые варианты сбоев, которые появляются вместе с внедрением агентов. В реальности даже один AI-агент способен уронить проект быстрее, чем человеческая ошибка. Галлюцинации, удаление нужных данных, иллюзия компетентности — это лишь часть проблем. Когда агентов несколько и они зависят друг от друга, риск сбоев возрастает. Попробую разобраться, от чего зависят типичные проблемы, и расскажу, как я с ними справляюсь.
-
Hmmm seems like Typst doesn't have lazy evaluation but it does have #eval() which might work for this...
-
#eval #check #synth #guard #guard_expr #exit #print #[ #v[ #reduce #check_tactic #check_tactic_failure #check_simp #discr_tree_key #discr_tree_simp_key #widget
(All the #commands in Lean that I could find by running rg '^syntax .* "#')
-
20년 개발 경험이 독이 되는 순간: AI 에이전트 엔지니어링의 5가지 함정
시니어 개발자가 AI 에이전트 개발에서 오히려 고전하는 이유. 전통적 소프트웨어 엔지니어링 원칙과 AI 에이전트 개발의 5가지 근본적 차이점을 소개합니다. -
[Перевод] Парадокс безопасности локальных LLM
Команда AI for Devs подготовила перевод исследования о парадоксе безопасности локальных LLM. Если вы запускаете модели на своём сервере ради приватности, эту статью стоит прочитать. Эксперименты показывают: локальные модели вроде gpt-oss-20b куда легче обмануть, чем облачные аналоги. Они чаще вставляют вредоносный код, не замечая подвоха, и превращаются в идеальную цель для атак.
https://habr.com/ru/articles/960132/
#LLM #безопасность #локальные_модели #атаки #бекдор #eval #exec #RedTeaming #приватность #разработка
-
Reveal – Read Eval Visualize Loop for Clojure
https://vlaaad.github.io/reveal/
#HackerNews #Reveal #Read #Eval #Visualize #Loop #Clojure #Programming
-
Reveal – Read Eval Visualize Loop for Clojure
https://vlaaad.github.io/reveal/
#HackerNews #Reveal #Read #Eval #Visualize #Loop #Clojure #Programming
-
-
🔍 Online-Workshop: Praxisnahe Evaluation von #Wissenschaftskommunikation! Teilnehmende entwickelten in unserem Workshop Evaluationspläne für Projekte-von Exzellenzclustern bis hin zu Formaten für Schüler:innen. Der Fokus lag dabei auf Ziel, Methode & Umsetzung. Danke für den inspirierenden Austausch! 🙌💡 #Wisskomm #Eval
-
🔍 Online-Workshop: Praxisnahe Evaluation von #Wissenschaftskommunikation! Teilnehmende entwickelten in unserem Workshop Evaluationspläne für Projekte-von Exzellenzclustern bis hin zu Formaten für Schüler:innen. Der Fokus lag dabei auf Ziel, Methode & Umsetzung. Danke für den inspirierenden Austausch! 🙌💡 #Wisskomm #Eval
-
[Перевод] Хочешь умного агента? Научись оценивать его правильно
В середине 2024 года AI-агенты стали главной темой обсуждений в технологическом сообществе — с помощью них теперь выполняют множество задач от заказа ингредиентов для ужина до бронирования билетов и записи на прием к врачу. Затем появились вертикальные AI-агенты — узкоспециализированные системы, о которых заговорили как о потенциальной замене привычных SaaS-решений. Но по мере роста влияния агентов увеличиваются и риски, связанные с их преждевременным внедрением. Недостаточно протестированный AI-агент может стать источником множества проблем: от неточных предсказаний и скрытых байасов до плохой адаптивности и уязвимостей в безопасности. Такие ошибки дезориентируют пользователей и подрывают доверие к системе, нарушая принципы fairness и транспарентности. Если вы разрабатываете AI-агента, наличие чёткой стратегии безопасного деплоймента критически важно. В этой статье мы рассмотрим, почему тщательная валидация необходима, разберём пошаговые подходы к тестированию и методы проведения комплексной оценки AI-агентов для обеспечения их надёжного развертывания.
https://habr.com/ru/articles/902608/
#ai_agent #ai_agents #ai_агенты #ии_агент #ai #ии #llm #eval
-
🎩 BREAKING NEWS: #JavaScript is weird! 🧙♂️ Who would've thought? 🤔 An article reveals the shocking truth that #eval is a #nightmare, #loops are #sneaky, and #ASI is quirkier than your uncle's dance moves at a wedding. 😱 But hey, don't worry, just slap a #linter on it and pretend everything's fine. 🙄
https://stack-auth.com/blog/on-javascripts-weirdness #Weirdness #Quirks #Solutions #HackerNews #ngated -
XML Odoo Eval tutorial explains how to fix common XML errors, correctly set eval attributes, and add image fields in Odoo modules. Read more for detailed code examples and best practices. Tags: #Odoo #XML #Eval #Tutorial
https://teguhteja.id/xml-odoo-eval-correct-errors-add-images/
-
My evals.fun web app is really starting to become usable for graphing #LLM #eval results! I’m using it in a client project to embed graphs in GitHub PRs. Try it out, one project is free forever! https://www.evals.fun
-
Quite a good list of LLM evaluation metrics (with papers!) by Parea AI: https://docs.parea.ai/blog/eval-metrics-for-llm-apps-in-prod
#llms #rag #evaluation #eval #metrics #faithfulness #relevance #informationretrieval
-
@brendan I mean, `#eval` can execute arbitrary I/O, so if you are carelessly testing your functions with it and there is some I/O somewhere in the chain of functions, who knows what can be overwritten.
I once accidentally dumped about 20 GB of noise from /dev/urandom into a temp file because of an #eval. If you have IO functions that do file deletion for cleanup, you better make sure you don't pass those to an #eval by mistake.
Unlike code you are ready to compile and execute, you can always butterfingers an eval parameter!
-
-
@jonmsterling @chrisamaphone Yeah, in the past I’ve found that just doing `#eval` in the source file is a great way to interactively explore stuff. And unlike a linear repl you can update previous definitions and those changes will flow through.
-
BigGen Benchmark🔖
Coarse grained, large & diverse generation benchmark77 tasks
9 core skills
103 LMs checkedSeed examples were created by humans
the rest by GPT4 and manually validatedValidate judge quality, data quality...
https://arxiv.org/abs/2406.05761
https://t.co/2KPchOz8GZ
#ML #benchmark #evaluation #eval #nlp #Llm #llms #machinelearning -
We share code on
@githubWe share datasets on
@huggingface
But where do we share our data processing?We prompt, clean, and filter
but on our own🥺Unitxt🦄
A preprocessing tool
That we can grow together
https://unitxt.rtfd.io -
There is now a hardcover edition of LISP from Nothing, because some people asked. See http://t3x.org/lfn/
Nothing new inside, just a hardcover version of the same book about minimal LISP and LISP in the age of mainframe computers.
#LISP, #eval, #MACLISP, #mainframes, #punchcards, #teletypes, #retrocomputing