#eval — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #eval, aggregated by home.social.
-
Exploit for Patched vBulletin Flaw Disclosed
A newly disclosed exploit for a patched vBulletin flaw shows how an unauthenticated request can be used to execute code on an unpatched forum server, putting vulnerable sites at risk. This security threat was made public on July 27, highlighting the importance of keeping software up to date.
-
Как мы строили eval и автоматизировали оптимизацию AI-агента для умного помощника
Привет! Меня зовут Алексей, я разработчик в Битрикс24. В первой части рассказывал про retrieval-часть нашего RAG для AI-помощника Марты: как мы перестраивали поиск по базе знаний, подбирали retrieval pipeline под продуктовую документацию и постепенно улучшали качество поиска через серию небольших экспериментов. Ещё разобрал, почему production RAG — это постоянная работа с retrieval, шумом и latency. Сегодня — как мы измеряли качество всей RAG-системы целиком . Расскажу про экспертный и синтетический датасеты, почему retrieval-метрики могут расходиться с реальным качеством ответов и как мы замкнули агентную петлю. В конце покажу финальную картину метрик с замечаниями и поделюсь, какие полезные мысли появились во время работы.
-
Как мы строили eval и автоматизировали оптимизацию AI-агента для умного помощника
Привет! Меня зовут Алексей, я разработчик в Битрикс24. В первой части рассказывал про retrieval-часть нашего RAG для AI-помощника Марты: как мы перестраивали поиск по базе знаний, подбирали retrieval pipeline под продуктовую документацию и постепенно улучшали качество поиска через серию небольших экспериментов. Ещё разобрал, почему production RAG — это постоянная работа с retrieval, шумом и latency. Сегодня — как мы измеряли качество всей RAG-системы целиком . Расскажу про экспертный и синтетический датасеты, почему retrieval-метрики могут расходиться с реальным качеством ответов и как мы замкнули агентную петлю. В конце покажу финальную картину метрик с замечаниями и поделюсь, какие полезные мысли появились во время работы.
-
Как мы строили eval и автоматизировали оптимизацию AI-агента для умного помощника
Привет! Меня зовут Алексей, я разработчик в Битрикс24. В первой части рассказывал про retrieval-часть нашего RAG для AI-помощника Марты: как мы перестраивали поиск по базе знаний, подбирали retrieval pipeline под продуктовую документацию и постепенно улучшали качество поиска через серию небольших экспериментов. Ещё разобрал, почему production RAG — это постоянная работа с retrieval, шумом и latency. Сегодня — как мы измеряли качество всей RAG-системы целиком . Расскажу про экспертный и синтетический датасеты, почему retrieval-метрики могут расходиться с реальным качеством ответов и как мы замкнули агентную петлю. В конце покажу финальную картину метрик с замечаниями и поделюсь, какие полезные мысли появились во время работы.
-
Как оценивать ИИ-агентов в проде: нижняя планка, трассы и кодовые проверки
Если агент уже ходит в инструменты, читает документы, меняет состояние системы и принимает часть решений сам, проверка одного промпта почти ничего не говорит о надежности. Нужно смотреть на весь путь: вход, найденный контекст, вызовы инструментов, промежуточные состояния, итоговый ответ и побочные эффекты. Ниже - рабочая схема, как строить такие проверки до релиза и после выхода в прод.
https://habr.com/ru/articles/1040756/
#eval #ai #aiагенты #llm #тестирование #data_analysis #агенты_в_продакшене #агенты_ии #трассировка #harness_engineering
-
Как оценивать ИИ-агентов в проде: нижняя планка, трассы и кодовые проверки
Если агент уже ходит в инструменты, читает документы, меняет состояние системы и принимает часть решений сам, проверка одного промпта почти ничего не говорит о надежности. Нужно смотреть на весь путь: вход, найденный контекст, вызовы инструментов, промежуточные состояния, итоговый ответ и побочные эффекты. Ниже - рабочая схема, как строить такие проверки до релиза и после выхода в прод.
https://habr.com/ru/articles/1040756/
#eval #ai #aiагенты #llm #тестирование #data_analysis #агенты_в_продакшене #агенты_ии #трассировка #harness_engineering
-
Как оценивать ИИ-агентов в проде: нижняя планка, трассы и кодовые проверки
Если агент уже ходит в инструменты, читает документы, меняет состояние системы и принимает часть решений сам, проверка одного промпта почти ничего не говорит о надежности. Нужно смотреть на весь путь: вход, найденный контекст, вызовы инструментов, промежуточные состояния, итоговый ответ и побочные эффекты. Ниже - рабочая схема, как строить такие проверки до релиза и после выхода в прод.
https://habr.com/ru/articles/1040756/
#eval #ai #aiагенты #llm #тестирование #data_analysis #агенты_в_продакшене #агенты_ии #трассировка #harness_engineering
-
Agent-skills-eval – Test whether Agent Skills improve outputs
https://github.com/darkrishabh/agent-skills-eval
#HackerNews #AgentSkills #Eval #Testing #Skills #Outputs #AIResearch #MachineLearning
-
Agent-skills-eval – Test whether Agent Skills improve outputs
https://github.com/darkrishabh/agent-skills-eval
#HackerNews #AgentSkills #Eval #Testing #Skills #Outputs #AIResearch #MachineLearning
-
Agent-skills-eval – Test whether Agent Skills improve outputs
https://github.com/darkrishabh/agent-skills-eval
#HackerNews #AgentSkills #Eval #Testing #Skills #Outputs #AIResearch #MachineLearning
-
Agent-skills-eval – Test whether Agent Skills improve outputs
https://github.com/darkrishabh/agent-skills-eval
#HackerNews #AgentSkills #Eval #Testing #Skills #Outputs #AIResearch #MachineLearning
-
Agent-skills-eval – Test whether Agent Skills improve outputs
https://github.com/darkrishabh/agent-skills-eval
#HackerNews #AgentSkills #Eval #Testing #Skills #Outputs #AIResearch #MachineLearning
-
Сделаем Python безопасным… снова
Все мы любим Python за то, что он дает нам свободу: динамическую типизацию, кроссплатформенность, огромное количество библиотек и многое другое. Но зачастую эта свобода становится кошмаром для security‑инженеров и архитекторов, когда речь заходит о высоконагруженных системах с серьезными требованиями к безопасности. В этой статье мы поговорим о том, как перехватить выполнение Python‑кода, запретить опасные вызовы и построить систему контрактов без изменения исходников.
https://habr.com/ru/companies/otus/articles/1029676/
#Python #безопасность_Python #audit_hook #syssettrace #AST #байткод #статический_анализ #песочница #eval #runtimeконтроль
-
Сделаем Python безопасным… снова
Все мы любим Python за то, что он дает нам свободу: динамическую типизацию, кроссплатформенность, огромное количество библиотек и многое другое. Но зачастую эта свобода становится кошмаром для security‑инженеров и архитекторов, когда речь заходит о высоконагруженных системах с серьезными требованиями к безопасности. В этой статье мы поговорим о том, как перехватить выполнение Python‑кода, запретить опасные вызовы и построить систему контрактов без изменения исходников.
https://habr.com/ru/companies/otus/articles/1029676/
#Python #безопасность_Python #audit_hook #syssettrace #AST #байткод #статический_анализ #песочница #eval #runtimeконтроль
-
Сделаем Python безопасным… снова
Все мы любим Python за то, что он дает нам свободу: динамическую типизацию, кроссплатформенность, огромное количество библиотек и многое другое. Но зачастую эта свобода становится кошмаром для security‑инженеров и архитекторов, когда речь заходит о высоконагруженных системах с серьезными требованиями к безопасности. В этой статье мы поговорим о том, как перехватить выполнение Python‑кода, запретить опасные вызовы и построить систему контрактов без изменения исходников.
https://habr.com/ru/companies/otus/articles/1029676/
#Python #безопасность_Python #audit_hook #syssettrace #AST #байткод #статический_анализ #песочница #eval #runtimeконтроль
-
Почему AI-агенты сбоят и как сделать, чтобы они перестали
Привет, хочу поговорить об AI-агентах. Но не об их преимуществах: все и так уже знают, как они ускоряют разработку и освобождают команду от рутины. Здесь я хочу обсудить риски и новые варианты сбоев, которые появляются вместе с внедрением агентов. В реальности даже один AI-агент способен уронить проект быстрее, чем человеческая ошибка. Галлюцинации, удаление нужных данных, иллюзия компетентности — это лишь часть проблем. Когда агентов несколько и они зависят друг от друга, риск сбоев возрастает. Попробую разобраться, от чего зависят типичные проблемы, и расскажу, как я с ними справляюсь.
-
Почему AI-агенты сбоят и как сделать, чтобы они перестали
Привет, хочу поговорить об AI-агентах. Но не об их преимуществах: все и так уже знают, как они ускоряют разработку и освобождают команду от рутины. Здесь я хочу обсудить риски и новые варианты сбоев, которые появляются вместе с внедрением агентов. В реальности даже один AI-агент способен уронить проект быстрее, чем человеческая ошибка. Галлюцинации, удаление нужных данных, иллюзия компетентности — это лишь часть проблем. Когда агентов несколько и они зависят друг от друга, риск сбоев возрастает. Попробую разобраться, от чего зависят типичные проблемы, и расскажу, как я с ними справляюсь.
-
Почему AI-агенты сбоят и как сделать, чтобы они перестали
Привет, хочу поговорить об AI-агентах. Но не об их преимуществах: все и так уже знают, как они ускоряют разработку и освобождают команду от рутины. Здесь я хочу обсудить риски и новые варианты сбоев, которые появляются вместе с внедрением агентов. В реальности даже один AI-агент способен уронить проект быстрее, чем человеческая ошибка. Галлюцинации, удаление нужных данных, иллюзия компетентности — это лишь часть проблем. Когда агентов несколько и они зависят друг от друга, риск сбоев возрастает. Попробую разобраться, от чего зависят типичные проблемы, и расскажу, как я с ними справляюсь.
-
Hmmm seems like Typst doesn't have lazy evaluation but it does have #eval() which might work for this...
-
Hmmm seems like Typst doesn't have lazy evaluation but it does have #eval() which might work for this...
-
Hmmm seems like Typst doesn't have lazy evaluation but it does have #eval() which might work for this...
-
Hmmm seems like Typst doesn't have lazy evaluation but it does have #eval() which might work for this...
-
#eval #check #synth #guard #guard_expr #exit #print #[ #v[ #reduce #check_tactic #check_tactic_failure #check_simp #discr_tree_key #discr_tree_simp_key #widget
(All the #commands in Lean that I could find by running rg '^syntax .* "#')
-
#eval #check #synth #guard #guard_expr #exit #print #[ #v[ #reduce #check_tactic #check_tactic_failure #check_simp #discr_tree_key #discr_tree_simp_key #widget
(All the #commands in Lean that I could find by running rg '^syntax .* "#')
-
#eval #check #synth #guard #guard_expr #exit #print #[ #v[ #reduce #check_tactic #check_tactic_failure #check_simp #discr_tree_key #discr_tree_simp_key #widget
(All the #commands in Lean that I could find by running rg '^syntax .* "#')
-
#eval #check #synth #guard #guard_expr #exit #print #[ #v[ #reduce #check_tactic #check_tactic_failure #check_simp #discr_tree_key #discr_tree_simp_key #widget
(All the #commands in Lean that I could find by running rg '^syntax .* "#')
-
https://www.europesays.com/ee/52924/ Kööts võttis Suzukas hooaja viimase võidu, ent Talvar vormistas meistritiitli #EE #Eesti #EestiKeel #Estonia #Estonian #EVAL #Sport #Sports
-
20년 개발 경험이 독이 되는 순간: AI 에이전트 엔지니어링의 5가지 함정
시니어 개발자가 AI 에이전트 개발에서 오히려 고전하는 이유. 전통적 소프트웨어 엔지니어링 원칙과 AI 에이전트 개발의 5가지 근본적 차이점을 소개합니다. -
20년 개발 경험이 독이 되는 순간: AI 에이전트 엔지니어링의 5가지 함정
시니어 개발자가 AI 에이전트 개발에서 오히려 고전하는 이유. 전통적 소프트웨어 엔지니어링 원칙과 AI 에이전트 개발의 5가지 근본적 차이점을 소개합니다. -
20년 개발 경험이 독이 되는 순간: AI 에이전트 엔지니어링의 5가지 함정
시니어 개발자가 AI 에이전트 개발에서 오히려 고전하는 이유. 전통적 소프트웨어 엔지니어링 원칙과 AI 에이전트 개발의 5가지 근본적 차이점을 소개합니다. -
20년 개발 경험이 독이 되는 순간: AI 에이전트 엔지니어링의 5가지 함정
시니어 개발자가 AI 에이전트 개발에서 오히려 고전하는 이유. 전통적 소프트웨어 엔지니어링 원칙과 AI 에이전트 개발의 5가지 근본적 차이점을 소개합니다. -
https://www.europesays.com/ee/42243/ Talvar võidukas Interlagoses, meistrid selguvad Suzuka ringrajal #EE #Eesti #EestiKeel #Estonia #Estonian #EVAL #Sport #Sports
-
https://www.europesays.com/ee/35677/ Talvar võidutses COTA etapil, Kööts ja Janis poodiumil #EE #Eesti #EestiKeel #Estonia #Estonian #EVAL #Sport #Sports
-
[Перевод] Парадокс безопасности локальных LLM
Команда AI for Devs подготовила перевод исследования о парадоксе безопасности локальных LLM. Если вы запускаете модели на своём сервере ради приватности, эту статью стоит прочитать. Эксперименты показывают: локальные модели вроде gpt-oss-20b куда легче обмануть, чем облачные аналоги. Они чаще вставляют вредоносный код, не замечая подвоха, и превращаются в идеальную цель для атак.
https://habr.com/ru/articles/960132/
#LLM #безопасность #локальные_модели #атаки #бекдор #eval #exec #RedTeaming #приватность #разработка
-
[Перевод] Парадокс безопасности локальных LLM
Команда AI for Devs подготовила перевод исследования о парадоксе безопасности локальных LLM. Если вы запускаете модели на своём сервере ради приватности, эту статью стоит прочитать. Эксперименты показывают: локальные модели вроде gpt-oss-20b куда легче обмануть, чем облачные аналоги. Они чаще вставляют вредоносный код, не замечая подвоха, и превращаются в идеальную цель для атак.
https://habr.com/ru/articles/960132/
#LLM #безопасность #локальные_модели #атаки #бекдор #eval #exec #RedTeaming #приватность #разработка
-
[Перевод] Парадокс безопасности локальных LLM
Команда AI for Devs подготовила перевод исследования о парадоксе безопасности локальных LLM. Если вы запускаете модели на своём сервере ради приватности, эту статью стоит прочитать. Эксперименты показывают: локальные модели вроде gpt-oss-20b куда легче обмануть, чем облачные аналоги. Они чаще вставляют вредоносный код, не замечая подвоха, и превращаются в идеальную цель для атак.
https://habr.com/ru/articles/960132/
#LLM #безопасность #локальные_модели #атаки #бекдор #eval #exec #RedTeaming #приватность #разработка
-
Reveal – Read Eval Visualize Loop for Clojure
https://vlaaad.github.io/reveal/
#HackerNews #Reveal #Read #Eval #Visualize #Loop #Clojure #Programming
-
Reveal – Read Eval Visualize Loop for Clojure
https://vlaaad.github.io/reveal/
#HackerNews #Reveal #Read #Eval #Visualize #Loop #Clojure #Programming
-
Reveal – Read Eval Visualize Loop for Clojure
https://vlaaad.github.io/reveal/
#HackerNews #Reveal #Read #Eval #Visualize #Loop #Clojure #Programming
-
Reveal – Read Eval Visualize Loop for Clojure
https://vlaaad.github.io/reveal/
#HackerNews #Reveal #Read #Eval #Visualize #Loop #Clojure #Programming
-
Reveal – Read Eval Visualize Loop for Clojure
https://vlaaad.github.io/reveal/
#HackerNews #Reveal #Read #Eval #Visualize #Loop #Clojure #Programming
-
-
-
-
🔍 Online-Workshop: Praxisnahe Evaluation von #Wissenschaftskommunikation! Teilnehmende entwickelten in unserem Workshop Evaluationspläne für Projekte-von Exzellenzclustern bis hin zu Formaten für Schüler:innen. Der Fokus lag dabei auf Ziel, Methode & Umsetzung. Danke für den inspirierenden Austausch! 🙌💡 #Wisskomm #Eval
-
🔍 Online-Workshop: Praxisnahe Evaluation von #Wissenschaftskommunikation! Teilnehmende entwickelten in unserem Workshop Evaluationspläne für Projekte-von Exzellenzclustern bis hin zu Formaten für Schüler:innen. Der Fokus lag dabei auf Ziel, Methode & Umsetzung. Danke für den inspirierenden Austausch! 🙌💡 #Wisskomm #Eval
-
🔍 Online-Workshop: Praxisnahe Evaluation von #Wissenschaftskommunikation! Teilnehmende entwickelten in unserem Workshop Evaluationspläne für Projekte-von Exzellenzclustern bis hin zu Formaten für Schüler:innen. Der Fokus lag dabei auf Ziel, Methode & Umsetzung. Danke für den inspirierenden Austausch! 🙌💡 #Wisskomm #Eval
-
🔍 Online-Workshop: Praxisnahe Evaluation von #Wissenschaftskommunikation! Teilnehmende entwickelten in unserem Workshop Evaluationspläne für Projekte-von Exzellenzclustern bis hin zu Formaten für Schüler:innen. Der Fokus lag dabei auf Ziel, Methode & Umsetzung. Danke für den inspirierenden Austausch! 🙌💡 #Wisskomm #Eval
-
🔍 Online-Workshop: Praxisnahe Evaluation von #Wissenschaftskommunikation! Teilnehmende entwickelten in unserem Workshop Evaluationspläne für Projekte-von Exzellenzclustern bis hin zu Formaten für Schüler:innen. Der Fokus lag dabei auf Ziel, Methode & Umsetzung. Danke für den inspirierenden Austausch! 🙌💡 #Wisskomm #Eval