home.social

#eval — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #eval, aggregated by home.social.

fetched live
  1. Exploit for Patched vBulletin Flaw Disclosed

    A newly disclosed exploit for a patched vBulletin flaw shows how an unauthenticated request can be used to execute code on an unpatched forum server, putting vulnerable sites at risk. This security threat was made public on July 27, highlighting the importance of keeping software up to date.

    osintsights.com/exploit-for-pa

    #Vbulletin #Cve202661511 #Exploit #Php #Eval

  2. Как мы строили eval и автоматизировали оптимизацию AI-агента для умного помощника

    Привет! Меня зовут Алексей, я разработчик в Битрикс24. В первой части рассказывал про retrieval-часть нашего RAG для AI-помощника Марты: как мы перестраивали поиск по базе знаний, подбирали retrieval pipeline под продуктовую документацию и постепенно улучшали качество поиска через серию небольших экспериментов. Ещё разобрал, почему production RAG — это постоянная работа с retrieval, шумом и latency. Сегодня — как мы измеряли качество всей RAG-системы целиком . Расскажу про экспертный и синтетический датасеты, почему retrieval-метрики могут расходиться с реальным качеством ответов и как мы замкнули агентную петлю. В конце покажу финальную картину метрик с замечаниями и поделюсь, какие полезные мысли появились во время работы.

    habr.com/ru/companies/bitrix/a

    #rag #eval #оптимизация #датасет #битрикс24 #база_знаний

  3. Как мы строили eval и автоматизировали оптимизацию AI-агента для умного помощника

    Привет! Меня зовут Алексей, я разработчик в Битрикс24. В первой части рассказывал про retrieval-часть нашего RAG для AI-помощника Марты: как мы перестраивали поиск по базе знаний, подбирали retrieval pipeline под продуктовую документацию и постепенно улучшали качество поиска через серию небольших экспериментов. Ещё разобрал, почему production RAG — это постоянная работа с retrieval, шумом и latency. Сегодня — как мы измеряли качество всей RAG-системы целиком . Расскажу про экспертный и синтетический датасеты, почему retrieval-метрики могут расходиться с реальным качеством ответов и как мы замкнули агентную петлю. В конце покажу финальную картину метрик с замечаниями и поделюсь, какие полезные мысли появились во время работы.

    habr.com/ru/companies/bitrix/a

    #rag #eval #оптимизация #датасет #битрикс24 #база_знаний

  4. Как мы строили eval и автоматизировали оптимизацию AI-агента для умного помощника

    Привет! Меня зовут Алексей, я разработчик в Битрикс24. В первой части рассказывал про retrieval-часть нашего RAG для AI-помощника Марты: как мы перестраивали поиск по базе знаний, подбирали retrieval pipeline под продуктовую документацию и постепенно улучшали качество поиска через серию небольших экспериментов. Ещё разобрал, почему production RAG — это постоянная работа с retrieval, шумом и latency. Сегодня — как мы измеряли качество всей RAG-системы целиком . Расскажу про экспертный и синтетический датасеты, почему retrieval-метрики могут расходиться с реальным качеством ответов и как мы замкнули агентную петлю. В конце покажу финальную картину метрик с замечаниями и поделюсь, какие полезные мысли появились во время работы.

    habr.com/ru/companies/bitrix/a

    #rag #eval #оптимизация #датасет #битрикс24 #база_знаний

  5. Как оценивать ИИ-агентов в проде: нижняя планка, трассы и кодовые проверки

    Если агент уже ходит в инструменты, читает документы, меняет состояние системы и принимает часть решений сам, проверка одного промпта почти ничего не говорит о надежности. Нужно смотреть на весь путь: вход, найденный контекст, вызовы инструментов, промежуточные состояния, итоговый ответ и побочные эффекты. Ниже - рабочая схема, как строить такие проверки до релиза и после выхода в прод.

    habr.com/ru/articles/1040756/

    #eval #ai #aiагенты #llm #тестирование #data_analysis #агенты_в_продакшене #агенты_ии #трассировка #harness_engineering

  6. Как оценивать ИИ-агентов в проде: нижняя планка, трассы и кодовые проверки

    Если агент уже ходит в инструменты, читает документы, меняет состояние системы и принимает часть решений сам, проверка одного промпта почти ничего не говорит о надежности. Нужно смотреть на весь путь: вход, найденный контекст, вызовы инструментов, промежуточные состояния, итоговый ответ и побочные эффекты. Ниже - рабочая схема, как строить такие проверки до релиза и после выхода в прод.

    habr.com/ru/articles/1040756/

    #eval #ai #aiагенты #llm #тестирование #data_analysis #агенты_в_продакшене #агенты_ии #трассировка #harness_engineering

  7. Как оценивать ИИ-агентов в проде: нижняя планка, трассы и кодовые проверки

    Если агент уже ходит в инструменты, читает документы, меняет состояние системы и принимает часть решений сам, проверка одного промпта почти ничего не говорит о надежности. Нужно смотреть на весь путь: вход, найденный контекст, вызовы инструментов, промежуточные состояния, итоговый ответ и побочные эффекты. Ниже - рабочая схема, как строить такие проверки до релиза и после выхода в прод.

    habr.com/ru/articles/1040756/

    #eval #ai #aiагенты #llm #тестирование #data_analysis #агенты_в_продакшене #агенты_ии #трассировка #harness_engineering

  8. Сделаем Python безопасным… снова

    Все мы любим Python за то, что он дает нам свободу: динамическую типизацию, кроссплатформенность, огромное количество библиотек и многое другое. Но зачастую эта свобода становится кошмаром для security‑инженеров и архитекторов, когда речь заходит о высоконагруженных системах с серьезными требованиями к безопасности. В этой статье мы поговорим о том, как перехватить выполнение Python‑кода, запретить опасные вызовы и построить систему контрактов без изменения исходников.

    habr.com/ru/companies/otus/art

    #Python #безопасность_Python #audit_hook #syssettrace #AST #байткод #статический_анализ #песочница #eval #runtimeконтроль

  9. Сделаем Python безопасным… снова

    Все мы любим Python за то, что он дает нам свободу: динамическую типизацию, кроссплатформенность, огромное количество библиотек и многое другое. Но зачастую эта свобода становится кошмаром для security‑инженеров и архитекторов, когда речь заходит о высоконагруженных системах с серьезными требованиями к безопасности. В этой статье мы поговорим о том, как перехватить выполнение Python‑кода, запретить опасные вызовы и построить систему контрактов без изменения исходников.

    habr.com/ru/companies/otus/art

    #Python #безопасность_Python #audit_hook #syssettrace #AST #байткод #статический_анализ #песочница #eval #runtimeконтроль

  10. Сделаем Python безопасным… снова

    Все мы любим Python за то, что он дает нам свободу: динамическую типизацию, кроссплатформенность, огромное количество библиотек и многое другое. Но зачастую эта свобода становится кошмаром для security‑инженеров и архитекторов, когда речь заходит о высоконагруженных системах с серьезными требованиями к безопасности. В этой статье мы поговорим о том, как перехватить выполнение Python‑кода, запретить опасные вызовы и построить систему контрактов без изменения исходников.

    habr.com/ru/companies/otus/art

    #Python #безопасность_Python #audit_hook #syssettrace #AST #байткод #статический_анализ #песочница #eval #runtimeконтроль

  11. Почему AI-агенты сбоят и как сделать, чтобы они перестали

    Привет, хочу поговорить об AI-агентах. Но не об их преимуществах: все и так уже знают, как они ускоряют разработку и освобождают команду от рутины. Здесь я хочу обсудить риски и новые варианты сбоев, которые появляются вместе с внедрением агентов. В реальности даже один AI-агент способен уронить проект быстрее, чем человеческая ошибка. Галлюцинации, удаление нужных данных, иллюзия компетентности — это лишь часть проблем. Когда агентов несколько и они зависят друг от друга, риск сбоев возрастает. Попробую разобраться, от чего зависят типичные проблемы, и расскажу, как я с ними справляюсь.

    habr.com/ru/companies/cloud_ru

    #aiagent #мультиагентные_системы #eval #adk #автономность

  12. Почему AI-агенты сбоят и как сделать, чтобы они перестали

    Привет, хочу поговорить об AI-агентах. Но не об их преимуществах: все и так уже знают, как они ускоряют разработку и освобождают команду от рутины. Здесь я хочу обсудить риски и новые варианты сбоев, которые появляются вместе с внедрением агентов. В реальности даже один AI-агент способен уронить проект быстрее, чем человеческая ошибка. Галлюцинации, удаление нужных данных, иллюзия компетентности — это лишь часть проблем. Когда агентов несколько и они зависят друг от друга, риск сбоев возрастает. Попробую разобраться, от чего зависят типичные проблемы, и расскажу, как я с ними справляюсь.

    habr.com/ru/companies/cloud_ru

    #aiagent #мультиагентные_системы #eval #adk #автономность

  13. Почему AI-агенты сбоят и как сделать, чтобы они перестали

    Привет, хочу поговорить об AI-агентах. Но не об их преимуществах: все и так уже знают, как они ускоряют разработку и освобождают команду от рутины. Здесь я хочу обсудить риски и новые варианты сбоев, которые появляются вместе с внедрением агентов. В реальности даже один AI-агент способен уронить проект быстрее, чем человеческая ошибка. Галлюцинации, удаление нужных данных, иллюзия компетентности — это лишь часть проблем. Когда агентов несколько и они зависят друг от друга, риск сбоев возрастает. Попробую разобраться, от чего зависят типичные проблемы, и расскажу, как я с ними справляюсь.

    habr.com/ru/companies/cloud_ru

    #aiagent #мультиагентные_системы #eval #adk #автономность

  14. すごい!
    Hello from typst!
    #let code = ```typ
    #import "@preview/ansi-render:0.8.0": *
    #ansi-render(read("tmp.txt"), font: "Juisee HWNF")

    Code:
    #code

    Rendered:
    #eval(code.text, mode: "markup")
    ```
  15. すごい!
    Hello from typst!
    #let code = ```typ
    #import "@preview/ansi-render:0.8.0": *
    #ansi-render(read("tmp.txt"), font: "Juisee HWNF")

    Code:
    #code

    Rendered:
    #eval(code.text, mode: "markup")
    ```
  16. すごい!
    Hello from typst!
    #let code = ```typ
    #import "@preview/ansi-render:0.8.0": *
    #ansi-render(read("tmp.txt"), font: "Juisee HWNF")

    Code:
    #code

    Rendered:
    #eval(code.text, mode: "markup")
    ```
  17. すごい!
    Hello from typst!
    #let code = ```typ
    #import "@preview/ansi-render:0.8.0": *
    #ansi-render(read("tmp.txt"), font: "Juisee HWNF")

    Code:
    #code

    Rendered:
    #eval(code.text, mode: "markup")
    ```
  18. すごい!
    Hello from typst!
    #let code = ```typ
    #import "@preview/ansi-render:0.8.0": *
    #ansi-render(read("tmp.txt"), font: "Juisee HWNF")

    Code:
    #code

    Rendered:
    #eval(code.text, mode: "markup")
    ```
  19. Hmmm seems like Typst doesn't have lazy evaluation but it does have #eval() which might work for this...

  20. Hmmm seems like Typst doesn't have lazy evaluation but it does have #eval() which might work for this...

  21. Hmmm seems like Typst doesn't have lazy evaluation but it does have #eval() which might work for this...

  22. Hmmm seems like Typst doesn't have lazy evaluation but it does have #eval() which might work for this...

  23. 20년 개발 경험이 독이 되는 순간: AI 에이전트 엔지니어링의 5가지 함정

    시니어 개발자가 AI 에이전트 개발에서 오히려 고전하는 이유. 전통적 소프트웨어 엔지니어링 원칙과 AI 에이전트 개발의 5가지 근본적 차이점을 소개합니다.

    aisparkup.com/posts/7049

  24. 20년 개발 경험이 독이 되는 순간: AI 에이전트 엔지니어링의 5가지 함정

    시니어 개발자가 AI 에이전트 개발에서 오히려 고전하는 이유. 전통적 소프트웨어 엔지니어링 원칙과 AI 에이전트 개발의 5가지 근본적 차이점을 소개합니다.

    aisparkup.com/posts/7049

  25. 20년 개발 경험이 독이 되는 순간: AI 에이전트 엔지니어링의 5가지 함정

    시니어 개발자가 AI 에이전트 개발에서 오히려 고전하는 이유. 전통적 소프트웨어 엔지니어링 원칙과 AI 에이전트 개발의 5가지 근본적 차이점을 소개합니다.

    aisparkup.com/posts/7049

  26. 20년 개발 경험이 독이 되는 순간: AI 에이전트 엔지니어링의 5가지 함정

    시니어 개발자가 AI 에이전트 개발에서 오히려 고전하는 이유. 전통적 소프트웨어 엔지니어링 원칙과 AI 에이전트 개발의 5가지 근본적 차이점을 소개합니다.

    aisparkup.com/posts/7049

  27. [Перевод] Парадокс безопасности локальных LLM

    Команда AI for Devs подготовила перевод исследования о парадоксе безопасности локальных LLM. Если вы запускаете модели на своём сервере ради приватности, эту статью стоит прочитать. Эксперименты показывают: локальные модели вроде gpt-oss-20b куда легче обмануть, чем облачные аналоги. Они чаще вставляют вредоносный код, не замечая подвоха, и превращаются в идеальную цель для атак.

    habr.com/ru/articles/960132/

    #LLM #безопасность #локальные_модели #атаки #бекдор #eval #exec #RedTeaming #приватность #разработка

  28. [Перевод] Парадокс безопасности локальных LLM

    Команда AI for Devs подготовила перевод исследования о парадоксе безопасности локальных LLM. Если вы запускаете модели на своём сервере ради приватности, эту статью стоит прочитать. Эксперименты показывают: локальные модели вроде gpt-oss-20b куда легче обмануть, чем облачные аналоги. Они чаще вставляют вредоносный код, не замечая подвоха, и превращаются в идеальную цель для атак.

    habr.com/ru/articles/960132/

    #LLM #безопасность #локальные_модели #атаки #бекдор #eval #exec #RedTeaming #приватность #разработка

  29. [Перевод] Парадокс безопасности локальных LLM

    Команда AI for Devs подготовила перевод исследования о парадоксе безопасности локальных LLM. Если вы запускаете модели на своём сервере ради приватности, эту статью стоит прочитать. Эксперименты показывают: локальные модели вроде gpt-oss-20b куда легче обмануть, чем облачные аналоги. Они чаще вставляют вредоносный код, не замечая подвоха, и превращаются в идеальную цель для атак.

    habr.com/ru/articles/960132/

    #LLM #безопасность #локальные_модели #атаки #бекдор #eval #exec #RedTeaming #приватность #разработка

  30. @asvhl Leaving my Lean code littered with hashtags like someone desperate for clout #eval #print #check #v[] #guard_msgs #exit

  31. @asvhl Leaving my Lean code littered with hashtags like someone desperate for clout #eval #print #check #v[] #guard_msgs #exit

  32. @asvhl Leaving my Lean code littered with hashtags like someone desperate for clout #eval #print #check #v[] #guard_msgs #exit

  33. @asvhl Leaving my Lean code littered with hashtags like someone desperate for clout #eval #print #check #v[] #guard_msgs #exit

  34. 🔍 Online-Workshop: Praxisnahe Evaluation von #Wissenschaftskommunikation! Teilnehmende entwickelten in unserem Workshop Evaluationspläne für Projekte-von Exzellenzclustern bis hin zu Formaten für Schüler:innen. Der Fokus lag dabei auf Ziel, Methode & Umsetzung. Danke für den inspirierenden Austausch! 🙌💡 #Wisskomm #Eval

  35. 🔍 Online-Workshop: Praxisnahe Evaluation von #Wissenschaftskommunikation! Teilnehmende entwickelten in unserem Workshop Evaluationspläne für Projekte-von Exzellenzclustern bis hin zu Formaten für Schüler:innen. Der Fokus lag dabei auf Ziel, Methode & Umsetzung. Danke für den inspirierenden Austausch! 🙌💡 #Wisskomm #Eval

  36. 🔍 Online-Workshop: Praxisnahe Evaluation von #Wissenschaftskommunikation! Teilnehmende entwickelten in unserem Workshop Evaluationspläne für Projekte-von Exzellenzclustern bis hin zu Formaten für Schüler:innen. Der Fokus lag dabei auf Ziel, Methode & Umsetzung. Danke für den inspirierenden Austausch! 🙌💡 #Wisskomm #Eval

  37. 🔍 Online-Workshop: Praxisnahe Evaluation von #Wissenschaftskommunikation! Teilnehmende entwickelten in unserem Workshop Evaluationspläne für Projekte-von Exzellenzclustern bis hin zu Formaten für Schüler:innen. Der Fokus lag dabei auf Ziel, Methode & Umsetzung. Danke für den inspirierenden Austausch! 🙌💡 #Wisskomm #Eval

  38. 🔍 Online-Workshop: Praxisnahe Evaluation von #Wissenschaftskommunikation! Teilnehmende entwickelten in unserem Workshop Evaluationspläne für Projekte-von Exzellenzclustern bis hin zu Formaten für Schüler:innen. Der Fokus lag dabei auf Ziel, Methode & Umsetzung. Danke für den inspirierenden Austausch! 🙌💡 #Wisskomm #Eval