home.social

#leaderboard — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #leaderboard, aggregated by home.social.

  1. 🥳🎉 Behold, the ultimate #ranking of trendy open-source AI agents that no one asked for, updated weekly because who doesn't love a #leaderboard with as much relevance as a 30-day-old sandwich? 🥪🤖 With a dazzling "Momentum Score" that definitely wasn't invented last week, dive into the shallow end of AI obscurity! 🌊📉
    theagenticleaderboard.com/ #trendyAI #openSource #MomentumScore #AIobscurity #HackerNews #ngated

  2. 🥳🎉 Behold, the ultimate #ranking of trendy open-source AI agents that no one asked for, updated weekly because who doesn't love a #leaderboard with as much relevance as a 30-day-old sandwich? 🥪🤖 With a dazzling "Momentum Score" that definitely wasn't invented last week, dive into the shallow end of AI obscurity! 🌊📉
    theagenticleaderboard.com/ #trendyAI #openSource #MomentumScore #AIobscurity #HackerNews #ngated

  3. 🥳🎉 Behold, the ultimate #ranking of trendy open-source AI agents that no one asked for, updated weekly because who doesn't love a #leaderboard with as much relevance as a 30-day-old sandwich? 🥪🤖 With a dazzling "Momentum Score" that definitely wasn't invented last week, dive into the shallow end of AI obscurity! 🌊📉
    theagenticleaderboard.com/ #trendyAI #openSource #MomentumScore #AIobscurity #HackerNews #ngated

  4. 🥳🎉 Behold, the ultimate #ranking of trendy open-source AI agents that no one asked for, updated weekly because who doesn't love a #leaderboard with as much relevance as a 30-day-old sandwich? 🥪🤖 With a dazzling "Momentum Score" that definitely wasn't invented last week, dive into the shallow end of AI obscurity! 🌊📉
    theagenticleaderboard.com/ #trendyAI #openSource #MomentumScore #AIobscurity #HackerNews #ngated

  5. 🥳🎉 Behold, the ultimate #ranking of trendy open-source AI agents that no one asked for, updated weekly because who doesn't love a #leaderboard with as much relevance as a 30-day-old sandwich? 🥪🤖 With a dazzling "Momentum Score" that definitely wasn't invented last week, dive into the shallow end of AI obscurity! 🌊📉
    theagenticleaderboard.com/ #trendyAI #openSource #MomentumScore #AIobscurity #HackerNews #ngated

  6. GuardRate: как мы построили независимую арену для guardrail-моделей (часть 1)

    Всем привет, на связи команда HiveTrace! Мы уделяем много времени разработке собственных моделей и часто задаемся вопросом: "какой из двух гардрейлов лучше?". Если вы когда-нибудь выбирали guardrail-модель для LLM, то знаете: одни модели блокируют безобидные запросы, другие пропускают явные угрозы. Хуже всего то, что нет прозрачного стандарта сравнения. Авторы оценивают свои решения субъективно, не публикуют методологию, а результаты замеров одних и тех же моделей на одинаковых бенчмарках в разных статьях часто отличаются. Поэтому мы создали CLI, который назвали GuardRateTools - это автоматизированный пайплайн оценки guardrail-моделей. Его интерфейс – HiveTrace GuardRate Leaderboard, уже открыт для просмотра. GuardRateTools интегрирован в CI/CD процесс дообучения внутренних guardrail-моделей и обеспечивает честное сравнение моделей в равных условиях. CLI запускает проверку одной командой: подтягивает датасеты и конфигурацию модели из YAML, разворачивает изолированную среду, которая создается индивидуально для каждой модели, прогоняет модель по фиксированному набору бенчмарков и считает метрики. Сырые ответы от модели, логи и итоговые метрики сохраняются в артефакты, поэтому любой результат можно проверить и воспроизвести. Автоматизация исключает ручной труд, снижает влияние человеческого фактора и сокращает время оценки новых решений в области гардрейлов. HiveTrace GuardRate Leaderboard уже доступен для всех! В третьем квартале 2026 года мы выложим исходный код CLI. Если хотите протестировать свою модель, свяжитесь с нами. Контакты вы найдёте в конце статьи.

    habr.com/ru/companies/raft/art

    #llm #guardrails #guardrail_metrics #leaderboard #evaluation #guardrail_areana #ai_safety #promptinjection #benchmarking #opensource

  7. GuardRate: как мы построили независимую арену для guardrail-моделей (часть 1)

    Всем привет, на связи команда HiveTrace! Мы уделяем много времени разработке собственных моделей и часто задаемся вопросом: "какой из двух гардрейлов лучше?". Если вы когда-нибудь выбирали guardrail-модель для LLM, то знаете: одни модели блокируют безобидные запросы, другие пропускают явные угрозы. Хуже всего то, что нет прозрачного стандарта сравнения. Авторы оценивают свои решения субъективно, не публикуют методологию, а результаты замеров одних и тех же моделей на одинаковых бенчмарках в разных статьях часто отличаются. Поэтому мы создали CLI, который назвали GuardRateTools - это автоматизированный пайплайн оценки guardrail-моделей. Его интерфейс – HiveTrace GuardRate Leaderboard, уже открыт для просмотра. GuardRateTools интегрирован в CI/CD процесс дообучения внутренних guardrail-моделей и обеспечивает честное сравнение моделей в равных условиях. CLI запускает проверку одной командой: подтягивает датасеты и конфигурацию модели из YAML, разворачивает изолированную среду, которая создается индивидуально для каждой модели, прогоняет модель по фиксированному набору бенчмарков и считает метрики. Сырые ответы от модели, логи и итоговые метрики сохраняются в артефакты, поэтому любой результат можно проверить и воспроизвести. Автоматизация исключает ручной труд, снижает влияние человеческого фактора и сокращает время оценки новых решений в области гардрейлов. HiveTrace GuardRate Leaderboard уже доступен для всех! В третьем квартале 2026 года мы выложим исходный код CLI. Если хотите протестировать свою модель, свяжитесь с нами. Контакты вы найдёте в конце статьи.

    habr.com/ru/companies/raft/art

    #llm #guardrails #guardrail_metrics #leaderboard #evaluation #guardrail_areana #ai_safety #promptinjection #benchmarking #opensource

  8. GuardRate: как мы построили независимую арену для guardrail-моделей (часть 1)

    Всем привет, на связи команда HiveTrace! Мы уделяем много времени разработке собственных моделей и часто задаемся вопросом: "какой из двух гардрейлов лучше?". Если вы когда-нибудь выбирали guardrail-модель для LLM, то знаете: одни модели блокируют безобидные запросы, другие пропускают явные угрозы. Хуже всего то, что нет прозрачного стандарта сравнения. Авторы оценивают свои решения субъективно, не публикуют методологию, а результаты замеров одних и тех же моделей на одинаковых бенчмарках в разных статьях часто отличаются. Поэтому мы создали CLI, который назвали GuardRateTools - это автоматизированный пайплайн оценки guardrail-моделей. Его интерфейс – HiveTrace GuardRate Leaderboard, уже открыт для просмотра. GuardRateTools интегрирован в CI/CD процесс дообучения внутренних guardrail-моделей и обеспечивает честное сравнение моделей в равных условиях. CLI запускает проверку одной командой: подтягивает датасеты и конфигурацию модели из YAML, разворачивает изолированную среду, которая создается индивидуально для каждой модели, прогоняет модель по фиксированному набору бенчмарков и считает метрики. Сырые ответы от модели, логи и итоговые метрики сохраняются в артефакты, поэтому любой результат можно проверить и воспроизвести. Автоматизация исключает ручной труд, снижает влияние человеческого фактора и сокращает время оценки новых решений в области гардрейлов. HiveTrace GuardRate Leaderboard уже доступен для всех! В третьем квартале 2026 года мы выложим исходный код CLI. Если хотите протестировать свою модель, свяжитесь с нами. Контакты вы найдёте в конце статьи.

    habr.com/ru/companies/raft/art

    #llm #guardrails #guardrail_metrics #leaderboard #evaluation #guardrail_areana #ai_safety #promptinjection #benchmarking #opensource