#evals — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #evals, aggregated by home.social.
-
Честный RAG eval set: как собрать первые 100-300 кейсов и не обмануть себя цифрой
В прошлой статье серии мы сжимали эмбеддинги и замеряли, насколько изменится выдача относительно полного fp32-поиска. Там это был правильный вопрос: ломает ли квантизация уже существующий retrieval . Но у такого замера есть неприятное слепое пятно. Можно аккуратно сохранить 99% выдачи исходного эмбеддера и все равно плохо находить нужные документы на своем домене. Внешний бенчмарк, даже сильный, этого не гарантирует. BEIR как раз был создан, чтобы показать, насколько результаты retrieval меняются между разными задачами и доменами; один усредненный скор там не заменяет проверку на собственных данных. Нужен свой eval set . И тут обычно возникает ложная развилка:
https://habr.com/ru/articles/1070534/
#rag #retrieval #evals #оценка_качества #LLM #эмбеддинги #поиск #MTEB #ragas #BEIR
-
Я объяснил KERNEL маме за пять минут. Потом проверил, переживёт ли он LLM в production
Недавно я попробовал объяснить маме, как нормально ставить задачи ChatGPT. Без temperature, context window, system prompt и прочих слов, после которых человек вполне справедливо решает, что проще уже сделать всё самому. Я сказал примерно так: «Сформулируй, что тебе нужно. Объясни, каким должен быть результат. Если есть ограничения, напиши их сразу. Не сваливай пять разных задач в одну. И не заставляй модель угадывать то, что существует только у тебя в голове». На всё ушло минут пять. А потом я понял, что почти дословно пересказал KERNEL, один из фреймворков для написания промптов. И тут стало интереснее: если базовый prompt engineering действительно можно объяснить человеку за пять минут, что происходит, когда LLM переезжает из вкладки браузера в реальный продукт?
https://habr.com/ru/companies/syntx_ai/articles/1068654/
#LLM #prompt_engineering #KERNEL #промпты #context_engineering #evals #ChatGPT #RAG #AIагенты #LLM_в_production
-
Eval-driven development beats prompt golf.
🧪 Write the failing eval first, then tweak the prompt
📉 If you can't measure the win, you didn't make one
🔁 Prompt changes regress silently — only the suite catches it
🎯 "It feels better" is how you ship a quality drop you can't see -
Do not choose an AI model from a leaderboard alone
Model choice should come from a small product-specific logbook, not only a public leaderboard.
Track exact model ID, route, prompt class, tokens, latency, charge, retries, and pass/fail reason before production traffic.
Start small:
-
[Перевод] Внутри Claude нашли сознание у моделей. J-пространство в LLM
Привет, Хабр. 6 июля 2026 года Anthropic опубликовала исследование Verbalizable Representations Form a Global Workspace in Language Models . Разбираю технические детали и практические следствия. Пока вы читаете это предложение, ваш мозг делает десятки вещей, которых вы не замечаете: держит осанку, регулирует дыхание, превращает линии на экране в слова. Но часть работы мозга вам всё-таки доступна - всплывший образ, обдуманное решение, куда направить внимание. Нейробиологи называют такую активность сознательно доступной и отличают её от всей остальной, идущей без нашего ведома. У неё особые свойства: её можно описать словами, ею можно управлять и рассуждать -> в отличие от автоматических процессов, которые текут сами собой. В новой работе Anthropic показывает, что похожее разделение появилось и в языковых моделях вроде Claude. У модели обнаружился небольшой набор внутренних нейронных паттернов, которые - на фоне всей остальной обработки играют особую роль.
https://habr.com/ru/articles/1056320/
#claude #anthropic #chatgpt #evals #archive #codex #claudecode #research #antigravity #rlvr
-
AI Engineer World's Fair 2026: разбор докладов и куда движется AI-инженерия
AI Engineer World's Fair 2026 уже прошла, а по-русски её так никто и не разобрал. В официальном расписании 560 сессий: воркшопы, кейноуты, доклады. Глазами это не осилить. Я собрал агентный пайплайн, прогнал через него доступные записи и сел читать конференцию про агентов с помощью агента. Рассказываю, что в записях повторялось из доклада в доклад, куда сходится AI-инженерия и что посмотреть, если время есть только на пять роликов. Все доступные доклады с русскими саммари, таймкодами и тематическим навигатором я собрал в отдельном SPA .
https://habr.com/ru/articles/1055370/
#AI_Engineer_Worlds_Fair #AIинженерия #агенты #LLM #harness #review_debt #evals #agent_UX #AI_engineering
-
You can have production-quality evals running in minutes.
Our Solutions Architect Ankur Duggal @Anky488 is leading a workshop at AI Engineer World's Fair tomorrow, walking through how to stand up a production eval pipeline in minutes using Arize Agent Skills, no prior setup required.
Grab lunch and come by, leave with a working eval setup.
📅 Day 1 · Monday, June 29 · 1:15–2:15 pm
📍 Room 2010Mark your calendar: https://www.ai.engineer/worldsfair/schedule?session=asn_2026_06_29_workshop_track_01_1315
-
Come see what we've been building at Arize.
Our Fuad Ali @tofuadmiral is leading a live walk-through of the latest features in Arize on Day 1 at AI Engineer World's Fair.
If you want to see what's new firsthand, ask questions directly, and get a head start on features your team can put to use now, this is the session.
📅 Day 1 · Monday, June 29 · 11:05 am–12:05 pm
📍 Room 2010See you there: https://www.ai.engineer/worldsfair/schedule?session=asn_slot_2026_07_01_breakout_track_09_1140_2026_06_03t09_28_29_013z
-
201 goes deeper: session-level evals, RAG quality scoring, trajectory evaluation, and autonomous issue investigation with Signal.
📅 Workshop 101 · Day 1 · Monday, June 29 · 9:00–11:00 am · Room 2010
📅 Workshop 201 · Day 1 · Monday, June 29 · 2:20–4:20 pm · Room 2010 -
📅 Day 2 · Tuesday, June 30 · 12:05-12:25pm
📍 Expo Stage 1