#arcagi — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #arcagi, aggregated by home.social.
-
Train и eval в ARC-AGI-2 — это разные распределения
Если вы замеряете прогресс своего солвера на случайной подвыборке из train, вы замеряете его не на том наборе. Медианная задача train занимает 100 клеток на выходе, у медианной задачи eval их 225. Два и более тестовых входа требуют 6.9 процента задач train и 40.8 процента задач eval. Расхождение держится по всем шести структурным осям, которые я померил, и переживает поправку на множественные сравнения. Дальше идёт распределительное сравнение обоих публичных наборов ARC-AGI-2, отпечатки файлов, на которых оно сделано, и подмножество из train, подобранное под eval по структуре. CSV со списком задач в конце. Сразу оговорка, к которой я вернусь отдельным разделом: всё это про структуру, а не про сложность для человека. Свой же индекс я проверил против человеческих решений, и он проверку не прошёл. Что показали измерения
https://habr.com/ru/articles/1071730/
#ARCAGI #ARC_Prize #бенчмарки #сдвиг_распределения #критерий_КолмогороваСмирнова #валидация #воспроизводимость #машинное_обучение #AGI #статистика
-
Бенчмарки AGI никогда не будут объективными
Тест Тьюринга явно устарел, сейчас пытаются придумать новые тесты на сильный ИИ . Но как оценить интеллект модели, если учёные сильно расходятся в оценке даже человека. Существует как минимум 70 определений интеллекта для сапиенсов. И ещё эти многочисленные научные статьи на тему сознания у LLM . Тут вообще странная постановка вопроса. По опыту человека известно, что наиболее эффективно мыслительные процессы идут на подсознательном уровне, а вмешательство самосознания только мешает решению сложных проблем. На этот счёт вроде бы установлен научный консенсус . Если у модели возникнет самосознание — этот баг быстро устранят, чтобы он не тормозил систему, как у человека. Казалось бы, о чём тут рассуждать?
https://habr.com/ru/companies/ruvds/articles/1033540/
#интеллект #сильный_ИИ #AGI #личность #Сверхинтеллект #самосознание #когнитивная_наука #GeneralBench #ARCAGI #ruvds_статьи
-
[Перевод] Разбираем 14 самых популярных бенчмарков для LLM
Opus 4.5 набирает 80.6% на SWE-bench Verified. Opus 4 — 72.5%. Значит ли это, что Opus 4.5 лучше программирует, чем Opus 4? Ну... возможно . Но SWE-bench Verified это не показывает. Он показывает способность модели чинить небольшие баги в 12 популярных open source Python-репозиториях, которые почти наверняка входят в её обучающие данные. SWE-bench Verified не тестирует умение ориентироваться в вашем TypeScript-монорепо, Spring Boot-приложении или самописном ORM, на котором настоял предыдущий CTO. Я написал эту статью, потому что в релизах новых моделей постоянно мелькает один и тот же набор бенчмарков — и я понятия не имел, что они означают. Пришлось прочитать статьи, код и критику. Результат: разбор 14 бенчмарков — что тестирует, как устроен, в чём критикуют, и мои собственные наблюдения.
https://habr.com/ru/articles/1017082/
#бенчмарки_LLM #SWEbench #оценка_языковых_моделей #AI_бенчмарки_2025 #TerminalBench #ARCAGI #GPQA_Diamond #FrontierMath #тестирование_ИИ #метрики_качества_LLM
-
Люди набирают 100%, GPT-5.4 — 0,26%, а Google хватило всего лишь 3-бит
Седьмой выпуск еженедельных IT-новостей от OpenIDE: новый бенчмарк AGI, которому модели не смогли угодить, трёхбитная квантизация от Google, ACP-протокол в OpenIDE, GigaChat 3.1 и бесславный конец Sora.
https://habr.com/ru/companies/haulmont/articles/1017460/
#ARCAGI #GPT54 #Grok #Google_TurboQuant #OpenIDE_ACP #Claude_Capybara #Sora #GigaChat_31 #бенчмарк_AGI
-
https://winbuzzer.com/2026/03/30/arc-agi-3-offers-2m-ai-matching-human-reasoning-benchmark-xcxwbn/
ARC-AGI-3 Offers $2M for AI Matching Human Reasoning
#AI #ARCAGI #ARCAGI3 #AGI #AIBenchmarks #AIResearch #AICompetition #LLMs #DeepLearning #MachineLearning #FrançoisChollet #ARCPrizeFoundation
-
ARC-AGI для оценки способностей ИИ и новый релиз ChatGPT 5.2
Вчера вышла новая версия модели ChatGPT 5.2 . В очередной раз Сэм Альтман и OpenAI удивляют качеством модели (в последний месяц было так много релизов, что они решили не отставать). В целом, все как обычно — топовые результаты на большинстве бенчмарков. Но хочу уделить внимание одному очень сложному бенчмарку, на котором пока многие спотыкаются — ARC-AGI (Abstract and Reasoning Corpus for Artificial General Intelligence). Именно здесь ChatGPT 5.2 показал значительный скачок. На сегодня существует две версии этого теста. Так о чем же он?
https://habr.com/ru/articles/976228/
#искусственный_интеллект #машинное_обучение #новости #бенчмарки #бенчмаркинг #тестирование_моделей #генеративный_ии #openai #arcagi
-
Samsung rzuca wyzwanie gigantom AI. Ich mały model bije na głowę największe umysły branży
W wyścigu o dominację w dziedzinie sztucznej inteligencji od lat panuje mantra „większy znaczy lepszy”. Okazuje się jednak, że to może być ślepa uliczka.
Naukowcy z Samsung AI przedstawili model, który mając zaledwie 7 milionów parametrów, w zadaniach na złożone rozumowanie pokonuje największe modele językowe na świecie.
Podczas gdy technologiczni giganci inwestują miliardy w tworzenie coraz potężniejszych LLM-ów (Large Language Models), badaczka z Samsung SAIL Montréal, Alexia Jolicoeur-Martineau, udowadnia, że kluczem do sukcesu nie musi być skala. Jej praca nad „Małym Modelem Rekurencyjnym” (Tiny Recursive Model – TRM) pokazuje, że znacznie mniejsza, ale sprytniej zaprojektowana sieć może osiągać lepsze rezultaty przy ułamku zasobów, z jakich korzystają duże LLM-y.
Samsung i OpenAI łączą siły. Powstanie globalna infrastruktura dla sztucznej inteligencji
Słabość gigantów
Wielkie modele językowe, mimo imponujących zdolności do generowania tekstu, mają fundamentalną słabość – bywają kruche w wieloetapowym rozumowaniu. Ponieważ generują odpowiedzi krok po kroku (token po tokenie), jeden błąd na wczesnym etapie może zniweczyć cały proces i doprowadzić do błędnej odpowiedzi końcowej.
Model TRM podchodzi do problemu inaczej. Zamiast generować odpowiedź w jednym przebiegu, model iteracyjnie poprawia zarówno swój wewnętrzny „tok rozumowania”, jak i proponowaną odpowiedź. Ten proces może być powtarzany nawet 16 razy, co pozwala sieci na progresywne korygowanie własnych pomyłek.
Mniej znaczy więcej
Najbardziej zaskakującym odkryciem w badaniach jest fakt, że sieć składająca się z zaledwie dwóch warstw osiągnęła znacznie lepsze wyniki niż jej czterowarstwowa, bardziej rozbudowana i złożona wersja. Mniejszy rozmiar zapobiega przeuczeniu modelu, co jest częstym problemem przy pracy na mniejszych, wyspecjalizowanych zbiorach danych. Podejście Samsunga jest dowodem na to, że inteligentna architektura jest w stanie pokonać surową moc obliczeniową.
Wyniki mówią same za siebie. W teście Sudoku-Extreme TRM osiągnął skuteczność na poziomie 87,4%, deklasując poprzednie modele. Jednak najbardziej spektakularny sukces odniósł w benchmarku ARC-AGI, zaprojektowanym do mierzenia prawdziwej, płynnej inteligencji AI. Model Samsunga z 7 milionami parametrów osiągnął tam wynik 7,8%, podczas gdy znacznie większy Gemini 2.5 Pro od Google uzyskał zaledwie 4,9%. To dowód na to, że w złożonym rozumowaniu, to nie rozmiar, a architektura ma kluczowe znaczenie.
#AI #ARCAGI #badania #benchmark #Gemini #LLM #małyModelJęzykowy #news #przełom #rozumowanie #Samsung #sztucznaInteligencja #TRM
-
I got the highest score on ARC-AGI again swapping Python for English
https://jeremyberman.substack.com/p/how-i-got-the-highest-score-on-arc-agi-again
-
If AI flunks François Chollet’s test, maybe it just struggles with colorful grids—not intelligence itself. #AI #AGI #Intelligence #Chollet #ARCAGI #PhilosophyOfAI
The Man Out to Prove How Dumb ... -
Yessssss 🐍 a benchmark for AI that matters.
"It wasn’t until we tested GPT-4, Gemini 2.0, and o3-mini that we saw enough spatial reasoning for strategic play."
-
Модель o3 от OpenAI показала результат 75,7% в бенчмарке ARC-AGI-Pub
Франсуа Шолле, создатель фреймворка Keras и основатель ARC Prize Foundation, поделился итогами тестов новой модели o3 от OpenAI в тестах бенчмарка ARC-AGI-Pub. Эта модель достигла впечатляющего результата — 75,7% на полу-приватном наборе оценки при соблюдении установленного публичного лимита вычислительных ресурсов в $10 тысяч. Конфигурация o3 с увеличенным уровнем вычислений (172-кратное увеличение) показала результат 87,5%. Этот результат представляет собой неожиданный и значительный скачок в возможностях искусственного интеллекта, демонстрируя способность к адаптации к новым задачам, ранее невиданную в моделях семейства GPT. Для сравнения, ARC-AGI-1 потребовал 4 года, чтобы повысить результат с 0% у GPT-3 в 2020 году до 5% у GPT-4o в 2024 году. Все представления о возможностях ИИ требуют пересмотра подхода к бенчмаркам ARC в свете достижений o3.
https://habr.com/ru/articles/869098/
#AI #openai #o3 #arc #arcagi #бенчмарк #искусственный_интеллект #ии
-
Personally I've waited for an AI system to pass the ARC-AGI benchmark before freaking out. That time is now...
"You'll know AGI is here when the exercise of creating tasks that are easy for regular humans but hard for AI becomes simply impossible."
- François Chollet