#catastrophic_forgetting — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #catastrophic_forgetting, aggregated by home.social.
-
Ваш трансформер постоянно переобучается? Тогда мы идём к вам
Вот смотрите: кинули в мясорубку не только мясо, но и другие ингредиенты. Что получилось? Уже не чистый фарш, а какая-то смесь всего со всем. А если для каждого ингредиента взять свой инструмент, то получим чистый продукт. В нейросетях то же самое: общие веса = общая мясорубка. Обучили на кошках, потом на машинах, всё смешалось. Кошки забыты. Это catastrophic forgetting. 30 лет проблемы. Тысячи статей. Регуляризация, replay, elastic weight consolidation, всё какие-то костыли. Решение лежит на поверхности. Шаг от трансформера к рою
https://habr.com/ru/articles/1052182/
#catastrophic_forgetting #continual_learning #изоляция_весов #нейросети #архитектура #mixture_of_experts #машинное_обучение
-
Забыла, как писать «Hello, world»: почему нейросети теряют память
Представьте: вы месяцами обучали языковую модель, она выдает блестящие ответы — и вдруг после загрузки нового датасета словно теряет память и начинает ошибаться в задачах, которые раньше решала без проблем. Знакомо? Причина такого поведения — не баг, а побочный эффект обучения нейросетей, известный как катастрофическое забывание (catastrophic forgetting). Оно особенно досаждает при тренировке LLM и мощных систем компьютерного зрения, которые приходится регулярно докармливать свежими данными. Увы, с каждым таким апдейтом есть риск, что старая информация «испарится» из модели. Почему забывание происходит — и всегда ли это нежелательный эффект? Давайте разбираться.
https://habr.com/ru/companies/magnus-tech/articles/987422/
#забывание_в_нейросетях #катастрофическое_забывание_в_LLM #забывание_в_языковых_моделях #catastrophic_forgetting #причины_забывания_в_нейросетях #деградация_моделей #почему_нейросети_забывают #ошибки_при_дообучении_моделей
-
Нейросеть, которая помнит всё: заморозка ядра вместо «костылей» (Frozen Core Decomposition)
Frozen Core Decomposition (FCD) — инновационный метод для решения проблемы катастрофического забывания в continual learning. Используя разложение Tucker, метод достигает 96.1% точности на Split MNIST с минимальным забыванием (0.2%) и поддерживает работу с CNN, ResNet, GPT-2 и другими архитектурами. В статье разбираем математику, результаты экспериментов и реализацию на PyTorch.
https://habr.com/ru/articles/979030/
#continual_learning #neural_networks #frozen_core_decomposition #tucker_decomposition #machine_learning #deep_learning #catastrophic_forgetting #incremental_learning #PyTorch #neural_network_training
-
Нейросети перестанут забывать: метод с масками внимания и графом задач
В этой статье я разберу идею DTG‑MA (Dynamic Task‑Graph Masked Attention) пусть будет такое название и сокращение. Есть одна неприятная штука, которую почти каждый ловил на практике, когда пробовал последовательное обучение моделей как катастрофическое забывание. Решение проблемы может быстрее привести нас к полноценному искусственному интеллекту и других задач. В 1997 году когда в институте проходили нейросети возникла идея, что можно нейросеть использовать как хранилище данных, но как оказалось не все так просто ). Вы обучили систему на задаче A. Потом приходит задача B — модель обновляется, и внезапно качество на A падает так, будто A никогда и не было. Так проявляется catastrophic forgetting — катастрофическое забывание.