#activation_patching — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #activation_patching, aggregated by home.social.
-
Можно ли пересадить алгоритм из маленькой модели в LLM? Эксперимент с grokking, residual stream и линейной проекцией
Современные LLM (Large Language Models) — это черные ящики. Мы знаем, что они что-то умеют, но как они это делают внутри — остается загадкой. Существует целое направление — механистическая интерпретируемость (mechanistic interpretability) , которое пытается заглянуть внутрь нейросетей и найти алгоритмы, зашитые в весах. Ключевая идея этого направления: если модель обучилась решать задачу (например, арифметику), то внутри её residual stream формируется геометрическая структура — числа начинают лежать на окружности, а операции сводятся к вращению. Это не просто паттерн, это настоящий скомпилированный алгоритм. Вопрос, который мы задали: можно ли взять этот алгоритм из маленькой обученной модели и «пересадить» его в большую LLM во время inference? Без дообучения, без градиентов, без данных. Просто взять внутреннее состояние и подставить его в другую модель. Если бы это работало, мы бы получили способ усиления больших моделей узкоспециализированными маленькими , минуя дорогостоящий fine-tuning. Проведены серии экспериментов. И спойлером отвечу на вопрос: ответ — да, но с большими ограничениями . И эти ограничения говорят о фундаментальной природе работы LLM.
https://habr.com/ru/articles/1052114/
#grokking #residual_stream #mechanistic_interpretability #модульная_арифметика #transfer_learning #линейный_пробник #Phi2 #трансформеры #activation_patching
-
Можно ли пересадить алгоритм из маленькой модели в LLM? Эксперимент с grokking, residual stream и линейной проекцией
Современные LLM (Large Language Models) — это черные ящики. Мы знаем, что они что-то умеют, но как они это делают внутри — остается загадкой. Существует целое направление — механистическая интерпретируемость (mechanistic interpretability) , которое пытается заглянуть внутрь нейросетей и найти алгоритмы, зашитые в весах. Ключевая идея этого направления: если модель обучилась решать задачу (например, арифметику), то внутри её residual stream формируется геометрическая структура — числа начинают лежать на окружности, а операции сводятся к вращению. Это не просто паттерн, это настоящий скомпилированный алгоритм. Вопрос, который мы задали: можно ли взять этот алгоритм из маленькой обученной модели и «пересадить» его в большую LLM во время inference? Без дообучения, без градиентов, без данных. Просто взять внутреннее состояние и подставить его в другую модель. Если бы это работало, мы бы получили способ усиления больших моделей узкоспециализированными маленькими , минуя дорогостоящий fine-tuning. Проведены серии экспериментов. И спойлером отвечу на вопрос: ответ — да, но с большими ограничениями . И эти ограничения говорят о фундаментальной природе работы LLM.
https://habr.com/ru/articles/1052114/
#grokking #residual_stream #mechanistic_interpretability #модульная_арифметика #transfer_learning #линейный_пробник #Phi2 #трансформеры #activation_patching
-
Можно ли пересадить алгоритм из маленькой модели в LLM? Эксперимент с grokking, residual stream и линейной проекцией
Современные LLM (Large Language Models) — это черные ящики. Мы знаем, что они что-то умеют, но как они это делают внутри — остается загадкой. Существует целое направление — механистическая интерпретируемость (mechanistic interpretability) , которое пытается заглянуть внутрь нейросетей и найти алгоритмы, зашитые в весах. Ключевая идея этого направления: если модель обучилась решать задачу (например, арифметику), то внутри её residual stream формируется геометрическая структура — числа начинают лежать на окружности, а операции сводятся к вращению. Это не просто паттерн, это настоящий скомпилированный алгоритм. Вопрос, который мы задали: можно ли взять этот алгоритм из маленькой обученной модели и «пересадить» его в большую LLM во время inference? Без дообучения, без градиентов, без данных. Просто взять внутреннее состояние и подставить его в другую модель. Если бы это работало, мы бы получили способ усиления больших моделей узкоспециализированными маленькими , минуя дорогостоящий fine-tuning. Проведены серии экспериментов. И спойлером отвечу на вопрос: ответ — да, но с большими ограничениями . И эти ограничения говорят о фундаментальной природе работы LLM.
https://habr.com/ru/articles/1052114/
#grokking #residual_stream #mechanistic_interpretability #модульная_арифметика #transfer_learning #линейный_пробник #Phi2 #трансформеры #activation_patching