#phi2 — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #phi2, aggregated by home.social.
-
Можно ли пересадить алгоритм из маленькой модели в LLM? Эксперимент с grokking, residual stream и линейной проекцией
Современные LLM (Large Language Models) — это черные ящики. Мы знаем, что они что-то умеют, но как они это делают внутри — остается загадкой. Существует целое направление — механистическая интерпретируемость (mechanistic interpretability) , которое пытается заглянуть внутрь нейросетей и найти алгоритмы, зашитые в весах. Ключевая идея этого направления: если модель обучилась решать задачу (например, арифметику), то внутри её residual stream формируется геометрическая структура — числа начинают лежать на окружности, а операции сводятся к вращению. Это не просто паттерн, это настоящий скомпилированный алгоритм. Вопрос, который мы задали: можно ли взять этот алгоритм из маленькой обученной модели и «пересадить» его в большую LLM во время inference? Без дообучения, без градиентов, без данных. Просто взять внутреннее состояние и подставить его в другую модель. Если бы это работало, мы бы получили способ усиления больших моделей узкоспециализированными маленькими , минуя дорогостоящий fine-tuning. Проведены серии экспериментов. И спойлером отвечу на вопрос: ответ — да, но с большими ограничениями . И эти ограничения говорят о фундаментальной природе работы LLM.
https://habr.com/ru/articles/1052114/
#grokking #residual_stream #mechanistic_interpretability #модульная_арифметика #transfer_learning #линейный_пробник #Phi2 #трансформеры #activation_patching
-
Et si on installait une #IA en local sur un @raspberrypi RASPBERRYPI5 ? Je vous propose d'installer llama-cpp et #Ollama sur la framboise et de la tester avec différents modèles comme #Phi2 ou #Mistral
https://www.framboise314.fr/faites-tourner-un-llm-de-type-chatgpt-sur-le-raspberry-pi-5/ -
🧠 #NVIDIA researchers are advancing SLMs through structured weight pruning and knowledge distillation, cutting down model size while preserving performance.
For instance, #Minitron 8B and 4B models, derived from Nemotron 15B, outperform many models trained from scratch. Despite its size, it competes with top-tier models like #Gemma2 and #Phi2.
-
Impressed with the ease of use of https://lmstudio.ai/
, easy to install, after that you can download a version of the Phi-2 model to play around with. All locally without extra costs or internet connection.
#LLM #generativeAI #Phi2 #experiment #microsoft #LMstudio #AI -
Imagine having a small AI language model with 3B parameters, trained on 1.4T tokens, that can outperform some large language models... yet be small enough to run entirely on your smartphone.
At Microsoft Ignite 2023, CEO Satya Nadella introduced the world to the revolutionary "Phi-2".
"Phi-2: The surprising power of small language models" - Microsoft Research
https://www.microsoft.com/en-us/research/blog/phi-2-the-surprising-power-of-small-language-models/ -
Microsoft unveils 2.7B parameter language model Phi-2 https://www.artificialintelligence-news.com/2023/12/13/microsoft-unveils-2-7b-parameter-language-model-phi-2/ #microsoft #phi2 #ai #tech #news #technology