#pretraining — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #pretraining, aggregated by home.social.
-
Т9 за сотню долларов, ассистент за миллиард: сколько на самом деле стоит обучить LLM с нуля
«Лучший ChatGPT за $100», «китайцы обучили GPT-4 за шесть миллионов», «модель с нуля на одной игровой карте за вечер» — за последний год такие заголовки идут потоком. Почти все цифры в них честные. Беда в том, что они про разные вещи. За словами «обучить LLM» прячется лестница в семь порядков: от десятков долларов на карте под столом до миллиарда на фронтире. На каждой ступени за деньги покупают разное, и перепутать ступени дорого. Я работаю CTO ML-команды. Расчет «взять открытые веса / дообучить / обучить с нуля» мы проделываем регулярно, и почти всегда он заканчивается не там, где ждет заказчик. Ниже — вся лестница с числами и первоисточниками: что реально обучить на RTX 5090, где начинается аренда кластера, из чего складывается смета фронтир-модели и почему «модель за $6 млн» и «компания с инфраструктурой на миллиард» — правда одновременно. Посчитать свою LLM
https://habr.com/ru/articles/1060916/
#LLM #обучение_LLM #pretraining #машинное_обучение #нейросети #GPU #RTX_5090 #H100 #стоимость_обучения_моделей #nanochat
-
Своя GPT-like LLM по WH40K с нуля. Часть 3: pre-train LLM
Привет, Хабр! Меня зовут Владимир, и это третья часть цикла статей по написании и обучению небольшой decoder-only LLM с нуля. В первой части мы обучили токенизатор и собрали pretrain-датасет, во второй части реализовали класс Трансформер-блока. В этой части будем собирать и предобучать нашу LLM.
https://habr.com/ru/articles/1060454/
#llm #gpt #pytorch #transformers #nlp #python #pretraining #text_generation
-
Своя GPT-like LLM по WH40K с нуля. Часть 1: токенизируем Империум
Привет, Хабр! Меня зовут Владимир, и я давно хотел погрузиться во вселенную Warhammer40K. Для погружение во вселенную я решил обучить LLM на лоре Warhammer40K. И чтобы было интереснее, код этой LLM я решил написать сам, на голом pytorch (ну почти). Данная статья - первая в цикле статей по созданию и обучению GPT-like LLM с нуля. В них я постараюсь рассказать, как работают Decoder-only модели, как обучить небольшую LLM, сколько это заняло у меня времени.
https://habr.com/ru/articles/1056212/
#llm #gpt #transformers #pytorch #nlp #bpe #huggingface #dataset #pretraining #python
-
As of this morning: 🧠 425.49B tokens seen 📊 4.25% completed This eager reader wants more input, one token at a time. Follow along. 🔍 (2/2) #PreTraining #LLM #MultilingualAI #TransparentAI #goOpenEuroLLM
-
Как я обучил GPT с нуля на русском языке — и что из этого получилось
Всё началось с наивной мысли: зачем платить за API или тащить 7B-модель, если мне нужна маленькая модель для простых разговоров на одном языке? Логика казалась железной — большие модели умеют всё и на всех языках сразу, но это же избыточно. 0.7B, заточенная под один язык и один стиль общения, должна справляться не хуже. Спойлер: это было наивно. Но путь оказался ценнее результата.
https://habr.com/ru/articles/1037532/
#GPT #LLM #pretraining #распределённое_обучение #Google_Colab #RoPE #GQA #SwiGLU #NLP #русский_язык
-
Brain Drain @ OpenAI continues.
Andrej Karpathy a founding member of OpenAI is joining Anthropic and will focus on building out Anthropic's pretraining research .... https://www.axios.com/2026/05/19/anthropic-openai-karpathy-andrej-claude #AI #Karpathy #Anthropic #OpenAI #BrainDrain #Pretraining #Claude #LLMs #FrontierAI
-
Brain Drain @ OpenAI continues.
Andrej Karpathy a founding member of OpenAI is joining Anthropic and will focus on building out Anthropic's pretraining research .... https://www.axios.com/2026/05/19/anthropic-openai-karpathy-andrej-claude #AI #Karpathy #Anthropic #OpenAI #BrainDrain #Pretraining #Claude #LLMs #FrontierAI
-
RT @AndrewCurran_: Karpathy wird ein neues Pre-Training-Team bilden, das sich auf rekursive Selbstverbesserung konzentriert, und wird Claude beibringen, das Training von Claude zu verbessern, wie von Axios berichtet.
mehr auf Arint.info
#AI #Axios #Karpathy #PreTraining #SelfImprovement #arint_info
-
RT @AndrewCurran_: Karpathy wird ein neues Pre-Training-Team bilden, das sich auf rekursive Selbstverbesserung konzentriert, und wird Claude beibringen, das Training von Claude zu verbessern, wie von Axios berichtet.
mehr auf Arint.info
#AI #Axios #Karpathy #PreTraining #SelfImprovement #arint_info
-
La leyenda urbana de «entrenar tu propio modelo de IAG» sigue siendo un anzuelo para monetizar tutoriales, cursos, masterclass y demás productos que los gurúes y promotores de la IA generativa usan para seguir lucrando a costa de todos los autores vulnerados. ¡No se dejen engañar!
#AI #MachineLearning #data #training #finetuning #AImodel #genAI #generativeAI #pretraining #Copyright #opensource