home.social

#pretraining — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #pretraining, aggregated by home.social.

fetched live
  1. Т9 за сотню долларов, ассистент за миллиард: сколько на самом деле стоит обучить LLM с нуля

    «Лучший ChatGPT за $100», «китайцы обучили GPT-4 за шесть миллионов», «модель с нуля на одной игровой карте за вечер» — за последний год такие заголовки идут потоком. Почти все цифры в них честные. Беда в том, что они про разные вещи. За словами «обучить LLM» прячется лестница в семь порядков: от десятков долларов на карте под столом до миллиарда на фронтире. На каждой ступени за деньги покупают разное, и перепутать ступени дорого. Я работаю CTO ML-команды. Расчет «взять открытые веса / дообучить / обучить с нуля» мы проделываем регулярно, и почти всегда он заканчивается не там, где ждет заказчик. Ниже — вся лестница с числами и первоисточниками: что реально обучить на RTX 5090, где начинается аренда кластера, из чего складывается смета фронтир-модели и почему «модель за $6 млн» и «компания с инфраструктурой на миллиард» — правда одновременно. Посчитать свою LLM

    habr.com/ru/articles/1060916/

    #LLM #обучение_LLM #pretraining #машинное_обучение #нейросети #GPU #RTX_5090 #H100 #стоимость_обучения_моделей #nanochat

  2. Своя GPT-like LLM по WH40K с нуля. Часть 3: pre-train LLM

    Привет, Хабр! Меня зовут Владимир, и это третья часть цикла статей по написании и обучению небольшой decoder-only LLM с нуля. В первой части мы обучили токенизатор и собрали pretrain-датасет, во второй части реализовали класс Трансформер-блока. В этой части будем собирать и предобучать нашу LLM.

    habr.com/ru/articles/1060454/

    #llm #gpt #pytorch #transformers #nlp #python #pretraining #text_generation

  3. Своя GPT-like LLM по WH40K с нуля. Часть 1: токенизируем Империум

    Привет, Хабр! Меня зовут Владимир, и я давно хотел погрузиться во вселенную Warhammer40K. Для погружение во вселенную я решил обучить LLM на лоре Warhammer40K. И чтобы было интереснее, код этой LLM я решил написать сам, на голом pytorch (ну почти). Данная статья - первая в цикле статей по созданию и обучению GPT-like LLM с нуля. В них я постараюсь рассказать, как работают Decoder-only модели, как обучить небольшую LLM, сколько это заняло у меня времени.

    habr.com/ru/articles/1056212/

    #llm #gpt #transformers #pytorch #nlp #bpe #huggingface #dataset #pretraining #python

  4. As of this morning: 🧠 425.49B tokens seen 📊 4.25% completed This eager reader wants more input, one token at a time. Follow along. 🔍 (2/2) #PreTraining #LLM #MultilingualAI #TransparentAI #goOpenEuroLLM

  5. Как я обучил GPT с нуля на русском языке — и что из этого получилось

    Всё началось с наивной мысли: зачем платить за API или тащить 7B-модель, если мне нужна маленькая модель для простых разговоров на одном языке? Логика казалась железной — большие модели умеют всё и на всех языках сразу, но это же избыточно. 0.7B, заточенная под один язык и один стиль общения, должна справляться не хуже. Спойлер: это было наивно. Но путь оказался ценнее результата.

    habr.com/ru/articles/1037532/

    #GPT #LLM #pretraining #распределённое_обучение #Google_Colab #RoPE #GQA #SwiGLU #NLP #русский_язык

  6. Brain Drain @ OpenAI continues.

    Andrej Karpathy a founding member of OpenAI is joining Anthropic and will focus on building out Anthropic's pretraining research .... axios.com/2026/05/19/anthropic #AI #Karpathy #Anthropic #OpenAI #BrainDrain #Pretraining #Claude #LLMs #FrontierAI

  7. Brain Drain @ OpenAI continues.

    Andrej Karpathy a founding member of OpenAI is joining Anthropic and will focus on building out Anthropic's pretraining research .... axios.com/2026/05/19/anthropic

  8. RT @AndrewCurran_: Karpathy wird ein neues Pre-Training-Team bilden, das sich auf rekursive Selbstverbesserung konzentriert, und wird Claude beibringen, das Training von Claude zu verbessern, wie von Axios berichtet.

    mehr auf Arint.info

    #AI #Axios #Karpathy #PreTraining #SelfImprovement #arint_info

    https://x.com/AndrewCurran_/status/2056776839402795041#m

  9. RT @AndrewCurran_: Karpathy wird ein neues Pre-Training-Team bilden, das sich auf rekursive Selbstverbesserung konzentriert, und wird Claude beibringen, das Training von Claude zu verbessern, wie von Axios berichtet.

    mehr auf Arint.info

    #AI #Axios #Karpathy #PreTraining #SelfImprovement #arint_info

    https://x.com/AndrewCurran_/status/2056776839402795041#m

  10. La leyenda urbana de «entrenar tu propio modelo de IAG» sigue siendo un anzuelo para monetizar tutoriales, cursos, masterclass y demás productos que los gurúes y promotores de la IA generativa usan para seguir lucrando a costa de todos los autores vulnerados. ¡No se dejen engañar!

    #AI #MachineLearning #data #training #finetuning #AImodel #genAI #generativeAI #pretraining #Copyright #opensource