home.social

#rlaif — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #rlaif, aggregated by home.social.

fetched live
  1. [Перевод] Законы масштабирования – архитектура O1 Pro // Инфраструктура синтетических данных, RLAIF, токеномика вычислений

    С каждым днем растут страхи и сомнения относительно законов масштабирования ИИ. Большинство предсказателей отрасли ИИ утверждают об окончании законов масштабирования, которые за последние несколько лет привели к мгновенному улучшению возможностей крупных языковых моделей (LLM). К ним присоединились журналисты, вооружившись неопределенной информацией о неспособности моделей успешно масштабироваться из-за предполагаемой низкой производительности. Критики также указывают на исчерпание доступных данных для обучения и замедление масштабирования оборудования для обучения.

    habr.com/ru/articles/869674/

    #O1_Pro #AI_Lab #RLAIF #Законы_масштабирования #синтетические_данные #OpenAI #Claude_35_Opus #RLHF #llm #supervised_finetuning

  2. As usual, the Strange Loop conference has produced some interesting talks.

    This one is on interpretability in large language models and other deep networks:

    youtu.be/Gx2mDuVAClo?si=J4d3-i

    #ai #salami #ml #machinelearning #LLMs #gpt #intelligence #rlaif #rlhf #computing #computation #computationalscience

  3. As usual, the Strange Loop conference has produced some interesting talks.

    This one is on interpretability in large language models and other deep networks:

    youtu.be/Gx2mDuVAClo?si=J4d3-i

    #ai #salami #ml #machinelearning #LLMs #gpt #intelligence #rlaif #rlhf #computing #computation #computationalscience

  4. Is the Reinforcement Learning (RL) in #RLHF and #RLAIF even necessary? What does RL discover that cannot be seen in offline training?

  5. Is the Reinforcement Learning (RL) in #RLHF and #RLAIF even necessary? What does RL discover that cannot be seen in offline training?

  6. What has changed fundamentally that Reinforcement Learning (with Human Feedback or AI Feedback) #rlhf #rlaif has become unmistakenly potent for large language models?

  7. What has changed fundamentally that Reinforcement Learning (with Human Feedback or AI Feedback) #rlhf #rlaif has become unmistakenly potent for large language models?