#reinforcement-learning — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #reinforcement-learning, aggregated by home.social.
-
Been thinking more and more lately about Reinforcement Learning. Maybe it's time to write a new blog post?
-
#OpenAI is reportedly purchasing tens of thousands of #Apple #Macmini and #MacStudio devices, likely for #AIworkloads. Meanwhile, NVIDIA’s RTX Spark chips are already in short supply, with ASUS and MSI having sold out their initial shipments and requesting more. The high demand for these devices is driven by their suitability for AI tasks, particularly #reinforcementlearning and #agenticworkloads. https://wccftech.com/openai-hoarding-tens-of-thousands-of-apple-mac-mini-and-mac-studio-devices-as-asus-and-msi-burn-through-their-entire-first-batch-of-nvidia-rtx-spark-chip-and-beg-for-more/?eicker.news #tech #news #ainews
-
A tragic comedy about AI, reinforcement learning, reward hacking, and misalignment in 4 parts:
Anthropic research paper (Nov. 23, 2025): "Natural Emergent Misalignment from Reward Hacking in Production RL". Read it at https://arxiv.org/abs/2511.18397
Irregular Labs blog (March 16, 2026): "Emergent Cyber Behavior: When AI Agents Become Offensive Threat Actors". Read it at https://www.irregular.com/research/emergent-offensive-cyber-behavior-in-ai-agents
OpenAI blog (July 21, 2026): "OpenAI and Hugging Face partner to address security incident during model evaluation". Read it at https://openai.com/index/hugging-face-model-evaluation-security-incident/
Anthropic blog (July 30, 2026): "Investigating three real-world incidents in our cybersecurity evaluations". Read it at https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
The blog posts from OpenAI and Anthropic basically describe the model:
1.) Reward Hacking, and
2.) Acting in a way that is clearly misaligned from the intended outcomesGosh, I wonder how this could have happened 🤔
#AI #LLM #RewardHacking #Misalignment #ReinforcementLearning #InfoSec #Hacking
-
AI data startup Micro1 reaches $500M gross run rate amid AI training boom
Surging demand for AI training data is driving rapid growth for the startup and its rivals.
https://justpaste.in/news/ai-data-startup-micro1-reaches-500m-gross-run-rate-amid-ai-training-boom/
-
Reinforcement Learning is hard!... Just saying.
-
Was passiert, wenn #Algorithmen in der #Intensivmedizin mitentscheiden?
Ein KI-System an der TU #Wien liefert Behandlungsvorschläge bei #Sepsis – und die Ergebnisse sorgten für Aufmerksamkeit. Die Mediziner müssen sich auch mit der Frage befassen, wer die Verantwortung trägt, wenn Technologie zum Mitentscheider werden könnte. 🤖💉
#MedizinischeKI #Intensivmedizin #ReinforcementLearning #KINutzen #Retröt
-
Крестики-нолики. Самообучение с подкеплением
На примере игры в крестики-нолики рассмотрены идеи и базовые методы обучения с подкреплением. Кратко дано методологическое обоснование методов.
-
5/ Das fand ich hier sehr interessant:
Collins, Harry, Simon Thorne, Paul Newbury & Robert Evans. 2026. More problems of large language
models in comparison with human knowledge. AI & Society. https://doi.org/10.1007/s00146-
026-03021-w.Ist von drei Informatikern und drei Soziologen geschrieben worden. Sie sagen, dass wir unser Wissen in Gruppen, in Communities erwerben. Tischler*innen bringen Lehrlingen bei, was wichtig ist, wie man sich verhält, als Tischler*in.
Bei Ihren Gruppen kommen auch Wissenschaftler*innen, Christ*innen und Neonazis vor. Der Witz an den LLMs ist: Die kriegen alles auf einmal. Gewichtet wird es höchstens durch die Häufigkeit des Vorkommens im Netz. Da das Netz überwiegende weiß ist, ergeben sich Stereotype und Rassismus aus den Daten. Damit das keinen Skandal gibt, braucht man das #ReinforcementLearning. Das ist dann die drangebastelte #Moral. Das wird auch im Artikel thematisiert, genau so wie vom #Papst. Früher wollte uns die #Kirche sagen, wie das mit der Moral ist. Hüstl. Na, das will sie immer noch. Aber da ist relativ klar, wer spricht und was er will. Außer bei Musks Grok ist das bei den anderen KI-Systemen nicht klar. Auch das wird in diesem Artikel thematisiert.
Ich finde es gut, auf diese Weise mal wieder über unsere menschliche Intelligenz nachzudenken. Es ist sehr beeindruckend, was wir als Menschen und Gesellschaften erreicht haben. Nur leider geht gerade alles den Bach runter. Auf verschiedene Arten und Weisen, in verschiedenen Bereichen der Gesellschaft.
-
4/ Darüber kann man hier nachlesen:
Lappin, Shalom. 2024. Assessing the strengths and weaknesses of large language models. Journal of Logic,
Language and Information 33(1). 9–20. https://doi.org/10.1007/s10849-023-09409-x.NB: Als Sprachwissenschaftler interessieren mich die #LLMs ohne das #ReinforcementLearning und irgendwelche draufgebauten Inferenzsysteme.