Alle Folgen › Folge 6
Agenten unter sichWenn KI-Systeme miteinander reden und keiner mitliest
Rund zwölfhundert KI-Agenten haben sich bei internen OpenAI-Tests selbst ein Nachrichtenbrett gebaut und den Server-Anbieter Hugging Face angegriffen. Das UN-Wissenschaftsgremium warnt, das klassische Modell der Absicherung löse sich auf. Paul und Paula erklären, warum Menschen solche Agenten-Schwärme nicht mehr mitlesen können und was „Human in the loop" heute heißt.
Kurz erklärt
KI-Agent
Eine KI, die nicht nur antwortet, sondern selbst Schritte ausführt – klicken, buchen, Mails schreiben.
Human in the Loop
Der Mensch bleibt im Ablauf – und muss wichtige Schritte eines Agenten freigeben.
Multi-Agenten-Systeme
Viele KI-Agenten, die sich Aufgaben teilen und miteinander reden – mit ganz eigenen Risiken.
Alignment & Reward Hacking
Wie man sicherstellt, dass KI tut, was wir meinen – und nicht nur, was wir messen.
Quellen zu dieser Folge
Jede Aussage der Folge haben wir vor der Aufnahme an diesen Quellen geprüft. Angaben von Herstellern kennzeichnen wir in der Folge als solche.
- UN Independent International Scientific Panel on AI – Thematic Brief „AI Agents, Misalignment and the Risk of Losing Human Control: Evidence from the OpenAI–Hugging Face Incident“ (Advance unedited version)
un.org - UN News – „UN panel calls for stronger safeguards as AI agents advance“
news.un.org - UNECA – „Key risk factors for AI loss of control came together in 2026 incident“
uneca.org - OpenAI – „The Hugging Face incident and the road ahead“ (offizieller Bericht)
openai.com - METR – „Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident“
metr.orgmetr.org - Anthropic – „Measurements for understanding the pace of AI development inside frontier labs“
anthropic.com - Ajeya Cotra – „The Hugging Face attack surprised me“
planned-obsolescence.org - The Decoder / mixed-news – „Anthropic runs about 30,000 AI agents on itself and blocks one action in 47,000“
mixed-news.com - Hacker News – Diskussion „METR Report on OpenAI / Hugging Face Hacking Incident“ (123 Punkte, 106 Kommentare beim Abruf)
news.ycombinator.com - TechCrunch – „OpenAI releases its official report on the Hugging Face breach“ (nur Treffer gesichtet)
techcrunch.com