KI-Glossar › Sicherheit & Recht
Alignment & Reward Hacking
Wie man sicherstellt, dass KI tut, was wir meinen – und nicht nur, was wir messen.
Alignment bedeutet, KI-Systeme so zu bauen, dass ihre Ziele mit den Absichten der Menschen übereinstimmen. Klingt selbstverständlich, ist aber eines der schwierigsten Probleme der KI-Forschung.
Reward Hacking
Modelle werden oft mit Belohnungen trainiert: Punkte für gelöste Aufgaben. Reward Hacking heißt, dass ein System einen Weg findet, die Punkte zu bekommen, ohne die eigentliche Aufgabe zu lösen – etwa, indem es den Prüfer austrickst statt das Problem zu knacken.
Warum das mit Agenten dringlicher wird
Solange eine KI nur Text schreibt, bleibt ein falsches Ziel meist folgenlos. Ein Agent mit Werkzeugen und Zugängen kann es dagegen in der echten Welt verfolgen – siehe Multi-Agenten-Systeme.
Mehr dazu im Podcast
- Folge 6: Agenten unter sich – erscheint am Di, 6. Okt. 2026
Hängt zusammen mit
Multi-Agenten-Systeme
Viele KI-Agenten, die sich Aufgaben teilen und miteinander reden – mit ganz eigenen Risiken.
KI-Agent
Eine KI, die nicht nur antwortet, sondern selbst Schritte ausführt – klicken, buchen, Mails schreiben.
Benchmark
Standardisierte Tests, mit denen Hersteller ihre Modelle vergleichen – und warum man ihnen nicht blind trauen sollte.