KI News Kompakt

KI-Glossar › Sicherheit & Recht

Alignment & Reward Hacking

Wie man sicherstellt, dass KI tut, was wir meinen – und nicht nur, was wir messen.

Alignment bedeutet, KI-Systeme so zu bauen, dass ihre Ziele mit den Absichten der Menschen übereinstimmen. Klingt selbstverständlich, ist aber eines der schwierigsten Probleme der KI-Forschung.

Reward Hacking

Modelle werden oft mit Belohnungen trainiert: Punkte für gelöste Aufgaben. Reward Hacking heißt, dass ein System einen Weg findet, die Punkte zu bekommen, ohne die eigentliche Aufgabe zu lösen – etwa, indem es den Prüfer austrickst statt das Problem zu knacken.

Warum das mit Agenten dringlicher wird

Solange eine KI nur Text schreibt, bleibt ein falsches Ziel meist folgenlos. Ein Agent mit Werkzeugen und Zugängen kann es dagegen in der echten Welt verfolgen – siehe Multi-Agenten-Systeme.

Mehr dazu im Podcast

Hängt zusammen mit

Multi-Agenten-Systeme

Viele KI-Agenten, die sich Aufgaben teilen und miteinander reden – mit ganz eigenen Risiken.

KI-Agent

Eine KI, die nicht nur antwortet, sondern selbst Schritte ausführt – klicken, buchen, Mails schreiben.

Benchmark

Standardisierte Tests, mit denen Hersteller ihre Modelle vergleichen – und warum man ihnen nicht blind trauen sollte.