KI News Kompakt

KI-Glossar › Grundlagen

Benchmark

Standardisierte Tests, mit denen Hersteller ihre Modelle vergleichen – und warum man ihnen nicht blind trauen sollte.

Ein Benchmark ist ein fester Satz an Aufgaben – Matheprobleme, Programmieraufgaben, Wissensfragen –, an dem man Modelle misst. Neue Modelle werden fast immer mit einer Tabelle solcher Werte vorgestellt.

Warum Vorsicht angebracht ist

So halten wir es im Podcast: Herstellerzahlen nennen wir als solche. Aussagekräftiger sind unabhängige Nachtests – und der eigene Test mit echten Aufgaben.

Mehr dazu im Podcast

Hängt zusammen mit

Halluzination

Wenn eine KI überzeugend klingende, aber falsche Dinge erfindet – Quellen, Zahlen, Zitate.

Reasoning-Modell („Denkmodus“)

Modelle, die vor der Antwort erst intern nachdenken – besser bei kniffligen Aufgaben, aber langsamer und teurer.

Large Language Model (LLM)

Das Sprachmodell hinter ChatGPT, Claude, Gemini & Co. – ein Textvorhersage-System im Riesenformat.