KI-Glossar › Grundlagen
Benchmark
Standardisierte Tests, mit denen Hersteller ihre Modelle vergleichen – und warum man ihnen nicht blind trauen sollte.
Ein Benchmark ist ein fester Satz an Aufgaben – Matheprobleme, Programmieraufgaben, Wissensfragen –, an dem man Modelle misst. Neue Modelle werden fast immer mit einer Tabelle solcher Werte vorgestellt.
Warum Vorsicht angebracht ist
- Herstellerangaben: Die Zahlen stammen meist vom Anbieter selbst – unter Bedingungen, die er wählt.
- Auswendiglernen: Landen Testaufgaben in den Trainingsdaten, misst der Benchmark Gedächtnis statt Können.
- Alltag ≠ Test: Ein Punkt mehr im Benchmark heißt nicht, dass deine Aufgabe besser gelöst wird.
So halten wir es im Podcast: Herstellerzahlen nennen wir als solche. Aussagekräftiger sind unabhängige Nachtests – und der eigene Test mit echten Aufgaben.
Mehr dazu im Podcast
- Folge 2: Preisschlacht – erscheint am Di, 29. Sep. 2026
- Folge 7: Spitzen-KI auf dem Laptop – erscheint am Fr, 9. Okt. 2026
Hängt zusammen mit
Halluzination
Wenn eine KI überzeugend klingende, aber falsche Dinge erfindet – Quellen, Zahlen, Zitate.
Reasoning-Modell („Denkmodus“)
Modelle, die vor der Antwort erst intern nachdenken – besser bei kniffligen Aufgaben, aber langsamer und teurer.
Large Language Model (LLM)
Das Sprachmodell hinter ChatGPT, Claude, Gemini & Co. – ein Textvorhersage-System im Riesenformat.