KI News Kompakt

KI-Glossar › Grundlagen

Multimodale KI

Modelle, die nicht nur Text verstehen, sondern auch Bilder, Audio und Video.

Ein multimodales Modell verarbeitet mehrere Arten von Eingaben – etwa ein Foto, einen Screenshot, eine Sprachaufnahme oder ein Video – und kann oft auch in mehreren Formen antworten, zum Beispiel mit gesprochener Sprache.

Warum das für Agenten zählt

Wer Bildschirme „sehen“ kann, kann Programme bedienen (Computer Use). Wer in Echtzeit hören und sprechen kann, kann telefonieren (KI-Telefonie).

Die Kehrseite

Dieselbe Technik macht täuschend echte Bilder, Stimmen und Videos möglich – deshalb die Debatte um Deepfakes und Kennzeichnung.

Mehr dazu im Podcast

Hängt zusammen mit

Computer Use & Browser-Agenten

Agenten, die Bildschirm, Maus und Tastatur bedienen – wie ein Mensch, nur ohne Pause.

KI-Telefonie & Voice Agents

KI, die selbst anruft oder ans Telefon geht – vom Tischreservieren bis zum Kundenservice.

Deepfake

Täuschend echte KI-Bilder, -Stimmen oder -Videos von realen Menschen oder Ereignissen.