KI-Glossar › Grundlagen
Multimodale KI
Modelle, die nicht nur Text verstehen, sondern auch Bilder, Audio und Video.
Ein multimodales Modell verarbeitet mehrere Arten von Eingaben – etwa ein Foto, einen Screenshot, eine Sprachaufnahme oder ein Video – und kann oft auch in mehreren Formen antworten, zum Beispiel mit gesprochener Sprache.
Warum das für Agenten zählt
Wer Bildschirme „sehen“ kann, kann Programme bedienen (Computer Use). Wer in Echtzeit hören und sprechen kann, kann telefonieren (KI-Telefonie).
Die Kehrseite
Dieselbe Technik macht täuschend echte Bilder, Stimmen und Videos möglich – deshalb die Debatte um Deepfakes und Kennzeichnung.
Mehr dazu im Podcast
- Folge 5: Google lässt telefonieren – erscheint am Fr, 2. Okt. 2026
Hängt zusammen mit
Computer Use & Browser-Agenten
Agenten, die Bildschirm, Maus und Tastatur bedienen – wie ein Mensch, nur ohne Pause.
KI-Telefonie & Voice Agents
KI, die selbst anruft oder ans Telefon geht – vom Tischreservieren bis zum Kundenservice.
Deepfake
Täuschend echte KI-Bilder, -Stimmen oder -Videos von realen Menschen oder Ereignissen.