Grundlagen
Multimodal
Ein Modell, das mehr als eine Art von Eingabe verarbeitet, etwa Text zusammen mit Bild, Audio oder Video.
Multimodale Modelle nehmen nicht nur Text, sondern auch Bilder, Audio oder Video als Eingabe. Praktisch heißt das: Ihr könnt einen Screenshot, ein Foto eines Whiteboards oder eine PDF-Seite anhängen und darüber sprechen.
Für den Alltag ist das oft der unterschätzte Teil. Ein Screenshot eines kaputten Layouts erklärt in einem Bild, was in Worten drei Absätze braucht. Umgekehrt bleibt die Genauigkeit bei Tabellen und Scans begrenzt, deshalb gehören extrahierte Zahlen kontrolliert.
Verwandte Begriffe
In der Praxis üben
In der AI Masterclass kommt dieser Begriff nicht als Definition vor, sondern in einer Session, in der damit gearbeitet wird.