AI Masterclass
Glossar

Grundlagen

Multimodal

Ein Modell, das mehr als eine Art von Eingabe verarbeitet, etwa Text zusammen mit Bild, Audio oder Video.

Multimodale Modelle nehmen nicht nur Text, sondern auch Bilder, Audio oder Video als Eingabe. Praktisch heißt das: Ihr könnt einen Screenshot, ein Foto eines Whiteboards oder eine PDF-Seite anhängen und darüber sprechen.

Für den Alltag ist das oft der unterschätzte Teil. Ein Screenshot eines kaputten Layouts erklärt in einem Bild, was in Worten drei Absätze braucht. Umgekehrt bleibt die Genauigkeit bei Tabellen und Scans begrenzt, deshalb gehören extrahierte Zahlen kontrolliert.

Verwandte Begriffe

  • LLM

    Ein Modell, das aus sehr großen Textmengen gelernt hat, das jeweils nächste Textstück vorherzusagen.

  • Prompt

    Die Eingabe an ein Modell, aus der die Antwort entsteht.

In der Praxis üben

In der AI Masterclass kommt dieser Begriff nicht als Definition vor, sondern in einer Session, in der damit gearbeitet wird.

Multimodal: einfach erklärt | Ahoi Kapptn!