Zum Inhalt springen
AI READY

Grundbegriffe

Multimodale KI

Multimodale KI verarbeitet und verknüpft mehrere Datentypen – Text, Bild, Audio und teils Video – in einem Modell statt in getrennten Tools. So liest, hört und beschreibt ein System für euch Belege, Sprachnachrichten und Fotos, ohne Toolwechsel.

Das Wichtigste in Kürze

  • GPT-4o verarbeitet laut OpenAI jede Kombination aus Text, Audio, Bild und Video in einem Modell
  • Antwortzeit auf Audio-Eingaben bei GPT-4o: ab ca. 232 Millisekunden (OpenAI System Card)
  • Google Gemini kombiniert Text, Bild, Audio und Video nativ in einer Architektur (Gemini-Fachpapier)
  • Faustregel: Bild- und Audio-Verarbeitung kostet pro Anfrage meist mehr Rechenleistung als reiner Text

Was ist das?

Was bringt das eurem Betrieb?

Was kostet das?

Beispiel aus dem Mittelstand

Häufige Fragen

Was ist der Unterschied zwischen multimodaler KI und einem normalen Chatbot?

Ein klassischer Chatbot verarbeitet nur Text. Multimodale KI kann zusätzlich Bilder, Audio und teils Video als Eingabe verstehen und in einer Antwort zusammenführen.

Brauchen wir dafür eine eigene Serverinfrastruktur?

Nein, in der Regel läuft multimodale KI über die Cloud-Schnittstellen der Anbieter (z. B. OpenAI, Google). Eigene Infrastruktur wird meist nur bei besonders sensiblen Daten oder sehr hohem Datenvolumen relevant.

Ist multimodale KI für Kundendaten und Fotos datenschutzkonform einsetzbar?

Das hängt vom konkreten Anbieter, Vertrag und Verarbeitungsort ab – eine pauschale Aussage wäre unseriös. Prüft vor dem Einsatz, wo die Daten verarbeitet werden und ob ein Auftragsverarbeitungsvertrag vorliegt.

Quellen

Verwandte Begriffe

Ihr wollt herausfinden, wo das in eurem Betrieb Wirkung entfaltet?

AI Use Case Workshop ansehen
Multimodale KI einfach erklärt — AI READY