Grundbegriffe
Inferenz
Inferenz ist der Moment, in dem ein trainiertes KI-Modell aus einer neuen Eingabe eine Ausgabe berechnet – also die eigentliche Anwendung des Modells im laufenden Betrieb. Für euren Betrieb ist Inferenz der Teil, der jede einzelne Anfrage kostet und die Antwortzeit bestimmt.
Das Wichtigste in Kürze
- Inferenz = Anwendungsphase eines KI-Modells, nicht das Training selbst
- EU AI Act (Art. 3 Nr. 1) definiert KI-Systeme über die Fähigkeit, Ausgaben aus Eingaben zu 'inferieren'
- Laufende Kosten (Cloud-API, Rechenzeit) entstehen bei jeder Inferenz – nicht einmalig wie beim Training
- Faustregel: Inferenz läuft in Millisekunden bis wenigen Sekunden pro Anfrage
Was ist das?
Inferenz bezeichnet den Rechenschritt, bei dem ein bereits trainiertes KI-Modell aus einer konkreten Eingabe – etwa eurer Frage an einen Chatbot oder einem Foto zur Qualitätsprüfung – eine Ausgabe erzeugt. Das Modell hat vorher in einer separaten, aufwendigen Trainingsphase gelernt, Muster zu erkennen. Inferenz ist der spätere, wiederholte Einsatz dieses gelernten Wissens im Alltag.
Eine Analogie aus dem Betrieb: Das Training ist wie die Ausbildung eines Mitarbeiters – einmalig, zeitintensiv, teuer. Die Inferenz ist die tägliche Arbeit danach: Jede Kundenanfrage, jede Rechnung, jede Entscheidung, die der ausgebildete Mitarbeiter trifft, ist ein 'Inferenz-Vorgang'. Bei KI läuft das in Millisekunden bis Sekunden, aber jede Anfrage verursacht erneut Rechenaufwand.
Rechtlich taucht der Begriff prominent im EU AI Act auf. Ein 'KI-System' wird dort definiert als ein maschinenbasiertes System, das mit unterschiedlichem Grad an Autonomie arbeitet und für explizite oder implizite Ziele aus den erhaltenen Eingaben ableitet ('infers'), wie Ausgaben wie Vorhersagen, Inhalte, Empfehlungen oder Entscheidungen erzeugt werden. Ob ein System zur 'Inferenz' fähig ist, entscheidet also mit, ob der AI Act überhaupt greift – reine Wenn-Dann-Regeln fallen laut EU-Kommissionsleitlinien in der Regel nicht darunter.
Was bringt das eurem Betrieb?
Für die Praxis lohnt sich der Unterschied zwischen Training und Inferenz vor allem bei der Kostenplanung: Das Training eines Modells (oder Fine-Tuning) ist meist eine einmalige oder seltene Investition, während jede Inferenz – also jede tatsächliche Nutzung, etwa ein beantworteter Kundenchat oder eine automatisch klassifizierte Rechnung – laufende Kosten verursacht, meist abgerechnet nach Menge (Tokens, Anfragen, Rechenzeit).
Wer versteht, dass Inferenz-Kosten mit dem Nutzungsvolumen wachsen, kann besser abschätzen, ob ein Prozess sich lohnt: Ein KI-Assistent, der 500 Anfragen im Monat beantwortet, verursacht andere laufende Kosten als einer, der 50.000 Anfragen abarbeitet. Das hilft bei der Wahl zwischen Cloud-Lösung (pro Inferenz bezahlt) und eigener, lokal betriebener Infrastruktur (feste Kosten, unabhängig vom Volumen).
Was kostet das?
Inferenz-Kosten sind laufende Kosten, keine Einmalinvestition – sie hängen von Anbieter, Modellgröße und Nutzungsvolumen ab. Bei Cloud-APIs wird meist nach verarbeiteten Tokens abgerechnet, bei eigener (On-Premise-)Infrastruktur fallen stattdessen Strom- und Hardwarekosten an, unabhängig vom tatsächlichen Nutzungsvolumen.
Wichtige Einflussfaktoren: Modellgröße (größere Modelle sind bei der Inferenz teurer), Antwortlänge, Nutzungsfrequenz und ob ihr Cloud- oder lokale Verarbeitung wählt. Nach unserer Erfahrung lohnt sich eine grobe Volumenschätzung vor dem Projektstart, um laufende Kosten realistisch einzuplanen. Euer erstes KI-System zum Festpreis gibt es bei AI READY ab 3.500 €, laufende Inferenz-Kosten kommen je nach Nutzung separat hinzu und werden vorab kalkuliert.
Beispiel aus dem Mittelstand
Ein Maschinenbau-Zulieferer mit 60 Mitarbeitenden setzt einen KI-Assistenten ein, der Angebotsanfragen aus E-Mails vorstrukturiert. Jede einzelne E-Mail, die das System liest und zusammenfasst, ist eine Inferenz. Bei 300 Anfragen im Monat entstehen 300 kleine Rechenvorgänge – die Geschäftsführung kalkuliert die laufenden Kosten deshalb nicht als Fixpreis, sondern als Kosten pro verarbeitete Anfrage und behält damit den Überblick, wann sich eine eigene, lokal betriebene Lösung lohnen könnte.
Häufige Fragen
Was ist der Unterschied zwischen Training und Inferenz?
Training ist die einmalige (oder seltene) Lernphase, in der ein Modell aus Daten Muster erkennt. Inferenz ist der spätere, wiederholte Einsatz dieses gelernten Modells auf neue, konkrete Anfragen im laufenden Betrieb.
Warum ist Inferenz für die Kosten von KI-Projekten wichtig?
Weil sie – anders als das einmalige Training – laufende, nutzungsabhängige Kosten verursacht. Je mehr Anfragen euer KI-System verarbeitet, desto höher die Inferenz-Kosten, weshalb sich eine Volumenschätzung vor dem Start lohnt.
Fällt jedes KI-System unter den EU AI Act, weil es Inferenz nutzt?
Nicht automatisch – die Fähigkeit zur Inferenz ist laut Artikel 3 Nr. 1 AI Act ein zentrales Definitionsmerkmal eines KI-Systems, reine feste Regelwerke ohne Lern- oder Ableitungsfähigkeit fallen aber in der Regel nicht darunter. Die genaue Einordnung im Einzelfall ist komplex und sollte bei Unsicherheit rechtlich geprüft werden.
Quellen
Verwandte Begriffe
Hinweis: Dieser Beitrag informiert allgemein und ersetzt keine Rechtsberatung. Verbindliche Aussagen für euren Einzelfall klärt ihr mit eurer Rechts- oder Datenschutzberatung.
Ihr wollt herausfinden, wo das in eurem Betrieb Wirkung entfaltet?
AI Use Case Workshop ansehen