Grundlagen
Inferenz
Auch: Inference
Das Ausführen eines fertig trainierten Modells, also jede einzelne Anfrage.
Training und Inferenz sind zwei verschiedene Dinge. Trainiert wird ein Modell einmal, mit sehr viel Rechenleistung. Inferenz ist jede Nutzung danach: eine Frage rein, eine Antwort raus.
Für Kostenrechnungen ist fast immer nur die Inferenz relevant. Sie skaliert mit der Nutzung, nicht mit der Modellgröße allein, und sie ist der Posten, der ein Produkt teuer macht, wenn viele Nutzer:innen viele Tokens erzeugen.
Verwandte Begriffe
- Token
Die Recheneinheit eines Sprachmodells: ein Wortteil, nach dem Preise und Längenlimits bemessen werden.
- Fine-Tuning
Ein vorhandenes Modell mit eigenen Beispielen weitertrainieren, damit es Stil oder Format zuverlässig trifft.
- Open-Weight-Modell
Ein Modell, dessen Gewichte frei verfügbar sind, sodass es auf eigener Infrastruktur laufen kann.
In der Praxis üben
In der AI Masterclass kommt dieser Begriff nicht als Definition vor, sondern in einer Session, in der damit gearbeitet wird.