Glossar
Inferenzkosten
Auch: Token-Kosten · Inference Cost · Kosten pro Anfrage
Die laufenden Kosten je Anfrage an ein Sprachmodell, abgerechnet nach eingehenden und ausgehenden Token.
Ein KI-System hat einen Preis pro Vorgang, und den sollte man kennen, bevor die Menge steigt. Abgerechnet wird nach Token, also nach Textbausteinen, getrennt nach Eingabe und Ausgabe. Ausgabe ist regelmäßig ein Vielfaches teurer als Eingabe, was die wichtigste Entwurfsregel erklärt: kurze Antworten erzwingen, lange Kontexte sind das kleinere Problem.
Die Kostenkurve zwischen Modellstufen ist steil, der Qualitätsunterschied bei einfachen Aufgaben gering. Für Klassifikation, Extraktion und Zuordnung reicht fast immer das kleinste Modell, das die Aufgabe löst. Die großen Modelle gehören dorthin, wo wirklich Sprache erzeugt oder mehrschrittig geschlossen wird.
Der zweite große Hebel ist die Bündelung. Wer zwanzig Elemente einzeln bewerten lässt, bezahlt die Anweisung zwanzigmal, denn der System-Prompt geht bei jedem Aufruf mit. Gebündelt zahlt man sie einmal. Bei kurzen Nutzdaten und langer Anweisung macht das den größten Teil der Rechnung aus.
Zwischenspeicherung wirkt in zwei Formen: Prompt-Caching der Anbieter senkt den Preis für wiederkehrende Kontextteile deutlich, und ein eigener Cache vor dem Modell verhindert, dass dieselbe Frage zweimal bezahlt wird. Bei wiederkehrenden Anfragen ist der günstigste Aufruf der, der nicht stattfindet.
Was die Kalkulation regelmäßig sprengt, sind Wiederholungen: Ein Agent, der in einer Schleife arbeitet, erzeugt pro Aufgabe nicht einen Aufruf, sondern zehn. Bei mehrschrittigen Abläufen gehört deshalb eine harte Obergrenze in den Code, sonst ist der Preis pro Vorgang nicht nach oben begrenzt.
Gemessen wird pro fachlicher Einheit, nicht pro Monat: Kosten pro Anruf, pro Dokument, pro Ticket. Erst diese Zahl sagt, ob ein Anwendungsfall trägt. Eine steigende Gesamtrechnung bei stärker steigender Nutzung ist Erfolg, und ohne Bezugsgröße lässt sich das nicht unterscheiden.
Woran Sie es erkennen
- Niemand kann sagen, was ein einzelner Vorgang an Modellkosten verursacht.
- Die Modellwahl wurde einmal getroffen und seitdem nicht überprüft.
- Es gibt keine Obergrenze für Schritte je Anfrage.
- Elemente werden einzeln an das Modell geschickt, obwohl sie zusammen kämen.
Nicht zu verwechseln mit
- Trainingskosten
- Einmalig, um ein Modell zu erzeugen oder anzupassen. Inferenz ist der laufende Betrieb und in fast allen Projekten der größere Posten.
- Fine-Tuning
- Kostet einmalig Training und danach oft eine höhere Inferenzrate. Lohnt sich, wenn dadurch ein kleineres Modell reicht oder Prompts drastisch kürzer werden.
- Kontextfenster
- Die technische Obergrenze für die Eingabe, kein Preis. Aber jeder Token darin wird bezahlt, weshalb ein großes Fenster kein Grund ist, es zu füllen.
Wann es trägt
- Vor dem Produktivgang jeder KI-Funktion, die pro Nutzer oder pro Vorgang läuft.
- Wenn die Menge steigen soll: ein Preis pro Vorgang skaliert linear mit.
- Bei mehrschrittigen Agenten, wo ein Vorgang viele Aufrufe erzeugt.
Wann nicht
- Bei einem internen Werkzeug mit wenigen Aufrufen am Tag lohnt die Optimierung nicht.
- Als Argument gegen Qualität: Ein zu kleines Modell, das falsch klassifiziert, kostet mehr, als es spart.
Wie man rangeht
- Preis pro Vorgang messen, nicht schätzenToken je Anfrage protokollieren und mit der erwarteten Menge hochrechnen. Diese eine Zahl entscheidet, ob der Anwendungsfall trägt, und sie steht vor dem Bau fest.
- Mit dem kleinsten Modell anfangenErst hochstufen, wenn die Messung zeigt, dass die Qualität nicht reicht. Der umgekehrte Weg wird selten gegangen, weil niemand ein laufendes System herunterstuft.
- Bündeln statt einzeln fragenMehrere Elemente in einem Aufruf bewerten lassen. Die Anweisung wird einmal bezahlt statt zwanzigmal. Bündelgröße an das Ratelimit anpassen, nicht ans Maximum.
- Ausgabelänge begrenzenStrukturierte, knappe Antworten erzwingen. Ausgabe-Token sind das Teuerste an der Rechnung, und ein Modell, das frei formulieren darf, formuliert lang.
- ZwischenspeichernPrompt-Caching des Anbieters für wiederkehrende Kontextteile, eigener Cache für wiederkehrende Fragen. Beides senkt den Preis pro Vorgang ohne Qualitätsverlust.
- Obergrenze und Alarm setzenHarte Grenze für Schritte je Vorgang, Budgetalarm auf die Modellkosten. Ein Agent in einer Schleife ist der einzige Fall, in dem die Rechnung über Nacht explodiert.
Häufig gefragt
Wie senkt man Inferenzkosten am schnellsten?
In dieser Reihenfolge: kleineres Modell prüfen, Anfragen bündeln, Ausgabelänge begrenzen, zwischenspeichern. Die ersten beiden bringen in der Regel den größten Teil, und keiner der vier Schritte verlangt eine Architekturänderung.
Sind Eingabe- und Ausgabe-Token gleich teuer?
Nein, Ausgabe ist regelmäßig ein Vielfaches teurer. Deshalb wirkt eine erzwungene knappe Antwortstruktur oft stärker als ein gekürzter Kontext, obwohl die Intuition das Gegenteil nahelegt.
Lohnt sich ein eigenes Modell im eigenen Betrieb?
Erst ab erheblichem Volumen und dann mit anderen Kosten: Grafikkarten laufen auch dann, wenn keine Anfrage kommt. Ein Anbietermodell rechnet pro Anfrage ab und ist bei schwankender Last fast immer günstiger. Wo es um Datenschutz geht, ist die Rechnung eine andere.
Wie plant man Kosten für einen Agenten?
Nicht pro Aufruf, sondern pro abgeschlossener Aufgabe. Ein Agent macht pro Aufgabe mehrere Aufrufe, und die Anzahl schwankt. Deshalb gehören eine harte Obergrenze für Schritte und eine Messung der tatsächlichen Verteilung in den Bau, nicht in die Nachbetrachtung.
