Alle Begriffe

Glossar

LLM-Evaluation

Auch: Evaluation · Evals · Qualitätsmessung

Ein wiederholbares Verfahren, mit dem sich messen lässt, ob Antworten eines Sprachmodells besser oder schlechter werden.

Ohne Evaluation ist jede Änderung an einem KI-System eine Vermutung. Ein neuer Prompt fühlt sich besser an, ein neues Modell klingt flüssiger, und ob die Trefferquote gestiegen oder gefallen ist, weiß niemand. Das fällt erst auf, wenn sich Nutzer beschweren, und dann liegen mehrere Änderungen dazwischen.

Der Kern ist ein fester Testsatz: echte Fälle mit bekannter richtiger Antwort. Er muss nicht groß sein. Fünfzig gut ausgewählte Beispiele, die die typischen und die schwierigen Fälle abdecken, sind mehr wert als tausend zufällige. Wichtig ist, dass sie eingefroren sind, sonst misst man gegen ein bewegliches Ziel.

Wie gemessen wird, hängt von der Aufgabe ab. Bei Klassifikation und Extraktion gibt es eine richtige Antwort, dort rechnet man Trefferquote, Präzision und Ausbeute. Bei frei formulierten Antworten hilft ein zweites Modell als Prüfer, dessen Urteil gegen eine Stichprobe menschlicher Bewertung kalibriert wird.

Bei RAG-Systemen wird die Kette getrennt gemessen: Wurde der richtige Ausschnitt gefunden, wurde er hoch genug einsortiert, und hat das Modell ihn korrekt verwendet. Eine Gesamtnote verdeckt, an welcher Stelle es klemmt, und behandelt dann das falsche Problem.

Zwei Zahlen gehören immer dazu, weil sie sonst gegeneinander optimiert werden: die Kosten pro Vorgang und die Antwortzeit. Ein Prompt, der die Qualität um zwei Punkte hebt und die Kosten verdoppelt, ist keine eindeutige Verbesserung.

Die Evaluation gehört in die Pipeline, nicht in ein Notebook. Läuft sie nur, wenn jemand daran denkt, läuft sie nach drei Wochen nicht mehr, und der Testsatz veraltet still.

Woran Sie es erkennen

  • Prompt-Änderungen werden an wenigen zufälligen Beispielen geprüft.
  • Nach einem Modellwechsel weiß niemand, ob die Qualität gestiegen ist.
  • Beschwerden von Nutzern sind die erste Quelle für Qualitätsprobleme.
  • Es gibt keine Zahl für Kosten und Antwortzeit je Vorgang.

Nicht zu verwechseln mit

Benchmarks
Vergleichen Modelle auf öffentlichen Aufgaben. Sagen wenig darüber, wie ein Modell in Ihrem Anwendungsfall abschneidet, weil Ihre Daten und Ihr Prompt fehlen.
Monitoring
Beobachtet den laufenden Betrieb: Fehlerquoten, Latenz, Kosten. Evaluation prüft Qualität gegen bekannte richtige Antworten, meist vor dem Ausrollen.
A/B-Test
Misst Wirkung an echten Nutzern, dauert länger und braucht Volumen. Evaluation gibt eine Antwort in Minuten und fängt die groben Verschlechterungen vorher ab.

Wann es trägt

  • Sobald mehr als eine Person am Prompt oder an der Kette arbeitet.
  • Vor jedem Modellwechsel, auch bei einer neuen Version desselben Modells.
  • Wenn Antworten fachliche oder finanzielle Wirkung haben.

Wann nicht

  • In der ersten Erkundungsphase, solange sich die Aufgabe selbst noch ändert.
  • Als Ersatz für Beobachtung im Betrieb. Ein Testsatz kennt nur die Fälle, die jemand hineingelegt hat.

Wie man rangeht

  1. Testsatz aus echten Fällen bauenFünfzig bis zweihundert Beispiele aus der tatsächlichen Nutzung, mit richtiger Antwort. Bewusst auch die Grenzfälle, an denen das System bisher gescheitert ist.
  2. Metrik zur Aufgabe wählenBei fester Antwort Trefferquote und Präzision, bei freiem Text ein Prüfmodell mit kalibrierter Bewertung. Eine Note ohne definierte Metrik ist ein Gefühl mit Nachkommastelle.
  3. Kette getrennt messenBei RAG Suche, Sortierung und Formulierung einzeln. Sonst weiß man, dass es schlechter wurde, aber nicht wo.
  4. Kosten und Zeit mitführenJede Messung notiert Preis pro Vorgang und Antwortzeit. Sonst wird Qualität auf Kosten der beiden anderen Größen optimiert.
  5. In die Pipeline nehmenAutomatisch bei jeder Änderung an Prompt, Kette oder Modellversion. Eine Verschlechterung über einer Schwelle blockiert das Ausrollen.
  6. Fehlerfälle zurückspeisenJeder gemeldete Fehler wird ein neuer Testfall. So wächst der Satz genau um die Fälle, die in der Realität schiefgehen.

Häufig gefragt

Wie groß muss ein Testsatz sein?

Kleiner als die meisten denken. Fünfzig bis zweihundert gut ausgewählte Fälle reichen, um grobe Verschlechterungen zuverlässig zu erkennen. Wichtiger als die Menge ist die Auswahl: typische Fälle, Grenzfälle und die, an denen das System schon einmal gescheitert ist.

Kann ein Modell ein anderes Modell bewerten?

Ja, und für frei formulierte Antworten ist das oft der einzige praktikable Weg. Wichtig ist die Kalibrierung: eine Stichprobe von Hand bewerten und prüfen, ob das Prüfmodell ähnlich urteilt. Ohne diesen Abgleich misst man die Meinung eines Modells über ein anderes.

Wie oft sollte die Evaluation laufen?

Bei jeder Änderung an Prompt, Kette, Wissensbasis oder Modellversion, automatisch in der Pipeline. Zusätzlich regelmäßig ohne Änderung, weil Anbietermodelle sich ändern können, ohne dass die Versionsnummer es verrät.

Was misst man bei einem RAG-System?

Drei Dinge getrennt: ob der richtige Ausschnitt gefunden wurde, ob er weit genug oben stand, und ob die Antwort ihn korrekt verwendet. Erst diese Trennung sagt, ob an der Suche, an der Sortierung oder am Prompt gearbeitet werden muss.

WeiterlesenEin KI-System mit Budget null: sechs Entscheidungen, drei Fehler