Alle Begriffe

Glossar

Guardrails

Auch: Leitplanken · Schutzmechanismen

Technische Grenzen um ein Sprachmodell herum, die festlegen, was hinein darf, was heraus darf und was es auslösen kann.

Guardrails sind kein einzelnes Produkt, sondern eine Sammlung von Grenzen an vier Stellen: vor dem Modell, im Modell, nach dem Modell und an den Werkzeugen. Die wirksamsten liegen nicht im Modell, sondern drumherum.

Vor dem Modell wird gefiltert, was hineingeht: Personendaten maskieren, Dateitypen und Größen begrenzen, offensichtliche Angriffsmuster abweisen. Danach wird geprüft, was herauskommt: Formatvalidierung, Schwellenwerte für Konfidenz, Sperrlisten für Inhalte, die nie erscheinen dürfen.

Die härteste und zugleich einfachste Grenze sind die Berechtigungen der angebundenen Werkzeuge. Ein Modell, das keine Löschrechte hat, löscht auch unter Angriff nichts. Diese Grenze ist die einzige, die nicht auf Textprüfung beruht und damit die einzige, die zuverlässig hält.

Ein Guardrail, der oft fehlt, ist der Rückfallweg. Was passiert, wenn die Prüfung anschlägt? Ein System, das dann einfach nichts tut, ist im Zweifel schlimmer als eines, das eskaliert: Der Vorgang verschwindet, statt einen Menschen zu erreichen. Jede Grenze braucht einen definierten Ausgang.

Guardrails kosten Qualität, und das ist der ehrliche Teil. Zu enge Filter blocken legitime Fälle, zu strenge Formatvorgaben erzwingen unpassende Antworten. Die Einstellung ist ein Abwägen, keine Optimierung, und sie gehört gemessen wie jede andere Änderung am System.

Der Standardfehler ist, Guardrails als Prompt zu bauen. „Antworte niemals über Preise" ist eine Bitte, keine Grenze. Sicherheitsrelevante Entscheidungen gehören in Code, in Rechte und in Prüfungen, nicht in einen Text, den ein anderer Text überschreiben kann.

Woran Sie es erkennen

  • Sicherheitsanforderungen stehen als Sätze im System-Prompt.
  • Es gibt keine Schema-Prüfung für strukturierte Antworten.
  • Wenn eine Prüfung greift, passiert nichts weiter.
  • Niemand weiß, wie oft welche Grenze greift.

Nicht zu verwechseln mit

System-Prompt
Steuert Verhalten und Ton, aber ist keine Grenze. Er lässt sich durch Inhalte im Kontext beeinflussen und taugt nicht als Sicherheitsmaßnahme.
Human in the Loop
Ein Mensch als Prüfstufe. Der stärkste Guardrail für folgenschwere Aktionen und der teuerste, weshalb er gezielt eingesetzt wird.
Evaluation
Misst Qualität über die Zeit. Guardrails greifen im Einzelfall zur Laufzeit. Beides zusammen: die Evaluation zeigt, ob die Guardrails zu eng oder zu weit stehen.

Wann es trägt

  • Das System ist für Externe erreichbar oder verarbeitet fremde Inhalte.
  • Angebundene Werkzeuge können Daten ändern, versenden oder löschen.
  • Die Antworten haben rechtliche oder finanzielle Wirkung.

Wann nicht

  • Als Ersatz für ein Rechtemodell. Ein Filter, der eine fehlende Berechtigung kompensieren soll, hält nicht.
  • In der frühen Erprobung mit internen Nutzern und ohne schreibende Werkzeuge: dort bremsen sie das Lernen.

Wie man rangeht

  1. Zuerst die RechteWas kann jedes Werkzeug im schlimmsten Fall anrichten, und lässt sich das einschränken. Diese Frage bringt mehr Sicherheit als jede Textprüfung.
  2. Eingaben begrenzenGrößen, Formate und Quellen festlegen, Personendaten maskieren, bevor sie das Modell sehen. Was nie im Kontext war, kann nicht abfließen.
  3. Ausgaben validierenStrukturierte Antworten gegen ein Schema prüfen, nicht gegen ein Bauchgefühl. Was nicht validiert, wird verworfen oder eskaliert, statt weiterverarbeitet zu werden.
  4. Voreinstellung auf AblehnenBei Unsicherheit lieber nicht handeln. Falsche Treffer kosten Vertrauen, verpasste kosten wenig, und die Schwelle lässt sich später senken.
  5. Rückfallweg definierenJede greifende Grenze braucht ein Ziel: Warteschlange, Mensch, Ticket. Ein Vorgang, der still verschwindet, ist der schlechteste Ausgang.
  6. Wirkung messenWie oft greift welche Grenze, und wie viele davon waren legitime Fälle. Ohne diese Zahl weiß niemand, ob die Guardrails schützen oder behindern.

Häufig gefragt

Reichen die Guardrails des Anbieters?

Sie decken allgemeine Inhaltsrisiken ab, kennen aber Ihre Fachlichkeit nicht. Was in Ihrem Kontext nicht gesagt oder nicht ausgelöst werden darf, weiß nur Ihr System. Anbieter-Guardrails sind eine Grundlage, keine vollständige Lösung.

Wie streng sollten Guardrails eingestellt sein?

Am Anfang eher streng, mit Voreinstellung auf Ablehnen, und dann anhand der Messung lockern. Falsche Treffer kosten Vertrauen, verpasste kosten meist nur einen zusätzlichen Vorgang. Wichtig ist, dass abgelehnte Fälle sichtbar irgendwo landen.

Wo gehören Guardrails hin, in den Prompt oder in den Code?

Verhalten und Ton in den Prompt, Sicherheit und Korrektheit in den Code. Alles, was jemand umgehen können sollte, gehört in Rechte, Validierung und Prüfungen außerhalb des Modells. Ein Prompt lässt sich durch Text im Kontext beeinflussen, ein Rechtemodell nicht.

WeiterlesenEin KI-System mit Budget null: sechs Entscheidungen, drei Fehler