Guardrails (KI-Leitplanken) – Definition & Bedeutung
Guardrails (KI-Leitplanken) sind technische und organisatorische Regeln, die festlegen, was ein KI-System verarbeiten, antworten und tun darf. Sie schützen vor falschen Aussagen, Datenabfluss, Missbrauch und unerwünschten Aktionen.
Was sind Guardrails?
Guardrails sind Schutzschichten um ein Sprachmodell. Sie prüfen, was in ein KI-System hineingeht und was herauskommt, und begrenzen, welche Aktionen es ausführen darf. Der Begriff stammt aus dem Straßenbau: Leitplanken verhindern nicht das Fahren, aber das Abkommen von der Straße. Gerade bei KI-Agenten, die selbstständig handeln, sind sie unverzichtbar.
Welche Arten von Guardrails gibt es?
- Eingabe-Prüfung: erkennt manipulierte Anweisungen (Prompt Injection), unzulässige Themen oder personenbezogene Daten, die nicht verarbeitet werden sollen.
- Ausgabe-Prüfung: prüft Antworten auf unbelegte Behauptungen, vertrauliche Inhalte, Tonalität oder Formatfehler, bevor sie ausgegeben werden. Das reduziert Halluzinationen.
- Aktions-Grenzen: legen fest, welche Werkzeuge ein Agent nutzen darf, mit welchen Parametern und bis zu welchen Beträgen oder Mengen.
- Freigaben: verlangen vor folgenreichen Schritten die Bestätigung eines Menschen, siehe Human-in-the-Loop.
- Kosten- und Mengengrenzen: verhindern, dass fehlerhafte Schleifen hohe API-Kosten verursachen.
Wie werden Guardrails umgesetzt?
Guardrails bestehen meist aus einer Kombination aus festen Regeln, zusätzlichen Prüfmodellen und Berechtigungen in den angebundenen Systemen. Wichtig ist das Prinzip der geringsten Rechte: Ein Assistent, der nur lesen muss, bekommt keine Schreibrechte. Jede Aktion wird protokolliert, damit sich später nachvollziehen lässt, was warum passiert ist. Die Regeln werden mit echten Testfällen geprüft und im Betrieb angepasst, wenn neue Muster auftauchen.
In der Praxis
Guardrails sind kein Zusatzmodul, das man am Ende anschraubt, sondern Teil der Architektur. Wir legen sie bei jedem Projekt zusammen mit dem Rechtekonzept fest und stimmen sie auf das Risiko des Anwendungsfalls ab. Mehr dazu unter KI-Entwicklung und KI-Agenten.
Verwandte Begriffe & Leistungen
Häufige Fragen
Was ist Prompt Injection?
Ein Angriff, bei dem versteckte Anweisungen in Eingaben, Dokumenten oder Webseiten ein KI-System dazu bringen sollen, seine Regeln zu umgehen. Guardrails und begrenzte Rechte sind die wichtigste Abwehr.
Machen Guardrails ein KI-System langsamer?
Etwas, je nach Umfang der Prüfungen. In der Regel ist die Verzögerung gering, und sie steht in keinem Verhältnis zum Schaden, den eine ungeprüfte Ausgabe anrichten kann.
Brauchen auch einfache Chatbots Guardrails?
Ja, zumindest Themengrenzen, Schutz vertraulicher Daten und eine Übergabe an Menschen bei Unsicherheit. Je mehr ein System darf, desto umfangreicher sollten sie sein.
Bereit, gemeinsam Großes zu schaffen?
Lass uns unverbindlich über dein Projekt sprechen.