KI-Richtlinie Erkennungseinstellungen bestimmen, wie TrendAI Vision One™ die Eingaben und Antworten Ihrer KI-Anwendungen überprüft.
Erstellen Sie eine Richtlinie auf der KI-Richtlinienseite und weisen Sie sie auf der KI-Wächter-Registerkarte zu.
Eine Richtlinie verfügt über drei Erkennungstabs, die Regeln auf den erkannten Inhalt
anwenden.
Regelaktionen
Schädliche Inhalte und sensible Informationen unterliegen einer Reihe von Regeln.
Jede Regel verknüpft eine Aktion mit dem Inhalt, den sie erkennt. Prompt-Angriffe
wenden eine einzelne Aktion an und haben keine Regeln, Stufen oder Kategorien.
|
Aktion
|
Beschreibung
|
|
Zulassen & protokollieren
|
Erlaubt Inhalte, die der Regel entsprechen, und protokolliert die Erkennung in den
Logs.
|
|
Verweigern & protokollieren
|
Blockiert Inhalte, die der Regel entsprechen, und protokolliert die Erkennung in den
Logs.
|
Schädliche Inhalte
Der Tab "Schädliche Inhalte" erkennt schädliches Material in Eingabeaufforderungen
und Antworten. Jede Regel legt ein Erkennungsniveau fest und gilt für eine Kategorie.
Der Erkennungsstufe legt fest, wie aggressiv die Regel Inhalte kennzeichnet.
Sensible Informationen
Die Registerkarte "Sensible Informationen" erkennt sensible Daten in Eingaben und
Antworten. Jede Regel zielt auf eine Kategorie sensibler Daten mit einem festen Empfindlichkeitsgrad
ab. Sie können den Empfindlichkeitsgrad oder die Kategorie einer Regel nicht ändern,
aber Sie können die Regel aktivieren oder deaktivieren und ihre Aktion festlegen.
Um Regeln auf dieser Registerkarte zu finden, verwenden Sie Rule name, um nach Regelname zu suchen, oder klicken Sie auf Add filter und wählen Sie eine oder mehrere der folgenden Optionen aus:
-
Bundesland
-
Aktion
-
Empfindlichkeitsstufe
-
Kategorie
-
Region
Sie können die Schwärzung auch auf dieser Registerkarte aktivieren. Die Schwärzung
ersetzt sensible Daten durch Sternchen, bevor die Richtlinie die Regelaktion anwendet.
-
Wenn die Aktion Deny & log ist, blockiert die Richtlinie die sensiblen Daten, damit sie das KI-Modell nicht erreichen, und protokolliert sie als Sternchen.
-
Wenn die Aktion Allow & log ist, sendet und protokolliert die Richtlinie Sternchen anstelle der sensiblen Daten.
Aufforderungsangriffe
Der Tab "Prompt-Angriffe" erkennt Versuche, eine KI-Anwendung zu manipulieren, wie
z.B. Prompt-Injection. Im Gegensatz zu den anderen Tabs verwendet er keine Regeln,
Erkennungsstufen oder Kategorien. Stattdessen legen Sie eine einzelne Aktion fest,
die auf jeden erkannten Prompt-Angriff angewendet wird.
