Ansichten:
KI-Richtlinie Erkennungseinstellungen bestimmen, wie TrendAI Vision One™ die Eingaben und Antworten Ihrer KI-Anwendungen überprüft.
Eine Richtlinie verfügt über drei Erkennungstabs, die Regeln auf den erkannten Inhalt anwenden.

Regelaktionen

Schädliche Inhalte und sensible Informationen unterliegen einer Reihe von Regeln. Jede Regel verknüpft eine Aktion mit dem Inhalt, den sie erkennt. Prompt-Angriffe wenden eine einzelne Aktion an und haben keine Regeln, Stufen oder Kategorien.
Aktion
Beschreibung
Zulassen & protokollieren
Erlaubt Inhalte, die der Regel entsprechen, und protokolliert die Erkennung in den Logs.
Verweigern & protokollieren
Blockiert Inhalte, die der Regel entsprechen, und protokolliert die Erkennung in den Logs.

Schädliche Inhalte

Der Tab "Schädliche Inhalte" erkennt schädliches Material in Eingabeaufforderungen und Antworten. Jede Regel legt ein Erkennungsniveau fest und gilt für eine Kategorie.
Der Erkennungsstufe legt fest, wie aggressiv die Regel Inhalte kennzeichnet.

Sensible Informationen

Die Registerkarte "Sensible Informationen" erkennt sensible Daten in Eingaben und Antworten. Jede Regel zielt auf eine Kategorie sensibler Daten mit einem festen Empfindlichkeitsgrad ab. Sie können den Empfindlichkeitsgrad oder die Kategorie einer Regel nicht ändern, aber Sie können die Regel aktivieren oder deaktivieren und ihre Aktion festlegen.
Um Regeln auf dieser Registerkarte zu finden, verwenden Sie Rule name, um nach Regelname zu suchen, oder klicken Sie auf Add filter und wählen Sie eine oder mehrere der folgenden Optionen aus:
  • Bundesland
  • Aktion
  • Empfindlichkeitsstufe
  • Kategorie
  • Region
Sie können die Schwärzung auch auf dieser Registerkarte aktivieren. Die Schwärzung ersetzt sensible Daten durch Sternchen, bevor die Richtlinie die Regelaktion anwendet.
  • Wenn die Aktion Deny & log ist, blockiert die Richtlinie die sensiblen Daten, damit sie das KI-Modell nicht erreichen, und protokolliert sie als Sternchen.
  • Wenn die Aktion Allow & log ist, sendet und protokolliert die Richtlinie Sternchen anstelle der sensiblen Daten.

Aufforderungsangriffe

Der Tab "Prompt-Angriffe" erkennt Versuche, eine KI-Anwendung zu manipulieren, wie z.B. Prompt-Injection. Im Gegensatz zu den anderen Tabs verwendet er keine Regeln, Erkennungsstufen oder Kategorien. Stattdessen legen Sie eine einzelne Aktion fest, die auf jeden erkannten Prompt-Angriff angewendet wird.