Red Teaming nutzt adversariale Testfälle, um vor der Bereitstellung Verhalten aufzudecken, das Schäden verursachen, die Sicherheit gefährden oder gegen Richtlinien verstoßen kann. Es ergänzt Evaluationen und konzentriert sich dabei auf Missbrauchsszenarien, Fehlverhalten und Interaktionen mit hohem Risiko, die gewöhnliche Qualitätstests möglicherweise nicht aufdecken.
Wichtig: Reiche bei OpenAI Red Teaming nur Code oder andere Ressourcen ein, die dir gehören oder die du ausdrücklich testen darfst. Nutze OpenAI Red Teaming ohne ausdrückliche schriftliche Genehmigung von OpenAI nicht, um Schwachstellen in Open-Source-Code oder anderem Code Dritter zu analysieren oder zu melden.
Promptfoo für Red Teaming mit Open Source nutzen
Promptfoo ist ein Open-Source-Framework zur Evaluierung von Prompts, Agenten und KI-Anwendungen. Seine Arbeitsabläufe für Red Teaming helfen dir, adversariale Testfälle zu generieren, das Verhalten des getesteten Systems zu untersuchen und dein System anhand der Ergebnisse zu verbessern.
Weitere Informationen zur Methodik mit Open Source findest du im Leitfaden zum Red Teaming von LLMs von Promptfoo.
Verfügbarkeit für Unternehmen
OpenAI Red Teaming steht Unternehmen zur Verfügung, die ein verwaltetes Angebot für das Red Teaming von KI-Anwendungen und Agenten benötigen. Arbeitsabläufe für Unternehmen können umfangreichere Anforderungen an Koordination, Reviews und Berichterstattung erfüllen als ein eigenständiger lokaler Ablauf.
Red Teaming und Evaluationen
Mit Evaluationen misst du, ob sich ein KI-System wie vorgesehen verhält. Mit Red Teaming untersuchst du, wie sich das System bei adversarialen, missbräuchlichen oder unerwarteten Eingaben verhält. Ausgereifte Evaluierungsprogramme setzen häufig beide Ansätze ein.