Was bedeutet Adversarial Attack?
Eine Adversarial Attack ist ein gezielter Angriff auf ein KI-Modell, bei dem die Eingabedaten so verändert werden, dass das Modell eine falsche Ausgabe erzeugt. Angreifer nutzen die Manipulation, um Klassifikationen zu kippen, Inhaltsfilter zu umgehen oder Freigaben zu erschleichen. Anders als beim Data Poisoning bleibt das trainierte Modell unangetastet, verändert wird allein die Eingabe zur Laufzeit.
Die bekannteste Methode ist die Fast Gradient Sign Method. Sie berechnet den Gradienten der Verlustfunktion am fertig trainieren Modell und verschiebt jeden Bildpunkt um einen kleinen Betrag in Richtung des Fehlers. Für das menschliche Auge bleibt das Bild unverändert. Iterative Verfahren wie Projected Gradient Descent wiederholen den Schritt hundertfach und finden kleinere Störungen. Bei Sprachmodellen läuft der Angriff über den Text, etwa durch versteckte Anweisungen in einem hochgeladenen Dokument.
Eine Angriffsfläche entsteht überall dort, wo ein Modell Eingaben von Dritten verarbeitet und daraus unmittelbar eine Entscheidung ableitet. Betroffen sind Bilderkennung an Zugangskontrollen, Spam- und Betrugsfilter sowie Sprachmodelle, die eingereichte Dokumente vorsortieren. Einen Zugang zum System brauchet ein Angreifer dafür nicht, es genügt die Datei oder das Bild, das er ohnehin einreichen darf.
Der Schutz eines Modells vor einer Adversarial Attack beginnt bei der Trennung von Inhalt und Anweisung: Wer Eingaben als Daten behandelt und nicht als Befehle, entzieht dem Angriff die Grundlage. Adversarial Training mit manipulierten Beispielen härtet die Bildmodelle gegen bekannte Muster. Protokollierte Ein- und Ausgaben machen einen Vorfall im Nachhinein auswertbar, indem sie zeigen, welche Eingabe welche Ausgabe ausgelöst hat.
Der EU AI Act zählt Robustheit gegen Manipulation zu den Anforderungen an Hochrisikosysteme. Verlangt wird dort der jeweils belegbare Stand der Technik: Abwehr gegen bekannte Angriffsverfahren, eine Dokumentation der Maßnahmen und ein Meldeweg für Vorfälle. Dieser Stand verschiebt sich mit jedem neuen Verfahren.