Projekt
Explainable Artificial Intelligence in Adversarial Environments
Moderne Systeme basierend auf Künstlicher Intelligenz (KI), insbesondere künstliche Neuronale Netze, zeigen eine erstaunliche Performanz über zunehmend komplexe und nicht-lineare Aufgaben hinweg. Ihre Performanz wird vor allem durch eine enorme Anzahl an gelernten Parametern ermöglicht, was wiederum dazu führt, dass d…
Moderne Systeme basierend auf Künstlicher Intelligenz (KI), insbesondere künstliche Neuronale Netze, zeigen eine erstaunliche Performanz über zunehmend komplexe und nicht-lineare Aufgaben hinweg. Ihre Performanz wird vor allem durch eine enorme Anzahl an gelernten Parametern ermöglicht, was wiederum dazu führt, dass diese Systeme selbst von ihren Entwicklern nicht nachvollzogen werden können. Das ist besonders problematisch, sollten diese Modelle in Bereichen eingesetzt werden, in denen Personen oder Institutionen substantiell von den Vorhersagen der Modelle betroffen sein können. Um dieses Problem zu adressieren, haben Forschende Erklärungsalgorithmen entwickelt. Diese Lösungen, die unter dem englischen Begriff "eXplainable Artificial Intelligence (XAI)" zusammengefasst werden, legen die Entscheidungsprozesse der Modelle offen. Insbesondere die Untergruppe der sogenannten "Feature Attribution"-Methoden ist für diese Arbeit relevant. Diese Methoden weisen jeder Teilinformation der Eingabe einen Wichtigkeitswert zu. Diese Wichtigkeitswerte können dann beispielsweise als Heatmap über der Eingabe visualisiert werden um wichtige Bereiche graphisch hervorhebt. Besonders für die Klassifizierung von Bildern ist das eine übliche Vorgehensweise. Leider können diese Erklärungsmethoden das hochgradig nicht-lineare Verhalten von modernen Modellen nicht exakt abbilden und sind daher angreifbar. Angreifer können leicht veränderte Eingaben konstruieren, die die Vorhersagen und Erklärungen des Modells manipulieren. Alternativ können auch die Modelle selbst verändert werden, um Vorhersagen und Erklärungen zu beeinflussen. In dieser Arbeit werden Angriffe, welche Erklärungen berücksichtigen, anhand verschiedener Kategorien systematisiert. Es wird eine Hierarchie aus Robustheitsbegriffen vorgestellt und es werden verschiedene Angriffsvektoren erläutert. Im Verlauf dieser Arbeit werden zwei konkrete Angriffe vorgestellt und evaluiert: Im ersten Angriff verändert der Angreifer das Modell so, dass es normale Erklärungen und korrekte Vorhersagen erzeugt, wenn es mit gutartigen Eingaben verwendet wird. Wird jedoch ein kleines spezifisches Muster in die Eingabe eingebracht, erzeugt das Modell Erklärungen und Vorhersagen wie vom Angreifer gewünscht. Der Angreifer kann damit unter anderem verhindern, dass Artefakte in den Erklärungen auftauchen, die ansonsten auf den Angriff hindeuten könnten. Der zweite Angriff entkoppelt die Manipulation der Vorhersage vom Angriff auf die Erklärung. Während die Vorhersage vor dem Lernen des Modells durch eine Vorverunreinigung der Trainingsdaten beeinflusst wird, erfolgt der Angriff auf die Erklärungen erst, wenn das Modell schließlich verwendet wird. Durch geschickte Manipulation der Eingabe kann dann eine geeignete Erklärung erzwungen werden, die zu der jeweiligen Eingabe passt. Die Vorhersagen werden wie zuvor über ein spezifisches Muster manipuliert. Zusätzlich wird eine Verteidigung gegen die Manipulation von Erklärungen zur Verwendungszeit des Modells vorgestellt. Dazu wird das etablierte Verteidigungsprinzip "Adversarial Training" für Angriffe auf Erklärungen erweitert und mit Ansätzen zur Stabilisierung von Erklärungen verglichen. Zusammenfassend macht diese Arbeit deutlich, dass die Verlässlichkeit von Erklärungen essentiell ist, um eine breitere Verwendung von KI-Systemen in Anwendungsfeldern mit potenziell substantiellen Auswirkungen zu ermöglichen. Insbesondere trifft das zu, wenn die KI-Systeme in böswilligen Kontexten agieren. Die vorliegende Arbeit trägt zur Verlässlichkeit von Erklärungen bei, indem sie Angriffe auf Erklärungen systematisiert, Angriffe und Verteidigungen entwickelt und demonstriert, wie die Robustheit von XAI in böswilligen Umgebungen verbessert werden kann.