Projekt
Generierung von Feedback zu fehlgeschlagenen Autobewertungen mit GenKI
Der an der Hochschule Hannover entwickelte Autobewerter Graja prüft studentische Java-Einreichungen mittels JUnit-Tests sowie der statischen Analysewerkzeuge PMD und Checkstyle. Das Feedback zu fehlgeschlagenen Bewertungsaspekten ist dabei fest im System codiert und fällt entsprechend generisch aus. Diese Arbeit unter…
Der an der Hochschule Hannover entwickelte Autobewerter Graja prüft studentische Java-Einreichungen mittels JUnit-Tests sowie der statischen Analysewerkzeuge PMD und Checkstyle. Das Feedback zu fehlgeschlagenen Bewertungsaspekten ist dabei fest im System codiert und fällt entsprechend generisch aus. Diese Arbeit untersucht, ob sich mit großen Sprachmodellen (LLMs) ein individuelles, auf den konkreten Fehler bezogenes Feedback erzeugen lässt, und integriert dieses in den bestehenden Bewertungsprozess. Dazu wird zunächst festgelegt, welche Grading-Informationen einem LLM je Fehlerkategorie übergeben werden, und darauf aufbauend eine XML-artig ausgezeichnete Prompt-Struktur in je einer Variante pro Kategorie entworfen. Zehn Modelle – proprietäre, extern gehostete offene sowie lokal betriebene – werden anhand zuvor definierter Nützlichkeitskriterien verglichen. Anschließend werden lokales Hosting, die GWDG-Dienste und der HsH-KI-Server als Anbindungsvarianten gegeneinander abgewogen. Beide Ergebnisse münden in eine prototypische Graja-Erweiterung, die pro fehlgeschlagenem Bewertungsaspekt einen LLM-Aufruf absetzt und den erzeugten Text an die bestehende Rückmeldung anhängt. Eine abschließende Erprobung über alle betrachteten Fehlerkategorien belegt als Proof of Concept die funktionale Korrektheit der Erweiterung.
Technologien
- Generative AI Generative AI – Überblick über Forschungsprojekte, Patente und Akteure im TechnologieAtlas.