Stolperfalle in der IT 27.11.2025, 16:00 Uhr

Verwirrender Programmcode: KI und Mensch reagieren gleich

Ein Forscherteam der Universität des Saarlandes und des Max-Planck-Instituts für Softwaresysteme hat erstmals gezeigt, dass die Reaktionen von Menschen und großen Sprachmodellen (LLMs) auf komplexen oder irreführenden Programmcode messbar signifikant übereinstimmen.

Ein interdisziplinäres Forschungsteam verknüpft EEG-Messungen von Entwicklerinnen und Entwicklern mit der Unsicherheit großer Sprachmodelle – und zeigt: Mensch und KI stolpern über dieselben verwirrenden Code-Muster.

Ein interdisziplinäres Forschungsteam verknüpft EEG-Messungen von Entwicklerinnen und Entwicklern mit der Unsicherheit großer Sprachmodelle – und zeigt: Mensch und KI stolpern über dieselben verwirrenden Code-Muster.

Foto: Smarterpix/MediaWhalestock

In der Studie wurde untersucht, wie Menschen und LLMs auf verwirrenden Code reagieren. Dabei wurde die Hirnaktivität der Testpersonen damit verglichen, wie unsicher sich die Sprachmodelle bei der Vorhersage waren. Darauf aufbauend hat das Team eine datengetriebene Methode entwickelt, um solche unklaren Stellen im Code automatisiert aufzuspüren – eine Chance für bessere KI-Assistenten in der Softwareentwicklung.

Merkmale der Verwirrung

Die Merkmale solcher Code-Stellen, die in der Informatik als „Atoms of Confusion“ bezeichnet werden, sind in der Forschung bereits ausführlich betrachtet worden. Dabei handelt es sich um kurze, syntaktisch korrekte, aber für Menschen oft irreführende Programmiermuster, die selbst erfahrene Entwicklerinnen und Entwickler aus dem Konzept bringen können.

Durchführung der Studie

Das Forschungsteam verwendete einen interdisziplinären Ansatz, um herauszufinden, ob LLMs und Menschen über dieselben Stolperfallen „nachdenken“. Einerseits wurden Daten aus einer früheren Studie von Sven Apel, Professor für Software-Engineering der Universität des Saarlandes, und Kollegen genutzt. In dieser wurden die Probandinnen und Probanden gebeten, verwirrende und saubere Code-Variante zu lesen. Dabei wurde ihre Hirnaktivität, sowie die Aufmerksamkeit durch Elektroenzephalografie (EEG) und Eye Tracking gemessen.

Andererseits wurde die „Verwirrung“ von Sprachmodellen und deren Vertrauen in die eigenen Vorhersagen (Modellunsicherheit) anhand sogenannter Perplexity-Werte analysiert. Perplexity ist eine gängige Metrik, um Sprachmodelle zu bewerten (nicht zu verwechseln mit dem gleichnamigen Sprachmodell). Dabei wird auf der Grundlage von Wahrscheinlichkeiten quantifiziert, inwieweit die Vorhersagen von Textsequenzen unsicher sind.

Stellenangebote im Bereich IT/TK Consulting, Vertrieb

IT/TK Consulting, Vertrieb Jobs
EGGER Holzwerkstoffe Brilon GmbH & Co. KG-Firmenlogo
OT Specialist / Operational Technology Engineer (w/m/d) EGGER Holzwerkstoffe Brilon GmbH & Co. KG
Humanetics Europe GmbH-Firmenlogo
R&D Software Engineer SQL & ERP Applications (m/w/d) Humanetics Europe GmbH
Rheinmünster Zum Job 
MED-EL Medical Electronics-Firmenlogo
Technician, Automation Engineering (m/f/d) MED-EL Medical Electronics
Innsbruck Zum Job 
TenneT-Firmenlogo
ERP-Experte / SAP Super User mit Schwerpunkt Umspannwerke (m/w/d) TenneT
Bayreuth Zum Job 
DFS Deutsche Flugsicherung GmbH-Firmenlogo
Ingenieur* im Anforderungsmanagement DFS Deutsche Flugsicherung GmbH
Hochschule Düsseldorf University of Applied Sciences-Firmenlogo
Professur "Wirtschaftsinformatik und Datenbanken mit dem Schwerpunkt IT-Venture-Design, Digital Enterprise und innovativer Lehre in Makerspace-Settings (W2)" Hochschule Düsseldorf University of Applied Sciences
Düsseldorf Zum Job 
Die Autobahn GmbH des Bundes-Firmenlogo
BIM-Manager (w/m/d) Niederlassung Westfalen Die Autobahn GmbH des Bundes
Hamm, Münster, Gelsenkirchen Zum Job 
BAM Bundesanstalt für Materialforschung und -prüfung-Firmenlogo
Promovierte*r wissenschaftliche*r Mitarbeiter*in (m/w/d) der Fachrichtung Bauingenieurwesen, physikalische Ingenieurwissenschaften, Physik, Mathematik oder vglb. BAM Bundesanstalt für Materialforschung und -prüfung
DFS Deutsche Flugsicherung GmbH-Firmenlogo
Leitung (m/w/d) Betriebliches Anforderungsmanagement Wetter, Informationssysteme (IDP) & Sprachsysteme DFS Deutsche Flugsicherung GmbH
Akkodis Germany GmbH-Firmenlogo
Senior Softwareentwickler C++(w/m/d) Akkodis Germany GmbH
München Zum Job 
HENSOLDT-Firmenlogo
Senior Expert Maritime Systems Engineering (w/m/d) HENSOLDT
Wilhelmshaven, Kiel, Rostock, Hamburg Zum Job 
AIXTRON SE-Firmenlogo
300mm Metrology Expert (all genders) AIXTRON SE
Herzogenrath Zum Job 
Rheinmetall Landsysteme GmbH-Firmenlogo
Abteilungsleiter Analysis and Functional Design of Digital Systems (m/w/d) Rheinmetall Landsysteme GmbH
Rheinmetall Landsysteme GmbH-Firmenlogo
Systemingenieur E/E Architektur Digitale Systeme (m/w/d) Rheinmetall Landsysteme GmbH
Rheinmetall Landsysteme GmbH-Firmenlogo
Systemingenieur Steuergeräteentwicklung (m/w/d) Rheinmetall Landsysteme GmbH
ALTEN GmbH-Firmenlogo
Analog Mixed - Signal Layout Engineer (all gender) ALTEN GmbH
München Zum Job 
ALTEN GmbH-Firmenlogo
Manufacturing Engineering Support - TORNADO Programm (all gender) ALTEN GmbH
Manching Zum Job 
MBDA Deutschland GmbH-Firmenlogo
Software Developer (w/m/d) MBDA Deutschland GmbH
Schrobenhausen Zum Job 
MBDA Deutschland GmbH-Firmenlogo
Senior Systems Engineer (w/m/d) MBDA Deutschland GmbH
Schrobenhausen Zum Job 
Brodbeck Service und Verwaltung GmbH & Co. KG-Firmenlogo
Applikationsbetreuer (m/w/d) Brodbeck Service und Verwaltung GmbH & Co. KG
Metzingen Zum Job 

Mensch und KI stolpern über die gleichen Hürden

Die Ergebnisse der Studie sind eindeutig: Da, wo Menschen am Programmcode hängen bleiben, zeigen auch die LLMs erhöhte Unsicherheit. Die EEG-Signale der Teilnehmerinnen und Teilnehmer, insbesondere die sogenannte „Late Frontal Positivity“, die in der Sprachforschung mit unerwarteten Satzenden assoziiert ist, stieg genau dort an, wo auch das Sprachmodell einen Unsicherheitssprung zeigte.

„Wir waren erstaunt, dass der Ausschlag in Hirnaktivität und der Modellunsicherheit signifikante Korrelationen aufwiesen“, sagt Informatik-Doktorand Youssef Abdelsalam.

Algorithmus, der Schwachstellen im Code erkennt

Basierend auf dieser Ähnlichkeit haben die Forschenden ein datengetriebenes Verfahren entwickelt, welches unklare Stellen im Code automatisch erkennt und kennzeichnet. In mehr als 60 % der Fälle hat der Algorithmus die verwirrenden Strukturen im Test-Code erfolgreich identifiziert, die vorab bekannt und von Hand markiert waren. Darüber hinaus wurden mehr als 150 neue, bislang unerkannte Muster entdeckt, die ebenfalls mit erhöhter Hirnaktivität der Probandinnen und Probanden einhergingen.

„Wenn wir wissen, wann und warum LLMs und Menschen gleichermaßen ins Stolpern geraten, können wir Werkzeuge entwickeln, die Programmcode verständlicher machen und die Zusammenarbeit zwischen Mensch und KI deutlich verbessern“, sagt Professor Sven Apel.

Ein Beitrag von:

  • Anastasia Pukhovich

    Anastasia Pukhovich ist Volontärin beim VDI Verlag. Ihre Tätigkeit beim Max-Planck-Institut für Nachhaltige Materialien weckte ihr Interesse an allen Themen rund um Wissenschaft und Technik. Besonders gerne verfolgt sie journalistisch die Themen Medizintechnik und Karriere.

Zu unseren Newslettern anmelden

Das Wichtigste immer im Blick: Mit unseren beiden Newslettern verpassen Sie keine News mehr aus der schönen neuen Technikwelt und erhalten Karrieretipps rund um Jobsuche & Bewerbung. Sie begeistert ein Thema mehr als das andere? Dann wählen Sie einfach Ihren kostenfreien Favoriten.