Etikett „Mensch“ bringt Bonuspunkte 07.08.2026, 07:08 Uhr

Leser bevorzugen ChatGPT-Texte, solange sie sie für menschlich halten

ChatGPT-Kurzgeschichten schneiden bei Lesern besser ab als menschliche Texte. Doch die Studie zeigt auch einen deutlichen Bonus für das Etikett „Mensch“.

Mann am Laptop, arbeitet mit ChatGPT

Mensch oder KI? In einer Studie schneiden ChatGPT-Kurzgeschichten überraschend gut ab. Warum das Ergebnis trotzdem kein Sieg der KI-Literatur ist.

Foto: Smarterpix / KTStock

Wer schreibt die bessere Kurzgeschichte: ein Mensch oder ChatGPT? In einem Experiment mit 1682 Erwachsenen schnitten drei von ChatGPT erzeugte Geschichten bei den Leserinnen und Lesern besser ab als drei veröffentlichte Texte menschlicher Autoren. Gleichzeitig erhielten Geschichten höhere Bewertungen, wenn die Versuchspersonen glaubten, sie stammten von einem Menschen.

Das klingt widersprüchlich, ist statistisch aber sauber voneinander zu trennen: Die KI-Texte wurden unabhängig von ihrer Kennzeichnung besser bewertet. Zusätzlich verschaffte das Etikett „von einem Menschen geschrieben“ sowohl menschlichen als auch KI-generierten Geschichten einen Vorteil.

Zu diesem Ergebnis kommen Sydney Sears und Deena Skolnick Weisberg von der Villanova University. Ihre Studie ist am 5. August 2026 im Fachjournal „Judgment and Decision Making“ erschienen.

Top Stellenangebote

Zur Jobbörse
Stadt Neumünster-Firmenlogo
Ingenieur*in in der Fachrichtung Architektur Stadt Neumünster
Neumünster Zum Job 
Stadtreinigung Hamburg-Firmenlogo
Ingenieur (all genders) Hochbau Stadtreinigung Hamburg
Hamburg Zum Job 
Thüringer Landgesellschaft mbH-Firmenlogo
Sachbearbeiter Bereich Wasserwirtschaft (m/w/d) Thüringer Landgesellschaft mbH
Erfurt-Mittelhausen Zum Job 
WipflerPLAN Planungsgesellschaft mbH-Firmenlogo
Projektingenieur / Planungsingenieur (m/w/d) für Siedlungswasserwirtschaft WipflerPLAN Planungsgesellschaft mbH
Donauwörth, München-Ost (Grasbrunn), München-West (Planegg), Pfaffenhofen an der Ilm Zum Job 
TenneT-Firmenlogo
HSE Manager Baustellen & Infrastrukturprojekte (m/w/d) TenneT
Stadtreinigung Hamburg-Firmenlogo
Ingenieur (all genders) Tiefbau Stadtreinigung Hamburg
Hamburg Zum Job 
VDZ Service GmbH-Firmenlogo
Auditor (m/w/d) für die Validierung von Umweltmerkmalen und für die Produktzertifizierung VDZ Service GmbH
Düsseldorf Zum Job 
Thüringer Landgesellschaft mbH-Firmenlogo
Bauingenieur (m/w/d) Thüringer Landgesellschaft mbH
Thüringer Landgesellschaft mbH-Firmenlogo
Projektingenieur Wasserbau (m/w/d) Thüringer Landgesellschaft mbH
Erfurt, Meiningen, Neustadt an der Orla, Sondershausen Zum Job 
Handtmann Reutlingen GmbH-Firmenlogo
Elektrokonstrukteur / Electrical Design Engineer (m/w/d) EPLAN P8 Handtmann Reutlingen GmbH
Reutlingen Zum Job 
Egger Holzwerkstoffe Brilon GmbH & Co. KG-Firmenlogo
Absolvent / Nachwuchsingenieur (w/m/d) Technik und Produktion Egger Holzwerkstoffe Brilon GmbH & Co. KG
Universität Bayreuth-Firmenlogo
W3-Professur für Chemische Verfahrenstechnik Universität Bayreuth
Bayreuth Zum Job 
Die Autobahn GmbH des Bundes-Firmenlogo
Ingenieur (w/m/d) für Energie- und Gebäudetechnik Die Autobahn GmbH des Bundes
Nürnberg Zum Job 
Stadtverwaltung Frankenthal-Firmenlogo
Bereichsleiter (m/w/d) Gebäude und Grundstücke Stadtverwaltung Frankenthal
Frankenthal (Pfalz) Zum Job 
Stadt Offenburg-Firmenlogo
Techniker*in Straßenbau - Bauüberwachung und Genehmigungsverfahren (m/w/d) Stadt Offenburg
Offenburg Zum Job 
Deutsches Zentrum für Astrophysik gGmbH-Firmenlogo
C-26-03 Projektingenieur:in Technische Gebäudeausrüstung (w/m/d) Deutsches Zentrum für Astrophysik gGmbH
Görlitz Zum Job 
WipflerPLAN Planungsgesellschaft mbH-Firmenlogo
Planungsleiter / Projektleiter (m/w/d) für Kläranlagen mit Schwerpunkt Ingenieurbau WipflerPLAN Planungsgesellschaft mbH
verschiedene Einsatzorte Zum Job 
WipflerPLAN Planungsgesellschaft mbH-Firmenlogo
Planungsleiter / Projektleiter (m/w/d) für Kläranlagen mit Schwerpunkt Verfahrenstechnik WipflerPLAN Planungsgesellschaft mbH
verschiedene Einsatzorte Zum Job 
Hochschule Reutlingen-Firmenlogo
W2-Professur (m/w/x) Energiewirtschaft und Energienetze Hochschule Reutlingen
Reutlingen Zum Job 
OST  Ostschweizer Fachhochschule-Firmenlogo
Professor/in für Integrierte Digitale Systeme OST Ostschweizer Fachhochschule
Rapperswil Zum Job 

Drei menschliche Kurzgeschichten gegen drei Texte von ChatGPT

Für das erste Experiment rekrutierten die Forscherinnen 1682 Erwachsene in den USA. Die Stichprobe sollte hinsichtlich Alter, Geschlecht und ethnischer Zugehörigkeit die US-Bevölkerung abbilden. Jede Versuchsperson las eine etwa 1000 Wörter lange Kurzgeschichte.

Zur Auswahl standen sechs Texte. Drei davon stammten von menschlichen Autoren und waren zuvor in Literaturzeitschriften oder Kurzgeschichtensammlungen veröffentlicht worden. Den drei menschlichen Geschichten stellten die Forscherinnen jeweils einen von ChatGPT erzeugten Text gegenüber.

Die Hälfte der Teilnehmer erhielt eine korrekte Angabe zur Herkunft der Geschichte. Der anderen Hälfte wurde eine falsche Urheberschaft genannt. Ein menschlicher Text konnte also als Werk von ChatGPT ausgegeben werden – oder eine KI-Geschichte als Werk eines Menschen.

Danach bewerteten die Teilnehmer unter anderem, wie stark sie die Geschichte fesselte und wie hoch sie deren Qualität einschätzten.

ChatGPT-Geschichten werden höher bewertet

Auf einer Skala von −3 bis +3 erreichten die KI-Texte bei der wahrgenommenen Qualität im Mittel 1,54 Punkte. Die menschlichen Geschichten kamen auf 0,97 Punkte. Auch bei der sogenannten Story Absorption, also der Frage, wie stark Leser in die Geschichte eintauchten, lagen die ChatGPT-Texte mit 1,42 Punkten vor den menschlichen Texten mit 1,00 Punkten. Beide Unterschiede waren statistisch signifikant.

Die Studie misst damit allerdings keine objektive literarische Qualität. Bewertet wurde, wie die Versuchspersonen die Texte wahrnahmen. Für die Qualität entwickelten die Forscherinnen eine eigene Skala mit zehn Aussagen zu Handlung, Figuren, Thema und Stil. Die Messung der Story Absorption basierte auf einer gekürzten Version einer bereits etablierten Skala.

Unabhängig von der tatsächlichen Herkunft hatte auch die vermeintliche Urheberschaft einen messbaren Einfluss: Geschichten wurden höher bewertet, wenn den Teilnehmern gesagt wurde, ein Mensch habe sie geschrieben. Bei der wahrgenommenen Qualität lag der Mittelwert dann bei 1,40 Punkten. Wurde der Text als ChatGPT-Werk angekündigt, waren es 1,12 Punkte. Bei der Story Absorption zeigte sich der gleiche Effekt.

Wichtig ist jedoch: Zwischen tatsächlicher Herkunft und angegebener Urheberschaft fanden die Forscherinnen keine statistisch signifikante Wechselwirkung. Daraus lässt sich also nicht ableiten, dass ChatGPT-Texte nur dann besonders gut ankamen, wenn sie als menschliche Werke ausgegeben wurden.

ChatGPT musste die Geschichten nicht selbst erfinden

Der Vergleich hat noch eine wichtige Einschränkung: ChatGPT bekam für seine Geschichten relativ konkrete Vorgaben.

Für einen Text lautete die Aufgabe beispielsweise, eine etwa 1000 Wörter lange Geschichte über Generationen, Leben, Tod und Unsicherheit zu verfassen, Koi-Karpfen als Symbol zu verwenden und aus der Perspektive des erwachsenen Kindes einer Frau zu erzählen.

Auch bei den beiden anderen Geschichten enthielten die Prompts zentrale Elemente der menschlichen Vergleichstexte: Handlung, zeitliche Einordnung, Erzählperspektive, Konflikte und teilweise das gewünschte Ende.

Die KI musste den Stoff deshalb nicht von Grund auf selbst entwickeln. Die Versuche zeigen vor allem, wie überzeugend ChatGPT vorgegebene Motive und Handlungselemente in eine Kurzgeschichte umsetzen kann. Sie sind kein symmetrischer Wettbewerb zwischen menschlicher und maschineller Ideenfindung.

Hinzu kommt die geringe Zahl der untersuchten Werke: Trotz der großen Teilnehmerzahl basiert der Vergleich auf lediglich drei menschlichen und drei KI-generierten Geschichten.

Mensch oder KI? Leser liegen häufig daneben

In zwei weiteren Experimenten untersuchten Sears und Weisberg, ob Menschen überhaupt erkennen können, wer eine Geschichte geschrieben hat.

Dabei lasen insgesamt 905 weitere Teilnehmer jeweils zwei thematisch zusammengehörende Texte – einen menschlichen und einen von ChatGPT. Anschließend sollten sie entscheiden, welcher Text von wem stammte.

Im zweiten Experiment gelang die richtige Zuordnung nur 39,39 % der Teilnehmer. Das lag statistisch signifikant unter der Zufallswahrscheinlichkeit von 50 %. Die Versuchspersonen tendierten also sogar dazu, die Herkunft beider Texte zu vertauschen.

Die Forscherinnen wiederholten den Versuch deshalb mit weiteren 481 Personen und einer verbesserten Messung der KI-Kompetenz. Diesmal lagen 51,97 % richtig. Das unterschied sich statistisch nicht von einem Zufallsergebnis.

In keinem der beiden Experimente konnten die Teilnehmer menschliche und KI-generierte Geschichten damit generell zuverlässig auseinanderhalten.

Ausgerechnet die Sprache führte Leser in die Irre

Interessant ist, woran sich die Versuchspersonen bei ihrer Entscheidung orientierten. Wer nach eigener Aussage besonders auf die Sprache der Geschichten achtete, lag sogar häufiger falsch.

Im dritten Experiment schnitten Teilnehmer etwas besser ab, wenn sie sich bei ihrer Einschätzung an der Verwendung von Symbolik orientierten. Andere Merkmale wie Handlung, Figuren oder Thema lieferten keinen klaren Vorteil.

Auch größere Erfahrung mit Literatur half nicht. Einen Zusammenhang fanden die Forscherinnen dagegen bei der selbst eingeschätzten KI-Kompetenz: Teilnehmer mit höheren Werten auf einer KI-Kompetenzskala erkannten die Herkunft der Geschichten etwas häufiger richtig.

Daraus folgt allerdings nicht, dass regelmäßige ChatGPT-Nutzung automatisch zum zuverlässigen KI-Detektor macht. Die Untersuchung zeigt lediglich einen statistischen Zusammenhang zwischen selbst berichteter KI-Kompetenz und Trefferquote.

Die untersuchte KI ist bereits mehrere Jahre alt

Für die Einordnung der Ergebnisse ist auch der Entstehungszeitpunkt der KI-Texte relevant. Die erste Geschichte ließ das Forschungsteam bereits im November 2023 mit „ChatGPT 4.0“ erstellen. Die beiden anderen folgten im Dezember 2024.

Die im August 2026 veröffentlichte Studie bildet damit nicht den aktuellen technischen Stand leistungsfähiger Sprachmodelle ab. Ob neuere Modelle bei demselben Versuchsaufbau besser, schlechter oder lediglich anders abschneiden würden, wurde nicht untersucht.

Auch eine Verallgemeinerung auf Romane oder andere Textformen wäre nicht zulässig. Sämtliche Geschichten waren nur rund 1000 Wörter lang und gehörten zur realistischen Fiktion. Die Autorinnen weisen selbst darauf hin, dass längere Texte Sprachmodelle vor andere Probleme stellen könnten, etwa bei der konsistenten Entwicklung von Figuren und Handlungssträngen.

Zudem stammen sämtliche Versuchspersonen aus den USA. Kulturelle Unterschiede beim Umgang mit Literatur und Künstlicher Intelligenz könnten die Ergebnisse beeinflussen. (mit Material der dpa)

Quellen:

Originalstudie: Sears, Sydney; Weisberg, Deena Skolnick: Bot or not: Can people tell the difference between stories written by a human or by an AI system?, „Judgment and Decision Making“, veröffentlicht am 5. August 2026, DOI 10.1017/jdm.2026.10042. Originalstudie bei Cambridge University Press

Daten, Materialien und Analyseskripte: Die Autorinnen stellen Versuchsunterlagen und Datenauswertung über das Open Science Framework bereit. Studienmaterialien im OSF

Universität/Forschungsteam: STAR Lab der Villanova University, Forschungsgruppe von Deena Skolnick Weisberg. Publikationsübersicht des STAR Lab

Ein Beitrag von:

  • Dominik Hochwarth

    Redakteur beim VDI Verlag. Nach dem Studium absolvierte er eine Ausbildung zum Online-Redakteur, es folgten ein Volontariat und jeweils 10 Jahre als Webtexter für eine Internetagentur und einen Onlineshop. Seit September 2022 schreibt er für ingenieur.de.

Zu unseren Newslettern anmelden

Das Wichtigste immer im Blick: Mit unseren beiden Newslettern verpassen Sie keine News mehr aus der schönen neuen Technikwelt und erhalten Karrieretipps rund um Jobsuche & Bewerbung. Sie begeistert ein Thema mehr als das andere? Dann wählen Sie einfach Ihren kostenfreien Favoriten.