Etikett „Mensch“ bringt Bonuspunkte 07.08.2026, 07:08 Uhr

Leser bevorzugen ChatGPT-Texte, solange sie sie für menschlich halten

ChatGPT-Kurzgeschichten schneiden bei Lesern besser ab als menschliche Texte. Doch die Studie zeigt auch einen deutlichen Bonus für das Etikett „Mensch“.

Mann am Laptop, arbeitet mit ChatGPT

Mensch oder KI? In einer Studie schneiden ChatGPT-Kurzgeschichten überraschend gut ab. Warum das Ergebnis trotzdem kein Sieg der KI-Literatur ist.

Foto: Smarterpix / KTStock

Wer schreibt die bessere Kurzgeschichte: ein Mensch oder ChatGPT? In einem Experiment mit 1682 Erwachsenen schnitten drei von ChatGPT erzeugte Geschichten bei den Leserinnen und Lesern besser ab als drei veröffentlichte Texte menschlicher Autoren. Gleichzeitig erhielten Geschichten höhere Bewertungen, wenn die Versuchspersonen glaubten, sie stammten von einem Menschen.

Das klingt widersprüchlich, ist statistisch aber sauber voneinander zu trennen: Die KI-Texte wurden unabhängig von ihrer Kennzeichnung besser bewertet. Zusätzlich verschaffte das Etikett „von einem Menschen geschrieben“ sowohl menschlichen als auch KI-generierten Geschichten einen Vorteil.

Zu diesem Ergebnis kommen Sydney Sears und Deena Skolnick Weisberg von der Villanova University. Ihre Studie ist am 5. August 2026 im Fachjournal „Judgment and Decision Making“ erschienen.

Top Stellenangebote

Zur Jobbörse
Wirtschaftsbetrieb Hagen AöR-Firmenlogo
Fachbereichsleitung Grün (m/w/d) Wirtschaftsbetrieb Hagen AöR
Heilbronner Versorgungs GmbH-Firmenlogo
Planungsingenieur in den Bereichen Gas und Wasser (m/w/d) Heilbronner Versorgungs GmbH
Heilbronn Zum Job 
Flughafen München GmbH-Firmenlogo
Leiter Elektrotechnik / Stromnetzprojekte (w/m/d) Flughafen München GmbH
Oberding Zum Job 
Hochschule Bremen-Firmenlogo
Professur (w/m/d), Bes. Gr. W2 für das Fachgebiet "Simulation und Regelung technischer Systeme" Hochschule Bremen
Pädagogische Hochschule Heidelberg-Firmenlogo
Mitarbeiter*in (m/w/d) Strategische Entwicklung und Begleitung des 'Campus der Zukunft' Pädagogische Hochschule Heidelberg
Heidelberg Zum Job 
Intego GmbH-Firmenlogo
Servicetechniker / Field Service Engineer (m/w/d) - Einsatz in Kalifornien (USA) Intego GmbH
Erlangen Zum Job 
Boyd Weiler GmbH & Co. KG-Firmenlogo
CAD-Konstrukteur (m/w/d) Boyd Weiler GmbH & Co. KG
Weiler-Simmerberg Zum Job 
TransnetBW GmbH-Firmenlogo
Senior Ingenieur Systemintegration und KI-basierte Performancebewertung (w/m/d) TransnetBW GmbH
Stuttgart Zum Job 
TransnetBW GmbH-Firmenlogo
Ingenieur Systemführung Operative Betriebsplanung (w/m/d) TransnetBW GmbH
Stuttgart Zum Job 
Staatliches Hochbauamt Heidelberg-Firmenlogo
Bauingenieur (w/m/d) Tiefbau / Ver- und Entsorgung / Baubetrieb Staatliches Hochbauamt Heidelberg
Heidelberg Zum Job 
Staatliches Hochbauamt Heidelberg-Firmenlogo
Bauingenieur (w/m/d) Bergbautechnik / Tiefbau Staatliches Hochbauamt Heidelberg
Heidelberg Zum Job 
Allbau Managementgesellschaft mbH-Firmenlogo
Bauprojektleiter (m/w/d) Allbau Managementgesellschaft mbH
DFS Deutsche Flugsicherung GmbH-Firmenlogo
Ingenieur* im Anforderungsmanagement DFS Deutsche Flugsicherung GmbH
Stadt Weinheim-Firmenlogo
Ingenieur*in (w/m/d) im Bereich Landschaftsarchitektur, Landschafts- oder Freiraumplanung für die Gestaltung städtischer Außen- und Freianlagen Stadt Weinheim
Weinheim Zum Job 
Stadt Norderstedt-Firmenlogo
Ingenieur/in / Technische/r Mitarbeiter/in (w/m/d) Bereich Verkehrswesen Stadt Norderstedt
Norderstedt Zum Job 
WipflerPLAN Planungsgesellschaft-Firmenlogo
Bauingenieur / Bautechniker Kommunaler Tiefbau (m/w/d) WipflerPLAN Planungsgesellschaft
Donauwörth, Nördlingen, Pfaffenhofen an der Ilm, Lauf an der Pegnitz Zum Job 
Albert-Ludwigs-Universität Freiburg-Firmenlogo
Leitung des Rechenzentrums der Universität Freiburg (m/w/d) Albert-Ludwigs-Universität Freiburg
Freiburg Zum Job 
DTU Nanolab-Firmenlogo
Head of Thin Film Processing (f/m/d) DTU Nanolab
Kongens Lyngby Zum Job 
Hofmann Maschinen- und Anlagenbau GmbH-Firmenlogo
Zerspanungsmechaniker (m/w/d) Fachrichtung Schleiftechnik Hofmann Maschinen- und Anlagenbau GmbH
Universität zu Köln-Firmenlogo
Projektingenieur*in (TGA) im Bereich Elektrotechnik (w/m/d) Abteilung 53 - Technisches Gebäudemanagement Universität zu Köln

Drei menschliche Kurzgeschichten gegen drei Texte von ChatGPT

Für das erste Experiment rekrutierten die Forscherinnen 1682 Erwachsene in den USA. Die Stichprobe sollte hinsichtlich Alter, Geschlecht und ethnischer Zugehörigkeit die US-Bevölkerung abbilden. Jede Versuchsperson las eine etwa 1000 Wörter lange Kurzgeschichte.

Zur Auswahl standen sechs Texte. Drei davon stammten von menschlichen Autoren und waren zuvor in Literaturzeitschriften oder Kurzgeschichtensammlungen veröffentlicht worden. Den drei menschlichen Geschichten stellten die Forscherinnen jeweils einen von ChatGPT erzeugten Text gegenüber.

Die Hälfte der Teilnehmer erhielt eine korrekte Angabe zur Herkunft der Geschichte. Der anderen Hälfte wurde eine falsche Urheberschaft genannt. Ein menschlicher Text konnte also als Werk von ChatGPT ausgegeben werden – oder eine KI-Geschichte als Werk eines Menschen.

Danach bewerteten die Teilnehmer unter anderem, wie stark sie die Geschichte fesselte und wie hoch sie deren Qualität einschätzten.

ChatGPT-Geschichten werden höher bewertet

Auf einer Skala von −3 bis +3 erreichten die KI-Texte bei der wahrgenommenen Qualität im Mittel 1,54 Punkte. Die menschlichen Geschichten kamen auf 0,97 Punkte. Auch bei der sogenannten Story Absorption, also der Frage, wie stark Leser in die Geschichte eintauchten, lagen die ChatGPT-Texte mit 1,42 Punkten vor den menschlichen Texten mit 1,00 Punkten. Beide Unterschiede waren statistisch signifikant.

Die Studie misst damit allerdings keine objektive literarische Qualität. Bewertet wurde, wie die Versuchspersonen die Texte wahrnahmen. Für die Qualität entwickelten die Forscherinnen eine eigene Skala mit zehn Aussagen zu Handlung, Figuren, Thema und Stil. Die Messung der Story Absorption basierte auf einer gekürzten Version einer bereits etablierten Skala.

Unabhängig von der tatsächlichen Herkunft hatte auch die vermeintliche Urheberschaft einen messbaren Einfluss: Geschichten wurden höher bewertet, wenn den Teilnehmern gesagt wurde, ein Mensch habe sie geschrieben. Bei der wahrgenommenen Qualität lag der Mittelwert dann bei 1,40 Punkten. Wurde der Text als ChatGPT-Werk angekündigt, waren es 1,12 Punkte. Bei der Story Absorption zeigte sich der gleiche Effekt.

Wichtig ist jedoch: Zwischen tatsächlicher Herkunft und angegebener Urheberschaft fanden die Forscherinnen keine statistisch signifikante Wechselwirkung. Daraus lässt sich also nicht ableiten, dass ChatGPT-Texte nur dann besonders gut ankamen, wenn sie als menschliche Werke ausgegeben wurden.

ChatGPT musste die Geschichten nicht selbst erfinden

Der Vergleich hat noch eine wichtige Einschränkung: ChatGPT bekam für seine Geschichten relativ konkrete Vorgaben.

Für einen Text lautete die Aufgabe beispielsweise, eine etwa 1000 Wörter lange Geschichte über Generationen, Leben, Tod und Unsicherheit zu verfassen, Koi-Karpfen als Symbol zu verwenden und aus der Perspektive des erwachsenen Kindes einer Frau zu erzählen.

Auch bei den beiden anderen Geschichten enthielten die Prompts zentrale Elemente der menschlichen Vergleichstexte: Handlung, zeitliche Einordnung, Erzählperspektive, Konflikte und teilweise das gewünschte Ende.

Die KI musste den Stoff deshalb nicht von Grund auf selbst entwickeln. Die Versuche zeigen vor allem, wie überzeugend ChatGPT vorgegebene Motive und Handlungselemente in eine Kurzgeschichte umsetzen kann. Sie sind kein symmetrischer Wettbewerb zwischen menschlicher und maschineller Ideenfindung.

Hinzu kommt die geringe Zahl der untersuchten Werke: Trotz der großen Teilnehmerzahl basiert der Vergleich auf lediglich drei menschlichen und drei KI-generierten Geschichten.

Mensch oder KI? Leser liegen häufig daneben

In zwei weiteren Experimenten untersuchten Sears und Weisberg, ob Menschen überhaupt erkennen können, wer eine Geschichte geschrieben hat.

Dabei lasen insgesamt 905 weitere Teilnehmer jeweils zwei thematisch zusammengehörende Texte – einen menschlichen und einen von ChatGPT. Anschließend sollten sie entscheiden, welcher Text von wem stammte.

Im zweiten Experiment gelang die richtige Zuordnung nur 39,39 % der Teilnehmer. Das lag statistisch signifikant unter der Zufallswahrscheinlichkeit von 50 %. Die Versuchspersonen tendierten also sogar dazu, die Herkunft beider Texte zu vertauschen.

Die Forscherinnen wiederholten den Versuch deshalb mit weiteren 481 Personen und einer verbesserten Messung der KI-Kompetenz. Diesmal lagen 51,97 % richtig. Das unterschied sich statistisch nicht von einem Zufallsergebnis.

In keinem der beiden Experimente konnten die Teilnehmer menschliche und KI-generierte Geschichten damit generell zuverlässig auseinanderhalten.

Ausgerechnet die Sprache führte Leser in die Irre

Interessant ist, woran sich die Versuchspersonen bei ihrer Entscheidung orientierten. Wer nach eigener Aussage besonders auf die Sprache der Geschichten achtete, lag sogar häufiger falsch.

Im dritten Experiment schnitten Teilnehmer etwas besser ab, wenn sie sich bei ihrer Einschätzung an der Verwendung von Symbolik orientierten. Andere Merkmale wie Handlung, Figuren oder Thema lieferten keinen klaren Vorteil.

Auch größere Erfahrung mit Literatur half nicht. Einen Zusammenhang fanden die Forscherinnen dagegen bei der selbst eingeschätzten KI-Kompetenz: Teilnehmer mit höheren Werten auf einer KI-Kompetenzskala erkannten die Herkunft der Geschichten etwas häufiger richtig.

Daraus folgt allerdings nicht, dass regelmäßige ChatGPT-Nutzung automatisch zum zuverlässigen KI-Detektor macht. Die Untersuchung zeigt lediglich einen statistischen Zusammenhang zwischen selbst berichteter KI-Kompetenz und Trefferquote.

Die untersuchte KI ist bereits mehrere Jahre alt

Für die Einordnung der Ergebnisse ist auch der Entstehungszeitpunkt der KI-Texte relevant. Die erste Geschichte ließ das Forschungsteam bereits im November 2023 mit „ChatGPT 4.0“ erstellen. Die beiden anderen folgten im Dezember 2024.

Die im August 2026 veröffentlichte Studie bildet damit nicht den aktuellen technischen Stand leistungsfähiger Sprachmodelle ab. Ob neuere Modelle bei demselben Versuchsaufbau besser, schlechter oder lediglich anders abschneiden würden, wurde nicht untersucht.

Auch eine Verallgemeinerung auf Romane oder andere Textformen wäre nicht zulässig. Sämtliche Geschichten waren nur rund 1000 Wörter lang und gehörten zur realistischen Fiktion. Die Autorinnen weisen selbst darauf hin, dass längere Texte Sprachmodelle vor andere Probleme stellen könnten, etwa bei der konsistenten Entwicklung von Figuren und Handlungssträngen.

Zudem stammen sämtliche Versuchspersonen aus den USA. Kulturelle Unterschiede beim Umgang mit Literatur und Künstlicher Intelligenz könnten die Ergebnisse beeinflussen. (mit Material der dpa)

Quellen:

Originalstudie: Sears, Sydney; Weisberg, Deena Skolnick: Bot or not: Can people tell the difference between stories written by a human or by an AI system?, „Judgment and Decision Making“, veröffentlicht am 5. August 2026, DOI 10.1017/jdm.2026.10042. Originalstudie bei Cambridge University Press

Daten, Materialien und Analyseskripte: Die Autorinnen stellen Versuchsunterlagen und Datenauswertung über das Open Science Framework bereit. Studienmaterialien im OSF

Universität/Forschungsteam: STAR Lab der Villanova University, Forschungsgruppe von Deena Skolnick Weisberg. Publikationsübersicht des STAR Lab

Ein Beitrag von:

  • Dominik Hochwarth

    Redakteur beim VDI Verlag. Nach dem Studium absolvierte er eine Ausbildung zum Online-Redakteur, es folgten ein Volontariat und jeweils 10 Jahre als Webtexter für eine Internetagentur und einen Onlineshop. Seit September 2022 schreibt er für ingenieur.de.

Zu unseren Newslettern anmelden

Das Wichtigste immer im Blick: Mit unseren beiden Newslettern verpassen Sie keine News mehr aus der schönen neuen Technikwelt und erhalten Karrieretipps rund um Jobsuche & Bewerbung. Sie begeistert ein Thema mehr als das andere? Dann wählen Sie einfach Ihren kostenfreien Favoriten.