Wissenschaft lebt von einer einfachen Regel: Eine Behauptung soll nachvollziehbar sein. Literaturangaben sind dafür das Gedächtnis eines Fachartikels. Doch was passiert, wenn eine zitierte Studie überhaupt nicht existiert?
Ein Forschungsteam um Maxim Topaz hat rund 2,5 Millionen biomedizinische Arbeiten aus dem Open-Access-Bestand von PubMed Central untersucht. Von 97,1 Millionen überprüften Referenzen klassifizierte das Team 4.046 als fabriziert. Sie verteilten sich auf 2.810 Arbeiten.
Besonders auffällig ist der zeitliche Trend: 2023 enthielt ungefähr eine von 2.828 Arbeiten mindestens eine fabrizierte Referenz. In den ersten sieben Wochen 2026 war es etwa eine von 277. Die Rate stieg damit um mehr als das Zwölffache.
Wie kann eine Quelle erfunden werden?
Moderne Sprachmodelle erzeugen Text nach Wahrscheinlichkeiten. Werden sie nach Literatur gefragt, können sie Angaben produzieren, die wie echte wissenschaftliche Referenzen aussehen: plausible Autorennamen, ein passender Titel, ein existierendes Journal und sogar eine scheinbar glaubwürdige DOI. Nur die konkrete Publikation existiert nicht.
Das Problem ist älter als generative KI. Fehler beim Kopieren, ungenaue Literaturdatenbanken oder wissenschaftliches Fehlverhalten können ebenfalls falsche Referenzen erzeugen. Die starke Zunahme seit Mitte 2024 fällt jedoch zeitlich mit der breiten Nutzung generativer KI zusammen.
Korrelation ist noch kein Täterbeweis
Genau hier ist wissenschaftliche Vorsicht nötig. Die Studie zeigt eine starke zeitliche Übereinstimmung, aber sie kann nicht für jede einzelne falsche Referenz beweisen, dass ChatGPT oder ein anderes Sprachmodell sie erzeugt hat. Deshalb wäre die Aussage ‚KI hat 4.046 Quellen erfunden‘ zu stark.
Die Autoren nutzten ausgerechnet KI-gestützte Verfahren, um verdächtige Referenzen in Millionen Datensätzen zu finden, und prüften sie gegen mehrere wissenschaftliche Datenbanken. Das illustriert eine wichtige Pointe: KI ist weder automatisch Ursache noch Lösung. Entscheidend ist der Prüfprozess.
Warum falsche Zitate medizinisch relevant sind
Eine erfundene Referenz ist nicht nur ein Schönheitsfehler im Literaturverzeichnis. Reviews und Leitlinien bauen auf früheren Publikationen auf. Wenn eine nichtexistente Studie als Beleg für eine Behandlung oder einen biologischen Mechanismus erscheint, kann sie in weitere Arbeiten übernommen werden. Aus einem einzelnen Fehler entsteht eine scheinbare Belegkette.
Das Risiko hängt allerdings vom Inhalt ab. Eine falsche Referenz, die für die Schlussfolgerung einer Arbeit keine Rolle spielt, ist weniger gravierend als eine erfundene Schlüsselstudie, auf der eine Therapieempfehlung beruht.
Was dagegen helfen kann
Technisch ist das Problem überraschend lösbar. DOI, PubMed-ID, Titel, Autoren und Journal lassen sich automatisiert gegen Datenbanken prüfen. Verlage könnten solche Kontrollen bereits bei der Manuskripteinreichung durchführen. Peer Reviewer müssten dann nicht jede Literaturangabe manuell anklicken.
Die Studie hat Grenzen: Sie untersuchte den Open-Access-Bestand von PubMed Central, nicht die gesamte medizinische Literatur. Auch automatisierte Klassifikation ist nicht fehlerfrei. Trotzdem zeigt die Größenordnung ein reales Qualitätssicherungsproblem.
Die wichtigste Lehre ist deshalb nicht, KI aus Wissenschaft zu verbannen. Sie lautet: Eine plausibel klingende Quelle ist keine Quelle. In einer Forschungswelt, in der Maschinen Text immer überzeugender erzeugen, wird Verifikation nicht weniger wichtig – sondern zum zentralen Teil wissenschaftlicher Infrastruktur.
Quellen
- https://doi.org/10.1016/S0140-6736(26)00603-3
- https://doi.org/10.1038/d41586-026-00748-w
- https://phys.org/news/2026-05-peer-medical-papers-fake-citations.html
Redaktioneller Hinweis: Stand: 14.09.2026. Die Primärarbeit erschien im Mai 2026; der Beitrag greift das aktuell erneut diskutierte Forschungsintegritätsproblem auf. Kausalität zwischen jedem Einzelfall und generativer KI ist nicht bewiesen.