KI-Ratgeber

Literaturrecherche mit KI: Werkzeuge und Quellenprüfung

27 Min. Lesezeit
Illustration zum Ratgeber Literaturrecherche mit KI, Kategorie KI-Ratgeber | vergleich.cc

Eine Literaturliste, die eine KI in zwölf Sekunden ausspuckt, sieht aus wie das Ergebnis von zwei Tagen Bibliotheksarbeit. Autorennamen, Zeitschrift, Jahrgang, Seitenzahlen, dazu ein DOI, der so aussieht, wie DOIs eben aussehen. Ein Teil dieser Angaben führt beim Nachschlagen ins Leere, weil es die Arbeit nie gegeben hat. In einer Hausarbeit ist das kein Formfehler, sondern ein Täuschungsvorwurf, der die ganze Leistung kostet.

Die Nutzung ist längst Alltag. Das Centrum für Hochschulentwicklung fasste im Januar 2026 fünfzehn Einzelstudien zusammen und kam zu dem Ergebnis, dass der Anteil der Studierenden ohne jede KI-Nutzung nur noch im einstelligen Prozentbereich liegt, während rund die Hälfte täglich mit solchen Werkzeugen arbeitet. Umso wichtiger ist die Frage, welches Werkzeug für welchen Schritt taugt. Dieser Ratgeber zeigt dir, warum Sprachmodelle Quellen erfinden, welche Programme stattdessen echte Publikationsdatenbanken durchsuchen, was sie kosten und wie du jede einzelne Angabe in unter einer Minute überprüfst. Alle Angaben haben den Stand vom 31. August 2026.

Warum erfindet eine KI Literaturangaben, die es nicht gibt?

Der Grund liegt in der Bauart des Werkzeugs und ist keine Fehlfunktion, die sich mit dem nächsten Update erledigt.

Was beim Zitieren im Modell wirklich passiert

Ein Sprachmodell speichert keine Bibliothek. Es hat aus sehr vielen Texten gelernt, welche Zeichenfolge auf eine andere zu folgen pflegt, und erzeugt daraus Wort für Wort eine wahrscheinliche Fortsetzung. Fragst du nach Literatur zu einem Thema, produziert es genau das: eine wahrscheinliche Literaturangabe. Der Aufbau stimmt, weil das Modell Tausende echter Quellenangaben gesehen hat. Die Kombination aus Autor, Titel, Zeitschrift und Jahr entsteht dabei neu und muss keiner realen Veröffentlichung entsprechen.

Besonders tückisch wird es, wenn echte Bausteine falsch zusammengesetzt werden. Ein real existierender Forschungsname landet auf einem Titel, den jemand anderes geschrieben hat, veröffentlicht in einer Zeitschrift, die es wirklich gibt, im falschen Jahrgang. Solche Mischungen fallen bei einer flüchtigen Prüfung nicht auf, weil jedes Einzelteil bekannt wirkt.

Warum erfundene Angaben so echt aussehen

Ein DOI, also der dauerhafte digitale Objektbezeichner einer Veröffentlichung, hat ein festes Muster. Er beginnt mit einer Präfixnummer für den Verlag, dann folgt ein Schrägstrich und eine Zeichenkette. Ein Modell kann dieses Muster problemlos nachbilden und hängt es an eine erfundene Arbeit, weil zu einer vollständigen Quellenangabe eben ein DOI gehört. Die Nummer sieht dadurch korrekt aus und löst trotzdem nichts auf.

Dazu kommt der Tonfall. Sprachmodelle antworten in ganzen Sätzen und ohne erkennbares Zögern, auch dann, wenn sie zu einem Nischenthema gar nichts wissen. Diese gleichbleibende Sicherheit ist der eigentliche Fallstrick, weil sie kein Warnsignal sendet.

Wie oft kommen erfundene Quellen wirklich vor?

Zu dieser Frage gibt es inzwischen belastbare Messungen, und sie fallen deutlicher aus, als viele erwarten.

Die bekannteste Untersuchung stammt von William Walters und Esther Wilder, veröffentlicht 2023 in der Zeitschrift Scientific Reports. Die beiden ließen ChatGPT in der Version 3.5 und in der Version 4 kurze Literaturüberblicke zu 42 Themen schreiben und prüften die 636 darin enthaltenen Quellenangaben einzeln nach. Ergebnis: 55 Prozent der Angaben aus GPT-3.5 waren frei erfunden, bei GPT-4 waren es 18 Prozent. Von den echten Angaben enthielten zusätzlich 43 Prozent beziehungsweise 24 Prozent inhaltliche Fehler, etwa falsche Seitenzahlen oder ein falsches Erscheinungsjahr.

Eine zweite Arbeit prüfte den Ernstfall. Mikaël Chelli und Kollegen ließen 2024 im Journal of Medical Internet Research Sprachmodelle die Ergebnisse von elf bereits veröffentlichten systematischen Übersichtsarbeiten nachbauen und verglichen die gelieferten 471 Quellen mit den echten. Die Halluzinationsrate lag bei GPT-3.5 bei 39,6 Prozent, bei GPT-4 bei 28,6 Prozent und bei Bard, dem Vorläufer von Gemini, bei 91,4 Prozent. Noch aussagekräftiger ist die Trefferquote. Von den Arbeiten, die tatsächlich in die Übersichten gehörten, fanden die Modelle rund zwölf bis vierzehn Prozent, Bard keine einzige. Das Fazit der Autoren fällt eindeutig aus, Sprachmodelle taugen in diesem Zustand nicht als alleiniges Werkzeug für eine systematische Recherche.

Neuere Zahlen zeigen, dass sich das Problem verlagert hat. Jake Linardon und Kollegen prüften 2025 in JMIR Mental Health 176 Quellenangaben aus GPT-4o. Erfunden waren davon knapp 20 Prozent, von den echten Angaben enthielten 45 Prozent Fehler. Der interessanteste Befund betrifft die DOIs. Bei zwei Dritteln der erfundenen Quellen war der mitgelieferte DOI gültig und führte zu einem echten, thematisch völlig anderen Aufsatz. Ein Klick auf den DOI allein reicht als Prüfung also nicht.

Dass die Sache in der Wissenschaft selbst ankommt, zeigt eine Untersuchung, die im Mai 2026 in The Lancet erschien. Ein Team um Michael Topaz durchsuchte rund 2,5 Millionen biomedizinische Fachartikel nach erfundenen Quellenangaben. Der Anteil betroffener Arbeiten stieg von einer unter 2.828 im Jahr 2023 auf eine unter 277 in den ersten Wochen des Jahres 2026.

Wie teuer der Verzicht auf die Prüfung wird, zeigt der Fall Mata gegen Avianca. Zwei New Yorker Anwälte reichten 2023 einen Schriftsatz mit sechs Präzedenzfällen ein, die ChatGPT erfunden hatte. Das Gericht verhängte im Juni 2023 eine Geldbuße von 5.000 US-Dollar. Für eine Prüfungsleistung gilt derselbe Maßstab, dort führt der Weg allerdings in ein Verfahren wegen Täuschungsversuchs.

Was unterscheidet ein Chatmodell von einem Rechercheassistenten?

Dieser Unterschied entscheidet darüber, ob deine Quellen existieren, und er ist wichtiger als jedes Ranking der beliebtesten Werkzeuge.

Erzeugen gegen nachschlagen

Ein reines Chatmodell arbeitet aus dem, was in seinen Gewichten steckt. Es hat keinen Zugriff auf einen Katalog, kann keine Suchanfrage an eine Datenbank stellen und keine Trefferliste zurückbekommen. Alles, was wie ein Suchergebnis aussieht, ist eine Rekonstruktion aus dem Training.

Ein werkzeuggestützter Rechercheassistent dreht die Reihenfolge um. Er wandelt deine Frage in eine oder mehrere Suchanfragen, schickt sie an einen echten Bestand wie Semantic Scholar, OpenAlex, PubMed oder Scopus, holt sich die Treffer samt Metadaten und fasst erst dann zusammen, was in diesen Treffern steht. Die Zusammenfassung kann immer noch danebenliegen, die Quellenangabe dagegen stammt aus dem Datensatz der Datenbank und ist damit real. In der Fachsprache heißt dieses Prinzip retrieval augmented generation, also erst holen, dann formulieren.

Woran du erkennst, welche Sorte du vor dir hast

Drei Prüfungen dauern zusammen keine zwei Minuten.

  • Gibt es anklickbare Treffer? Ein Assistent mit Datenbankanbindung zeigt eine Trefferliste mit Titeln, Autoren, Jahr und einem Link, der dich zum Verlag oder zum Volltext bringt. Reiner Fließtext mit Quellenangaben im Klammernformat ist ein schlechtes Zeichen.
  • Steht die Trefferzahl dabei? Werkzeuge, die wirklich suchen, nennen typischerweise, aus wie vielen Arbeiten sie ausgewählt haben.
  • Lässt sich exportieren? Wer eine Trefferliste als BibTeX oder RIS herausgeben kann, hat strukturierte Datensätze und nicht nur Text.

Die Zwischenform sind Chatmodelle mit eingeschalteter Websuche. Sie schlagen tatsächlich nach, allerdings im offenen Web und nicht in einem Publikationsbestand. Damit landen Blogbeiträge, Pressemitteilungen und Verlagswerbung gleichberechtigt neben begutachteten Arbeiten. Für einen ersten Überblick reicht das, für ein Literaturverzeichnis nicht. Dasselbe gilt für Claude und die übrigen großen Chatmodelle, solange sie ohne angebundene Fachdatenbank arbeiten.

Eine dritte Bauart lohnt die Unterscheidung. Gemini Notebook (früher NotebookLM) beantwortet Fragen ausschließlich aus den Dateien, die du selbst hochlädst, und belegt jede Aussage mit einer Stelle im hochgeladenen Material. Erfundene Quellen sind damit ausgeschlossen, weil das Werkzeug gar keine eigenen sucht. Für die Auswertung eines Stapels, den du bereits zusammengetragen hast, ist das stark, als Suchwerkzeug taugt es nicht, weil es weder Semantic Scholar noch Scopus oder Web of Science erreicht.

Welche KI-Werkzeuge durchsuchen wirklich Publikationsdatenbanken?

Die folgenden Programme stellen echte Suchanfragen an einen Publikationsbestand und liefern Treffer mit Metadaten zurück. Alle Angaben stammen von den Anbieterseiten, abgerufen am 31. August 2026, und sind in US-Dollar ausgewiesen.

Elicit, der Assistent für Übersichtsarbeiten

Bei Elicit stellst du eine Forschungsfrage, und das Werkzeug legt die Treffer in einer Tabelle ab, deren Spalten du selbst festlegst, etwa Stichprobengröße, Studiendesign oder Hauptergebnis. Der Bestand umfasst nach Anbieterangabe über 138 Millionen Arbeiten, zusammengeführt aus Semantic Scholar, OpenAlex und PubMed. Die Gratisstufe erlaubt unbegrenztes Suchen und Zusammenfassen bei begrenzter Nutzung der Rechercheberichte. Pro kostet 49 US-Dollar je Nutzer und Monat, im Jahrestarif 588 US-Dollar, und screent bis zu 5.000 Arbeiten. Die Stufe Scale liegt bei 169 US-Dollar im Monat.

Consensus, die Antwort mit Studienlage

Consensus beantwortet konkrete Fragen anhand der Literatur und zeigt, wie viele der gefundenen Arbeiten zustimmen und wie viele widersprechen. Der Bestand umfasst nach Anbieterangabe über 220 Millionen begutachtete Arbeiten aus Semantic Scholar, OpenAlex und einem eigenen Index. Die Reihenfolge ist dabei entscheidend. Erst wird gesucht und sortiert, dann fasst das Modell ausschließlich die obersten Treffer zusammen. Erfundene Angaben sind damit strukturell ausgeschlossen. Die Gratisstufe bietet die Basissuche, 15 vertiefte Anfragen und drei ausführliche Berichte im Monat. Pro kostet 20 US-Dollar im Monat, bei Jahreszahlung 12 US-Dollar. Studierende und Lehrende mit Hochschul-Mailadresse bekommen nach Anbieterangabe bis zu 40 Prozent Rabatt.

SciSpace, Suche und Lesehilfe in einem

SciSpace erklärt markierte Stellen im PDF, baut Vergleichstabellen und zieht Treffer unter anderem aus Semantic Scholar, OpenAlex und Google Scholar. Eine dauerhafte Gratisstufe weist die Preisseite nicht aus, die Tarife arbeiten mit einem Guthabensystem. Premium kostet 20 US-Dollar im Monat, bei Jahreszahlung 12 US-Dollar, Advanced liegt bei 90 beziehungsweise 70 US-Dollar, Max bei 200 beziehungsweise 160 US-Dollar. Eine aktuelle Bestandszahl nennt der Anbieter derzeit nicht.

Scite, die Zitate im Kontext

Scite beantwortet eine andere Frage als die übrigen Werkzeuge, nämlich wie eine Arbeit von anderen aufgenommen wurde. Der Dienst wertet Zitatstellen aus und ordnet sie in unterstützend, erwähnend und widersprechend ein. Der Anbieter nennt 1,6 Milliarden Zitatstellen aus mehr als 300 Millionen wissenschaftlichen Quellen. Eine Gratisstufe gibt es nicht, nur einen Test über sieben Tage. Basic kostet 20 US-Dollar im Monat bei Jahreszahlung, Pro 50 US-Dollar. Für die Frage, ob eine viel zitierte Studie später bestätigt oder zerlegt wurde, gibt es kaum ein schnelleres Werkzeug.

Research Rabbit, Connected Papers und Litmaps für den Zitationsgraphen

Diese drei arbeiten grafisch. Du gibst eine oder mehrere Startarbeiten an, und das Werkzeug zeichnet daraus ein Netz verwandter Arbeiten. Research Rabbit nennt über 310 Millionen Artikel und gehört seit Mai 2025 zu Litmaps. Die Gratisstufe deckt bis zu 50 Startarbeiten ab, die Plus-Stufe kostet 10 US-Dollar im Monat bei Jahreszahlung. Connected Papers baut seinen Ähnlichkeitsgraphen auf dem Bestand von Semantic Scholar auf, erlaubt gratis fünf Graphen im Monat und kostet für Hochschulangehörige 3 US-Dollar im Monat. Litmaps greift auf Crossref, Semantic Scholar und OpenAlex zu, nennt über 270 Millionen Artikel, begrenzt die Gratisstufe auf wenige Karten mit je 100 Arbeiten und verlangt für Pro 10 US-Dollar im Monat oder 120 US-Dollar im Jahr. Der Nutzen dieser Werkzeuge liegt in den Literatur-Alerts, die eine gespeicherte Karte automatisch um neue Arbeiten ergänzen.

Undermind für die erschöpfende Suche

Undermind arbeitet Zitationsspuren systematisch ab, statt eine Trefferliste zu ranken. Die Suche läuft mehrstufig über etwa zwei Minuten, greift auf über 200 Millionen Arbeiten aus dem Bestand von Semantic Scholar zu und schätzt am Ende, welchen Anteil der relevanten Literatur sie gefunden hat. Diese Schätzung ist der eigentliche Unterschied zu einer normalen Suche. Die Gratisstufe deckt Standardlimits ab, Pro kostet 16 US-Dollar im Monat bei Jahreszahlung und durchsucht zusätzlich Volltexte von frei zugänglichen Arbeiten und Vorabdrucken.

Scopus AI, Web of Science und Google Scholar

Die etablierten Anbieter haben nachgezogen, ihre Assistenten hängen allerdings an einer Lizenz. Scopus AI von Elsevier wertet Dokumente ab Erscheinungsjahr 2003 aus und stützt seine Zusammenfassungen auf bis zu 20 Arbeiten, bei der erweiterten Recherche auf bis zu 40. Der Research Assistant von Clarivate arbeitet auf der Core Collection von Web of Science mit über 101 Millionen Datensätzen und führt schrittweise durch Themenabgrenzung, Suchstrategie und Auswahl. Beide erreichst du über deine Hochschulbibliothek, einen öffentlichen Preis nennen die Anbieter nicht.

Google Scholar hat im November 2025 unter dem Namen Scholar Labs eine KI-Suche gestartet. Sie zerlegt deine Frage in Bestandteile, bildet daraus mehrere Suchanfragen und sortiert die Treffer. Der Zugang wird schrittweise freigeschaltet, im Juni 2026 folgte ein Ausbau von Tempo und Umfang. Kostenlos und ohne Anmeldung nutzbar sind auch die Bestände selbst. OpenAlex verzeichnete am 31. August 2026 rund 321,9 Millionen Werke, Semantic Scholar nennt 214 Millionen Arbeiten und 2,49 Milliarden Zitationen. Für den deutschsprachigen Raum kommen die lizenzierten Fachdatenbanken deiner Bibliothek dazu, die Suchmaschine BASE der Universitätsbibliothek Bielefeld sowie die Fachinformationsdienste der einzelnen Disziplinen.

Was kostet die KI-gestützte Literaturrecherche wirklich?

Für Einzelpersonen liegen die Assistenten zwischen 3 und 50 US-Dollar im Monat, die Stufen für intensives Screening deutlich darüber. Bevor du etwas abschließt, lohnen sich drei Prüfungen.

  • Frag zuerst deine Bibliothek. Viele Hochschulen haben Scopus, Web of Science oder Fachdatenbanken lizenziert, teils samt KI-Erweiterung. Der Zugang läuft über die Anmeldung deiner Einrichtung und kostet dich nichts.
  • Prüfe den Bildungsrabatt. Mehrere Anbieter geben deutliche Nachlässe für Hochschul-Mailadressen, bei Consensus bis zu 40 Prozent, bei Connected Papers gilt ein eigener Tarif für Hochschulangehörige.
  • Rechne in Monaten. Eine Abschlussarbeit dauert selten zwölf Monate. Ein Monatsabo in der heißen Phase kommt oft günstiger als ein Jahresvertrag mit Rabatt.

Für viele Arbeiten reicht die Kombination aus der Fachdatenbank der Bibliothek, einem kostenlosen Zitationswerkzeug und den Gratisstufen der Assistenten. Wie sich diese Programme in die Übersicht der KI-Werkzeuge insgesamt einordnen, zeigt der Vergleich der Kategorien. Geld ausgeben lohnt sich ab dem Punkt, an dem du systematisch screenst und Daten aus vielen Arbeiten in eine Tabelle ziehst.

Wie prüfst du eine Quelle, die dir eine KI genannt hat?

Die Prüfung folgt einer festen Reihenfolge und dauert pro Angabe etwa vierzig Sekunden.

Den DOI auflösen

Setze den DOI hinter die Adresse doi.org, also zum Beispiel doi.org/10.1038/s41598-023-41032-5, und ruf die Adresse auf. Existiert die Arbeit, leitet der Dienst dich zur Seite des Verlags weiter. Existiert sie nicht, bekommst du eine Fehlermeldung, dass der DOI nicht gefunden wurde. Genau so verhalten sich erfundene Nummern, und der Test kostet dich einen Klick.

Wer mehrere Angaben auf einmal prüfen will, nutzt die Schnittstelle von Crossref. Der Aufruf api.crossref.org/works/ mit angehängtem DOI liefert bei einer echten Arbeit einen Datensatz mit Titel, Autoren, Zeitschrift und Erscheinungsdatum, bei einer erfundenen den Fehlercode 404. Vergleiche dabei unbedingt den zurückgegebenen Titel mit dem, was die KI dir genannt hat. Ein auflösbarer DOI beweist nur, dass die Nummer zu irgendeiner Arbeit gehört.

In der Datenbank gegenprüfen

Fehlt der DOI, suchst du den exakten Titel in Anführungszeichen in Google Scholar, in PubMed für medizinische Themen oder in der freien Datenbank OpenAlex. OpenAlex verzeichnete am 31. August 2026 rund 321,9 Millionen Arbeiten, davon etwa 220,3 Millionen mit DOI, und ist ohne Konto abfragbar. Wenn ein Titel dort nirgends auftaucht, du ihn aber wortgleich suchst, gibt es die Arbeit mit hoher Wahrscheinlichkeit nicht.

Ein zweiter Schritt lohnt sich bei allem, was du zitieren willst. Die Retraction Watch Database, seit September 2023 bei Crossref und frei durchsuchbar, verzeichnet zurückgezogene Arbeiten. Eine zurückgezogene Studie ist echt und trotzdem unbrauchbar, und ein Sprachmodell kennt diesen Unterschied nicht.

Die Zitationskette anschauen

Existiert die Arbeit, prüfst du zum Schluss, ob sie überhaupt das hergibt, was in deinem Text steht. Öffne den Abstract und suche die Aussage, die du belegen willst. Bei einer Behauptung, die nur im Volltext steht, gehört der Volltext gelesen. Dienste, die Zitate im Kontext auswerten, zeigen dir zusätzlich, ob spätere Arbeiten die Studie bestätigen oder ihr widersprechen. Eine viel zitierte Arbeit kann viel zitiert werden, weil alle sie widerlegen.

Wie schärfst du die Fragestellung, bevor du überhaupt suchst?

Der häufigste Grund für eine unbrauchbare Trefferliste liegt vor der ersten Suchanfrage. Eine Frage wie „Wirkung von Social Media auf Jugendliche“ ist zu weit für jede Datenbank und für jeden Assistenten.

Zerlege deine Frage deshalb in Bestandteile. In der Medizin hat sich dafür das Schema PICO eingebürgert, das nach Population, Intervention, Vergleich und Ergebnis fragt. Für andere Fächer funktioniert die gleiche Logik mit anderen Bezeichnungen. Wer, was, womit verglichen, gemessen woran, in welchem Zeitraum und in welchem Land. Aus der Beispielfrage wird damit etwa: Zusammenhang zwischen täglicher Nutzungsdauer von Kurzvideoplattformen und selbstberichteten Konzentrationsproblemen bei 14- bis 18-Jährigen in Längsschnittstudien seit 2020.

Diese Fassung taugt als Prompt und gleichzeitig als Suchanfrage in einer Datenbank. Ein Rechercheassistent kann daraus sinnvolle Filter ableiten, und du selbst erkennst am Treffer sofort, ob er zur Frage passt.

Welche Suchbegriffe und Synonyme brauchst du?

Datenbanken suchen nach Zeichenfolgen, nicht nach Bedeutung. Deshalb entscheidet die Begriffsliste über die Vollständigkeit deiner Recherche.

Sammle für jeden Baustein deiner Frage drei Sorten von Begriffen. Erstens die deutschen Alltagswörter, zweitens die englischen Fachbegriffe, drittens die kontrollierten Schlagwörter der jeweiligen Datenbank. In PubMed heißen diese Schlagwörter MeSH, andere Fächer haben eigene Thesauri. Denk an britische und amerikanische Schreibweisen, an Singular und Plural sowie an ältere Bezeichnungen für dasselbe Phänomen, weil Arbeiten aus den Neunzigern anders benannt sind als Arbeiten von heute.

Verknüpfe die Begriffe anschließend mit den booleschen Operatoren. Synonyme innerhalb eines Bausteins verbindest du mit OR, verschiedene Bausteine mit AND, und störende Nebenbedeutungen schließt du mit NOT aus. Der Stern als Platzhalter fängt Wortformen ab, etwa Jugend* für Jugendliche und Jugendlicher. Genau hierbei hilft ein Sprachmodell zuverlässig, weil Synonyme zu finden eine Sprachaufgabe ist und keine Faktenfrage.

Wie legst du Ein- und Ausschlusskriterien fest?

Kriterien schreibst du auf, bevor du die Treffer siehst. Sonst entscheidest du unterwegs nach Bauchgefühl und begründest hinterher, warum genau die Studien übrig blieben, die deine These stützen.

  • Zeitraum: ab welchem Erscheinungsjahr, mit Begründung aus dem Thema und nicht aus der Bequemlichkeit.
  • Sprache: welche Publikationssprachen du lesen kannst, mit ehrlichem Vermerk, dass alles andere unberücksichtigt bleibt. Eine Übersetzung mit DeepL macht ein fremdsprachiges Abstract zugänglich, den Volltext für eine Detailauswertung ersetzt sie nicht.
  • Publikationsform: begutachtete Zeitschriftenartikel, Konferenzbeiträge, Vorabdrucke, Qualifikationsarbeiten, graue Literatur.
  • Studienart: etwa nur Längsschnittstudien, nur kontrollierte Versuche, nur empirische Arbeiten.
  • Population und Kontext: Altersgruppe, Berufsgruppe, Land, Branche.
  • Verfügbarkeit: ob Arbeiten ohne zugänglichen Volltext ausgeschlossen werden.

Halte zu jedem Kriterium fest, wie viele Treffer daran gescheitert sind. Diese Zahlen brauchst du später für den Methodenteil, und sie schützen dich vor dem Vorwurf, deine Auswahl sei beliebig.

Wie funktioniert das Schneeballverfahren vorwärts und rückwärts?

Keine Datenbanksuche findet alles. Das Schneeballverfahren schließt die Lücken und ist der Teil der Recherche, den KI-Werkzeuge am besten unterstützen.

Rückwärts heißt, du nimmst eine gute Arbeit und gehst ihr Literaturverzeichnis durch. So kommst du zu den älteren Grundlagentexten, auf denen das Feld aufbaut, und findest Begriffe, die du in deiner Suche noch nicht hattest. Vorwärts heißt, du suchst die Arbeiten, die deine Ausgangsstudie später zitiert haben. Das führt dich zum aktuellen Stand, zu Replikationen und zu Widerspruch. Google Scholar zeigt diesen Weg über den Link „Zitiert von“, Semantic Scholar und OpenAlex liefern dieselbe Information über ihre Schnittstellen.

Die grafischen Werkzeuge setzen genau hier an. Sie zeichnen aus einer oder mehreren Startarbeiten ein Netz aus Zitationen und machen sichtbar, welche Arbeiten im Zentrum stehen und welche Gruppen sich gebildet haben. Zwei Warnungen gehören dazu. Ein Netz zeigt Beziehungen und keine Qualität, und stark vernetzte ältere Arbeiten verdrängen neue, die noch niemand zitiert hat. Deshalb bleibt die Datenbanksuche mit sauberer Begriffsliste die Grundlage, das Schneeballverfahren ergänzt sie.

Darf KI bei einer systematischen Übersichtsarbeit mitarbeiten?

Ja, unter Bedingungen, und diese Bedingungen sind seit 2025 erstmals ausformuliert. Cochrane, die Campbell Collaboration, das JBI und die Collaboration for Environmental Evidence haben ein gemeinsames Positionspapier vorgelegt, das den Einsatz von KI in Evidenzsynthesen regelt.

Drei Punkte daraus solltest du kennen. Die Verantwortung für die Übersichtsarbeit bleibt vollständig bei den Menschen, die sie erstellen, einschließlich der Entscheidung, überhaupt KI einzusetzen. Jeder KI-Einsatz braucht menschliche Aufsicht. Jede Stelle, an der ein Werkzeug ein Urteil fällt oder vorschlägt, gehört vollständig und nachvollziehbar in den Bericht. Dieselbe Gruppe hat unter dem Kürzel RAISE Empfehlungen für alle Beteiligten veröffentlicht, von den Autorenteams bis zu den Verlagen.

Für deine Arbeit heißt das ganz praktisch, dass du Suchanfrage, Datum, Datenbank, Trefferzahl und eingesetztes Werkzeug samt Version festhältst. Eine Recherche, die sich nicht nachbauen lässt, erfüllt den Anspruch an eine systematische Übersichtsarbeit nicht, egal wie gründlich sie war. Genau daran scheitern Chatmodelle als Suchwerkzeug, weil dieselbe Frage morgen eine andere Trefferliste ergibt.

Wie screenst du Abstracts und Volltexte mit Unterstützung?

Nach der Suche steht die eigentliche Arbeit an. Aus mehreren Tausend Treffern werden in zwei Durchgängen die relevanten Arbeiten herausgefiltert, erst über Titel und Abstract, dann über den Volltext.

Für den ersten Durchgang gibt es seit Jahren spezialisierte Programme, die mit aktivem Lernen arbeiten. Du bewertest einige Treffer selbst, das Programm lernt daraus und sortiert die verbleibende Liste so um, dass die wahrscheinlich relevanten Arbeiten nach oben rutschen. Eine Übersichtsarbeit im Journal of Information Science wertete 2025 sechzig Studien zu diesem Verfahren aus, alle sechzig empfahlen es als Mittel, den Screening-Aufwand zu senken. Frei verfügbar ist ASReview, verbreitet im Team ist Rayyan.

Wichtig ist die Rolle, die du dem Werkzeug gibst. Es sortiert die Reihenfolge, es entscheidet nicht über den Ausschluss. Der übliche Weg sieht vor, dass zwei Personen unabhängig voneinander screenen und Abweichungen besprechen. Ein Sprachmodell kann eine dieser Personen unterstützen, ersetzt sie aber nicht, weil es seine Entscheidung nicht begründen kann und bei gleicher Eingabe unterschiedlich urteilt.

Beim Volltext-Durchgang helfen Werkzeuge wie ChatPDF oder AskYourPDF, die Fragen an ein hochgeladenes PDF beantworten. Sie sind nützlich für gezielte Fragen wie die Stichprobengröße, das Erhebungsjahr oder das eingesetzte Messinstrument. Bei gescannten Aufsätzen ohne Textebene liefern sie nichts, dort muss vorher eine Texterkennung laufen. Prüfe jede so gewonnene Angabe an der Stelle im Text, aus der sie stammen soll.

Wie kommen die Treffer in Zotero, Citavi oder Mendeley?

Ein Fund, der nur im Verlauf eines Assistenten steht, ist verloren. Deshalb gehört jeder brauchbare Treffer sofort in ein Literaturverwaltungsprogramm, mit PDF und einer Notiz dazu, warum du ihn behalten hast.

Der Weg aus dem Assistenten in die Verwaltung

Die meisten Assistenten geben ihre Trefferlisten strukturiert heraus. Consensus exportiert Ergebnisse und Sammlungen als CSV und RIS und nennt Zotero, Mendeley, EndNote und Citavi ausdrücklich als Ziel. Elicit gibt Tabellen als RIS oder BibTeX aus, allerdings erst in den Bezahlstufen. Scite, SciSpace und Research Rabbit liefern ebenfalls RIS oder BibTeX, Litmaps bietet als einziges dieser Werkzeuge einen Abgleich in beide Richtungen mit Zotero. Bei Perplexity findest du in der Hilfe keinen Zitations-Export, dort bleiben dir PDF oder das manuelle Übertragen.

Fehlt ein Export, hilft der Umweg über die Kennung. In Zotero fügst du über die Funktion zum Hinzufügen per Identifikator mehrere DOIs, PubMed-IDs, arXiv-IDs oder ISBNs auf einmal ein, getrennt durch Zeilenumbrüche. Das Programm holt die vollständigen Metadaten selbst und du hast nebenbei geprüft, ob es die Arbeiten wirklich gibt.

Was die Programme selbst an KI mitbringen

Zotero ist in Version 10 seit August 2026 verfügbar und bringt von Haus aus keine KI-Funktionen mit. Die Erweiterungen kommen aus der Gemeinschaft, darunter Beaver als Assistent mit Zugriff auf die eigene Bibliothek und PapersGPT für Fragen an die gesammelten PDFs. Zotero führt bewusst kein geprüftes Verzeichnis und weist darauf hin, dass Erweiterungen vollen Zugriff auf das Programm und den Rechner haben. Prüfe deshalb, wer hinter einer Erweiterung steht, bevor du sie installierst. Der Speicher in der Zotero-Cloud ist bis 300 Megabyte kostenlos, 2 Gigabyte kosten 20 US-Dollar im Jahr.

Citavi gehört zum Anbieter Lumivero und liegt in Version 7 vor. Eingebaut sind drei KI-Funktionen: eine Kurzübersicht über einen ganzen Aufsatz, Zusammenfassungen einzelner Abschnitte und eine Suche, bei der du dein Thema in Alltagssprache beschreibst und passende Arbeiten aus dem Bestand von Semantic Scholar bekommst. KI-erzeugte Inhalte kennzeichnet das Programm im Projekt selbst. Die Vollversion läuft weiterhin nur unter Windows, für alle anderen gibt es die schmalere Weboberfläche. Viele Hochschulen haben eine Campuslizenz, frag danach, bevor du kaufst.

Mendeley von Elsevier hat 2026 drei KI-Funktionen bekommen, nämlich einen Lesebegleiter für einzelne PDFs, eine Abfrage über die gesamte eigene Bibliothek und einen Vergleich mehrerer Arbeiten in Tabellenform. Die Gratisstufe bringt 2 Gigabyte Speicher und fünf Fragen an den Lesebegleiter, die Bezahlstufen beginnen bei 4,99 US-Dollar im Monat. Das alte Programm Mendeley Desktop wird seit 2022 nicht mehr ausgeliefert.

Für alle drei gilt dieselbe Warnung. Eine Zusammenfassung, die dein Verwaltungsprogramm erzeugt, ist eine Lesehilfe und keine zitierfähige Aussage. Was in deiner Arbeit landet, hast du im Original nachgelesen.

Was erlauben Hochschulen, und was musst du angeben?

Eine bundesweit einheitliche Regel gibt es nicht, und das ist die wichtigste Information in diesem Abschnitt. Maßgeblich ist immer die Prüfungsordnung deines Studiengangs, dazu die Regelung deiner Hochschule oder Fakultät und die Absprache mit der Betreuung. Eine juristische Handreichung aus dem Januar 2026 fasst es so zusammen, dass das Prüfungsformat in der Prüfungsordnung geregelt sein muss und Studierende zur Kennzeichnung verpflichtet werden können, wenn die Ordnung das vorsieht. Die folgenden Beispiele zeigen die Bandbreite, sie ersetzen nicht den Blick in deine eigenen Vorgaben.

  • Erweiterte Eigenständigkeitserklärung. Die Hochschule für Wirtschaft und Recht Berlin stellt gestaffelte Formulierungen bereit, in einer Variante gehören sämtliche KI-Hilfsmittel mit Produktnamen und den verwendeten Eingaben in ein Verzeichnis im Anhang.
  • Abschnitt im Methodenteil. Die Medizinische Fakultät der Universität Zürich verlangt in ihren Richtlinien einen eigenen Abschnitt zur Verwendung von KI-Systemen im Methodikkapitel.
  • Dokumentation während der Arbeit. Die Universität Basel empfiehlt in ihrem Leitfaden ein Arbeitstagebuch mit Werkzeug, Einsatzform, betroffenen Teilen und Datum und weist darauf hin, dass eine fehlende Kennzeichnung als Täuschung gewertet werden kann.
  • Regelung auf Fakultätsebene. Die Universität Hamburg gibt einen Orientierungsrahmen vor und überlässt Format und Vorlagen den Fakultäten. In manchen Studiengängen gehört eine schriftliche Absprache mit der Betreuung vor Beginn der Arbeit dazu.

Wie ernst die Sache genommen wird, zeigen zwei Urteile des Verwaltungsgerichts Kassel vom 25. Februar 2026. In beiden Fällen ging es um ungekennzeichneten Einsatz von KI in einer Abschlussarbeit, das Gericht wertete das als besonders schwere Täuschung und bestätigte den Ausschluss von der Wiederholungsprüfung. Die Entscheidungen betrafen die fehlende Kennzeichnung, nicht erfundene Quellen. Ein Urteil speziell zu halluzinierten Literaturangaben in einer Prüfungsleistung ist bislang nicht bekannt.

Für die Wissenschaft insgesamt ist die Linie klarer. Die Deutsche Forschungsgemeinschaft stellte 2023 fest, dass nur verantwortlich handelnde natürliche Personen als Autorinnen und Autoren auftreten können, und verlangt Offenlegung, welche Modelle zu welchem Zweck und in welchem Umfang genutzt wurden. Die Leitlinien der Europäischen Kommission zum verantwortungsvollen Einsatz generativer KI in der Forschung, in der dritten Fassung vom Mai 2026, formulieren dasselbe und verweisen den Nachweis in den Methodenteil. Die Ethikorganisation COPE und das ICMJE halten es für Fachzeitschriften ebenso.

Zwei praktische Hinweise zum Schluss. Reine Rechtschreib- und Übersetzungshilfen behandeln viele Regelwerke anders als generative Textarbeit, das lohnt den Blick ins Kleingedruckte. Sichere deine Verläufe und Eingaben mit, solange du an der Arbeit sitzt. Wer später erklären muss, wie ein Abschnitt entstanden ist, hat es mit Datum, Werkzeug und Eingabe erheblich leichter.

Welche Prompts funktionieren in der Literaturrecherche?

Gute Prompts verlangen von der KI das, was sie kann, und halten sie von dem fern, was sie erfindet. Die folgenden drei Anweisungen kannst du wörtlich übernehmen und die eckigen Angaben durch deine eigenen ersetzen.

Prompt eins: Suchbegriffe und Suchstring bauen

Dieser Prompt gehört in ein Chatmodell, weil es hier um Sprache geht und nicht um Fakten.

„Du bist Fachreferentin an einer Universitätsbibliothek. Meine Fragestellung lautet: [deine Fragestellung in einem Satz]. Zerlege sie in ihre inhaltlichen Bausteine. Liefere mir zu jedem Baustein eine Tabelle in Textform mit deutschen Alltagsbegriffen, englischen Fachbegriffen und, soweit du sie kennst, kontrollierten Schlagwörtern aus PubMed oder einem Fachthesaurus. Baue daraus einen Suchstring mit den Operatoren AND, OR und NOT sowie mit Trunkierung. Nenne keine Literatur und keine Studien.“

Der letzte Satz ist der wichtigste. Er verhindert, dass dir das Modell ungefragt eine Quellenliste dazuschreibt.

Prompt zwei: eine gefundene Studie einordnen

Diesen Prompt setzt du ein, nachdem du ein PDF hochgeladen hast, also mit einem Werkzeug, das am Volltext arbeitet.

„Hier ist eine Studie als PDF. Beantworte ausschließlich anhand dieses Dokuments. Welche Fragestellung wird untersucht? Welches Studiendesign, welche Stichprobe, welcher Erhebungszeitraum? Welche Ergebnisse werden berichtet, mit den genannten Kennzahlen? Welche Einschränkungen nennen die Autoren selbst? Gib zu jeder Antwort die Seitenzahl oder den Abschnitt an. Wenn eine Information im Dokument fehlt, vermerke das ausdrücklich und ergänze nichts aus deinem eigenen Wissen.“

Prompt drei: den eigenen Entwurf gegen die Quellen prüfen

Diesen Prompt nutzt du am Ende, wenn dein Text steht.

„Ich gebe dir einen Abschnitt meiner Arbeit und die dazugehörigen Quellen als Dateien. Prüfe für jede Aussage im Abschnitt, ob sie durch die beigefügten Quellen gedeckt ist. Liste mir in drei Gruppen auf: Aussagen mit klarer Deckung samt Fundstelle, Aussagen mit ungenauer oder zu weit gehender Deckung, Aussagen ohne Beleg. Schlage keine zusätzliche Literatur vor.“

Für die reine Suche nach Arbeiten setzt du keinen Prompt in ein Chatmodell, sondern deine Frage in einen Assistenten mit Datenbankanbindung. Der Unterschied zwischen einer schönen Antwort und einer belegten Trefferliste entsteht an dieser Stelle.

Wofür taugt KI in der Literaturrecherche nicht?

Die ehrliche Antwort auf diese Frage spart dir mehr Zeit als jedes Werkzeug.

  • Als alleinige Quelle für Literaturangaben. Jede Angabe, die kein Werkzeug mit Datenbankanbindung geliefert hat, gilt als unbelegt, bis du sie aufgelöst hast.
  • Für Vollständigkeit. Kein Assistent garantiert dir, dass er alles Relevante gefunden hat. Die Bestände unterscheiden sich, und Arbeiten hinter Bezahlschranken oder in nicht indexierten Zeitschriften fehlen schlicht.
  • Für sehr enge Nischenthemen. Wo es zu einer Frage nur eine Handvoll Arbeiten gibt, hilft die Fachreferentin deiner Bibliothek mehr als jedes Modell, das bei dünner Datenlage besonders gern Plausibles ergänzt.
  • Für die Bewertung von Qualität. Ob eine Zeitschrift seriös begutachtet, ob eine Methode zum Gegenstand passt, ob eine Stichprobe trägt, sind Urteile, die du selbst fällen musst.
  • Für den roten Faden deiner Arbeit. Eine Zusammenfassung von zwanzig Abstracts ergibt keinen Forschungsstand. Der entsteht erst, wenn du Widersprüche benennst, Lücken zeigst und die Auswahl begründest.
  • Zum Umformulieren fremder Texte. Ein Werkzeug wie QuillBot schreibt Sätze um, aus einer fremden Aussage wird dadurch keine eigene. Ein umformulierter Absatz ohne Beleg bleibt ein Plagiat.
  • Für alles, was vertraulich ist. Unveröffentlichte Manuskripte, fremde Daten und personenbezogene Angaben gehören nicht in ein Eingabefeld, dessen Anbieter die Inhalte für das Training verwenden darf. Wo der Serverstandort eine Rolle spielt, lohnt der Blick auf europäische Anbieter wie Mistral oder auf ein Modell, das lokal auf dem eigenen Rechner läuft.
  • Als Ersatz für das Lesen. Was du zitierst, hast du gelesen. Das ist die älteste Regel im Fach, und keine Zusammenfassung hebt sie auf.

Wie sieht ein Ablauf aus, der beide Seiten nutzt?

Zum Schluss die Reihenfolge, die sich in der Praxis bewährt hat, mit dem jeweils passenden Werkzeug.

  • Fragestellung schärfen. Chatmodell als Gegenüber, das nachfragt und die Frage zerlegt.
  • Begriffe und Suchstring bauen. Chatmodell, danach ein eigener Blick auf die Schlagwortlisten der Fachdatenbank.
  • Kriterien festlegen und aufschreiben. Ohne Werkzeug, dafür schriftlich.
  • Breit suchen. Fachdatenbank deiner Disziplin, dazu ein Assistent mit Datenbankanbindung für die Frage in natürlicher Sprache.
  • Schneeball in beide Richtungen. Zitationswerkzeug, ausgehend von drei bis fünf Kernarbeiten.
  • Screening. Erst Titel und Abstract, bei großen Mengen mit einem Screening-Programm, dann die Volltexte.
  • Prüfen. Jede Angabe über DOI oder Datenbank, jede Kernaussage am Original.
  • Verwalten. Alles sofort ins Literaturverwaltungsprogramm, mit PDF und Notiz.
  • Schreiben. Eigene Arbeit, mit der KI höchstens als Prüfinstanz für Deckung und Sprache.
  • Kennzeichnen. Nach den Vorgaben deiner Hochschule, im Zweifel eine Zeile zu viel.

Der Zeitgewinn liegt in den Schritten zwei, fünf und sechs, also beim Formulieren der Suche, beim Verfolgen der Zitationen und beim Sortieren großer Trefferlisten. Der Zeitverlust droht überall dort, wo du eine erfundene Angabe erst in der Endkorrektur bemerkst. Wer die Prüfung von Anfang an mitlaufen lässt, behält den Gewinn und spart sich den Verlust.

Welche Werkzeuge sich für die übrigen Aufgaben rund um KI-Tools im Studium eignen, von der Mitschrift bis zur Prüfungsvorbereitung, steht in einem eigenen Ratgeber. Für die Recherche bleibt der eine Satz, der über die Note entscheidet. Was du zitierst, muss existieren, und das prüfst du selbst.

Häufige Fragen

Kann ChatGPT Quellen für meine Hausarbeit finden?
Ein Chatmodell ohne angebundene Fachdatenbank sucht nicht, es erzeugt eine wahrscheinliche Literaturangabe. Eine Untersuchung in Scientific Reports fand 2023 bei GPT-3.5 55 Prozent erfundene Quellen, bei GPT-4 noch 18 Prozent. Für die Suche selbst nimmst du deshalb einen Assistenten mit Datenbankanbindung wie Elicit oder Consensus oder die Fachdatenbank deiner Bibliothek. Das Chatmodell bleibt zuständig für Suchbegriffe, Synonyme und die Zuspitzung der Fragestellung.
Woran erkenne ich eine erfundene Quelle?
Setz den DOI hinter doi.org und ruf die Adresse auf. Bei einer erfundenen Nummer meldet der Dienst, dass er sie nicht auflösen kann. Wichtig ist der zweite Schritt, denn ein gültiger DOI kann zu einem ganz anderen Aufsatz führen. Eine Studie in JMIR Mental Health fand 2025, dass zwei Drittel der DOIs bei erfundenen Quellen auflösbar waren und auf thematisch fremde Arbeiten zeigten. Vergleiche deshalb Titel, Autoren und Jahr mit dem, was tatsächlich hinter dem Link steht. Ohne DOI suchst du den exakten Titel in Anführungszeichen in OpenAlex, PubMed oder Google Scholar.
Welches KI-Werkzeug eignet sich am besten für die Literaturrecherche?
Das hängt von der Aufgabe ab. Für eine Frage, die du in ganzen Sätzen stellst, und für Tabellen mit Angaben aus vielen Arbeiten eignen sich Elicit und Consensus. Für die Frage, ob eine Studie später bestätigt oder widerlegt wurde, ist Scite gebaut. Für das Verfolgen von Zitationen in beide Richtungen nimmst du Research Rabbit, Connected Papers oder Litmaps. Hat deine Hochschule Scopus oder Web of Science lizenziert, bekommst du dort die KI-Erweiterungen ohne eigene Kosten.
Ist die Literaturrecherche mit KI kostenlos möglich?
Ja, für die meisten Arbeiten reicht die Gratisebene. Consensus, Elicit, Litmaps und Connected Papers haben kostenlose Stufen mit Mengenbegrenzung, OpenAlex und Semantic Scholar sind vollständig frei, und die Fachdatenbanken deiner Hochschule kosten dich über die Anmeldung deiner Einrichtung nichts. Die Bezahlstufen für Einzelpersonen liegen zwischen 3 und 50 US-Dollar im Monat, Stand 31. August 2026. Mehrere Anbieter geben Rabatte für Hochschul-Mailadressen, bei Consensus bis zu 40 Prozent.
Muss ich angeben, dass ich KI für die Literaturrecherche genutzt habe?
In aller Regel ja, das Wie hängt von deiner Hochschule ab. Eine bundesweit einheitliche Regel gibt es nicht, maßgeblich sind die Prüfungsordnung deines Studiengangs und die Vorgaben deiner Fakultät. Verbreitet sind drei Wege, nämlich eine erweiterte Eigenständigkeitserklärung, ein Verzeichnis der eingesetzten Werkzeuge samt Eingaben im Anhang und ein Abschnitt im Methodenteil. Das Verwaltungsgericht Kassel bestätigte im Februar 2026 in zwei Fällen den Ausschluss von der Wiederholungsprüfung, weil KI-Nutzung in Abschlussarbeiten nicht gekennzeichnet war. Frag im Zweifel deine Betreuung und dokumentiere deine Nutzung von Anfang an.
Darf ich KI für eine systematische Übersichtsarbeit einsetzen?
Ja, unter Auflagen. Cochrane, die Campbell Collaboration, das JBI und die Collaboration for Environmental Evidence halten in ihrem gemeinsamen Positionspapier von 2025 fest, dass die Verantwortung bei den Autorinnen und Autoren bleibt, dass jeder Einsatz menschliche Aufsicht braucht und dass jede Stelle, an der ein Werkzeug ein Urteil fällt oder vorschlägt, im Bericht offengelegt wird. Praktisch heißt das, du hältst Suchanfrage, Datum, Datenbank, Trefferzahl und Werkzeugversion fest. Ein Chatmodell als Suchwerkzeug scheidet damit aus, weil dieselbe Frage morgen eine andere Trefferliste liefert.