Deduplizierung und Reproduzierbarkeit in der Literaturrecherche
Wer mehrere Datenbanken durchsucht, erhält häufig identische oder nahezu identische Datensätze. Eine protokollierte Deduplizierung bereinigt diese Treffer, ohne den ursprünglichen Suchprozess zu verschleiern.
Gemeinsam mit einem vollständigen Suchprotokoll schafft sie die Voraussetzung für Reproduzierbarkeit. Du erfährst, welche Angaben dokumentiert werden müssen, wie Duplikate erkannt werden und wie sich Trefferzahlen transparent berichten lassen.
Brauchst du eine fachliche Einschätzung?
Finde die passende Antwort in der 1a-Studi Akademie oder lass deine konkrete Frage kostenlos von einem Experten einschätzen.
Frage kostenlos prüfen lassen
Grundlagen
Deduplizierung und reproduzierbare Recherche einordnen
Bei einer Suche in mehreren Datenbanken erscheint dieselbe Publikation häufig mehrfach. Ursachen sind überlappende Datenbestände, unterschiedliche Metadaten, Online- und Druckversionen, Preprints, Konferenzfassungen oder fehlerhafte Importe. Die Deduplizierung führt solche Datensätze nach transparenten Regeln zusammen.
Reproduzierbarkeit bedeutet in diesem Kontext, dass andere Personen den Such- und Auswahlprozess anhand der Dokumentation nachvollziehen und unter vergleichbaren Bedingungen wiederholen können. Exakt identische Trefferzahlen sind nicht dauerhaft garantiert, weil Datenbanken neue Datensätze aufnehmen, Metadaten korrigieren und ihre Abdeckung verändern.
Deduplizierung bereinigt den Trefferbestand. Ein Suchprotokoll dokumentiert, wie dieser Bestand entstanden ist. Erst die Verbindung beider Schritte schafft eine belastbare Grundlage für Screening und Berichterstattung.
Dublettenbereinigung
Treffer kontrolliert deduplizieren
- Rohexporte sichern: Bewahre jede unveränderte Exportdatei mit Datenbank, Datum und Trefferzahl auf.
- Datensätze importieren: Führe die Exporte in einer Literaturverwaltung, Review-Software oder einer kontrollierten Tabelle zusammen.
- Exakte Übereinstimmungen prüfen: Vergleiche DOI, PMID oder andere stabile Identifikatoren.
- Nahe Übereinstimmungen erkennen: Prüfe normalisierte Titel, Autorenschaft, Jahr, Zeitschrift, Band und Seiten.
- Versionsbeziehungen unterscheiden: Preprint, akzeptiertes Manuskript, Konferenzbeitrag und Verlagsfassung können zusammengehören, aber unterschiedliche Funktionen besitzen.
- Grenzfälle manuell entscheiden: Öffne Datensätze oder Volltexte, bevor ein Treffer gelöscht oder zusammengeführt wird.
- Masterdatensatz festlegen: Behalte den vollständigsten Datensatz und ergänze fehlende Metadaten kontrolliert.
- Herkunft erhalten: Dokumentiere alle Datenbanken und Register, aus denen die Publikation gefunden wurde.
- Bereinigung protokollieren: Halte automatische Regeln, manuelle Entscheidungen und die Zahl entfernter Dubletten fest.
Studienprotokoll, Ergebnisartikel, Teilanalyse und Folgepublikation können ähnliche Titel und Autorenschaften besitzen. Lösche solche Datensätze erst nach einer inhaltlichen Prüfung.
Suchprotokoll
Die Suchstrategie vollständig dokumentieren
| Protokollfeld | Erforderliche Angabe |
|---|---|
| Informationsquelle | Datenbank, Register, Katalog oder Website einschließlich verwendeter Plattform |
| Suchdatum | Tag der Ausführung und gegebenenfalls Zeitraum der Aktualisierung |
| Suchstrategie | exakt ausgeführter Suchstring mit Feldcodes, Deskriptoren, Operatoren und Klammern |
| Begrenzungen | Filter für Zeitraum, Sprache, Dokumenttyp oder Population mit Begründung |
| Treffermenge | Zahl vor Export, Zahl erfolgreich exportierter Datensätze und Abweichungen |
| Export | Dateiformat, Dateiname und relevante Exportoptionen |
| Software | Programm, Version und verwendete Deduplizierungsregeln |
| Auswahlprozess | Ein- und Ausschlusskriterien, Screening-Stufen und Entscheidungsverfahren |
Speichere zusätzlich Versionen der Suchstrings und begründe wesentliche Änderungen. Bei einer iterativen Recherche muss erkennbar bleiben, welche Abfrage zu welchem Trefferbestand geführt hat.
Berichterstattung
Deduplizierung im Auswahlprozess transparent ausweisen
Bei systematischen Reviews kann ein PRISMA-Flow-Diagramm zeigen, wie viele Datensätze identifiziert, vor dem Screening entfernt, geprüft, ausgeschlossen und schließlich eingeschlossen wurden. Das Diagramm ist ein Instrument der Berichterstattung und ersetzt weder die Deduplizierung noch das Suchprotokoll.
| Zahl | Kontrollfrage |
|---|---|
| identifizierte Datensätze | Stimmt die Summe mit den protokollierten Datenbank- und Registertreffern überein? |
| entfernte Dubletten | Ist nachvollziehbar, nach welchen Regeln und in welcher Software bereinigt wurde? |
| gescreente Datensätze | Entspricht die Zahl dem bereinigten Bestand vor Titel- und Abstractscreening? |
| Volltexte | Sind nicht beschaffte Berichte und fachliche Ausschlussgründe getrennt dokumentiert? |
| eingeschlossene Studien | Wurden mehrere Berichte derselben Studie korrekt zugeordnet? |
Für eine Bachelor- oder Masterarbeit ohne systematisches Review genügt häufig eine kompaktere Tabelle. Sie sollte trotzdem Datenbanken, Suchstrings, Suchdaten, Trefferzahlen, Deduplizierung und Auswahlregeln enthalten.
Fehlerkontrolle
Häufige Fehler bei Deduplizierung und Reproduzierbarkeit vermeiden
- Rohexporte nach dem Import überschreiben oder löschen.
- Dubletten ausschließlich anhand des Titels automatisch entfernen.
- Preprint und veröffentlichte Fassung ungeprüft doppelt auswerten.
- Herkunftsinformationen beim Zusammenführen verlieren.
- nur allgemeine Suchbegriffe statt des exakten datenbankspezifischen Suchstrings berichten.
- Suchdatum, Plattform, Filter oder Exportoptionen nicht dokumentieren.
- eine spätere Trefferänderung als Beweis für einen Fehler im ursprünglichen Protokoll deuten.
- PRISMA als Such- oder Deduplizierungsmethode bezeichnen.
Ziehe eine kleine Stichprobe aus automatisch entfernten und verbleibenden Datensätzen. Die manuelle Kontrolle zeigt, ob die gewählten Regeln zu aggressiv oder zu schwach eingestellt waren.
Deduplizierung und Reproduzierbarkeit verbinden technische Datenbereinigung mit methodischer Transparenz. Bewahre Rohexporte, dokumentiere Regeln und Werkzeuge und führe Trefferzahlen so, dass jede Stufe des Auswahlprozesses nachvollziehbar bleibt.
Häufige Fragen und Antworten
Die folgenden Antworten fassen die wichtigsten Anwendungsfragen zu dieser Recherchetechnik zusammen.
Was bedeutet Deduplizierung?
Deduplizierung erkennt mehrfach importierte Datensätze und führt oder entfernt sie nach festgelegten Regeln, sodass jede Publikation im Arbeitskorpus nur einmal gezählt wird.
Welche Felder eignen sich zur Duplikaterkennung?
Besonders hilfreich sind DOI, PMID oder andere eindeutige Identifikatoren. Ergänzend werden Titel, Autorenschaft, Jahr, Zeitschrift, Band und Seiten verglichen.
Was macht eine Literaturrecherche reproduzierbar?
Reproduzierbarkeit erfordert dokumentierte Datenbanken, Suchdaten, vollständige Suchstrings, Filter, Exportformate, Deduplizierungsregeln und Auswahlkriterien.
Müssen Rohexporte aufbewahrt werden?
Ja. Rohexporte sichern den ursprünglichen Suchstand und ermöglichen spätere Kontrollen, erneute Bereinigungen und einen nachvollziehbaren Abgleich der Trefferzahlen.
Hat dir dieser Artikel geholfen?
Dein Feedback hilft dabei, die 1a-Studi Akademie gezielter auszubauen und passende Inhalte schneller auffindbar zu machen.
Quellenangaben, Zitationen und Literaturverzeichnis auf Vollständigkeit und korrekte Umsetzung nach APA, Harvard, Chicago oder weiteren Zitierstilen prüfen lassen.
Quellen & Zitation prüfenPrüfe, ob durch KI verwendete Quellen tatsächlich existieren und ob Aussagen, Zitate und Belege inhaltlich mit den Originalquellen übereinstimmen.
KI-Quellenanalyse anseheLass deinen wissenschaftlichen Text sprachlich korrigieren und zusätzlich auf Plagiate, KI-Auffälligkeiten und problematische Textstellen überprüfen.
Plagiat & KI-Check ansehen