Speicherplatz sparen und Duplikate finden – Dein Tutorial

Du möchtest Duplikate auf Deiner Festplatte finden?

Hier ist Dein Guide für eine effiziente Suche!

Starten wir!

Warum Duplikate finden? – Wieso lohnt sich die Mühe?

Speicherplatz sparen

Der Hauptgrund, um die Duplikate zu entfernen, ist es Speicherplatz zu sparen. Oft haben wir Bilder und (Multimedia-)Dateien nicht doppelt, sondern dreifach oder häufiger auf der gleichen Festplatte liegen. Da eine digitale Ordnerstruktur große Datenmengen versteckt, ohne eine Ordnung zu schaffen, sind wir verleitet Dateien mehrfach zu kopieren und alles in den „Archiv“ Ordner zu schieben. Wer nicht aktiv nach Duplikaten sucht, wird über die Jahre immer größere redundante Datenmenge anhäufen, die man von Altgerät zum Neugerät jedes Mal mitnimmt.

Zu viele Daten und zu viel doppelt?
Zu viele Daten und zu viel doppelt?

Weniger Backup-Masse

Backups gehen schneller, wenn die Ursprungsordner weniger gefüllt sind. Es passiert schnell, dass man einen Ordner mit 1000+ Dateien / 20+ GB irgendwo hinzieht und somit ein Duplikat erstellt. Bei den schnellen Solid State Disks erscheint bei diesen Datenmengen kein Wartefenster mehr, aber man schafft durch das Falsch-Geklicke immer wieder Duplikate.

Änderungen nur in einer Datei

Das größte Risiko bei Duplikaten ist es, dass Du eine Änderung nur in Datei 1 durchführst, bei nächstem Mal weitere Änderungen in Duplikat 2 durchführst und am 3. Tag keine Ahnung mehr hast, wo die Änderungen in Duplikat 3 hin sind. Ein Duplikat-freier Speicher ist Gold wert.

Schnell sind 566 Datein doppelt
Schnell sind 566 Datein doppelt

Orderstruktur klar: Wir legen, uns eine Ordernstruktur an, um Dateien zu sortieren. Einige Dateien legen wir an einem Tag in Ordnern 1 ab und in der Woche darauf in Ordner 2, weil viele Dokumente nicht eindeutig zuordenbar sind. Unser Betriebssystem gibt uns nicht die Warnung, dass wir die gleiche Datei woanders gespeichert ist.

Effizienter Suchen! Wie funktioniert diese Software?

Duplikat Finder Software indexiert zuerst die Ordner oder Festplatten, die Du auf Duplikate prüfen willst.

Es lohnt sich einen zentralen Ordner wie das Home-Verzeichnis zu nutzen, um alle Duplikate verteilt zu finden. Ausschlüsse wie z. B. AppData helfen dabei Programm-Daten und ausführbare Dateien zu überspringen. Das reduziert die Suchzeit und verkürzt die Liste mit Dateien, die ihr nicht löschen solltet.

Hashes sind nice

Um Duplikate zu finden nutzt, die Software Hashes und Perceptual Hashing.

Der digitale Fingerabdruck für Dateien – Hash basierend

Ein Hash ist ein Bit-String von definierter Länge. z. B. 512 Bits aus 0 und 1en.

Ein Hash-Algorithmus komprimiert eine egal wie große Datei auf die 512 Bits und dabei gehen Daten verloren. Der Bit-String ist wie eine Fingerabdruck „nahezu“ einmalig für diese Datei. Wenn Du eine 0 an die Datei anhängen würdest, ändert sich der Ausgabe-Hash zum großen Teil.

Die kurzen Hashes erlauben das Vergleichen mit allen anderen Hashes. Statt die ganze Datei mit 1 GB zu vergleichen, findet der Vergleich mit kurzen Hashes statt.

Kryptografische Hashes sind bei dieser Anwendung nicht immer die erste Wahl. Ein performanterer Hash (aber unsicherer) wie CRC oder MD5 eigenen sich für diese Aufgabe besser. Die Software kann nach einer Übereinstimmung des CRCs zusätzlich dem SHA-3-512 berechnen, um noch genauer die Übereinstimmung zu prüfen.

Mit CRC geht es schneller

Immer etwas Abstand halten! – Wahrnehmende Hashes

Bilder, die Du nur kopiert hast, haben den gleichen Hash.

Wenn das Bild 2 um nur 1 Grad beim Knipsen zu Bild 1 verschoben ist, haben wir einen anderen Hash. Für Fotografen ist es interessant, nahezu gleiche Bilder zu eliminieren, um Speicherplatz zu sparen. Gute Fotografen nehmen immer mehrere Bilder für ein Motiv und Ansicht auf, weil immer etwas verruckelt sein kann oder jemand auf dem Gruppenfoto die Augen schließt.

Normale Hashes sind ungeeignet, da kleine Änderungen große Auswirkungen haben. Wahrnehmende Hashes nutzen andere Techniken:

  • Ein Farbhistogramm: Zwei ähnliche Bilder sind nicht Pixel genau, aber im Histogramm ähnlich. Das bedeutet, dass ähnlich viele helle und dunkele Farbtönen im Bild vorkommen. Diese Methode erlaubt ein schnelles Vergleichen zwischen den Bildern. Außerdem kann der Computer davon ausgehen, dass das Bild PIC_004 12:12:25 und das Bild PIC_005 12:12:26 direkt danach geschossen wurde. Wenn PIC_004 und PIC_005 an zwei Orten aufgenommen wurde, unterscheiden sich die Histogramme massiv.
Histogramme sind Metadaten
  • GQview Matrix: Statt sich ein Bild genau anzuschauen, kann der Computer auch herauszoomen. Der Computer unterteilt das Bild in 32×32 Kacheln, und gibt jeder Kachel die Durchschnittsfarbe. Jetzt prüft ein Algorithmus, wie weit die Kachel 1 des Bilds A von Kachel 1 des Bilds B abweicht. Ist ein kleiner Farbraumunterschied feststellbar, sind die Bilder ähnlich.
  • Andere Algorithmen wie PHashs: Ich überspringe mal andere komplexere mathematische Methoden, die im Grunde genommen Informationen reduzieren und diese mit einem Abstandswert vergleichen.

Quelle: https://gist.github.com/augmt/efa871bbf2668dd4aa711ce2013f5046

Tutorial – 5 Schritte – Wie Duplikate finden?

Ein intuitives Tool für das Finden von Duplikaten ist Krokeit oder Czkawka. Entgegen dem gruseligen Namen ist das Tool super einfach zu bedienen:


Schnelle Dupliatsuche
Schnelle Dupliatsuche
  1. Füge oben rechts Ordner hinzu, die Du durchsuchen willst (Dokumente). Fasse den Rahmen groß!
  2. Schließe Ordner aus (Exclude Directories), die Du nicht aktiv nutzt z. B. AppData oder andere Programm-Config-Ordner, die Du nicht selbst pflegst und mit Daten aktiv befüllst. Das reduziert massiv die Wartezeit.
  3. Klicke auf Suche. Die Suche kann Minuten bis Stunden dauern und kann im Hintergrund stattfinden. Vermeide das Öffnen oder Ändern von Dateien, damit die Software alles erfassen kann.
  4. Aus den gefundenen Duplikaten musst Du Dir jetzt die Dateien heraussuchen, welche Du in den Papierkorb verschieben willst. Du hast die Option der schnellen Auswahl (z. B. immer die neusten Dateien) oder Du machst es manuell.
  5. Der manuelle Ansatz lohnt sich, damit Du nicht Deine Ordnerstruktur Logik zerstörst. Z. B. Hast Du eine Computer-Rechnung in dem Ordner „Finanzamt 2019“ und „Rechnungen 2019“. Ein Duplikat davon kannst Du löschen. Dieser Schritt kann mehrere Stunden dauern, je nachdem wie viele Duplikate gefunden wurden. Du kannst später die Löschung fortsetzen, wenn Du eine Pause machen willst.

Wie kann ich Duplikate vermeiden

Nicht immer sind Duplikate schlecht. Trotzdem solltest Du diese reduzieren:

  • Versionsstände: Du möchtest absichtlich verschiedene Bearbeitungsstände einer Datei anfertigen. → Nutzt stattdessen ein Versionierungssystem wie in M365 oder Git, um Arbeitsstände zu sichern.
  • Ordner-Logik-Dopplungen: Deine private Ordnung im Gehirn sagt, dass die Datei in „Finanzamt 2019“ und in „Rechnungen 2019“ Ordner sein muss, um diese wiederzufinden. → Hier sind Links zu der eigentlichen Datei, die bessere Wahl.
  • Erreichbarkeit: Aus Bequemlichkeit willst Du ein Duplikat haben. → Hier sind Links zu der eigentlichen Datei, die bessere Wahl.

Dieser Beitrag ist zitierfähig. Adaptiere das Beispiel nach dem Harvard Stil: Lippke, Steffen (2026): ‚Programmieren lernen – Tutorial für Einsteiger‘, Security and Coding Explosive Tutorials [online], 01. Januar 2026. Verfügbar unter: https://lippke.li/programmieren-lernen/, ISSN: 3054-3436

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert