Wer kennt es nicht: Ein wichtiges Dokument liegt irgendwo in einem Ordner, der Vertrag von 2019 ist unauffindbar, und die Steuererklärung erfordert stundenlange Suche im Papierberg. Paperless-ngx schafft Abhilfe: Die Open-Source-Software digitalisiert, indexiert und durchsucht alle Dokumente vollautomatisch – und lässt sich dank Docker auf jedem Heimserver betreiben. Das Ergebnis ist ein papierloses Büro, das auch DSGVO-konform betrieben werden kann.
Was ist Paperless-ngx?
Paperless-ngx ist ein Community-Fork des ursprünglichen Paperless-Projekts und wurde 2021 gegründet, nachdem das Original nicht mehr aktiv gepflegt wurde. Das Projekt steht unter der GPL-Lizenz und wird heute von einem aktiven Entwicklerteam betrieben. Die Software nimmt eingescannte Dokumente entgegen, extrahiert mit OCR den enthaltenen Text, klassifiziert die Dokumente automatisch und macht sie per Volltextsuche auffindbar.
Technisch basiert Paperless-ngx auf Django (Python), PostgreSQL oder SQLite als Datenbank, Redis als Message-Broker und Tesseract als OCR-Engine. Alle Komponenten laufen in Docker-Containern. Die Web-Oberfläche ist modern und responsiv, sodass der Zugriff auch vom Smartphone funktioniert.
OCR mit Tesseract: Texterkennung für alle Dokumente
Das Herzstück von Paperless-ngx ist die OCR-Verarbeitung. Sobald ein neues Dokument importiert wird – egal ob als gescanntes PDF, JPEG oder PNG – übergibt die Software es an Tesseract. Die OCR-Engine erkennt den enthaltenen Text und macht ihn durchsuchbar. Paperless-ngx nutzt dabei ocrmypdf als Wrapper, der Dokumente auch in mehrseitige, durchsuchbare PDFs konvertiert.
Tesseract unterstützt über 100 Sprachen. Für deutsche Dokumente empfiehlt sich die Installation des Sprachpakets deu. In der Docker-Konfiguration kann die Sprache über die Umgebungsvariable PAPERLESS_OCR_LANGUAGE=deu+eng festgelegt werden – damit werden sowohl deutsche als auch englische Dokumente korrekt erkannt.
Automatisches Tagging und KI-Klassifizierung
Was Paperless-ngx besonders macht, ist die automatische Dokumentenklassifizierung. Über den integrierten Machine-Learning-Classifier lernt die Software anhand bereits klassifizierter Dokumente, neue Dokumente automatisch zu kategorisieren. Folgende Metadaten werden dabei automatisch zugewiesen:
- Tags: Schlagwörter wie „Rechnung", „Versicherung" oder „Behörde" werden automatisch erkannt und angehängt.
- Korrespondenten: Absender wie „Finanzamt", „Stromversorger" oder „Vermieter" werden als Kontakte gespeichert und zugewiesen.
- Dokumententypen: Kategorien wie „Brief", „Vertrag" oder „Quittung" helfen bei der Strukturierung.
- Erstellungsdatum: Paperless-ngx erkennt Datumsangaben im Dokumenttext und setzt das Erstellungsdatum automatisch.
Je mehr Dokumente manuell klassifiziert wurden, desto besser werden die automatischen Vorschläge. Nach einigen hundert Dokumenten arbeitet die Klassifizierung erstaunlich zuverlässig.
Consumption Folder: Automatischer Import
Der Consumption Folder ist ein überwachter Ordner auf dem Server. Jede Datei, die in diesen Ordner gelegt wird – manuell, per Netzlaufwerk oder per Scanner-Direktupload – wird von Paperless-ngx automatisch verarbeitet. Das bedeutet:
- Dokument landet im Consumption Folder (z. B. über SFTP oder Netzwerkfreigabe).
- Paperless-ngx erkennt die neue Datei, startet die OCR-Verarbeitung.
- Das Dokument wird klassifiziert, getaggt und in die Datenbank aufgenommen.
- Die Originaldatei wird verschoben oder gelöscht – je nach Konfiguration.
Viele moderne Scanner unterstützen das direkte Scannen in einen SMB- oder FTP-Ordner. Damit wird der Workflow vollständig automatisiert: Dokument einlegen, Scan-Knopf drücken, fertig – wenige Sekunden später ist das Dokument in Paperless-ngx auffindbar.
Docker-Setup
Das offizielle Docker-Compose-Setup von Paperless-ngx ist schnell eingerichtet. Die Projekt-Website stellt einen Konfigurations-Assistenten bereit, der eine fertige docker-compose.yml generiert. Ein minimales Setup mit PostgreSQL und Redis sieht so aus:
version: "3.4"
services:
broker:
image: docker.io/library/redis:7
db:
image: docker.io/library/postgres:15
environment:
POSTGRES_DB: paperless
POSTGRES_USER: paperless
POSTGRES_PASSWORD: paperless
webserver:
image: ghcr.io/paperless-ngx/paperless-ngx:latest
depends_on: [db, broker]
ports: ["8000:8000"]
volumes:
- ./data:/usr/src/paperless/data
- ./media:/usr/src/paperless/media
- ./consume:/usr/src/paperless/consume
media-Ordner. Dieser Ordner sollte regelmäßig gesichert werden – er enthält alle verarbeiteten Dokumente. Die Datenbank allein reicht für ein vollständiges Backup nicht aus.
Volltextsuche und Nutzung im Alltag
Die Volltextsuche von Paperless-ngx durchsucht alle OCR-extrahierten Texte in Echtzeit. Eine Suche nach „Nebenkostenabrechnung 2024" findet alle passenden Dokumente sofort, unabhängig davon, in welchem Ordner sie abgelegt sind. Zusätzlich lassen sich Suchen kombinieren: Korrespondent = „Stadtwerke" UND Tag = „Rechnung" liefert nur Rechnungen des Stadtwerkeanbieters.
Die Benutzeroberfläche bietet außerdem eine Dashboard-Ansicht mit kürzlich hinzugefügten Dokumenten, gespeicherte Suchanfragen und eine Statistik-Übersicht. Dokumente können direkt im Browser als PDF angezeigt und heruntergeladen werden.
Vergleich: Paperless-ngx vs. Alternativen
| Eigenschaft | Paperless-ngx | Docspell | Mayan EDMS | M-Files |
|---|---|---|---|---|
| OCR-Engine | Tesseract | Tesseract | Tesseract | Proprietär |
| Auto-Tagging (KI) | Ja, trainierbar | Regelbasiert | Ja, Workflows | Ja (Enterprise) |
| Self-Hosting | Ja (Docker) | Ja (Docker) | Ja (Docker) | On-Premise möglich |
| Preis | Kostenlos | Kostenlos | Kostenlos | Kostenpflichtig |
| Benutzeroberfläche | Modern, responsiv | Funktional | Komplex | Professionell |
| DSGVO-konform (Self-Host) | Ja | Ja | Ja | Je nach Konfiguration |
| Einstiegshürde | Niedrig | Mittel | Hoch | Hoch |
Docspell ist eine weitere gute Open-Source-Option mit stärkerem Fokus auf regelbasierte Automatisierung. Mayan EDMS ist ein vollständiges Enterprise-DMS mit Workflows und Versionshistorie, aber deutlich komplexer zu betreiben. M-Files ist eine professionelle Lösung für Unternehmen mit entsprechendem Preisschild. Für Heimanwender und kleine Unternehmen ist Paperless-ngx die beste Balance aus Funktionalität und Einfachheit.
Das Projekt ist auf GitHub aktiv und hat eine lebhafte Community im offiziellen Forum und Discord-Server.
Häufige Fragen zu Paperless-ngx
- Kann ich bestehende Dokumente nachträglich importieren?
- Ja. Über die Kommandozeile lassen sich ganze Ordnerstrukturen mit dem
document_importer-Befehl in Paperless-ngx importieren. PDFs werden dabei ebenfalls per OCR verarbeitet, sofern sie noch keinen durchsuchbaren Text enthalten. - Wie sicher sind meine Dokumente in Paperless-ngx?
- Da die Software lokal läuft, hängt die Sicherheit von der eigenen Infrastruktur ab. HTTPS per Reverse-Proxy und regelmäßige Backups sind essenziell. Paperless-ngx selbst unterstützt keine Ende-zu-Ende-Verschlüsselung der gespeicherten Dokumente.
- Funktioniert Paperless-ngx auch ohne Scanner?
- Ja. Digitale PDFs, E-Mail-Anhänge und andere Dateien können ebenfalls importiert werden. Viele Nutzer integrieren Paperless-ngx mit E-Mail-Posteingängen, um Rechnungen automatisch abzulegen.
- Wie viel Speicherplatz benötigt Paperless-ngx?
- Das hängt von der Dokumentenmenge ab. Ein gescanntes Dokument mit OCR-Layer belegt typischerweise 200–500 KB. Für 10.000 Dokumente sind also etwa 2–5 GB einzuplanen, ohne Originaldateien in höherer Qualität.