Parashift/Dokumentli/Benchmark
Benchmark · Stand 25. September 2026

Dokumenten-KI im Test: Dokumentli gegen fünf Frontier-Modelle.

3'365 echte Geschäftsdokumente, 5 Datensätze, 6 Modelle, eine Aufgabe: strukturierte Felder extrahieren, ohne Vorwissen über das Layout. Dokumentli erreicht 89,1 Prozent Extraktionsgenauigkeit, den Bestwert im Feld, und gewinnt alle fünf Benchmarks gegen das stärkste Referenzmodell.

3'365 Dokumente, 6 ModelleMethodik und Ausschlüsse offenZonen Zürich, Frankfurt, Amsterdam
Benchmark 09/20266 Modelle
Ø Genauigkeit89,1 %
Gewonnene Benchmarks5 von 5
Ø Geschwindigkeit1,14 Dok/s
Kontextbudget8'192 Tokens
Referenzmodellebis 64'000
cANLS bei Schwellenwert 0,8, Makro-Mittel über 5 Benchmarks
Das Ergebnis

Spezialisierung schlägt Modellgrösse.

Getestet wurden Claude Opus 5.5 von Anthropic, GPT-6 Astra von OpenAI, Gemini 3.8 Flash von Google, Qwen3.8-27B von Alibaba und das offene Modell Gemma 4 26B-A4B-IT. Alle fünf sind General-Purpose-Modelle mit ungleich grösserem Trainingsaufwand. Dokumentli ist ein kompaktes, auf europäische Geschäftsdokumente spezialisiertes Vision-Language-Model und liegt in der Genauigkeit vor allen fünf.

89,1 %

Ø Extraktionsgenauigkeit, Bestwert aller sechs Modelle

cANLS@0,8, 5 Benchmarks
5 von 5

Benchmarks gewonnen gegen Claude Opus 5.5, das stärkste Referenzmodell

Vorsprung 0,8 bis 7,4 Prozentpunkte
1,9 ×

schneller als das genaueste Referenzmodell

1,14 gegen 0,60 Dokumente pro Sekunde
1/8

des Kontextbudgets der grössten Referenzmodelle

8'192 gegen bis zu 64'000 Tokens
Alle Zahlen

Genauigkeit je Benchmark und Modell.

BenchmarkDokumenteDokumentli 5.3Claude Opus 5.5GPT-6 AstraGemini 3.8Qwen3.8-27BGemma 4 26B
RechnungsverarbeitungDiverse Kreditorenrechnungen41389,1 %86,1 %86,0 %85,5 %83,7 %71,1 %
E-CommerceBestell- und Versandbelege147484,5 %77,1 %75,8 %76,4 %79,1 %63,1 %
LogistikFracht- und Kontraktdokumente92782,2 %79,7 %79,8 %78,3 %75,4 %62,9 %
AutomotiveKfz-Werkstattrechnungen12696,8 %96,0 %95,8 %94,6 %93,2 %–
ImmobilienMiet- und Nebenkostenabrechnungen42593,4 %87,5 %88,7 %85,8 %78,2 %70,3 %
Mittelwert336589,1 %85,3 %85,2 %84,1 %81,9 %66,9 %

cANLS bei Schwellenwert 0,8, Makro-Mittelwert je Benchmark. Die Referenzwerte stammen aus menschlich geprüften Feldern echter Geschäftsdokumente. Der grösste Vorsprung liegt bei Bestell- und Versandbelegen mit 7,4 Prozentpunkten, der knappste bei Kfz-Werkstattrechnungen mit 0,8 Prozentpunkten.

Geschwindigkeit

Im Schnitt das schnellste Modell im Feld.

In produktiven Dokumentenprozessen entscheidet die Verarbeitungsgeschwindigkeit über Durchlaufzeit und Infrastrukturkosten. Claude Opus 5.5 ist das schnellste Referenzmodell, liegt aber klar zurück. GPT-6 Astra, Gemini 3.8 Flash und vor allem Qwen3.8-27B fallen deutlich weiter ab.

ModellDokumente pro Sekunde
Dokumentli 5.31,14
Claude Opus 5.50,60
Gemma 4 26B0,34
GPT-6 Astra0,21
Gemini 3.8 Flash0,20
Qwen3.8-27B0,08

Gemittelt über alle 5 Benchmarks, gemessen unter identischen Bedingungen. Referenzmodelle über OpenRouter, Dokumentli über den eigenen dedizierten Endpunkt.

Was daraus folgt

Genauigkeit, Tempo und Betrieb hängen zusammen.

Betrieb auf einer einzelnen GPU

Dank des kleinen Kontextbudgets läuft Dokumentli über die Komponente Dokumentli Node auf handelsüblicher PC-Hardware mit einer einzigen GPU. Ohne dedizierte Serverinfrastruktur, ohne Cloud-Anbindung, ohne dass ein Dokument das Haus verlässt.

Kosten je Beleg

Höherer Durchsatz je Recheneinheit bei gleichzeitig führender Genauigkeit bedeutet niedrigere Kosten pro verarbeitetem Dokument. Sichtbar wird das bei Volumen, wie in den Benchmarks aus E-Commerce mit 1'474 und Logistik mit 927 Dokumenten.

Europäische Datenhoheit

Verarbeitung in den Zonen Zürich, Frankfurt und Amsterdam, auf Wunsch vollständig im eigenen Rechenzentrum. ISO 27001, SOC 2 Type 2, BSI C5. Das Modell ist europäisch entwickelt und betrieben, nicht nur europäisch gehostet.

Fragen zum Benchmark

Methodik, Grenzen und Preise.

Was misst cANLS bei einem Schwellenwert von 0,8?

cANLS steht für case-insensitive Average Normalized Levenshtein Similarity. Gemessen wird je Feld, wie stark der extrahierte Wert vom menschlich geprüften Referenzwert abweicht. Ab einer Ähnlichkeit von 0,8 gilt ein Feld als korrekt. Das ist eine gängige Variante des ANLS-Industriestandards für Dokumentenextraktion. Ergänzend wurden Precision und Recall auf Zellebene sowie 95-Prozent-Konfidenzintervalle berechnet.

Wurde Dokumentli auf diesen Testdaten trainiert?

Nein. Dokumentli ist auf Geschäftsdokumente aus denselben Branchen und Dokumenttypen spezialisiert, wurde aber nicht mit den Benchmark-Datensätzen selbst trainiert. Alle 3'365 Testdokumente waren dem Modell vorher unbekannt.

Ist das ein unabhängiger Test?

Nein, das ist ein interner Benchmark von Parashift. Deshalb liegen Datensätze, Messgrösse, Modellversionen, Kontextbudgets und alle Ausschlüsse offen. Die fünf Referenzmodelle wurden über Standard-APIs via OpenRouter mit Zero-Shot-Prompting angesprochen, Dokumentli über einen eigenen Endpunkt.

Warum fehlt beim Automotive-Benchmark der Wert für Gemma 4?

Gemma 4 26B-A4B-IT wurde nicht erneut gegen Dokumentli 5.3 getestet. Die gezeigten Werte stammen aus einer früheren Testreihe unter denselben Bedingungen. Für den Automotive-Benchmark liegt dort kein Messwert vor.

Wie viel Rechenleistung braucht Dokumentli?

Dokumentli arbeitet mit einem Budget von 8'192 Tokens je Anfrage. Die Referenzmodelle wurden mit bis zu 32'768 Tokens angefragt, also rund dem Achtfachen je Dokument, bei niedrigerer bis vergleichbarer Genauigkeit. Über die Komponente Dokumentli Node läuft das Modell auf handelsüblicher PC-Hardware mit einer einzelnen GPU, ohne Serverinfrastruktur und ohne Cloud-Anbindung.

Wo werden die Dokumente verarbeitet?

In den Zonen Zürich, Frankfurt und Amsterdam, nach Wahl des Kunden. Auf Wunsch vollständig im eigenen Rechenzentrum oder auf eigener Hardware. Parashift ist nach ISO 27001 und SOC 2 Type 2 zertifiziert und erfüllt BSI C5.

Wie hoch ist die Automationsrate in der Praxis?

In produktiven Parashift-Prozessen liegt die Automationsrate über 90 Prozent. Sie misst, welcher Anteil der Dokumente ohne menschlichen Eingriff durchläuft, und hängt an Konfidenzschwellen, Validierungsregeln und Stammdatenabgleich. Gemessen wird sie je Prozess und Dokumenttyp.

Was kostet Dokumentli?

Dokumentli startet bei 990 Euro im Monat. Die vollständige Parashift-Plattform mit Klassifizierung, Trennung, Validierung und Nachweiskette startet bei 1'590 Euro im Monat.

Der ehrlichste Test ist Ihr eigener Dokumentenstapel.

Schicken Sie uns einen anonymisierten Satz Ihrer Dokumente. Sie bekommen die Extraktion, die Konfidenzwerte und die Auswertung Feld für Feld auf Ihren eigenen Belegen zurück, nicht auf unseren.

Dokumentli ab 990 Euro im Monat, Plattform ab 1'590 Euro im Monat. Antwort innert einem Werktag.