Dokumenten-KI im Test: Dokumentli gegen fünf Frontier-Modelle.
3'365 echte Geschäftsdokumente, 5 Datensätze, 6 Modelle, eine Aufgabe: strukturierte Felder extrahieren, ohne Vorwissen über das Layout. Dokumentli erreicht 89,1 Prozent Extraktionsgenauigkeit, den Bestwert im Feld, und gewinnt alle fünf Benchmarks gegen das stärkste Referenzmodell.
Spezialisierung schlägt Modellgrösse.
Getestet wurden Claude Opus 5.5 von Anthropic, GPT-6 Astra von OpenAI, Gemini 3.8 Flash von Google, Qwen3.8-27B von Alibaba und das offene Modell Gemma 4 26B-A4B-IT. Alle fünf sind General-Purpose-Modelle mit ungleich grösserem Trainingsaufwand. Dokumentli ist ein kompaktes, auf europäische Geschäftsdokumente spezialisiertes Vision-Language-Model und liegt in der Genauigkeit vor allen fünf.
Ø Extraktionsgenauigkeit, Bestwert aller sechs Modelle
cANLS@0,8, 5 BenchmarksBenchmarks gewonnen gegen Claude Opus 5.5, das stärkste Referenzmodell
Vorsprung 0,8 bis 7,4 Prozentpunkteschneller als das genaueste Referenzmodell
1,14 gegen 0,60 Dokumente pro Sekundedes Kontextbudgets der grössten Referenzmodelle
8'192 gegen bis zu 64'000 TokensGenauigkeit je Benchmark und Modell.
| Benchmark | Dokumente | Dokumentli 5.3 | Claude Opus 5.5 | GPT-6 Astra | Gemini 3.8 | Qwen3.8-27B | Gemma 4 26B |
|---|---|---|---|---|---|---|---|
| RechnungsverarbeitungDiverse Kreditorenrechnungen | 413 | 89,1 % | 86,1 % | 86,0 % | 85,5 % | 83,7 % | 71,1 % |
| E-CommerceBestell- und Versandbelege | 1474 | 84,5 % | 77,1 % | 75,8 % | 76,4 % | 79,1 % | 63,1 % |
| LogistikFracht- und Kontraktdokumente | 927 | 82,2 % | 79,7 % | 79,8 % | 78,3 % | 75,4 % | 62,9 % |
| AutomotiveKfz-Werkstattrechnungen | 126 | 96,8 % | 96,0 % | 95,8 % | 94,6 % | 93,2 % | – |
| ImmobilienMiet- und Nebenkostenabrechnungen | 425 | 93,4 % | 87,5 % | 88,7 % | 85,8 % | 78,2 % | 70,3 % |
| Mittelwert | 3365 | 89,1 % | 85,3 % | 85,2 % | 84,1 % | 81,9 % | 66,9 % |
cANLS bei Schwellenwert 0,8, Makro-Mittelwert je Benchmark. Die Referenzwerte stammen aus menschlich geprüften Feldern echter Geschäftsdokumente. Der grösste Vorsprung liegt bei Bestell- und Versandbelegen mit 7,4 Prozentpunkten, der knappste bei Kfz-Werkstattrechnungen mit 0,8 Prozentpunkten.
Im Schnitt das schnellste Modell im Feld.
In produktiven Dokumentenprozessen entscheidet die Verarbeitungsgeschwindigkeit über Durchlaufzeit und Infrastrukturkosten. Claude Opus 5.5 ist das schnellste Referenzmodell, liegt aber klar zurück. GPT-6 Astra, Gemini 3.8 Flash und vor allem Qwen3.8-27B fallen deutlich weiter ab.
| Modell | Dokumente pro Sekunde |
|---|---|
| Dokumentli 5.3 | 1,14 |
| Claude Opus 5.5 | 0,60 |
| Gemma 4 26B | 0,34 |
| GPT-6 Astra | 0,21 |
| Gemini 3.8 Flash | 0,20 |
| Qwen3.8-27B | 0,08 |
Gemittelt über alle 5 Benchmarks, gemessen unter identischen Bedingungen. Referenzmodelle über OpenRouter, Dokumentli über den eigenen dedizierten Endpunkt.
Genauigkeit, Tempo und Betrieb hängen zusammen.
Betrieb auf einer einzelnen GPU
Dank des kleinen Kontextbudgets läuft Dokumentli über die Komponente Dokumentli Node auf handelsüblicher PC-Hardware mit einer einzigen GPU. Ohne dedizierte Serverinfrastruktur, ohne Cloud-Anbindung, ohne dass ein Dokument das Haus verlässt.
Kosten je Beleg
Höherer Durchsatz je Recheneinheit bei gleichzeitig führender Genauigkeit bedeutet niedrigere Kosten pro verarbeitetem Dokument. Sichtbar wird das bei Volumen, wie in den Benchmarks aus E-Commerce mit 1'474 und Logistik mit 927 Dokumenten.
Europäische Datenhoheit
Verarbeitung in den Zonen Zürich, Frankfurt und Amsterdam, auf Wunsch vollständig im eigenen Rechenzentrum. ISO 27001, SOC 2 Type 2, BSI C5. Das Modell ist europäisch entwickelt und betrieben, nicht nur europäisch gehostet.
Methodik, Grenzen und Preise.
Was misst cANLS bei einem Schwellenwert von 0,8?
cANLS steht für case-insensitive Average Normalized Levenshtein Similarity. Gemessen wird je Feld, wie stark der extrahierte Wert vom menschlich geprüften Referenzwert abweicht. Ab einer Ähnlichkeit von 0,8 gilt ein Feld als korrekt. Das ist eine gängige Variante des ANLS-Industriestandards für Dokumentenextraktion. Ergänzend wurden Precision und Recall auf Zellebene sowie 95-Prozent-Konfidenzintervalle berechnet.
Wurde Dokumentli auf diesen Testdaten trainiert?
Nein. Dokumentli ist auf Geschäftsdokumente aus denselben Branchen und Dokumenttypen spezialisiert, wurde aber nicht mit den Benchmark-Datensätzen selbst trainiert. Alle 3'365 Testdokumente waren dem Modell vorher unbekannt.
Ist das ein unabhängiger Test?
Nein, das ist ein interner Benchmark von Parashift. Deshalb liegen Datensätze, Messgrösse, Modellversionen, Kontextbudgets und alle Ausschlüsse offen. Die fünf Referenzmodelle wurden über Standard-APIs via OpenRouter mit Zero-Shot-Prompting angesprochen, Dokumentli über einen eigenen Endpunkt.
Warum fehlt beim Automotive-Benchmark der Wert für Gemma 4?
Gemma 4 26B-A4B-IT wurde nicht erneut gegen Dokumentli 5.3 getestet. Die gezeigten Werte stammen aus einer früheren Testreihe unter denselben Bedingungen. Für den Automotive-Benchmark liegt dort kein Messwert vor.
Wie viel Rechenleistung braucht Dokumentli?
Dokumentli arbeitet mit einem Budget von 8'192 Tokens je Anfrage. Die Referenzmodelle wurden mit bis zu 32'768 Tokens angefragt, also rund dem Achtfachen je Dokument, bei niedrigerer bis vergleichbarer Genauigkeit. Über die Komponente Dokumentli Node läuft das Modell auf handelsüblicher PC-Hardware mit einer einzelnen GPU, ohne Serverinfrastruktur und ohne Cloud-Anbindung.
Wo werden die Dokumente verarbeitet?
In den Zonen Zürich, Frankfurt und Amsterdam, nach Wahl des Kunden. Auf Wunsch vollständig im eigenen Rechenzentrum oder auf eigener Hardware. Parashift ist nach ISO 27001 und SOC 2 Type 2 zertifiziert und erfüllt BSI C5.
Wie hoch ist die Automationsrate in der Praxis?
In produktiven Parashift-Prozessen liegt die Automationsrate über 90 Prozent. Sie misst, welcher Anteil der Dokumente ohne menschlichen Eingriff durchläuft, und hängt an Konfidenzschwellen, Validierungsregeln und Stammdatenabgleich. Gemessen wird sie je Prozess und Dokumenttyp.
Was kostet Dokumentli?
Dokumentli startet bei 990 Euro im Monat. Die vollständige Parashift-Plattform mit Klassifizierung, Trennung, Validierung und Nachweiskette startet bei 1'590 Euro im Monat.
Der ehrlichste Test ist Ihr eigener Dokumentenstapel.
Schicken Sie uns einen anonymisierten Satz Ihrer Dokumente. Sie bekommen die Extraktion, die Konfidenzwerte und die Auswertung Feld für Feld auf Ihren eigenen Belegen zurück, nicht auf unseren.
Dokumentli ab 990 Euro im Monat, Plattform ab 1'590 Euro im Monat. Antwort innert einem Werktag.