ByteDance Dolphin
Kostenlos
ByteDance Dolphin ist das Open-Source-Dokument-Parsing-Modell von ByteDance. Es führt Strukturerkennung, Inhaltsextraktion und Markdown/JSON-Ausgabe rund um PDF, gescannte Dokumente und komplexe Layoutdokumente durch. Sein Hauptvorteil ist die Effizienz des zweistufigen Dokumentverständnisses und der parallelen Analyse.
ByteDanceDolphin
Kernparameter und Statistiken
[Ein kurzer Kommentar in einem Satz]: Es handelt sich nicht um ein „anderes OCR-Modell“, sondern um eine Dokumentstrukturierungs-Engine, die das Layoutverständnis, die Lesereihenfolge, das Zuschneiden von Elementen und das Parsen von Inhalten in zwei Ausführungsphasen aufteilt.
[Werbungsüberprüfung]: Das offizielle Lager beschreibt Dolphin-v2 als universelles Dokument-Parsing-Modell. Diese Aussage ist nicht übertrieben, da sie klar zwischen digital erstellten und fotografierten Dokumenten unterscheidet und unterschiedliche Parsing-Strategien für unterschiedliche Dokumentpfade anwendet. „Universal“ bedeutet jedoch nicht „hirnlos, allumfassend“. Komplexe gescannte Dokumente, seitenübergreifende Logik und extreme Tabellen erfordern noch eine zusätzliche Überprüfung.
| Projekte | Öffentliche Informationen |
|---|---|
| Aktuelle Hauptlinie | Dolphin-v2 |
| Parameterskala | v1/v1.5 ist 0,3B, v2 wird auf 3B aktualisiert |
| Papierstatus | ACL 2025-Annahme |
| Open-Source-Portal | GitHub, Hugging Face, arXiv |
| Support-Ausgabe | JSON, Markdown, Ergebnisse auf Elementebene |
| Schlüsselfunktionen | Layoutanalyse, Vorhersage der Lesereihenfolge, Tabellen-/Formel-/Codeanalyse, mehrseitiges PDF |
| Öffentlicher Auftritt | Die Dolphin-v2-Metriken auf OmniDocBench sind deutlich besser als v1.5 und v1 |
| Gemeinschaftsgröße | GitHub über 9.000 Sterne, 772 Forks |
Expertenmeinung: Was bei Dolphin sehenswert ist, ist nicht der „Wettbewerb mit anderen“, sondern die Tatsache, dass es „zuerst das Layout verstehen und dann den Inhalt analysieren“ zu einem technischen Weg gemacht hat. Dies führt direkt dazu, dass es einfacher ist, in komplexen Dokumentenszenarien strukturierte und nachgelagert nutzbare Ergebnisse zu erhalten, als Lösungen, die nur eine End-to-End-OCR durchführen.
Benutzer- und Markterkennung
Ungefähr 9.000 Sterne und 772 Forks auf GitHub weisen darauf hin, dass Dolphin große Aufmerksamkeit der Entwickler erhalten hat. Für ein Open-Source-Modell der Dokumentenanalyse reicht diese Größe aus, um zu zeigen, dass es sich nicht um ein temporäres Projekt im Labor handelt, sondern um eine Tool-Chain-Komponente, die von echten Teams ausprobiert und wieder integriert wird.
Benutzer- und Markterkennung: Der Beamte veröffentlichte außerdem gleichzeitig die Modellkarte und die Demo des ACL-Papiers Hugging Face, was bedeutet, dass es sich sowohl an Forscher als auch an Ingenieurteams richtet. Insbesondere für Teams, die sich mit der Digitalisierung von Dokumenten, der Bereinigung von Wissensdatenbanken und der Rechnungs-/Berichtsverarbeitung befassen, ist diese Art von Modell, das JSON/Markdown implementieren kann, praktischer als die einfache Texterkennung.
Werbeverifizierung: Wenn Sie es so interpretieren, dass es „alle kommerziellen OCR-Suiten ersetzt“, ist das offensichtlich zu viel; Wenn Sie es jedoch als Kern-Engine der Open-Source-Plattform zum Parsen von Dokumenten positionieren, sind die offiziellen Leistungsgrenzen glaubwürdig.
Versteckte Vorteile: Im Vergleich zu OCR, das nur eine ganze Seite mit reinem Text zurückgibt, kann die strukturierte Ausgabe von Dolphin Nachbearbeitungsregeln und manuelle Reinigungskosten erheblich reduzieren, was besonders bei langen Dokumenten, Tabellen und Formelszenarien deutlich wird.
Kostenvorteil
Die Wahrheit über kostenlos: Dolphin ist Open Source und kostenlos, aber kostenlos bedeutet nicht, dass der Schwellenwert niedrig ist. Nach dem Upgrade von v2 auf 3B ist der Effekt zwar stärker, aber auch die Komplexität der Inferenzressourcen, des Modell-Downloads und der Bereitstellung nimmt zu. Für Teams, die nur leichte OCR durchführen, sind die „Gesamtsystemkosten“ und nicht der Lizenzpreis der eigentliche Vergleich.
| Kostenschicht | Offenlegung | Was es eigentlich bedeutet |
|---|---|---|
| C-Seite/persönlich | Kein eigenständiges Konsumprodukt | Eher eine F&E-Komponente als eine gewöhnliche Benutzer-App |
| Entwickler/API | Open Source und kostenlos, kann selbst bereitgestellt werden | Die Kosten liegen in Rechenleistung, Modell-Download, Inferenz-Framework und Wartung |
| Unternehmen | Kein öffentliches kommerzielles Paket | Wenn Sie in die Produktion einsteigen, müssen Sie die Berechtigungen, Audits, Flexibilität und SLA selbst ausfüllen |
Versteckte Kosten: Der erste ist die Auswahl des Modells und des Inferenzrahmens. vLLM-, TensorRT-LLM- und Transformers-Lösungen weisen jeweils technische Kompromisse auf. Der zweite Grund sind die Kosten für die Vorverarbeitung von Dokumenten. Schlechte Bildqualität, Rotation, Schattenbildung und das Mischen mehrerer Sprachen verstärken die Fehler. Der dritte Punkt ist die nachgelagerte Schemaausrichtung. Die Struktur identifizieren zu können bedeutet nicht, sie direkt und verlustfrei in das Geschäftssystem schreiben zu können.
Versteckte Vorteile: Wenn das Unternehmen immer noch die alte Methode „OCR-Erkennung des Volltextes + harte Auflösung einer Reihe von Regeln“ verwendet, können strukturierte Modelle wie Dolphin die Kosten für die Regelpflege und manuelle Nacharbeit am meisten einsparen.
Hauptfunktionen
- Zweistufige Dokumentanalyse: Zuerst wird eine Klassifizierung durchgeführt, eine Layoutanalyse durchgeführt und dann der Inhalt nach Element oder gesamter Seite analysiert.
- Vorhersage der Lesereihenfolge: Identifiziert nicht nur Elemente, sondern versucht auch, die natürliche Lesereihenfolge wiederherzustellen, was besonders wichtig für die Markdown-Ausgabe ist.
- Multigranularitätsanalyse: Unterstützt Verarbeitungsmethoden auf Seiten- und Elementebene.
- Extraktion komplexer Elemente: deckt Text, Tabellen, Formeln, Codes und andere Elemente ab.
- Unterstützung für mehrseitige PDFs: Im offiziellen Änderungsprotokoll wurden Funktionen zum Parsen mehrseitiger PDFs veröffentlicht.
- Anpassung der Inferenzbeschleunigung: Die Unterstützung für vLLM, TensorRT-LLM usw. weist darauf hin, dass sie auf die reale Bereitstellung und nicht auf die reine Papierreproduktion ausgerichtet ist.
Expertenmeinung: Die kritischste versteckte Verknüpfung hier ist „Layout -> Element Clipping -> Special Prompt Word Analysis“. Dies bedeutet, dass verschiedene Elemente nicht mehr denselben Parsing-Ton und dieselbe Ausgabevorlage verwenden, was die Hauptquelle für die Verbesserung der Qualität komplexer Dokumente darstellt.
Modell- und Versionsentwicklung
Anfangsphase
Dolphin 1.0: 20.05.2025 Das Vortrainingsmodell und der Inferenzcode werden veröffentlicht, wodurch ein Open-Source-Zugang geschaffen wird.
Leichte Verbesserungsstufe
Dolphin-1.5: 16.10.2025 Verbesserte Parsing-Leistung unter Beibehaltung der 0.3B-Architektur, was darauf hindeutet, dass das Team zunächst an der „leichten Benutzerfreundlichkeit“ gearbeitet hat.
Fähigkeitserweiterungsstufe
Dolphin-v2: Am 12.12.2025 auf 3B aktualisiert und 21 neue Elementerkennung, Attributextraktion, Fotodokumentfunktionen, Formeln und spezielle Codeanalyse hinzugefügt. Dies ist eine Schlüsselversion von „leicht und praktisch“ bis hin zu „allgemeinerer und stärkerer Struktur“.
Aktuelle Einschränkung: Das Warehouse verfügt nicht über einen GitHub-Release-Mechanismus und die Versionsentwicklung basiert mehr auf dem README-Änderungsprotokoll. Es eignet sich zum Anheften von Commits oder Branches vor dem Zugriff, anstatt blind dem Master zu folgen.
Technische Vorteile
ByteDance Dolphin ist eine Mischung aus [RAG/Wissensdatenbank/Datenzentrum] und grundlegenden Komponenten zum Parsen von Dokumenten. Es wird hier anhand seiner Hauptauslieferungsform „Dokument-Parsing-Infrastruktur“ bewertet.
Datengrenze: Der Beamte berücksichtigt eindeutig sowohl digital erstellte als auch fotografierte Dokumente und weist darauf hin, dass er sich nicht nur auf die PDF-Textebene konzentriert, sondern auch auf komplexere reale Dokumentbilder abzielt. Der Vorteil besteht darin, dass gescannte Dokumente und fotografierte Dokumente verarbeitet werden können. Die Einschränkung besteht darin, dass extreme Unschärfe, starke perspektivische Verzerrung und Scans mit niedriger Auflösung immer noch zu erheblichen Qualitätsverlusten führen.
Erinnern Sie sich an die Schmerzpunkte: Die eigentliche Schwierigkeit beim Parsen von Dokumenten liegt nicht nur in der Zeichenerkennung, sondern auch in der mehrsprachigen Mischung, der Fachterminologie, der Verteilung von Tabellen, verschachtelten Formeln und Layoutunterbrechungen. Obwohl Dolphin in diesen Abschnitten stärker ist als die herkömmliche OCR, wird nach der Eingabe eines RAG- oder Wissensdatenbank-Links dennoch empfohlen, Hybridsuche, Metadatenfilterung und gemischtes Chunking auf Seiten- und Elementebene zu verwenden, um Abrufverzerrungen zu reduzieren.
Sicherheitskonformität: Das offizielle öffentliche Lager gibt keine Informationen zur Unternehmensgovernance wie RBAC, Mandantenisolierung und ob Daten für sekundäre Schulungen verwendet werden. Der größte Vorteil der Open-Source-Selbstbereitstellung besteht darin, dass die Daten kontrollierbar sind. Der größte Kostenfaktor besteht jedoch darin, dass diese Governance-Funktionen selbst ergänzt werden müssen.
Wie man es benutzt
Das offizielle Repository stellt die Kerninstallations- und Argumentationspfade bereit.
„Bash Git-Klon https://github.com/ByteDance/Dolphin.git CD Delphin pip install -r Anforderungen.txt git lfs installieren Git-Klon https://huggingface.co/ByteDance/Dolphin-v2 ./hf_model python demo_page.py --model_path ./hf_model --save_dir ./results --input_path ./demo/page_imgs/page_1.png „
Eingangsbeschreibung:
| So verwenden Sie | Geeignet für wen | Anleitung |
|---|---|---|
demo_page.py |
Team, das ganzseitiges Parsen durchführt | Strukturergebnisse auf Seitenebene direkt ausgeben |
demo_element.py |
Team führt feine Elementextraktion durch | Geeignet für die separate Verarbeitung von Tabellen, Formeln und Codes |
demo_layout.py |
Ein Team, das Layout-Verständnisse und Voranalysen durchführt | Geeignet für die Vorlayout-Diagnose |
Grenze der Mensch-Computer-Zusammenarbeit: Die Stapelextraktion kann automatisiert werden, aber hochwertige Verträge, medizinische Dokumente, Finanzberichte und komplexe akademische PDFs müssen immer noch von Menschen überprüft werden, bevor sie online gehen, wobei der Schwerpunkt auf Tabellenausrichtung, fehlenden Formeln und unterbrochenen seitenübergreifenden Beziehungen liegt.
Produktpreise
Es gibt keine öffentliche Preisgestaltung, da es sich um ein Open-Source-Modell und nicht um SaaS von der Stange handelt.
C-Seite/Einzelperson: Für normale Benutzer gibt es keinen Kaufzugang.
Entwickler/API: Die wichtigsten Kosten sind Modelldownload, Inferenzbereitstellung, Grafikspeicher und Durchsatzoptimierung.
Unternehmen: Wenn Sie eine interne Analyseplattform aufbauen möchten, müssen Sie neben den Argumentationskosten auch Berechtigungen, Caching, Aufgabenwarteschlangen, Ergebnisüberprüfung und Protokollverwaltung einbeziehen.
Die freie Wahrheit: Open Source spart Lizenzgebühren, nicht Systemkosten. Sobald die Dokumentenanalyse die Produktion erreicht, werden Rechenleistung und Datenverwaltung nie mehr außer Acht gelassen.
Anwendungsszenarien
- Wissensdatenbank-Vorverarbeitung: Strukturieren Sie zunächst PDFs, Berichte und Papiere und senden Sie sie dann an Abruf- und Frage-und-Antwort-Links.
- Analyse wissenschaftlicher Dokumente und Formeln: Besonders geeignet für wissenschaftliche Forschungsmaterialien mit gemischten Formeln, Tabellen und Texten.
- Digitalisierung von Unternehmensdokumenten: Strukturierte Extraktion von Verträgen, technischen Dokumenten und Geschäftsberichten.
- Mehrseitige PDF-Stapelverarbeitung: Konvertieren Sie große Mengen historischer Dokumente in indexierbare, nachgelagert nutzbare strukturierte Daten.
Streikszenario zur Dimensionsreduzierung: Wenn das Team durch traditionelle OCR aufgrund von Problemen mit Tabellen, Formeln und Lesereihenfolge stark gequält wurde, wird der Einsatz dieser OCR eine ganz offensichtliche Verbesserung der Strukturqualität mit sich bringen.
Aktuelle Einschränkungen: Wenn ein Unternehmen nur eine einfache Ticket-OCR oder einspaltige Dokumenttextextraktion benötigt, ist dies aufgrund der höheren technischen Komplexität möglicherweise nicht unbedingt die kostengünstigste Option.
Anwendbare Personen
- Plattformteam arbeitet an Wissensdatenbank/RAG: Eine qualitativ hochwertige Dokumentenvorverarbeitung ist erforderlich.
- Document AI Product Team: Sie möchten OCR von der Klartexterkennung auf das Strukturverständnis umstellen.
- Forschungs- und Bildungsteam: Wertvoller beim Umgang mit Aufsätzen, Lehrbüchern, Testarbeiten und Materialien mit Formeln.
Überzeugungsszenario:
- Menschen, die einfach nur eine sofort einsatzbereite Nutzung mit niedrigen Barrieren wünschen: Es handelt sich eher um Modellkomponenten, nicht um SaaS von der Stange.
- Teams ohne GPU- oder Modellbereitstellungserfahrung: Die Bereitstellungs- und Beschleunigungskonfiguration bringt viele Hindernisse mit sich.
- Betrachten Sie es als ein „universelles und fehlerfreies OCR“-Team: Das Parsen komplexer Dokumente erfordert immer noch eine stichprobenartige Überprüfung und nachgelagerte Korrektur.
Zusammenfassung und Ausblick
Die Wettbewerbsfähigkeit von ByteDance Dolphin liegt in seiner Fähigkeit, das Dokumentverständnis von „Ganzseitenkompetenz“ zu „Struktur zuerst, Inhalt später“ zu verbessern. Dies ist von entscheidender Bedeutung für Wissensdatenbanken, Unternehmensdokumente und die Verarbeitung von Forschungsmaterial, da die spätere Verwendbarkeit oft nicht von der Zeichengenauigkeit abhängt, sondern davon, ob Tabellen, Formeln, Codeblöcke und Lesereihenfolge erhalten bleiben.
[Beschaffungs-/Einführungsrisikobewertung]: Das Wichtigste, was Sie vor der Einführung bewerten sollten, ist die Art Ihres Dokuments und nicht nur die Bewertung der Liste. Wenn es sich bei einer großen Anzahl von Dokumenten um komplexe akademische PDFs, mehrseitige Berichte, gemischte Tabellen und Formeln handelt, ist Dolphin wertvoll; Wenn es sich nur um OCR mit leichtem Text handelt, kann das Problem von „Überkapazität und Overengineering“ auftreten. Was es wert ist, auch in Zukunft weiter beobachtet zu werden, ist das nachfolgende Inferenzbeschleunigungs-Ökosystem von v2, die Stabilität fotografierter Dokumente und die Geschwindigkeit der Community-Nachfüllung rund um Schemastandardisierung und Unternehmensführung.
Versionsinfo
- Dolphin-v2 :Die neueste im offiziellen Warehouse-Änderungsprotokoll veröffentlichte Hauptversion wurde auf 3B-Parameter aktualisiert und bietet 21 Arten der Elementerkennung, Attributfeldextraktion, spezielle Formel- und Codeanalyse sowie stärkere Funktionen zur Verarbeitung von Fotodokumenten.
- Delphin-1.5 :Die deutliche Verbesserung des Parsing-Effekts bei gleichzeitiger Beibehaltung der 0,3B-Lightweight-Architektur ist ein wichtiger Knotenpunkt beim Übergang von der ersten Version zur praktischen Anwendung.
- Delphin 1.0 :Der Beamte gab zum ersten Mal das Pre-Training-Modell und den Inferenzcode bekannt und schuf damit einen vollständigen Open-Source-Zugang für das Parsen von Dokumenten.
Benutzerbewertungen