Erweiterte Version von Jina AI ReaderLM-v2: Die Konvertierungsqualität von HTML in Markdown/JSON wurde verbessert und die Agent-Abrufbasis wurde aktualisiert.
Jina AI verbessert die Qualität der HTML-zu-Markdown/JSON-Konvertierung und erweitert die Suchfunktionen im Reader, und ReaderLM-v2 ermöglicht eine zuverlässigere Eingabe von Webinhalten in LLM und Agent.
Erweiterte Version von Jina AI ReaderLM-v2: Die Konvertierungsqualität von HTML in Markdown/JSON wurde verbessert und die Agent-Abrufbasis wurde aktualisiert.
Jina AI hat im Juni 2026 die erweiterte Version von ReaderLM-v2 veröffentlicht. Der Kern besteht darin, die Konvertierungsqualität von HTML in Markdown/JSON im Reader auf ein höheres Niveau zu bringen und die suchbezogenen Funktionen weiter zu erweitern. Als Agent-Abrufbasis mit r.jina.ai und s.jina.ai als Kern steht dieses Update in direktem Zusammenhang mit der Zuverlässigkeit und Genauigkeit des RAG-Systems und des AI-Agenten beim Abrufen von Webseiteninformationen.
- Verbesserung der Konvertierungsqualität: ReaderLM-v2 verbessert die Genauigkeit der HTML-zu-Markdown/JSON-Konvertierung und reduziert so Informationsverluste und strukturelle Verwirrung.
- Erweiterung der Suchfunktionen: Der Suchendpunkt wird weiterhin verbessert, um die Informationserfassung des Agenten in Echtzeit zu unterstützen.
- Komponentisierte Retrieval-Basis: Reader, Embeddings, Reranker, DeepSearch und andere Funktionen können unabhängig voneinander aufgerufen und frei kombiniert werden.
- Für LLM-freundliche Ausgabe: Die Konvertierung von Webseiteninhalten in LLM-freundlichen Text ist eine wichtige Vorverarbeitungsebene für RAG und Agent.
Versionshintergrund
Jina AI ist nicht als eine weitere Vektordatenbank oder Suchmaschine positioniert, sondern als eine Reihe von Open-Source-Suchinfrastrukturschichten mit „Componentized Retrieval“ als Kernkonzept. Es zerlegt das Lesen von Webseiten (Reader), die semantische Vektorisierung (Embeddings), die Neuanordnung der Relevanz (Reranker), das multimodale Verständnis und das Argumentieren tiefer Suchvorgänge (DeepSearch) in API-Module, die unabhängig voneinander aufgerufen und frei kombiniert werden können. Die Reader-API hat sich seit 2023/01, als sie die URL-Lesefunktionen von r.jina.ai offenlegte, weiterentwickelt, und ReaderLM-v2 ist ein wichtiges Upgrade der Konvertierungsqualität in dieser Entwicklung.
Highlights dieser Version
Erweiterung der ReaderLM-v2-Konvertierung
- HTML zu Markdown: Stellen Sie die Struktur der Webseite genauer wieder her, entfernen Sie Rauschen wie Navigation und Werbung und behalten Sie die Semantik des Textes bei.
- HTML zu JSON: Strukturierte Extraktion von Seiteninformationen zur Erleichterung der programmatischen Nutzung und Datenspeicherung.
- Verbesserung der Wiedergabetreue: Komplexe Strukturen wie Tabellen, Codeblöcke und Listen werden bei der Konvertierung weniger verzerrt, wodurch die nachgelagerten Analysekosten gesenkt werden.
Such- und Abrufkomponenten
- s.jina.ai-Suche: Agentenorientierte Echtzeit-Suchfunktion, die mit Reader zusammenarbeitet, um die geschlossene Schleife „Suchen-Lesen“ zu vervollständigen.
- Einbettungen und Reranker: Semantische Vektorisierung und Relevanzneuordnung zur Verbesserung der Abrufqualität.
- DeepSearch: Funktionen zur umfassenden Suchbegründung, die mehrstufige Abrufszenarien unterstützen.
Bedeutung für Entwickler
Aus Branchensicht weist das ReaderLM-v2-Upgrade von Jina AI auf die deterministischen Anforderungen an die Agent-Infrastruktur hin: Webseiteninformationen sind eine der wichtigsten externen Datenquellen für Agent, und die Qualität der Konvertierung von „Webseiten in strukturierten Text“ bestimmt direkt die Antwortqualität von RAG-Anwendungen. Für inländische Entwickler bedeutet dies, dass sie beim Erstellen von Fragen und Antworten für Dokumente, Informationsaggregation und Agentenanwendungen zunächst „zuverlässiges Lesen von Webseiten“ als Infrastruktur verbinden und dann Vektorisierung und Neuanordnung hinzufügen können.
Für Teams, die RAG-Framework-Anwendungen wie LlamaIndex erstellen, bietet Reader eine hochwertige Implementierung des „Web Page Loader“, der den Arbeitsaufwand für selbst erstelltes Crawling und Bereinigen erheblich reduzieren kann.
Tipps für den Einstieg
- RAG-Anwendung: Verwenden Sie den Reader-Endpunkt, um das selbst erstellte Parsen von Webseiten zu ersetzen und die Verbesserung der Antwortgenauigkeit aufgrund der Konvertierungsqualität zu überprüfen.
- Agentenentwicklung: Kombinieren Sie die s.jina.ai-Suche und den Reader, um einen Agenteninformationslink für „Echtzeitsuche – Webseitenlesen – strukturierte Ausgabe“ zu erstellen.
- Bewertungskriterien: Die Qualität der Basis wird in zwei Dimensionen gemessen: „Genauigkeit der strukturierten Konvertierung“ und „Relevanz der Suchergebnisse“.
Richtungen, die in Zukunft Aufmerksamkeit verdienen
- Grenze der Konvertierungsqualität: Konvertierungsleistung komplexer dynamischer Seiten, Anti-Crawling-Seiten und mehrsprachiger Inhalte.
- Echtzeitleistung der Suchfunktionen: Die Abdeckung der Echtzeitleistung und regionaler Unterschiede wirkt sich auf den Umfang der Agentenimplementierung aus.
- Vergleich mit inländischen Retrieval-Komponenten: Tatsächlicher Messvergleich mit inländischen Retrieval-Lösungen auf chinesischen Webseiten und chinesischen Suchszenarien.
Bewertungen