Open-Source-RAG-Wissensdatenbank, lokale Bereitstellung, Tutorial auf Nanny-Ebene: Ollama + AnythingLLM Privatisierung – Fragen und Antworten
🛒 Für Betriebs- und Wartungspersonal sowie Geschäftspersonal ohne tiefgreifenden Entwicklungshintergrund ein vollständiges Tutorial zum Aufbau einer privaten Wissensdatenbank ohne Code.
Lernziele
Dieses Tutorial verwendet zwei Open-Source-Komponenten, um eine lokale RAG-Wissensdatenbank aufzubauen, die für Fragen und Antworten durch Hochladen von Dokumenten und Antworten mit Quellen verwendet und offline ausgeführt werden kann:
– Ollama: Inferenzdienst zum lokalen Ausführen großer Modelle.
AnythingLLM: One-Stop-Wissensdatenbankanwendung mit Schnittstelle (einschließlich Vektorbibliothek und Fragen und Antworten).
Im gesamten Prozess muss kein Code geschrieben werden, und er eignet sich für Betrieb und Wartung, Betrieb und Geschäftspersonal.
Vorbereitungscheckliste
- [ ] Ein Computer oder Server: 16 GB Arbeitsspeicher oder mehr werden empfohlen; macOS/Linux/Windows sind akzeptabel.
- [ ] Bereiten Sie mehrere Testdokumente vor (PDF/Word/TXT/Markdown sind akzeptabel).
- [ ] Das Netzwerk ist verfügbar (Modell und Software müssen zum ersten Mal heruntergeladen werden und können danach offline verwendet werden).
- [ ] Reservieren Sie 8–20 GB Speicherplatz (abhängig von der Modellgröße).
- [ ] (Optional) NVIDIA-Grafikkarte verbessert die Antwortgeschwindigkeit erheblich.
Versionstipp: Die folgenden Versionsnummern, Modellgrößen und Download-Adressen unterliegen der offiziellen Echtzeitseite. Der Model-Pull-Befehl unterliegt der offiziellen Ollama-Modellbibliothek.
Schritt 1: Ollama installieren und konfigurieren
Besuchen Sie die offizielle Website von Ollama, um das entsprechende Systeminstallationspaket herunterzuladen (ziehen Sie es direkt in „Anwendungen“ für macOS; verwenden Sie das Installationsskript für Linux; verwenden Sie das Installationspaket für Windows). Öffnen Sie nach der Installation das Terminal, um Folgendes zu überprüfen:
„Bash ollama --version „
Normalerweise wird die Versionsnummer ausgegeben, z. B. „ollama version 0.x.x“.
Schritt 2: Ziehen Sie das lokale Modell
Die Wissensdatenbank erfordert zwei Modelle: eines zum Generieren von Antworten und eines zum Vektorisieren des Dokuments (Einbetten). Ziehen Sie zunächst das Dialogmodell:
„Bash ollama pull qwen2.5:7b „
Ziehen Sie dann das Vektorisierungsmodell:
„Bash Ollama Pull nomic-embed-text „
Überprüfen Sie, ob das Modell bereit ist:
„Bash Ollama-Liste „
Das Modell ist groß und je nach Netzwerkgeschwindigkeit kann es einige Zeit dauern, bis es zum ersten Mal aufgerufen wird. Die Modellbenennung und die verfügbare Liste unterliegen der offiziellen Ollama-Echtzeitseite.
Schritt 3: AnythingLLM installieren
Laden Sie das Installationspaket für die Desktop-Version von der offiziellen Website von AnythingLLM herunter und installieren Sie es (unterstützt macOS/Windows/Linux). Beim ersten Start gelangen Sie in den Initialisierungsassistenten:
- Wählen Sie den Typ „Lokale Vektorbibliothek“ (standardmäßig wird die integrierte LanceDB verwendet, es ist keine zusätzliche Installation erforderlich).
- Wählen Sie als LLM-Anbieter Ollama aus.
- Geben Sie die Ollama-Adresse „http://localhost:11434“ ein und wählen Sie „qwen2.5:7b“ aus dem vorherigen Schritt aus.
- Wählen Sie den Einbettungsanbieter „Ollama“ und das Modell „nomic-embed-text“ aus.
Nach dem Speichern der Konfiguration ist die Verbindung abgeschlossen.
Schritt 4: Erstellen Sie eine Wissensdatenbank und laden Sie Dokumente hoch
- Klicken Sie auf der linken Seite von AnythingLLM auf „Arbeitsbereich“ und erstellen Sie einen neuen Arbeitsbereich, z. B. „Unternehmenssystem“.
- Betreten Sie den Arbeitsbereich → „Dokument hochladen“ und ziehen Sie das vorbereitete geteilte Dokument hinein.
- Klicken Sie auf „Verarbeiten“ und warten Sie, bis die Vektorisierung abgeschlossen ist.
Nach erfolgreicher Vektorisierung zeigt jedes Dokument den Status „Verarbeitet“ an, was darauf hinweist, dass es in die durchsuchbare Vektorbibliothek aufgenommen wurde.
Schritt 5: Fragen und Antworten starten und Rückverfolgbarkeit überprüfen
Geben Sie eine Frage in das Arbeitsbereichsdialogfeld ein, z. B. „Wie viele Schritte dauert der Erstattungsprozess laut Dokumentation?“
Erwartete Leistung:
- Der Inhalt der Antwort stammt aus dem von Ihnen hochgeladenen Dokument und ist nicht allgemein gehalten.
- Das zitierte Quellfragment wird unterhalb der Antwort angezeigt. Sie können auf klicken, um zur ursprünglichen Textposition zu springen.
Öffnen Sie die „Chat“-Einstellungen von AnythingLLM und aktivieren Sie „Zitate anzeigen“, um die Quelle jeder Antwort anzuzeigen.
Schritt 6: Effektabstimmung
Wenn die Antwort nicht zufriedenstellend ist, versuchen Sie es in der Reihenfolge:
- Chunking anpassen: Chunk-Größe und Überlappung können in den AnythingLLM-Einstellungen konfiguriert werden (empfohlen wird eine Chunk-Größe von 500–1000, eine Überlappung von 50–100).
- Wechseln Sie zu einem stärkeren Modell: „ollama pull qwen2.5:14b“ oder einem größeren Modell.
- Wechseln Sie zu einem besseren Vektormodell: Verwenden Sie ein höherdimensionales Einbettungsmodell und wechseln Sie in der Konfiguration.
- Ergänzende Dokumentation: Fehlendes Wissen zur Wissensbasis hinzufügen und erneut aufbereiten.
Schritt 7: Passen Sie die Aufforderungswörter und den Antwortstil an
Mit AnythingLLM können Sie Systemansagen (Systemansagen) anpassen, um Antworten besser an den Ton des Teams anzupassen. Geben Sie beispielsweise Folgendes in „Chat-Einstellungen“ ein:
„Text Sie sind der Wissensassistent des Unternehmens. Antworten Sie nur auf der Grundlage hochgeladener Dokumente und erfinden Sie nichts. Antworten Sie in präzisem Chinesisch und geben Sie zuerst die Schlussfolgerungen und dann die Grundlage. Wenn keine Beweise gefunden werden, wird klargestellt, dass „die Datenbank keinen relevanten Inhalt enthält“. „
Durch das Anpassen von Aufforderungswörtern können Antworten Ihren eigenen ähnlicher werden und sind außerdem ein wirksames Mittel zur Reduzierung von Halluzinationen.
Schritt 8: Datensicherung und -aktualisierung
- Backup: Das Datenverzeichnis von AnythingLLM (einschließlich Vektorbibliothek und Konfiguration) wird regelmäßig kopiert. Es wird empfohlen, es in die tägliche Sicherungsaufgabe einzubeziehen.
- Upgrade: Sichern Sie vor dem Upgrade, aktualisieren Sie dann die Softwareversion und überprüfen Sie die Fragen und Antworten erneut.
- Dokumentaktualisierung: Nachdem sich der Dokumentinhalt geändert hat, löschen Sie die alte Version und laden Sie sie erneut hoch, um Konflikte zwischen der alten und der neuen Version zu vermeiden.
Verifizierungsmethode
- Überprüfung 1: „Ollama-Liste“ kann das Dialogmodell und das Vektormodell sehen.
- Überprüfung 2: Nach dem Hochladen des Dokuments ist der Status „Verarbeitet“.
- Überprüfung 3: Stellen Sie im Dokument eine sachliche Frage und die Antwort kann die entsprechende Quelle zitieren.
- Überprüfung 4: Verbindung zum externen Netzwerk trennen, Fragen und Antworten sind weiterhin verfügbar (bestätigen Sie, dass es sich um eine lokale Inferenz handelt).
- Überprüfung 5: Nach der Anpassung der Eingabeaufforderungswörter können unbegründete Fragen korrekt abgelehnt werden.
Häufige Fehler und Vorsichtsmaßnahmen
- Das Dokumentformat ist verwirrend: Vereinheitlichen Sie es zunächst in auswählbaren Text (OCR zuerst das gescannte Dokument) und importieren Sie es dann stapelweise.
- Der Block ist zu groß: Eine Abrufverzerrung tritt auf, wenn ein einzelner Block den Modellkontext überschreitet. Passen Sie den empfohlenen Wert an.
- Mehrsprachiges Mischen: Versuchen Sie, die Sprachen in einer Wissensdatenbank zu vereinheitlichen, oder teilen Sie Arbeitsbereiche nach Sprachen auf.
- Vergessen, Referenzen zu aktivieren: Stellen Sie sicher, dass in der Konfiguration „Referenzquellen anzeigen“ aktiviert ist. Dies ist ein schwierig zu akzeptierender Punkt.
Häufig gestellte Fragen und Fehlerbehebung (FAQ)
- Was soll ich tun, wenn AnythingLLM keine Verbindung zu Ollama herstellen kann?
Vergewissern Sie sich zunächst, dass „Ollama Serve“ ausgeführt wird („Ollama Serve“ hört standardmäßig auf 11434) und greifen Sie dann mit dem Browser auf „http://localhost:11434“ zu, um dies zu überprüfen. Fügen Sie in der Konfiguration keine zusätzlichen Schrägstriche in die Adresse ein.
-
Der Modell-Download ist langsam oder schlägt fehl?
Wenn das Netzwerk begrenzt ist, verwenden Sie die Spiegeladresse oder versuchen Sie es zu einem anderen Zeitpunkt erneut. Sie können das GGUF-Modell auch herunterladen und manuell importieren.
-
Die Antwort zitiert das Dokument überhaupt nicht, als würde man Unsinn plaudern?
Überprüfen Sie, ob Embedding als lokales Ollama-Modell konfiguriert ist. Wenn es nicht konfiguriert ist, kann das Dokument nicht korrekt abgerufen werden.
-
Wird das hochgeladene PDF verstümmelt oder unvollständig erkannt?
AnythingLLM verlässt sich auf den integrierten Parser; Das gescannte PDF muss zunächst per OCR in auswählbaren Text konvertiert werden.
-
Unzureichender Speicher und verzögerter Betrieb?
Wechseln Sie zu einem kleineren Quantisierungsmodell (z. B. „qwen2.5:3b“) und schließen Sie andere Programme mit großem Speicher. Das 7B-Modell empfiehlt mehr als 16 GB Speicher.
-
Wie können mehrere Computer eine Wissensdatenbank gemeinsam nutzen?
Stellen Sie AnythingLLM als Docker-Server bereit und konfigurieren Sie ein gemeinsames Datenvolumen, auf das Clients über das LAN zugreifen können.
Zusammenfassung und nächste Schritte
Zu diesem Zeitpunkt verfügen Sie bereits über eine Reihe von RAG-Anwendungen „lokales Modell + lokale Wissensbasis + nachvollziehbare Frage und Antwort“. Empfohlener nächster Schritt: Verwenden Sie zunächst echte Geschäftsdokumente für einen kleinen Testzeitraum von 1–2 Wochen, um hochfrequente Probleme zu sammeln und blinde Flecken abzurufen, und entscheiden Sie dann, ob Sie das Modell aktualisieren, die Vektorbibliotheken wechseln oder es für mehrere Benutzer bereitstellen möchten.
Weiterentwicklung und Erweiterung
- Wechsel zu FastGPT/Flowise: Migration, wenn visueller Workflow und komplexe Verzweigungen erforderlich sind.
- Upgrade der Vektorbibliothek: Wenn die Menge an Dokumenten groß wird, ersetzen Sie LanceDB durch eine professionelle Vektorbibliothek wie Milvus.
- Hybridsuche: Aktivieren Sie die Schlüsselwort- und Vektorsuche gleichzeitig, um die Trefferquote bei Long-Tail-Fragen zu verbessern.
- Mehrbenutzerberechtigungen: Stellen Sie den Server bereit und greifen Sie auf das Kontosystem zu, um eine Wissensisolierung auf Abteilungsebene zu erreichen.
- Zugriff auf Agenten: Machen Sie die Wissensdatenbank zu einem Suchtool für Agenten und verknüpfen Sie Arbeitsaufträge, Kundenservice und andere Geschäftsprozesse.
Benutzerbewertungen