Spaß-ASR1.5 Kostenlos

-

Fun-ASR1.5 ist ein großes End-to-End-Spracherkennungsmodell, das vom Alibaba Tongyi-Team eingeführt wurde. Basierend auf der MoE-Architektur unterstützt ein einzelnes Modell 30 Sprachen, sieben wichtige Dialektsysteme und mehr als 20 lokale Akzente und verfügt über integrierte Funktionen zur intelligenten Zeichensetzungsvorhersage und Textnormalisierung.

Spaß-ASR1.5 Produktoberfläche

Fun-ASR1.5: Alibaba Tongyi End-to-End-Spracherkennungsmodell

Kernparameter und Statistiken von Fun-ASR1.5

Projekt Einzelheiten
Produktname Fun-ASR1.5 (Spracherkennungsmodell von Alibaba Tongyi)
Produkttyp End-to-End-Spracherkennung, großes Modell
Lieferform Python-Bibliothek/API/CLI/MCP-Server
Unterstützte Sprachen 30 Sprachen (Chinesisch, Englisch, Japanisch, Koreanisch, Französisch, Deutsch, Spanisch, Portugiesisch, Russisch, Arabisch usw.)
Dialektabdeckung Sieben große Dialektsysteme mit Schwerpunkt auf der Optimierung von 15 stark nachgefragten Dialekten wie Shanghai-, Kantonesisch- und Sichuan-Dialekten
Architektur MoE (Mixed Expert Architecture)
Neueste Version FunASR 1.3.19 (19.07.2026)
Open-Source-Vereinbarung MIT (Toolkit) / Modellgewichte werden mit separater Vereinbarung geliefert
GitHub-Sterne 19,3k
Zielbenutzer Entwickler, Unternehmen, Forschungseinrichtungen

Parameterinterpretation: Ein einzelnes Modell, das 30 Sprachen abdeckt, bedeutet, dass während der Bereitstellung keine separaten Modellinstanzen für jede Sprache verwaltet werden müssen. Die MoE-Architektur stellt sicher, dass das entsprechende Expertenmodul nur aktiviert wird, wenn eine bestimmte Sprache erkannt wird, und die Argumentationseffizienz ist höher als die eines dichten Modells im gleichen Maßstab. Die Dialektfehlerrate (CER) ist im Vergleich zur Vorgängerversion um 56,2 % gesunken, was in der Praxis die Kosten für das manuelle Korrekturlesen deutlich senken kann.

Benutzer und Marktbekanntheit von Fun-ASR1.5

Hinter Fun-ASR1.5 steht das Open-Source-Projekt FunASR (GitHub 19.3k Stars) der Alibaba Damo Academy. Es ist derzeit eines der aktivsten End-to-End-Toolkits in der chinesischen Spracherkennungs-Community. Die kumulierten Downloads von PyPI haben eine große Anzahl einzelner Entwickler und Unternehmensbenutzer abgedeckt, mit mehr als 178 Community-Mitwirkenden.

Im Benchmark-Test erreichte Fun-ASR-Nano (das Flaggschiffmodell der Fun-ASR1.5-Serie) auf dem chinesischen Long-Audio-Testset eine Wortfehlerrate (CER) von nur 8,20 %, was viel niedriger ist als die 21,71 % von Whisper-large-v3-turbo. Die Inferenzgeschwindigkeit erreichte 340-mal Echtzeit (mit vLLM), was mehr als 26-mal so viel ist wie bei Whisper. Das SenseVoiceSmall-Modell kann eine 17-fache Echtzeitinferenz auf der CPU erreichen und einen Durchsatz auf Produktionsebene erreichen, ohne dass eine GPU erforderlich ist.

Dieses Projekt wurde häufig in Szenarien wie Besprechungsprotokollen, intelligentem Kundenservice, Sprachsuche, Untertitelgenerierung und Online-Bildung eingesetzt. Benutzer auf Unternehmensebene können die API direkt über die Alibaba Cloud Bailian-Plattform aufrufen.

Kostenvorteile von Fun-ASR1.5

Fun-ASR1.5 ist ein vollständig Open-Source-Projekt und sein Hauptvorteil besteht darin, dass keine Lizenzkosten anfallen.

Kostendimension Beschreibung
Toolkit-Nutzung MIT-Lizenz, völlig kostenlos und für die kommerzielle Nutzung verfügbar
Modellgewicht Vorbehaltlich der Musterkartenvereinbarung, die meisten davon sind für die kommerzielle Nutzung kostenlos
API-Aufruf (Alibaba Cloud Bailian) Pay-as-you-go-Abrechnung finden Sie im Echtzeitangebot von Alibaba Cloud
Privater Einsatz Bauen Sie Ihren eigenen Server und tragen Sie nur die Infrastrukturkosten
Wettbewerbsproduktvergleich (Whisper API) Die Inferenzgeschwindigkeit ist bei Selbstbereitstellung 26-mal höher und die Hardwarekosten werden bei gleichem Durchsatz erheblich reduziert

C-seitige Kosten: Das Online-Erlebnis über die Moda Community ist völlig kostenlos und für die lokale Bereitstellung ist lediglich ein Computer mit einer GPU erforderlich (auf der CPU kann auch das SenseVoiceSmall-Modell ausgeführt werden). Geschäftsseitige Kosten: Unternehmen können sich für eine nutzungsbasierte Bezahlung der Alibaba Cloud Bailian API entscheiden oder sie privat bereitstellen, um zu verhindern, dass Daten die Domäne verlassen. Im Selbstbereitstellungsmodus ermöglicht die Inferenzeffizienz von Fun-ASR1.5 eine viel höhere Parallelität als Whisper auf derselben Hardware.

Hauptfunktionen von Fun-ASR1.5

  • Mehrsprachige Erkennung: Ein einziges Modell deckt 30 Sprachen ab, darunter Chinesisch, Englisch, Japanisch, Koreanisch, Französisch, Deutsch, Spanisch, Portugiesisch, Russisch und Arabisch. Es ist nicht erforderlich, für jede Sprache unabhängige Modelle bereitzustellen. Geeignet für transnationale Konferenzen und mehrsprachige Content-Produktionsszenarien.

  • Automatische Sprachumschaltung (Code-Switching): Sprach-Tags müssen nicht voreingestellt werden, mehrsprachige gemischte Stimmen im selben Gespräch werden automatisch erkannt und verarbeitet. Dies ist äußerst praktisch für Szenarien wie Geschäftstreffen und Technologie-Podcasts, in denen Chinesisch und Englisch gemischt werden, wodurch die mühsame manuelle Segmentierungsanmerkung entfällt.

  • Dialekt- und Akzenterkennung: Deckt sieben wichtige Dialektsysteme und mehr als 20 lokale Akzente ab und konzentriert sich auf die Optimierung von 15 stark nachgefragten Dialekten wie Shanghainesisch, Kantonesisch, Sichuan und Hokkien. Die Fehlerrate von Dialektzeichen ist im Vergleich zur Vorgängerversion um 56,2 % gesunken, was die Wiederherstellung der ursprünglichen Dialektzeichen unterstützt.

  • Erkennung von Rezitationen antiker Poesie: Erstellte ein Korpus realer Rezitationen, das klassische Texte wie „Das Buch der Lieder“, „Chu Ci“, die Gedichte von Li Bai und Du Fu sowie die Ci-Gedichte von Su Shi und Xin Qiji abdeckt, mit einer Genauigkeit von 97 % auf Zeichenebene. Es hat einen einzigartigen Wert für das digitale Szenario der chinesischen Studienausbildung und des kulturellen Erbes.

  • Intelligente Nachbearbeitung: Fügen Sie automatisch Satzzeichen wie Kommas, Punkte, Fragezeichen usw. basierend auf der Kontextsemantik ein und konvertieren Sie gesprochene Zahlen, Daten, Beträge, Telefonanrufe usw. automatisch in standardisierte Schriftformate. Diese Funktion kann die manuelle Bearbeitungszeit nach der Produktion für Szenarien wie Besprechungsprotokolle und juristische Transkripte erheblich verkürzen.

Fun-ASR1.5 Modell- und Versionsentwicklung

Fun-ASR1.5 ist ein Open-Source-Projekt, das ständig iteriert. Die neueste Hauptversion ist FunASR 1.3.19 (veröffentlicht am 19.07.2026). Der Kernentwicklungsprozess ist wie folgt:

Version Datum Wichtige Änderungen
FunASR 1.3.19 19.07.2026 Echtzeit-WebSocket-Diagnoseprotokolle für lange Sitzungen, gepackt in die PyPI-Dokumentation
FunASR 1.3.18 19.07.2026 Regression der CLI-Untertitelsegmentierung behoben, SRT-Ausgabe wird nach Sätzen segmentiert
FunASR 1.3.17 19.07.2026 SenseVoice llama.cpp Laufzeitverbesserungen, Windows CUDA-Unterstützung
FunASR 1.3.16 18.07.2026 Fun-ASR-Nano Echtzeit-WebSocket-Dienst direkt von PyPI installiert
FunASR 1.3.15 17.07.2026 Verbesserung der Streaming-Zuverlässigkeit, Fun-ASR-Nano-Kompatibilitätskorrektur
FunASR 1.3.3 24.05.2026 funasr-server CLI, OpenAI-kompatible API, MCP-Server
Fun-ASR-Nano-2512 15.12.2025 Das erste Fun-ASR-Nano-Flaggschiffmodell veröffentlicht

In Bezug auf den Modellstammbaum bietet das FunASR-Toolkit mehrere Modelloptionen: Fun-ASR-Nano (Chinesisch/Englisch/Japanisch + Dialekt), Fun-ASR-MLT-Nano (31 Sprachen), SenseVoiceSmall (5 Sprachen + Emotionserkennung), Paraformer (Streaming-ASR mit geringer Latenz), Qwen3-ASR (52 Sprachen) usw. Benutzer können basierend auf Szenengenauigkeit, Sprachabdeckung und Hardwarebedingungen flexibel auswählen.

Technische Vorteile von Fun-ASR1.5

Die wichtigsten technischen Vorteile von Fun-ASR1.5 lassen sich in drei Ebenen unterteilen: Architektur, Inferenzeffizienz und Bereitstellungsflexibilität:

  • MoE Hybrid Expert Architecture: Das Modell enthält mehrere sprachbezogene Experten-Subnetzwerke. Wenn eine bestimmte Sprache gehört wird, wird nur das entsprechende Expertenmodul aktiviert. Durch dieses Design ist die Parametereffizienz eines einzelnen Modells, das 30 Sprachen abdeckt, viel höher als die eines dichten Modells im gleichen Maßstab. Der Rechenaufwand während der Inferenz wird erheblich reduziert. Gleichzeitig kann jedes Expertenmodul unabhängig voneinander optimiert werden, ohne sich gegenseitig zu beeinträchtigen.

  • Abgestufte und abgestufte Trainingsstrategie: Verwenden Sie genaue Daten für das stufenweise Training. Führen Sie zunächst ein allgemeines mehrsprachiges Vortraining durch, dann eine Feinabstimmung von Dialekt/Akzent und schließlich eine spezielle Szenenausrichtung (z. B. antike Poesie). Dieser Trainingsprozess macht das Modell in realen komplexen Sprachszenarien deutlich robuster als ein Modell, das in einer einzelnen Phase trainiert wurde.

  • Full-Link-Bereitstellungsmatrix: Von der Python-Bibliothek („pip install funasr“) bis zum OpenAI-kompatiblen API-Dienst („funasr-server“), von der Edge-Side-Binärdatei llama.cpp/GGUF bis zur Docker-Container-Bereitstellung, vom MCP-Server bis zur vLLM-Batch-Inferenz-Engine, die den gesamten Bereitstellungsbedarf von persönlichen Entwicklungsmaschinen bis hin zu großen Produktionsclustern abdeckt. Insbesondere bringt die llama.cpp-Laufzeit FunASR auf reine CPU- und Edge-Geräte, ohne dass eine Python-Laufzeit erforderlich ist, was ihm einzigartige Vorteile in IoT- und eingebetteten Szenarien verschafft.

  • Führend bei der Inferenzleistung: Fun-ASR-Nano + vLLM erreicht 340-fache Echtzeit (RTFx), SenseVoiceSmall erreicht 17-fache Echtzeit auf der CPU. Verglichen mit der 13-fachen Echtzeit (GPU) von Whisper-large-v3 übertrifft die Inferenzgeschwindigkeit von FunASR auf der CPU sogar die Leistung von Whisper auf der GPU, was den Einsatz ohne CPU-Karte zu einer praktikablen Lösung macht.

Fun-ASR1.5 Anleitung

Fun-ASR1.5 bietet eine Vielzahl von Nutzungsmethoden, und Entwickler können je nach Szenario flexibel wählen:

Eingang Beschreibung
Python-Bibliothek (pip) „pip install funasr“, aufgerufen über die „AutoModel“-API
CLI-Befehlszeile „funasr audio.wav“ ist eine Transliteration und unterstützt die SRT/JSON-Ausgabe
OpenAI-kompatible API „funasr-server --device cuda“ startet den Dienst, „POST /v1/audio/transcriptions“
MCP-Server Für KI-Agenten wie Claude/Cursor zum Aufrufen von Spracherkennungsfunktionen
Magic Scope Community Online-Erlebnis Verwenden Sie den Browser direkt, keine Installation erforderlich: https://modelscope.cn/studios/iic/FunAudio-ASR
llama.cpp binär Reiner CPU-/Edge-Run, kein Python-Kontext erforderlich

Schneller Einstieg in Python: „Python from funasr import AutoModel

model = AutoModel(model="FunAudioLLM/Fun-ASR-Nano-2512", device="cuda") result = model.generate(input="audio.wav") print(result[0]["text"]) „

Einzeilige CLI-Transkription: „Bash funasr audio.wav --output-format json --spk --timestamps „

API-Dienst starten: „Bash funasr-server --device cuda

Stellen Sie nach dem Start des Dienstes eine OpenAI-kompatible Schnittstelle unter localhost:8000 bereit

Typischer Verwendungsprozess: FunASR installieren → Modell laden (Gewichte automatisch herunterladen) → Audiodateien/Streams eingeben → strukturierte Erkennungsergebnisse erhalten → Nachbearbeitung (Interpunktion/Normalisierung). Es ist im gesamten Prozess nicht erforderlich, Sprach-Tags manuell festzulegen, das Modell erkennt sie automatisch.

Produktpreise für Fun-ASR1.5

Die Open-Source-Strategie von Fun-ASR1.5 bietet erhebliche Kostenvorteile:

  • Community Edition (kostenlos): Installieren Sie den GitHub-Repository-Download über PyPI und erleben Sie die Magic Community online, alles kostenlos. Die MIT-Open-Source-Lizenz ermöglicht die kommerzielle Nutzung und Sekundärentwicklung.
  • Alibaba Cloud Bailian API (Pay-as-you-go): Benutzer, die keine eigene Infrastruktur aufbauen möchten, können die API über die Alibaba Cloud Bailian-Plattform aufrufen und die Abrechnung erfolgt auf Basis der Anzahl der Aufrufe. Der spezifische Preis unterliegt der Echtzeit-Preisseite von Alibaba Cloud.
  • Privatisierte Bereitstellung durch Unternehmen (selbst erstellt): Unternehmen können die Bereitstellung auf ihren eigenen Servern durchführen und müssen nur die Kosten für Computerressourcen tragen. Durch die hohe Inferenzeffizienz von FunASR kann eine einzelne GPU eine große Anzahl gleichzeitiger Anforderungen verarbeiten.

Im Vergleich zu kommerziellen Spracherkennungsdiensten (wie Azure Speech, Google Cloud Speech-to-Text, Whisper API) bieten die Gesamtbetriebskosten (Total Cost of Ownership) der Fun-ASR1.5-Selbstbereitstellungslösung in mittleren und großen Nutzungsszenarien erhebliche Vorteile, und die Daten verlassen die Domäne nicht, wodurch Compliance-Anforderungen erfüllt werden.

Anwendungsszenarien von Fun-ASR1.5

  • Mehrsprachige Konferenzen und mehrsprachige Transkription: Präzise Transkription mehrsprachiger gemischter Dialoginhalte in Echtzeit bei multinationalen Meetings. Es ist nicht erforderlich, die Sprachen im Voraus voreinzustellen. Ein einzelnes Modell kann 30 Sprachen abdecken. Automatische Interpunktion und Textnormalisierung reduzieren die Nachbearbeitungskosten erheblich.

  • Intelligente Kundendienst-Sprachanalyse: Batch-Transkribierung von Kundendienstanrufaufzeichnungen in strukturierten Text, Unterstützung der Dialekterkennung und Sprechertrennung und Verwendung für die Überwachung der Servicequalität, Hot Issue Mining und Stimmungsanalyse.

  • Online-Lehre und Digitalisierung von Chinesischstudien: Die 97-prozentige Zeichengenauigkeit der Rezitationserkennung antiker Gedichte macht sie zu einem einzigartigen Werkzeug für die Online-Chinesischstudienausbildung, mit dem die Rezitationen der Schüler in Echtzeit in Text übersetzt und Vergleiche und Bewertungen durchgeführt werden können.

  • Inhaltsproduktion und Untertitelgenerierung: Videokünstler können Audio über einen einzeiligen CLI-Befehl in SRT-Untertiteldateien transkribieren. Es unterstützt Sprecher-Tags und Zeitstempel und eignet sich für die Produktion von Inhalten wie Podcasts, Kursvideos und Nachrichteninterviews.

  • Sprachinteraktion zwischen IoT und Edge-Geräten: Bei der Ausführung über llama.cpp/GGUF kann Fun-ASR1.5 auf reinen CPU-Geräten ausgeführt werden und eignet sich für Edge-Szenarien wie intelligente Lautsprecher, Autostimme und industrielle Steuerung.

Anwendbare Gruppen von Fun-ASR1.5

  • KI-Anwendungsentwickler: Entwickler, die Spracherkennung in ihre eigenen Anwendungen integrieren müssen, können über Python SDK, REST API oder MCP Server schnell darauf zugreifen. „pip install funasr“ kann starten.

  • Unternehmens-IT- und Datenteam: Für Unternehmen, die die Bereitstellung von Spracherkennungsdiensten privatisieren müssen, bietet FunASR eine vollständige Bereitstellungsmatrix (Docker, Kubernetes, OpenAI-kompatible API), um zu unterstützen, dass Daten die Domäne nicht verlassen.

  • Forschungseinrichtungen und akademische Benutzer: Open-Source-Modellgewichte und eine vollständige Trainings- und Feinabstimmungs-Toolkette, geeignet für Forschungsarbeiten in den Bereichen Spracherkennung, Dialektologie, mehrsprachiges ASR und andere Richtungen.

  • Content-Ersteller und Medienpersonal: Ersteller, die Audio/Video schnell in Text umwandeln und Untertitel erstellen müssen. Die CLI kann die Transkodierung mit einer Befehlszeile abschließen und unterstützt die Ausgabe in Formaten wie SRT/JSON/VTT.

  • Nicht für die Masse geeignet: Für Echtzeit-Kommunikationsszenarien mit strengen Anforderungen an eine extrem niedrige Latenz (<100 ms End-to-End) wird eine Bewertung nach dem Testen empfohlen. Benutzern, die reine Cloud-freie Betriebs- und Wartungs-Hosting-Dienste benötigen, wird empfohlen, der Alibaba Cloud Bailian API Vorrang vor der Selbstbereitstellung einzuräumen. Reine Geschäftsanwender, die mit der Befehlszeile oder der Python-Programmierung nicht vertraut sind, müssen die visuelle Benutzeroberfläche von Alibaba Cloud Bailian oder die Integration von Drittanbietern verwenden.

Zusammenfassung und Ausblick von Fun-ASR1.5

Fun-ASR1.5 ist eine wichtige Open-Source-Errungenschaft des Alibaba Tongyi-Teams im Bereich der Spracherkennung. Seine wesentliche Wettbewerbsfähigkeit liegt darin: Die mehrsprachige Abdeckung eines einzelnen Modells (30 Sprachen + sieben Hauptdialekte) reduziert die Betriebs- und Wartungskomplexität der Bereitstellung mehrerer Modelle. Die durch die MoE-Architektur erzielte Inferenzeffizienz ermöglicht einen Durchsatz, der weit über dem von Konkurrenzprodukten auf derselben Hardware liegt. Die Full-Link-Open-Source-Strategie (MIT-Protokoll + vollständige Bereitstellungstoolkette) bietet Unternehmen und Entwicklern eine kostengünstige, hoch kontrollierbare Spracherkennungsinfrastruktur.

Einschränkungen: Obwohl Modellgewichte kostenlos verwendet werden können, sind die Lizenzvereinbarungen verschiedener Modelle unterschiedlich und die Autorisierungsbedingungen der jeweiligen Modellkarte müssen vor der kommerziellen Nutzung bestätigt werden; Streaming-Szenarien mit extrem geringer Latenz (z. B. Intercom-Übersetzung in Echtzeit) erfordern immer noch eine gezielte Abstimmung; Für extrem ressourcenarme Edge-Geräte (MCU-Ebene) wird die Laufzeit von llama.cpp weiterhin kontinuierlich optimiert.

Beschaffungs-/Einführungsrisikobewertung: Als Open-Source-Projekt der Alibaba Damo Academy verfügt FunASR über langfristige und stabile Community- und Unternehmensunterstützung. 19,3.000 GitHub-Stars und 178 Mitwirkende beweisen seine ökologische Aktivität. Unternehmen müssen bei der Einführung Folgendes beachten: Die Open-Source-Version bietet keine SLA-Garantie, und wichtigen Produktionsunternehmen wird empfohlen, Unterstützung auf Unternehmensebene über die Alibaba Cloud Bailian API zu erhalten. Unabhängige Lizenzvereinbarungen für Modellgewichte müssen vor der kommerziellen Nutzung einzeln bestätigt werden. Der Iterationsrhythmus des Projekts ist schnell (jeden Monat werden mehrere kleine Versionen veröffentlicht), und Produktionsunternehmen sollten die Version sperren und Regressionstests durchführen. Insgesamt ist Fun-ASR1.5 derzeit eine der kostengünstigsten Open-Source-Optionen im Bereich der chinesischen Spracherkennung für Teams mit Selbstaufbaufähigkeiten und Daten-Compliance-Anforderungen.

Verwandte Tools: , udio

Versionsinfo

  • FunASR 1.3.19 :Echtzeit-Diagnosefunktion für lange WebSocket-Sitzungen hinzugefügt, verbesserte CLI-Untertitelgenerierung und Interpunktionsladung sowie aktualisierte Community-Dokumentation.
  • FunASR 1.3.18 :Regressionsproblem bei der SRT-Untertitelsegmentierung behoben, Zeitstempelanforderung auf Satzebene unterstützt und das Laden des Interpunktionsmodells verbessert.
  • FunASR 1.3.17 :Echtzeit-WebSocket-Sitzungsdiagnoseprotokolle, SenseVoice llama.cpp-Laufzeitverbesserungen und Windows CUDA-Unterstützung hinzugefügt.
  • FunASR 1.3.16 :Der Echtzeit-WebSocket-Dienst Fun-ASR-Nano kann direkt von PyPI aus installiert werden und unterstützt den clientgesteuerten Endpunktmodus.
  • FunASR v1.3.15 :Verbessern Sie die Streaming-Zuverlässigkeit, beheben Sie Fun-ASR-Nano-Kompatibilitätsprobleme und verbessern Sie CLI und Textverarbeitung.

Benutzerbewertungen

  • Bewertungen werden geladen...