KI-Audio
-
Deepgram-API AIStartMap
Einheitliche Sprach-KI-API-Plattform, die Spracherkennung, Synthese, intelligente Analyse und Konversations-KI-Agent-Infrastruktur in Echtzeit bietet
-
Ecrett-Musik ecrett
KI-Tool zur Erstellung lizenzfreier Soundtracks für Entwickler, mit dem Sie schnell kommerziell verfügbare Musik nach Szene, Stimmung und Genre generieren können
-
3D-Lautsprecher
ModelScope ist ein Open-Source-Toolkit zur multimodalen Stimmabdruckerkennung und Sprechertrennung.
-
Elf Musik ElevenLabs
Die KI-Plattform zur Musikgenerierung von ElevenLabs kombiniert eine Creator Workbench, einen Marktplatz für kommerzielle Lizenzen und eine einbettbare Musik-API
-
Fisch-Audio Fish
Eine Text-to-Speech- und Sprachklonungsplattform, die sich auf emotionale Ausdruckskraft konzentriert und auf dem Open-Source-Fish-Speech-Modell basiert
-
ACE-Schritt ACE-Step
ACE Studio und StepFun veröffentlichen gemeinsam das Grundmodell der Musikgenerierung als Open Source, um eine effiziente Generierung und Textbearbeitung zu unterstützen.
-
Aero-1-Audio Aero-1-Audio
Ein leichtes Audiomodell mit nur 150 Millionen Parametern, das 15 Minuten kontinuierliche Audioverarbeitung unterstützt
-
Spaß Asr Fun-ASR
Das Open-Source-End-to-End-Spracherkennungsmodell von Tongyi Lab unterstützt chinesische Dialekte und 31 Sprachen.
-
Ein Interview AInterview
Sie sind der Gast und AI ist der Moderator, der in wenigen Minuten ein Podcast-Interview erstellt
-
Fun-AudioGen-VD Alibaba Tongyi Lab
Das von Alibaba Tongyi Lab eingeführte Timbre-Design-Modell unterstützt die Beschreibung natürlicher Sprache, um Timbre, Emotionen und szenenbasiertes Audio zu erzeugen.
-
AssemblyAI-API AssemblyAI
Eine Sprach-KI-API-Plattform für Entwickler, die eine vollständige Link-Infrastruktur von der Transkription über das Verstehen bis hin zum Sprachagenten bietet
-
Gemini 3.1 Flash TTS Google
Das von Google eingeführte Text-to-Speech-Modell der nächsten Generation unterstützt über 70 Sprachen und die Steuerung von Audio-Tags auf Director-Ebene











