Surtout l'IA
Gratuit
Mostly AI est une plate-forme de données synthétiques open source originaire d'Autriche, proposant deux formes de livraison : SDK et plate-forme d'intelligence de données. Le noyau est basé sur l'architecture de génération profonde TabularARGN et prend en charge la formation, la génération et la vérification de la qualité des données de table et de texte. Elle a été acquise par Syntho en juin 2026 et opère désormais sous la marque « MOSTLY AI, powered by Syntho ».
La plateforme de données synthétiques de #MostlyAI
Paramètres et statistiques de base
| Paramètre | Valeur |
|---|---|
| Positionnement du produit | Plateforme open source de génération de données synthétiques |
| Formulaire de livraison | SDK Python (open source) + plateforme de data intelligence (niveau entreprise) |
| Licence Open Source | Apache 2.0 (SDK) |
| Architecture de base | TabularARGN (Modèle Génératif Profond) |
| Types de données pris en charge | Tableaux (table unique/tableaux multiples/séries chronologiques), texte |
| Plateformes prises en charge | Web (plateforme), API, bureau (le SDK s'exécute localement) |
| Étoiles GitHub | ~784 |
| Fourches GitHub | ~68 |
| Sorties totales | 116 sorties |
| Dernière version | 6.1.1 (2026-05-08) |
| Lieu d'appartenance | Autriche (AT) |
| Opérateur actuel | Syntho (Pays-Bas, acquis en juin 2026) |
La plupart du temps, l'IA prend la « démocratisation des données synthétiques » comme concept principal, étendant les capacités de génération de données des data scientists d'entreprise aux développeurs ordinaires. Le SDK open source fournit une chaîne d'outils Python native, tandis que la plate-forme d'entreprise offre des capacités visuelles d'exploration, de collaboration et de partage de données. Les deux formulaires couvrent tous les scénarios, depuis les expériences personnelles jusqu'au déploiement de conformité au niveau de l'entreprise.
Reconnaissance des utilisateurs et du marché
- Clients entreprises : les cas ouverts incluent la Poste Suisse (augmentation de la disponibilité des données clients de 11 % à 100 %), Erste Group (accélération du développement de modèles avec des données synthétiques dans le contexte Databricks), AWS (pour le déverrouillage des données dans les migrations cloud des clients), Databricks (pour la collaboration intersectorielle en matière de données en salle blanche).
- Finance et assurance : JPMorgan utilise un bac à sable de données synthétiques pour accélérer le POC tiers ; Anthem utilise des données synthétiques pour détecter la fraude et personnaliser les services ; Telefónica utilise des données clients synthétiques à des fins d'analyse.
- Communauté Open Source : GitHub 784 étoiles, 68 Forks, 116 versions, 20 contributeurs, les téléchargements PyPI continuent de croître. Le projet fonctionne sous la licence Apache 2.0 et accepte les contributions de la communauté.
- Reconnaissance de l'industrie : répertorié comme fournisseur représentatif de données synthétiques par Gartner. Gartner prédit que « d’ici 2030, la majorité des données utilisées pour le développement de projets d’IA et d’analyse seront générées de manière synthétique ».
Avantage de coût
Développeurs côté C/individuels : le SDK open source est entièrement gratuit (licence Apache 2.0) et peut être installé via pip/uv mostlyai[local] pour s'exécuter localement sur le CPU/GPU local. Il n'y a pas de coûts explicites pour l'apprentissage personnel, l'expérimentation et le développement de prototypes, et vous devez uniquement supporter le coût des ressources informatiques locales.
API/Développeur : le SDK prend en charge le mode LOCAL (inférence de formation locale) et le mode CLIENT (connexion aux points de terminaison du SDK distants). Les méthodes de facturation spécifiques au mode CLIENT et à l'API de la plateforme ne sont pas divulguées. Vous devez contacter Syntho Business pour obtenir un devis. Le package PyPI lui-même est gratuit, mais l'utilisation de points de terminaison distants implique une consommation de ressources de plateforme.
Entreprise/Privé : la plateforme de Data Intelligence de niveau entreprise prend en charge les déploiements privatisés Kubernetes/OpenShift, avec des coûts basés sur le volume de données, le nombre de nœuds, le nombre d'utilisateurs et le niveau de support. Il n’existe pas de tarif public officiel et le contrat commercial prévaut. Le SDK open source peut également être déployé hors ligne sur l'intranet de l'entreprise, mais le téléchargement du modèle Hugging Face nécessite un transfert manuel de fichiers dans un environnement hors ligne.
Coût caché : la formation de modèles de langage volumineux nécessite des ressources GPU (recommande officiellement les GPU modernes pour l'inférence de réglage fin LLM) ; la formation de données tabulaires peut s'exécuter efficacement sur le processeur. Les déploiements d'entreprise doivent maintenir leur propre infrastructure Kubernetes.
Fonctions principales
-
L'IA génère des données synthétiques : sur la base du modèle de génération profonde TabularARGN, elle apprend la distribution statistique et la structure de corrélation à partir de données d'échantillon réelles et génère des données synthétiques avec des caractéristiques statistiques cohérentes. Prend en charge les relations à table unique, multi-tables, les données de séries chronologiques et les données texte. Un rapport d'assurance qualité (Model Insight Report) est automatiquement joint pour vérifier la fidélité et la sécurité de la confidentialité.
-
AI Assistant : un assistant d'analyse de données basé sur le langage naturel qui peut effectuer une analyse exploratoire, une surveillance des tendances et une découverte de modèles sur les données de production sans écrire de code. La couche inférieure génère et exécute automatiquement le code Python, adapté aux analystes commerciaux.
-
Données simulées de données simulées : générez des données simulées basées sur des règles et du caractère aléatoire sans avoir besoin d'échantillons réels. Convient au développement de démonstrations contextuelles, de tests de prototypes et d'autres scénarios. Les données simulées peuvent générer des données contextuelles plus réalistes que les outils de règles pures.
-
Déduction de scénarios de données simulées : Modèle basé sur des données réelles ou synthétiques pour déduire des cas extrêmes, des scénarios futurs et des conditions de simulation. Convient aux tests de résistance, à la vérification de stratégie et à l'évaluation de la robustesse des algorithmes.
-
Synthetic Data SDK : boîte à outils Python, fournissant quatre API principales :
mostly.train(),mostly.generate(),mostly.probe(),mostly.connect(). Prend en charge des options avancées telles que la formation GPU/CPU, la confidentialité différentielle, l'échantillonnage conditionnel, le contrôle de l'équité, le réglage de la température, etc. Les générateurs peuvent être exportés et partagés au sein de la plateforme.
Evolution du modèle et de la version
Itération de la ligne principale
La plupart du temps, le SDK open source d'AI a subi une évolution architecturale, passant d'un système lié à la plate-forme à un système natif depuis sa première publication en 2023. Voici les principales étapes de la publication :
-
2023 - v1.0 (open source initial) : La première version open source basée sur l'architecture TabularARGN, prenant en charge la génération de données synthétiques à table unique/multi-tables et le reporting de qualité. Sous licence Apache 2.0.
-
4ème trimestre 2025 - v5.9.0 : ajout de la prise en charge de l'intégration OAuth2 et amélioration de la connectivité aux sources de données externes.
-
2026 Q1 - v5.10.0 : Introduction du système de contraintes de règles métier (Inequality, FixedCombinations) afin que les données générées puissent se conformer à des contraintes spécifiques de relations inter-colonnes. Moteur mis à niveau vers 2.4, PyTorch 2.9.1.
-
2026 Q2 - v6.0.0 : refactorisation architecturale majeure - SDK entièrement natif d'abord, supprimant les interfaces de plate-forme uniquement et les connecteurs Hive/Databricks/Redshift. Le mode CLIENT est conservé en tant qu’option d’installation légère et autonome.
-
2026 Q2 - v6.1.0/6.1.1 : Le moteur est itéré vers la version 2.6.1 et le module QA est mis à jour vers la version 1.10.6 pour continuer à améliorer l'efficacité de la formation et la qualité de la génération.
Livre blanc technique
L'article arXiv « Démocratiser l'accès aux données tabulaires avec un SDK de données synthétiques open source » (arXiv : 2508.00718) sera publié en 2025, qui explique systématiquement l'architecture du SDK TabularARGN, la conception du modèle et le système d'évaluation de la qualité.
Avantages techniques
Architecture TabularARGN : l'avantage technique principal de l'IA réside principalement dans le modèle génératif profond TabularARGN (arXiv :2501.12012). Cette architecture est 1 à 2 ordres de grandeur plus efficace en matière de formation que des modèles similaires tout en conservant la meilleure qualité de données synthétiques. Cela permet de réaliser la formation et la génération de millions d'enregistrements en quelques minutes, même dans un environnement gourmand en CPU, non pas en compressant la taille du modèle, mais en optimisant l'efficacité de calcul de l'algorithme de formation.
Prise en charge multimodèle flexible : L'ARGN tabulaire est utilisé pour les données tabulaires, la correspondance DNN est utilisée pour les relations graphiques et le LSTM de base (LSTMFromScratch-3m) ou tout modèle AutoModelForCausalLM sur Hugging Face Hub affiné peut être utilisé pour les données texte. Cette stratégie de superposition garantit que les différents types de données utilisent la méthode de génération la plus appropriée.
Assurance qualité intégrée : chaque générateur généré est automatiquement accompagné du rapport Model Insight, qui fournit des rapports visuels sur les indicateurs de fidélité et de confidentialité. Évitez le surajustement et les fuites lors de la génération, plutôt que de les détecter par la suite.
Capacités d'échantillonnage avancées : prend en charge le suréchantillonnage de n'importe quelle quantité de données, la simulation conditionnelle basée sur n'importe quelle colonne (telle que « générer 10 000 enregistrements masculins de 24 ans »), l'équilibrage du poids des groupes sous-représentés, l'interpolation des données contextuelles, le contrôle de l'équité statistique et les contraintes des règles de régulation de la température. Ces capacités font des données synthétiques non seulement une « copie », mais une amélioration ciblée des données.
Confidentialité différentielle : une protection différentielle de la confidentialité peut être activée pendant la formation afin de fournir une garantie quantifiable du budget de confidentialité pour la publication des données.
Comment utiliser
SDK open source pour démarrer rapidement
# Installer
# pip install -U 'mostlyai[local]'
à partir de mostai.sdk importer MostlyAI
#Initialiser le SDK (mode LOCAL)
principalement = SurtoutAI()
# 1. Importer un générateur pré-entraîné à partir d'un fichier
g = most.generators.import_from_file(
"https://github.com/mostly-ai/public-demo-data/raw/dev/census/census-generator.zip"
)
# 2. La détection génère 1000 échantillons représentatifs
df = principalement.probe(g, taille=1000)
# 3. Générer en fonction de valeurs de colonne fixes
df = most.probe(g, seed=[{"age": 24, "sex": "Male"}] * 10_000)
# 4. Entraînez votre propre générateur
importer des pandas en tant que PD
original_df = pd.read_csv(
"https://github.com/mostly-ai/public-demo-data/raw/dev/titanic/titanic.csv"
)
g = most.train(name="Démo Titanic", data=original_df)
# 5. Afficher le rapport de qualité
g.reports(display=True)
# 6. Générer un ensemble de données synthétiques
sd = principalement.generate(g)
df = sd.data()
Plateforme d'entreprise
La Data Intelligence Platform est accessible via un navigateur et fournit :
- Connexion à la source de données : connexion directe aux plateformes de données telles que Databricks, Snowflake et Postgres
- AI Assistant : requête et analyse en langage naturel
- Collaboration de projet : les équipes partagent des générateurs, des ensembles de données et des rapports d'analyse
- Déploiement sécurisé : prend en charge le déploiement privatisé Kubernetes/OpenShift
Trois modes de fonctionnement
| Mode | Méthode d'installation | Scénarios applicables |
|---|---|---|
| LOCAL (par défaut) | mostlyai[local] (y compris PyTorch) |
Développement local, expérimentations personnelles, contexte hors ligne |
| CLIENT | mostlyai (léger) |
Se connecter au point de terminaison du SDK distant |
| Docker | Construction du fichier Docker | Intégration CI/CD en contexte isolé |
Prix des produits
La plupart du temps, l'IA adopte un modèle de tarification hybride open source + plate-forme d'entreprise :
- SDK Open Source : entièrement gratuit, sous licence Apache 2.0. Peut être utilisé localement pour une utilisation illimitée sans limitations fonctionnelles.
- Enterprise Data Intelligence Platform : Facturé sur la base d'un déploiement privé ou d'un abonnement SaaS. Le prix spécifique n'a pas été divulgué, veuillez contacter Syntho Business (info@syntho.ai) pour un devis. Les facteurs de tarification incluent le volume de données, le nombre d'utilisateurs, les nœuds de déploiement et le niveau de support.
- Mode CLIENT : la consommation des ressources de la plateforme est impliquée lors de la connexion aux points de terminaison distants, et la méthode de facturation n'est pas divulguée.
Remarque : Après l'acquisition de Syntho en juin 2026, la feuille de route produit et la stratégie tarifaire peuvent être ajustées, veuillez vous référer à la page officielle en temps réel.
Scénarios d'application
-
Développement et formation IA/ML : générez des données de formation haute fidélité pour les modèles d'apprentissage automatique, résolvant ainsi les problèmes de rareté des données réelles, d'étiquettes déséquilibrées ou de confidentialité limitée. Il peut suréchantillonner les populations sous-représentées et corriger les biais des données. Conseils de mise en œuvre : utilisez d'abord un petit échantillon pour effectuer un entraînement progressif Crawl/Walk/Run, puis développez-le après avoir vérifié la qualité de la génération.
-
Données de test et assurance qualité : générez des données de test structurées réalistes pour le contexte de développement/test/pré-version, éliminant ainsi le risque de fuite d'informations sensibles sur les données de production. Convient aux tests d'intégration, aux tests de résistance et à l'acceptation de bout en bout. Conseils de mise en œuvre : Les données simulées conviennent aux scénarios sans exigences statistiques strictes, et les données synthétiques conviennent aux scénarios qui nécessitent une distribution de données réelles.
-
Partage de données et collaboration : générez des ensembles de données synthétiques garantissant la confidentialité et partagez des données entre équipes et organisations sans exposer les informations personnelles. Prend en charge la collaboration sécurisée des données dans le contexte d’une salle blanche. Conseil de mise en œuvre : L'activation de la fonction de confidentialité différentielle peut fournir une protection quantifiable de la confidentialité et convient aux scénarios d'audit de conformité.
-
Affichage de démonstration et de prototype : générez des ensembles de données réalistes mais non sensibles pour les démonstrations commerciales, les prototypes de produits et les preuves de concept afin d'accélérer les cycles de communication et de retour d'information avec les clients.
-
Amélioration des données et correction des biais : Complétez les cas limites ou les groupes sous-représentés sur la base des données originales pour améliorer la capacité de généralisation et l'équité du modèle.
Personnes concernées
-
Data Scientists et ML Engineers : utilisez le SDK pour générer des données synthétiques de haute qualité directement dans votre flux de travail Python, sans quitter l'environnement Notebook. Convient aux équipes qui ont besoin d’itérer fréquemment les données d’entraînement.
-
Data Engineers et DevOps : utilisez le mode Docker ou CLI pour intégrer la génération de données synthétiques dans les pipelines CI/CD afin de provisionner automatiquement les données de sécurité pour les contextes de test. Ne convient pas aux scénarios en temps réel qui imposent des exigences extrêmes en matière de délai de génération de données.
-
Analystes commerciaux et équipes de conformité : explorez les données en langage naturel avec l'assistant IA de la plateforme pour obtenir des informations analytiques sans écrire de code. Ne convient pas aux scénarios nécessitant une personnalisation approfondie des modèles générés.
-
Enterprise Data Platform Teams : les organisations qui ont besoin de partager des données entre équipes mais qui sont contraintes par le respect de la confidentialité peuvent utiliser Mostly AI pour créer un bac à sable de données synthétiques. Condition préalable : des capacités d'exploitation et de maintenance de Kubernetes sont requises.
-
Ne s'applique pas aux personnes :
- Scénarios nécessitant des données synthétiques non structurées telles que des images, de l'audio et de la vidéo (l'IA se concentre principalement sur les tableaux et le texte)
- Scénarios avec des exigences extrêmes en temps réel (niveau inférieur à la seconde) pour les données générées
- Scénarios qui ne nécessitent pas d'authenticité statistique et nécessitent uniquement des données d'espace réservé complètement aléatoires (l'outil de simulation de règles est plus léger)
Résumé et Outlook
La principale compétitivité d'AI réside principalement dans l'efficacité et la stratégie open source de l'architecture TabularARGN - c'est l'une des rares plates-formes de données synthétiques qui fournit des licences Apache 2.0 et a une efficacité de formation de 1 à 2 ordres de grandeur supérieure à celle des produits concurrents. Des cas d'entreprises, de la Poste Suisse à JPMorgan, ont vérifié sa capacité à s'implanter dans des secteurs hautement réglementés tels que la finance, les télécommunications et les soins médicaux.
Limites et incertitudes actuelles :
- Après son acquisition par Syntho en juin 2026, l'orientation de l'intégration des produits, la stratégie de marque et le modèle de tarification pourraient changer. Les entreprises doivent prêter attention aux annonces de produits ultérieures de Syntho avant d'acheter.
- Le prix de la plateforme d'entreprise n'est pas public. Vous devez contacter l'entreprise pour obtenir un devis contractuel. Il est difficile de comparer directement le coût des produits concurrents.
- La génération de données textuelles repose sur le modèle Hugging Face, et le déploiement dans des environnements hors ligne/air-gappés nécessite des étapes de transmission manuelle supplémentaires du modèle.
- Les données non structurées telles que les images/audio/vidéos ne sont pas prises en charge.
Évaluation des risques d'achat/d'adoption : Avant d'acheter la plateforme Mostly AI, les entreprises doivent se concentrer sur la vérification : ① La stratégie open source du SDK existant après l'acquisition de Syntho (s'il existe des risques de source fermée) ; ② Le coût de déploiement réel et les ressources minimales requises pour la version entreprise ; ③ La qualité de la génération de données multilingues telles que le chinois ; ④ Certification de conformité pour un déploiement privatisé (telle que SOC2, conformité RGPD). Il est recommandé d'utiliser d'abord le SDK open source pour effectuer un POC afin de vérifier la qualité de la production, puis de mener des négociations commerciales pour la version entreprise après avoir confirmé qu'elle répond aux besoins de l'entreprise.
Informations de version
- SDK version 6.1.1 :Moteur mis à jour 2.6.1 et QA 1.10.6, fichiers de verrouillage Dependabot mis à niveau.
- SDK version 6.1.0 :Moteur mis à jour 2.6.0 et QA 1.10.5.
- SDK version 6.0.0 :Refactorisation native du SDK, supprimant les interfaces de plate-forme uniquement et les connecteurs Hive/Databricks/Redshift.
- SDK version 5.10.0 :Introduire les contraintes de règles métier (Inequality et FixedCombinations), mettre à niveau le moteur 2.4 et PyTorch 2.9.1.
- SDK version 5.9.0 :Ajout de la prise en charge de l'intégration OAuth2.
- Version open source initiale :La première version open source du SDK est basée sur l'architecture TabularARGN et prend en charge la génération de données synthétiques à table unique/multi-table. Il n’y a pas encore de date officielle précise.
Avis des utilisateurs