Ouvrir l'Assistant
Gratuit
Open Assistant est un projet de conversation d'IA open source piloté par la communauté et lancé par LAION, qui collecte des données de conversation multilingues et forme des modèles de discussion open source via le crowdsourcing.
Ouvrir l'Assistant
Paramètres et statistiques de base
Open Assistant (OA) est un projet de dialogue sur l'IA open source piloté par la communauté et initié par LAION. Le projet lui-même a été officiellement annoncé comme achevé en octobre 2023. Sa valeur fondamentale ne réside pas dans l'exploitation d'un service de chat en ligne en continu, mais dans la production de l'un des ensembles de données participatives les plus influents dans le domaine de l'IA conversationnelle open source - oasst2, ainsi qu'une infrastructure complète pour la collecte de données conversationnelles, l'annotation et la formation de modèles.
| Projets | Informations publiques |
|---|---|
| Positionnement officiel | "OpenAssistant est un assistant basé sur le chat qui comprend les tâches, peut interagir avec des systèmes tiers et récupérer des informations de manière dynamique" |
| Statut du projet | Terminé (annoncé le 2023-10-25) |
| Ensemble de données final | oasst2 (publié par HuggingFace) |
| Licence Open Source | Apache-2.0 |
| Étoiles GitHub | 37,4k |
| Fourches GitHub | 3,3k |
| Contributeurs | 304 personnes |
| Versions publiées | 127 (dernière v0.0.4-alpha2, 2023-11-26) |
| Langues principales | Python (71,5%), TypeScript (27,1%) |
| Langues couvertes | Anglais, chinois, allemand, français, espagnol, japonais et des dizaines d'autres langues |
| Plateforme d'assistance | Internet |
Cycle de vie du projet : OA sera lancé de fin 2022 jusqu'à son achèvement en octobre 2023, avec un cycle de vie de base d'environ 12 mois. Cette fenêtre étroite a produit plus de 37 000 étoiles GitHub et 127 versions, reflétant la capacité de la communauté open source à collaborer efficacement dans le cadre d'objectifs ciblés. Une fois le projet terminé, l'équipe OA recommande clairement aux utilisateurs d'utiliser l'ensemble de données oasst2 et les projets ultérieurs dérivés de la communauté.
Taille de l'ensemble de données : oasst2 est actuellement l'un des plus grands ensembles de données de dialogue multilingues open source, couvrant les structures de dialogue arborescentes dans des dizaines de langues. Chaque conversation contient des invites, plusieurs séries de réponses et des annotations de préférences humaines, qui peuvent être directement utilisées pour la formation de réglage fin supervisé (SFT) et de modèle de récompense (RM). La conception de l'ensemble de données suit le processus en trois étapes de l'article InstructGPT (SFT → Preference Sampling → RLHF), avec l'intention de répliquer le pipeline de données de ChatGPT.
Différences de positionnement par rapport à des projets similaires : OA ne compare pas complètement les produits de chat commerciaux, mais se concentre sur la production disciplinée de données - il n'offre pas "une meilleure expérience de chat", mais "des données ouvertes de haute qualité qui peuvent être utilisées pour former des modèles de chat". Ce positionnement détermine que ses utilisateurs ne sont pas des consommateurs ordinaires, mais des chercheurs en IA et des formateurs de modèles.
Reconnaissance des utilisateurs et du marché d'Open Assistant
La reconnaissance du marché de l'OA est emblématique dans la communauté mondiale de l'IA open source, qui se reflète à trois niveaux : la participation communautaire, l'impact académique et les projets dérivés.
Popularité de la communauté GitHub : 37,4 000 étoiles, 3,3 000 Forks, 304 contributeurs, 127 versions - ces chiffres se situent au plus haut niveau parmi les projets open source d'IA en 2023. En particulier, les 304 contributeurs directs au code (à l'exclusion des bénévoles qui ont uniquement participé à l'annotation des données) reflètent que le projet a franchi le stade du prototype de recherche pure et a formé un pipeline de contributions externes durable. Cependant, il convient de noter que la croissance de Star après la fin du projet provient principalement du trafic d'accès de la « marque d'archives » et n'est pas un signe de développement actif.
Influence de l'ensemble de données HuggingFace : les téléchargements de l'ensemble de données oasst2 sur HuggingFace continuent de croître et sont largement utilisés comme base de formation pour les modèles de dialogue multilingues. De nombreux projets open source ultérieurs (tels que OpenAssistantGPT, modèles de réglage fin dérivés d'OASST2) s'appuient directement sur cet ensemble de données, formant un écosystème à partir de données OA.
Citations académiques et références industrielles : la méthodologie de collecte de données et l'architecture de la plateforme d'OA ont été citées dans plusieurs articles de l'ACL et de l'EMNLP, en particulier dans les domaines de la collecte de données de conversation à faible coût et de l'alignement multilingue. Son modèle d'annotation « crowdsourcing + qualité grading » a été adopté par des projets ultérieurs (tels que les stratégies de collecte de données de Dolly et ShareGPT).
Goulot d'étranglement dans la mise en œuvre de l'industrie : La nature du projet OA détermine qu'il ne dispose pas des indicateurs de reconnaissance du marché des produits commerciaux. Il n'y a pas de numéros de clients d'entreprises publiques, de chiffres de revenus ou d'engagements SLA. Dans les équipes professionnelles d'IA, l'OA est considérée comme une « ressource de recherche » plutôt qu'un « outil de production » : il existe un écart d'un ordre de grandeur entre les performances du modèle et les produits fermés de la même période, et son utilisation directe dans des scénarios clients nécessite beaucoup de réglage fin et d'alignement de sécurité.
Avantages financiers d'Open Assistant
L'avantage en termes de coût de l'OA ne se reflète pas dans le fait d'être « moins cher que les produits concurrents », mais dans la production de données de conversation vérifiables et de haute qualité dans un modèle à budget nul - c'est sa différence fondamentale par rapport à tous les projets commerciaux d'IA.
Côté/individuel : entièrement gratuit, seuil zéro : la plateforme Web d'OA, les ensembles de données et les pondérations des modèles sont gratuits et ouverts à tous les utilisateurs, et peuvent être téléchargés et utilisés sans inscription. Les utilisateurs individuels peuvent directement participer à l'annotation des données (complétées) ou télécharger des ensembles de données complétés pour la recherche sur la plateforme OA.
Développeur/API : aucune API commerciale, les modèles doivent être auto-déployés : OA ne fournit pas de services API commerciaux. Les utilisateurs doivent télécharger les poids du modèle depuis HuggingFace et les déployer sur leur propre GPU. En prenant comme exemple le modèle de base Pythia d'OA 1.0 (environ 6,9B de paramètres), une seule carte A100-40G peut exécuter l'inférence, mais le débit et la latence ne peuvent pas répondre aux exigences de niveau de production. Si une inférence de performances plus élevées est requise, il est recommandé de se référer aux modèles ultérieurs dérivés de la communauté ou d'utiliser des alternatives avec une meilleure optimisation du modèle.
Entreprise/Privé : Licence Open Source, coût de licence nul : Tous les poids de modèle d'OA sont publiés sous la licence Apache-2.0, et les entreprises peuvent librement utiliser, modifier et distribuer dans le cadre de la licence sans payer de frais de licence. Mais veuillez noter : OA ne fournit aucune assistance, mise à jour de sécurité ou certification de conformité au niveau de l'entreprise, et les entreprises doivent évaluer leurs propres responsabilités en matière de confidentialité des données et de conformité en matière de sécurité lors de la sélection.
Coûts cachés : les coûts cachés liés à l'utilisation des modèles et des données OA se reflètent principalement dans trois aspects : premièrement, les performances du modèle sont bien inférieures à celles des produits commerciaux, et un investissement important en ingénierie (ingénierie rapide, réglage fin, alignement) est nécessaire pour les tâches complexes pour atteindre des niveaux utilisables ; deuxièmement, la qualité des ensembles de données OA repose sur les contributions des bénévoles, et il existe des problèmes de fluctuations de cohérence des étiquettes et de couverture linguistique inégale, nécessitant un filtrage supplémentaire pour une utilisation en aval ; troisièmement, le projet est terminé et il n'y aura pas de mises à jour officielles ni de correctifs de sécurité.
Principales fonctions d'Open Assistant
Le système fonctionnel d'OA est conçu autour de l'objectif d'un « pipeline de données GPT open source ». Il ne s'agit pas d'un produit de chat destiné aux utilisateurs finaux, mais d'une infrastructure de production de données pour les chercheurs en IA et les formateurs de modèles.
-
Plateforme de collecte de données de dialogue participative : le produit principal d'OA est une application Web. Les bénévoles peuvent créer des invites de dialogue (invites), rédiger des réponses (réponses), prioriser plusieurs réponses (classement) et annoter des labels de qualité (étiquetage) sur la plateforme. L'ensemble du processus imite le pipeline de collecte de données décrit dans l'article InstructGPT. Tâches applicables : accumulez rapidement des données de dialogue multilingues et multi-scénarios et abaissez le seuil de formation du modèle de dialogue.
-
Structure de dialogue arborescente (Thread/Tree) : le modèle de données d'OA est organisé dans une structure arborescente : une invite initiale peut dériver plusieurs branches de réponse, et chaque branche peut continuer à approfondir le dialogue pendant plusieurs tours. Cette structure est plus riche qu'un simple format « paire de questions et réponses » et prend en charge des modèles de formation pour comprendre le contexte de la conversation et les choix de branchement. Valeur applicable : fournissez des données de formation pour des modèles de dialogue plus proches des scénarios d'interaction réels.
-
Évaluation de la qualité et annotation des préférences : les bénévoles écrivent non seulement les réponses, mais notent et trient également plusieurs réponses sous la même invite. Ces données de préférence sont directement utilisées pour entraîner le modèle de récompense (Reward Model) et constituent un élément clé du processus RLHF. Valeur applicable : injectez des préférences humaines dans le modèle pour rendre le résultat du modèle plus cohérent avec les attentes des utilisateurs.
-
Couverture multilingue : la plateforme OA prend en charge la collecte de données de conversation dans des dizaines de langues. Le frontal de la plateforme, l'interface d'annotation et les guides sont tous disponibles en plusieurs langues, réduisant ainsi la barrière à l'entrée pour les contributeurs non anglophones. L’ensemble de données oasst2 qui en résulte est l’un des plus grands ensembles de données de conversation accessibles au public dans la couverture linguistique autre que l’anglais. Valeur applicable : elle comble l'écart du modèle économique en matière de données de conversation linguistique à faibles ressources.
-
Publication de poids de modèle open source : OA a formé et publié plusieurs versions de poids de modèle basées sur les données collectées, y compris des modèles SFT basés sur LLaMA et Pythia (oasst-sft) et des modèles d'optimisation des préférences basés sur RLHF (oasst-rlhf). Tous droits réservés sur HuggingFace sous la licence Apache-2.0. Valeur applicable : fournit à la communauté open source une implémentation de référence complète et reproductible de « des données au modèle ».
Evolution du modèle et de la version d'Open Assistant
L'évolution de la version d'OA peut être résumée comme "compacte, transparente et finale". Le projet a publié 127 versions au cours d'une période active d'environ 12 mois, culminant avec l'ensemble de données et le modèle oasst2.
Prototype et version anticipée (2022-12 à 2023-03)
- Version Proto (~2022-12) : Preuve de concept initiale, l'équipe principale construit un processus de collecte de données de base pour vérifier la faisabilité du modèle de crowdsourcing. Le code utilise le backend Python (FastAPI) + le frontend TypeScript (Next.js).
- v0.0.1-alpha (~2023-02) : première version Alpha, la plateforme prend en charge les fonctions de base de collecte de données et d'annotation et est ouverte à une participation limitée des utilisateurs de test.
Bêta publique et extension à grande échelle (2023-03 à 2023-06)
- v0.0.2-alpha (~2023-05) : les fonctions de la plate-forme ont été considérablement améliorées, prenant en charge l'intégration de Discord Bot, l'interface multilingue et l'exportation de données. Les contributeurs de la communauté sont rapidement passés à plus de 100 personnes. À ce stade, le premier lot de collecte de données à grande échelle a été achevé, avec un volume de données dépassant les 100 000 conversations.
- Extension multilingue (2023-06) : prise en charge centralisée de la collecte de données dans des langues autres que l'anglais et la traduction de l'interface de la plateforme couvre des dizaines de langues. Les volontaires peuvent participer à l'annotation dans leur langue maternelle.
Version finale et achèvement du projet (2023-06 à 2023-11)
- v0.0.3-alpha (~2023-08) : le pipeline de formation de modèles est officiellement publié, la formation SFT et RLHF sur les modèles de base LLaMA et Pythia est terminée et les poids oasst-sft et oasst-rlhf sont générés.
- v0.0.4-alpha2 (2023-11-26, version finale) : La dernière version officiellement publiée par le projet, qui intègre tous les correctifs et optimisations avant l'achèvement du projet.
- Annonce d'achèvement du projet (2023-10-25) : LAION a officiellement annoncé l'achèvement du projet Open Assistant. Le principal livrable est l’ensemble de données oasst2. Il est recommandé à la communauté de se tourner vers des projets dérivés ultérieurs et vers l'utilisation ultérieure d'oasst2.
Inspiration des versions
La version d'OA ne porte pas sur « le nombre de fonctions », mais sur « l'exhaustivité du processus » : la première version vérifie la faisabilité de la collecte de données, la version à mi-parcours étend l'échelle et la couverture linguistique, et la version finale fournit un ensemble de données et un modèle complets. Cette version rythmée par la sortie de données comme jalon a une valeur de référence pour les projets de données open source.
Avantages techniques d'Open Assistant
L'avantage technique de l'OA ne réside pas dans l'architecture innovante du modèle sous-jacent (le modèle est affiné sur la base de LLaMA/Pythia), mais dans la qualité de conception du pipeline de données de crowdsourcing et l'évolutivité du projet d'annotation multilingue.
Conception de bout en bout du pipeline de données de crowdsourcing : l'ensemble de la plateforme OA réalise une automatisation complète des liens depuis l'enregistrement → l'attribution des tâches → la création de conversations → la rédaction de réponses → l'annotation hiérarchique → l'examen de la qualité → l'exportation de l'ensemble de données. Cette conception de pipeline fait référence à la méthodologie de collecte de données d'InstructGPT, mais il ne s'agit pas d'un simple « questionnaire en ligne », mais d'un système technique qui comprend un contrôle de la qualité, une vérification de la cohérence et des mécanismes anti-abus. L'effet technique direct est le suivant : sans une équipe opérationnelle à temps plein, le projet a accumulé des centaines de milliers de données de conversations multilingues de qualité en 12 mois.
Implémentation technique de la structure de conversation arborescente : le modèle de données d'OA utilise une structure arborescente au lieu de paires de questions et réponses plates, ce qui augmente la complexité de la conception de la base de données back-end (PostgreSQL + requête arborescente), de l'interaction frontale (expansion/effondrement de l'arbre) et de la formation du modèle (sérialisation basée sur l'arborescence). Mais cette conception confère aux données une valeur de formation plus élevée que de simples paires de questions et réponses : le modèle peut apprendre les directions potentielles des branches de conversation et la diversité des intentions des utilisateurs.
Architecture évolutive pour l'annotation multilingue : la plate-forme OA utilise le framework i18n pour obtenir une multilinguisation frontale complète, et les contributeurs non anglophones peuvent participer dans leur langue maternelle. Le modèle de données back-end prend en charge les balises de langue et les annotations mixtes multilingues. Il s'agit d'une décision architecturale importante pour la communauté open source : la plupart des plateformes de données commerciales ont un investissement limité dans la couverture linguistique autre que l'anglais, tandis que l'OA produit des ensembles de données multilingues représentatifs à un coût contrôlable grâce au crowdsourcing et aux interfaces multilingues.
Mécanisme de crowdsourcing pour le contrôle qualité : OA ne se contente pas de « collecter du contenu », mais intègre plusieurs niveaux de contrôle qualité dans le processus d'annotation : chaque tâche d'annotation est effectuée par plusieurs bénévoles indépendants, les annotations peu cohérentes déclencheront un examen et les contributions malveillantes ou de spam seront signalées et supprimées par la communauté. Ce mécanisme s’appuie sur l’expérience de gouvernance communautaire de Wikipédia, mais la cohérence de la qualité des données d’OA est toujours limitée par les différences de niveaux professionnels des bénévoles – un problème commun à tous les projets de crowdsourcing.
Limites des données et limitations structurelles : les données OA couvrent uniquement les scénarios de conversation (invite + réponse + classement) et ne couvrent pas les données structurées (tableaux, enregistrements de base de données), le traitement au niveau du document (PDF, résumés de texte longs) ou le contenu image/multimodal. Pour les scénarios dans lesquels les données d'IA doivent être utilisées en dehors des conversations, la couverture de données d'un seul scénario d'OA n'est pas suffisante et doit être combinée avec d'autres ensembles de données (tels que ShareGPT, Dolly, Alpaca).
Points douloureux du rappel et de la découvrabilité : la densité d'annotation effective de l'ensemble de données OA dans les requêtes mixtes multilingues et les domaines à forte intensité de terminologie professionnelle est nettement inférieure à celle du domaine des conversations générales. Par exemple, dans les scénarios conversationnels qui nécessitent des connaissances dans un domaine tel que la médecine, le droit ou l’ingénierie, la qualité des annotateurs issus du crowdsourcing est difficile à garantir. Il est recommandé que les modèles en aval formés à l'aide des données OA soient utilisés conjointement avec le réglage fin spécifique au domaine, plutôt que de s'appuyer directement sur les données OA pour couvrir l'expertise à longue traîne.
Conformité en matière de sécurité : les ensembles de données OA sont rendus publics sous la licence Apache-2.0 et ne contiennent aucun processus de nettoyage automatisé des informations personnellement identifiables (PII), mais pas de RBAC (contrôle d'accès basé sur les rôles) ni d'isolation des autorisations au niveau du document. L'ensemble de données n'a aucune restriction d'accès géographique et peut être téléchargé par les utilisateurs du monde entier. Toutes les données sont utilisées pour former des modèles open source et ne seront pas utilisées pour la formation secondaire de modèles commerciaux fermés. Le projet OA lui-même n’implique pas de certification de conformité RGPD ou SOC2.
Comment utiliser Open Assistant
L'utilisation de l'OA est divisée en trois chemins différents : les utilisateurs de données, les utilisateurs de modèles et les reproducteurs de plateforme :
| Comment utiliser | Convient aux personnes | Caractéristiques | Coût |
|---|---|---|---|
| Télécharger l'ensemble de données oasst2 | Chercheurs en IA, formateurs de modèles | Téléchargement direct HuggingFace pour la formation SFT/RM | Entièrement gratuit |
| Télécharger les poids des modèles | Développeurs, utilisateurs auto-déployants | HuggingFace obtient des pondérations et doit gérer vous-même le contexte d'inférence | Gratuit + frais GPU |
| Démo de chat Web | Avis utilisateur | Essayez la conversation sur chat.open-assistant.io (Archivé) | Gratuit |
| Construction de plateforme de recherche | Équipe/organisation | Utilisez Docker pour démarrer la pile back-end complète (pour le développement uniquement), des capacités techniques sont requises | Coûts d'infrastructure |
| Contribuer des données (fermé) | Bénévole | Projet terminé, nouvelles contributions de données arrêtées | — |
Parcours d'expérience rapide : Visitez la page de l'ensemble de données HuggingFace OpenAssistant/oasst2 pour télécharger directement l'ensemble de données (format Parquet) sans inscription. Chargez à l'aide de la bibliothèque HuggingFace Datasets :
à partir des ensembles de données importer load_dataset
dataset = load_dataset("OpenAssistant/oasst2", split="train")
# L'ensemble de données contient des champs tels que message_id, parent_id, rôle, texte, langue, classement, etc.
Exemple d'inférence de modèle : obtenez le modèle OpenAssistant/oasst-sft sur HuggingFace et utilisez la bibliothèque Transformers pour charger l'inférence. Il convient de noter que le modèle OA est basé sur l'architecture LLaMA/Pythia antérieure, et que la vitesse et la qualité d'inférence sont différentes des modèles traditionnels actuels. Il est recommandé de l'utiliser en comprenant ses limites.
Développement auto-hébergé avec contexte : Le projet d'origine fournit une configuration Docker Compose, qui peut démarrer la pile complète (front-end + back-end + base de données) localement. La commande Docker est docker compose --profile ci up --build --attach-dependencies et accédez à http://localhost:3000 après le démarrage. Cependant, le projet OA est terminé, le code n'est plus maintenu et le déploiement lié à la production n'est pas recommandé.
Prix des produits pour Open Assistant
OA est un projet communautaire purement open source et ne dispose pas de système de tarification commercial. Tous les actifs (données, code, poids des modèles) sont ouverts sous la licence Apache-2.0, sans restrictions d'enregistrement, sans paywalls et sans hiérarchisation Freemium.
Côté C/Individuel : Aucun coût d'utilisation. Les ensembles de données et les poids des modèles sont disponibles en téléchargement direct, et l'interface de discussion en ligne (archivée) est gratuite. Les contributeurs individuels n'ont pas besoin de payer pendant la période d'annotation, mais ils ne reçoivent plus de retours financiers directs.
Développeurs/API : Aucun service API officiel. Les développeurs doivent obtenir le modèle auprès de HuggingFace et le déployer dans leur propre environnement. Le coût d'inférence dépend de la configuration matérielle : un A100-40G peut exécuter des modèles OA 1.0, mais avec un débit limité. Si vous avez besoin de services d'inférence au niveau de la production, il est recommandé d'utiliser des versions ou des modèles commerciaux optimisés pour la communauté ultérieurs.
Entreprise/Institution : gratuit pour une utilisation sous la licence Apache-2.0. Les entreprises peuvent directement utiliser des ensembles de données OA pour la formation de modèles dans le cadre de la licence. Mais OA ne fournit pas de SLA, de support technique, de correctifs de sécurité ou d'engagements de conformité au RGPD. Les entreprises doivent procéder à un examen juridique avant de l'utiliser pour confirmer la compatibilité de la licence Apache-2.0 avec le scénario commercial.
Scénarios d'application d'Open Assistant
La valeur ajoutée du libre accès est concentrée dans des scénarios qui « nécessitent des données de dialogue ouvertes » plutôt que « qui nécessitent la meilleure expérience de dialogue ».
-
Source de données de formation pour les modèles de dialogue open source : l'ensemble de données oasst2 est largement utilisé comme données de formation multilingues pour les modèles de dialogue, en particulier les scénarios de dialogue dans des langues autres que l'anglais. oasst2 est probablement le plus grand ensemble de données de formation à la conversation publique pour les langues à faibles ressources (par exemple, l'allemand, le français, l'espagnol). Conseils de mise en œuvre : La cohérence des annotations d'oasst2 varie selon la langue - les données en anglais ont la cohérence la plus élevée et la qualité des annotations des langues de niche varie considérablement. Il est recommandé d'effectuer un filtrage de qualité par groupe de langues avant utilisation.
-
Éducation et référence pour le processus RLHF : Le projet OA implémente entièrement le pipeline en trois étapes d'InstructGPT (SFT → Preference Sampling → RLHF), et sa base de code, son ensemble de données et ses poids de modèle peuvent être utilisés comme référence complète pour l'enseignement et la pratique du RLHF. Conseils de mise en œuvre : La valeur de référence de mise en œuvre technique d'OA est supérieure à la valeur d'utilisation du produit. Il est recommandé aux apprenants en IA d'accorder plus d'attention à la conception de son processus d'annotation de données plutôt qu'à l'utilisation directe de son modèle.
-
Recherche et analyse comparative en PNL multilingue : la couverture multilingue d'oasst2 en fait une source de données de référence pour évaluer les capacités multilingues des modèles conversationnels. Les chercheurs peuvent utiliser l’ensemble de tests oasst2 pour évaluer les performances de leurs modèles sur le dialogue multilingue. Conseil de mise en œuvre : la période d'étiquetage de l'ensemble de données (2023) est antérieure à la période de développement rapide de la plupart des grands modèles. Lorsqu’elles sont utilisées comme référence, la fenêtre temporelle des données doit être notée.
-
Architecture de référence pour la protection de la confidentialité des données : le modèle de données OA open source auto-hébergé peut fournir une référence sur « comment créer un processus de collecte de données qui ne repose pas sur des API sources fermées » pour les organisations et les institutions qui exigent la souveraineté des données. Conseils de mise en œuvre : L'architecture d'OA est précoce et non maintenue. Il est plus efficace de se référer à son concept de conception plutôt qu’à l’implémentation du code.
Groupes applicables d'Open Assistant
Le positionnement d’OA détermine que ses principaux utilisateurs sont des chercheurs en IA et des formateurs de modèles, plutôt que des utilisateurs ordinaires à la recherche de la meilleure expérience de chat.
-
Chercheurs en IA et étudiants en PNL : comprenez l'ensemble du processus « des données de crowdsourcing aux modèles de conversation » via les ensembles de données et les bibliothèques de codes d'OA. Limite inappropriée : si la recherche se concentre sur la dernière architecture après 2025 (MoE, attention éparse, contexte long), la pile technologique de l'OA est trop ancienne et a une valeur de référence limitée.
-
Open Source Model Trainer : utilisez l'ensemble de données oasst2 comme données de formation au dialogue multilingue, ou effectuez un réglage précis des instructions et un alignement des préférences sur la base du modèle OA. Limite d'inadaptation : si l'objectif d'entraînement est la meilleure performance de référence, le plafond de performance du modèle OA est faible et il est recommandé d'utiliser uniquement son ensemble de données au lieu des pondérations du modèle.
-
Développeur NLP en langage à faibles ressources : la couverture de données multilingues d'OA est une source importante de données de conversation dans d'autres langues que l'anglais, particulièrement adaptée aux équipes qui ont besoin de données de conversation en allemand, français, espagnol, japonais et d'autres langues. Ne convient pas aux frontières : La qualité de la couverture des données d'OA pour les conversations en chinois n'est pas aussi bonne que celle de l'anglais et de l'allemand. Il est recommandé d'utiliser des ensembles de données natifs chinois (tels que BELLE, Firefly) pour les tâches chinoises.
-
Institution d'enseignement et de formation en IA : La mise en œuvre technique de l'OA (front-end et back-end, modèle de données, pipeline de formation) est un cas d'enseignement complet pour « l'ingénierie des données » et la « pratique RLHF » dans le cours d'IA. Ne convient pas aux limites : la base de code d'OA est basée sur la pile technologique de 2023, et certaines dépendances et API sont obsolètes. Veuillez prêter attention aux instructions de compatibilité des versions lors de l'enseignement.
Résumé et Outlook
Open Assistant est un projet de nœud important dans le domaine du dialogue sur l'IA open source : il a utilisé la puissance de la communauté pour fournir le plus grand ensemble de données de dialogue multilingue et un pipeline de données complet en 2022-2023, lorsque ChatGPT a déclenché l'engouement pour l'IA conversationnelle. Le projet a complété le projet de zéro en données à modéliser en environ 12 mois d'activité, prouvant l'hypothèse selon laquelle « les organisations non commerciales peuvent également produire des données d'entraînement à la conversation utilisables ».
Contribution principale : l'ensemble de données oasst2 est l'atout le plus durable d'OA et est encore largement utilisé comme données de formation pour les modèles de dialogue multilingues. La méthodologie de collecte de données et d'annotation du projet a influencé plusieurs projets de données d'IA participatifs ultérieurs (Dolly, conception du processus de données de ShareGPT).
Limites actuelles : Le projet s'est officiellement terminé en octobre 2023 et le code n'est plus maintenu. Les performances du modèle sont en retard de 2 à 3 générations par rapport au niveau courant actuel. La cohérence de la qualité des ensembles de données varie selon la langue et le niveau de l'annotateur. L'ensemble de la pile technologique OA (Python 3.9, Next.js 13, premières versions de PyTorch) est partiellement obsolète et la réutilisation directe nécessite une adaptation.
Comparaison avec des projets similaires :
| Dimensions | Ouvrir l'Assistant | Chariot 2.0 | PartagerGPT | Alpaga |
|---|---|---|---|---|
| Source de données | Bénévoles participatifs | Interne aux Databricks | Téléchargements d'utilisateurs | Auto-instruction |
| Licence de données | Apache-2.0 | CC BY-SA 3.0 | Licence non commerciale | CC BY-NC 4.0 |
| Couverture multilingue | Des dizaines de langues | Anglais uniquement | Langues téléchargées par l'utilisateur | Anglais uniquement |
| Structure des données | Conversation sur les arbres | Paires de questions et réponses | Dialogues | Commande-réponse |
| Statut du projet | Terminé | Maintenance active | Opérations actives | Archivé |
| Données RLHF | Contient des annotations de préférences | Aucun | Aucun | Aucun |
| Licence modèle | Apache-2.0 | CC BY-SA 3.0 | Non Commercial | Non Commercial |
Points d'observation de suivi : Différenciation écologique après la fin de l'OA - les pratiques d'amélioration des données, de réglage fin du modèle et de déploiement basées sur oasst2 continueront d'évoluer dans la communauté ; si les projets dérivés de la communauté (tels que OpenAssistantGPT) peuvent créer davantage de produits techniques basés sur des données OA ; à mesure que les exigences en matière de données LLM évoluent, si des modèles de données similaires en crowdsourcing réapparaîtront dans le nouveau cycle technologique.
Évaluation des risques d'approvisionnement et d'adoption : OA ne convient pas pour remplacer les assistants d'IA de niveau production : les performances du modèle, l'alignement sécurisé et la prise en charge des mises à jour ne suffisent pas pour les exigences de production. Il est recommandé de positionner le libre accès comme une « ressource de recherche et d'apprentissage » plutôt que comme une « cible de déploiement ». Pour les entreprises qui ont besoin de modèles de dialogue de haute précision, il est recommandé d'utiliser l'ensemble de données OA comme l'une des sources de données de formation et d'affiner les modèles de base courants actuels (tels que LLaMA 3, DeepSeek, Qwen) au lieu d'utiliser directement les pondérations de modèle publiées par OA. Les chercheurs universitaires peuvent utiliser l’ensemble de données oasst2 (licence Apache-2.0) en toute confiance, mais doivent indiquer la fenêtre temporelle et la méthode d’annotation des données au moment de la publication. Les données multilingues d'OA constituent une source de données supplémentaire importante pour le développement de systèmes de dialogue dans les langues à faibles ressources, mais il est recommandé de les mélanger avec les données les plus récentes afin de combler les lacunes dans les domaines et les domaines temporels.
Outils associés :
Recherche profonde, ChatGPT
Informations de version
- Libre accès 2.0 :Il n’y a pas encore de date officielle précise ; basé sur le modèle de base amélioré, prise en charge multilingue améliorée.
- Libre accès 1.0 :Pas de date officielle précise pour l'instant ; première version publique, affinée sur la base des modèles Pythia et LLaMA.
Avis des utilisateurs