Boussole ouverte Gratuit

-

OpenCompass (Sinan) est un système d'évaluation open source lancé par le laboratoire d'intelligence artificielle de Shanghai, couvrant de grands scénarios d'évaluation des capacités de modèles tels que le langage général, la connaissance du sujet, la sécurité et la fiabilité, les agents et la multimodalité.

Boussole ouverte Interface du produit

OpenCompass

Paramètres et statistiques de base

Projets Informations
Catégorie de logiciels Plateforme d'évaluation de grands modèles/Cadre d'évaluation
Dernière version 0.5.2 (2026-02-14)
Licence Open Source Apache-2.0
Étoiles GitHub ~7 075
Fourches GitHub ~786
Taille de l'ensemble de données Plus de 100 ensembles de données d'évaluation
Établissement leader Laboratoire d'intelligence artificielle de Shanghai
Liste officielle https://opencompass.org.cn/
Méthode de déploiement Opération de cadre local + requête de liste publique

Le tableau ci-dessus est une spécification objective. Le nombre spécifique d'étoiles et d'ensembles de données est soumis à l'entrepôt officiel et à la page de classement en temps réel.

Reconnaissance des utilisateurs et du marché

Sensibilisez progressivement les utilisateurs sur le terrain et les capacités du produit sont utilisées par les créateurs de contenu et les équipes pour améliorer l'efficacité du travail. Certains utilisateurs de l'industrie l'ont intégré à leur flux de travail quotidien. Il est recommandé de se référer aux dernières divulgations officielles pour connaître les données spécifiques sur l’échelle des utilisateurs et le taux d’adoption par l’industrie.

Avantage de coût

  • C-side/Researcher : Le framework est entièrement open source et gratuit, et tous les processus d'évaluation peuvent être exécutés localement. Le coût principal provient de la puissance de calcul d’inférence auto-préparée.
  • Évaluation du développeur/API : prend en charge l'accès aux modèles d'API tiers pour l'évaluation. À l'heure actuelle, le coût dépend de la facturation des appels du modèle testé et OpenCompass lui-même ne facture aucun supplément.
  • Entreprise / Privatisation : Il peut être entièrement déployé sur l'intranet, et les modèles auto-développés peuvent être évalués à huis clos pour éviter d'exporter le modèle ou les données de test ; les coûts cachés sont principalement l’évaluation de la puissance de calcul et les investissements en maintenance technique.
  • Calibre de comparaison : par rapport à la création d'un ensemble auto-construit de scripts d'évaluation et d'ensembles de données de maintenance, OpenCompass réutilise des centaines de références publiques avec une configuration unifiée, réduisant considérablement le coût de création et de maintenance du système d'évaluation.

Fonctions principales

  • Évaluation des capacités multidimensionnelles : couvre les dimensions objectives des capacités telles que le langage général, la connaissance de la matière, le raisonnement mathématique et logique, la génération de code et le contexte long.
  • Évaluation subjective et multimodale : fournit un lien d'évaluation de question subjective basé sur la notation du modèle et étend les capacités d'évaluation aux scénarios multimodaux et d'agent.
  • Adaptation étendue du modèle : prend en charge à la fois le cadre d'inférence local et les modèles d'API distants, couvrant les familles de modèles grand public telles que Llama, Qwen, GLM, Mistral, GPT et Claude.
  • Système de configuration reproductible : utilisez des fichiers de configuration pour décrire les modèles, les ensembles de données et les méthodes d'évaluation afin de garantir que les résultats peuvent être reproduits par d'autres avec le même calibre.
  • Liste publique : le système d'évaluation et la liste de domaines du site « Sinan » sont ouverts au monde extérieur, y compris des catégories verticales telles que l'intelligence scientifique, la sécurité et les systèmes informatiques intelligents incarnés d'IA.

Evolution du modèle et de la version

OpenCompass utilise le squelette « 0.x » pour itérer en continu, et le rythme des versions est promu autour des deux axes principaux de « couverture d'évaluation » et de « stabilité de reproduction ».

Reconstruction du système de configuration (0.5.0)

0.5.0 reconstruit le système de configuration de l'évaluation, unifie l'entrée d'évaluation pour les questions objectives et subjectives et ajoute plusieurs ensembles de références de sujet et de raisonnement. Il s’agit d’un élément clé de l’expansion des capacités d’évaluation au cours de la dernière année.

Convergence de stabilité et de compatibilité (0.5.1.post1)

0.5.1.post1 se concentre sur la résolution des problèmes de compatibilité entre la planification des tâches et le chargement des ensembles de données, et améliore les ensembles d'évaluation de contexte long et de capacité de code pour rendre les évaluations par lots à grande échelle plus stables.

Extensions subjectives et multimodales (0.5.2)

La dernière version 0.5.2 étend les liens d'évaluation subjective et d'évaluation multimodale, complète la configuration d'évaluation standardisée des modèles traditionnels récents et optimise le raisonnement distribué et la reproduction des résultats. La première version 0.4.2 a jeté les bases d’une adaptation approfondie du backend du modèle.

Avantages techniques

  • Calibre unifié pour réduire les biais d'évaluation : tous les modèles s'exécutent sous le même ensemble d'ensembles de données, d'invites et de règles de notation, ce qui rend les comparaisons horizontales plus crédibles et évite la confusion de calibre selon laquelle "chacun exécute son propre benchmark".
  • Configuration signifie évaluation, forte reproductibilité : Le processus d'évaluation est entièrement décrit par le fichier de configuration, et d'autres peuvent reproduire les résultats avec les mêmes paramètres. C’est la source fondamentale de la crédibilité de l’évaluation.
  • Découplage backend, forte scalabilité : le backend d'inférence du modèle est séparé de la logique d'évaluation. Lors de l'ajout d'un nouveau framework local ou d'un modèle d'API, il vous suffit d'ajouter une couche d'adaptation pour faciliter l'inclusion rapide de nouveaux modèles.
  • Planification distribuée, échelle contrôlable : prend en charge la segmentation des tâches et le raisonnement distribué, de sorte que l'évaluation par lots de centaines d'ensembles de données puisse être effectuée dans un délai contrôlable. L'ampleur de sa propre puissance de calcul doit être évaluée lors de sa mise en œuvre.

Comment utiliser

  1. Clonez le référentiel open-compass/opencompass depuis GitHub et installez les dépendances pour préparer le contexte de raisonnement requis pour l'évaluation.
  2. Sélectionnez ou écrivez un fichier de configuration pour spécifier la combinaison du modèle testé (framework local ou API) et l'ensemble de données cible.
  3. Exécutez la tâche d'évaluation. Le framework complète le raisonnement, la notation et la synthèse selon la configuration. Lors de la mise en œuvre, vous devez faire attention aux paramètres de consommation d’énergie de calcul et de simultanéité des tâches.
  4. Consultez le rapport d'évaluation généré et comparez les performances du modèle d'analyse dans chaque dimension de capacité avec un calibre unifié.
  5. Si vous avez besoin d'une référence publique, vous pouvez vérifier les résultats d'évaluation sur le terrain publiés dans le système sur le site de liste « Sinan ».

Prix des produits

Le modèle de tarification est soumis à la page officielle en temps réel. Habituellement, un système freemium ou d'abonnement est utilisé et les fonctions de base peuvent être utilisées gratuitement. Les fonctions avancées ou l'utilisation à haute fréquence nécessitent des abonnements payants, et il est conseillé aux utilisateurs d'évaluer la solution optimale en fonction de l'utilisation réelle.

Scénarios d'application

  • Évaluation R&D du modèle : l'équipe du modèle continue de suivre les changements de capacités au cours du processus d'itération et utilise un calibre unifié pour vérifier si les améliorations sont réelles et efficaces.
  • Évaluation de la sélection et de l'approvisionnement : avant d'introduire des modèles externes, les entreprises utilisent des critères de référence cohérents pour comparer horizontalement le sujet, le raisonnement et les capacités de codage des modèles candidats.
  • Sécurité et évaluation verticale : Avec l'aide de la sécurité du système « Sinan » et des systèmes informatiques intelligents incarnés par l'IA, des évaluations spéciales pour des scénarios spécifiques sont effectuées.
  • Reproduction de recherche universitaire : les chercheurs réutilisent la configuration publique pour reproduire les résultats de l'évaluation dans l'article, ou ajoutent des références dans un cadre unifié pour mener des expériences contrôlées.

Personnes concernées

  • Équipe R&D grand modèle : une base d'évaluation interne reproductible et comparable horizontalement est nécessaire.
  • Ingénieur de sélection et de plate-forme IA : effectuez des évaluations de capacités et des décisions d'achat parmi plusieurs modèles.
  • Évaluateurs de sécurité et de conformité : concentrez-vous sur l'évaluation des capacités spéciales dans les domaines de la sécurité, de la fiabilité et des verticaux.
  • Chercheurs universitaires : Mener des recherches sur les méthodes d'évaluation, l'expansion des références et la réplication des résultats.
  • Limite inappropriée : si vous n'avez besoin que d'un test unique, léger et rapide d'un seul modèle, ou si vous manquez de puissance de calcul d'inférence et de capacités de maintenance technique, l'investissement dans la création d'un processus d'évaluation complet peut être lourd ; ces besoins sont plus appropriés pour se référer directement aux résultats de la liste publique.

Résumé et Outlook

Elle propose des solutions compétitives dans son domaine et sa valeur fondamentale réside dans l’abaissement du seuil d’utilisation de l’IA dans ce domaine.

Limites actuelles : Certaines fonctionnalités avancées nécessitent un abonnement payant et la version gratuite comporte des restrictions de fonction ou d'utilisation ; les détails techniques spécifiques et les critères de performance n’ont pas encore été entièrement divulgués.

Outils associés : Visage câlin, replicate

Qu'est-ce qu'OpenCompass

OpenCompass (nom chinois « Si Nan ») est un système d'évaluation de grands modèles open source dirigé par le laboratoire d'intelligence artificielle de Shanghai. Il organise l'évaluation des capacités de grands modèles de langage à partir de tests dispersés en un seul point en un ensemble de processus standardisés couvrant le langage général, les connaissances disciplinaires, le raisonnement mathématique, la capacité de codage, la sécurité et la fiabilité, les agents et la multimodalité. Le projet est open source sur GitHub sous le protocole Apache-2.0 et est équipé d'un site de liste d'évaluation ouverte opencompass.org.cn.

Il ne se positionne pas comme « un autre script d'analyse comparative », mais comme une infrastructure d'évaluation ouverte pour l'ère de l'intelligence artificielle générale : les chercheurs peuvent utiliser le même ensemble de configurations pour reproduire les résultats d'autres personnes, les entreprises peuvent exécuter des indicateurs horizontalement comparables sur leurs propres modèles, et la communauté peut obtenir un calibre cohérent de référence de capacités via des listes publiques.

Comparaison des produits concurrents

Dimensions de comparaison Boussole Ouverte Concurrent A Concurrent B
Différences fondamentales
Prix ​​
Utilisateurs cibles

Remarque : la comparaison ci-dessus est basée sur les informations publiques sur le produit et les différences réelles sont basées sur l'expérience utilisateur.

Avantages techniques et limites des capacités

En tant que modèle d'IA et produit API, les capacités de base d'OpenCompass peuvent être profondément comprises à travers les dimensions suivantes, qui affectent directement la sélection technologique et les effets de mise en œuvre.

Performances d'inférence et performances de référence Les performances de raisonnement du modèle se reflètent dans ses performances sur les tâches standards de PNL (génération de texte, complétion de code, compréhension sémantique, dialogue multi-tours, extraction d’informations, etc.). Il est recommandé d'effectuer une comparaison horizontale via des listes de tests de référence publiques (telles que MMLU, HumanEval, GSM8K, etc.), mais veuillez noter qu'il peut y avoir un écart entre les résultats des tests de référence et les performances réelles des scénarios commerciaux. Les indicateurs clés qui affectent l'expérience utilisateur réelle comprennent : la vitesse d'inférence (jeton/s ou délai de réponse, qui détermine directement la fluidité de l'expérience utilisateur), la longueur de la fenêtre contextuelle (qui détermine la taille d'entrée pouvant être traitée à la fois, affectant la complexité des tâches pouvant être traitées) et la cohérence de la qualité de sortie (la stabilité des résultats de plusieurs sorties de la même entrée, ce qui affecte la perception de la fiabilité).

Compatibilité API et écosystème de développement La profondeur de la compatibilité des API avec les frameworks de développement traditionnels (LangChain, LlamaIndex, Semantic Kernel, etc.) affecte directement le coût et le cycle de développement intégré. Il est recommandé de prêter attention aux dimensions d'intégration suivantes : la couverture des types de langage pris en charge par le SDK (si les langages grand public tels que Python, JavaScript, Go et Java ont des SDK officiels), la prise en charge de la sortie de streaming (compatibilité du protocole SSE/WebSocket), les capacités d'appel de fonction et d'utilisation des outils (s'il prend en charge la sortie du modèle de mappage vers les appels de fonction structurés), la flexibilité de la sortie structurée (mode JSON) et la capacité d'intégration avec l'infrastructure au niveau de l'entreprise (déploiement VPC, lien privé, authentification d'identité unifiée). Une documentation complète de l'API et des exemples de code riches peuvent réduire considérablement les barrières d'entrée au développement et réduire le temps et les coûts d'intégration.

Flexibilité de déploiement et compromis en termes de coûts En fonction des exigences de confidentialité des données, de la sensibilité de la latence et de l'échelle d'utilisation, OpenCompass peut choisir entre des appels d'API cloud ou des options de déploiement sur site. Les avantages du déploiement cloud sont l'absence de coûts d'exploitation et de maintenance et une évolutivité élastique, adaptée aux scénarios avec de grandes fluctuations d'utilisation et un développement rapide de prototypes ; le déploiement local offre une souveraineté complète des données et une faible latence (pas de surcharge du réseau aller-retour), mais vous devez supporter le coût d'achat du matériel tel que les GPU et la main d'œuvre d'exploitation et de maintenance. Il est recommandé d'utiliser un volume d'appels API mensuel de 1 million de fois ou des frais mensuels de 1 000 $ US comme ligne de démarcation de référence : en dessous de ce seuil, les API cloud ont une meilleure rentabilité et flexibilité. Après avoir dépassé ce seuil, le coût total de possession de la solution d'auto-déploiement doit être évalué de manière globale, en tenant compte de facteurs tels que la dépréciation du matériel, l'électricité, la main d'œuvre d'exploitation et de maintenance, etc.

Sélection du modèle et stratégie de version

Pour la sélection des modèles de la série OpenCompass, il est recommandé de faire correspondre les capacités des modèles des différentes versions en fonction de scénarios d'utilisation spécifiques. La version à grands paramètres est plus performante sur les raisonnements complexes et les tâches en plusieurs étapes, mais entraîne des coûts plus élevés et des délais plus longs ; la version à petits paramètres peut déjà fournir une qualité de sortie satisfaisante dans des scénarios tels que des conversations quotidiennes et de simples questions et réponses, et le coût ne représente qu'une fraction de celui de la grande version. La stratégie de sélection recommandée est la suivante : utilisez des versions petites et moyennes dans des scénarios standard pour réduire les coûts, et n'appelez des modèles de versions volumineuses que lorsque des tâches d'inférence complexes doivent être traitées. Cette stratégie d'appel hiérarchique peut réduire le coût global de l'API de 40 à 60 % sans affecter de manière significative la qualité du résultat.

Informations de version

  • OpenCompass 0.5.2 :Développez les liens d'évaluation subjective et d'évaluation multimodale, complétez la configuration d'évaluation standardisée des modèles traditionnels récents et optimisez la stabilité du raisonnement distribué et de la reproduction des résultats.
  • OpenCompass 0.5.1.post1 :Correction des problèmes de compatibilité entre la planification des tâches d'évaluation et le chargement des ensembles de données, et amélioration des ensembles d'évaluation de contexte long et de capacité de code.
  • OpenCompass 0.5.0 :Reconstruisez le système de configuration de l'évaluation, unifiez l'entrée de l'évaluation pour les questions objectives et subjectives et ajoutez plusieurs ensembles de références de sujets et de raisonnement.
  • OpenCompass 0.4.2 :Étendez la portée de l'adaptation backend du modèle pour couvrir davantage de modèles d'API et de cadres de raisonnement locaux, et améliorez l'exportation des rapports d'évaluation.

Avis des utilisateurs

  • Chargement des avis...