Tuyau ouvert

-

OpenPipe est une plateforme destinée aux développeurs et aux équipes d'applications d'IA. Ses documents publics couvrent les ensembles de données, le réglage fin du DPO, les critères d'évaluation, les complétions de chat, la mise en cache, le déploiement et l'accès aux modèles externes ; son projet ART étend la formation d'apprentissage par renforcement des agents à des tâches réelles en plusieurs étapes.

Tuyau ouvert Interface du produit

OpenPipe

Paramètres et statistiques de base

La forme de produit public d'OpenPipe peut être divisée en deux lignes principales : l'une est une plate-forme gérée de réglage fin et d'évaluation LLM, qui fonctionne autour des ensembles de données, des tâches de formation, des tables d'évaluation et du déploiement d'inférence ; l'autre est ART, ou Agent Reinforcement Trainer, qui étend la formation d'apprentissage par renforcement à un flux de travail d'agent en plusieurs étapes. Selon la page officielle et le positionnement du document, il est plus approprié d'être classé dans la catégorie de formation de modèles plutôt que dans un outil de traitement de données pan-data.

Projet Informations publiques actuelles
Entrée officielle https://openpipe.ai/
Saisie des documents https://docs.openpipe.ai/
Classement formation-modèle-IA
Principales capacités Réglage fin, DPO, évaluations, critères, complétion de chat, mise en cache, déploiements, modèles externes
Capacités de formation des agents ART utilise GRPO pour former des agents en plusieurs étapes, prenant en charge des itinéraires modèles tels que Qwen, GPT-OSS et Llama
Formulaire de plateforme API de console Web, projet de formation open source officiel
E-mail de contact public bonjour@openpipe.ai
Statistiques du dépôt public ART Environ 10 150 étoiles, 906 forks, licence Apache-2.0

Limite de positionnement : la valeur d'OpenPipe ne réside pas dans le remplacement des services de modèles généraux, mais dans la transformation des journaux commerciaux existants, des échantillons étiquetés, des données de préférence et des normes d'évaluation en actifs de modèles pouvant être entraînés, comparables et en ligne. Pour les équipes qui n’ont besoin d’appeler qu’une seule fois les grands modèles, son système de formation et d’évaluation semblera trop lourd.

Reconnaissance des utilisateurs et du marché

La reconnaissance d'OpenPipe vient principalement de la scène des développeurs et de l'écosystème du code public. La description publique de l'entrepôt ART est « Agent Reinforcement Trainer », et elle place clairement des mots-clés tels que GRPO, multi-step Agent, Qwen, GPT-OSS, Llama, etc. dans le positionnement du projet ; cela montre qu'il ne sert pas les frontaux de chat ordinaires, mais espère continuer à former des échantillons d'agents ayant échoué à des tâches réelles dans des équipes d'ingénierie dotées de capacités améliorées.

Signal du développeur : le référentiel public ART affiche environ 10 150 étoiles, 906 forks, le langage par défaut est Python, la licence est Apache-2.0 et le thème couvre agent, agentic-ai, grpo, llms, lora, qwen, renforce-learning, rl. Cette échelle montre qu'OpenPipe a attiré une forte attention des développeurs en direction de la formation d'apprentissage par renforcement des agents, mais le nombre d'entreprises clientes, les revenus et l'échelle de paiement n'ont pas été divulgués.

Signal produit : la navigation de gauche du document officiel couvre le réglage fin, le DPO, les évaluations, les critères, les achèvements de chat, la mise en cache, les déploiements et les modèles externes, ce qui montre qu'OpenPipe n'est pas un script de formation en un seul point, mais regroupe les données, la formation, l'évaluation, l'inférence et l'accès aux modèles externes dans un seul package.

Avantage de coût

L'avantage en termes de coût d'OpenPipe vient de sa méthode de facturation qui est « divisée par échelle de formation, jeton d'inférence ou unité de calcul ». Au lieu de passer directement à un contrat d'entreprise personnalisé pendant la phase pilote, les équipes peuvent d'abord estimer les coûts de formation par catégorie de modèle, puis choisir le mode par jeton ou par unité de calcul en fonction du volume d'inférence.

C-side/Personal : OpenPipe n'est pas une application gratuite pour le chat personnel ordinaire. La page de tarification publique est principalement destinée aux développeurs et aux organisations pour former et déployer des modèles. Les développeurs individuels peuvent expérimenter via le Web et l'API, mais le coût dépend de la quantité de données de formation, du type de modèle et de l'utilisation de l'inférence.

Développeur/API : la formation est facturée en fonction de la taille du modèle et du numéro de jeton de l'ensemble de données ; L'inférence gérée peut être facturée par jeton ou par heures CU. Lorsqu'un modèle tiers est affiné par OpenPipe, les instructions officielles n'ajoutent pas de majoration supplémentaire, et l'appel et les coûts sont supportés par les tarifs standard du fournisseur de modèle correspondant.

Entreprise/Privé : les forfaits Entreprise couvrent des remises sur volume, des options de déploiement sur site, une assistance dédiée, des SLA personnalisés, des fonctionnalités de sécurité avancées et un stockage de données accru. Les SLA de contrat spécifiques et les limites de déploiement nécessitent une confirmation commerciale.

Objets de facturation Méthode de facturation publique officielle Prix ​​public/limite
Formation 8B et inférieure Appuyez sur 1 million de jetons 0,48 $
Formation modèles 14B Appuyez sur 1 million de jetons 1,50 $
Formation modèles 32B Appuyez sur 1 million de jetons 1,90 $
Formation des modèles 70B+ Appuyez sur 1 million de jetons 2,90 $
Inférence hébergée Llama 3.1 8B Instruct Jetons d'entrée/sortie 1M 0,30 $ / 0,45 $
Inférence hébergée Llama 3.1 70B Instruct Jetons d'entrée/sortie 1 million 1,80 $ / 2,00 $
Unité de calcul Par heure CU 8B/12B équivaut à 1,50 $, 32B/14B équivaut à 6,00 $, 72B/70B équivaut à 12,00 $

Fonctions principales

  • Ensemble de données et entrée d'entraînement : la page de démarrage rapide de réglage fin vous oblige à créer d'abord un ensemble de données et à importer au moins 10 éléments de données d'entraînement ; par défaut, 10 % des données seront conservées comme ensemble de test pendant la formation pour évaluer la nouvelle sortie du modèle.
  • Gestion des tâches de réglage précis : le processus officiel comprend la sélection des données d'entraînement, le nom du modèle, l'ajustement des hyperparamètres, le démarrage de l'entraînement et la visualisation du modèle entraîné. Il convient à la conversion d'échantillons de production en versions de modèles réutilisables.
  • DPO et optimisation des préférences : la navigation officielle fournit séparément l'optimisation directe des préférences, ce qui convient aux scénarios dans lesquels vous disposez déjà d'échantillons de préférences et souhaitez rapprocher le modèle du jugement humain ou des normes commerciales.
  • Système d'évaluation : les évaluations prennent en charge les évaluations de code, les évaluations de critères et les évaluations face à face, qui correspondent respectivement aux tâches déterministes, aux tâches de texte libre et aux comparaisons rapides multimodèles.
  • Inférence et mise en cache : les achèvements de chat, la mise en cache, les déploiements et les modèles externes permettent au modèle formé d'entrer dans le lien d'inférence et de former une interface d'appel unifiée avec les fournisseurs de modèles externes.
  • Apprentissage par renforcement des agents : ART utilise GRPO pour former des agents en plusieurs étapes, ce qui permet d'apprendre à partir de trajectoires d'exécution de tâches réelles, plutôt que de simplement affiner un seul cycle de résultats d'invite.

La clé pour combiner ces fonctions est de collecter d'abord les données et les journaux, puis de former le modèle, puis d'utiliser la table d'évaluation pour juger de la qualité de la sortie et enfin de la déployer sur le lien d'inférence. Même si une équipe qui manque de critères d'évaluation termine sa formation, il sera difficile de juger si le modèle est vraiment meilleur que le modèle de base.

Evolution du modèle et de la version

OpenPipe n'affiche pas uniformément les numéros de version sémantiques sur le site officiel comme les logiciels traditionnels, il est donc plus approprié d'utiliser les jalons publics du produit pour décrire l'évolution. Le titre actuel du site officiel indique « RL For Agents », indiquant que le récit du produit a été encore élargi depuis la première plate-forme de réglage fin jusqu'à la formation d'apprentissage par renforcement des agents ; le document officiel conserve toujours les capacités de réglage fin, de DPO, d'évaluation et d'hébergement d'inférence.

Phases Version/Jalon Dates Signification publique
Plateforme de réglage fin Plateforme de réglage fin OpenPipe ~2024-09 Une plateforme de formation gérée avec des ensembles de données, des tâches de formation, le déploiement et l'évaluation de modèles comme noyau, pas encore de date de sortie officielle précise
Projet public ART Open Pipe ART 2025-03-10 Création d'un entrepôt public officiel, positionné comme Agent Renforcement Formateur
Positionnement actuel du site officiel OpenPipe RL pour les agents ~2026-06 Le titre du site officiel montre RL For Agents, le récit du produit se concentre sur la formation d'apprentissage par renforcement des agents, il n'y a pas encore de date de sortie officielle précise

Jugement de version : pour les environnements de production, la « version » d'OpenPipe doit être acceptée en fonction des capacités et des dépendances de déploiement, plutôt que de simplement examiner le numéro de version. Les liens de réglage fin, d'évaluation, d'hébergement d'inférence et de formation ART impliquent différents contextes opérationnels, et les pilotes nécessitent des ensembles de données fixes, des modèles de base, des normes d'évaluation et des calibres de coûts d'inférence.

Avantages techniques

Aucun mécanisme de formation : OpenPipe place les ensembles de données, les réglages fins, les évaluations et les déploiements dans le même ensemble de documents et de chemins de produits. Mécaniquement, les données de formation entrent d'abord dans l'ensemble de données, puis forment une tâche de formation, puis utilisent l'ensemble de test et les règles d'évaluation pour comparer les résultats ; en effet, l’équipe peut voir plus clairement si le modèle s’est réellement amélioré ; les scénarios applicables sont des tâches telles que la classification, l'extraction, le service client, la synthèse et la génération de code qui ont des échantillons et des critères d'évaluation stables.

Modes d'évaluation multiples : les évaluations de code conviennent aux résultats déterministes, les évaluations de critères conviennent au texte libre et les évaluations face-à-face conviennent aux comparaisons rapides entre plusieurs modèles. Mécaniquement, il divise le jugement subjectif de « bien paraître » en différentes méthodes d'évaluation ; en effet, cela réduit la zone aveugle avant la mise en ligne du modèle ; le scénario applicable est une équipe de développement qui doit comparer en permanence le modèle de base, le modèle de réglage fin et le modèle externe.

Parcours d'apprentissage par renforcement des agents : ART est orienté vers les agents en plusieurs étapes et propose une formation sur le terrain via GRPO. Mécaniquement, il se concentre sur les trajectoires d’exécution des tâches et les signaux de récompense ; en effet, l'objectif de formation est plus proche de l'achèvement réel du travail ; les scénarios applicables sont les appels d'outils, les tâches à lien long, les agents de code et les systèmes automatisés qui nécessitent des stratégies d'amélioration continue.

Comment utiliser

Le chemin vers l’utilisation d’OpenPipe commence généralement par l’ensemble de données plutôt que par les paramètres du modèle. L'équipe de développement organise d'abord les journaux ou les échantillons étiquetés en entrées de formation, accède à la console Web ou à l'API pour créer un ensemble de données ; sélectionne ensuite le modèle de base, nomme le modèle, définit les hyperparamètres et démarre la formation. Une fois la formation terminée, utilisez l'ensemble de test par défaut ou la tâche d'évaluation personnalisée pour vérifier les différences de sortie, et enfin connectez le modèle qualifié aux achèvements de conversation ou au lien de déploiement.

Chemin de la console Web : convient pour une vérification rapide par de petites équipes, en se concentrant sur la question de savoir si le format des données de formation, l'ensemble de tests par défaut, la sélection des hyperparamètres et le tableau d'évaluation peuvent couvrir les tâches commerciales.

Chemin API : convient pour relier les journaux de production, les plateformes d'annotation et les processus d'évaluation CI. Le principe du chemin API est que l'équipe dispose d'un flux de données stable et de critères d'évaluation clairs, sinon la formation automatisée ne fera qu'amplifier le bruit des données.

Chemin ART : adapté aux équipes d'agents, combinant le processus d'exécution de tâches réel, les signaux de récompense et l'itération de stratégie de modèle. Il est plus proche d'un cadre de formation en ingénierie et nécessite généralement que les développeurs comprennent l'apprentissage par renforcement, les contextes d'exécution de modèles et les mesures d'évaluation.

Prix des produits

La page de tarification publique d'OpenPipe répartit les coûts en formation, inférence hébergée, modèles tiers et plans d'entreprise. Les frais de formation sont calculés en fonction de la catégorie du modèle et du nombre de jetons d'ensemble de données ; L'hébergement d'inférence propose deux méthodes : tarification par jeton et unités de calcul horaires ; il n'y a pas d'augmentation de prix supplémentaire lorsque les modèles tiers sont peaufinés via OpenPipe, et le fournisseur correspondant réglera la facture aux tarifs standards.

Frais de formation : 0,48 $/1 M de jetons pour les modèles 8 B et moins, 1,50 $/1 M de jetons pour les modèles 14B, 1,90 $/1 M de jetons pour les modèles 32B, 2,90 $/1 M de jetons pour les modèles 70B+. Plus les données de formation et le modèle sont volumineux, plus le coût total de formation est élevé.

Frais d'inférence : les modèles à volume élevé conviennent à la tarification par jeton ; les modèles expérimentaux ou à faible volume conviennent à l'heure CU. Une unité de calcul déclare officiellement qu'elle peut gérer jusqu'à 24 requêtes simultanées par seconde et rester disponible pendant 60 secondes après des pics de trafic.

Frais Entreprise : les forfaits Entreprise nécessitent de contacter hello@openpipe.ai pour confirmer le déploiement sur site, le SLA à prix réduit, l'assistance, les fonctionnalités de sécurité et les conditions de stockage des données.

Scénarios d'application

  • Modèle de texte de service client et d'opération : organisez l'historique des bons de travail, les réponses manuelles et les normes d'inspection qualité dans des ensembles de formation, et réduisez les erreurs de formatage et les écarts de ton grâce à un réglage précis ; l'objectif de l'acceptation est le taux d'erreur, le taux de retouche manuelle et le taux de réussite des tâches d'évaluation.
  • Extraction et classification d'informations : les évaluations de code conviennent aux tâches déterministes telles que l'extraction structurée, la classification d'étiquettes et la normalisation de champ ; l'objectif de l'acceptation est l'exactitude, le rappel et les performances des échantillons limites.
  • Évaluation et routage multimodèles : les évaluations directes peuvent être utilisées pour comparer des modèles de base, des modèles affinés et des modèles externes afin de déterminer quelles tâches valent la peine d'être entreprises avec des modèles plus petits et quelles tâches sont réservées à des modèles plus puissants.
  • Apprentissage par renforcement des agents : ART convient à la formation d'agents en plusieurs étapes, telles que l'invocation d'outils, les tâches de code, l'exécution après récupération et l'automatisation du flux de travail ; l'objectif d'acceptation est le taux d'achèvement des tâches, la capacité de reprise après incident et le coût unitaire des tâches.

OpenPipe est plus adapté aux équipes qui « disposent déjà de données et de critères d'évaluation ». Si les tâches métier n'ont pas été définies de manière stable, il est plus important de mettre en place d'abord des normes de gouvernance et d'évaluation des données plutôt que de former directement le modèle.

Personnes concernées

  • Équipe de développement d'applications IA : nécessité de convertir les journaux de production en données de réglage fin et de déterminer si le modèle vaut la peine d'être lancé via le processus d'évaluation.
  • Équipe plateforme et MLOps : nécessité de gérer de manière uniforme la formation, l'hébergement d'inférences, les modèles externes et les normes d'évaluation, en mettant l'accent sur le coût, la qualité et la traçabilité.
  • Équipe d'ingénierie des agents : il est nécessaire d'utiliser des méthodes d'apprentissage par renforcement telles que GRPO pour former des agents en plusieurs étapes, en se concentrant sur l'achèvement réel des tâches plutôt que sur les scores de texte en un seul tour.
  • Leader de l'annotation et de l'évaluation des données : Les normes artificielles doivent être transformées en critères, codes ou évaluations face-à-face réutilisables.

Les scénarios qui ne conviennent pas incluent : il n'y a pas de données de formation, pas de normes d'évaluation, seule une entrée de chat commune est nécessaire, ou l'équipe ne peut pas se permettre le coût de la formation, du déploiement et de la maintenance du modèle. À ce stade, il est souvent plus simple d’utiliser directement l’API du modèle générique.

Résumé et Outlook

La compétence principale d'OpenPipe est de regrouper la formation au réglage fin du LLM, à l'évaluation, à l'hébergement d'inférences et à l'apprentissage par renforcement des agents dans le même parcours d'ingénierie. Il ne s'agit pas d'un produit de chat destiné au public, mais d'une plate-forme destinée aux développeurs qui souhaitent utiliser les données pour améliorer continuellement les performances des modèles ; Lorsque l'équipe a accumulé des journaux de production, des échantillons étiquetés et des critères d'évaluation clairs, OpenPipe peut transformer « si le modèle s'améliore » d'un jugement sensoriel en un processus évaluable.

Les limites actuelles sont également très claires : les informations publiques ne divulguent pas le nombre complet de clients, les revenus, les détails du contrat d'entreprise et toutes les dates de version historiques ; bien que l'ART retienne une attention active, la formation d'apprentissage par renforcement elle-même a des exigences élevées en matière de données, de conception de récompense et de contexte d'ingénierie. Lorsque les entreprises le mettent en œuvre, il est recommandé de sélectionner d'abord une tâche pilote à haute fréquence, clairement délimitée et quantifiable, puis de l'étendre à davantage de secteurs d'activité après avoir confirmé les coûts de formation, les avantages de l'évaluation, les délais d'inférence et les conditions de sécurité des données.

Outils associés : Visage câlin, replicate

Informations de version

  • OpenPipe RL pour les agents :Le titre du site officiel montre publiquement qu'OpenPipe est actuellement positionné comme RL For Agents, et le document officiel conserve également les capacités de réglage fin du DPO, de l'évaluation, de l'hébergement d'inférence et de l'accès aux modèles externes ; il n’y a pas encore de date de sortie officielle précise.
  • Plateforme de réglage fin OpenPipe :Le document officiel divulgue la forme de la plate-forme de réglage fin du modèle, couvrant l'importation d'ensembles de données, la formation, l'ajustement des hyperparamètres, le déploiement du modèle et l'évaluation une fois la formation terminée ; il n’y a pas de date de sortie officielle officielle.
  • OuvrirPipeART :Le référentiel ART officiel a été créé le 10/03/2025 et est décrit comme Agent Reinforcement Trainer, qui utilise la formation GRPO pour les tâches d'agent en plusieurs étapes.

Avis des utilisateurs

  • Chargement des avis...