Entschlossene KI Kostenlos

-

Determined AI ist eine Open-Source-Deep-Learning-Trainingsplattform, die verteiltes Training, automatische Suche nach Superparametern, GPU-Cluster-Management und Experimentverfolgungsfunktionen bietet und PyTorch und TensorFlow unterstützt.

Entschlossene KI Produktoberfläche

EntschlosseneKI

Ermittelt die Kernparameter und Statistiken der KI

Determined AI positioniert sich als „Betriebssystem für Deep-Learning-Training“ und löst das schwierigste Problem der verteilten Orchestrierung im ML-Engineering: Wenn sich die Trainingsaufgabe von einer einzelnen Karte auf mehrere Knoten ausdehnt, sind Codeänderungskosten, Ressourcenwettbewerb und experimentelles Chaos für fast jedes Team zu einem unvermeidlichen Problem geworden. Determined fasst diese Probleme durch eine einheitliche Planungsebene zusammen, sodass sich Forscher nur auf das Modell selbst konzentrieren können.

Projekte Öffentliche Informationen
Offizielle Positionierung Open-Source-Deep-Learning-Schulungsplattform
Kernkompetenzen Verteiltes Training, Hyperparametersuche, Experimentverfolgung GPU-Clusterverwaltung
Unterstützte Frameworks PyTorch, TensorFlow, Keras (einschließlich KerasTuner)
Bereitstellungsmethode Selbstgehostet: Kubernetes, lokaler Agentencluster Slurm/PBS, AWS/GCP
Zugangsportal Web-Benutzeroberfläche, CLI („det“), Python SDK, REST-API
Open-Source-Lizenz Apache 2.0
Code-Repository GitHub „determined-ai/determined“ (3,2.000 Sterne, 372 Forks, 96 Mitwirkende)
Neueste Version v0.38.1 (20.03.2025)
Firmeneigentum HPE (Hewlett Packard Enterprise) – Akquisitionen 2021
Technologie-Stack Go (44,6 %) / Python (27,9 %) / TypeScript (24,4 %)

Ein kurzer Kommentar in einem Satz: Es handelt sich nicht um ein weiteres MLOps-Dashboard, sondern um eine Planungs-Engine, die das „Multi-Machine- und Multi-Card-Training“ von der manuellen Konfiguration zur deklarativen Übermittlung ändert. Der Kernwert besteht darin, dem Team die Möglichkeit zu geben, verteilte Schulungen zu absolvieren, ohne dabei die mentale Belastung zu tragen, Code für eine einzelne Maschine zu schreiben.

Hintergrund der HPE-Übernahme: Nach der Übernahme erhielt Determined Supportressourcen auf Unternehmensebene. Für die EE-Version (Enterprise Edition) war ab sofort ein Lizenzschlüssel erforderlich. Die OSS-Version und die EE-Version weisen funktionale Unterschiede bei Unternehmensfunktionen wie SSO und RBAC-Überwachung auf. Die Community muss darauf achten, ob die OSS-Version weiterhin Aktualisierungen der Kerntrainingsfunktionen in derselben Qualität wie die EE-Version erhält.

Benutzer und Marktanerkennung von Determined AI

GitHub-Community-Aktivität: Das Warehouse verfügt über 3,2.000 Sterne, 372 Forks, insgesamt 121 Veröffentlichungen (Stand 2026–07) und 96 Mitwirkende, was darauf hindeutet, dass das Projekt im Bereich der Open-Source-MLOps eine stabile Aufmerksamkeit genießt, aber noch nicht in die Super-Popular-Ränge vorgedrungen ist (ähnliche Projekte wie MLflow haben höhere Sterne).

Enterprise Adoption: HPE integriert Determined in seine KI-Infrastrukturlösungen für HPC-Kunden in den Bereichen Finanzen, Fertigung, wissenschaftliche Forschung und anderen Branchen. Öffentlich verfügbare Einführungsfälle werden von akademischen Einrichtungen und mittelgroßen ML-Teams dominiert, während die Anzahl der Bereitstellungen in großen Unternehmen nicht bekannt gegeben wird.

Branchen-Benchmarking: Im Vergleich zu Kubeflow (komplettes natives K8s-MLOps) und MLflow (voreingenommen auf experimentelles Tracking + Modellregistrierung) liegt der Hauptunterschied von Determined in der „Planung und Beschleunigung der Trainingsaufgabe selbst“ und nicht in der vollständigen Link-Orchestrierung. Im Teilbereich des verteilten Trainings ergänzt es Horovod (nur verteilte Kommunikationsschicht) und Weights & Biases (nur experimentelles Tracking) und konkurriert nicht direkt mit ihnen.

Vergleichsmaße Entschlossene KI Kubeflow MLflow Horovod
Positionierung Schulungsplanungsplattform Volllink-MLOps Experimentverfolgung + Modellregistrierung Verteilte Schulungskommunikationsbibliothek
Verteiltes Training Automatische Orchestrierung Manuelle Konfiguration erforderlich Nicht beteiligt Bereitstellung von Kommunikationsprimitiven
Hyperparametersuche Integriert (Gitter/Bayesian/ASHA) Muss Katib integrieren Nicht integriert Nicht beteiligt
Clusterplanung Integrierte Warteschlange + Kontingent K8s native Planung Nicht beteiligt Nicht beteiligt
Schwierigkeiten beim Einstieg Mittel (erfordert K8s-Grundkenntnisse) Hoch Niedrig Mittel

Kostenvorteile entschlossener KI

C-Seite/individuell

Die Open-Source-Version ist völlig kostenlos (Apache 2.0). Einzelpersonen können die CLI über „Pip Install Determined“ installieren und einen lokalen Cluster auf einem einzelnen Computer oder ihrer eigenen GPU bereitstellen. Es fallen keine Lizenzgebühren an, Sie müssen jedoch die Betriebskosten für die Wartung Ihres eigenen PostgreSQL + -Speicher-Backends tragen.

Entwickler/Team

Für die Open-Source-Version fallen keine Softwarelizenzgebühren an und Teams können sie nach Bedarf bereitstellen:

  • Lokaler Agent-Modus: Stellen Sie Master + Agent auf Bare-Metal oder VM bereit, geeignet für Teams mit vorhandenen GPU-Servern, mit geringer Betriebs- und Wartungskomplexität.
  • Kubernetes-Modus: Wird über Helm Chart bereitgestellt und eignet sich für Teams, die bereits über eine K8s-Infrastruktur verfügen, aber K8s-Verwaltungsfunktionen benötigen.
  • Cloud-Bereitstellung: „Deploy aws/gcp up“ Bereitstellung mit einem Klick, Bezahlung entsprechend der tatsächlichen Nutzung der Cloud-Ressourcen, keine zusätzlichen Lizenzgebühren.

Versteckte Kosten spiegeln sich hauptsächlich im Betriebs- und Wartungspersonal wider: PostgreSQL-Datenbankverwaltung, Speicherkonfiguration (S3/GCS/gemeinsames Dateisystem), Netzwerk- und Sicherheitsgruppenrichtlinien, Versionsaktualisierungen und -migrationen usw.

Unternehmen/Privatisierung

HPE bietet die Enterprise Edition an, die Folgendes umfasst:

  • SSO/SAML-Integration
  • Detailliertes RBAC-Berechtigungsaudit
  • Kommerzielles SLA und technischer Support – Vorintegrierte Validierung mit HPE-Hardware wie ProLiant-Servern Nimble-Speicher

Die Preise für die Enterprise Edition werden nicht bekannt gegeben. Bitte holen Sie ein Angebot über HPE Sales ein. Wichtige Bedingungen, die Sie vor dem Kauf überprüfen sollten: ob die Lizenz auf der Grundlage der Anzahl der Knoten/GPUs oder Benutzer abgerechnet wird, ob sie die produktionsgebundene SLA-Reaktionszeit, den Upgrade-Pfad und den Supportumfang für die Datenmigration umfasst.

Kostenhierarchie Kostenkomponenten Typische jährliche Kosten (Herleitung)
Einzelperson/Kleines Team (OSS) 0 Lizenzgebühr + Cloud-Host-/GPU-Gebühr 0 $ + On-Demand-Cloud-Ressourcen
Mittelgroßes Team (OSS + Eigenbetrieb und Wartung) 0 Lizenzgebühr + Betriebs- und Wartungspersonal (ca. 0,5–1 Personenmonat/Jahr) 5.000 bis 15.000 US-Dollar (Betriebs- und Wartungsumstellung)
Unternehmen (HPE EE) Lizenzgebühr + Supportvertrag + Hardware Geschäftsbestätigung erforderlich

Hauptfunktionen von Determined AI

  • Verteiltes Training ohne Modifikation: Benutzer müssen nur die Basisklasse „determined.pytorch.PyTorchTrial“ oder „determined.keras.KerasTrial“ im Trainingsskript verwenden, und die Plattform übernimmt automatisch die Gradientensynchronisierung (All-Reduce), das Daten-Sharding und die Knotenfehlertoleranz. Es ist nicht erforderlich, „torch.distributed.launch“ oder „tf.distribute.Strategy“ manuell zu schreiben, was die Eintrittsbarriere für verteiltes Training verringert.

    • Expertenmeinung: Der verborgene Vorteil dieser Abstraktionsschicht besteht darin, dass das Team direkt vom Einzelkarten-Prototyp zur Produktion mit mehreren Karten übergehen kann, ohne verteilte Logik in den Code einbetten zu müssen. Um die Anzahl der GPUs nachträglich zu erhöhen, müssen Sie lediglich „slots_per_trial“ in der YAML-Konfiguration ändern, ohne den Trainingscode zu ändern.
  • Adaptive Hyperparameter Search (ASHA): Basierend auf dem asynchronen sukzessiven Halbierungsalgorithmus werden Versuche mit geringem Potenzial zuerst eliminiert, wenn die Ressourcen begrenzt sind, und mehr Rechenleistung wird Parameterkombinationen mit hohem Potenzial zugewiesen. Unterstützt Early Stopping, Rastersuche und Bayes'sche Suche und kann den Suchraum während des Suchvorgangs dynamisch anpassen.

    • Expertenansicht: Die Zusammenarbeit zwischen ASHA und dem Plattformplaner ist der Hauptunterschied von Determined – der Suchalgorithmus kann nicht nur bestimmen, „was der nächste Parametersatz ist“, sondern kann über den Plattformplaner auch steuern, „welche Versuche vorgezogen werden können“, indem Suchversuche mit niedriger Priorität automatisch herabgestuft werden, wenn der Cluster voll ist, um zu vermeiden, dass Hyperparametersuchen formale Trainingsaufgaben blockieren.
  • GPU-Kontingent und Warteschlangenplanung: Unterstützt die Aufteilung des GPU-Kontingents nach Ressourcenpool (Ressourcenpool). Nachdem der Benutzer die Aufgabe über „det experiment create“ übermittelt hat, stellt die Plattform automatisch Slots in die Warteschlange, plant und weist sie zu. Unterstützt Priority Scheduler und Fair Scheduler, um zu verhindern, dass ein einzelner Benutzer den Cluster füllt.

    • Expertenansicht: Die Kombination aus Planer + Quote löst das typische Team-Dilemma „GPU-Leerlauf und Konkurrenz koexistieren“. Forscher müssen nicht mehr manuell aushandeln, wer die Karte wann verwenden wird, und die Plattform garantiert, dass eingereichte Aufgaben schließlich geplant werden – was die Koordinationskosten in einem Team mit mehr als 10 Personen erheblich reduzieren kann.
  • Experimentverfolgung und automatische Snapshots: Zeichnen Sie automatisch Indikatoren (Zeitreihen wie Verlust/Genauigkeit), Hyperparameterkonfiguration, vollständige Code-Snapshots (Git Commit + nicht verfolgte Dateien) und Modellgewichtungskontrollpunkte für jedes Training auf. Die Web-Benutzeroberfläche unterstützt den Vergleich und die Visualisierung mehrerer experimenteller Indikatoren, und Checkpoint kann das Training mit einem Klick fortsetzen oder fortsetzen.

    • Expertenansicht: Das automatische Abfangen von Code-Snapshots ist zuverlässiger als die manuelle Aufzeichnung – selbst wenn der Forscher vergisst, einen Commit durchzuführen, archiviert die Plattform den Quellcode beim Einreichen automatisch. Dies ist für die experimentelle Reproduzierbarkeit von entscheidender Bedeutung, insbesondere wenn sich mehrere Forscher einen Cluster teilen. „Mit welcher Version des Codes dieses Modell ausgeführt wurde“ ist kein Geheimnis mehr.
  • Notebook- und interaktive Aufgaben: Starten Sie Jupyter Notebook, TensorBoard oder Shell auf dem Cluster-GPU-Knoten und die Berechnungen werden direkt auf dem GPU-Knoten durchgeführt. Die Daten im Notebook und die Trainingsaufgaben teilen sich die gleiche Speicherschicht (gemeinsames Dateisystem oder Objektspeicher), was die direkte Übermittlung von Trainingsaufgaben nach der Datenvorverarbeitung erleichtert.

    • Expertenansicht: Notebook- und Trainingsaufgaben teilen sich den GPU-Pool, was bedeutet, dass auf derselben Karte Notebook und Training nicht gleichzeitig ausgeführt werden können. Es wird empfohlen, Notebooks auf Ressourcenpools mit niedriger Priorität zu beschränken oder kleine GPU-Pools zu trennen, um zu verhindern, dass interaktive Aufgaben Produktionsschulungsressourcen belegen.
  • DeepSpeed-Integration: Integrierte DeepSpeed-Unterstützung seit Version 0.17.0, ZeRO-Optimierung (Stufe 1/2/3) kann über die YAML-Konfiguration aktiviert werden, um die Grafikspeichernutzung in sehr großen Modelltrainingsszenarien zu reduzieren. Zusammen mit der automatischen Gradientensynchronisierung von Determined arbeiten der Kommunikationsmodus und der Plattformplaner von ZeRO zusammen.

  • Kern-API (Schnittstelle auf niedrigerer Ebene): Für fortgeschrittene Benutzer, die die Trial-Basisklasse nicht benötigen, stellt Determined die Kern-API bereit, die es Benutzern ermöglicht, Plattformfunktionen auf die am wenigsten aufdringliche Weise zu integrieren – verwenden Sie einfach „det.core.init()“, um den Kontext zum Aufzeichnen von Indikatoren und Speichern von Prüfpunkten zu erhalten, ohne eine Änderung der Trainingszyklusstruktur zu erzwingen. Dies ist besonders nützlich bei der Integration mit Trainingsbibliotheken von Drittanbietern wie Hugging Face Trainer.

Modell- und Versionsentwicklung von Determined AI

Determined übernimmt die zweigleisige Veröffentlichungsstrategie „OSS + EE“: Die OSS-Version folgt der semantischen Versionierung und die EE-Version hängt das Suffix „-ee“ nach der OSS-Versionsnummer an.

Mainline-Veröffentlichung

Versionsnummer Erscheinungsdatum Kernänderungen
v0.32.0 2026-05 (noch kein offizielles genaues Datum) Neueste Release-Version, einschließlich Leistungsoptimierung und Fehlerbehebungen
v0.38.1 20.03.2025 Die neueste stabile Version, einschließlich Umgebungs-Image-Updates und Abhängigkeitsreparaturen
v0.38.0 23.11.2024 Suchkontext entfernen (Architekturvereinfachung), Aufgabenkonfigurationsrichtlinie (Konfigurationsrichtlinien) GA, globale Konfigurationsrichtlinien-Benutzeroberfläche
v0.37.0 30.09.2024 Neues Ausführungsobjekt (Run Centric API), Workload-Alarmierung (Workload-Alarmierung), Erstunterstützung für Konfigurationsrichtlinien
v0.36.0 24.08.2024 Flat Runs-Ansicht GA, RBAC-Webhook, Data Lineage-Erstunterstützung
v0.35.0 09.08.2024 Flat Runs-Vergleichsansicht, Metadatenfiltersuche, K8s-Pod-zu-Job-Übermittlung, Framework-Splitting (Framework-Splitting)
v0.34.0 29.06.2024 Notebook-Token-Zertifizierung K8s Node Selector/Affinity unterstützt Pause/Resume Run
v0.33.0 30.05.2024 WebUI-Vorlagenverwaltung Flat Runs Sortierung/Filterung, Heatmap (Heatmap), Helm-Passwort-Komplexitätsprüfung
v0.32.0 2024-04 (noch kein offizielles genaues Datum) Template CRUD API, K8s Multi-RM-Unterstützung, experimenteller Batch-Betrieb

Beobachtung der Versionsverwaltung

  • Tempo: Behalten Sie im Jahr 2024 eine Iterationsfrequenz von etwa einer Nebenversion pro Monat bei, und das Tempo wird sich nach Beginn des Jahres 2025 verlangsamen (v0.38.1 wird 2025-03 veröffentlicht), was auf die Verbesserung der Produktreife oder die Anpassung der Teamressourcen zurückzuführen sein kann.
  • Architekturentwicklung: Der Kerntrend von v0.35 zu v0.38 ist die Migration von „Experiment-Trial-Zentralisierung“ zu „Run-Zentralisierung“ (Flat Runs) und die Einführung von Konfigurationsrichtlinien zur Verbesserung der Multi-Tenant-Governance-Funktionen.
  • Unterschiede bei der Enterprise Edition: Die EE-Version ist OSS bei Enterprise-Funktionen wie SSO-Verbesserungen (v0.38.0+), Lizenzschlüsselüberprüfung, RBAC-Überwachungsprotokolle usw. voraus. OSS-Benutzer müssen darauf achten, ob diese Funktionen schrittweise auf die Community-Version übertragen werden oder ob sie für lange Zeit exklusiv für EE bleiben.

Technische Vorteile von Determined AI

Deklarative Trainingskonfiguration: Benutzer definieren Trainingshyperparameter, Ressourcenanforderungen („slots_per_trial“), Suchalgorithmen und Planungsstrategien über YAML, und die Plattform generiert Versuche und plant die Ausführung entsprechend. Der Hauptvorteil dieser deklarativen Abstraktion besteht darin, dass Forscher beschreiben, „was zu tun ist“ und nicht „wie es zu tun ist“, und die Plattform basierend auf der Clusterlast im Hintergrund automatisch entscheidet, „wie viele GPUs auf welcher Maschine ausgeführt werden sollen“.

Automatische Gradientensynchronisation (All-Reduce-Aggregation): Die Harness-Komponente von Determined fügt automatisch eine Gradientensynchronisationslogik (basierend auf NCCL oder Gloo) zusätzlich zum Benutzertrainingscode ein, sodass Benutzer keinen verteilten Kommunikationscode schreiben müssen. Mehrere Versuche können unabhängig voneinander auf den jeweils zugewiesenen Plätzen vorwärts/rückwärts laufen. Harness führt nach jedem „backward()“ automatisch den All-Reduce-Aggregationsgradienten aus, um sicherzustellen, dass die Modellparameter jedes Knotens konsistent sind. Dieser Mechanismus ermöglicht die Erweiterung von einer einzelnen Karte auf mehrere Karten durch einfaches Ändern von „slots_per_trial“ in YAML, ohne das Trainingsskript zu berühren.

Planung der Zusammenarbeit für die ASHA-Suche: Herkömmliche Hyperparameter-Suchtools werden unabhängig vom Planer ausgeführt, und die durchsuchten Versuche müssen weiterhin für Ressourcen in die Warteschlange gestellt werden. Determined integriert den Sucher und den Planer tiefgreifend: Nachdem der Sucher den nächsten Parametersatz bestimmt hat, entscheidet der Planer, ob der Versuch sofort gestartet werden soll und ob Versuche mit niedriger Priorität auf der Grundlage der aktuellen Clusterlast vorgezogen werden sollen. Dieses Co-Design ermöglicht, dass die Hyperparameter-Suche Produktionstrainingsaufgaben nicht blockiert, wenn der Cluster voll ist. Suchversuche werden als präemptiv markiert und geben die GPU automatisch frei, wenn eine Aufgabe mit höherer Priorität übermittelt wird.

Dual-Track-Planung (Agent RM + K8s RM): Determined unterstützt zwei Ressourcenverwaltungsmodi – Agent RM (selbstverwalteter Agentencluster) und K8s RM (native Kubernetes-Planung). Agent RM eignet sich für Bare-Metal-/HPC-Umgebungen, erfordert keine K8s-Abhängigkeiten und ist einfacher bereitzustellen; K8s RM eignet sich für Teams, die bereits über eine K8s-Infrastruktur verfügen, und kann die automatische Erweiterung und Kontraktion, die Namespace-Isolierung und andere Funktionen von K8s nutzen. Beide können gleichzeitig aktiviert werden (Multi-RM), sodass derselbe Master heterogene Cluster verwalten kann.

Speicherabstraktion von Checkpoint: Checkpoint unterstützt die Speicherung im gemeinsam genutzten Dateisystem S3/GCS-Objektspeicher oder HDFS. Die Plattform verwaltet automatisch den Checkpoint-Lebenszyklus (GC-Richtlinie) und kann die Datenmigration über Speicherebenen hinweg konfigurieren. Diese Abstraktion entkoppelt die Speicherung und Berechnung des Trainingsclusters – Trainingsknoten können zustandslose Instanzen sein und Prüfpunkte werden im externen Objektspeicher gespeichert, um eine schnelle Wiederherstellung nach einem fehlgeschlagenen Experiment zu ermöglichen.

Integrierte Leistungsprofilierung: Die Web-Benutzeroberfläche verfügt über ein integriertes Tool zur Analyse der Trainingsleistung, das Indikatoren wie GPU-Auslastung, Datenladedurchsatz und Kommunikationsverhältnis anzeigen kann, um beim Auffinden von Trainingsengpässen zu helfen (z. B. ob das Laden von Daten ein Engpass oder die Kommunikation ein Engpass ist). Diese Funktion erfordert keine zusätzliche Integration von Prometheus/Grafana, wodurch die Komplexität der Toolkette zur Leistungsoptimierung reduziert wird.

Die Wahl von Go als Hauptsprache im Code-Warehouse (44,6 %) zeigt, dass die Master-Komponente hohe Anforderungen an die Parallelitätsleistung stellt – der Master muss die Heartbeats, Planungsentscheidungen und API-Anfragen von Hunderten von Agenten gleichzeitig verwalten. Das Goroutine-Modell von Go ist in diesem Szenario effizienter als Python. Python (27,9 %) wird für Harness (Trainingslaufzeit) und SDK verwendet, und TypeScript (24,4 %) wird für die Web-Benutzeroberfläche verwendet.

So verwenden Sie entschlossene KI

CLI installieren und Cluster starten

„Bash

CLI installieren

Pip-Installation bestimmt

Lokaler Cluster (schnelle Erfahrung auf einer einzelnen Maschine)

Stellen Sie einen lokalen Cluster bereit

AWSDeployment

Detploy aws up

GCP-Bereitstellung

Stellen Sie gcp bereit „

Trainingsaufgabe senden

Anpassung des Trainingsskripts (PyTorch-Beispiel):

„Python aus bestimmt.pytorch importieren PyTorchTrial, DataLoader, PyTorchTrialContext

Klasse MyTrial(PyTorchTrial): def init(self, Kontext: PyTorchTrialContext): self.context = Kontext self.model = self.context.wrap_model(nn.Sequential(...))

def train_batch(self, batch, epoch_idx):
    Verlust = self.model(batch)
    self.context.backward(Verlust)
    self.context.step_optimizer(self.optimizer)
    Rückkehr {"Verlust": Verlust}

YAML-Konfigurationsdatei („experiment.yaml“):

„yaml Name: mein_experiment Einstiegspunkt:train.py Hyperparameter: Lernrate: Typ: doppelt Mindestwert: 0,0001 Maximalwert: 1,0 Suchender: Name: adaptive_asha Metrik: Verlust kleinerer_is_better: wahr max_trials: 100 Ressourcen: slots_per_trial: 8 „

Befehl senden:

„Bash Das Experiment erstellt experiment.yaml . „

Vergleich der Bereitstellungsoptionen

Bereitstellungsmethode Anwendbare Szenarien Voraussetzungen Wartungskomplexität
Lokaler Cluster (detploy local) Persönliche Entwicklung/Einzelgerät mit mehreren Karten Docker Niedrig
AWS „Deploy aws“ Schnellstart in der Cloud AWS-Konto + Kontingent Mittel
GCP „Deploy gcp“ Schnellstart in der Cloud GCP-Konto + Kontingent Mittel
Kubernetes-Helm-Diagramm Vorhandener K8s-Cluster K8s-Cluster + Helm 3 Mittel bis hoch
Manuelle Agentenbereitstellung Bare-Metal/HPC PostgreSQL + gemeinsamer Speicher Hoch
Slurm/PBS-Integration HPC-Cluster Slurm/PBS Kontextuell Hoch

Schneller Verifizierungspfad: Einzelne Entwickler empfehlen „pip install bestimmt && det bereitstellen lokalen Cluster-up“, der innerhalb von 5 Minuten einen Einzelknoten-Cluster mit Master + Agent lokal hochziehen und den offiziellen MNIST-Beispielverifizierungskernprozess ausführen kann.

Produktpreise für entschlossene KI

Determined AI übernimmt ein zweigleisiges Preismodell aus „Open Source Core + Enterprise-Version“:

  • Open Source Version (OSS): Apache 2.0-Lizenz, voll funktionsfähig, einschließlich verteilter Schulung, Superparametersuche, Experimentverfolgung und -planung. Es gibt keine Nutzungsbeschränkungen oder GPU-Obergrenzen. Geeignet für Einzelpersonen, akademische Teams und mittelgroße Teams mit Selbstbedienungs- und Wartungsfunktionen.
  • Enterprise Edition (HPE Enterprise Edition): Basierend auf OSS bietet es eine SSO/SAML-integrierte, feinkörnige RBAC-Berechtigungsprüfung und kommerzielle SLA-Unterstützung für die vorintegrierte HPE-Hardware-Verifizierung. Die Preise werden über HPE Sales auf Jahresabonnementbasis ermittelt. Die konkrete Abrechnungseinheit (Knoten/GPU/Benutzer) wird nicht bekannt gegeben.
  • Cloud Hosted Edition: HPE bietet kein SaaS-Hosting an, alle Bereitstellungen werden selbst gehostet. Wenn Sie ein betriebsfreies Erlebnis wünschen, können Sie es über „deploy aws/gcp“ schnell in der Cloud starten, aber die Verwaltung und Überwachung liegt weiterhin in der Verantwortung des Teams.
Version Lizenz Preis Anwendbarer Maßstab
OSS Apache 2.0 Kostenlos Einzelpersonen bis mittelgroße Teams (<100 GPUs)
EE Kommerzielle Lizenz Geschäftsbestätigung erforderlich Mittlere und große Unternehmen (100+ GPUs)

Vor dem Kauf der Enterprise Edition müssen Sie bei HPE bestätigen, ob gestaffelte Preise basierend auf der Anzahl der GPUs unterstützt werden und ob spezifische Bedingungen für produktionsfähigen 24/7-Support, Upgrades und Datenmigration enthalten sind.

Definierte KI-Anwendungsszenarien

  • Multi-GPU-Cluster-Schulungsmanagement: Wenn ein Team 10–100 GPUs gemeinsam nutzt, reduziert die Warteschlangenplanung von Determined effektiv Leerlaufverschwendung – Forscher müssen nicht mehr manuell koordinieren, wer die Karte wann verwendet. Die Superparameter-Suche durchsucht automatisch den Parameterraum, wodurch die Notwendigkeit entfällt, Parameter manuell zu ändern und erneut auszuführen. Wichtige Punkte der Überprüfung: Wenn Aufgaben mit hoher Priorität häufig in der Warteschlangenplanung eingereicht werden, kann geprüft werden, ob Suchversuche mit niedriger Priorität korrekt vorweggenommen und wiederhergestellt werden können.

  • Standardisierte Experiment-Pipeline: Code-Snapshots, Hyperparameter, Indikatoren und Prüfpunkte werden für jedes Training automatisch aufgezeichnet. Wenn neue Forscher das Projekt übernehmen, können sie historische Experimente direkt auf der Web-Benutzeroberfläche anzeigen, sie mit einem Klick reproduzieren oder das Training vom angegebenen Kontrollpunkt aus fortsetzen. Wichtige zu überprüfende Punkte: Ob der Code-Snapshot vollständig nicht verfolgte lokal geänderte Dateien enthält und ob die Checkpoint GC-Strategie zu einem vorzeitigen Löschen führen kann.

  • Very Large Model Training (DeepSpeed ​​​​Integration): Für das Modelltraining mit zig Milliarden Parametern optimiert ZeRO Stage 2/3 die Nutzung des Videospeichers und arbeitet mit der automatischen Multi-Node-Planung von Determined zusammen, um den Infrastrukturschwellenwert für das Training großer Modelle zu senken. Verifizierungsschwerpunkt: Kompatibilität der DeepSpeed-Version und der Determined-Version. Kommunikationseffizienz unter ZeRO Stage 3.

  • Hybrid-Cloud/heterogenes Cluster-Training: Vereinheitlichen Sie die Verwaltung lokaler Bare-Metal-Cluster und K8s-Cluster in der Cloud durch Multi-RM, und Schulungsaufgaben werden entsprechend den Ressourcenanforderungen automatisch für verfügbare Knoten geplant. Verifizierungsschwerpunkt: Die Auswirkungen des Cluster-übergreifenden Checkpoint-Synchronisationsmechanismus und der Netzwerkverzögerung auf verteiltes Training.

  • HPC/Academic Research Computing: Determined auf dem Slurm/PBS-Cluster bereitstellen, um wissenschaftlichen Forschern eine Web-Benutzeroberfläche zum Senden von Schulungsaufgaben zur Verfügung zu stellen und die traditionelle SSH-Methode der manuellen Übermittlung von Jobs zu ersetzen. Die integrierte Experimentverfolgung reduziert nicht reproduzierbare Probleme, die durch das „Vergessen, Parameter aufzuzeichnen“ verursacht werden. Verifizierungsschwerpunkt: Die integrierte Version von Slurm unterstützt Job Array und koexistiert mit bestehenden HPC-Planungsstrategien.

Anwendbare Gruppen der entschlossenen KI

  • Deep-Learning-Forscher/Algorithmus-Ingenieur: Sie müssen häufig verteilte Trainingsexperimente durchführen, in der Hoffnung, den Arbeitsaufwand für die Anpassung verteilten Codes zu reduzieren, experimentelle Parameter und Ergebnisse automatisch aufzuzeichnen und mehrere Sätze experimenteller Indikatoren mit einem Klick zu vergleichen. Der Wert ist bei mittelgroßen Teams mit 5 bis 50 GPUs am offensichtlichsten.

  • ML-Infrastruktur-/Plattform-Ingenieur: Verantwortlich für den Aufbau der Schulungsinfrastruktur für das Team. Wir hoffen, eine Self-Service-Plattform zum „Einreichen und Trainieren“ bereitzustellen und die tägliche Supportarbeit zu reduzieren, indem wir „Forschern dabei helfen, Umgebungen zu konfigurieren, Treiber anzupassen und Pakete zu verpacken“. Es ist notwendig, das Gleichgewicht zwischen K8s/PostgreSQL-Betriebs- und Wartungskosten und Effizienzverbesserungen zu bewerten.

  • HPC-Cluster-Administrator: Verwaltet Slurm/PBS-Cluster, in der Hoffnung, die Schwelle für Forscher, den Cluster über die Web-Benutzeroberfläche zu nutzen, zu senken und gleichzeitig die Möglichkeit zu behalten, Jobprioritäten und Ressourcenkontingente zu steuern. Die festgestellte Kompatibilität mit vorhandenen Planern und die Ersatzkosten müssen bestätigt werden.

  • Technischer Entscheidungsträger (CTO/VP Eng): Um die Auswahl der MLOps-Plattform zu bewerten, ist es notwendig, die funktionale Abdeckung sowie die Betriebs- und Wartungskosten von Kubeflow/MLflow/Determined zu vergleichen. Determined verfügt über eine herausragende Wettbewerbsfähigkeit in der einzelnen Dimension „Verbesserung der Trainingseffizienz“. Wenn das Team jedoch eine vollständige Modellbereitstellungs- und Überwachungsverbindung benötigt, muss diese möglicherweise mit anderen Tools gekoppelt werden.

Nicht für die Masse geeignet:

  • Für kleine Teams oder Einzelpersonen, deren Anforderungen mit einer einzigen Karte erfüllt werden können, können die Cluster-Bereitstellungs- und Wartungskosten von Determined höher sein als der Nutzen. Es ist einfacher, „torchrun“ oder „python train.py“ direkt zu verwenden. – Für Teams, die eine vollständige Inferenzbereitstellung + A/B-Tests + Modellüberwachungslinks benötigen, enthält Determined keine Inferenzdienstkomponenten und muss mit Tools wie KServe/Seldon gekoppelt werden.
  • Teams widerstehen der unvermeidlichen Abhängigkeit von K8s – obwohl der Agent RM-Modus verfügbar ist, sind die meisten erweiterten Funktionen (Multi-RM, automatische Skalierung) immer noch auf K8s angewiesen.

Zusammenfassung und Ausblick von Determined AI

Kernkompetenzen: Determined AI bietet die umfassendste Out-of-the-Box-Lösung in der Open-Source-Community im vertikalen Bereich der „verteilten Trainingsplanung“. Seine Kombination aus deklarativer YAML-Konfiguration + automatischer Gradientensynchronisierung + ASHA-Suche + GPU-Kontingentverwaltung ändert das Multi-Maschinen- und Multi-Karten-Training von „Jedes Team stellt sein eigenes Rad her“ zu „Konfiguration als Training“. Für GPU-ressourcenintensive (10+ GPUs) ML-Teams kann es die GPU-Auslastung und die Experimentiereffizienz erheblich verbessern, ohne den Trainingscode zu ändern.

Aktuelle Einschränkungen:

  • Die Lernkurve konzentriert sich auf die K8s-Bereitstellung und das Verständnis der YAML-Konfiguration. Bei nicht-containerisierten Teams kann die erste Bereitstellung 1 bis 2 Wochen dauern. – Es besteht Unsicherheit über die Funktionslücke zwischen der OSS-Version und der EE-Version – Unternehmensfunktionen wie SSO und RBAC-Auditing waren lange Zeit in der EE-Version gesperrt. Es bleibt abzuwarten, ob die OSS-Version den vollständigen Iterationsfortschritt der Kerntrainingsfunktionen aufrechterhalten kann.
  • Die Community-Größe (3,2.000 Sterne) ist kleiner als bei Kubeflow (~14.000 Sterne) und MLflow (~18.000 Sterne), und die ökologischen Beiträge Dritter und die Reaktionsgeschwindigkeit auf Community-Probleme können begrenzt sein.

Beschaffungs-/Einführungsrisikobewertung: Es wird empfohlen, dass das Team zunächst die OSS-Version als Pilot auf dem vorhandenen Cluster bereitstellt und 1–2 typische Schulungsaufgaben (nicht zum Kerngeschäft gehörende Produktionsaufgaben) auswählt, um die Benutzerfreundlichkeit und den Planungseffekt verteilter Schulungen zu überprüfen. Es wird empfohlen, während der Pilotphase auf die folgenden drei Schlüsselindikatoren zu achten: (1) Die durchschnittliche Wartezeit von der Einreichung des Trainings bis zum Beginn des Trainings (verglichen mit dem Grad der Verbesserung der manuellen Koordination); (2) Nach der Einführung der Hyperparametersuche die Anzahl der Versuche und GPU-Stunden, die erforderlich sind, um die optimalen Parameter zu finden; (3) Der Arbeitsaufwand für Codeänderungen nach dem Wechsel der Forscher zur Plattform (je geringer, desto effektiver ist die Abstraktionsschicht). Wenn die Pilotüberprüfung bestanden wird, bewerten Sie, ob die Unternehmensfunktionen der EE-Version benötigt werden, und bestätigen Sie dabei die Preisbedingungen und den Datenmigrationspfad der EE-Version mit HPE.

Verwandte Tools: , replicate

Versionsinfo

  • Ermittelt 0,32,0 :Einen offiziellen genauen Termin gibt es noch nicht.
  • Ermittelt 0,28,0 :Einen offiziellen genauen Termin gibt es noch nicht.

Benutzerbewertungen

  • Bewertungen werden geladen...