ForgeTrain Kostenlos

-

ForgeTrain ist ein Open-Source-Pre-Training-Framework für große Modelle, das von Wallface Intelligence und der OpenBMB-Community der Tsinghua University veröffentlicht wurde. Der Framework-Code wird zu 100 % von AI Agent Loop selbst geschrieben und verwendet die dreistufige Methodik von Forge Engineering (Standarderstellung → bitweise Ausrichtung → Leistungsüberschreitung). Die Trainingsgeschwindigkeit auf NVIDIA H100 übertrifft die von Megatron-LM um etwa 10 %. Es hat den Vortrainingsprozess auf dem Ascend-Chip von Huawei vollständig durchlaufen und das MiniCPM5-1B-Modell erfolgreich trainiert.

ForgeTrain Produktoberfläche

ForgeTrain – das von AI Agent selbst geschriebene Pre-Training-Framework für große Modelle

Kernparameter und Statistiken

ForgeTrain ist ein Pre-Training-Framework für große Modelle auf Produktionsebene, das vollständig von KI-Agenten ohne Eingriffe in den menschlichen Code geschrieben wurde. Es wurde gemeinsam von Face Wall Intelligence und der OpenBMB-Open-Source-Community des Natural Language Processing Laboratory der Tsinghua-Universität veröffentlicht und stellt einen wichtigen Meilenstein auf dem Weg von „KI für KI“ von der Konzeptüberprüfung bis zur Produktionsimplementierung dar.

Parameterelement Wert
Entwickler Wall-Facing Intelligence (ModelBest) und Tsinghua University OpenBMB Community
Zielszenario Groß angelegtes verteiltes LLM-Vortraining (Hundert-Kalorien- bis Kilokalorien-Ebene)
Unterstützte Hardware NVIDIA H100 (SM90)/Huawei Ascend-Serie
Verifiziertes Modell MiniCPM4-0,5B, MiniCPM4-8B, MiniCPM5-1B
Trainingsrahmenskala Unterstützt nur DP (0,5B) und TP=2 / DP=4 (8B)
Code-Schreibmethode 100 % KI-Agent-Loop selbstgeneriert, keine manuelle Bearbeitung durch Menschen
Open-Source-Lizenz Apache 2.0
Trainingsdurchsatz MFU auf H100 erreicht 44,13 % und übertrifft Megatron-LM um etwa 10 %
Gemessener Cluster 64 H100-GPUs, BF16-Genauigkeit, verteilte Daten parallel
Kabelbaumkomponente Wird bald Open Source sein (Gerüst, das das Trainings-Framework für die automatische Ausgabe von Agent Loop steuert)

Die MFU (Modell-FLOPS-Auslastung) von ForgeTrain betrug 44,13 %, indem MiniCPM4-0.5B im 64× H100, BF16, reinen DP-Modus trainiert wurde. Zum Vergleich: Die MFU von Megatron-LM v0.15 beträgt bei derselben Hardwarekonfiguration etwa 40 %. Dies bedeutet, dass ForgeTrain bei gleicher Investition in Rechenleistung etwa 10 % der GPU-Rechenkosten einsparen oder ein größeres Modell mit demselben Budget trainieren kann. Bei einem 64-Karten-Cluster bedeutet eine Einsparung von 10 % Rechenleistung Zehntausende Dollar an Strom- und Maschinenzeitkosten.

Benutzer- und Markterkennung

ForgeTrain hat seit seiner Veröffentlichung große Aufmerksamkeit in Wissenschaft und Industrie erhalten. Sein Kernwert besteht darin, dass es zum ersten Mal die Aussage verifiziert hat, dass „KI-Agenten unabhängig ein Schulungsframework auf Produktionsebene schreiben können“.

  • Akademische Genehmigung: Das Projekt wurde vom Natural Language Processing Laboratory der Tsinghua-Universität ins Leben gerufen und die entsprechende Methodik wurde in der Einreichungsphase der Top-Konferenz veröffentlicht. Der Vorabdruck des Papiers zitiert die dreistufige Methodik von Forge Engineering, die einen reproduzierbaren theoretischen Rahmen für die KI-Infrastruktur für autonomes Schreiben bietet.
  • Industrielle Implementierung: Wall-Facing Intelligence hat ForgeTrain verwendet, um den Vortrainingsprozess von MiniCPM5-1B auf dem Huawei Ascend-Chip vollständig zu durchlaufen. Dieses Modell belegt weltweit den ersten Platz in der AA-Liste mit einer Größe unter 2B. Dies bedeutet, dass inländische Chips zum ersten Mal das Vortraining großer Modelle auf Produktionsebene durch einen selbst geschriebenen KI-Trainingsstapel abgeschlossen haben und damit die traditionelle Pfadabhängigkeit „Der Trainingsrahmen muss durch menschliche Handschrift optimiert werden“ durchbrechen.
  • Open-Source-Community: Das GitHub-Repository (OpenBMB/ForgeTrain) ist Open Source unter dem Apache 2.0-Protokoll. Zu den Community-Mitwirkenden zählen das Wallface-Kernteam und externe Entwickler. Die Trainings-Engine v0.1.0 ist derzeit veröffentlicht und das Harness-Orchestrierungs-Framework (Agent Loop Automated Scaffolding) befindet sich im Status „Coming Soon“.
  • Branchen-Benchmarking: Im Vergleich zu Konkurrenzprodukten wie NVIDIA VibeTensor (nicht für die Produktion gekennzeichnet) und dem Anthropic C-Compiler OpenAI Harness ist ForgeTrain das einzige KI-Generierungs-Framework, das gleichzeitig auf Produktionsebene verwendbar ist, eine hervorragende Leistung bietet und vollständig Open Source ist. Dies hat einen wichtigen Referenzwert und technische Demonstrationsbedeutung im Kontext der Branche, in der große Hersteller wie Meta „KI schreibende KI“ erforschen.

Kostenvorteil

Der Kostenvorteil von ForgeTrain muss auf drei Ebenen verstanden werden:

Vergleichsmaße ForgeTrain Megatron-LM (NVIDIA) Handschrift-Trainingsrahmen
Entwicklungskosten AI Agent ist unabhängig geschrieben, die menschliche Investition liegt nahe bei Null Erfordert eine langfristige Wartung durch ein Team erfahrener Systemingenieure Teamentwicklungszyklus von Monaten bis Jahren
Recheneffizienz 44,13 % MFU, etwa 10 % höher als Megatron ~40 % MFU (gleiche Hardware) Hängt vom Optimierungsgrad des Teams ab, normalerweise niedriger als bei ausgereiften Frameworks
Hardware-Anpassung H100 + Ascend Dual-Plattform, Harness kann sich automatisch anpassen Nur NVIDIA-GPU Neuentwicklung bei jeder neuen Hardware-Anpassung erforderlich
Lizenz Apache 2.0 ist vollständig Open Source und kostenlos Open Source, aber ökologisch gesperrtes CUDA Die Kosten für die Selbstrecherche sind hoch
Trainingsergebnis Das Produktionsmodell MiniCPM5-1B wurde hergestellt Für Entwicklung und Wartung werden zusätzliche Arbeitskräfte benötigt Vollständige Linkunterstützung ist erforderlich

C-seitige Benutzer: ForgeTrain richtet sich nicht direkt an einzelne Benutzer. Der Nutzungsgrenzwert gilt für Forschungseinrichtungen oder Unternehmen mit GPU-Clustern mit mehreren Karten. Durch Open-Source- und kostenlose Methoden kann jedoch jedes Team mit Computerressourcen es kostenlos erhalten und nutzen.

Entwickler und Forschungseinrichtungen: Die Open-Source-Lizenz (Apache 2.0) erlaubt die kostenlose Nutzung, Modifikation und kommerzielle Nutzung. Im Vergleich zu Closed-Source-Trainingsframeworks, die den Erwerb einer kommerziellen Lizenz erfordern, betragen die Kosten für die Einführung von ForgeTrain nur die Kosten für Cluster-Hardware und Strom. Für akademische Forschungsteams senkt dies die Schwelle für große Modellexperimente vor dem Training erheblich.

Unternehmensnutzer: Der Durchbruch von ForgeTrain bei der inländischen Chipadaption ist von großem kommerziellen Wert. Unternehmen müssen nicht N Jahre warten, um einen selbst entwickelten CUDA-kompatiblen Stack zu entwickeln. Sie können ForgeTrain direkt verwenden, um mit dem Training großer Modelle auf heimischen Chips zu beginnen. Für mittlere und große Unternehmen, die eine KI-Infrastruktur aufbauen, kann die Einführung von ForgeTrain die Bindung an einen einzigen GPU-Anbieter vermeiden und gleichzeitig mehr als 10 % der Rechenleistungskosten einsparen.

Hauptfunktionen

  • Verteilte Pre-Training-Engine: Unterstützt verteiltes kollaboratives Training von Hunderten bis Tausenden von GPUs und hat die Verifizierung auf Produktionsebene auf einem 64× H100-Cluster abgeschlossen. Die Trainings-Engine verfügt über fünf integrierte CUDA-Graph-Erfassungsgranularitäten (forward/step/step_full/step_optimizer/step_nccl_opt), die frei mit BucketedGradReducer und dem Sharding-Optimierer wgrad-overlap kombiniert werden können, um flexiblen Optimierungsraum für Trainingsaufgaben unterschiedlicher Größe bereitzustellen.
  • Hardwareplattformübergreifende Anpassung: Unterstützt sowohl Chips der NVIDIA H100 (SM90)- als auch der Huawei Ascend-Serie. Die MFU auf dem H100 erreicht 44,13 %, und der MiniCPM5-1B-Vorschulungsprozess wurde auf dem Shengteng vollständig bestanden. Diese Dual-Plattform-Unterstützung ist von strategischer Bedeutung für den Aufbau eines heimischen Rechenleistungs-Ökosystems – das Modellteam kann schnell auf H100 iterieren und die Produktionsbereitstellung auf Ascend abschließen.
  • Unabhängige KI-Agent-Loop-Entwicklung: Der Framework-Code wird vollständig unabhängig vom Coding Agent im automatischen Loop-Modus generiert, und Menschen stellen nur Harness-Spezifikationen und Kontext bereit. Der Agent schließt den gesamten Entwicklungsprozess selbstständig ab: „Lesen der Referenzimplementierung → Schreiben des Codes → Starten des Trainings → Analysieren von Protokollen → Lokalisieren der Ursache → Beheben von Patches → Übergeben der Zugriffskontrolle → Senden des Codes“. Jeder Bediener wurde durch eine echte verteilte Schulung verifiziert.
  • Selbstentwickelte Hochleistungs-Operator-Bibliothek: Enthält 5 benutzerdefinierte GEMM-Operatoren auf Basis von CuTeDSL mit einer MFU von bis zu 90 % für einen einzelnen Operator; Bei der selbst entwickelten FlashAttention-Implementierung übertrifft die Leistung die von Transformer Engine/FlashAttention 3 und entspricht der von FlashAttention 4. Der Operator wird durch AOT C-Export in einen persistenten Cache kompiliert, was beim nachfolgenden Training nur ein paar Sekunden „Dlopen“-Overhead verursacht.
  • Bitweise Konsistenzüberprüfung: Das KI-generierte Framework und die Referenzimplementierung (Megatron-LM) erzeugen unter derselben Eingabe genau dieselben numerischen Ergebnisse. Dies wird durch die zweite Stufe der „bit-für-bit-Ausrichtung“ von Forge Engineering erreicht – der Agent reproduziert die Vorwärts-/Rückwärtsausbreitungsergebnisse der Referenzimplementierung unter Harness-Einschränkungen genau und stellt so die Korrektheit sicher, bevor er in die Leistungsoptimierungsphase eintritt.
  • Automatisiertes Evaluierungsgeschirr (in Kürze erhältlich): Integrierte automatisierte Tests und Leistungsbewertung

„Richtig laufen“ und „Schnell laufen“ wandelt das System in Kriterien um, die die Maschine automatisch beurteilen kann. Harness umfasst außerdem eine Agent-Loop-Orchestrierungslösung, die es jedem Team ermöglicht, den gesamten Prozess von der schrittweisen Ausrichtung bis zur Leistungsüberschreitung zu reproduzieren.

Modell- und Versionsentwicklung

ForgeTrain befindet sich derzeit in der ersten Veröffentlichungsphase von v0.1.0 und die Projekt-Roadmap ist klar:

Version Erscheinungsdatum Abgedeckter Inhalt
v0.1.0 (aktuell) 2026-05 Die Trainings-Engine wird öffentlich veröffentlicht und unterstützt NVIDIA H100 · MiniCPM4-0.5B (nur DP) und MiniCPM4-8B (TP=2). Enthält den Quellcode der Trainings-Engine, 5 benutzerdefinierte CuTeDSL-GEMMs und selbst entwickeltes FlashAttention.
Geschirr (bald erhältlich) Noch festzulegen Mithilfe des Agent Loop-Orchestrierungsgerüsts kann Coding Agent automatisch die Kernspezifikationen des Trainings-Frameworks generieren. Es ist eine Schlüsselkomponente, um die Reproduzierbarkeit von „KI schreibender KI“ zu erreichen.
Huawei Ascend-Version Auf der Roadmap Das MiniCPM5-1B Ascend-Trainingsframework wurde in die Praxis umgesetzt und die offizielle Version soll veröffentlicht werden.
Selbstgeneriertes Geschirr Auf der Roadmap Das Trainingsframework generiert selbst ein Harness-Gerüst, um eine rekursive Selbstverbesserung zu erreichen.

v0.1.0 ist der erste Meilenstein des Projekts – die Überprüfung der Machbarkeit des unabhängigen Schreibens eines Trainingsrahmens auf Produktionsebene für AI Agent. Der nächste Meilenstein ist die Veröffentlichung der Harness-Komponente, damit Drittteams den Produktionsprozess des Trainingsframeworks von Agent Loop reproduzieren können, anstatt nur die bereits erstellte Trainings-Engine zu verwenden.

Technische Vorteile

Die technische Architektur von ForgeTrain dreht sich um eine zentrale Innovationsverbindung: Forge Engineering-Methodik → Unabhängige Entwicklung von Agent Loop → Hochleistungs-Trainings-Engine → Cross-Hardware-Anpassung.

Dreistufige Methodik von Forge Engineering

Forge Engineering ist die zugrunde liegende Methodik von ForgeTrain, die in drei Phasen unterteilt ist:

  1. Festlegen von Standards (Harnessing): Sammeln Sie wichtige Betriebsdaten vom Referenztrainings-Stack (Megatron-LM), erstellen Sie ein automatisiertes Bewertungs-Harness und definieren Sie Richtigkeits- und Leistungsbenchmarks. Harness ist kein statisches Dokument, sondern eine Reihe ausführbarer Spezifikationen – einschließlich Datenstromkürzung, numerischer Vergleich, Leistungsschwellenwerte und andere maschinendefinierbare Standards.
  2. Bit-für-Bit-Replikation: Der AI-Agent generiert ein Trainingsframework, das Stück für Stück mit der Referenzimplementierung unter Harness-Einschränkungen übereinstimmt. In dieser Phase geht es nicht um Leistung, sondern nur um Korrektheit. Wenn die Ausgabe des vom Agenten erzeugten Codes nicht vollständig mit der Referenzimplementierung unter derselben Eingabe übereinstimmt, wird sie automatisch zurückgesetzt und repariert.
  3. Überragende Leistung: Heben Sie die binäre Konsistenzbeschränkung auf und wechseln Sie zu einem leistungsorientierten Harness, der es dem KI-Agenten ermöglicht, in einem größeren Operatorkombinationsraum unabhängig iterativ zu optimieren und letztendlich die von Menschen geschriebene Referenzimplementierung an Geschwindigkeit zu übertreffen. Dieser Schritt ist entscheidend – das gleiche Harness-Protokoll kann völlig unterschiedliche proprietäre Optimierungsimplementierungen auf unterschiedlicher Hardware fälschen.

Agent Loop unabhängig entwickelt

Anders als beim herkömmlichen Zyklus „Menschen schreiben Code → Kompilieren → Debuggen“ wird der Code von ForgeTrain vom Coding Agent in einem vollautomatischen Zyklus vervollständigt:

„ LLM (Coding Agent) → Harness-Protokoll lesen → Bedienercode generieren → Torchrun startet Training → Protokoll analysieren → Ursachenort → Code ändern → Numerisches Tor passieren → An Exporte senden/ „

Das größte Merkmal dieses Zyklus besteht darin, dass die Generierung jedes Operators durch echtes verteiltes Training überprüft wurde. Während des Entwicklungsprozesses hat Agent mehrere Betreiberimplementierungsvarianten wie CuTeDSL / cuBLAS / Triton / TransformerEngine und Dutzende von Kommunikations- + CUDA-Graph-Erfassungskombinationen unabhängig aufgelistet und bewertet und schließlich die Kombination mit der besten Leistung als Standardkonfiguration für die Produktion ausgewählt.

Hohe Leistung und technische Optimierung

  • 44,13 % MFU-Implementierungsmechanismus: Benutzerdefiniertes CuTeDSL-GEMM über CUDA Graph mit fünf Erfassungsgranularitäten (Einzeloperator-MFU erreicht 90 %), Triton-Fusionskernel (CE fwd+bwd / SwiGLU / RMSNorm+Residuum / RoPE / Fusion Adam + Parametersynchronisation) und Kommunikations-Rechen-Überlappung (Comm-Rechen-Überlappung) im reinen DP-Modus, nähert sich der theoretischen Grenze der Hardware.
  • Kein Abstraktionsverlust: Im Gegensatz zu herkömmlichen Trainings-Frameworks, die die Vielseitigkeit durch Abstraktionsschichten aufrechterhalten, behält ForgeTrain die Vielseitigkeit des Harness-Protokolls und die hohe Leistung in jeder Schmiede bei. Dies bedeutet, dass der für eine bestimmte Hardware- und Modellgröße generierte Code keinen unnötigen Abstraktionsaufwand enthält.
  • Consumer-Development-Konzept: Im Gegensatz zu herkömmlicher Software, die Code als „Asset“ für die langfristige Wartung behandelt, entbündelt Forge Engineering Code in tiefgreifend angepasste Produkte, die bei Bedarf erstellt werden. Wenn die Hardware ausgetauscht oder das Modell aktualisiert wird, muss der alte Code nicht geändert werden, sondern das Neuschmieden des Kabelbaums wird direkt ausgeführt.

Wie man es benutzt

Die Verwendung von ForgeTrain ist in zwei Ebenen unterteilt: Verwendung der produzierten Trainings-Engine (derzeit verfügbar) und Verwendung des Harness-Trainingsframeworks für autonomes Schmieden (in Kürze verfügbar).

Verwendung der Trainings-Engine (v0.1.0)

Eingang Adresse Beschreibung
GitHub-Repository https://github.com/OpenBMB/ForgeTrain Haupt-Repository, enthält den Quellcode der Trainings-Engine und die vollständige Dokumentation
Schulungs-Engine-Dokumentation exports/train_engine_0.5B/README.md Vollständige CLI-Dokumentation, Konfigurationsreferenz, Leistungsbasislinie der 0,5B-Modell-Trainings-Engine
Schulungs-Engine-Dokumentation exports/train_engine_8b/README.md Vollständige Dokumentation für die 8B-Modell-Trainings-Engine

Anforderungen: Python ≥ 3.11 · CUDA 12.x · PyTorch ≥ 2.4 · NVIDIA H100 80 GB (SM90). Für das vollständige Vortraining sind 8× H100 erforderlich, und frühe Ausrichtungsphasen können auf einer einzigen Karte ausgeführt werden.

Typische Schritte:

  1. Klonen Sie das Repository und installieren Sie Abhängigkeiten: „Bash Git-Klon https://github.com/OpenBMB/ForgeTrain.git cd ForgeTrain/exports/train_engine_0.5B pip install -e . pip installiert Datensatztransformatoren „

  2. Installation überprüfen: „Bash PYTHONPATH=src python -c „from training_engine_tensor import config; print(‘OK’)“ „ Erwartete Ausgabe: „OK“.

  3. Vorkompilierter Operator (erster Lauf): „Bash PYTHONPATH=src CUSTOM_GEMM=1 OP_ATTENTION=v1 python scripts/precompile_ops.py „ Dieser Befehl wärmt den AOT-Export und den „cpp_extension“-Build auf und kompiliert die 5 CuTeDSL-GEMMs in einem dauerhaften Cache.

  4. Einzelknoten 8× H100-Training: „Bash Torchrun --standalone --nproc-per-node=8 \ -m training_engine_tensor pretrain \ --num-steps 200 \ --global-batch-size 1280 --micro-batch-size 10 \ --seq-length 4096 \ --hf-dataset openai/gsm8k \ --hf-dataset-config main \ --hf-text-template „Frage: {question}\nAntwort: {answer}“ \ --tokenizer-path openbmb/MiniCPM4-0.5B \ --save-dir ./checkpoints/run1 „

Geschmiedet mit Geschirr (bald erhältlich)

Nachdem die Harness-Komponente freigegeben wurde, kann das Team auf folgende Weise mit dem unabhängigen Schmieden beginnen:

„Bash cd ForgeTrain/harness bash agent-loop.sh # Starten Sie die Agent-Schleife ohne manuelle Eingriffe „

Dieses Skript steuert einen Codierungsagenten dazu, in einer Schleife ausgeführt zu werden, beginnend mit dem Lesen des Referenz-Trainingsstapels über die schrittweise Ausrichtung und Leistungsoptimierung bis hin zur Erstellung eines benutzerdefinierten Trainingsrahmens.

Produktpreise

ForgeTrain ist derzeit völlig kostenlos und Open Source, lizenziert unter der Apache 2.0-Lizenz.

  • Open Source und kostenlos: Der vollständige Quellcode und die Dokumentation der Trainings-Engine wurden öffentlich auf GitHub veröffentlicht und können kostenlos bezogen, verwendet und geändert werden. Für die kommerzielle Nutzung ist keine zusätzliche Genehmigung erforderlich.
  • Harness-Komponente: In Kürze erhältlich, voraussichtlich auch Open Source unter der Apache 2.0-Lizenz.
  • Enterprise-Support: Facewall Intelligence bietet ForgeTrain-Bereitstellungs- und technische Supportdienste auf Unternehmensebene. Für konkrete Preise wenden Sie sich bitte an den Geschäftsinhaber. Für Unternehmen, die über große GPU-Cluster verfügen und ihren Trainings-Stack anpassen möchten, können sie Dienste auf Unternehmensebene aushandeln, einschließlich Kabelbaumanpassung, Chip-Anpassungsoptimierung und Expertenservices vor Ort.
  • Cloud/gehosteter Dienst: Derzeit gibt es keinen gehosteten Schulungsdienst, Benutzer müssen die GPU-Infrastruktur selbst verwalten. Es ist nicht auszuschließen, dass Facewall Intelligence in Zukunft eine Modell-Trainingsplattform auf Basis von ForgeTrain auf den Markt bringt.

Insgesamt ist die Preisgestaltung von ForgeTrain äußerst entwicklerfreundlich – Sie erhalten ein Schulungs-Framework in Produktionsqualität zum Null-Anschaffungspreis. Zu den versteckten Kosten für Unternehmen gehören hauptsächlich Hardwareinvestitionen sowie Betriebs- und Wartungspersonal für GPU-Cluster. Diese Kosten können jedoch nicht vermieden werden, wenn ein Pre-Training-Framework verwendet wird.

Anwendungsszenarien

  • Vortraining und Feinabstimmung großer Modelle: Ersetzt direkt von Menschen geschriebene Trainingsframeworks wie Megatron-LM und DeepSpeed ​​und wird für das vollständige Vortraining und die Feinabstimmung von Anweisungen für große Modelle auf Produktionsebene verwendet. ForgeTrain bietet bei gleicher Hardware eine MFU-Verbesserung von etwa 10 %, was eine erhebliche Rechenleistungseinsparung für das Training großer Modelle bedeutet, für das oft Hunderte von Karten erforderlich sind und Wochen dauern. Die erwarteten Vorteile bestehen darin, ein größeres Modell mit dem gleichen Budget zu trainieren oder den Trainingszyklus bei gleicher Modellgröße zu verkürzen.
  • Anpassung der inländischen Rechenleistung: ForgeTrain ist das erste selbst geschriebene KI-Trainingsframework, das den gesamten Vortrainingsprozess auf dem Ascend-Chip von Huawei durchläuft. Für inländische Chiphersteller und Unternehmen, die inländische Rechenleistung nutzen, kann ForgeTrain verwendet werden, um schnell exklusive Hochleistungs-Trainingsstacks für Ascend und andere Chips zu schmieden, ohne zehn Jahre in den Aufbau eines weiteren CUDA-Ökosystems zu investieren. Der erwartete Vorteil besteht darin, dass die Zeit vom „Chip-Tape-Out“ bis zur „Software-Verfügbarkeit“ erheblich verkürzt wird.
  • Beschleunigung der KI-Forschung: ForgeTrain ermöglicht es, „das jährliche Kapazitätswachstum großer Modelle von einer Funktion des menschlichen Maßstabs auf eine Funktion des Rechenleistungsmaßstabs zu verschieben“. Das Forschungsteam nutzt Harness, um unabhängig in einem größeren Suchraum zu iterieren und schnell mit neuen Trainingsmethoden, Modellarchitekturen und Optimierungsstrategien zu experimentieren. Die erwarteten Vorteile werden die Energie des Teams von der Wartung des Trainings-Frameworks auf die Innovation von Modellalgorithmen verlagern.
  • Software Engineering Paradigm Experiment: Als erste industrielle Instanz von Forge Engineering bietet ForgeTrain eine Referenzmethodik und Architekturreferenz für die automatische Generierung von KI für andere komplexe Systeme (Compiler, Datenbanken, Betriebssysteme, Deep-Learning-Laufzeiten). Forschungsteams können die autonome Entwicklung von KI in ihren eigenen Bereichen auf der Grundlage des Harness-Modells von ForgeTrain erforschen.
  • Endseitige Modellentwicklung: Wall-face Intelligence hat ForgeTrain zum Trainieren von MiniCPM5-1B verwendet und belegt damit weltweit den ersten Platz im Maßstab unter 2B auf der AA-Liste. Dies beweist, dass ForgeTrain auch für die Entwicklung hocheffizienter Modelle auf der Endseite geeignet ist – Teams, die Bedarf an endseitigen Bereitstellungsszenarien wie mobilem IoT haben, können dies tun

Nehmen Sie direkt diesen Ausbildungsweg ein.

Anwendbare Personen

  • Ingenieure und Forscher für die Ausbildung großer Modelle: Dies ist die Kernbenutzergruppe von ForgeTrain. Sie können die Trainings-Engine direkt für das Vortraining großer Modelle verwenden oder sich in den von Agent Loop generierten Operatorcode vertiefen, um die Implementierung eines leistungsstarken Trainings-Frameworks zu erlernen. Die Open-Source-Codebasis von ForgeTrain selbst ist ein ausführbares Lehrbuch zum „H100 High Performance Training Project“.
  • KI-Infrastrukturteam: Technische Teams, die für die KI-Trainingsinfrastruktur von Unternehmen verantwortlich sind, können ForgeTrain verwenden, um die Kosten für die Rechenleistung zu senken (ca. 10 % MFU-Verbesserung im Vergleich zu Megatron-LM) und gleichzeitig zu vermeiden, durch Hardware-übergreifende Unterstützung an einen einzelnen Chip-Anbieter gebunden zu sein. Für Teams, die Optionen für Schulungsrahmen untersuchen, ist ForgeTrain aufgrund der Apache 2.0-Lizenz und des Open-Source-Community-Ökosystems eine risikoarme, langfristige Option.
  • Inländische Chip-Ökosystem-Entwickler: Entwickler, die Trainings-Stacks für inländische Chips wie Ascend und Cambrian schreiben, können die Harness-Methodik von ForgeTrain nutzen, um schnell exklusive Trainings-Frameworks für inländische Chips zu erstellen, anstatt bei Null anzufangen. Das „protokollgesteuerte, automatische Schmiede“-Modell von Harness reduziert die Arbeitskosten und den Zeitzyklus der Spananpassung.
  • KI-Agenten und Automatisierungstechnologie-Enthusiasten: ForgeTrain ist die hochmoderne Praxis der „KI, die KI macht“. Entwickler, die sich für Agent Loop, automatische Codegenerierung, KI-Selbstverbesserung und andere technische Richtungen interessieren, können sich mit dem Implementierungsmechanismus befassen. Agent-Friendly Quick Deploy ist so konzipiert, dass Coding Agent den gesamten Bereitstellungs- und Akzeptanzprozess selbstständig abschließen kann.

Nicht für die Masse geeignet: ForgeTrain ist für die folgenden Szenarien nicht geeignet: Einzelentwickler, die nicht über Hochleistungs-GPU-Cluster verfügen (Benutzer einer einzelnen Karte oder sogar ohne Karte können den Wert nicht erkennen); Teams, die gebrauchsfertige SaaS-Schulungsdienste benötigen (ForgeTrain ist ein Self-Service-Open-Source-Framework und bietet keine Hosting-Dienste); Teams, die kein Verständnis für das zugrunde liegende CUDA/PyTorch haben und nicht bereit sind, in den technischen Betrieb und die Wartung zu investieren; Unternehmen, die die Plattform nutzen (Datensatzverwaltung, Experimentverfolgung, Modellregistrierung usw.), sollten sie in Verbindung mit der herkömmlichen MLops-Plattform und nicht als Ersatz verwenden.

Zusammenfassung und Ausblick

Die zentrale Wettbewerbsfähigkeit von ForgeTrain liegt in seiner Fähigkeit, erstmals den vollständigen Übergang von „KI-made AI“ vom Konzept zur Implementierung auf Produktionsebene zu realisieren. Es handelt sich nicht um eine Proof-of-Concept-Demo, sondern um ein Trainingsframework in Produktionsqualität, das echte Modellgewichte auf einem 64-Karten-Cluster erzeugt hat. Seine Forge-Engineering-Methodik bietet der KI einen reproduzierbaren Weg zum unabhängigen Schreiben von Infrastruktursoftware – von der Festlegung von Standards über die schrittweise Anpassung bis hin zur Leistungsüberschreitung hat jeder Schritt klare Standards für das Bestehen.

Aktuelle Einschränkungen: – Begrenzte Auswahl an unterstützten Modellen: v0.1.0 verifizierte nur zwei Konfigurationen: MiniCPM4-0.5B (nur DP) und MiniCPM4-8B (TP=2). Modelle mit größerem Maßstab oder anderen Architekturen erfordern zusätzliche Anpassungsarbeiten.

  • Die Harness-Komponente ist noch nicht Open Source: Derzeit können Benutzer nur die erstellte Trainings-Engine verwenden und sind noch nicht in der Lage, den vollständigen Prozess des „unabhängigen Schmiedens“ zu erleben. Die Veröffentlichung des Agent Loop-Orchestrierungsframeworks ist das von der Community am meisten erwartete Feature.
  • Hoher Hardware-Schwellenwert: Für das vollständige Training ist eine H100-GPU mit 80 GB oder mehr erforderlich, und eine einzelne Karte kann das Vortraining auf Produktionsebene nicht abschließen, was die Teilnahme einzelner Entwickler einschränkt.
  • Das Community-Ökosystem befindet sich noch in einem frühen Stadium: Im Vergleich zu Megatron-LM und DeepSpeed, die über ausgereifte Communities und umfangreiche Dokumentation verfügen, werden bei ForgeTrain immer noch Tutorials, Fälle und Beiträge Dritter gesammelt.
  • Fehlende MLops-Integration: ForgeTrain konzentriert sich auf die Trainings-Engine selbst und umfasst keine MLops-Funktionen wie Experimentmanagement, Modellregistrierung und Bereitstellung und muss in Verbindung mit anderen Tools verwendet werden.

Beschaffungs- und Einführungsrisikobewertung: Für Unternehmen, die den Kauf von ForgeTrain planen, wird empfohlen, die Strategie „zuerst Pilot, Verifizierung in kleinem Maßstab und dann Erweiterung“ zu übernehmen. Überprüfen Sie zunächst, ob die Stabilitäts- und Leistungsdaten des Frameworks mit den offiziellen Daten für eine kleine Trainingsaufgabe übereinstimmen (z. B. einen MiniCPM4-0,5B mit 8 Karten und einem einzelnen Knoten). Erweitern Sie nach der Bestätigung das Modelltraining in größerem Maßstab. Besonderes Augenmerk muss auf folgende Aspekte gelegt werden: die offizielle Veröffentlichungszeit von Harness (die bestimmt, ob ein autonomer Forging-Workflow implementiert werden kann), das Gebührenmodell und Service-SLA von Wallface Intelligence für Support auf Unternehmensebene sowie die Nachhaltigkeit der langfristigen Wartung des Projekts. Aus Sicht des technischen Risikos basiert ForgeTrain auf ausgereiften Open-Source-Komponenten (PyTorch, CUTLASS, FlashAttention) und die Kerntrainings-Engine genießt hohe Glaubwürdigkeit. Das Hauptrisiko liegt in der Lieferqualität der Harness-Komponente und darin, ob das Community-Ökosystem weiter wachsen kann. Insgesamt ist ForgeTrain ein Projekt mit großem Potenzial und hat zunächst seine technische Machbarkeit bewiesen, es dauert jedoch noch lange, bis es durch ökologische Bauweise zu einem Mainstream-Trainingsrahmen wird.

Verwandte Tools: hugging-face, replicate

Versionsinfo

  • Erstveröffentlichung :Die erste öffentlich veröffentlichte Version unterstützt das verteilte Vortraining von MiniCPM4-0.5B und MiniCPM4-8B auf NVIDIA H100; umfasst den Quellcode der Trainings-Engine, 5 benutzerdefinierte CuTeDSL-GEMM-Operatoren und eine selbst entwickelte FlashAttention-Implementierung; Die Harness-Komponente (Agent Loop Orchestration Framework) soll veröffentlicht werden.
  • Erstveröffentlichung :Die erste öffentlich veröffentlichte Version unterstützt das verteilte Vortraining von MiniCPM4-0.5B und MiniCPM4-8B auf NVIDIA H100.

Benutzerbewertungen

  • Bewertungen werden geladen...