ACE-Ego
Kostenlos
ACE-Ego ist ein Open-Source-Forschungsprojekt für die Vorbereitung auf verkörperte Intelligenz und Roboterbedienung. Es schlägt eine Methode zur Anpassung desselben VLA-Modells an verschiedene Roboterontologien durch morphologische Zustandskodierung vor und eignet sich gut für kollaborative Operationsszenarien mit zwei Armen.
Vollständige Rezension von #ACE-Ego
Kernparameter und Statistiken
| Projekt | Spezifikationen |
|---|---|
| Produktpositionierung | Ontologieübergreifende verkörperte Operation VLA-Forschungsprojekt |
| Entwicklungsagentur | ACE Robotik-Forschungsteam |
| Kerntechnologie | Einheitliche Kameraraumaktion + morphologische Zustandskodierung |
| Trainingsdaten | Über 6.000 Stunden menschliches First-Person-Video + Roboter-/Simulationsdaten |
| Bewertungsbenchmark | RoboTwin 2.0 Leicht/Schwer |
| Bewertungsergebnis | 91,12 % / 90,62 % |
| Codestatus | Demnächst erhältlich |
ACE-Ego beantwortet eine praktische Frage: Verschiedene Roboter haben unterschiedliche Gelenkzahlen, Armlängen und Greifertypen. Der traditionelle Ansatz besteht darin, für jeden Roboter ein separates Modell zu trainieren. Die Idee von ACE-Ego besteht darin, ein Modell zur Anpassung an alle Roboter zu verwenden und sich dabei darauf zu verlassen, „wie der Roboter aussieht“ als bedingte Informationen an das Modell weiterzugeben.
Werbeüberprüfung: „91,12 %/90,62 % Genauigkeit“ – diese Zahlen werden bei bestimmten Benchmark-Aufgaben erreicht, darunter das Verpacken von Plastiktüten, das Verpacken von Schuhen und andere Szenarien im Einzelhandelsbetrieb. Die tatsächliche Leistung verschiedener Szenarien und Roboter schwankt und es besteht eine Lücke zwischen der Benchmark-Testumgebung und der realen Produktionslinienumgebung.
Benutzer- und Markterkennung
ACE-Ego befindet sich noch in der akademischen Forschungsphase und ist über Veröffentlichungen und Projektseiten öffentlich zugänglich. Sein technischer Wert liegt darin, ein skalierbares, ontologieübergreifendes VLA-Pre-Training-Framework vorzuschlagen, das beim RoboTwin 2.0-Benchmark Ergebnisse von über 90 % erzielt. Der Projektcode ist noch nicht als Open-Source-Lösung verfügbar, aber die im Papier beschriebene Lösung bietet einen neuen technischen Weg für das Lernen von Multi-Roboter-Operationen.
Werbeüberprüfung: „91,12 %/90,62 % Genauigkeit“ – diese Zahlen werden bei bestimmten Benchmark-Aufgaben erreicht, darunter das Verpacken von Plastiktüten, das Verpacken von Schuhen und andere Szenarien im Einzelhandelsbetrieb. Die tatsächliche Leistung verschiedener Szenarien und Roboter schwankt und es besteht eine Lücke zwischen der Benchmark-Testumgebung und der realen Produktionslinienumgebung.
Kostenvorteil
| Abmessungen | Beschreibung |
|---|---|
| Papier- und Projektseite | Kostenlos für die Öffentlichkeit |
| Code | Demnächst erhältlich (voraussichtlich Open Source) |
| API-Dienst | Nicht bereitgestellt |
| Kommerzielle Lizenz | Nicht bekannt gegeben |
Kostenlose Wahrheit: Forschungsarbeiten und Projektseiten sind kostenlos, aber die Reproduktion der Ergebnisse erfordert Ihre eigene Roboterhardware und Schulungsrechenleistung. Die Kosten für eine Dual-Arm-Roboterplattform liegen zwischen 50.000 und 200.000 US-Dollar, und für das Training des VLA-Modells ist ein GPU-Cluster mit mehreren Karten erforderlich. Für Forschungsteams ohne Hardware-Voraussetzungen sind die Kosten für die Verifizierung viel höher als die Nullkosten für das Lesen von Arbeiten.
Hauptfunktionen
- Einheitliche VLA über die Ontologie hinweg: Dasselbe Modell passt sich durch morphologische Zustandskodierung an die kinematischen Strukturen (URDF-Informationen) verschiedener Roboter an, ohne dass für jeden Robotertyp ein separates Training erforderlich ist. Von „ein Roboter, ein Modell“ bis hin zu „mehrere Roboter teilen sich ein Modell“ werden die Modellwartungskosten erheblich reduziert.
- Komplexe Operationen mit Zusammenarbeit beider Arme: Unterstützt Einzelhandelsbetriebsszenarien, die die Zusammenarbeit beider Arme erfordern, wie z. B. das Verpacken von Plastiktüten und das Verpacken von Schuhen. Die Koordination beider Arme ist ein schwieriger Punkt bei der Roboterbedienung – die linke Hand fixiert das Objekt und die rechte Hand führt die Operation aus. Die beiden Sätze kinematischer Ketten müssen zeitlich und räumlich genau ausgerichtet sein.
- Vortraining mit gemischten Daten: Fusion von Videos aus der Perspektive der menschlichen Ego-Perspektive (mehr als 6.000 Stunden), Roboter-Teleoperationsdaten und Simulations-Rollout-Daten für ein gemeinsames Vortraining. Menschliche Videos bieten eine reichhaltige betriebliche Vielfalt, Roboterdaten liefern präzise Handlungsanmerkungen und Simulationsdaten ergänzen die Flugbahnen von Erkundungsoperationen.
Modell- und Versionsentwicklung
Hauptversion
- ~2026-06: ACE-Ego-Papier und Projektseite werden zum ersten Mal veröffentlicht, Code folgt in Kürze.
Technische Vorteile
Der wichtigste technologische Durchbruch von ACE-Ego besteht darin, „einem Modell verständlich zu machen, wie es aussieht“. Die traditionelle VLA-Methode geht davon aus, dass der Roboterkörper fixiert ist. ACE-Ego bricht diese Annahme durch zwei Schlüsseldesigns:
-
Gleichmäßige Aktionen im Kameraraum: Verschiedene Roboter haben unterschiedliche mechanische Armlängen und unterschiedliche Gelenkwinkelbereiche. Die gleiche Aktion „nach vorne greifen“ hat völlig unterschiedliche Darstellungen im Gelenkraum. ACE-Ego stellt Aktionen einheitlich im Kamerakoordinatensystem dar – egal wie der Roboter aussieht, das Ziel „die Hand 10 Zentimeter nach vorne rechts auf dem Bildschirm bewegen“ wird konsistent im Kameraraum dargestellt.
-
Morphologische Zustandskodierung: Fügen Sie die URDF-Struktur (Unified Robot Description Format) des Roboters und kinematische Einschränkungsinformationen zur Modelleingabe hinzu, damit das Modell weiß, „welchen Roboter ich gerade verwende und wie sich seine Gelenke drehen“. Der Effekt besteht darin, dass derselbe Satz von Netzwerkparametern unterschiedliche Subnetzwerkpfade auf verschiedenen Robotern aktiviert.
Wie man es benutzt
ACE-Ego ist derzeit als Forschungsarbeit öffentlich verfügbar und der Code wurde noch nicht veröffentlicht. Geschätzter Nutzungsprozess:
- Besuchen Sie die Projektseite, um mehr über technische Lösungen zu erfahren
- Warten Sie, bis der GitHub-Code Open Source ist, und laden Sie ihn herunter
- Konfigurieren Sie die Trainingsumgebung und die Roboterhardware gemäß der Dokumentation
- Bereiten Sie Vortrainingsdaten vor oder laden Sie sie herunter
- Feinabstimmung oder Bereitstellung direkt auf dem Zielroboter
Produktpreise
Derzeit gibt es keine kommerzielle Form und es ist ausschließlich für die Forschungsgemeinschaft bestimmt. Es wird erwartet, dass der Code unter einer akademischen Open-Source-Lizenz (wie MIT/Apache 2.0) als Open-Source-Code bereitgestellt wird und die kommerzielle Nutzung die Bestätigung spezifischer Lizenzbedingungen erfordert.
Grenze der Zusammenarbeit zwischen Mensch und Maschine: 100 % Automatisierung: Modellinferenz und Ausführung von Roboteroperationen. Manuelle Eingriffe sind erforderlich: Qualitätsprüfung und stichprobenartige Überprüfung der Betriebsergebnisse, manuelle Eingriffe bei abnormalen Situationen sowie Anpassung der Trainingsdaten und des Szenendesigns. Bei der Migration zwischen Ontologien müssen Sie manuell bestätigen, ob der Migrationseffekt wie erwartet ist.
Anwendungsszenarien
- Automatisierung von Lagervorgängen im Einzelhandel: kollaborativer Betrieb beider Arme wie Verpackung von Plastiktüten, Schuhkartons, Produktsortierung usw. Die ontologieübergreifende Fähigkeit von ACE-Ego bedeutet, dass derselbe Satz von Modellen auf verschiedenen Robotertypen eingesetzt werden kann, was für Szenarien geeignet ist, in denen mehrere Roboter gleichzeitig in Lagern laufen.
- Einheitlicher Einsatz mehrerer Roboter: Verschiedene Robotermarken und -modelle werden in Fabriken oder Lagerhäusern gemischt. ACE-Ego ermöglicht es dem Betriebs- und Wartungsteam, den gleichen Modellsatz zur Verwaltung aller Roboter zu verwenden, wodurch der Wartungsaufwand durch „ein KI-Modell für jeden Roboter“ reduziert wird.
- Forschung zum Transfer von Roboterkompetenzen: An einem Roboter trainierte Fähigkeiten werden durch die ontologieübergreifende Fähigkeit des Modells auf einen anderen Roboter übertragen. Geeignet für F&E-Teams, die betriebliche Fähigkeiten zwischen verschiedenen Hardwareplattformen migrieren müssen.
Abschreckungsszenario: Wenn Ihr Roboter nur über ein einziges Modell verfügt und nicht kurzfristig ersetzt wird, ist ein speziell trainiertes einzelnes VLA-Modell in der Regel leistungsfähiger als ein ontologieübergreifendes Modell – die Verbesserung der Generalisierungsfähigkeiten geht zu Lasten der Genauigkeit bei einem bestimmten Roboter. Der Wert von ACE-Ego kommt in Szenarien voll zur Geltung, in denen eine „einheitliche Verwaltung mehrerer Modelle“ erforderlich ist.
Aktuelle Einschränkungen: Der Code ist noch nicht Open Source (in Kürze verfügbar) und technische Lösungen können nur durch Papiere evaluiert werden. Das Testszenario von RoboTwin 2.0 ist der Einzelhandelsbetrieb, und die Generalisierungsfähigkeit in anderen Szenarien (z. B. Präzisionsmontage, medizinische Chirurgie) wurde nicht überprüft.
Anwendbare Personen
- Forscher verkörperter Intelligenz: Akademische Forscher mit Schwerpunkt auf VLA, ontologieübergreifender Generalisierung und Multitasking-Roboterlernen.
- Robot Algorithm Team: Algorithmeningenieure, die mehrere Roboterontologien gleichzeitig verwalten und die Kostenleistung von Cross-Ontologie-Modellen und Einzelkörpermodellen bewerten müssen.
- Einzelhandels- und Lagerautomatisierungsteam: Das tatsächliche Betriebsszenario umfasst die Zusammenarbeit eines Ingenieurteams mit mehreren Robotertypen.
Zusammenfassung und Ausblick
Es bietet wettbewerbsfähige Lösungen in seinem Bereich und sein Kernwert liegt darin, die Schwelle für den Einsatz von KI in diesem Bereich zu senken.
Aktuelle Einschränkungen: Für einige erweiterte Funktionen ist ein kostenpflichtiges Abonnement erforderlich, und die kostenlose Version unterliegt Funktions- oder Nutzungsbeschränkungen. Spezifische technische Details und Leistungsbenchmarks wurden noch nicht vollständig bekannt gegeben.
Verwandte Tools: hugging-face, replicate
Versionsinfo
- ACE-Ego :Erste öffentliche Veröffentlichung und Projektseite, GitHub-Code in Kürze verfügbar, noch kein offizielles genaues Datum.
- ACE-Ego :Erste öffentliche Veröffentlichung, noch kein offizielles genaues Datum.
Benutzerbewertungen