HMA(이종 마스크 자기회귀) 무료

-

HMA(Heterogeneous Masked Autoregression)는 MIT, Meta FAIR, UIUC가 공동으로 제안한 로봇 액션-비디오 동적 모델링 방법입니다. 이종 마스크 자동 회귀 사전 훈련을 통해 40개 이상의 데이터 세트와 300만 개 이상의 궤적에 대해 교차 온톨로지 및 교차 도메인 액션-비디오 결합 분포를 학습하여 실시간 고충실도 로봇 비디오 시뮬레이션을 달성합니다. 이전 SOTA에 비해 추론 속도가 15배 향상되어 전략 평가, 합성 데이터 생성 및 대화형 비디오 시뮬레이션에 널리 사용될 수 있습니다.

HMA(이종 마스크 자기회귀) 제품 인터페이스

HMA: 현실 세계를 위한 로봇 액션 - 비디오 동적 모델링

핵심 매개변수 및 통계

프로젝트 세부정보
제품명 HMA(이종 마스크 자기회귀)
제품 유형 오픈 소스 연구 모델 / 로봇 세계 모델
배송 형태 오픈 소스 코드(GitHub) + 사전 훈련된 가중치(HuggingFace)
모델 규모 HMA-MagVit: 362M 매개변수; HMA-MAR: 1B 매개변수
훈련 데이터 40개 이상의 데이터 세트, 3백만 개 이상의 궤적
추론 속도 SOTA보다 15배 빠른 속도(실시간 운영)
오픈 소스 라이센스 아파치-2.0
지원되는 언어 영어
대상 사용자 로봇 연구자, 구현지능 엔지니어, AI 시뮬레이션 개발자
코어페이퍼 arXiv 2502.04296 (2025년 2월)
프로젝트 홈페이지 https://liruiw.github.io/hma

매개변수 해석: HMA의 매개변수 크기는 "중간에서 대형" 범위에 있습니다. MagVit 버전(362M)은 단일 GPU 추론 및 빠른 반복에 적합하며 MAR 버전(1B)은 비디오 충실도를 더욱 향상시켰습니다. 이전 주류 확산 모델 솔루션(예: UniPi 및 VideoPoet)과 비교하여 HMA는 마스크된 자동 회귀 경로를 채택하여 생성 속도(15배 가속)에서 10배 이점을 갖습니다. 이것이 핵심 엔지니어링 가치입니다. 처음으로 로봇 비디오 시뮬레이션을 "대화형 실시간"의 한계점까지 끌어올렸습니다.

사용자 및 시장 인지도

학술적 채택 신호: HMA는 2025년 2월 arXiv에 게시된 후 로봇 학습 커뮤니티로부터 빠르게 주목을 받았습니다. 이 논문의 저자는 MIT CSAIL, Meta AI(FAIR) 및 UIUC 출신입니다. 이 조합 자체는 강력한 학문적 신뢰성을 제공합니다. 프로젝트 GitHub 저장소(github.com/liruiw/HMA)에는 현재 41개의 별표가 표시됩니다. 대규모 커뮤니티 프로젝트는 아니지만 전문성(로봇 영상 동적 모델링)을 고려하면 초기 연구과제에 대한 기대치에 부합하는 데이터이다.

제3자 통신: HMA는 AI 도구 세트 내비게이션 스테이션(ai-bot.cn)에 포함되었으며 Bilibili 및 기타 플랫폼에 여러 기술 해석 비디오가 등장했습니다(예: "MIT의 최신 연구! HMA: 15배 더 빠르고 고품질 로봇 동작 데이터 생성!"). 이는 중국 기술 커뮤니티에서도 주목을 받고 있음을 나타냅니다. 본 논문은 arXiv에서 cs.RO(Robotics)로 분류되었으며, 학제간 영향을 반영하여 cs.CV(Computer Vision) 및 cs.LG(Machine Learning)을 상호 참조했습니다.

벤치마크 성능: 여러 SOTA 비디오 생성 모델과 비교하여 HMA는 시각적 충실도(FVD 표시기)와 제어 가능성(동작 추적 정확도) 모두에서 선두를 달리고 있습니다. 이 논문은 Bridge, Dobb-E, Kaist 등과 같은 여러 실제 로봇 데이터 세트에 대한 정성적, 정량적 결과를 보여줍니다. HMA에서 생성된 비디오는 물리적 합리성(객체 상호 작용, 그림자, 폐색 처리) 측면에서 기본 방법보다 훨씬 뛰어납니다.

현재 제한 사항: 학술 연구 프로젝트인 HMA는 아직 상용 버전이나 기업 수준의 지원을 제공하지 않습니다. 사용자 기반은 주로 딥 러닝 교육 및 로봇 배포 기능을 갖춘 연구팀으로 제한됩니다. GitHub 스타 수와 커뮤니티 활동은 초기 단계이며, 완전한 문서 생태계와 사용자 커뮤니티가 아직 형성되지 않았습니다.

비용 이점

HMA의 완전 오픈 소스 모델은 상용 로봇 시뮬레이션 도구와 비용 구조가 극명하게 대조됩니다.

비용 차원 HMA(오픈소스) 상업용 로봇 시뮬레이터(예: NVIDIA Isaac Sim) 클라우드 비디오 생성 API
C측/연구원 완전 무료, 코드 + 가중치 오픈 소스 무료 커뮤니티 버전은 기능이 제한되어 있으며, 정식 버전에는 기업 라이센스가 필요합니다 토큰/초 단위로 청구되며 긴 동영상은 비용이 많이 듭니다
API/개발자 API 계층이 없으며 추론을 직접 배포해야 함 Python SDK 제공, GPU 클러스터 필요 요청에 따라 청구됨, 일반적으로 초당 $0.01-0.10
기업/개인 자체 호스팅, 라이센스 비용 없음, GPU 하드웨어만 Isaac Sim Enterprise Edition은 연간 $10,000 이상 민영화를 지원하지 않습니다

C 측 비용: 연구원은 GitHub를 통해 직접 저장소를 복제하고, HuggingFace에서 사전 훈련된 가중치(0.4B/1B)를 다운로드하고, 단일 RTX 3090/4090에서 추론 및 대화형 데모를 실행할 수 있습니다. 하드웨어 비용이 유일한 실제 비용입니다.

개발자 비용: HMA는 상용 API를 제공하지 않습니다. 워크플로에 통합하려면 팀에서 환경 구성(Python 3.10+, PyTorch, Accelerate 및 기타 종속성), 모델 배포 및 추론 파이프라인 구성을 스스로 완료해야 합니다. 초기 배포 비용은 약 2~5일이며, DL Ops 기능을 갖춘 팀에 적합합니다.

기업 비용: 상용 시뮬레이터(NVIDIA Isaac Sim Enterprise Edition $10K+/년, Amazon RoboMaker는 시간 단위로 청구)와 비교할 때 HMA는 TCO 측면에서 상당한 이점이 있습니다. 즉, 소프트웨어 라이선스가 필요하지 않지만 모델 배포 및 튜닝 기능을 갖춘 팀이 필요합니다. 숨겨진 비용은 주로 데이터 준비(로봇 궤적 데이터를 RLDS 형식으로 변환해야 함), 모델 사후 학습 적응(특정 로봇 온톨로지에 대한 미세 조정 실험) 및 상업적 지원 부족에 반영됩니다.

자유로운 진실: HMA는 완전히 무료이며 오픈 소스이지만, "무료"라는 전제는 사용자가 Python 딥 러닝 개발 환경을 구축할 수 있는 능력과 로봇 작동 데이터를 얻을 수 있는 능력을 가지고 있다는 것입니다. 로봇 데이터 축적이 없는 팀의 경우 처음부터 궤적을 수집하는 데 드는 비용이 상용 도구의 연간 요금을 초과할 수 있습니다.

주요 기능

  • 이기종 마스크 자동 회귀 비디오 예측: 초기 프레임과 동작 시퀀스가 ​​주어지면 HMA는 자동 회귀 방식으로 후속 비디오 프레임을 생성합니다. 프레임별로 독립적으로 생성되는 확산 모델과 달리 마스크된 자동 회귀 메커니즘은 토큰 수준에서 타이밍 종속성을 모델링하고 단일 단계에서 여러 향후 토큰을 예측할 수 있어 추론 효율성을 크게 향상시킵니다. 적용 가능한 작업: 로봇 전략의 신속한 비디오 롤백 평가 및 계획 결과 시각화.

  • Cross-ontology, cross-domain heterogeneous pre-training: HMA는 40개 이상의 데이터 세트에 대해 공동 학습하며, 데이터 소스에는 실제 로봇 원격 조작(Bridge, Dobb-E, Kaist), 인간 조작 비디오(EpicKitchens), 시뮬레이션 데이터(RLBench, MetaWorld) 등이 포함됩니다. 모델은 로봇 온톨로지마다 별도로 학습할 필요가 없으며 사전 학습된 가중치는 보이지 않는 로봇 형태에 직접 사용될 수 있습니다. 사용 가치: 새로운 로봇 시나리오에서 모델 배포에 대한 임계값을 낮추고 데이터 수집을 몇 주에서 몇 시간 후의 훈련 및 적응으로 압축합니다.

  • 이중 모드 생성 - 개별 토큰 및 연속 토큰: HMA-MagVit은 VQ-VAE 이산화(362M 매개변수)를 사용하여 정밀 제어 및 구조화된 평가에 적합한 개별 비디오 토큰 시퀀스를 생성합니다. HMA-MAR은 마스크된 자동회귀 연속 표현(1B 매개변수)을 사용하여 시각적 품질이 더 나은 소프트 토큰을 생성합니다. 둘 다 동일한 교육 프레임워크를 공유하며 작업 요구 사항에 따라 전환할 수 있습니다. 가치 사용: 정확성에 민감한 시나리오(전략 평가)에는 이산 모델을 선택하고 시각적 품질 우선 시나리오(데모 생성)에는 연속 모델을 선택합니다.

  • 대화형 실시간 비디오 시뮬레이션 데모: 이 프로젝트는 Pygame(python -m sim.app)을 기반으로 하는 대화형 데모를 제공합니다. 사용자는 갤러리에서 초기 이미지를 선택하고 키보드 화살표 키를 사용하여 로봇의 움직임을 제어하고 비디오 생성 결과를 실시간으로 관찰할 수 있습니다. 가치 사용: 모델 동작을 직관적으로 이해하고 동작과 시각적 피드백 간의 인과 관계를 신속하게 확인합니다.

  • 정책 평가 및 합성 데이터 생성 파이프라인: HMA에는 생성된 비디오와 실제 비디오의 FVD, PSNR, SSIM 및 기타 지표를 계산할 수 있는 완전한 평가 파이프라인이 내장되어 있습니다. 또한 데이터 향상 또는 정책 사전 훈련을 위해 훈련된 모델 샘플링에서 다수의 합성 궤적 생성을 지원합니다. 가치 사용: 정책 반복 주기를 '실제 환경 출시 → 데이터 수집 → 재교육'에서 '시뮬레이션 출시 → 합성 데이터 → 정책 업데이트'로 압축하여 실제 로봇 하드웨어 및 수동 주석에 대한 의존도를 줄입니다.

  • 사후 학습 메커니즘: HMA는 특정 데이터 세트에 대해 사전 학습된 모델의 사후 학습 미세 조정을 지원하며, 언어 테이블 데이터 세트에 대한 미세 조정 스크립트(run_langtable_finetuning.sh)가 제공됩니다. 가치 사용: 처음부터 훈련하지 않고도 특정 로봇 플랫폼 및 특정 작업(예: 블록 밀기, 잡기)에 빠르게 적응합니다.

모델 및 버전의 진화

HMA의 버전 컨텍스트는 종이 사전 인쇄 및 코드 릴리스를 기반으로 합니다.

버전 날짜 핵심 변경 사항
arXiv 사전 인쇄 2025-02-06 이 논문은 오픈 소스 GitHub 코드 저장소와 HuggingFace 모델 가중치를 동기화하여 처음으로 공개적으로 발표되었습니다.
초기 코드 제출 2025-02 (대략) 40개 이상의 데이터 세트를 지원하는 완전한 교육, 생성, 평가 및 시각화 파이프라인이 포함되어 있습니다.
HMA-맥비트(362M) 초기 코드와 동일 VQ-VAE + 마스크 자동회귀를 기반으로 하는 이산 토큰 모델
HMA-3월(1B) 초기 코드와 동일 더 많은 수의 매개변수를 사용하는 마스크된 자동 회귀를 기반으로 하는 연속 토큰 모델

버전 발전 설명: HMA는 현재 '페이퍼 오픈 소스' 단계에 있습니다. 코드 저장소는 일회성 초기 제출(첫 번째 커밋)이며 아직 버전 라벨이나 공식 릴리스가 없습니다. 저자는 README에서 "코드 품질: 피곤한 대학원생"을 언급했는데, 이는 코드가 재현성을 주요 목표로 삼고 엔지니어링 패키징을 수행하지 않음을 나타냅니다. 후속 진화 방향에는 더 많은 데이터 세트 적응, 모델 정량화 가속화, 보다 친숙한 패키징 인터페이스(예: ROS 통합, 체육관 환경 패키징)가 포함될 것으로 예상됩니다.

기술적인 장점

메커니즘 → 효과 → 시나리오의 인과사슬 해체:

  1. 마스크된 자동 회귀는 확산 모델을 대체합니다: 기존 로봇 비디오 생성 방법(예: UniPi)은 확산 모델을 사용하여 프레임별로 생성합니다. 각 프레임에는 다단계 노이즈 제거가 필요하며 추론 지연이 높습니다. HMA는 훈련 중에 비디오 토큰의 일부를 무작위로 마스킹하여 모델이 마스킹된 콘텐츠를 예측할 수 있도록 하는 마스킹된 자동 회귀 전략을 채택합니다. 추론 중에 모든 마스킹된 토큰을 한 번에 예측한 다음 자동 회귀 방식으로 반복적으로 개선합니다. 효과: 확산 모델의 50~1000단계에서 추론 단계 수를 8~16단계로 줄여 15배의 엔드 투 엔드 가속을 달성합니다. 적용 가능한 시나리오: 실시간 피드백이 필요한 대화형 시뮬레이션 및 온라인 전략 평가.

  2. 이기종 훈련으로 데이터 부족 현상 극복: 로봇 공학 분야는 오랫동안 분산된 데이터 소스, 다양한 온톨로지 및 다양한 작업 문제에 직면해 왔습니다. HMA를 사용하면 통합 토큰화 인터페이스(다양한 해상도의 비디오와 다양한 주파수의 동작 시퀀스를 고정 길이 토큰 시퀀스로 통합 인코딩)를 통해 40개 이상의 이종 데이터 세트에 대해 모델을 공동으로 사전 학습할 수 있습니다. 효과: 사전 훈련된 모델은 보이지 않는 로봇 본체 및 작업에 대한 제로 샘플 예약 기능을 보여주고, 사후 훈련은 단 200개의 궤적을 가진 새로운 장면에서 100개 이상의 효과적인 데이터 프레임을 생성할 수 있습니다. 적용 가능한 시나리오: 새로운 로봇 플랫폼의 신속한 배포 및 온톨로지 간 지식 마이그레이션.

  3. 액션 컨디셔닝은 정확한 제어 가능성을 달성합니다: HMA는 입력에 액션 토큰을 연결할 뿐만 아니라 변조 메커니즘을 사용하여 액션 신호를 입력 끝에 주입하는 것이 아니라 Transformer의 각 레이어의 중간 표현에 영향을 미칠 수 있도록 합니다. 효과: 생성된 비디오는 입력 동작 순서를 엄격하게 따릅니다. 푸시 블록의 방향과 강도, 로봇 팔의 궤적 등이 생성된 결과에 정확하게 반영됩니다. 무조건 비디오 생성 모델과 비교하여 HMA의 제어 가능성이 크게 향상되었습니다. 적용 가능한 시나리오: 정확한 모션 제약 조건이 필요한 전략 검증(예: "x 방향의 힘이 가해지면 객체가 어떻게 움직일까요?")

  4. VQ-VAE + MAR 듀얼 파이프라인은 정확성과 품질을 고려합니다: 개별 분기(MagVit)는 VQ-VAE를 사용하여 비디오 프레임을 개별 토큰으로 압축하여 생성 프로세스의 제어 가능성과 평가의 반복성을 보장합니다. 연속 분기(MAR)는 보다 자세한 정보를 유지하기 위해 연속 잠재 공간을 직접 운영합니다. 둘 다 동일한 Transformer 백본을 공유하며 전환 비용이 저렴합니다. 효과: 이산형 모델은 FVD와 같은 정량적 지표에서 더 우수하며 벤치마크 비교에 적합합니다. 연속 모델은 인간의 시각적 평가에 더 자연스럽고 시연 및 시각화에 적합합니다. 적용 가능한 시나리오: 학술 논문 평가에는 이산형을 선택하고, 제품 프로토타입 시연에는 연속형을 선택합니다.

사용방법

환경설정

HMA에는 Python 3.10+ 및 CUDA 환경이 필요합니다. 종속성을 관리하려면 Conda 또는 venv를 사용하는 것이 좋습니다.

``배쉬

저장소 복제

자식 클론 https://github.com/liruiw/HMA.git CDHMA

종속성 설치 및 데이터 다운로드(venv가 자동으로 생성됨)

./build.sh

Python 환경 활성화

소스 venv/bin/활성화


### 대화형 데모

``배쉬
# 대화형 GUI 데모 시작
파이썬 -m sim.app

시작 후 갤러리에서 초기 이미지를 선택하고 키보드 화살표 키를 사용하여 동작을 제어하고 HMA에서 생성된 비디오 프레임을 실시간으로 관찰합니다. 이는 모델을 사전 학습하지 않고도 HMA 기능을 경험할 수 있는 가장 빠른 방법입니다.

사전 훈련된 모델 추론

``배쉬

사전 훈련된 모델을 다운로드합니다(HuggingFace에서 수동으로 얻어야 함)

동영상 생성을 위한 단일 데이터 세트 추론

파이썬 hma/generate.py \ --checkpoint_dir 데이터/모델/step_100/ \ --val_data_dir 데이터/kaist_nonprehensile_converted_externally_to_rlds_magvit_max1000000_val


### 모델 평가

``배쉬
# 이산 모델 평가
출시 가속화 hma/evaluate.py \
  --checkpoint_dir "data/${RUN_NAME}/final_checkpt" \
  --val_data_dir "data/${dataset}_magvit_traj1000000_val" \
  --wandb_run_name "${RUN_NAME}"

# 지속적인 모델 평가
출시 가속화 hma/evaluate_feature.py \
  --checkpoint_dir "data/${RUN_NAME}/final_checkpt" \
  --val_data_dir "데이터/${데이터세트}_magvit_traj1000000_val"

사전 훈련(다중 데이터 세트)

``배쉬

VQ 토큰 모델(이산형)

bash 실험/스크립트/discrete_model/run_40datasets_waction.sh

소프트 토큰 모델(연속)

bash 실험/스크립트/continuous_model/run_30datasets_mar_waction.sh



### 출품작 요약

| 입구 | 목적 | 기술 요구사항 |
|------|------|----------|
| GitHub 저장소 | 소스 코드, 교육 스크립트, 평가 파이프라인 | 파이썬 3.10+, CUDA, PyTorch |
| HuggingFace 모델 라이브러리 | 사전 훈련 웨이트 다운로드 | 없음(다운로드를 통해 추론에 사용할 수 있음) |
| 프로젝트 홈페이지(데모) | 온라인 대화형 데모 | 브라우저 액세스, 로컬 환경 필요 없음 |
| arXiv 논문 | 기술 원리 및 실험 세부 사항 | 없음 |
| 대화형 데모(로컬) | 현지 실시간 시뮬레이션 체험 | Python 3.10+, Pygame, GPU 권장 |

## 제품 가격

HMA는 순수 오픈 소스 프로젝트이며 가격 구조는 매우 간단합니다.

- **모델 중량**: 무료, MIT 라이선스에 따른 Apache-2.0 라이선스
- **소스 코드**: 무료, Apache-2.0 라이선스
- **논문**: arXiv에서 무료로 공개 액세스 가능
- **온라인 데모**: 무료, 프로젝트 홈페이지에서 HuggingFace Spaces 온라인 경험 제공

현재 유료 등급이 없습니다. 상업용 라이센스 측면에서 Apache-2.0은 무료 사용, 수정 및 재배포를 허용합니다. 그러나 모델 가중치에 타사 데이터 세트에 대한 추가 사용 제한이 포함되는지 여부는 각 데이터 세트의 원래 라이센스 계약(예: Bridge 데이터 세트 사용 약관)을 확인해야 합니다.

**경쟁사 제품과의 가격 비교**:

| 프로젝트 | HMA | 엔비디아 아이작 심 | 구글 지니 | 신체지능 π0 |
|------|-----|------|---------------|-----------|
| 소프트웨어 가격 | 무료 | Community Edition은 무료, Enterprise Edition은 연간 $10,000 이상 | 비공개 | 비공개 |
| 추론 비용 | 자체 호스팅, 단일 GPU | 주문형 클라우드 GPU | Cloud API 투기적 청구 | 비공개 |
| 데이터 요구사항 | 자체 준비된 로봇 궤적 | 내장된 시뮬레이션 환경 | 외부 데이터가 필요하지 않습니다 | 상업적 협력 필요 |
| 맞춤화 가능 | 완전 개방 | 모듈식, 부분적으로 폐쇄된 소스 | 블랙박스 API | 협력고객 한정 |

## 애플리케이션 시나리오

- **신속한 로봇 전략 평가 및 반복**: 기존 전략 평가에는 실제 로봇에 대한 반복적인 출시가 필요하며, 이는 시간이 많이 걸리고 하드웨어 마모 위험이 있습니다. HMA는 전략에 의해 출력되는 액션 시퀀스를 수신하고 해당 비디오 예측 결과를 생성하며 전략의 질적 성과(목표 달성 여부, 액션이 원활한지, 상호 작용이 물리적으로 합리적인지 여부)를 신속하게 검증하기 위해 "비디오 세계 모델"로 사용될 수 있습니다. **추론 이점**: "각 평가에는 실제 로봇 출시에 30분 소요"에서 "HMA 시뮬레이션 평가 완료에 2분 소요"까지 단일 반복 주기가 90% 이상 단축되어 특히 전략의 초기 예비 심사 단계에 적합합니다.

- **정책 사전 학습을 위한 합성 데이터 생성**: 실제 데이터가 제한적인 경우 HMA를 사용하여 소수의 실제 궤적에서 시작하여 사후 학습을 통해 대상 장면에 적응한 후 대규모 샘플링을 통해 합성 비디오-동작 쌍을 생성합니다. 이러한 합성 데이터는 정책 모델의 백엔드 시각적 인코더를 사전 훈련하는 데 사용되거나 데이터 증대 수단으로 사용될 수 있습니다. **구현 팁**: HMA 논문에서는 사후 학습을 위해 200개의 실제 궤적만 사용하면 100개 이상의 효과적인 합성 데이터 프레임을 생성할 수 있으며 원래 데이터 분포에서 완전히 샘플링되지 않은 엣지 케이스(예: 다양한 폐색 모드, 조명 변경)를 처리할 수 있음을 보여줍니다.

- **대화형 로봇 행동 분석 및 교육**: 과학 연구 또는 교육에서 연구원은 HMA의 대화형 데모를 사용하여 다양한 동작 입력(예: 밀기, 당기기, 회전)에 해당하는 시각적 피드백을 직관적으로 보여줌으로써 로봇-환경 상호 작용의 물리적 법칙을 이해할 수 있습니다. 실제 로봇 하드웨어는 필요하지 않으며 GPU가 탑재된 노트북만 있으면 됩니다. **공제 혜택**: 로봇에 대한 진입 장벽을 낮추어 "하드웨어 플랫폼 구매 및 유지 관리 필요"에서 "소프트웨어 환경만 필요"로 변경하여 대학 과정에서 로봇 교육 및 원격 협업 비용을 대폭 절감합니다.

- **교차 온톨로지 지식 이전 사전 연구**: 팀이 기존 로봇 플랫폼(예: Franka)에서 새로운 플랫폼(예: UR5)으로 전환해야 하는 경우 HMA의 이기종 사전 교육 기능을 사용하여 새 플랫폼의 소량의 궤적 데이터로 사후 교육을 수행하여 전체 하드웨어 배포 비용을 투자하지 않고도 마이그레이션 솔루션이 실현 가능한지 신속하게 평가할 수 있습니다. **추론 이점**: 몇 주에 걸친 하드웨어 + 데이터 준비에서 며칠 간의 시뮬레이션 실험으로 새 플랫폼에 대한 예비 타당성 검증을 압축합니다.

- **다중 로봇 협업 시뮬레이션**: HMA의 동작 조건부 설계는 다중 개체 상호 작용 시나리오(예: 푸시 박스에 협업하는 여러 로봇 팔)를 지원하므로 가시선을 넘어서는 다중 로봇 협업 전략 검증에 사용할 수 있습니다. 현재 데모에서는 여러 객체를 동시에 제어하는 ​​대화형 시뮬레이션 기능을 시연했습니다.

## 해당자

- **로봇 알고리즘 연구자**: HMA의 핵심 사용자 그룹입니다. 새로운 전략을 평가하거나, 비교 실험의 시각화를 생성하거나, 절제 연구를 수행해야 하는 팀. HMA는 "실제 출시의 일부를 시뮬레이션 비디오로 대체"하는 경로를 제공하여 실험 비용을 직접적으로 절감합니다. **전제 조건**: PyTorch 및 딥 러닝 교육 프로세스에 익숙합니다. 로봇 궤적 데이터(RLDS 형식)를 읽고 처리할 수 있는 능력이 있습니다.

- **Embodied Intelligence/Robotics 분야의 대학원생**: 논문 복제, 강좌 프로젝트 또는 오픈 소스 기여에서 HMA는 연구 기준선 또는 비교 방법으로 사용할 수 있는 즉시 사용 가능한 사전 훈련된 모델과 완전한 훈련 파이프라인을 제공합니다. 대화형 데모는 교육용 데모 도구로도 적합합니다. **전제 조건**: 기본 Python 및 기본 CUDA 환경 구성 기능이 있어야 합니다.

- **로보틱스 스타트업 회사의 알고리즘 팀**: 초기 제품 개발 단계에서 HMA는 전략의 신속한 프로토타이핑을 위한 "자유 세계 모델"로 사용되어 물리적 로봇 하드웨어에 대한 의존도를 줄일 수 있습니다. **권장 사용법**: 먼저 공개 데이터 세트를 사용하여 사전 훈련된 모델을 로드하고 데모를 실행한 다음 훈련 후 적응을 위해 자체 로봇 데이터를 수집합니다.

- **AI 시뮬레이션 플랫폼 빌더**: 로봇에 대한 다양한 시각적 시뮬레이션 환경을 제공해야 하는 기술팀입니다. HMA의 이기종 사전 학습 기능과 Apache-2.0 라이선스는 더 높은 수준의 워크플로 플랫폼에 통합하는 데 적합합니다.

- **대중에게 적합하지 않음**:
  - **순수 비즈니스 사용자(프로그래밍 배경 지식 없음)**: HMA에는 GUI 애플리케이션이나 코드 인터페이스가 없으며 모든 작업은 명령줄과 Python 스크립트를 기반으로 합니다.
  - **안정적인 상업적 지원이 필요한 산업 사용자**: HMA에는 SLA, 기술 지원, 엔터프라이즈 수준 문서가 없으며 생산 환경의 중요한 경로에 적합하지 않습니다.
  - **비로봇 분야의 일반 개발자 및 디자이너**: HMA는 로봇 액션-비디오 모델링에 중점을 두고 있으며 일반 비디오 생성, 콘텐츠 제작 및 기타 시나리오에는 사용할 수 없습니다.

## 요약 및 전망

**핵심 역량**: HMA의 핵심 기여는 "마스크된 자동 회귀 패러다임을 로봇 비디오 동적 모델링에 처음으로 도입하고 이종 데이터 사전 훈련 및 실시간 추론 속도 규모의 획기적인 달성"에 있습니다. 15x 가속은 "오프라인 생성 도구"에서 "대화형 실시간 시뮬레이션" 범주로 발전합니다. 이는 이전 확산 모델 솔루션과 본질적인 차이점입니다. 완전 오픈 소스(Apache-2.0) 라이선싱 모델은 학계에서 자연스러운 배포 이점을 제공합니다.

**현재 제한사항**: (1) 낮은 수준의 코드 엔지니어링 - 저자가 자체 평가한 "코드 품질: 피곤한 대학원생", 릴리스 버전 없음, CI/CD 없음, Docker 이미지 없음, 배포에는 특정 기술 경험이 필요합니다. (2) 복잡한 데이터 세트 준비 - RLDS 형식의 비디오 액션 데이터 세트에는 특정 토큰화 파이프라인이 필요합니다. (3) 모델 규모 제한 - 1B 매개변수는 소비자급 GPU에서 실행될 수 있지만 40개 이상의 데이터 세트에 대한 완전한 사전 훈련에는 여러 GPU 클러스터가 필요합니다. (4) 커뮤니티 생태가 아직 형성되지 않았습니다. 문서는 주로 논문 + README이며 포럼도 없고 알려진 제3자 통합도 없습니다.

**후속 관찰 포인트**: (1) 창고가 공식 릴리스 버전을 출시할지 여부 및 버전이 지정된 체크포인트 업데이트 빈도; (2) ROS/Gym 등 로봇 표준 인터페이스에 대한 통합 지원 여부 (3) 작성자 팀이 더 큰 모델 버전을 출시하거나 특정 시나리오(예: 능숙한 작업)에 대한 미세 조정 가중치를 출시할지 여부 (4) 사용 임계값을 낮추기 위해 타사 패키지(예: Docker 이미지, HuggingFace 추론 API, Colab 노트북)가 커뮤니티에 표시되는지 여부.

**조달/채택 위험 평가**: HMA는 "기술 사전 연구 및 평가 가속화 도구"로 적합하며 현 단계에서 생산 환경에 대한 유일한 시뮬레이션 종속성으로 권장되지 않습니다. 다음 전략을 채택하는 것이 좋습니다. (1) 먼저 대화형 데모 및 사전 설정된 데이터 세트를 사용하여 전체 프로세스를 실행하여 자체 시나리오에서 모델의 실제 충실도를 평가합니다. (2) 데이터 플라이휠 효과를 정량화하기 위해 훈련 후 실험을 수행하기 위해 200개의 자체 궤적으로 시작합니다. (3) 완전히 검증하기 전에 실제 로봇 출시를 위한 백업 채널을 유지하십시오. 상용급 지원이 필요한 기업의 경우 커뮤니티 버전이 성숙해질 때까지 기다리거나 상용 대안(NVIDIA Isaac Sim, Physical Intelligence의 π0 등)을 평가하는 것이 좋습니다.

관련 도구: <a href="https://www.aistarmap.com/ko-KR/aitool/crewai" target="_self" class="tool-link"><img src="https://res.aistarmap.com/uploads/images/tools/zh-CN/crewai/logo_1785767147.svg" alt="크루AI" class="tool-logo" style="width: 20px; height: 20px; margin-right: 5px; vertical-align: middle;">크루AI</a>, langchain

버전 정보

  • HMA 초기 버전 :여기에는 HMA-MagVit(362M 매개변수) 및 HMA-MAR(1B 매개변수)의 두 가지 모델 사양이 포함되어 있으며 이산 토큰과 연속 토큰의 두 가지 생성 모드를 지원하고 사전 훈련, 사후 훈련, 평가 및 시각화의 전체 프로세스 코드를 제공합니다.
  • arXiv 사전 인쇄 :이 논문은 오픈 소스 코드와 모델 가중치를 동기화하여 arXiv(2502.04296)에 처음 게시되었습니다.

사용자 후기

  • 후기를 불러오는 중...