1시간
Hour One은 텍스트 스크립트를 사용하여 AI 디지털 휴먼 앵커의 음성 영상을 구동하고 다국어 및 앵커 역할을 지원하는 엔터프라이즈급 AI 가상 앵커 영상 생성 플랫폼입니다.
아워원
Hour One의 핵심 매개변수 및 통계
| 매개변수 항목 | 설명 |
|---|---|
| 제품 포지셔닝 | 엔터프라이즈급 AI 가상 앵커 영상 생성 플랫폼 |
| 가상 앵커 역할 | 100개 이상의 사전 설정된 역할 + 맞춤형 기업 디지털 인력 |
| 지원되는 언어 | 자동 입 정렬을 포함한 30개 이상의 언어 |
| 출력 품질 | 최대 4K(3840×2160) |
| 시나리오 템플릿 | 200개 이상의 업계 템플릿(교육, 마케팅, 제품 데모 등) |
| 입력 형식 | 텍스트 스크립트 PPT/PDF, URL 콘텐츠 가져오기 |
| 라이브 방송 모드 | AI 앵커를 통한 실시간 생방송 지원(API 통합 필요) |
| 배포 방법 | SaaS 클라우드 + 기업 프라이빗 배포(Enterprise 요금제) |
| API 액세스 | RESTful API, 일괄 비디오 생성 및 워크플로우 통합 지원 |
| 플랫폼 지원 | 웹(크롬/Firefox/Edge) + API |
포지셔닝 해석: 디지털 휴먼 비디오 분야에서 Hour One의 핵심 차이점은 소비자 수준이 아닌 "기업 수준"입니다. 시중에 나와 있는 일반적인 짧은 비디오 디지털 휴먼 생성 도구와 비교할 때 Hour One은 더 높은 출력 품질 요구 사항(4K 전송)을 갖고, 더 많은 사용자 정의가 가능하며(브랜드 디지털 휴먼 트레이닝 및 보정) 규정 준수 시나리오에서 브랜드 디지털 휴먼 이미지 관리를 지원합니다. 대상 고객은 개인 유튜버나 소셜 미디어 창작자가 아닌 인력 규모와 프로세스 표준화 요구 사항(기업 교육, 마케팅, 전자상거래 운영)을 갖춘 조직입니다. 주요 제약 조건: 맞춤형 디지털 휴먼을 만들려면 고품질 실사 비디오 자료를 제출해야 합니다(일반적으로 5~15분의 다중 각도 정면 촬영 필요). 이는 초기 배포에 특정 제작 준비 기간이 필요하며 순수 합성 가상 캐릭터처럼 즉시 사용할 수 없음을 의미합니다.
Hour One의 사용자 및 시장 인지도
현장에서 점차적으로 사용자 인지도를 구축하고, 콘텐츠 제작자와 팀은 제품 기능을 사용하여 업무 효율성을 향상시킵니다. 특정 사용자 규모 및 업계 채택 데이터는 공식 실시간 페이지에 따릅니다.
Hour One의 비용 이점
Hour One의 비용 구조는 사용자 유형에 따라 개인/팀 API 개발자, 기업/민영화의 세 가지 계층으로 나뉩니다. 각 계층의 청구 논리와 숨겨진 비용은 상당히 다릅니다.
C측/개인 및 팀
Hour One은 무료 요금제를 제공하지 않습니다. 엔트리 플랜은 일정량의 비디오 생성 시간과 720p 출력을 포함하여 소규모 팀을 위한 월간 구독을 제공합니다. 핵심 제한사항은 다음과 같습니다.
- 출력 품질 제한: 기본 요금제는 일반적으로 720p로 제한되며, 4K 출력은 Enterprise 요금제에서만 사용할 수 있습니다.
- 디지털 휴먼 캐릭터 수 : 보급형 플랜은 사전 설정된 캐릭터 수가 제한되어 있으며, 나만의 디지털 휴먼을 커스터마이징하려면 플랜을 업그레이드해야 합니다.
- 상용 승인 범위: 보급형 요금제의 영상 사용 범위가 제한될 수 있습니다. 기업은 시나리오를 외부에 공개할 때 완전한 상업적 승인이 포함되어 있는지 확인해야 합니다.
API/개발자
Hour One은 디지털 휴먼 비디오 기능을 자체 시스템의 워크플로에 통합하는 데 적합한 비디오 길이별로 요금이 청구되는 API 솔루션을 제공합니다. API 가격은 다음의 영향을 받습니다.
- 출력 해상도: 720p와 4K의 단가 차이는 2~3배일 수 있습니다.
- 디지털 인간 캐릭터 선택: 사용자 정의 디지털 인간 캐릭터를 사용하는 API 호출은 일반적으로 사전 설정된 문자보다 비용이 더 많이 듭니다.
- 대량 할인: 연간 사용량 또는 선불 요금제를 약정하여 계층별 할인을 받으세요.
개발자 팁: API 솔루션을 평가할 때 "비디오 렌더링 시간"과 "청구 시간" 간의 변환 관계를 계산에 포함하는 것이 좋습니다. 일부 플랫폼에서는 완성된 영상의 길이가 아닌 렌더링 시간을 기준으로 요금이 부과되며 둘 사이에는 차이가 있을 수 있습니다.
기업/민영화
엔터프라이즈 계획은 연간 계약 시스템을 채택하고 다음과 같은 일반적인 구성 요소를 포함합니다.
- 연간 구독료: 일정량의 동영상 생성에 해당하는 기본 플랫폼 사용 요금입니다.
- 맞춤형 디지털 휴먼 훈련비: 기업별 디지털 휴먼을 생성할 때마다 입 모양, 표정, 움직임에 대한 전문적인 보정이 포함된 일회성 훈련 비용을 지불해야 합니다.
- 프라이빗 배포 추가 요금: 고객이 속한 영역(VPC 또는 로컬 데이터 센터)에 배포해야 하는 경우 추가 인프라 인증 비용을 지불해야 합니다.
- SLA 및 기술 지원: 엔터프라이즈 플랜에는 일반적으로 전담 계정 관리자, 우선순위 기술 지원 응답, 99.9% 가용성 SLA가 포함됩니다.
주요 비용 변수: Hour One의 기업 요금제는 공개 가격표를 지원하지 않으며 모두 비즈니스 협상의 대상입니다. 이는 조달 전 시간 비용이 높다는 것을 의미합니다. 요구사항 전달, POC 검증, 계약 협상 등 여러 단계를 거쳐야 합니다. 일반적으로 초기 접촉부터 공식 배포까지 4~8주가 걸립니다.
경쟁 제품 비용 비교 공제 (연간 총 비용 기준, 비공식 데이터, 참고용):
| 비용 차원 | 1시간 | 합성 | 헤이젠 | 설명 |
|---|---|---|---|---|
| 참가 계획 월별 요금 | 비공개 | 월 $29부터 시작 | 월 $24부터 시작 | Hour One이 순수한 개인 계획을 제공하는지 여부는 공식 웹사이트 |
| 4K 출력 지원 | 엔터프라이즈 플랜 | 엔터프라이즈 플랜 | 엔터프라이즈 플랜 | 세 회사 모두 엔터프라이즈 버전의 차별화 기능으로 4K를 사용 |
| 맞춤형 디지털휴먼 교육비 | 일회성 비즈니스 견적 | 일회성 $1000+ | 일회성 견적 | 교육비는 일반적으로 연간 구독료에 포함되지 않습니다 |
| API 청구 단위 | 분/해결책 | 분/해결책 | 분/해결책 | 비디오 재생 시간을 기준으로 업계 전반에 걸쳐 청구 |
| 기업을 위한 최소 연간 약정 | 사업 확인 필요 | 연간 $12,500부터 | 사업 확인 필요 | 기업 고객을 위한 최소 연간 약정 |
아워원의 주요 기능
AI 디지털 휴먼 앵커: 다양한 연령, 성별, 인종의 캐릭터를 포함하는 100개 이상의 사전 설정된 캐릭터 라이브러리에서 가상 앵커 이미지를 선택하세요. 디지털 휴먼 앵커는 녹화를 위해 실제 사람이 카메라에 나타날 필요 없이 신체 움직임, 얼굴 표정, 입 움직임에서 AI에 의해 구동됩니다. 구현 팁: 사전 설정된 캐릭터의 액션 풍부함과 제스처 습관이 정확히 동일하지는 않습니다. 대량 제작 전 소규모 A/B 테스트를 진행하여 브랜드 톤에 가장 잘 맞는 캐릭터를 선정하고, 영상 간 앵커 스타일 점프를 피하는 것이 좋습니다.
언어 인식 립싱크: 30개 이상의 언어로 텍스트 입력을 지원합니다. 디지털 사람이 다른 언어를 말할 때 입 모양은 자동으로 해당 언어의 발음 특성에 맞춰집니다. 영어와 일본어는 입 움직임 패턴이 완전히 다릅니다. 영어는 입술과 치아 접촉이 더 뚜렷하고 턱을 열고 닫는 것이 더 뚜렷한 반면, 일본어는 턱 움직임이 덜한 것이 특징입니다. Hour One의 언어 인식 입 모양 예측 모델은 단순히 입 모양을 오디오 트랙의 타임라인에 맞추는 것이 아니라 입력 텍스트의 언어에 따라 입 모양 생성 매개변수를 자동으로 전환합니다. 수용성 문제: 구매 전 대상 언어(특히 필요한 언어 조합)에서 실제 테스트를 진행하여 특정 언어의 입 모양이 기대에 부합하는지 확인하는 것이 좋습니다.
PPT/PDF를 동영상으로: PowerPoint 또는 PDF 파일을 업로드하면 AI가 자동으로 각 페이지의 핵심 사항을 분석하고 해당 설명 스크립트를 생성합니다. 영상 속 디지털 휴먼 앵커가 페이지별로 설명을 해주며, 페이지 간 전환 시 시각적 전환이 자연스럽습니다. 작업 메커니즘: 시스템은 먼저 문서의 텍스트 계층 구조(제목, 단락, 목록)를 추출한 다음 각 페이지에 대해 독립적인 설명 단락을 생성하고 마지막으로 이를 완전한 비디오 스크립트로 연결합니다. 차트와 그림이 포함된 페이지의 경우 시스템은 자동으로 그림을 유지하고 구두 방송 중에 해당 내레이션 안내를 제공합니다. 이 기능은 주로 교육 시나리오 및 제품 데모를 목표로 하며 정적 문서를 배포 및 유지 가능한 비디오 자산으로 변환합니다.
실시간 라이브 방송 앵커(v4의 새로운 기능): AI 디지털 인력은 실시간 라이브 방송 스트림에 액세스하고 실시간 입력 스크립트, 사격 또는 Q&A 콘텐츠를 기반으로 진행자의 구두 응답을 동적으로 생성할 수 있습니다. 기술적 구현 경로: 이 기능을 사용하려면 API를 통해 Hour One의 렌더링 엔진을 라이브 스트리밍 도구에 통합해야 하며 타사 라이브 방송 플랫폼(예: YouTube Live, Twitch 및 기업 소유 라이브 방송 시스템)을 통해 배포됩니다. Hour One은 독립적인 라이브 방송 플랫폼을 제공하지 않지만, 기존 라이브 방송 워크플로우를 렌더링 모듈 형태로 내장합니다. 이는 기업이 통합을 완료하려면 특정 기술 개발 역량을 보유해야 함을 의미합니다.
브랜드 디지털 휴먼 커스터마이징: 브랜드 대변인이나 실제 직원을 기반으로 독점적인 디지털 휴먼 이미지를 생성합니다. 제작 과정은 일반적으로 5~15분 분량의 다각도 정면 고화질 영상 자료 제출 → Hour One 팀이 입술, 표정, 동작에 대한 전문가 수준의 캘리브레이션 트레이닝 → 공식 외부 콘텐츠에 활용 가능한 브랜드 디지털 피플 출력 등으로 구성됩니다. 사용의 경계: 맞춤형 디지털 피플은 실제 인물이 등장하는 장면을 완전히 대체할 수 없습니다. 풍부한 미시적 표현과 높은 정서적 긴장감을 요구하는 콘텐츠(CEO 연설, 감성 브랜드 스토리 등)에서는 여전히 맞춤형 디지털 피플의 성과와 실제 인물 사이에 인지 가능한 격차가 있습니다.
팀 공동작업 및 워크플로: 스크립트 관리, 비디오 승인, 버전 관리 및 프로젝트 수준 권한 제어를 포함한 다중 사용자 팀 공동작업을 지원합니다. 엔터프라이즈 플랜은 API 일괄 호출 및 사용자 정의 비디오 템플릿 라이브러리 관리를 위한 SSO(Single Sign-On)와의 통합도 지원합니다.
Hour One의 모델 및 버전 진화
Hour One 버전의 진화는 기업 수준의 디지털 휴먼 비디오 기술이 "사용 가능"에서 "사용하기 쉬운" 방향으로 나아가는 과정을 반영합니다. 핵심 컨텍스트는 맞춤형 디지털 휴먼, 다국어 역량, 실시간 상호작용이라는 세 가지 방향에 중점을 두고 있습니다.
v2.0(2024-08): 다국어 및 장면 템플릿의 획기적인 발전
두 번째 주요 버전은 "단일 언어, 단일 장면" 제한을 해결합니다.
- 주요 유라시아 언어를 포괄하는 다국어 립싱크 메커니즘을 도입합니다.
- 교육, 마케팅, 제품 설명 등과 같은 일반적인 기업 시나리오를 다루는 200개 이상의 산업 시나리오 템플릿 출시
- 50개 이상의 문자 선택을 제공하는 사전 설정된 문자 라이브러리의 초기 설정입니다.
- 비디오 생성 기능을 위한 타사 시스템 호출을 지원하기 위한 기본 API 인터페이스를 출시했습니다.
이번 버전의 이정표는 '단일 디지털 휴먼 시연'에서 '다국어, 다중 시나리오를 지원할 수 있는 콘텐츠 제작 도구'로 확장한 것이다.
v3.0(2025-06): 맞춤형 디지털 인력 및 브랜딩
세 번째 버전은 제품을 "범용 도구"에서 "기업 브랜드 자산"으로 이동합니다.
- 핵심 신규: 맞춤형 디지털 인간 이미지 생성 기능. 기업은 실제 인물 영상을 기반으로 전용 디지털 휴먼을 훈련할 수 있으며, 출력 효과는 입 모양, 표정, 움직임에 따라 전문적으로 보정됩니다.
- 디지털 휴먼 캐릭터의 자연스러움 향상: "불쾌한 계곡" 효과를 줄이기 위해 더욱 세련된 얼굴 움직임 유닛 제어를 도입합니다.
- 템플릿 시스템 업그레이드 : 기업 맞춤형 브랜드 템플릿 라이브러리 지원 및 영상 비주얼 스타일 통일
- API 기능 향상: 스크립트 일괄 제출 및 비디오 생성 작업을 지원합니다.
이 버전의 과제는 디지털 휴먼을 맞춤화하기 위한 교육 기간이 길고(보통 2~4주) 실제 인물 영상에 대한 품질 요구 사항이 높다는 것입니다. 모든 회사가 자격을 갖춘 교육 자료를 신속하게 제공할 수 있는 것은 아닙니다.
v4.0(2026-05): 라이브 방송 및 PPT를 영상으로
최신 버전은 실시간 상호 작용과 문서를 비디오로 자동 변환하는 데 중점을 둡니다.
- 실시간 라이브 방송 앵커: AI 디지털 피플이 라이브 스트림에 접속하여 실시간 대본이나 Q&A를 기반으로 구두 방송을 동적으로 생성할 수 있습니다. 하지만 참고하세요: Hour One은 라이브 방송 플랫폼이 아닌 렌더링 엔진을 제공하며 기업은 라이브 방송 시스템 통합을 직접 완료해야 합니다.
- PPT를 동영상으로: PPT/PDF를 업로드하고 자동으로 핵심 포인트를 추출하여 스크립트를 생성하면 디지털 인력이 페이지별로 설명합니다. 이 기능은 "문서를 비디오로" 제작하는 기준을 크게 낮춥니다.
- 입술 동기화 정확도 최적화: 입 모양과 발음이 일치하지 않는 문제를 줄이기 위해 중국어, 일본어, 한국어 및 기타 아시아 언어에 대한 특별 최적화가 이루어졌습니다.
- 4K 출력은 제품 수준의 안정성(엔터프라이즈 솔루션)에 도달하고 프레임 속도는 30fps를 지원합니다.
- 기업 수준 배치 생산 시나리오에서 일정 최적화를 지원하기 위해 비디오 렌더링 대기열 관리가 추가되었습니다.
버전 선택 제안: 장면에 사전 설정된 문자 + 단일 언어로 된 기본 음성 비디오만 필요한 경우 v2/v3의 기능이 이미 처리될 수 있습니다. 브랜드 디지털 맞춤화 또는 다국어 콘텐츠 제작이 필요한 경우 v3/v4의 정밀 최적화는 업그레이드할 가치가 있습니다. 실시간 생방송 모드는 아직 상용화 초기 단계로, 생방송 통합 계획을 회사에서 확인한 후 결정하는 것이 좋습니다.
아워원의 기술적 장점
2D 신경망 렌더링과 3D 모델링 비교
아워원의 디지털 휴먼 기술 루트는 기존의 3D 모델링 + 뼈 바인딩 솔루션이 아닌 2D 신경 렌더링(Neural Rendering)을 기반으로 합니다. 2D 신경 렌더링의 핵심 아이디어는 수많은 실제 사람이 말하는 비디오를 통해 엔드투엔드 얼굴 생성 모델을 훈련시키는 것입니다. 텍스트/음성 신호를 입력한 후 3D 안면 메시를 구축하지 않고도 입술, 표정, 머리 자세 등의 연속적인 이미지를 직접 생성할 수 있습니다.
작동 메커니즘: 훈련 단계에서 특정 캐릭터에 대한 몇 시간의 비디오가 수집되고 입 모양 상태와 각 프레임의 해당 음소/텍스트 순서가 표시됩니다. 추론 단계에서 입력 텍스트의 음성 특징과 참조 프레임이 주어지면 모델은 얼굴 동작 매개변수를 예측하고 출력 사진을 프레임별로 렌더링합니다. 이 경로의 장점은 다음과 같습니다.
- 높은 자연스러움: 출력 사진은 3D 모델의 "플라스틱 느낌"이 아닌 실제 사람의 피부 질감, 가벼운 질감, 얼굴의 미세한 움직임을 그대로 유지합니다.
- 좋은 입 모양 정확도: 입 모양 매핑 관계는 비디오 데이터를 통해 직접 학습되며, 이는 이론적으로 3D 뼈 바인딩의 입 모양 범위보다 더 자연스럽습니다.
- 컴퓨팅 전력 요구 사항은 훈련 측면에 집중되어 있습니다: 추론(동영상 생성)을 위한 컴퓨팅 전력 요구 사항은 훈련보다 훨씬 낮으며 SaaS 대규모 전달에 적합합니다.
비용 및 한계: 2D 신경 렌더링의 약점은 시야각의 제한입니다. 디지털 사용자는 일반적으로 정면 또는 정면에 가까운 각도만 유지할 수 있으며 머리를 크게 또는 옆으로 돌리면 그림 왜곡이 발생합니다. 또한, 장기 영상에서는 얼굴 질감 깜박임이나 입 모양 드리프트가 발생할 수 있는데, 이는 프레임 후 스무딩 처리를 통해 완화해야 합니다.
언어 인식 입 모양 예측
다국어 립싱크의 엔지니어링 난이도는 종종 과소평가됩니다. 언어마다 발음 입 모양 특성이 크게 다릅니다.
- 영어에서는 상당한 입술-치아 접촉(예: /f/, /v/)과 턱 열림 및 닫힘의 변화가 필요합니다.
- 일본어는 턱의 작은 움직임이 지배적이며, 입술 모양의 변화는 모음에 집중되어 있습니다.
- 중국어(북경어)의 4성 변화는 입 모양 지속 시간 분포에 약간 영향을 미칩니다.
- 독일어 및 프랑스어 구개수/둥근 모음에는 특정 입술 처리가 필요합니다.
아워원의 언어 인식 립싱크 솔루션은 각 언어에 대해 독립적인 입 모양 예측 분기를 훈련하거나 미세 조정하고, 추론 단계에서 입력 텍스트의 언어 레이블에 따라 해당 분기를 자동으로 전환합니다. 이는 "모든 언어를 포괄하도록 일반 모델을 훈련"하는 솔루션보다 다양한 언어에 대한 입 모양 성능이 더 안정적입니다.
4K 출력 파이프라인
4K 디지털 휴먼 비디오 생성에는 다음과 같은 체계적인 엔지니어링 최적화가 포함됩니다.
- 렌더링 파이프라인: 2D 신경 렌더링은 각 프레임의 독립적 생성으로 인한 깜박임을 방지하기 위해 얼굴 생성부터 전체 비디오 합성까지 4K 해상도에서 프레임 일관성을 유지해야 합니다.
- 인코딩 최적화: 4K 비디오의 코드 속도 제어 및 인코딩 효율성은 출력 파일 크기와 재생 부드러움에 직접적인 영향을 미칩니다. Hour One은 다양한 배포 플랫폼의 요구 사항에 맞게 조정 가능한 인코딩 매개변수를 제공합니다.
- 렌더링 시간: 4K 비디오의 렌더링 시간은 일반적으로 비디오 길이의 2~5배입니다(캐릭터 복잡성 및 장면 템플릿에 따라 다름). 일괄 작업에는 렌더링 대기열에 대한 합리적인 계획이 필요합니다.
엔터프라이즈 통합 아키텍처
Hour One의 플랫폼 아키텍처는 API를 백본으로 사용하여 회사의 기존 워크플로와의 통합을 지원합니다.
엔터프라이즈 시스템(LMS/HRMS/CMS) → API 게이트웨이 → Hour One 렌더링 엔진
├── 디지털 휴먼 역할 관리
├── 스크립트 및 음성 합성
├── 립싱크 및 비디오 렌더링
└── 영상 출력 및 배포
엔지니어링 함정에 대한 가이드:
- 일괄 렌더링 동시성 제한: Hour One의 API 솔루션에는 일반적으로 동시 렌더링 작업 수에 대한 상한이 있습니다. 초과되면 대기열에 대기하게 됩니다. 대량 생산 시, 한 번에 많은 수의 제출로 인해 일부 작업이 시간 초과되는 것을 방지하기 위해 스크립트를 먼저 일괄 제출하는 것이 좋습니다.
- 사용자 정의 캐릭터 훈련 자료 사양: 훈련 자료를 직접 기록하는 경우 일반적인 함정에는 어수선한 배경(AI의 캐릭터 분할 정확도 감소), 고르지 않은 조명(출력에서 일관되지 않은 밝고 어두운 얼굴로 이어짐), 과도한 촬영 각도(2D 모델은 비정면 관점을 다룰 수 없음)가 포함됩니다. 공식 촬영 지침을 엄격히 따르는 것이 좋습니다.
- 라이브 방송 지연 제어: 실시간 라이브 방송 모드에서는 입력 텍스트부터 디지털 인구 동기화 출력까지의 엔드투엔드 지연이 핵심 지표입니다. Hour One의 렌더링 엔진은 초저 지연 시간(<500ms) 시나리오용으로 설계되지 않았으며 실시간 Q&A 라이브 방송에서 2~5초의 응답 지연이 발생할 수 있습니다.
아워원 이용방법
Hour One은 다양한 사용자 역할과 시나리오에 적합한 두 개의 기본 입구를 제공합니다.
웹 편집기(기술자가 아닌 사용자용)
브라우저를 통해 Hour One 공식 웹사이트에 접속하고 등록을 완료한 후 웹 인터페이스에서 전체 비디오 제작 과정을 완료할 수 있습니다.
- 역할 선택: 사전 설정된 캐릭터 라이브러리에서 디지털 휴먼 앵커를 선택하거나 훈련된 회사별 디지털 휴먼을 선택합니다.
- 입력 스크립트: 호스트의 음성 내용을 텍스트 형식으로 입력하고 일시 중지 표시 및 톤 프롬프트 삽입을 지원합니다.
- 템플릿/레이아웃 선택: 비디오 배경 템플릿(브랜드 색상 로고, 그래픽 및 텍스트 레이아웃 포함)을 선택하거나 사용자 정의 배경을 업로드합니다.
- 미리보기 및 조정: 입술 동기화 효과, 신체 움직임 및 전반적인 리듬을 확인하기 위해 미리보기 비디오를 생성합니다.
- 렌더링 내보내기: 출력 해상도와 형식(주로 MP4)을 선택하고 렌더링 작업을 제출한 후 완료될 때까지 기다립니다.
기술자가 아닌 사용자의 일반적인 학습 비용은 첫 번째 비디오 제작을 독립적으로 완료하는 데 약 1~2시간입니다.
API 통합(개발자용)
API 솔루션은 디지털 휴먼 비디오 기능을 기업 소유 시스템에 내장하는 데 사용됩니다. 핵심 API 엔드포인트에는 다음이 포함됩니다.
| 엔드포인트 | 기능 | 일반적인 사용 시나리오 |
|---|---|---|
POST /v1/videos |
비디오 생성 작업 제출 | 스크립트 텍스트로 디지털 휴먼 비디오 만들기 |
GET /v1/videos/{id} |
작업 상태 쿼리 | 설문 조사 렌더링 진행 상황 |
POST /v1/문자 |
맞춤형 디지털 개인 만들기 | 브랜드 디지털 인물을 만들기 위한 교육 자료 제출 |
GET /v1/templates |
사용 가능한 템플릿 목록 가져오기 | 콘텐츠와 일치하는 템플릿 자동 선택 |
POST /v1/live/stream |
라이브 방송 모드 시작 | 실시간 라이브 스트림에 액세스 |
빠른 시작 예(의사 코드 프로세스): ``파이썬
1. API 키 받기(Hour One 콘솔에서 생성됨)
2. 영상 생성 과제 제출
포스트 https://api.hourone.ai/v1/videos
헤더: 승인: Bearer
3. 폴링 작업 상태
https://api.hourone.ai/v1/videos/{video_id} 받기
4. 완성된 영상 다운로드 (완료 상태일 때)
*참고: 위 엔드포인트 이름 및 매개변수는 참조용으로만 사용됩니다. Hour One의 실제 API 문서가 우선합니다. *
### 기업 민영화 전개
엔터프라이즈 솔루션은 고객의 자체 환경에 Hour One 렌더링 엔진의 배포를 지원합니다. 이는 데이터 보안 요구 사항이 높고 민감한 비디오 콘텐츠(예: 금융 규정 준수, 의료 교육)가 있는 산업에 적합합니다. 배포 주기는 일반적으로 컨텍스트 평가, 배포 구현, 엔터프라이즈 시스템과의 통합 및 공동 디버깅을 포함하여 4~8주입니다.
## 1시간 동안의 제품 가격
Hour One은 무료 요금제를 포함한 공개 가격표를 제공하지 않습니다. 다음 정보는 제품 공개 페이지, 업계 관행 및 경쟁 제품 벤치마킹 분석을 기반으로 합니다. 실제 가격은 공식 실시간 견적을 따릅니다.
### 계획 수준 개요
| 계획 | 대상 사용자 | 청구 방법 | 일반적인 제한 사항 |
|------|---------|---------|---------|
| 스타터 플랜 | 소규모 팀 | 월간 구독 | 720p 출력, 사전 제작된 문자, 제한된 시간(분) |
| 프로페셔널 플랜 | 중규모 팀/부서 | 월간/연간 구독 | 1080p, 추가 역할 및 템플릿, 기본 API |
| 엔터프라이즈 플랜 | 대규모 조직 | 연간 계약 | 4K, 맞춤형 디지털 인력, 개인 배포 옵션 |
| API 계획 | 개발자/ISV | 분당 청구 | 해결 방법 및 역할 유형에 따른 차별화된 가격 책정 |
### 비용 구성 세부정보
- **구독 기본 요금**: 사용자 또는 팀 시트당 부과되는 플랫폼 사용 요금입니다.
- **동영상 생성 수수료**: 동영상 재생 시간(분)을 기준으로 청구됩니다. 해상도가 높을수록 단가도 높아집니다.
- **맞춤형 디지털 휴먼 교육 비용**: 재료 평가, 모델 교육, 품질 보정을 포함한 일회성 비용입니다.
- **API 호출 요금**: API 호출 횟수 또는 영상 생성 시간을 기준으로 과금됩니다. 일반적으로 월별 최소 소비 요구 사항이 있습니다.
- **민간 배포 추가 요금**: 인프라 승인, 운영 및 유지 관리 지원을 포함하여 매년 청구됩니다.
### 무료 할당량 및 평가판
Hour One의 무료 평가판 제공 여부는 공식 웹사이트의 최신 정책에 따릅니다. 업계 관행에서는 일반적으로 기업 고객이 효과를 확인할 수 있도록 한시적으로 무료 POC(개념 증명) 계정을 제공하지만 출력 해상도, 디지털 인간 역할 선택 및 비디오 워터마크가 제한될 수 있습니다.
*구매 제안: 공식 견적을 받기 전에, ① 월간 예상 총 영상 제작 시간, ② 최고 출력 해상도 필요, ③ 맞춤형 디지털 휴먼 필요 여부, ④ 다국어 콘텐츠 포함 여부, ⑤ API 통합 또는 민영화 배포 필요 여부 등의 변수를 명확히 하는 것이 좋습니다. 이러한 변수는 최종 가격 계산에 직접적인 영향을 미칩니다. *
## Hour One의 적용 시나리오
### 기업교육 영상(비용 절감 공제)
**시나리오 설명**: 대기업의 HR 교육팀은 글로벌 직원을 위한 온보딩 교육, 규정 준수 교육, 제품 지식 교육 동영상을 다양한 언어로 제작해야 합니다. 전통적인 방법은 스튜디오 임대, 실제 강사 고용, 사후 편집, 다국어 자막/더빙이 필요합니다. 단일 코스의 제작 주기는 영업일 기준 약 5~10일이며, 비용은 수천 달러에서 수만 달러에 이릅니다.
**아워원 플랜**: HR팀은 기업 브랜드의 디지털 휴먼 강사를 제작하고, 아워원의 PPT 동영상 기능을 통해 원클릭으로 교육용 PPT를 디지털 휴먼 설명이 포함된 교육용 동영상으로 변환합니다. 강사 스크립트는 통일된 방식으로 작성된 후 API를 통해 일괄 번역되어 다국어 버전을 생성합니다. 각 버전의 디지털 인구통계는 대상 언어에 자동으로 맞춰집니다.
**비용 절감 및 효율성 개선의 정량적 추론**(Hour One의 공식 약속이 아닌 업계 평균 데이터 기준):
| 보통 | 전통적인 방식 | 1시간 계획 | 근무시간 단축 |
|------|---------|---------------|---------|
| 싱글코스 촬영 | 1일(세트 및 장비 디버깅 포함) | 0(실제 촬영 불필요) | 100% |
| 다국어 더빙/자막 | 3~5일(외주번역+더빙) | API 자동 생성(30분) | 90%+ |
| 사후 편집 | 2~3일(대략+미세수정) | 미리보기 및 미세 조정(1~2시간) | 80%+ |
| 다중 버전 유지 관리 | 언어별 독립적인 파일 관리 | 단일 스크립트 + 언어 매개변수 | 60%+ |
**인간-기계 협업의 경계**: 스크립트 콘텐츠(특히 규정 준수와 관련된 부분)는 AI 생성 후 법률/규정 준수팀에서 수동으로 검토해야 합니다. 브랜드 디지털 휴먼의 첫 번째 교육에서는 실제 사람들이 자료를 기록해야 하며 완전히 AI로 생성될 수는 없습니다. 완성된 영상은 직원들에게 공개되기 전 교육부서의 최종 확인을 거쳐야 합니다.
### 마케팅 영상 대규모 제작 (비용 절감 공제)
**시나리오 설명**: 브랜드 마케팅 부서는 다양한 언어 시장(영어, 스페인어, 일본어, 한국어 등)에 맞춰 현지화된 제품 소개 동영상을 제작해야 합니다. 기존 방식은 시장별로 재촬영을 하거나 현지 성우를 고용해 재녹음을 해야 하는데, 이는 시간이 오래 걸리고 브랜드 일관성을 유지하기 어렵다.
**Hour One 솔루션**: 브랜드 맞춤형 디지털 휴먼을 통합 앵커로 활용하세요. 중국어 스크립트가 작성된 후 대상 언어로 번역됩니다. 아워원을 통해 입력하면 해당 언어의 디지털 휴먼 방송 영상이 자동으로 생성됩니다. 디지털 인물의 의상, 배경, 브랜드 요소는 모든 언어 버전에서 일관되게 유지되며 음성 언어만 전환하면 됩니다.
**인간-기계 협업의 경계**: 이문화 마케팅의 주요 정보(예: 슬로건, 문화적으로 민감한 콘텐츠)는 현지 시장 팀의 수동 검토가 필요하며 기계 번역 + AI 구두 방송의 자동화된 링크에 완전히 의존할 수 없습니다. 고급 브랜드 캠페인의 핵심 영상은 여전히 실제 사람이 촬영하는 것을 권장하며, AI 디지털 휴먼은 빈도가 높은 중저가의 일일 마케팅 콘텐츠(예: 제품 업데이트 지침, 프로모션 이벤트 소개 FAQ 영상)에 더 적합합니다.
### 전자상거래 생방송 AI 앵커(비용 절감 공제)
**시나리오 설명**: 전자상거래 플랫폼은 사용량이 적은 시간(오전 0시~오전 8시) 동안 24시간 제품 설명 라이브 방송을 진행해야 합니다. 라이브 앵커의 예약 비용은 높고 트래픽이 적은 기간에는 ROI가 낮습니다.
**Hour One 솔루션**: Hour One의 라이브 방송 모드 API를 전자상거래 라이브 방송실에 연결하고 AI 디지털 휴먼 앵커를 구성하여 무인 시간 동안 자동으로 제품 정보를 설명하고 자주 묻는 질문에 답변합니다. 생방송 스크립트는 운영팀이 미리 작성하거나 지식 베이스로 구성하며, AI 앵커는 설정된 프레임워크 내에서 상호 작용합니다.
**비용 절감 및 효율성 향상의 정량적 추론**:
| 차원 | 휴먼앵커(3교대) | AI 앵커(1시간) | 변경사항 |
|------|------|------|------|
| 월 인건비 | 3명 × 15,000엔 = 45,000엔 | API 사용료(추정) | 비용 절감 50-70% |
| 적용기간 | 16시간/일(일정 공백 포함) | 24시간 논스톱 | 50% 개선 |
| 상품 설명 취재 | 세션당 20-30 SKU | 세션당 50-100 SKU | 2~3배 개선 |
**인간-기계 협업의 경계**: AI 앵커는 복잡한 고객 불만, 가격 협상, 한정판 급매 등 감정적 긴장이 높은 시나리오를 처리하는 데 적합하지 않습니다. 생방송실에서는 'AI 앵커 + 실제 당직자' 모드를 설정하는 것이 좋습니다. AI 앵커는 정규 시간 동안 제품 설명을 담당하며, 복잡한 질문이 발생하거나 구매 결정 안내를 받을 경우 실제 고객 서비스로 연결됩니다. 또한, AI로 인해 발생하는 부적절한 표현으로 인한 브랜드 리스크를 방지하기 위해 AI 앵커의 음성 내용은 운영팀의 규정 준수 검토를 거쳐야 합니다.
### 기타 적응 시나리오
- **제품 시연 영상**: API를 통해 일괄 생성되는 SaaS 업체의 제품 업데이트 설명 영상입니다.
- **내부 소통 영상**: 경영진의 분기별 전회원 서신, 정책 홍보, 기타 내부 영상 등을 모두 브랜드 디지털 피플이 직접 소개합니다.
- **규정 준수 교육 동영상**: 금융 및 의료 업계의 정기적인 규정 준수 교육에는 직원 학습 진행 상황을 기록해야 합니다.
## 아워원 대상자
**기업 교육 및 HR 팀**: 교육 비디오를 자주 제작해야 하는 기업 교육 부서에 적합합니다. 아워원의 PPT를 영상으로 변환하는 기능은 코스웨어에서 영상으로의 변환 비용을 직접적으로 줄여주고, 브랜드 디지털 인재가 기업 내부 교육 강사로 등장할 수 있습니다. *부적합한 경계*: 교육 콘텐츠를 자주(일주일에 여러 번) 업데이트해야 하고 비디오 길이가 30분을 초과하는 시나리오의 경우 렌더링 비용과 업데이트 유지 관리 비용이 크게 증가합니다. 본격적인 프로모션에 앞서 소규모 파일럿을 통해 검증하는 것이 좋습니다.
**마케팅 부서**: 다국어 현지화 마케팅 콘텐츠가 필요한 기업 마케팅 팀에 적합합니다. 브랜드 디지털 인력은 다양한 시장에서 비디오의 브랜드 일관성을 보장할 수 있으며 API 일괄 생성 기능은 주요 프로모션 및 기타 노드의 집중적인 콘텐츠 요구를 지원합니다. *경계에 적합하지 않음*: 고급 브랜드 이미지 광고, CEO 연례 연설 등 감정이 강하고 개인 스타일이 강한 콘텐츠에는 AI 디지털 휴먼을 사용하지 않는 것이 좋습니다. 실제 사람의 감정 전달력은 여전히 대체할 수 없습니다.
**전자상거래 운영 및 라이브 방송팀**: 24시간 중단 없는 라이브 방송 및 대규모 SKU 설명이 필요한 전자상거래 시나리오에 적합합니다. AI 앵커는 트래픽이 적은 기간 동안 근무 중인 실제 인력을 대체하여 일정 관리 비용을 절감할 수 있습니다. *경계에 적합하지 않음*: 실제 제품 표시(예: 옷 입어보기, 음식 시식) 및 실시간 상호 작용 중 실제 제스처 작동 시연이 필요한 장면은 AI 앵커로 대체할 수 없습니다.
**엔터프라이즈 IT 및 시스템 통합 팀**: 기존 LMS, HRMS, CMS 등의 워크플로우에 디지털 휴먼 비디오 기능을 내장해야 하는 엔터프라이즈 IT 부서를 위한 것입니다. Hour One의 RESTful API 및 배치 렌더링 기능을 통해 엔터프라이즈 시스템과의 통합이 가능합니다. *전제조건*: 팀은 기본적인 API 통합 개발 능력을 갖추고 있어야 합니다. Hour One은 제로 코드/로우 코드 통합 도구를 제공하지 않습니다(적어도 HTTP 요청 및 JSON 데이터를 처리할 수 있어야 함).
**대중에게 적합하지 않음**:
- **개인 크리에이터/유튜버**: Hour One의 기업 포지셔닝에 따라 프로그램 임계값과 구독 비용이 HeyGen, Synthesia 및 개인 사용자를 대상으로 하는 기타 제품보다 높다고 결정됩니다. 개별 제작자는 보다 비용 효율적인 솔루션을 우선시할 것을 권장합니다.
- **고도의 맞춤형 원본 비디오가 필요한 팀**(예: 애니메이션 스튜디오, 영화 및 TV 제작): Hour One은 애니메이션 캐릭터 디자인, 멀티샷 내러티브, 특수 효과 합성 등 영화 및 TV 수준 요구 사항을 충족할 수 없는 표준화된 디지털 인간 모습 비디오를 제공합니다.
- **순수한 음성/더빙만 필요한 장면**: 디지털 휴먼이 꼭 등장하지 않아도 되는 경우 순수 TTS 또는 AI 더빙 솔루션 비용이 Hour One보다 훨씬 저렴합니다.
## 1시간 요약 및 전망
**핵심 경쟁력**: 기업용 디지털 휴먼 비디오 분야에서 Hour One의 핵심 장벽은 세 가지 측면에 반영됩니다. - ① **출력 품질**: 4K 해상도는 동급 제품 중 가장 높으며 외부 콘텐츠에 대한 비디오 품질에 대한 엄격한 요구 사항이 있는 브랜드에 적합합니다. ② **다국어 립싱크 정확도**: 언어 인식 립싱크 예측 모델은 교차 언어 콘텐츠 제작에서 일반 솔루션보다 더 나은 성능을 발휘하여 디지털 휴먼 비디오의 일반적인 문제점인 "립싱크 당혹감"을 줄입니다. ③**기업 통합 깊이**: API 솔루션과 개인화된 배포 옵션은 기업 수준 고객에게 데이터 보안 및 프로세스 통합의 유연성을 제공합니다.
**현재 제한 사항 및 불확실성**:
- **맞춤형 디지털 휴먼을 만들기 위한 기준점은 여전히 높습니다**: 실사 교육 자료(5~15분의 다각 정면 고화질 비디오)에 대한 품질 요구 사항은 기업이 초기 촬영 비용에 투자해야 하며 "디지털 휴먼을 만들기 위해 몇 장의 사진을 업로드하는" 편리한 경험을 달성할 수 없음을 의미합니다.
- **AI 앵커의 자연스러움 한계**: 2D 신경 렌더링은 정적 이미지 및 단기 구강 방송에서 자연스럽게 수행되지만, 장기간의 구강 방송(10분 이상) 또는 풍부한 미세 표현이 필요한 콘텐츠는 여전히 "불쾌한 계곡" 효과를 건드릴 것입니다. 안면 근육의 미묘한 변화, 눈의 자연스러운 편차, 감정 계층화는 현재 AI 디지털 휴먼의 일반적인 병목 현상이며 Hour One에만 국한된 문제는 아닙니다.
- **실시간 라이브 방송 모드는 상용화 초기 단계**: v4의 새로운 라이브 방송 앵커 기능은 아직 대규모로 상용화되지 않았습니다. 실제 배포 시 엔드투엔드 지연, 안정성, 타사 라이브 방송 플랫폼과의 호환성을 검증해야 합니다.
- **낮은 가격 투명성**: 공개 가격표가 없다는 것은 구매 결정에 대한 정보 비용이 높다는 것을 의미하며 기업 고객은 비즈니스 커뮤니케이션에 시간을 투자해야 합니다. POC 단계에서는 대상 언어의 입 모양 정확도와 4K 출력 효과를 검증하는 데 중점을 두고 계약 협상의 수락 기준으로 삼는 것이 좋습니다.
- **시장 경쟁 제품의 동질성 가속화**: Synthesia, HeyGen, Colossyan 및 기타 트랙 제품은 기능과 가격면에서 점점 가까워지고 있습니다. Hour One은 경쟁에 대처하기 위해 기업 배포 비용을 줄이는 동시에 이미지 품질과 다국어 정확성의 차별화를 계속 유지해야 합니다.
**조달/채택 위험 평가**: Hour One은 기존 비디오 콘텐츠 제작 프로세스가 있고 확장이 필요한 기업 조직, 특히 다국어 운영 및 브랜드 일관성에 대한 요구 사항이 높은 시나리오에 적합합니다. 결정하기 전에 다음 확인을 완료하는 것이 좋습니다. ① 일반 데모가 아닌 대상 언어로 된 실제 비디오 샘플을 영업팀에 문의하여 립싱크 정확도가 외부 출시 기준을 충족할 수 있는지 확인합니다. ② 4K 출력 및 맞춤형 디지털 휴먼 API를 명확히 합니다. 계약 계획의 특정 할당량 조건을 통해 후속 사용 시 과도한 비용을 피할 수 있습니다. ③ 디지털 인물 사진 사용에 관한 계약의 장기 조건을 이해합니다. - 교육을 받은 기업 디지털 휴먼이 특정 직원을 기반으로 하는 경우 직원 퇴사 후 디지털 인물 이미지의 사용 권한 및 삭제 프로세스를 명확히 할 필요가 있습니다. ④ 동일한 트랙의 제품(Synthesia, HeyGen)과 병렬 POC를 만들고, 출력 품질, 렌더링 속도, 단가를 수평적으로 비교하여 단일 제조업체의 Lock-in 위험을 줄입니다.
관련 도구: runway, pika
## 아워원 이용방법
- **웹 클라이언트** : 공식 홈페이지에 접속하여 계정을 등록하시면 사용하실 수 있습니다. 대부분의 기능은 설치가 필요하지 않습니다.
- **API 액세스**: RESTful API를 제공하며 개발자는 API 키를 획득하여 자신의 애플리케이션에 통합할 수 있습니다.
버전 정보
- 아워 원 v4 :동영상으로의 PPT 변환을 지원하고 립싱크 정확도를 최적화하는 새로운 실시간 라이브 방송 앵커 모드가 추가되었습니다.
- 아워 원 v3 :기업 브랜드 디지털 휴먼을 지원하기 위한 맞춤형 디지털 휴먼 이미지 생성 기능을 소개합니다.
- 아워 원 v2 :다국어 립싱크 및 다중 장면 템플릿이 추가되었습니다.
사용자 후기