Hy3(텐센트 훈위안 3)
무료
Hy3(Tencent Hunyuan 3)는 Tencent Hunyuan 팀이 출시한 3세대 하이브리드 전문가(MoE) 대규모 언어 모델입니다. 총 매개변수는 295B, 활성화 매개변수는 21B, 전문가 Top-8 경로 192개, 컨텍스트 창 256K, 오픈 소스 Apache 2.0 라이선스가 있습니다. SWE-bench Verified에서는 74.4%, GPQA Diamond에서는 90.4%에 도달했습니다. 강력한 코드 생성, 도구 호출 및 에이전트 기능을 갖추고 있으며 50개 이상의 Tencent 내부 제품에 적용되었습니다.
Hy3(Tencent Hunyuan 3): 오픈소스 MoE 대형 모델의 에이전트 및 코드 기능 벤치마크
Hy3의 핵심 매개변수 및 통계
Hy3(Hunyuan 3)은 Tencent의 Hunyuan 팀이 출시한 3세대 MoE(Mixture-of-Experts) 대규모 언어 모델입니다. 또한 현재까지 Tencent의 가장 강력하고 개방적인 기본 모델이기도 합니다. 이전 세대 Hy2와 비교하여 Hy3는 매개변수 크기, 전문가 규모, 컨텍스트 길이 및 추론 기능에서 세대 간 업그레이드를 달성했습니다. Apache 2.0 라이센스에 따른 완전한 오픈 소스이며 지리적 제한이 없습니다.
| 프로젝트 | 사양 |
|---|---|
| 제품명 | Hy3 (Hunyuan 3 / Tencent Hunyuan 3세대) |
| 제품 유형 | 기본 대형 모델(MoE) |
| 총 매개변수 | 295B(MTP 레이어 포함 299B) |
| 활성화 매개변수 | 21B |
| MTP 계층 매개변수 | 3.8B |
| 전문가 수 | 전문가 192명, Top-8 라우팅 |
| 네트워크 계층 수 | 80개 레이어(MTP 제외) |
| 주의 머리 | 64 (GQA, 8 KV 헤드, 헤드 딤 128) |
| 숨겨진 레이어 차원 | 4096 |
| 중간층 차원 | 13312 |
| 컨텍스트 창 | 256K 토큰 |
| 어휘 크기 | 120,832 |
| 정밀도 지원 | BF16/FP8 |
| 라이센스 계약 | 아파치 2.0 |
| 배송 형태 | 오픈소스 가중치(HuggingFace/ModelScope) + API(OpenRouter 및 기타 타사) |
| 홈 | CN(텐센트) |
| 지원되는 언어 | 중국어, 영어 |
| 출시일 | 미리보기: 2026-04-23; 전체: 2026-07-06 |
Hy3는 전지전능한 일반 모델로 포지셔닝된 것이 아니라, 오히려 "특정 매개변수 예산 하에서 최고의 추론 품질을 추구합니다". 21B 활성화 매개변수는 추론을 실행할 때 계산에 참여하기 위해 네트워크의 약 4.2%(전문가 8/192)만 필요하므로 동일한 지능 수준의 밀집 모델보다 배포 비용이 훨씬 저렴합니다. 256K 컨텍스트 창은 한 번에 약 384페이지의 A4 문서를 처리할 수 있어 긴 문서 분석 및 파일 간 코드 기반 이해에 적합합니다.
효율성 향상의 실제 의미: 활성화 매개변수가 21B이고 활성화 매개변수가 100B 이상인 다른 모델과 비교하여 Hy3는 추론 처리량에서 자연스러운 이점을 갖습니다. vLLM 또는 SGLang을 사용하여 배포하면 단일 추론의 메모리 사용량 및 토큰 생성 지연이 동일한 인텔리전스 수준의 밀집 모델보다 낮습니다. 빈도가 높은 API 호출자의 경우 이는 낮은 단위 토큰 가격과 낮은 일괄 처리 대기 시간에 직접적으로 반영됩니다.
추론 모드 설계: 'reasoning_effort' 세 가지 제어 수준을 지원합니다. 'no_think'(직접 모드, 번역 및 요약과 같은 결정론적 작업에 적합), 'low'(가벼운 사고, 일반적인 질문 및 답변에 적합), 'high'(심층 연쇄 추론, 수학적 증명에 적합, 경쟁 프로그래밍, 복잡한 에이전트 계획). '하이' 모드를 선택하면 토큰 출력량이 3~8배 증가하고 그에 따라 단일 호출 비용도 증가합니다.
Hy3의 사용자 및 시장 인지도
Hy3의 시장 인지도는 'Tencent 내부 생산 검증 + 오픈소스 커뮤니티 평판'이라는 2륜 구동 패턴을 보여줍니다.
내부 생산 규모: Hy3는 공식 출시 전에 WeChat, QQ, Tencent Cloud 및 게임 플랫폼과 같은 핵심 사업을 포괄하는 Tencent의 50개 이상의 내부 제품 라인에 통합되었습니다. 이러한 내부 배포 수준은 다중 라운드 대화 안정성, 긴 상황 감쇠 제어, 다중 언어 혼합 및 프로덕션 환경에서 다듬어진 기타 엔지니어링 문제를 포함하여 실제 트래픽과 복잡한 비즈니스 로직으로 모델이 테스트되었음을 의미합니다.
오픈 소스 커뮤니티 반응: 2026년 7월 현재 GitHub의 'Tencent-Hunyuan/Hy3' 창고는 530개 이상의 별과 120개 이상의 포크를 받았으며 HuggingFace의 월간 모델 가중치 다운로드 횟수는 14,000회를 초과합니다. Hy3 주변 커뮤니티에서는 10개 이상의 미세 조정 변형과 65개 이상의 양자화 버전(llama.cpp, LM Studio, Jan 등과 같은 도구 체인 지원)을 제작했으며 15개의 HuggingFace Spaces는 온라인 경험 입구를 제공합니다.
제3자 평가 성과: 인공분석 지능지수에서 Hy3는 41점(총 97건의 모델 비교)으로 초대형 매개변수 규모 오픈소스 모델 중 8위에 올랐으며, 이는 카테고리 중앙값인 25점보다 훨씬 높은 수치입니다. 주요 벤치마크 점수는 다음과 같습니다.
- GPQA 다이아몬드: 90.4%(지식 추론, 최상위 오픈 소스 모델)
- SWE-bench 검증: 78% (실제 코딩 작업 해결률)
- SWE-bench Pro: 57.9%(복잡한 엔지니어링 작업)
- 인류 기말고사: 53.2% (종합지식 챌린지)
- Deep-SWE: 28%(독립 코드 복구)
- Apex 에이전트: 25.6%(에이전트 작업)
- LHTB(장기 단말 작업): 28.8%(장기 에이전트 작업)
블라인드 테스트 전문가 평가: 텐센트가 업계 전문가 270명과 공동으로 블라인드 테스트를 진행했습니다. Hy3는 GLM-5.1의 2.51/4를 능가하는 2.67/4의 전체 점수를 받았습니다. 가장 큰 장점은 프론트엔드 개발, 데이터 스토리지, CI/CD 작업에 집중되어 있습니다. 이 결과는 단일 벤치마크보다 실제 시나리오의 모델 유용성을 더 잘 반영합니다.
Hy3의 비용 장점
Hy3의 비용 구조는 "Apache 2.0 오픈 소스 라이센스 비용 없음 + 낮은 활성화 매개변수 추론 효율성 + 타사 API의 저렴한 가격"이라는 세 가지 계층으로 구성됩니다. 현재 가장 비용 효율적인 오픈 소스 대형 모델 중 하나입니다.
C 클라이언트/개인 사용자: HuggingFace(tencent/Hy3)를 통해 완전 무료로 모델 가중치를 직접 다운로드합니다. 개별 개발자는 라이선스나 API 비용을 지불하지 않고도 자신의 하드웨어에서 추론을 실행할 수 있습니다. 그러나 GPU 컴퓨팅 성능 비용은 사용자가 직접 부담해야 합니다. 8×H20-80G 또는 동등한 구성으로 Hy3 완전 정밀도 추론을 실행하려면 단일 하드웨어 투자가 수만 위안에서 수십만 위안 정도입니다. 가끔 사용하는 시나리오의 경우 타사 API를 사용한 만큼 비용을 지불하는 것이 더 경제적입니다.
개발자/API 호출(OpenRouter를 예로 들어):
| 청구항목 | 가격(USD/백만개 토큰) | 비교 참고자료 |
|---|---|---|
| 입력(캐시 적중) | $0.035 (-75% 할인) | 클로드 소네트 5: $3/M |
| 입력(표준) | $0.14 | GPT-5.6: ~$15/M |
| 출력 | $0.58 | 그록 4.5: $6/M |
| 혼합가격(7:2:1 비율) | 대략. $0.11 | DeepSeek V4 플래시: 약. $0.08 |
Hy3의 API 가격은 유사한 인텔리전스 수준의 비공개 소스 모델 가격의 약 1/10~1/50입니다. 하루에 100만 개의 토큰 입력과 500,000개의 토큰 출력을 처리하는 경량 애플리케이션의 경우 월별 비용은 대략 ($0.14 × 30 + $0.58 × 15) = $12.9/월이며 이는 거의 무시할 수 있는 수준입니다.
기업/개인 배포: 오픈 소스 무게는 무료(Apache 2.0)이지만 인프라 비용 - 8×H20-80G 서버를 기준으로 하면 단일 장치의 월 임대 비용은 약 $8,000-12,000(Evian 제조업체 및 계약 기간에 따라 변동)이며 이는 중간 정도의 동시 Hy3 추론을 지원할 수 있습니다. 기업의 총 비용은 "API 연간 수수료 vs 프라이빗 3년 비용 TCO" 모델을 기반으로 평가해야 하며 운영 및 유지 관리 인력, 모델 버전 반복 업데이트 및 정량적 배포(FP8은 비디오 메모리 요구 사항을 더욱 줄임)의 숨겨진 비용이 포함되어야 합니다.
구매 팁: API 가격은 각 서비스 제공업체의 실시간 페이지를 기준으로 책정됩니다. 지역마다(예: 중국 본토와 해외) 가격 차이가 있습니다. 프라이빗 배포에 권장되는 하드웨어 구성 및 성능 지표는 GitHub 리포지토리의 배포 장을 기반으로 합니다.
Hy3의 주요 기능
Hy3의 기능 설계는 "코드 생성 + 에이전트 도구 호출 + 심층 추론 + 긴 컨텍스트"의 4가지 핵심 기능 라인을 중심으로 이루어집니다.
-
코드 생성 및 엔지니어링 작업: Python, JavaScript/TypeScript, Java, Go 등 주류 언어에 대한 코드 생성, 완성, 리팩토링, 버그 진단 및 단위 테스트 생성을 다룹니다. SWE-bench Verified에서 78%의 솔루션 비율은 모델이 실제 GitHub 문제 설명을 이해하고 관련 코드 파일을 찾고 병합 가능한 수정 사항을 제안할 수 있음을 의미합니다. 구현 팁: 복잡한 엔지니어링 작업의 경우 'reasoning_effort=high' 모드를 활성화하는 것이 좋습니다. Straight-out 모드에서는 경계조건 처리가 누락될 수 있습니다.
-
에이전트 도구 호출(Function Calling): Hy3의 도구 호출 기능은 이번 업그레이드의 핵심 하이라이트입니다. 이 모델은 기본적으로 여러 차례의 도구 호출, 오류 복구 및 에이전트 간 프레임워크 일반화를 지원합니다. SWE 벤치 검증 정확도는 다양한 스캐폴드(CodeBuddy, Cline, KiloCode)에서 4% 내에서 변동합니다. 도구 열기 목록:
navigate(웹 페이지 탐색),click(요소 클릭),type/input(텍스트 입력),screenshot(페이지 스크린샷),extract(정보 추출),wait(대기 조건),read_file/write_file(파일 읽기 및 쓰기),execute_command(명령 실행),finish(작업 종료)와 같은 표준 도구 동작을 지원합니다. 보고). 아키텍처 링크:LLM(Hy3) → API/MCP 서버 → 도구 실행 환경 → 관찰이 LLM을 반환하여 "계획 → 실행 → 관찰 → 조정"의 대화형 폐쇄 루프를 형성합니다. -
심층 추론 및 사고 사슬: 조정 가능한 사고 사슬 추론을 지원합니다. 지식 질문 답변(GPQA 다이아몬드 90.4%) 및 복잡한 추론 작업(Humanity's Last Exam 53.2%)에서 최고 수준의 오픈 소스 모델에 도달했습니다. 내부 리뷰에 따르면 Hy3의 환각률은 Hy3 Preview의 12.5%에서 5.4%로 감소했고, 상식 오류율은 25.4%에서 12.7%로 감소하여 사실 정확성과 논리적 일관성이 크게 향상되었습니다.
-
긴 컨텍스트 이해(256K 토큰): 한 번에 약 384페이지의 텍스트 콘텐츠를 처리할 수 있으며 법적 계약 세트 검토, 대규모 코드 기반의 전역 분석, 긴 대화 기록 이해 등과 같은 시나리오에 적합합니다. SFT와 RL의 공동 최적화를 통해 다중 라운드 대화에서 참조 해결, 누락 복구 및 제약 조건 상속 문제의 비율이 17.4%에서 7.9%로 감소합니다. 구현 팁: 추론 지연 시간과 KV 캐시 오버헤드는 긴 컨텍스트 시나리오에서 크게 증가합니다. 실제로 챕터 간 상관 관계가 필요한 작업에서는 전체 컨텍스트를 활성화하고 일일 작업을 32K 내에서 제어하여 비용 균형을 맞추는 것이 좋습니다.
-
다중 모드 확장: Hy3의 핵심은 텍스트 모델이지만 Tencent의 시각적 언어 모델 파이프라인을 통해 이미지 및 텍스트 이해까지 확장될 수 있습니다. 기본 Hy3 가중치 시각적 모드는 지원되지 않으며 일반 텍스트 장면에서는 이 제한 사항에 주의할 필요가 없습니다.
-
엔지니어링 최적화 도구 체인: 완전한 미세 조정(Finetune) 파이프라인(vLLM/SGLang 기반), RL 사후 훈련(verl + Megatron-LM + vLLM 롤아웃을 통한 GRPO) 및 양자화 도구(AngelSlim은 일반적인 양자화 알고리즘, 낮은 비트 양자화 및 추측 샘플링 지원)를 제공합니다. 개발자는 Hy3 가중치를 기반으로 수직 도메인별 모델을 구축할 수 있습니다.
Hy3 모델 및 버전 진화
Hy3의 버전 반복은 "미리보기 검증 → 피드백 수집 → 전체 릴리스 최적화"의 리듬을 따릅니다.
메인라인 출시
- Hy2(~2025-12): Hunyuan 2세대 모델, SWE-bench는 약 53.0%로 Hy3의 MoE 아키텍처 업그레이드를 위한 기준을 마련합니다. 아직 공식적인 정확한 출시일은 없습니다.
- Hy3 미리보기(2026-04-23): 295B MoE(21B 활성화) 아키텍처와 192명의 전문가 Top-8 라우팅을 처음으로 사용하는 새로운 인프라에 대한 첫 번째 훈련 모델 배치입니다. SWE-bench Verified는 74.4%에 도달해 개발자 커뮤니티의 관심을 끌었습니다. 출시 후 Tencent는 50개 이상의 내부 제품 사용 피드백을 수집했습니다.
- Hy3 Full(2026-07-06): 미리보기 피드백을 기반으로 한 대규모 사후 학습 최적화입니다. 주요 개선 사항은 다음과 같습니다.
- 도구 호출 안정성 및 오류 복구 기능이 대폭 향상되었습니다.
- 환상률 12.5%에서 5.4%로 감소, 상식 오류율 25.4%에서 12.7%로 감소
- 다회전 대화 의도 추적 문제 발생률이 17.4%에서 7.9%로 감소되었습니다.
- 장거리 상호 작용에서 복잡한 의도가 붕괴되는 것을 방지하면서 출력이 더 간결해졌습니다.
- 배포 임계값을 낮추기 위해 FP8 정량 버전(Hy3-FP8) 동시 출시
후보자 확인
- Hy3-FP8(전체 출시일에 출시): AngelSlim 도구 체인과 함께 작동하는 FP8의 양자화된 버전으로 추론 품질을 유지하면서 그래픽 메모리 요구 사항을 크게 줄여 더 많은 개발자가 제한된 하드웨어에서 Hy3를 실행할 수 있습니다.
릴리스 노트: Hy3의 오픈 소스 정책은 추가 조건이나 지리적 제한 없이 Apache 2.0 라이선스에 따라 릴리스되었습니다. 이전 버전(Hy2)의 가중치도 Tencent HuggingFace 조직 페이지를 통해 공개되었습니다. 후속 버전 반복 계획은 GitHub 창고 및 공식 Twitter/X 계정에서 공개된 정보에 따라 달라집니다.
Hy3의 기술적 장점
Hy3의 기술 경로 선택은 "제한된 컴퓨팅 전력 예산 하에서 추론 품질 극대화"에 대한 Tencent의 엔지니어링 축적을 반영합니다.
MoE 아키텍처 및 192개 전문가 Top-8 라우팅: Hy3의 MoE는 단순히 전문가 수를 늘리는 것이 아니라 80층 Transformer에 계층당 192개의 전문가 하위 네트워크를 배포하고 토큰당 이 중 8개만 활성화됩니다(활성화율 약 4.2%). 즉, 295B 매개변수 중 21B만 추론의 각 단계에 참여하여 추론 계산량을 제어하면서 광범위한 지식을 저장한다는 의미입니다. 다양한 토큰은 다양한 전문가에게 전달됩니다. 코드 토큰은 코드 전문 지식 전문가를 활성화하는 경향이 있고, 자연어 토큰은 언어 전문 지식 전문가를 활성화하여 암시적 작업 분할을 형성합니다.
MTP 계층(다중 작업 예측 계층): 3.8B 매개변수의 공유 MTP 계층은 서로 다른 전문가의 출력을 조정하여 서로 다른 전문가가 서로 다른 토큰을 처리하더라도 전체 시퀀스가 의미론적 일관성을 유지하도록 보장합니다. 이는 복잡한 다단계 추론에서 안정적인 출력을 유지하는 Hy3의 핵심 메커니즘입니다.
추론 노력: 모델은 'reasoning_effort' 매개변수를 통해 '속도'와 '깊이' 사이에서 동적으로 조정될 수 있습니다. 'no_think' 모드에서는 모델이 답변을 직접 생성하므로 지연에 민감한 시나리오에 적합합니다. 'high' 모드에서 모델은 완전한 연쇄 추론을 개발합니다. 이 설계를 사용하면 여러 버전을 배포할 필요 없이 다양한 지연 예산에 따라 동일한 모델 가중치를 적응적으로 조정할 수 있습니다.
사후 훈련 파이프라인(SFT + RL): Hy3의 SFT 및 GRPO 강화 학습 파이프라인은 verl + Megatron-LM 프레임워크에서 실행되어 대규모 분산 훈련을 지원합니다. 훈련 후 데이터 품질과 다양성의 향상은 Hy3 Preview에서 정식 버전으로 품질이 향상되는 주된 이유입니다. 내부 평가에 따르면 환각 비율, 상식 오류 및 다단계 일관성에 대한 공동 최적화 효과가 유의미한 것으로 나타났습니다.
생산 등급 도구 호출 안정성: Hy3는 여러 기본 안정성 문제를 수정하여 다양한 구성 및 출력 제약 조건 하에서 도구 호출을 생산 등급 표준으로 끌어올립니다. 다양한 에이전트 프레임워크(CodeBuddy, Cline, KiloCode)에서 모델의 SWE 벤치 검증 정확도 차이는 4% 이내로 유지되며 이는 도구 호출 기능이 특정 프레임워크 구현에 바인딩되지 않음을 나타냅니다.
엔지니어링 배포 적응: Hy3는 MTP 추측 디코딩 가속을 지원하는 두 개의 주류 추론 엔진 vLLM 및 SGLang에 대한 공식 적응 솔루션을 보유하고 있습니다. 배포 중에는 8×H20-80G 이상의 메모리 GPU를 사용하는 것이 좋습니다. FP8 양자화 버전은 메모리 요구 사항을 더욱 줄일 수 있습니다. 정량화 도구인 AngelSlim은 Tencent에서 오픈 소스로 제공하며 일반적인 양자화 알고리즘과 낮은 비트 양자화를 지원합니다.
성능 및 처리량 참고: 인공 분석을 통한 실제 측정에 따르면 타사 API에서 Hy3의 출력 속도 중앙값은 약 60.3token/s(카테고리 중앙값인 64.2보다 낮지만 격차는 크지 않음)이며, 중앙값 TTFT(첫 번째 단어 지연)는 약 2.65초(카테고리 중앙값인 1.83초보다 약간 높음)입니다. 구체적인 값은 배포 하드웨어, 정량화 방식, 동시성에 따라 달라지며 실제 테스트 대상이다.
Hy3의 적응 경계와 장면 제약
최고의 기능: 코드 생성 및 에이전트 작업, 수학적 추론 및 지식 질문과 답변, 중국어/영어 이중 언어 처리, 도구 호출 및 다단계 계획.
잘 못함: 영어 문서 스타일의 정교함은 순수 영어 학습 모델의 정교함보다 약간 낮습니다. 롱테일 서양식 프레임워크 및 도구에 대한 친숙도는 DeepSeek와 같이 생태학적으로 성숙한 모델만큼 좋지 않습니다. 시각적 양식은 지원되지 않습니다(순수 텍스트 모델). 매우 긴 컨텍스트(256K 제한에 근접) 시나리오에서는 추론 지연이 크게 증가합니다.
경쟁 제품과의 비교:
| 비교 | 하이3 | DeepSeek V4 프로 | GLM-5.2 | 클로드 소네트 5 |
|---|---|---|---|---|
| 총 매개변수 | 295B | 1.6T | 744B 소개 | 비공개 |
| 활성화 매개변수 | 21B | 49B 소개 | 약 1000억+ | 비공개 |
| 컨텍스트 | 256K | 100만 | ~256K | ~20만 |
| 라이센스 | 아파치 2.0 | MIT | MIT | 비공개 소스 |
| API 입력 가격 | $0.14/월 | 1~3엔/월 | $0.5-1/월 | $3/백만 |
| SWE 벤치 | 78% | 약 75% | 약 62% | 약 70% |
Hy3의 핵심 장점은 가장 작은 활성화 매개변수와 Apache 2.0의 완전 개방형 라이선스로 가장 강력한 SWE-벤치 성능을 달성하는 것입니다. 단점은 생태적 성숙도가 DeepSeek만큼 좋지 않고, 1M 초대형 컨텍스트 장면이 아직 다루어지지 않았다는 것입니다.
Hy3 사용방법
Hy3는 개인 실험부터 엔터프라이즈 수준 배포까지 모든 시나리오를 포괄하는 "오픈 소스 자체 호스팅 + 타사 API"라는 두 가지 사용 모드를 제공합니다.
| 사용 방법 | 사람들에게 적합 | 특징 | 비용 |
|---|---|---|---|
| 타사 API(OpenRouter 등) | 개발자, 소규모 팀 | 즉시 사용 가능, GPU 필요 없음 | 종량제(M 토큰당 $0.14/$0.58) |
| 자체 호스팅(vLLM) | 기업, 기술팀 | 데이터가 도메인 외부로 유출되지 않으며 모든 권한 | GPU 컴퓨팅 비용 |
| 자체 호스팅(SGLang) | 기업, 기술팀 | 정식개편, MTP 가속 | GPU 컴퓨팅 전력 비용 |
| HuggingFace 체중 다운로드 | 연구원, 모델 개발자 | 미세조정/정량화/2차 개발 | 무료(자신의 하드웨어를 가져와야 함) |
API 빠른 시작(OpenAI SDK와 호환되는 OpenRouter):
``파이썬 openai 가져오기 OpenAI에서
클라이언트 = OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key="
응답 = client.chat.completions.create( 모델="텐센트/hy3", 메시지=[ {"role": "user", "content": "Python을 사용하여 캐시된 피보나치 수열 계산을 구현합니다."} ], 온도=0.9, top_p=1.0, extra_body={ "chat_template_kwargs": {"reasoning_effort": "높음"} } ) 인쇄(response.choices[0].message.content)
**주요 매개변수 설명**: '온도'는 0.9, 'top_p'는 1.0을 권장합니다. '추론_노력'은 선택사항입니다. 'no_think'(직접), 'low'(가벼운 사고), 'high'(깊은 추론). 코드 및 복잡한 추론 시나리오에는 'high' 모드를 사용하는 것이 좋습니다.
**자체 호스팅 - vLLM 배포(8 GPU 권장)**:
``배쉬
# 먼저 vLLM을 컴파일하고 설치해야 합니다(소스 코드 기준).
VLLM_FLASHINFER_ALLREDUCE_BACKEND=trtllm 내보내기
vllm은 tencent/Hy3 \를 제공합니다.
--텐서-병렬-크기 8 \
--speculative-config.method mtp \
--speculative-config.num_speculative_tokens 2 \
--tool-call-parser hy_v3 \
--추론-파서 hy_v3 \
--활성화-자동-도구-선택 \
--포트 8000 \
--제공된 모델 이름 hy3
자체 호스팅 - SGLang 배포:
``배쉬 python3 -m sglang.launch_server \ --모델 텐센트/Hy3 \ --tp-크기 8 \ --tool-call-parser hunyuan \ --추론 파서 hunyuan \ --추측-수-단계 2 \ --투기-독수리-topk 1 \ --투기-수-초안-토큰 3 \ --추측 알고리즘 EAGLE \ --포트 8000 \ --제공된 모델 이름 hy3
배포가 완료되면 OpenAI 호환 인터페이스를 통해 로컬 서비스를 호출할 수 있습니다. 자세한 배포 문서는 GitHub 저장소 'Tencent-Hunyuan/Hy3'의 README를 따릅니다.
## Hy3 제품 가격
Hy3의 가격은 "오픈 소스 중량 무료 + 타사 API 종량제" 모델을 계속 유지합니다.
**오픈 소스 가중치**: Apache 2.0 라이센스, 사용 제한 없음, 지리적 제한 없음, 상업적 사용 제한 없음. 사용자는 자유롭게 다운로드, 사용, 수정 및 재배포할 수 있습니다. Meta의 Llama 커뮤니티 라이선스와 달리 Hy3는 상용 라이선스를 위한 별도의 신청이 필요하지 않습니다.
**타사 API 가격**: OpenRouter의 중간 가격을 기준으로 $0.14/백만 토큰을 입력하고 $0.58/백만 토큰을 출력합니다. 캐시 적중 시 75% 할인($0.035/백만 토큰). 다양한 서비스 제공자(예: Fireworks AI, Together AI 등)의 가격은 약간 다를 수 있으며 각 플랫폼의 실시간 페이지에 따라 달라질 수 있습니다.
**개인 배포 비용**: 무게는 무료이지만 인프라 비용은 본인이 부담해야 합니다. 8×H20-80G 또는 동급 GPU 구성을 권장하며, 단일 유닛의 월 렌탈 비용은 $8,000-12,000 정도입니다. FP8 정량 버전(Hy3-FP8)은 동일한 하드웨어에서 더 높은 동시성을 수행하거나 하드웨어 임계값을 단일 카드 A100-80G로 낮출 수 있습니다(실험 시나리오에만 해당).
**기업 대량 구매**: Tencent는 Hy3의 공식 호스팅 API 가격을 공개하지 않았습니다. 대규모 트래픽 시나리오의 경우 `hunyuan_opensource@tencent.com`을 통해 Tencent 팀에 문의하여 비즈니스 솔루션을 얻거나 OpenRouter와 같은 플랫폼에서 기업 수준 계약을 기반으로 할인을 협상하는 것이 좋습니다.
## Hy3 적용 시나리오
Hy3의 애플리케이션 시나리오는 소프트웨어 개발, 에이전트 자동화, 지식 집약적 분석 및 기업 생산성 향상이라는 네 가지 차원에 걸쳐 있습니다.
- **소프트웨어 개발(코드 생성 및 엔지니어링 작업)**: 이는 Hy3의 가장 강력한 시나리오입니다. 코드 완성, 버그 위치 및 복구, 단위 테스트 생성, 코드 검토, 리팩토링 제안, 기술 문서 작성 등을 다룹니다. SWE-bench 검증된 성능이 78%라는 것은 Hy3가 복잡한 GitHub 문제 설명을 이해하고 병합 가능한 수정 코드를 생성할 수 있음을 의미합니다. **구현 팁**: 도구 호출 기능을 최대한 활용하려면 CodeBuddy, Cline 또는 KiloCode와 같은 에이전트 프레임워크와 함께 사용하는 것이 좋습니다. 복잡한 엔지니어링 작업을 위해 `reasoning_effort=high` 모드를 활성화합니다.
- **AI 에이전트 및 자동화된 워크플로**: Hy3의 도구 호출 안정성은 50개 이상의 Tencent 내부 제품을 통해 검증되었습니다. 웹 페이지 자동화(정보 수집, 양식 작성), 명령줄 도구 체인 배열, 다단계 데이터 처리 파이프라인 및 기타 시나리오에 적합합니다. **아키텍처 링크**: `LLM(Hy3) → 도구 파서 → 함수 실행 → 관찰 → LLM 재계획`. **엔지니어링 함정에 대한 가이드**:
1. **무한 루프 및 토큰 인플레이션 제어**: 'max_steps' 매개변수(10~20 권장)를 통해 최대 실행 라운드 수를 제한하고, 반복 작업 감지(3개 연속 단계에 대해 동일한 관찰이 반환되면 종료)와 함께 단일 단계 제한 시간을 설정하여 모델이 유휴 상태가 되는 것을 방지합니다.
2. **DOM/컨텍스트 오버로드**: 웹 페이지 에이전트 작업의 경우 스크린샷 전달을 비활성화하고 접근성 트리 또는 DOM 요약만 반환하여 전체 HTML 문서가 컨텍스트 창을 채우는 것을 방지하는 것이 좋습니다.
3. **보안 및 초권력 거버넌스**: 되돌릴 수 없는 작업(파일 삭제, 메시지 전송, 결제, 게시)에 대한 확인 지점(Human-in-the-loop)을 설정하거나 실행 환경에서 읽기 전용 모드로 시작하여 모델의 오작동을 방지합니다.
- **지식 질문 및 문서 분석**: GPQA Diamond의 90.4% 성능은 Hy3가 지식 집약적 작업에 대한 최첨단 비공개 소스 모델에 가깝다는 것을 보여줍니다. 256K 컨텍스트는 긴 학술 논문 검토, 법적 계약 조건 비교, 기술 백서 요약과 같은 시나리오에 적합합니다. **구현 팁**: 문서 분석 시나리오에서는 'reasoning_effort=no_think' 또는 '낮음' 모드를 사용하세요. 깊은 추론을 활성화할 필요가 없으므로 대기 시간과 토큰 소비를 줄이는 데 도움이 됩니다.
- **기업 생산성(내부 도구 및 RAG 시스템)**: 오픈 소스 가중치 자체 호스팅과 RAG(검색 증강 생성) 프레임워크를 결합하여 기업은 개인 지식 질문 응답 시스템을 구축할 수 있습니다. Apache 2.0 라이선싱은 데이터가 기업 인프라를 벗어나지 않도록 보장하며 제3자 API 호출로 인한 개인정보 보호 위험이 없습니다. **구현 팁**: 다국어 혼합 문서 시나리오의 경우 하이브리드 검색(키워드 + 의미 검색) 및 재순위 메커니즘과 협력하여 회수 품질을 향상시키는 것이 좋습니다. Hy3 자체는 문서 수준 RBAC를 제공하지 않으며 RAG 프레임워크 계층에서 권한 격리를 구현해야 합니다.
**시나리오에는 적합하지 않음**: 극도의 창의성이 필요한 브랜드 카피라이팅(Hy3의 출력 스타일은 엔지니어링 지향적이며 창의적 풍부함은 Claude 시리즈만큼 풍부하지 않습니다) 매우 높은 수준의 영어 문서 스타일(예: 학술 논문 다듬기)이 필요한 비코딩 시나리오 다중 모드 입력(예: 이미지 인식, 비디오 이해)이 필요한 시나리오.
## Hy3 적용그룹
- **소프트웨어 개발자 및 엔지니어**: Hy3의 핵심 고객입니다. 일상적인 코딩 지원, 버그 진단, 코드 검토 또는 복잡한 엔지니어링 작업 등 SWE-벤치에서 Hy3의 78% 성능은 개발자에게 신뢰할 수 있는 프로그래밍 파트너가 될 수 있음을 의미합니다. **경계에 적합하지 않음**: 영어 문서 생성(예: 오픈 소스 프로젝트의 영어 문서)에 대한 품질 요구 사항이 매우 높은 팀의 경우 2차 다듬질을 위해 Grammarly와 같은 도구를 사용하는 것이 좋습니다.
- **AI 에이전트 개발자 및 자동화 엔지니어**: 웹 페이지 데이터 수집부터 명령줄 도구 체인 조정, Hy3의 도구 호출 안정성 및 프레임워크 간 일반화 기능에 이르기까지 자동화된 워크플로를 구축해야 하는 개발자는 Hy3를 에이전트 시스템을 위한 이상적인 기본 모델로 만듭니다. **선행조건**: Agent 프레임워크(예: Cline, CodeBuddy)를 구성하고 합리적인 단계 예산 및 확인 포인트 전략을 설정해야 합니다.
- **엔터프라이즈 및 기술팀(비공개 배포)**: 데이터 주권 및 규정 준수에 중점을 둔 기업입니다. Hy3의 Apache 2.0 라이선스 및 자체 호스팅 기능은 개인화된 AI 인프라에 이상적입니다. **구매 전제 조건**: 기업은 8×H20-80G 레벨 GPU 클러스터를 보유하거나 임대할 수 있어야 하며 해당 운영 및 유지 관리 기능을 갖추고 있어야 합니다. 자체 호스팅으로 전환할지 여부를 결정하기 전에 API 모드에서 ROI를 확인하는 것이 좋습니다.
- **AI 연구원 및 모델 개발자**: 오픈 소스 가중치와 완전한 미세 조정/RL 파이프라인을 통해 Hy3는 연구 및 2차 개발을 위한 탁월한 기본 모델이 됩니다. 192 전문가 MoE 아키텍처 자체도 연구 가치가 있습니다. **부적합한 경계**: 실험적 재현을 위한 하드웨어 요구 사항이 높습니다(전체 무게는 약 600GB 스토리지 + 멀티 카드 GPU).
**주의해서 사용**: 응답 지연(예: 온라인 고객 서비스의 실시간 응답)에 매우 민감한 실시간 상호 작용 시나리오에서는 Hy3의 약 2.65초 TTFT가 이상적이지 않을 수 있습니다. 지연에 특별히 최적화된 소형 모델이나 증류 버전을 선택하는 것이 좋습니다. 매우 긴 문서(256K 한도에 근접)를 처리할 경우 컨텍스트 창 오버플로의 위험을 피하기 위해 한꺼번에 입력하는 대신 섹션별로 제출하는 것이 좋습니다.
## 요약 및 전망
Hy3는 대형 모델을 위한 중국 오픈 소스 경로의 중요한 전환점을 나타냅니다. Tencent는 지리적 제한 없이 SWE-bench에서 대부분의 폐쇄 소스 모델을 능가하는 Apache 2.0 라이센스에 따라 오픈 소스 MoE 모델을 출시했습니다. 이는 Meta LLaMA 및 Mistral과 같은 서구 오픈 소스 경로에 대한 대응일 뿐만 아니라 API 수익에 의존하기보다는 오픈 소스를 통해 생태학적 영향력을 확립하려는 전략적 선택이기도 합니다.
**현재 핵심 장점**: 295B 매개변수 중 21B만 활성화된 MoE 아키텍처는 뛰어난 비용 효율성을 제공합니다. SWE 벤치 검증 78% 및 GPQA Diamond 90.4% 성능은 오픈 소스 모델 중 첫 번째 계층에 속합니다. Apache 2.0 라이센스는 상업적 사용에 대한 법적 장벽을 완전히 제거합니다. 50개 이상의 Tencent 내부 제품을 통해 엔지니어링 신뢰성이 검증되었습니다.
**현재 주요 제한 사항**: 생태학적 성숙도는 DeepSeek 및 Qwen보다 낮습니다. 타사 도구 체인, 커뮤니티 튜토리얼 및 중국 기술 기사가 여전히 축적되고 있습니다. 1M 초대형 컨텍스트는 아직 지원되지 않습니다. 영어 비코드 시나리오는 순수 영어 모델만큼 정교하지 않습니다. 배포 하드웨어 임계값은 동일한 지능 밀도 모델보다 낮지만 8×H20-80G는 여전히 중소 규모 팀에서 쉽게 구입할 수 없습니다.
**추가 관찰 포인트**: Tencent가 Hy3 시리즈를 다중 모드(시각, 음성) 분야로 확장할지 여부; 커뮤니티가 Hy3를 중심으로 충분히 풍부한 미세 조정 변형과 전용 도구 체인을 형성할 것인지 여부 Tencent가 기업 액세스 프로세스를 단순화하기 위해 공식 관리형 API를 출시할지 여부 다음 버전(Hy3.5 또는 Hy4)이 더 큰 컨텍스트 창과 더 높은 활성화 매개변수 예산을 지원할지 여부입니다.
**조달 및 채택 위험 평가**: 개별 개발자 및 기업가 팀의 경우 OpenRouter와 같은 타사 API를 통해 비용을 지불하면 위험 없이 Hy3의 핵심 기능을 경험할 수 있습니다. A/B 테스트를 위해 일일 코딩 도구 체인에 통합하는 것이 좋습니다. 민영화 배포를 계획하는 기업의 경우 프로덕션 수준 에이전트 작업으로 확장하기 전에 중요하지 않은 프로세스(예: 내부 코드 검토, 자동화된 테스트 생성)에 시험판을 배포하여 모델 출력 품질과 팀 승인을 확인하는 것이 좋습니다. 구매하기 전에 배포된 하드웨어의 GPU 모델과 수량이 목표 부하를 충족할 수 있는지(vLLM/SGLang의 공식 성능 데이터 참조), 모델 버전 업데이트의 이전 버전과의 호환성 보장(현재 공식 약속은 없음), Apache 2.0 라이선스가 기업의 예상 사용량(예: 미세 조정된 모델 재배포)을 완전히 포괄하는지 확인하는 것이 중요합니다. 규정 준수에 민감한 산업(금융, 의료, 정부 업무)에서는 생산에 들어가기 전에 민영화된 환경에서 전체 레드팀 테스트 및 감사를 완료하는 것이 좋습니다.
관련 도구: <a href="https://www.aistarmap.com/ko-KR/aitool/crewai" target="_self" class="tool-link"><img src="https://res.aistarmap.com/uploads/images/tools/zh-CN/crewai/logo_1785767147.svg" alt="크루AI" class="tool-logo" style="width: 20px; height: 20px; margin-right: 5px; vertical-align: middle;">크루AI</a>, langchain
버전 정보
- Hy3 :공식 출시된 버전은 미리보기 버전에서 50개 이상의 제품 피드백을 수집한 후 대규모 사후 교육 최적화를 기반으로 하며, 이를 통해 에이전트 기능, 도구 호출 안정성 및 환각 방지 기능이 크게 향상됩니다.
- Hy3 미리보기 :새로운 인프라에 대해 훈련된 첫 번째 모델 배치인 미리보기 버전은 295B MoE 아키텍처의 타당성을 SWE-bench 검증 74.4%로 검증합니다.
- HY2(휴에너지 2) :2세대 하이브리드 모델인 SWE-벤치는 약 53.0%로 Hy3의 아키텍처 업그레이드를 위한 기준을 제공하고 있다. 아직 공식적인 정확한 날짜는 없습니다.
사용자 후기