키미 K2

-

Kimi K2는 Moonshot AI가 출시한 오픈 소스 MoE 대형 언어 모델 시리즈입니다. 총 매개변수는 1T이고 활성화 매개변수는 32B입니다. 도구 호출, 코드 생성 및 자율 작업 해결과 같은 에이전트 시나리오를 위해 특별히 설계되었습니다. Base와 Instruct의 두 가지 변형을 제공하고 128K 컨텍스트를 지원하며 SWE-bench 및 Tau2-bench와 같은 에이전트 벤치마크에서 오픈 소스 SOTA 수준에 도달하며 API는 OpenAI/Anthropic 인터페이스와 호환됩니다.

키미 K2 제품 인터페이스

키미K2

핵심 매개변수 및 통계

Kimi K2는 2025년 7월 Moonshot AI가 오픈소스로 공개한 대규모 언어 모델 시리즈입니다. 총 매개변수 볼륨이 1조(1T)인 혼합 전문가(MoE) 아키텍처를 채택하고 토큰당 32B 매개변수만 활성화됩니다. 비사고 모델 경로에서 최첨단 수준의 지식, 추론 및 프로그래밍을 달성하고, 이를 기반으로 "질문에 답변"뿐만 아니라 "작업 실행"과 같은 에이전트 작업에 깊이 최적화되어 있습니다.

매개변수 항목 키미 K2-강습 / K2-베이스 키미 K2-0905(향상된 버전) Kimi K2.6 (유니버설 플래그십)
건축 MoE(혼합 전문 지식) 환경부 환경부
총 매개변수 1T 1T 비공개
활성화 매개변수 32B 32B 비공개
전문가 수 384(토큰당 8개 선택) 384 비공개
주의 메커니즘 MLA(다중 잠재 주의) MLA MLA
컨텍스트 창 128K 토큰 256K 토큰 256K 토큰
어휘 크기 160K 160K 비공개
훈련 데이터 15.5T 토큰
최적화 뮤온클립(자체 개발 안정화 옵티마이저) 뮤온클립
시각적 입력 지원되지 않음 지원되지 않음 지원됨(사진+동영상)
사고체인 추론 지원되지 않음(비사고 모델) 지원되지 않음 지원(생각/비생각 듀얼 모드)
오픈 소스 라이센스 수정된 MIT 수정된 MIT 오픈 소스 아님(API 전용)
추론 엔진 vLLM / SGLang / KTransformers / TensorRT-LLM 위와 동일 API 서비스

매개변수 해석: 토큰당 384명의 전문가 중 8명만 활성화됩니다(+1명의 공유 전문가). 이러한 높은 희소성 설계(활성화율은 약 2.3%)는 Kimi K2가 1T 총 매개변수로 배포 가능한 추론을 달성하는 핵심 이유입니다. MoE 경로에 있는 DeepSeek-V3(총 매개변수 671B/활성화 37B)와 비교하여 K2는 총 매개변수가 49% 더 크지만 활성화 매개변수는 13% 더 작습니다. 이는 동일한 하드웨어 조건에서 추론 계산량이 더 적다는 것을 의미합니다.

128K→256K 컨텍스트 전환: 초기 버전은 128K 토큰을 지원하며, 0905 강화 버전 및 후속 K2.6에서는 256K로 확장됩니다. 코드 저장소 수준 컨텍스트, 긴 문서 분석 및 여러 라운드의 에이전트 대화의 경우 256K 창은 보다 완전한 컨텍스트를 다루고 잘림으로 인한 계획 중단을 줄일 수 있습니다. 그러나 참고: 컨텍스트를 두 배로 늘리면 KV 캐시 오버헤드가 동시에 증가하며 자체 배포 시나리오에서 비디오 메모리 용량을 평가해야 합니다.

비사고 모델의 위치 차이: K2의 초기 버전은 "반사 등급"(반사 수준) 비사고 모델로 포지셔닝됩니다. 이는 명시적인 사고 사슬을 수행하지 않지만 사전 훈련 및 강화 학습에 의존하여 기능을 직관적인 반응으로 내재화합니다. 이로 인해 K2의 추론 대기 시간은 현대 사고 모델(예: DeepSeek-R1)보다 낮지만, 사고 모델은 다단계 논리 확장이 필요한 복잡한 추론 작업에서 여전히 장점을 가지고 있습니다. 후속 K2.6 버전에는 사고 연쇄 추론에 대한 지원이 추가되어 이러한 격차를 보완했습니다.

키미K2의 사용자 및 시장 인지도

Kimi K2의 시장 영향력은 오픈 소스 커뮤니티와 개발자 생태계에서 특히 두드러집니다. C-end 사용자는 주로 kimi.com의 무료 채팅 포털을 통해 K2 시리즈 모델과 접촉합니다.

오픈 소스 커뮤니티 인기: GitHub 저장소 'MoonshotAI/Kimi-K2'는 11,000개 이상의 별점과 880개 이상의 포크를 받았으며 10명의 활성 관리자가 계속해서 기여하고 있습니다. 이는 중국 AI 기업의 오픈소스 프로젝트 중 커뮤니티의 관심이 가장 높은 모델 창고 중 하나입니다. 커뮤니티는 K2 주변에 수많은 생태 프로젝트(예: kimi-writer, kimiflare, Kimi-K2.7 Swarm Workstation 등)를 탄생시켰습니다.

개발자 API 채택: Kimi API 플랫폼은 수백만 명의 전문 개발자에게 서비스를 제공했으며 파트너에는 Vercel, Cursor, Windsurf, TRAE, GenSpark, Xiaohongshu, Huawei, Coze, CodeBuddy 및 기타 주요 기업과 개발 도구가 포함됩니다. 특히 AI 프로그래밍 분야에서는 잘 알려진 많은 IDE 플러그인(예: Kilo Code, Cursor)이 K2 시리즈를 기본 모델로 통합합니다. Tencent CodeBuddy는 K2 Thinking 모델을 통합하여 개발자가 복잡한 프로그래밍 작업을 해결하도록 지원합니다. Genspark는 K2 0905 버전을 사용하여 에이전트 플랫폼에서 자율 에이전트를 구동합니다.

업계 고객 검증: 공개 사례에 따르면 K2는 금융 연구(AlphaEngine FinGPT 에이전트), 재료 과학(XtalPi 화학 문헌 이해), 과학용 AI(DP Technology RxnBench Top 2) 등과 같은 전문 분야에서 사용되었습니다. 이러한 시나리오는 도구 호출의 정확성과 긴 컨텍스트의 신뢰성에 대한 요구 사항이 매우 높습니다. 이러한 수직적 시나리오에서 K2를 구현하면 에이전트 기능이 프로덕션 수준 수준에 도달했음을 알 수 있습니다.

벤치마크 성능: SWE-벤치 검증(에이전트 코딩)에서 pass@1이 65.8%로 같은 기간의 모든 오픈 소스 모델을 능가합니다. Tau2-bench의 3개 하위 항목(도구 사용)에서 오픈소스 부문 1위를 차지했으며, 그 중 통신 하위 항목이 40% 이상 2위를 차지했습니다. Math & STEM 평가에서 AIME 2024/2025, MATH-500, GPQA-Diamond 및 기타 벤치마크는 비공개 소스 플래그십 모델 수준에 도달했거나 이에 근접했습니다(GitHub README 평가 표 참조). 이러한 결과는 비사고 모델 조건에서 달성되었다는 점에 유의해야 합니다. 사고 체인(K2.6 이상)에 합류한 후에는 추가 개선의 여지가 있을 것으로 예상됩니다.

비용 이점: 오픈 소스 + API 이중 트랙 가격이 모든 시나리오를 포괄합니다.

Kimi K2의 비용 구조는 순수 폐쇄 소스 모델이나 순수 오픈 소스 모델과 다릅니다. 이는 "오픈 소스 자체 호스팅 라이센스 비용 없음"과 "볼륨당 지불 API 매우 낮은 단가"를 모두 제공하여 개인 개발자부터 대기업까지 다양한 예산 및 규정 준수 요구 사항을 충족합니다.

C면: kimi.com에서 무료로 사용 가능: 일반 사용자는 횟수 제한 없이 kimi.com에서 K2 시리즈 모델을 무료로 선택하여 대화할 수 있습니다. 이것이 C-end 사용자를 유치하기 위한 Dark Side of the Moon의 핵심 전략입니다. 즉, 무료 경험을 통해 브랜드 인지도를 구축하고 개발자와 기업이 유료 API를 사용하도록 유도하는 것입니다. 무료 버전은 현재 MCP 도구 호출 및 시각적 입력과 같은 고급 기능을 지원하지 않습니다.

API 가격(개발자 수준): Kimi K2.6의 API 가격은 주류 대형 모델 중 중저가 수준이며, 컨텍스트 캐싱 메커니즘을 통해 반복 입력의 한계 비용이 더욱 절감됩니다.

모델 입력(캐시 적중) 입력(캐시 누락) 출력 컨텍스트 창
키미 K2.6 $0.16 / 백만 토큰 $0.95 / 백만 토큰 $4.00 / 백만 토큰 256K
키미 K2.7 코드 $0.19/백만 토큰 $0.95 / 백만 토큰 $4.00 / 백만 토큰 256K
Kimi K2.7 코드 고속 $0.38 / 백만 토큰 $1.90 / 백만 토큰 $8.00 / 백만 토큰 256K
비교: DeepSeek-V4-Flash ~$0.14/백만 토큰 ~$0.14/백만 토큰 ~$0.28/백만 토큰 100만
비교: GPT-4o ~$2.50/백만 토큰 ~$2.50/백만 토큰 ~$10.00 / 백만 토큰 128K

기업/개인 배포: K2 Base 및 Instruct 가중치는 수정된 MIT 라이선스에 따른 오픈 소스입니다. 기업은 라이선스 비용을 지불하지 않고도 자유롭게 다운로드하고, 자체 호스팅하고, 세부 조정할 수 있습니다. 자체 배포의 숨겨진 비용에는 GPU 서버(높은 동시성을 위해 4×A100-80G 이상 권장), 운영 및 유지 관리 인력, 네트워크 대역폭 및 추론 엔진 튜닝이 포함됩니다. 데이터 주권 요구 사항 또는 높은 규정 준수 감사 요구 사항(금융, 의료, 정부 업무)이 있는 산업의 경우 자체 호스팅이 유일하게 실행 가능한 경로입니다. 중소 규모 팀의 경우 API를 직접 호출하는 것이 자체 구축하는 것보다 훨씬 경제적입니다.

암시적 비용 고려 사항: K2의 초기 버전은 시각적 입력 및 사고 사슬 추론을 지원하지 않습니다. 비즈니스 시나리오에 다중 모달 또는 복잡한 추론이 필요한 경우 K2.6 이상으로 업그레이드해야 합니다. K2.6은 오픈 소스가 아니며 API를 통해서만 호출할 수 있습니다. 이는 엔드투엔드 셀프 호스팅을 기대하는 팀에게 "능력 상한선"을 제시합니다. 셀프 호스팅(무료 라이센스 + 제한된 기능)과 API(종량제 + 전체 기능) 간에 균형을 맞춰야 합니다.

키미K2의 주요 기능

Kimi K2의 기능 세트는 "도구 호출"과 "자율 작업 실행"이라는 두 가지 주요 라인을 중심으로 진행됩니다. 기존 채팅 모델과 다릅니다. 핵심 제품 논리는 "모델이 직접 도구를 작동하고 폐쇄 루프 작업을 완료하도록 하는 것"입니다.

  • Tool Calling/Function Calling: K2의 핵심 차별화 역량입니다. 모델은 외부 도구를 호출할 시기, 전달할 매개변수, 반환된 결과를 구문 분석하는 방법을 독립적으로 결정할 수 있습니다. OpenAI/Anthropic 호환 도구 스키마 정의를 지원하므로 개발자는 이를 활성화하려면 요청에 'tools' 매개변수만 전달하면 됩니다. 일반적인 응용 프로그램: 날씨 쿼리, 데이터베이스 쿼리, 외부 API 호출, 코드 실행. Tau2-bench 평가에서 K2는 소매/항공/통신의 세 가지 분야에서 다른 오픈 소스 모델보다 크게 앞서며 복잡한 도구 조합 시나리오를 제어하는 ​​능력을 입증했습니다.

  • 에이전트 코딩: K2는 SWE-bench Verified에서 pass@1(단일 빌드, 테스트 없이 계산) 65.8%로 오픈 소스 모델 챔피언이 되었습니다. 이는 K2가 GitHub 문제를 이해하고, 관련 코드 파일을 찾고, 수정 패치를 생성하고, 테스트를 실행하고, 반복적으로 수정 작업을 수행할 수 있음을 의미합니다. 이 모든 작업이 사람의 개입 없이 이루어집니다. 또한 SWE-bench Multilingual에서 47.3% pass@1에 도달하여 대부분의 비공개 소스 모델을 능가합니다. 개발자의 경우 이는 K2가 PR 검토 보조, 버그 수정 자동화 및 코드 리팩토링을 위한 기본 엔진 역할을 할 수 있음을 의미합니다.

  • 자율 작업 계획 및 실행: K2는 높은 수준의 작업 설명(예: "2020~2025년 원격 근무가 급여에 미치는 영향 분석")을 수용한 다음 이를 다단계 계획(데이터 로드 → 정리 → 통계 분석 → 시각화 → 보고서 생성)으로 자율적으로 세분화할 수 있습니다. K2의 공식 데모는 Python 코드 실행, 오류 포착, 전략 수정 및 대화형 HTML 보고서 생성을 포함하여 16개의 IPython 호출로 완전한 데이터 과학 워크플로를 자동으로 완료하는 것을 보여줍니다.

  • 장기 컨텍스트 이해(128K→256K): MLA(다중 헤드 잠재 주의) 메커니즘을 기반으로 K2는 긴 컨텍스트 시나리오에서 낮은 KV 캐시 오버헤드를 유지합니다. 초기 버전 128K, 0905 향상된 버전 및 후속 버전 256K 컨텍스트 창은 전체 코드 저장소, 수백 페이지의 문서 또는 수십 라운드의 에이전트 대화 기록을 처리합니다. 긴 컨텍스트 검색 작업에서 K2의 중간 및 후기 단계 정보 회상률은 동일한 규모의 모델보다 우수합니다. 이는 에이전트 시나리오에 특히 중요합니다. 에이전트는 대화 후반부에 초기 지침을 검토해야 하는 경우가 많습니다.

  • API 생태학적 도구 세트: Kimi API 플랫폼에는 웹 검색(인터넷 검색), Code-Runner(Python 코드 실행), Excel(Excel/CSV 파일 분석), Memory(대화 메모리 지속성), Fetch(URL 콘텐츠 추출), Rethink(아이디어 재구성) 등을 포함한 풍부한 공식 도구가 내장되어 있습니다. 이러한 도구는 K2 모델과 긴밀하게 통합되어 있으며 개발자가 직접 개발할 필요 없이 즉시 사용할 수 있습니다.

모델 및 버전의 진화

Kimi K2는 2025년 7월 처음 오픈 소스로 공개된 이후 초기 오픈 소스 → 에이전트 코딩 향상 → 다중 모드 일반 플래그십 → 프로그래밍 전문 분기의 명확한 경로를 통해 4개의 주요 버전 노드로 반복되었습니다.

메인라인 버전

버전 출시일 핵심 변경 사항 특징 오픈소스 현황
K2-베이스/K2-지시 2025-07 (~2025-07-22) 초기 오픈 소스 릴리스 128K 컨텍스트, 무생각, 도구 호출 오픈 소스(수정된 MIT)
K2-0905 2025-09-05 에이전트 코딩 향상 컨텍스트가 256K로 확장되고 프로그래밍 작업의 성공률이 향상됩니다 오픈 소스(수정된 MIT)
K2.6 2026-04 일반능력 향상 시각적 + 텍스트 입력 지원, 256K 컨텍스트, 사고 연쇄 추론, 사고/비사고 듀얼 모드 추가 API 전용
K2.7 코드/K2.7 코드 고속 2026-05 프로그래밍 전문 분야 프로그래밍 작업 최적화, 고속 버전 ~180개 토큰/초, 256K 컨텍스트, 사고 체인 추론 API 전용

버전 컨텍스트 해석

V1 단계(K2-Base/Instruct): The Dark Side of the Moon은 수정된 MIT 라이선스에 따라 1T 매개변수 MoE 모델을 완전히 오픈 소스로 선택했습니다. 이는 당시 가장 많은 수의 매개변수를 보유한 오픈 소스 모델 중 하나였습니다. 기본 버전은 심층적인 미세 조정이 필요한 연구원과 팀을 위한 것이고, Instruct 버전은 플러그 앤 플레이 일반 대화 및 에이전트 시나리오용입니다. 초기 버전은 "비사고 모델"로 포지셔닝되었으며 당시 주류 체인 추론 경로와 의도적으로 차별화되었습니다.

V2 단계(K2-0905): 약 1.5개월 후 향상된 버전으로 Agentic Coding 기능을 개선하고 컨텍스트를 256K로 두 배로 늘리는 데 중점을 둡니다. 이번 릴리스는 개발자 현장을 향한 Dark of the Moon의 성향을 반영합니다. SWE 벤치에서의 최고의 성능은 기술적 접근 방식의 효율성을 입증합니다.

V3 단계(K2.6): K2 시리즈가 "순수 텍스트 비사고 모델"에서 "다중 모드 사고 모델"로 전환하는 핵심 버전입니다. 시각적 입력, 사고 연쇄 추론, 사고/비사고 듀얼 모드가 추가되어 능력 적용 범위가 크게 확장됩니다. 그러나 이는 오픈소스가 아닌 첫 번째 버전이기도 하며 Dark Side of the Moon의 오픈소스 전략의 차별화를 나타냅니다. 기본 모델 기능은 계속 오픈소스로 유지하고 최첨단 기능은 API 형태로 상용화합니다.

V4 단계(K2.7 코드): 프로그래밍 시나리오를 위한 심층적으로 전문화된 분기로, Cursor 및 Windsurf와 같은 IDE 플러그인의 기본 모델 요구 사항을 직접 대상으로 하는 높은 처리량 버전(180개 토큰/초)을 제공합니다. Code 제품군은 범용 K2.6을 보완합니다. 하나는 코드 품질을 기반으로 하고 다른 하나는 광범위한 애플리케이션을 포괄합니다.

기술적 장점: MuonClip부터 대규모 Agentic RL까지의 기술 스택

Kimi K2의 기술적 이점은 단일 혁신이 아니라 훈련 전 최적화부터 훈련 후 강화 학습까지 전체 링크의 체계적인 엔지니어링 혁신입니다.

MuonClip Optimizer: Muon 훈련의 불안정성 문제 해결: Muon 최적화 프로그램은 널리 사용되는 AdamW보다 토큰 효율성이 훨씬 뛰어나지만 대규모 훈련에서는 주의 로짓 폭발이 발생하여 훈련 중단을 초래하는 경향이 있습니다. Kimi K2 팀은 소스에서 주의 로짓 척도를 제어하기 위해 Muon이 업데이트된 후 쿼리/키 투영 가중치를 직접 재조정하는 qk-clip 기술을 제안했습니다. 적응형 요소(최대 로짓을 기반으로 한 동적 임계값)를 도입함으로써 MuonClip은 15.5T 토큰에 대한 사전 훈련에서 훈련 스파이크를 제로로 달성합니다. 이에 대한 엔지니어링 의미는 대규모 MoE 교육의 비용과 위험이 크게 감소하여 Dark Side of the Moon이 동료보다 훨씬 낮은 예산으로 1T 매개변수 모델을 교육할 수 있다는 것입니다.

높은 희소성 MoE 설계: 전문가 384명 + 토큰당 선택된 8명(+1명의 공유 전문가), 활성화율은 ~2.3%에 불과합니다. 희소성이 높다는 것은 전체 매개변수 수가 증가함에 따라 계산량이 준선형적으로 증가한다는 것을 의미하며, 추론 중에 32B 활성화 매개변수만 비디오 메모리에 로드됩니다. 이를 통해 단일 카드 A100-80G가 추론을 실행하여 자체 배포를 위한 하드웨어 임계값을 낮출 수 있습니다.

대규모 에이전트 데이터 합성 파이프라인: K2의 에이전트 기능은 두 가지 주요 혁신에서 비롯됩니다. 첫째, ACEBench에서 영감을 받은 자동화된 데이터 합성 파이프라인 - 수백 가지 분야에서 수천 개의 도구(실제 MCP 도구 및 합성 도구 포함)를 체계적으로 발전시키고, 다양한 도구를 운반하는 수백 개의 에이전트를 생성하며, 시뮬레이션된 환경에서 여러 라운드에 걸쳐 사용자 에이전트와 상호 작용할 수 있도록 합니다. LLM 심사위원은 루브릭을 기반으로 상호 작용 결과에 점수를 매기고 필터링하여 고품질 교육 데이터를 생성합니다. 둘째, 일반 강화 학습 시스템은 검증 가능한 보상(수학, 경쟁 프로그래밍)과 검증 불가능한 보상(작문, 연구)을 구별하고 후자에 대해 "자기 비판" 메커니즘을 채택합니다. 모델은 자체 비평가 역할을 하며 루브릭을 기반으로 확장 가능한 피드백을 제공합니다. 동시에 검증 가능한 보상의 정책 출시는 지속적으로 비평가를 업데이트하여 긍정적인 피드백 루프를 형성합니다.

API 호환성 디자인: API는 OpenAI 및 Anthropic의 인터페이스 형식과 호환됩니다. 이를 통해 개발자의 마이그레이션 비용이 절감됩니다. 기존 OpenAI SDK 기반 애플리케이션은 base_url 및 API 키만 수정하여 K2로 전환할 수 있습니다. Anthropic 호환 인터페이스의 온도는 'real_temp = request_temp × 0.6'을 통해 매핑되어 기존 애플리케이션과의 호환성을 보장합니다.

다중 추론 엔진 지원: 권장되는 실행 엔진에는 vLLM, SGLang, KTransformers 및 TensorRT-LLM이 포함되어 학술 연구부터 프로덕션 배포까지 다양한 성능 요구 사항을 충족합니다. vLLM과 SGLang은 처리량 최적화에 중점을 두고 있으며, KTransformers는 단일 카드 실험에 적합하며, TensorRT-LLM은 극단적인 추론 최적화에 사용됩니다.

사용방법

Kimi K2는 일반 사용자부터 개발자까지 전체 액세스 수준을 포괄하는 세 가지 사용 경로를 제공합니다.

사용 방법 입구 군중에게 적합 핵심 제한사항
웹 채팅 키미닷컴 일반 사용자, 제품 경험자 시각적 입력 및 MCP 도구(초기 버전)는 지원되지 않습니다. 로그인이 필요합니다
API 호출 platform.kimi.ai 개발자, 기업 통합 계정을 등록하고 API 키를 생성해야 합니다. 수량에 따른 과금
자체 호스팅 배포 GitHub + 포옹하는 얼굴 연구팀, 고준수 기업 GPU 서버가 필요합니다. 추론 엔진을 직접 구축해야 합니다

API 빠른 액세스 예시(Python, OpenAI SDK와 호환):

``파이썬 openai 가져오기 OpenAI에서

클라이언트 = OpenAI( api_key="", base_url="https://api.moonshot.ai/v1" )

응답 = client.chat.completions.create( 모델="kimi-k2.6", 메시지=[ {"role": "system", "content": "당신은 Dark Side of the Moon이 만든 AI 조수 Kimi입니다."}, {"role": "user", "content": "Python에서 빠른 정렬 알고리즘을 작성합니다."} ], 온도=0.6, max_tokens=2048, 스트림=거짓 ) 인쇄(response.choices[0].message.content)


**도구 호출을 사용한 API 예시**:

``파이썬
도구 = [{
    "유형": "함수",
    "함수": {
        "이름": "get_weather",
        "description": "지정된 도시의 현재 날씨 정보를 가져옵니다",
        "매개변수": {
            "유형": "객체",
            "필수": ["도시"],
            "속성": {
                "도시": {"유형": "문자열", "설명": "도시 이름"}
            }
        }
    }
}]

응답 = client.chat.completions.create(
    모델="kimi-k2.6",
    message=[{"role": "user", "content": "오늘 베이징 날씨는 어때요?"}],
    도구=도구,
    tool_choice="자동",
    온도=0.6
)

자체 호스팅 배포(vLLM 예):

``배쉬

vLLM 설치(Kimi K2 버전을 지원해야 함)

pip 설치 vllm

추론 서비스 시작(K2-Instruct를 예로 들어)

python -m vllm.entrypoints.openai.api_server \ --model moonshotai/Kimi-K2-Instruct \ --텐서-병렬-크기 4 \ --max-model-len 131072 \ --gpu-메모리 활용도 0.9

서비스 시작 후 OpenAI 호환 인터페이스를 통해 호출 가능



**일반적인 사용 프로세스**: kimi.com 또는 platform.kimi.ai 방문 → 등록/로그인 → API 키 생성(API 모드) → 모델 선택(K2.6/K2.7 코드) → 메시지 및 도구 정의 입력(선택 사항) → 생성된 결과 가져오기 → tool_calls 구문 분석(필요한 경우) → 키 출력 수동 검토.

## 제품 가격

Kimi K2 시리즈의 가격 전략은 "오픈 소스 무료 + API 종량제 + 기업 맞춤화"의 3단계 구조를 채택하여 오픈 소스 전략을 보완합니다.

**C면: kimi.com에서 무료**: 모든 Kimi 시리즈 모델(K2/K2.6/K2.7 코드 포함)은 kimi.com에서 상한선 없이 무료로 사용할 수 있습니다. 이 가격 책정 전략의 목적은 사용자 기반을 극대화하고 API 서비스에 대한 유료 전환을 촉진하는 것입니다. 무료 버전에는 기능이 제한되어 있다는 점은 주목할 가치가 있습니다(예: 도구 호출 지원 안 함, 제한된 고주파 요청, SLA 보장 없음).

**API 종량제**: API 가격은 모델 버전과 캐시 적중 상태에 따라 다릅니다.

| 모델 | 입력(캐시 적중) / 백만 토큰 | 입력(캐시 누락)/백만 토큰 | 출력/백만개 토큰 | 처리량이 많은 버전 출력 |
|---|---|---|---|---|
| 키미 K2.6 | $0.16 | $0.95 | $4.00 | — |
| 키미 K2.7 코드 | $0.19 | $0.95 | $4.00 | — |
| Kimi K2.7 코드 고속 | $0.38 | $1.90 | $8.00 | — |
| 키미 K3 (플래그십) | $0.30 | $3.00 | $15.00 | — |

**엔터프라이즈 맞춤형 솔루션**: 플랫폼은 유연한 요금 제한, 다중 프로젝트 배포 지원, SLA 보장, 데이터 규정 준수 및 개인 정보 보호, 독점 기술 지원을 포함한 "엔터프라이즈 솔루션 및 맞춤형" 서비스를 제공합니다. 기업 가격은 사업팀에 문의하여 확인해야 하며, 표준 가격은 공개되지 않았습니다. 자체 호스팅이 필요한 기업의 경우 K2 Base/Instruct 오픈소스 가중치를 무료로 제공하지만 GPU 인프라, 운영 및 유지 관리 인력, 추론 엔진 튜닝 비용은 직접 평가해야 합니다.

**무료 할당량 및 청구 세부정보**: API 등록 후 기본적으로 무료 평가판 할당량이 있습니다(구체적인 값은 platform.kimi.ai 페이지에 적용됨). 상황별 캐싱은 자동으로 적용됩니다. 동일한 접두사가 반복적으로 입력되면 캐시 적중 가격이 자동으로 적용됩니다. 파일 업로드 및 콘텐츠 추출 인터페이스는 현재 무료입니다. 실제 과금은 실시간 페이지를 기준으로 이루어집니다. 배포하기 전에 Token을 통해 예상 API 사용량을 계산하는 것이 좋습니다.

## 애플리케이션 시나리오

Kimi K2의 핵심 기능은 단순한 텍스트 생성이 아닌 도구의 적극적인 조작이 필요한 작업 시나리오에 가장 적합하다고 결정합니다. 다음 유형의 시나리오는 입출력 비율이 가장 높습니다.

- **에이전트 프로그래밍 및 코드 웨어하우스 유지 관리**: SWE-벤치에서 K2의 SOTA 성능은 GitHub 문제 복구, 코드 검토, 테스트 생성 및 리팩토링과 같은 엔지니어링 작업이 가능하다는 것을 의미합니다. 실제 사용 효과는 코드 웨어하우스의 모듈성과 문제 설명의 명확성에 따라 달라집니다. 고도로 결합된 오래된 코드 베이스에서는 K2의 문제 위치 정확도가 감소합니다. **수용 문제**: 중소 규모 창고(<50K 라인)의 단일 파일 수리 작업부터 검증을 시작하고 점차적으로 다중 파일 재구성으로 확장하는 것이 좋습니다.

- **심층 연구 및 분석 보고서 생성**: 웹 검색, Code-Runner 및 긴 컨텍스트 기능을 결합한 K2는 데이터 수집, 통계 분석에서 보고서 작성에 이르기까지 전체 워크플로를 완료하는 연구 보조자 역할을 할 수 있습니다. 공식 데모에서는 급여 데이터 분석을 완료하고 16개의 IPython 호출로 대화형 HTML 보고서를 생성하는 기능을 보여줍니다. **수용 문제**: 데이터 소스에 대한 권위 있는 요구 사항이 높을수록 주요 결론 링크에 수동 검토 지점을 설정하는 것이 더 필요합니다. K2의 통계 분석은 자동화가 가능하지만, 인과관계 추론과 비즈니스 추천을 모델에 완전히 맡기는 것은 권장되지 않습니다.

- **자동화된 작업 흐름 및 에이전트 시스템**: K2는 자율 에이전트 시스템을 구축하기 위한 이상적인 기본 모델입니다. 개발자는 Kimi API에서 다중 에이전트 협업 시스템을 구축할 수 있습니다. 각 에이전트는 서로 다른 도구 세트를 가지고 있으며 작업 조정을 통해 복잡한 비즈니스 논리를 완성합니다. Tencent CodeBuddy 및 Genspark Agent 플랫폼은 이 시나리오의 전형적인 사례입니다. **수용 문제**: 에이전트 시나리오에서는 토큰 소비 증가에 주의를 기울여야 합니다. 도구를 여러 번 호출하면 출력 토큰의 양이 크게 늘어납니다. 단일 작업 max_steps 및 토큰 예산 상한을 설정하는 것이 좋습니다.

- **고객 서비스 및 대화 지능**: K2의 명령 따르기 기능과 긴 컨텍스트 창은 지능형 고객 서비스 시스템 구축에 적합합니다. 사용자 의도와 상황에 대한 정확한 이해를 유지하면서 수십 라운드에 걸쳐 진행되는 대화를 처리할 수 있습니다. 메모리 도구와 협력하여 대화 기록 지속성과 사용자 초상화 축적을 달성할 수 있습니다. **수용성 문제**: 비즈니스 분야에 맞는 고품질의 Few-Shot 예제와 시스템 프롬프트 단어를 구축하는 것이 필요합니다. 민감한 비즈니스 운영(환불, 계정 해지 등)의 경우 수동 확인 포인트를 설정해야 합니다.

- **법률 및 계약 검토**: K2의 긴 컨텍스트 기능을 통해 수십 페이지에서 수백 페이지의 계약 문서를 한 번에 처리하고, 핵심 용어 추출, 위험 지점 표시, 버전 차이 비교 등을 수행할 수 있습니다. **수용 초점**: 법률 텍스트의 특수 용어 및 논리적 구조는 매우 정확한 이해를 요구합니다. 공식 출시 전 시스템 평가를 위해 대상 분야의 계약 샘플을 사용하는 것이 좋습니다. 최종 법적 의견은 여전히 ​​변호사의 확인을 받아야 합니다.

## 해당자

Kimi K2의 청중은 개인 개발자, 연구 팀, 대기업에 걸쳐 있지만 다양한 역할의 가치 포인트와 전제 조건은 크게 다릅니다.

- **AI 애플리케이션 개발자**: K2의 핵심 고객입니다. 에이전트 애플리케이션 구축, 프로그래밍 보조자 또는 자동화된 워크플로 등 무엇이든 K2의 도구 호출 기능과 오픈 소스 라이선스는 유연한 통합 기반을 제공합니다. 전제 조건: OpenAI/Anthropic API 형식에 익숙하고 도구 스키마 정의 및 에이전트 아키텍처를 이해합니다. 자체 호스팅이 필요한 개발자의 경우 GPU 클러스터 배포 경험도 필요합니다. **해당되지 않는 시나리오**: 높은 시각적 이해가 필요한 다중 모드 애플리케이션(K2.6 API 권장 또는 다중 모드 모델 전환) 극도의 지연 시간이 필요한 실시간 대화(전용 소형 모델 또는 고속 버전 API 권장)

- **AI 연구팀**: K2-Base의 오픈 소스 가중치는 연구원에게 미세 조정, 정렬 연구, 모델 압축 및 에이전트 행동 분석에 사용할 수 있는 1T 매개변수 인식 연구 플랫폼을 제공합니다. MuonClip 옵티마이저 구현은 훈련 안정성 연구에 대한 참고자료도 제공합니다. 전제 조건: 충분한 GPU 컴퓨팅 성능(8×A100-80G 이상 권장) 및 MoE 모델 교육/미세 조정 경험. **해당되지 않는 시나리오**: 예산이 부족한 개별 연구원(모델 무게가 600GB를 초과하고 저장 및 로딩 비용이 높음).

- **엔터프라이즈 AI 팀**: K2의 오픈 소스 라이선스 및 API 이중 트랙 시스템은 기업에 유연한 선택을 제공합니다. 규정 준수 요구 사항이 높으면 자체 호스팅을 선택하고 속도 요구 사항이 높으면 API를 선택합니다. 중소기업은 API를 통해 신속하게 개념을 입증할 수 있으며, 대기업은 오픈 소스 가중치를 기반으로 프라이빗 배포를 구축할 수 있습니다. 전제 조건: GPU 구매/임대 비용, 운영 및 유지 관리 인력, 모델 업데이트 빈도를 포함하여 셀프 호스팅과 API의 총 소유 비용(TCO)을 평가해야 합니다. **시나리오에는 해당되지 않음**: 다중 양식(사진/비디오 입력)이 강력히 필요하고 API 사용을 꺼리는 시나리오(K2 초기 버전은 비전을 지원하지 않음) 1M 토큰이 넘는 매우 긴 컨텍스트가 필요한 시나리오(DeepSeek 또는 1M 컨텍스트를 지원하는 기타 모델이 권장됨)

- **셀프 미디어 운영 및 콘텐츠 제작자**: kimi.com의 무료 입장을 통해 일반 사용자는 K2의 텍스트 생성 기능을 무료로 경험할 수 있으며 이는 기사 초안, 콘텐츠 요약, 브레인스토밍과 같은 가벼운 작업에 적합합니다. **시나리오에는 해당되지 않음**: 시각적 생성이 필요한 시나리오(예: 그래픽 및 텍스트 레이아웃, 포스터 디자인) 심도 있는 긴 형식의 창의적 글쓰기가 필요한 시나리오(K2 비사고 모드의 출력은 전용 쓰기 모델만큼 창의적이고 서술적인 논리가 아닐 수 있음)

## 요약 및 전망

Kimi K2는 "오픈 소스 에이전트 모델" 부문에서 Dark Side of the Moon의 정확한 위치입니다. 가장 큰 매개변수나 가장 긴 컨텍스트를 가진 모델은 아니지만 도구 호출 및 에이전트 작업 측면에서 오픈 소스 모델을 폐쇄 소스 플래그십 수준으로 끌어올린 최초의 제품입니다. 1T MoE + MuonClip 옵티마이저 + 대규모 Agentic RL의 기술 조합은 2025년 오픈 소스 모델 환경에서 확실한 차별화 요소입니다.

**핵심 역량**: 에이전트 기능(SWE-벤치 65.8%, Tau2-벤치 오픈 소스 우선)은 K2에서 가장 따라하기 어려운 해자입니다. 이는 Dark Side of the Moon이 에이전트 데이터 합성 및 일반 RL 시스템에 장기간 투자한 결과입니다. 오픈 소스 전략(수정된 MIT)은 기업의 시행착오 비용을 줄이고 OpenAI/Anthropic과의 API 호환성으로 마이그레이션 임계값을 낮춥니다. 이 모델은 또한 추론 효율성 면에서 분명한 이점을 가지고 있습니다. 32B 활성화 매개변수는 단일 카드에서 실행될 수 있으며 추론 비용이 동일한 기능 수준의 밀집 모델보다 낮다는 것을 의미합니다.

**현재 제한 사항**: 초기 버전은 시각적 입력 및 사고 사슬 추론을 지원하지 않습니다(K2.6은 API를 통해 이를 보완했습니다). 오픈 소스 버전은 K2-0905로 유지되며 후속 K2.6/K2.7 코드는 API 호출만 제공하며 자체 호스팅 사용자는 다중 모드 및 사고 체인 기능을 얻을 수 없습니다. 초장기 컨텍스트(1M+) 시나리오에서는 DeepSeek과 같은 경쟁 제품보다 열등합니다. 일부 복잡한 추론 작업에서는 토큰 낭비 및 불완전한 도구 호출이 때때로 발생합니다(공식적으로 제한 사항에서 인정).

**후속 진화 관찰**: (1) Dark Side of the Moon이 계속해서 후속 버전의 비중을 오픈 소스로 유지할 것인지 여부 - 이는 오픈 소스 커뮤니티에서 K2의 장기적인 생태학적 상태를 결정합니다. (2) "사고 모델" 방향으로 K2 시리즈의 추가 통합 - 초기 버전은 분명히 CoT 경로를 따르지 않지만 K2.6은 사고 체인 지원을 추가하기 시작하므로 이 전략적 변화는 추적할 가치가 있습니다. (3) 에이전트 생태학적 구축 - K2 주변의 커뮤니티 프로젝트(Swarm, MCP 도구 통합 등)가 유사한 LangChain을 형성할 수 있는지 여부 또는 AutoGPT의 생태학적 응집 효과.

**조달/도입 위험 평가**: 중소 규모 팀의 가장 경제적인 진입 경로는 Kimi API로 시작하여 초기 GPU 투자가 필요하지 않은 K2.6으로 숙련도 검증을 수행하는 것입니다. 대기업 및 중간 규모 기업의 경우 먼저 API를 사용하여 PoC를 수행하여 대상 시나리오에서 K2의 성능을 검증한 후(테스트 도구 호출 정확도, 긴 컨텍스트 회수율 및 작업 완료율에 중점) 자체 호스팅 환경을 구축할 가치가 있는지 평가하는 것이 좋습니다. 셀프 호스팅은 다음 사항을 확인하는 데 중점을 두어야 합니다. (1) 상업적 사용 및 2차 배포에 관한 라이센스 조건(수정된 MIT의 특정 제한 사항) (2) GPU 클러스터의 구매/임대 비용과 운영 및 유지 관리 팀의 역량; (3) 모델 업데이트 및 커뮤니티 지원의 예측 가능성. 강력한 규정 준수 산업(금융, 의료, 정부 업무)에서 K2 오픈 소스 가중치는 데이터 주권 보호를 제공하지만 회사는 공식 생산 전에 여전히 내부 보안 감사 및 적대적 테스트를 완료해야 합니다.

관련 도구: <exlink type="tool" slug="crewai">, langchain

버전 정보

  • 키미 K2.6 :K2 시리즈의 범용 플래그십 버전은 시각적 및 텍스트 입력, 사고 사슬 추론 및 256K 컨텍스트를 지원합니다. API 가격은 0.95달러/백만 토큰 입력 및 4.00달러/백만 토큰 출력입니다.
  • 키미 K2.7 코드 :256K 컨텍스트 및 사고 사슬 추론을 지원하고 프로그래밍 작업에서 더 높은 성공률을 가지며 고속 버전(~180개 토큰/초)을 제공하는 특수 프로그래밍 버전입니다. API 가격은 $0.95/백만 토큰 입력 및 $4.00/백만 토큰 출력입니다.
  • 키미 K2-0905 :향상된 저작권 보호, 향상된 에이전트 코딩 기능, 256K로 확장된 컨텍스트 및 Hugging Face를 다운로드할 수 있습니다.
  • 키미 K2-지시 :초기 명령 미세 조정 버전, 128K 컨텍스트, 비사고 모드, 일반 채팅 및 에이전트 시나리오에 최적화되었습니다.
  • 키미 K2-베이스 :기본 사전 훈련 모델, 1T 총 매개변수/32B 활성화, 연구자가 미세 조정하고 사용자 정의하는 데 적합합니다.

사용자 후기

  • 후기를 불러오는 중...