キミ・リニア
無料
Kim Linear は、Moonshot AI によって開始されたハイブリッド リニア アテンション アーキテクチャのオープン ソース モデルです。 1M レベルのコンテキストで高スループットの推論を行うように設計されています。 KV キャッシュの使用量を最大 75% 削減し、デコード速度を最大約 6 倍向上させることができます。
キミリニア の全レビュー
コアパラメータと統計
| プロジェクト | 仕様 |
|---|---|
| 製品のポジショニング | ハイブリッド リニア アテンション オープンソース ロング コンテキスト モデル |
| 開発者 | ダークサイド オブ ザ ムーン (ムーンショット AI) |
| モデルパラメータ | 合計パラメータ 48B / 活性化パラメータ 3B (MoE) |
| コンテキストの長さ | 100万トークン |
| オープンソース ライセンス | MITライセンス |
| KV キャッシュの節約 | 最大 75% 削減 |
| デコードの高速化 | 長いコンテキストでは最大約 6 倍 |
| エコロジーサポート | トランスフォーマー、vLLM、フラコア |
Kim Linear は、モデル アーキテクチャ レベルで Dark Side of the Moon に貢献した重要なオープンソースです。その中心となるアイデアは、従来のアテンション層の一部を線形アテンションに置き換えることで、モデルの品質に大きな影響を与えることなく、長いコンテキスト推論のリソース消費を大幅に削減することです。平たく言えば、非常に長いテキストを処理する際に、大規模なモデルをより高速に作成し、メモリの使用量を減らすことができます。
宣伝検証: 「KV キャッシュの使用量が最大 75% 削減され、デコード速度が最大 6 倍向上しました。」 - これらの数値は、論文/技術レポートで報告されている特定の構成およびベンチマークの下で達成されています。実際の利点は、推論の特定のシナリオとバッチ サイズによって異なります。線形アテンションの利点は、短いテキストのシナリオでは明らかではありませんが、長いテキスト (>100K トークン) では利点が徐々に増幅されます。
ユーザーと市場の認識
Dark Side of the Moon はこれまで Kimi K2 などのクローズド ソース モデルで知られていましたが、Kimi Linear はその珍しいオープンソース アーキテクチャ モデルです。 48B/A3B MoE スケールにより、自己導入シナリオに適しています。3B アクティベーション パラメータにより、単一の A100-80GB で推論を実行できます。 MIT ライセンスには商用利用の余地も十分に残されています。ロング コンテキスト モデルの分野において、Google Gemini や Anthropic Claude などのクローズドソース ソリューションとの違いは、オープン性と制御性にあります。
Dark Side of the Moon はこれまで Kimi K2 などのクローズド ソース モデルで知られていましたが、Kimi Linear はその珍しいオープンソース アーキテクチャ モデルです。 48B/A3B MoE スケールにより、自己導入シナリオに適しています。3B アクティベーション パラメータにより、単一の A100-80GB で推論を実行できます。 MIT ライセンスには商用利用の余地も十分に残されています。ロング コンテキスト モデルの分野において、Google Gemini や Anthropic Claude などのクローズドソース ソリューションとの違いは、オープン性と制御性にあります。
宣伝検証: 「KV キャッシュの使用量が最大 75% 削減され、デコード速度が最大 6 倍向上しました。」 - これらの数値は、論文/技術レポートで報告されている特定の構成およびベンチマークの下で達成されています。実際の利点は、推論の特定のシナリオとバッチ サイズによって異なります。線形アテンションの利点は、短いテキストのシナリオでは明らかではありませんが、長いテキスト (>100K トークン) では利点が徐々に増幅されます。
コストメリット
| 寸法 | 説明 |
|---|---|
| モデルの重み | MIT ライセンス、ハグフェイス無料ダウンロード |
| 自己展開型推論 | 独自の GPU を持参する必要があります (A100 ~ 80GB のシングル カードを実行可能) |
| API サービス | Dark Side of the Moon はスタンドアロン API を提供しません。 |
| クラウド サービス プロバイダー | サードパーティの推論プラットフォームが徐々に接続されることが予想されます。 |
無料情報: Weights MIT はオープンソースですが、自己展開には GPU が必要です。 48B/A3B MoE アーキテクチャは、同じスケールの高密度モデル (3B アクティベーション パラメーターと 48B フル パラメーター) と比較して推論コストを大幅に削減しましたが、スムーズな実行エクスペリエンスを実現するには、少なくとも A100-80GB または同等のハードウェアへの投資が必要です。個人の開発者の場合、クラウド GPU をレンタルする月額コストは約 500 ~ 1000 ドルです。
隠れたメリット: 独自のロングコンテキスト推論サービスを構築しているチームの場合、KV キャッシュが 75% 削減されるということは、同じハードウェアで 4 倍の同時リクエストに対応できるか、同じリクエストで 4 倍長いコンテキストを処理できることを意味します。これらの隠れたメリットは、継続的に実行されるサービスでのハードウェア コストの大幅な削減につながります。
主な機能
- 1M コンテキストによる長いテキスト処理: 数百万のトークンレベルのコンテキストをサポートし、長いドキュメントの分析、完全なコード ベースの理解、長期の会話履歴の処理などのシナリオに適しています。 128K または 200K コンテキストを備えたモデルと比較して、Kimi Linear の 1M コンテキストは、「一度では完了できない」タスクの大部分をカバーします。
- 3:1 ハイブリッド アテンション アーキテクチャ: キミ デルタ アテンション (リニア アテンション) とフル アテンション MLA を 3:1 の比率で組み合わせて、情報と計算効率のバランスをとります。 3 層の直線的注意 + 1 層の完全な注意のパターンがテキスト全体で何度も繰り返されます。
- 低 KV キャッシュ推論: KV キャッシュが 75% 低いということは、同じ GPU メモリがより長いコンテキストまたはより大きなバッチをサポートできることを意味します。高スループットの推論を必要とするシナリオ (同時対話システムなど) の場合、これはコストと遅延に直接影響するエンジニアリング上の利点です。
- オープンソース エコシステムの互換性: Transformers、vLLM、fla-core などの複数の推論フレームワークをサポートしており、開発者は使い慣れたツール チェーンを使用してモデルをデプロイできます。
モデルとバージョンの進化
メインライン リリース
- ~2026-06: キミ-リニア-48B-A3B-Hugging Face のオープン ソース (MIT ライセンス)。
技術的な利点
- アルゴリズムの最適化: 応答速度と結果の品質のバランスを達成するために、対応するシナリオに対してモデルまたはアルゴリズム レベルで特別な最適化が実行されています。
- 低遅延アーキテクチャ: ストリーミングまたは非同期処理アーキテクチャを採用してユーザーの待ち時間を短縮し、高頻度の対話シナリオに適しています。
使い方
- Hugging Face からモデル ウェイトをダウンロードします:
moonshotai/ Kim-Linear-48B-A3B-Instruct - Transformers または vLLM を使用した負荷推論
- fla-core の KDA カーネル アクセラレーションをサポート
- OpenAI互換の推論サービスに統合可能
製品の価格設定
| 寸法 | 説明 |
|---|---|
| モデルの重み | MIT ライセンスの下で無料 |
| 自己展開 | GPU が必要 (A100-80GB 1 枚のカードで実行可能) |
| APIサービス | 未公開 |
アプリケーションのシナリオ
- 100 万トークンのドキュメント分析: 技術ドキュメント全体、完全な財務レポート、および複数ラウンドの顧客対話履歴を分析します。 「分割してまとめて繋ぐ」から「全文を一度に読む」まで、分析の品質が高まり、セグメントをまたがる情報も逃しません。
- 長いコード ベースの理解: リファクタリング分析、セキュリティ監査、またはドキュメント生成のために、プロジェクト コード ベース全体 (数十万行のコード) をコンテキストに一度にロードします。 Kim Linear の低 KV キャッシュにより、このシナリオはコンシューマ GPU で実現可能になります。
- 長連鎖推論と複雑な Q&A: 複数の契約書の相互参照や長い論文の詳細な分析など、答えるために大量の情報を読む必要がある質問。
シナリオの中止: アプリケーションのシナリオが単なる短いテキストの会話 (毎回数百から数千のトークン) である場合、線形注意の利点は発揮できず、実際には従来の高密度モデルの推論効率の方が高くなります。キミリニアの価値は、長いテキストのシーンでのみ完全に発揮されます。
該当する人
- 長いコンテキストのアプリケーション開発者: 独自の製品に長いテキストの分析や対話を実装する必要があるエンジニア、Kimi Linear のオープンソース ライセンス、および低リソース消費は、自己展開に推奨されるソリューションです。
- セルフホスト LLM チーム: API コストに敏感なチーム、またはデータの民営化が必要なチームは、商用展開に Kim Linear の MIT プロトコルを活用します。
- LLM アーキテクチャ研究者: 注意メカニズムの最適化に焦点を当てている研究者にとって、Kimi Linear のオープンソース コードと重みは、線形注意の実用性を研究するための重要な参考資料です。
人間とマシンのコラボレーション境界: 100% 自動化: モデル推論と長いテキストの処理。手動による介入が必要です。長い文書の分析結果の精度検証と重要な情報の相互検証が必要です。 Kim Linear は、1M コンテキストで関連情報を見つけるのに役立ちますが、この情報から導き出される結論には人間の判断が必要です。
現在の制限: 短いテキストのシナリオにおける線形注意の利点は重要ではありません。コミュニティによる fla-core KDA カーネルへの適応はまだ初期段階にあります。主流の推論フレームワーク (vLLM、llama.cpp) との緊密な統合を改善する必要があります。
概要と展望
同社は、その分野で競争力のあるソリューションを提供しており、その核となる価値は、この分野での AI 利用の敷居を下げることにあります。
現在の制限事項: 一部の高度な機能には有料のサブスクリプションが必要であり、無料版には機能または使用制限があります。具体的な技術的詳細と性能ベンチマークはまだ完全には開示されていません。
関連ツール:
ハグフェイス、replicate
技術的な利点と能力の限界
AI モデルおよび API 製品としての Kim Linear のコア機能は、次の側面を通じて深く理解でき、テクノロジーの選択と実装効果に直接影響します。
推論パフォーマンスとベンチマーク パフォーマンス モデルの推論パフォーマンスは、標準的な NLP タスク (テキスト生成、コード補完、意味理解、マルチターン対話、情報抽出など) のパフォーマンスに反映されます。公開されているベンチマーク テスト リスト (MMLU、HumanEval、GSM8K など) を通じて水平比較を行うことをお勧めしますが、ベンチマーク テストのスコアと実際のビジネス シナリオのパフォーマンスの間にはギャップがある可能性があることに注意してください。実際のユーザー エクスペリエンスに影響を与える主な指標には、推論速度 (トークン/秒または応答遅延。ユーザー エクスペリエンスの滑らかさを直接決定します)、コンテキスト ウィンドウの長さ (一度に処理できる入力サイズを決定し、処理できるタスクの複雑さに影響します)、出力品質の一貫性 (同じ入力の複数の出力の結果の安定性。信頼性の認識に影響します) が含まれます。
API の互換性と開発エコシステム 主流の開発フレームワーク (LangChain、LlamaIndex、セマンティック カーネルなど) との API 互換性の深さは、統合開発のコストとサイクルに直接影響します。次の統合の側面に注意することをお勧めします: SDK でサポートされる言語タイプの範囲 (Python、JavaScript、Go、Java などの主流言語に公式 SDK があるかどうか)、ストリーミング出力のサポート (SSE/WebSocket プロトコルの互換性)、関数呼び出しとツールの使用機能 (モデル出力の構造化関数呼び出しへのマッピングをサポートするかどうか)、構造化出力の柔軟性 (JSON モード)、エンタープライズ レベルのインフラストラクチャとの統合機能 (VPC デプロイメント、プライベート)リンク、統一 ID 認証)。完全な API ドキュメントと豊富なコード サンプルにより、開発への参入障壁が大幅に下がり、統合の時間とコストが削減されます。
導入の柔軟性とコストのトレードオフ データ プライバシー要件、遅延の感度、使用規模に応じて、Kimi Linear はクラウド API 呼び出しかオンプレミス展開オプションのいずれかを選択できます。クラウド展開の利点は、運用とメンテナンスのコストがゼロであること、および柔軟な拡張性であることです。これは、使用量の変動が大きいシナリオや迅速なプロトタイプ開発に適しています。ローカル展開では、完全なデータ主権と低遅延 (ネットワークの往復オーバーヘッドなし) が提供されますが、GPU などのハードウェアの購入コストと運用および保守の人件費を負担する必要があります。月間 API 呼び出し量 100 万回または月額料金 1,000 ドルを基準分割線として使用することをお勧めします。このしきい値を下回ると、クラウド API の方が費用対効果と柔軟性が高くなります。このしきい値を超えた後は、ハードウェアの減価償却費、電気代、運用保守の人件費などの要素を考慮して、自己展開ソリューションの総所有コストを総合的に評価する必要があります。
モデルの選択とバージョン戦略
Kim Linear シリーズ モデルを選択する場合は、特定の使用シナリオに応じて、さまざまなバージョンのモデル機能を一致させることをお勧めします。パラメータが大きいバージョンは、複雑な推論や複数ステップのタスクのパフォーマンスが向上しますが、コストが高く、遅延が長くなります。小さなパラメータのバージョンは、日常会話や簡単な質疑応答などのシナリオですでに満足のいく出力品質を提供でき、コストは大きなバージョンの数分の一にすぎません。推奨される選択戦略は、コストを削減するために標準シナリオでは小規模および中バージョンを使用し、複雑な推論タスクを処理する必要がある場合にのみ大きなバージョンのモデルを呼び出すことです。この階層的な呼び出し戦略により、出力品質に大きな影響を与えることなく、全体的な API コストを 40 ~ 60% 削減できます。
バージョン情報
- キミ-リニア-48B-A3B-指示 :初の公開ハイブリッド リニア アテンション モデル。1M コンテキストをサポートし、MIT ライセンスに基づいたオープンソースです。
- キミ-リニア-48B-A3B-指示 :最初の公開バージョン、MIT ライセンス、公式の正確な日付はまだありません。
ユーザーレビュー