Kimi-K3は、Moonshot AI がこれまでに開発した中で最も高性能なフラグシップモデルであり、2.8兆個のパラメータを備えています。KDA ハイブリッド線形注意機構(Kimi Delta Attention)と Attention Residuals を基盤とし、視覚理解をネイティブにサポートし、1万トークンのコンテキストウィンドウを提供します。3兆パラメータ規模の世界初のオープンソースモデルとして、長期的なプログラミング、知識作業、推論などの最先端のインテリジェンスシナリオ向けに設計されています。
推論サービスプロバイダー
kimi-k3の推論サービスプロバイダーはAlibaba Cloud Model Studioです。
モデル機能
中国(北京)
機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | Text Image | 出力モダリティ | テキスト |
モデル体験 | サポート済み | Function Calling | サポート済み |
Structured Outputs | サポート済み | Web検索 | 未サポート |
Prefix Completion | サポート済み | コンテキストキャッシュ | サポート済み |
Batch Inference | 未サポート | ファインチューニング | 未サポート |
Singapore
範囲:International
機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | Text Image | 出力モダリティ | テキスト |
モデル体験 | サポート済み | Function Calling | サポート済み |
Structured Outputs | サポート済み | Web検索 | 未サポート |
Prefix Completion | サポート済み | コンテキストキャッシュ | サポート済み |
Batch Inference | 未サポート | ファインチューニング | 未サポート |
Germany (Frankfurt)
スコープ:グローバル
機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | Text Image | 出力モダリティ | テキスト |
モデル体験 | サポート済み | Function Calling | サポート済み |
Structured Outputs | サポート済み | Web検索 | 未サポート |
Prefix Completion | サポート済み | コンテキストキャッシュ | サポート済み |
Batch Inference | 未サポート | ファインチューニング | 未サポート |
米国(バージニア)
スコープ:グローバル
機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | Text Image | 出力モダリティ | テキスト |
モデル体験 | サポート済み | Function Calling | サポート済み |
Structured Outputs | サポート済み | Web検索 | 未サポート |
Prefix Completion | サポート済み | コンテキストキャッシュ | サポート済み |
Batch Inference | 未サポート | ファインチューニング | 未サポート |
Japan (Tokyo)
スコープ:グローバル
機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | Text Image | 出力モダリティ | テキスト |
モデル体験 | サポート済み | Function Calling | サポート済み |
Structured Outputs | サポート済み | Web検索 | 未サポート |
Prefix Completion | サポート済み | コンテキストキャッシュ | サポート済み |
Batch Inference | 未サポート | ファインチューニング | 未サポート |
香港(中国)
スコープ:グローバル
機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | Text Image | 出力モダリティ | テキスト |
モデル体験 | サポート済み | Function Calling | サポート済み |
Structured Outputs | サポート済み | Web検索 | 未サポート |
Prefix Completion | サポート済み | コンテキストキャッシュ | サポート済み |
Batch Inference | 未サポート | ファインチューニング | 未サポート |
コンテキスト制限
パラメータ | 値 | パラメータ | 値 |
|---|---|---|---|
最大入力長 | 1048576 | 最大出力長 | 1048576 |
コンテキストウィンドウ | 1048576 | 最大入力長(思考モード) | 1048576 |
最大出力長(思考モード) | 1048576 | 思考連鎖の最大長 | 1048576 |
料金
このページには、期間限定のプロモーションを除く、モデル API 呼び出しの標準料金のみの記載しています。プロモーションオファーについては、Model Studio コンソールをご覧ください。
中国(北京)
課金項目 | 料金(USD) | 単位 |
|---|---|---|
入力 | 2.827 | 1Mトークンあたり |
出力 | 14.133 | 1Mトークンあたり |
入力(暗黙的キャッシュ) | 0.283 | 1Mトークンあたり |
Singapore
範囲:International
課金項目 | 料金(USD) | 単位 |
|---|---|---|
入力 | 3 | 1Mトークンあたり |
出力 | 15 | 1Mトークンあたり |
入力(暗黙的キャッシュ) | 0.3 | 1Mトークンあたり |
Germany (Frankfurt)
スコープ:グローバル
課金項目 | 料金(USD) | 単位 |
|---|---|---|
入力 | 2.827 | 1Mトークンあたり |
出力 | 14.133 | 1Mトークンあたり |
入力(暗黙的キャッシュ) | 0.283 | 1Mトークンあたり |
米国(バージニア)
スコープ:グローバル
課金項目 | 料金(USD) | 単位 |
|---|---|---|
入力 | 2.827 | 1Mトークンあたり |
出力 | 14.133 | 1Mトークンあたり |
入力(暗黙的キャッシュ) | 0.283 | 1Mトークンあたり |
Japan (Tokyo)
スコープ:グローバル
課金項目 | 料金(USD) | 単位 |
|---|---|---|
入力 | 2.827 | 1Mトークンあたり |
出力 | 14.133 | 1Mトークンあたり |
入力(暗黙的キャッシュ) | 0.283 | 1Mトークンあたり |
香港(中国)
スコープ:グローバル
課金項目 | 料金(USD) | 単位 |
|---|---|---|
入力 | 2.827 | 1Mトークンあたり |
出力 | 14.133 | 1Mトークンあたり |
入力(暗黙的キャッシュ) | 0.283 | 1Mトークンあたり |
レート制限
中国(北京)
このリージョンでは動的レート制限が使用されます。TPM 制限は Model Studio の月額支出額に基づいて階層化されており、RPM 制限は通常の使用でスロットリングが発生しないよう十分に高く設定されています。階層値の詳細については、「動的レート制限」を参照してください。
Singapore
範囲:International
このリージョンでは動的レート制限が使用されます。TPM 制限は Model Studio の月額支出額に基づいて階層化されており、RPM 制限は通常の使用でスロットリングが発生しないよう十分に高く設定されています。階層値の詳細については、「動的レート制限」を参照してください。
Germany (Frankfurt)
スコープ:グローバル
パラメータ | 値 |
|---|---|
RPM(1分あたりのリクエスト数) | 15,000 |
TPM(1分あたりのトークン数) | 1,200,000 |
米国(バージニア)
スコープ:グローバル
パラメータ | 値 |
|---|---|
RPM(1分あたりのリクエスト数) | 15,000 |
TPM(1分あたりのトークン数) | 1,200,000 |
Japan (Tokyo)
スコープ:グローバル
パラメータ | 値 |
|---|---|
RPM(1分あたりのリクエスト数) | 15,000 |
TPM(1分あたりのトークン数) | 1,200,000 |
香港(中国)
スコープ:グローバル
パラメータ | 値 |
|---|---|
RPM(1分あたりのリクエスト数) | 15,000 |
TPM(1分あたりのトークン数) | 1,200,000 |