大規模な事前学習済み言語モデルを通じてテキスト理解と音声生成を組み合わせ、リアルタイムのストリーミングテキスト音声合成をサポートする生成型音声合成モデルです。
推論サービスプロバイダー
cosyvoice-v2 の推論サービスプロバイダーは Alibaba Cloud Model Studio です。
モデルの機能
| 機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | テキスト | 出力モダリティ | オーディオ |
モデル体験 | 非対応 | Function Calling | 非対応 |
構造化出力 | 非対応 | ウェブ検索 | 非対応 |
プレフィックス補完 | 非対応 | コンテキストキャッシュ | 非対応 |
バッチ推論 | 非対応 | ファインチューニング | 非対応 |
コンテキスト制限
| パラメーター | 値 | パラメーター | 値 |
|---|---|---|---|
最大入力長 | — | 最大出力長 | — |
コンテキストウィンドウ | — |
レート制限
中国 (北京)
| パラメーター | 値 |
|---|---|
RPM (1 分あたりのリクエスト数) | 180 |