テキストおよび音声出力、マルチチャンネル音声、ツール呼び出しに対応したリアルタイム音声・映像インタラクション用モデルです。
推論サービスプロバイダー
qwen3.8-omni-flash-realtimeの推論サービスプロバイダーはAlibaba Cloud Model Studioです。
モデル機能
対応リージョン:中国(北京)およびシンガポール。選択したリージョンのAPIキーを使用してください。
| 機能 | サポート | 機能 | サポート |
|---|---|---|---|
| 入力モダリティ | テキスト、ストリーミング音声、および動画(連続した画像フレーム) | 出力モダリティ | テキストおよび音声 |
| Function Calling | 以下をサポート: カスタムツール呼び出し | MCP | リモートMCPツールをサポートしています。詳細は MCPインタラクションフロー |
| マルチチャンネル音声 | WebSocketアクセスは1、2、または4チャンネルをサポートし、マルチチャンネル入力には16 kHz PCMを使用します | 動画集約 | 設定: session.video.input.representation_compact:デフォルトは none;集約を有効にするには normal に設定します |
| 音声 | デフォルトは Tina。 音声パラメータと音声プレビュー |
WebSocket、WebRTC、またはAOQを通じてモデルにアクセスします。例やSDKの設定については、リアルタイムガイドを参照してください。
WebSocketアクセスの場合は、ワークスペース固有のWebSocketエンドポイントを使用します。設定については、接続の確立を参照してください。
コンテキストの制限
| パラメータ | 値 | パラメータ | 値 |
|---|---|---|---|
| 最大合計入力トークン数 | 196608 | 音声履歴 | 最大100ターン、合計600秒まで |
| 動画履歴 | 最大50ターン、合計240秒まで | 最大出力トークン数 | 65536 |
ターン数または累積メディア時間が制限を超えると、古い履歴は破棄されます。累積メディア時間はセッション全体の時間ではありません。
モデル料金
推論料金については、モデル料金を参照してください。
音声出力の場合、qwen3.8-omni-flash-realtimeは音声とその対応テキストの両方にそれぞれの出力レートで課金します。Qwen3.5-Omni-Realtimeモデルは音声のみに課金され、対応するテキストには課金されません。
無料クォータ:1百万トークン、Singaporeでのみ利用可能です。サービスの有効化、モデルのリリース、またはアプリケーションの承認のうち、最も遅い日付から90日間有効です。無料クォータをご参照ください。
中国(北京)
| 課金項目 | 料金(USD) | 単位 |
|---|---|---|
入力:音声 | 0.848 | 百万トークンあたり |
出力:音声 | 1.696 | 百万トークンあたり |
入力:テキスト/画像/動画 | 0.212 | 百万トークンあたり |
出力:テキスト | 0.636 | 百万トークンあたり |
Singapore
| 課金項目 | 料金(USD) | 単位 |
|---|---|---|
入力:音声 | 0.93 | 百万トークンあたり |
出力:音声 | 1.87 | 百万トークンあたり |
入力:テキスト/画像/動画 | 0.23 | 百万トークンあたり |
出力:テキスト | 0.7 | 百万トークンあたり |
レート制限
北京とSingaporeの両方とも、制限は60 RPMおよび2,000,000 TPMです。モデルのリクエスト制限については、レート制限を参照してください。