Alibaba Cloud Model Studio のモデル利用状況について説明します。
詳細については、「新規ユーザー無料クォータ」をご参照ください。無料クォータの利用状況は、[Free Quota] ページで管理できます。
提供状況
- リージョン:シンガポールのみ。詳細については、「リージョンとアクセスドメイン」をご参照ください。
- モデル:モデル一覧に記載されているすべてのモデル。
無料クォータの利用状況の確認
コンソールでの操作
- [Free Quota] ページに移動し、モデルタイプのタブを選択して、各モデルの無料クォータの利用状況を確認します。
- モデルテーブルで、検索、並べ替え、またはフィルターを使用して特定のモデルを見つけ、無料クレジットが使い切られると停止します を個別にまたは一括でオン/オフに切り替えて、無料クォータの設定を管理します。
注記Free Quota Only: 有効にすると、無料クォータを使い切った時点でサービスが自動的に停止します (403 エラー:AllocationQuota.FreeTierOnly が返されます)。これにより、無料クォータを超える課金を防ぎます。使用を継続し、実際の使用量に応じて料金を支払う場合は、この機能をオフのままにしてください。この機能は、アカウントに未使用の無料クォータがある場合にのみ利用できます。一度オンにすると、無料クォータを完全に使い切るまでオフにできません。無料クォータは分単位で課金され、コンソールに表示されるデータには遅延が生じる場合があります。コンソールに表示される無料クォータの値をご参照ください。
モデルの利用状況の確認
現在、コンソールでは無料クォータの利用状況のみ確認できます。詳細な利用統計を確認するには、請求明細ページに移動し、請求書をエクスポートしてトークンの使用量を確認してください。
課金概要の確認
[請求概要] ページでは、以下を含む Model Studio サービスの費用概要を表示できます。
- コストカード:現在の請求期間の合計費用、サブスクリプションコスト、請求コストを確認でき、詳細な内訳へのリンクが表示されます。
- 請求トレンド:コストトレンドをグラフまたはリスト形式で表示します。月次または日次の統計、製品カテゴリ、API Key ID やモデルでフィルタリングできます。
- コストアラート:コストアラートを設定し、異常な支出の通知を受け取ることができます。
利用単位
Model Studio では、モデルごとの利用統計は以下の通りです。
タイプ | サブカテゴリ | 単位 | 課金方法 |
|---|---|---|---|
大規模言語モデル | 入力と出力のトークン数に基づいて課金されます。 | ||
ビジュアルモデル | 画像数 | 正常に生成された画像の数に基づいて課金されます。 | |
秒数 | 正常に生成された動画の秒数に基づいて課金されます。 | ||
音声モデル | 秒数、文字数、またはトークン数 | モデルに応じて、音声の長さ (秒数)、対応するテキストの文字数、またはトークン数に基づいて課金される場合があります。 | |
オムニモーダルモデル | トークン数 | テキストはトークン数に基づいて課金されます。その他のモダリティ (音声、画像、動画) は、対応するトークン数に基づいて課金されます。 | |
埋め込みモデル | トークン数 | 入力テキストのトークン数に基づいて課金されます。 | |
テキスト埋め込み |
本番利用の注意点
モデルの利用状況を管理するための推奨事項:
- モデルの出力長の制御: 思考長の制限を適切に設定し、
max_tokensパラメータを設定することで、1 回の呼び出しで生成されるコンテンツの最大長を制限し、コストを管理できます。 - タスクタイプに応じたモデルの選択: 分類や要約などのシンプルなタスクには、高性能だが高コストなモデルよりも、低コストで軽量なモデルを優先的に使用してください。
- 監視とアラート: 利用状況のトレンドを監視します。利用状況のアラートを設定すると、異常な使用量がタイムリーに通知されます。
- プロンプトの最適化: 簡潔で明確なプロンプトは、モデルの出力品質を向上させ、不要な入力トークンを削減できます。
- バッチ推論の使用: リアルタイム性を必要としない大規模バッチ処理タスクには、バッチ推論がリアルタイム呼び出しよりも費用対効果が高い場合が多いです。
用語集
用語 | 説明 |
|---|---|
トークン | 大規模言語モデルは、入力と出力をトークン単位で処理します。トークンは、以下のいずれかです。
経験に基づくと、平均して 1 トークンは約 1.5~2 文字の中国語に相当します。1 文字の英語は約 0.25 トークンに相当します。1 単語の英語は約 1.3 トークンに相当します。
各モデルには、入力と出力のトークン数の上限があります (モデル一覧をご参照ください)。この上限を超えると、処理が失敗します。 |
[Real-time] | モデルのすべての直接的および間接的な呼び出しを指し、主に以下のシナリオが含まれます。
|
[Batches] | リアルタイムレスポンスを必要としないシナリオでオフラインで実行される大規模データ処理のことです。OpenAI 互換 - Batch (ファイル入力) API を使用します。 |
よくある質問
Q: Alibaba Cloud アカウントの合計トークン使用量を確認するにはどうすればよいですか?A: Alibaba Cloud アカウントを使用して [請求明細] ページにアクセスし、請求書をエクスポートします。
[請求明細] ページで、請求明細をフィルターし、エクスポートします:
- [請求月] を対象月 (
2025-05など) に設定します。 - [製品名] で [Model Studio] を選択します。
- テーブルの右上隅にあるダウンロードアイコンをクリックして、課金データをエクスポートします。