このドキュメントでは、Alibaba Cloud Model Studio に関するよくある質問 (FAQ) に回答します。
課金
-
Alibaba Cloud Model Studio のモデルの単価はいくらですか?
各モデルの詳細については、Alibaba Cloud Model Studio コンソールをご参照ください。料金情報の詳細については、「モデル推論の料金」をご参照ください。
-
前払いのサービスはありますか?
はい、一部のモデルは前払いサービスでご利用いただけます。詳細については、「Savings Plans」をご参照ください。
-
従量課金の請求は月次決済ですか?
料金は分単位で計算され、月次で決済されます。
-
料金と請求の詳細を確認するにはどうすればよいですか?
詳細については、料金とコストをご参照ください。
-
経費のインボイスをリクエストするにはどうすればよいですか?
月次請求書の概要ページで、対象アカウントの [Actions] 列にある [Download Invoice] をクリックしてください。
-
Wan メンバーシップ Wan メンバーシップは Alibaba Cloud Model Studio の API 呼び出しをサポートしていますか?
いいえ。Wan メンバーシップと Alibaba Cloud Model Studio の API 呼び出しは、それぞれ別の課金システムを使用するため、Wan メンバーシップの特典は適用されません。
API/SDK
-
エラーコードに関する情報はどこで確認できますか?
Alibaba Cloud Model Studio の API を呼び出すと、呼び出しの結果を示すステータスコードが返されます。各コードとその解決策の詳細については、「エラーコード」をご参照ください。
-
SDK をインストールするにはどうすればよいですか?
Alibaba Cloud Model Studio は、Java と Python 用の SDK を提供しています。手順については、「SDK のインストール」をご参照ください。
-
アシスタント API で関数呼び出しを使用する場合、2 つのローカル関数を連続して呼び出すことはできますか?
a. 2 つの異なる関数を連続して呼び出すことは、現在サポートされていません。
b. 回避策として、アシスタント API を 2 回個別に呼び出し、それぞれの戻り値を処理することができます。
-
アシスタント API にはメモリ関連の機能がありますか?
メモリ設定機能は現在サポートされていません。
製品に関する質問
-
Alibaba Cloud Model Studio サービスをアクティベートするにはどうすればよいですか?
Alibaba Cloud Model Studio はリージョンごとにアクティベートする必要があります。Alibaba Cloud アカウント でログインし、Alibaba Cloud Model Studio コンソール (シンガポール)、Alibaba Cloud Model Studio コンソール (米国 (バージニア))、または Alibaba Cloud Model Studio コンソール (中国 (北京)) に移動します。コンソールの右上隅で対象リージョンを切り替えます。サービス利用規約を読み、同意すると、Alibaba Cloud Model Studio は自動的にアクティベートされます。規約が表示されない場合は、そのリージョンではサービスがすでにアクティベートされています。
-
Alibaba Cloud Model Studio サービスを無効化するにはどうすればよいですか?
現在、Alibaba Cloud Model Studio サービスを無効化することはできません。API を使用してモデルやアプリケーションを呼び出す場合は、API キー (シンガポール)、API キー (米国 (バージニア))、または API キー (北京) ページで API キーを削除することで、以降の呼び出しを防ぐことができます。
-
大規模モデルサービスを試すにはどうすればよいですか?
プレイグラウンド (シンガポール)、プレイグラウンド (米国 (バージニア))、または プレイグラウンド (北京) ページで試すことができます。。
-
Alibaba Cloud Model Studio と Qwen の違いは何ですか?
Alibaba Cloud Model Studio は、Qwen シリーズを含むさまざまな大規模モデルを提供する大規模言語モデルサービスプラットフォームです。
-
ビジネスデータの分離を実装して、異なるユーザーのデータが関連付けられないようにするにはどうすればよいですか?
Alibaba Cloud アカウントを使用して、異なるワークスペース権限を異なる RAM ユーザーに付与できます。データはワークスペース間で分離されます。詳細については、「ワークスペースの権限管理」をご参照ください。
-
Alibaba Cloud Model Studio はモデル呼び出し中に生成されたデータを保存しますか?
Alibaba Cloud はデータプライバシーを厳格に保護し、お客様のデータをモデルトレーニングに使用することはありません。アプリケーションの構築や大規模モデルのトレーニング時に送信されるすべてのデータは、AES-256 (Advanced Encryption Standard) で暗号化されます。
お客様のデータの取り扱いに関する詳細については、「Alibaba Cloud 国際ウェブサイト製品利用規約」内の Alibaba Cloud Model Studio に関する条項をご参照ください。
-
プレイグラウンドでの会話履歴はどのくらいの期間保持されますか?また、保存される会話数に制限はありますか?
Alibaba Cloud Model Studio コンソールでは、時間制限なしで最大 100 件の過去の会話記録が表示されます。一部の記録を手動で削除すると、システムは自動的に古い記録を表示します。ログインしていない 状態での試用セッションや、推論エラー になった会話は保存されません。
-
Alibaba Cloud Model Studio は、生成されたテキストに暗黙的な識別子を追加することをサポートしていますか?
いいえ。
-
Alibaba Cloud Model Studio にはモバイルアプリがありますか?
Alibaba Cloud Model Studio は現在、公式のスタンドアロンのモバイルアプリを提供していません。このサービスは主に Web コンソールを介してアクセスされます。
モデルセンター
-
大規模モデルのパラメーターはどのように保存されますか?
ModelScope コミュニティからオープンソース モデルをダウンロードできます。その構造は通常、JSON ファイルで定義されています。通常、これらのファイルを解析するにはオープンソースの Python ライブラリを使用する必要があり、これらには保存プロセスを理解するのに役立つベクトル情報が含まれています。
-
Qwen シリーズモデルはいくつの言語をサポートしていますか?
中国語、英語、アラビア語、スペイン語、フランス語、ポルトガル語、ドイツ語、イタリア語、ロシア語、日本語、韓国語、ベトナム語、タイ語、インドネシア語の 14 言語をサポートしています。
-
現在のモデルは、MySQL や Hive などの構造化データに接続できますか?
現在サポートされていません。ただし、この機能は開発中であり、ApsaraDB RDS との統合が優先されています。
-
Qwen-3 や Qwen-Max のようなモデルのテキスト生成速度は、すべてのユーザーで固定されていますか?速度を調整する方法はありますか?
生成速度は固定されていません。現在の全体的なサービス負荷やリクエストの同時実行数などの要因によって変動します。
-
モデルのレート制限がトリガーされた後、再試行するまでに通常どのくらい待つ必要がありますか?
待機時間は、1 秒あたりのリクエスト数 (RPS) や 1 分あたりのリクエスト数 (RPM) など、特定のレート制限値によって異なります。たとえば、制限が 120 RPM (1 秒あたり 2 リクエスト) で、0.2 秒以内に 2 つのリクエストを連続して送信した場合、3 番目のリクエストはスロットリングされます。次のリクエストを正常に送信できるようになるまで、約 0.8 秒待つ必要があります。
-
qwen-plus-latest はどのモデルシリーズに属しますか?Qwen3.7 ですか、それとも Qwen3.5 ですか?
qwen-plus-latest は qwen-plus の最新バージョンであり、Qwen3 シリーズに属します。Qwen3.5 や Qwen3.7 シリーズではありません。Qwen3.5、Qwen3.7 などの呼称は、Qwen3 のサブバージョンではなく、Qwen3 と並行する独立したモデルシリーズであることにご注意ください。
モデルのハルシネーション
-
モデルのハルシネーションとは何ですか?
モデルのハルシネーションとは、大規模言語モデル (LLM) が、無意味、事実と異なる、歪曲された、または論理的に矛盾したコンテンツを生成する現象のことです。出力はもっともらしく流暢に見えるかもしれませんが、入力プロンプト、現実世界の事実、または論理的な文脈と一致しません。ハルシネーションと、(古いトレーニングデータによって引き起こされるような) 事実誤認、主観的な意見、または (モデルに明示的に物語を書くように依頼した場合のような) 創造的な文章とを区別することが重要です。ハルシネーションの核心は、事実に基づかない、自信に満ちた断定です。
-
モデルのハルシネーションを減らすにはどうすればよいですか?
モデルのハルシネーションは、以下の方法で減らすことができます:
- より強力なモデルを選択する:一般的に、より大きく、より高度なモデルを選択することで、ハルシネーションを減らすことができます。たとえば、Qwen シリーズでは、Max レベルのモデルは Plus レベルのモデルよりもパフォーマンスが優れており、Plus レベルのモデルは Turbo レベルのモデルよりも優れています。
- プロンプトエンジニアリング:プロンプトの修正は、モデルのハルシネーションを減らすためのシンプルで効果的な方法です。たとえば、検索拡張生成 (RAG) シナリオでは、「提供されたドキュメントにのみ基づいて回答してください。情報がない場合は、『分かりません』と回答してください」などの指示を追加します。また、「結論を裏付けるために、特定のデータやレポートを引用してください」と追加したり、プロンプトを使用してタスクを複数のステップに分割したり、プロンプトでモデルの厳密な役割を定義したりすることもできます。
- 検索拡張生成 (RAG):RAG を使用すると、モデルに応答のための参照資料を提供し、その回答を取得した知識の範囲に厳密に制限することで、ハルシネーションを大幅に減らすことができます。RAG システムを構築する際には、検索システムが高品質であることを確認し、情報源を明確にラベル付けし、関連情報が見つからない場合を適切に処理するようにします。
- プラグイン/MCP:プラグインまたは MCP の機能を使用して、モデルのハルシネーションを減らすことができます。たとえば、大規模モデルを使用して構造化データベースのデータを要約する場合、プラグインまたは MCP を使用してデータベースクライアントを呼び出し、計算を実行させることができます。その結果をモデルに返して要約させることで、モデルが直接数値計算を試みる際に発生する可能性のあるハルシネーションを回避できます。
- モデルパラメーターチューニング:
temperature、top_k、top_pなどのランダム性パラメーターを低くすると、出力がより決定論的になり、奇妙なコンテンツが生成される可能性が低くなりますが、創造性が犠牲になる可能性があります。一部のシナリオでは、max_tokensを減らすことで、モデルが重要な情報を提供した後にコンテンツを捏造するのを防ぐことができます。 - 後処理検証:モデルの推論が完了した後、後続のステップを使用して応答の正しさを検証します。これには通常、別の AI 駆動プロセスを使用して応答にハルシネーションがないかチェックすることが含まれます。この方法ではコストが増加し、全体的な応答時間も遅くなります。