Alibaba Cloud Model Studio では、テキスト、イメージ、オーディオ、ビデオ向けの Qwen およびサードパーティモデルを提供しています。
テキスト生成
画像と動画
理解
画像や動画からテキスト記述や構造化データを抽出します
生成
テキストや画像から画像と動画を生成し、編集、参照、高解像度出力に対応します
オーディオと音声
音声合成
オーディオブックの読み上げ、音声放送、バーチャルアバターなどに活用できます
音声認識
専用の ASR と LLM ベースのアプローチが利用可能です。精度と柔軟性に応じて選択してください
スピーチツースピーチ
個別の ASR と TTS の呼び出しを必要とせず、エンドツーエンドの音声会話を実現します
オムニ
テキスト、画像、オーディオ、ビデオというモダリティにわたる理解能力と生成能力を統合します
埋め込みとリランキング
テキストやマルチモーダルコンテンツをベクトルに変換し、リランキングと組み合わせることで検索精度を向上させます
すべてのモデル
モデルプラザに移動して、すべての Qwen、サードパーティ、ドメイン特化、およびレガシーモデルを閲覧してください。