すべてのプロダクト
Search
ドキュメントセンター

OpenSearch:音声認識

最終更新日:Jun 23, 2026

AI 検索オープンプラットフォームは、音声認識 API を提供します。この API は、音声やビデオから音声を迅速に構造化テキストに変換し、会議の文字起こし、ビデオ検索インデックス、オンラインカスタマーサービスなどに利用できます。

サービスリスト

サービス名

サービス ID

説明

API QPS 制限

音声認識サービス

ops-audio-asr-001

音声コンテンツから字幕を生成します。

5

説明

より高い API QPS 制限をリクエストするには、テクニカルサポートにチケットを送信してください。

  • 認証情報の取得

    AI 検索オープンプラットフォームでは、認証に API キーが必要です。手順については、「API キーの取得」をご参照ください。

  • サービスエンドポイントの取得

    サービスは、パブリックネットワークまたは VPC 経由で呼び出すことができます。詳細については、「サービスエンドポイントの取得」をご参照ください。

非同期音声認識タスク

リクエストメソッド:POST

URL

POST {host}/v3/openapi/workspaces/{workspace_name}/audio-asr/{service_id}/async
  • host:サービスエンドポイント。API サービスは、パブリックネットワークまたは VPC から呼び出すことができます。詳細については、「サービスエンドポイントの取得」をご参照ください。

    AI 検索オープンプラットフォームコンソールにログインします。左上の隅で、ターゲットワークスペース (例:default (default space)) を選択します。左側のナビゲーションウィンドウで、[API キー] をクリックします。アクセスドメインセクションで、パブリック API ドメインプライベート API ドメインを確認できます。

  • workspace_name:ワークスペース名 (例:default)。

  • service_id:組み込みサービス ID (例:ops-audio-asr-001)。

リクエストパラメーター

ヘッダーパラメーター

API キー認証

パラメーター

必須

説明

Content-Type

String

はい

リクエストボディのメディアタイプ。

application/json

Authorization

String

はい

API キー

Bearer OS-d1**2a

ボディパラメーター

パラメーター

必須

説明

input

Object(input)

はい

処理するメディアファイル。

parameters

Object

いいえ

サービスのパラメーター。

output

Object(output)

はい

出力構成。

input

パラメーター

必須

説明

content

String

いいえ

base64 エンコードされた音声またはビデオコンテンツ。

サポートされている音声フォーマット:mp3、wav、aac、flac、ogg、m4a、alac、wma。

サポートされているビデオフォーマット:mp4、avi、mkv、mov、flv、webm。

説明

input.contentinput.oss パラメーターは相互排他的です。いずれか一方のみを指定してください。

Base64 データの使用:エンコードされた Base64 データを、data:<TYPE>/<FORMAT>;base64,<BASE64_DATA> のフォーマットで content パラメーターに渡します。ここで、

  • <TYPE>/<FORMAT>

    • 音声 (mp3 など) の場合は、audio/mp3 を使用します。

    • ビデオ (mov など) の場合は、video/mov を使用します。

  • <BASE64_DATA>:BASE64 エンコードされた音声またはビデオデータ。

例:

  • 音声:data:audio/mp3;base64,AAAAIGZ0eXBtcDQyAAABAGlzbWZj...

  • ビデオ:data:video/mov;base64,AAAAIGZ0eXBtcDQyAAABAGlzbWZj...

oss

String

いいえ

入力ファイルの OSS パス。例:oss://<bucket_name>/path/to/file.mp3

file_name

String

いいえ

音声またはビデオファイルの名前。このパラメーターが設定されていない場合、ファイル名はコンテンツから解析されます。

出力

パラメーター

必須

説明

type

String

いいえ

text:音声認識結果をプレーンテキストで返します。このオプションは同期タスクでのみサポートされます。

oss:出力ファイルを OSS バケットに保存します。これがデフォルトです。

oss

String

いいえ

出力ファイルの OSS パス。typeoss に設定されている場合に必須です。

例:oss://<BUCKET_NAME>/result

レスポンスパラメーター

パラメーター

説明

値の例

result.task_id

String

音声認識タスクの一意の識別子。

asr-xxxx-abc-123

Curl の例

curl -X POST \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer <API_KEY>" \
  "http://***-hangzhou.opensearch.aliyuncs.com/v3/openapi/workspaces/default/audio-asr/ops-audio-asr-001/async"
  --data '{
  "input":{
      "oss":"oss://<BUCKET_NAME>/xxx/xxx.mp3",
      "file_name":"xxx"
    },
    "output" :{
      "type":"oss",
      "oss":"oss://<BUCKET_NAME>/result"
    }
  }' \ 

レスポンスの例

{
  "request_id": "3eb8de02091b59431601f3bff******",
  "latency": 37,
  "usage": {},
  "result": {
    "task_id": "asr-20250610164552-1108418170738252-******",
    "status": "PENDING"
  }
}

非同期音声認識タスクのステータス

リクエストメソッド:GET

URL

  • host:サービスエンドポイント。API サービスは、パブリックネットワークまたは VPC から呼び出すことができます。詳細については、「サービスエンドポイントの取得」をご参照ください。

  • workspace_name:ワークスペース名 (例:default)。

  • service_id:組み込みサービス ID (例:ops-audio-asr-001)。

  • task_id:非同期音声認識タスクの一意の ID。タスク作成時のレスポンスで返されます。

リクエストパラメーター

パラメーター

必須

説明

Content-Type

String

はい

リクエストのメディアタイプ。

application/json

Authorization

String

はい

認証用の API キー。

Bearer OS-d1**2a

レスポンスパラメーター

パラメーター

説明

request_id

String

リクエスト ID。

3C09570D-12DB-46B4-BF0F-A100D79B****

latency

Float/Int

リクエストのレイテンシー (ミリ秒)。

3.0

result.task_id

String

非同期タスク ID。

a7e4c0f6-874c-47e3-b05b-02278a96e****

result.status

String

タスクのステータス。有効な値は次のとおりです:

  • PENDING:タスクは処理待ちです。

  • SUCCESS:タスクは正常に完了しました。

  • FAIL:タスクはエラーにより失敗しました。

PENDING

result.error

String

エラーメッセージ。このフィールドは、result.statusFAIL の場合にのみ値を持ちます。

result.data

List(AsrResult)

音声認識結果。このフィールドは、非同期タスクのステータスが SUCCESS の場合にのみ入力されます。

usage.duration

Float

音声ファイルの持続時間 (秒)。

AsrResult

パラメーター

説明

text

String

音声認識による文字起こしテキスト。

start

Float

ビデオ内のテキストの開始タイムスタンプ (秒)。

end

Float

ビデオ内のテキストの終了タイムスタンプ (秒)。

例:cURL リクエスト

curl -X GET \
-H"Content-Type: application/json" \
-H "Authorization: Bearer <your_api_key>" \
"http://***-hangzhou.opensearch.aliyuncs.com/v3/openapi/workspaces/default/audio-asr/ops-audio-asr-001/async/task-status?task_id=asr-20250618112151-1108418170738252-******" 
 

レスポンスの例

{
  "request_id": "1a1a4ca4b7a91dd630a40c54af******",
  "latency": 9,
  "usage": {
    "duration": 9
  },
  "result": {
    "task_id": "asr-20250618112151-1108418170738252-******",
    "status": "SUCCESS",
    "data": [
      {
        "text": "Rong Jielvdou began to speak, his voice as warm as the spring sun,",
        "start": 0.0,
        "end": 3.9
      },
      {
        "text": "full of life and warming the hearts of everyone who listened.",
        "start": 4.24,
        "end": 9.06
      }
    ]
  }
}

同期音声認識タスクの作成

リクエストメソッド:POST

URL

{host}/v3/openapi/workspaces/{workspace_name}/audio-asr/{service_id}/sync
  • host:サービスエンドポイント。API サービスは、パブリックネットワークまたは VPC 経由で呼び出すことができます。詳細については、「サービスエンドポイントの取得」をご参照ください。

  • workspace_name:ワークスペース名 (例:default)。

  • service_id:組み込みサービス ID (例:ops-audio-asr-001)。

リクエストパラメーター

ヘッダーパラメーター

API キー認証

パラメーター

必須

説明

Content-Type

String

はい

リクエストボディのメディアタイプを指定します。

application/json

Authorization

String

はい

認証用の API キー。"Bearer " をプレフィックスとして付けます。

Bearer OS-d1**2a

ボディパラメーター

パラメーター

必須

説明

input

Object(input)

はい

処理するメディアファイル。

parameters

Object

いいえ

サービスのパラメーター。

output

Object(output)

はい

出力構成。

input

パラメーター

必須

説明

content

String

いいえ

base64 エンコードされた音声またはビデオコンテンツ。

サポートされている音声フォーマット:mp3、wav、aac、flac、ogg、m4a、alac、wma。

サポートされているビデオフォーマット:mp4、avi、mkv、mov、flv、webm。

説明

input.contentinput.oss パラメーターは相互排他的です。いずれか一方のみを指定してください。

Base64 データの使用:エンコードされた Base64 データを、data:<TYPE>/<FORMAT>;base64,<BASE64_DATA> のフォーマットで content パラメーターに渡します。ここで、

  • <TYPE>/<FORMAT>

    • 音声 (mp3 など) の場合は、audio/mp3 を使用します。

    • ビデオ (mov など) の場合は、video/mov を使用します。

  • <BASE64_DATA>:BASE64 エンコードされた音声またはビデオデータ。

例:

  • 音声:data:audio/mp3;base64,AAAAIGZ0eXBtcDQyAAABAGlzbWZj...

  • ビデオ:data:video/mov;base64,AAAAIGZ0eXBtcDQyAAABAGlzbWZj...

oss

String

いいえ

入力ファイルの OSS パス。例:oss://<bucket_name>/path/to/file.mp3

file_name

String

いいえ

音声またはビデオファイルの名前。このパラメーターが設定されていない場合、ファイル名はコンテンツから解析されます。

出力

パラメーター

必須

説明

type

String

いいえ

text:音声認識結果をプレーンテキストで返します。このオプションは同期呼び出しでのみ利用可能です。

oss:ビデオまたは音声ファイルを OSS に保存します (デフォルト)。

oss

String

いいえ

出力ファイルの OSS パス。typeoss の場合に必須です。

例:oss://<BUCKET_NAME>/result

レスポンスパラメーター

パラメーター

説明

値の例

result.task_id

String

音声認識タスクの一意の識別子。

asr-xxxx-abc-123

Curl リクエスト

curl -X POST \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer <API_KEY>" \
  "http://***-hangzhou.opensearch.aliyuncs.com/v3/openapi/workspaces/default/audio-asr/ops-audio-asr-001/sync"
  --data '{
  "input":{
      "oss":"oss://<BUCKET_NAME>/xxx/xxx.mp3",
      "file_name":"xxx.mp3"
    },
    "output":{
      "type":"oss",
      "oss":"oss://<BUCKET_NAME>/result"
    }
  }' \ 

レスポンスの例

{
  "request_id": "df96b5c444281e0e79561fe9f8******",
  "latency": 570,
  "usage": {
    "duration": 9
  },
  "result": {
    "task_id": "asr-20250618132401-1108418170738252-******",
    "status": "SUCCESS",
    "data": [
      {
        "text": "Rong Jielvdou began to speak, his voice as warm as the spring sun,",
        "start": 0.0,
        "end": 3.9
      },
      {
        "text": "full of life and warming the hearts of everyone who listened.",
        "start": 4.24,
        "end": 9.06
      }
    ]
  }
}

ステータスコード

アクセスリクエストが失敗した場合、出力にはエラーを説明する codemessage が含まれます。

{
    "request_id": "6F33AFB6-A35C-4DA7-AFD2-9EA16CCF****",
    "latency": 2.0,
    "code": "InvalidParameter",
    "http_code": 400,
    "message": "JSON parse error: Cannot deserialize value of type `ImageStorage` from String \\"xxx\\"
}

HTTP ステータスコード

エラーコード

説明

200

-

タスクが失敗した場合でも、リクエストは成功です。実際のタスクステータスについては、result.status を確認してください。

404

BadRequest.TaskNotExist

指定されたタスクは存在しません。

400

InvalidParameter

リクエストが無効です。

500

InternalServerError

内部エラーが発生しました。

ステータスコードの詳細については、「ステータスコードの説明」をご参照ください。