複数の音声ファイルを 1 つの音声ファイルにマージし、希望のフォーマットに変換できます。本トピックでは、音声マージのパラメーターについて説明し、使用例を示します。
ユースケース
-
音楽制作:ミュージシャンやプロデューサーは、別々に録音された楽器トラックやボーカルトラックをマージして、完成した楽曲を作成することがよくあります。
-
オーディオブックおよび音声コンテンツ制作:オーディオブック制作では、ナレーション音声を章ごとにマージして、物語の一貫性を保つことが一般的です。
-
映画・テレビ番組のポストプロダクション:ポストプロダクション工程では、音声エディターが対話、ナレーション、環境音、BGM をマージして映像と同期させます。
-
ソーシャルメディアコンテンツ制作:ショート動画プラットフォームのユーザーは、効果音、ナレーション、BGM をマージして、より表現力豊かなコンテンツを作成します。
注意事項
-
音声マージは非同期処理(x-oss-async-process メソッド)のみをサポートしています。
-
音声マージを実行する前に、IMM プロジェクトをバインドする必要があります。コンソールまたは API を使用したプロジェクトのバインド方法については、「クイックスタート」および「OSS バケットのバインド」をご参照ください。
-
匿名アクセスは拒否されます。
-
この機能を使用するには必要な権限が必要です。詳細については、「権限」をご参照ください。
-
デフォルトのサンプリングレートまたは音声チャンネル数を使用すると、ターゲット音声コンテナ形式との互換性の問題により、マージが失敗する可能性があります。
-
一度に最大 11 個の音声ファイルをマージできます。
パラメーター
アクション:audio/concat
以下の表は、パラメーターについて説明しています。
マージパラメーター
リクエスト文字列における pre パラメーターおよび sur パラメーターのシーケンスが、audio/concat のマージ順序を決定します。
-
/pre:先頭に追加する音声ファイル。 -
/sur:末尾に追加する音声ファイル。
|
パラメーター |
タイプ |
必須 |
説明 |
|
ss |
int |
いいえ |
マージする音声クリップの開始時刻(ミリ秒単位)。有効な値:
|
|
t |
int |
いいえ |
先頭または末尾に追加する音声クリップのマージ持続時間(ミリ秒単位)。有効な値:
|
|
o |
string |
はい |
現在のバケット内の OSS オブジェクト。オブジェクト名は URL セーフ Base64 エンコードされている必要があります。 |
トランスコードパラメーター
|
パラメーター |
タイプ |
必須 |
説明 |
|
ss |
int |
いいえ |
メイン音声ファイルのトランスコード開始時刻(ミリ秒単位)。有効な値:
|
|
t |
int |
いいえ |
メイン音声ファイルのトランスコード持続時間(ミリ秒単位)。有効な値:
|
|
f |
string |
はい |
音声コンテナ形式:
|
|
ar |
int |
いいえ |
音声サンプリングレート。デフォルトでは、align で指定されたソース音声ファイルのレートに一致します。有効な値:
説明
サポートされるサンプリングレートはフォーマットによって異なります。mp3 は 48 kHz 以下をサポートします。opus は 8 kHz、12 kHz、16 kHz、24 kHz、48 kHz をサポートします。ac3 は 32 kHz、44.1 kHz、48 kHz をサポートします。amr は 8 kHz および 16 kHz のみをサポートします。 |
|
ac |
int |
いいえ |
音声チャンネル数。デフォルトでは、align パラメーターで指定されたソース音声ファイルのチャンネル数に一致します。有効な値:1 ~ 8。 説明
サポートされるチャンネル数はフォーマットによって異なります。mp3 はモノラルおよびステレオをサポートします。ac3 は最大 6 チャンネル(5.1)をサポートします。amr はモノラルのみをサポートします。 |
|
aq |
int |
いいえ |
音声圧縮品質。有効な値:0 ~ 100。 説明
このパラメーターは ab と相互排他です。どちらも設定されていない場合、エンコーダーはデフォルトのビットレートを使用します。 |
|
ab |
int |
いいえ |
音声ビットレート(bps 単位)。有効な値:1000 ~ 10000000。 |
|
abopt |
string |
いいえ |
音声ビットレートオプション。有効な値:
説明
このパラメーターは ab パラメーターと併用する必要があります。 |
|
align |
int |
いいえ |
マージリスト内のメイン音声ファイルのインデックス。デフォルトのトランスコードパラメーターはこのファイルから取得されます。デフォルト値は 0 で、マージリストの最初の音声ファイルを示します。 |
|
adepth |
int |
いいえ |
音声サンプリングビット深度。有効な値:16 および 24。 説明
このパラメーターは f が flac に設定されている場合にのみ有効です。 |
REST API
AAC への音声マージ
-
音声ファイル:pre1.mp3、pre2.wav、example.oga、sur1.aac、sur2.wma
-
マージ持続時間および順序:
音声ファイル名
注文
持続時間
pre1.mp3
1
全音声
pre2.wav
2
最初の 2 秒
example.oga
3
全音声
sur1.aac
4
4 秒~10 秒
sur2.wma
5
10 秒~終了
-
トランスコード完了通知:Message Service (MNS) メッセージを送信します。
-
出力音声仕様
-
音声フォーマット:aac
-
音声プロファイル:44.1 kHz サンプリングレート、モノラル
-
音声ビットレート:96 kbps
-
オブジェクトストレージパス
-
AAC ファイル:oss://outbucket/outobj.aac
-
-
リクエスト例
// example.oga オブジェクトに対して音声マージを実行します。
POST /example.oga?x-oss-async-process HTTP/1.1
Host: video-demo.oss-cn-hangzhou.aliyuncs.com
Date: Fri, 28 Oct 2022 06:40:10 GMT
Authorization: OSS4-HMAC-SHA256 Credential=LTAI********************/20250417/cn-hangzhou/oss/aliyun_v4_request,Signature=a7c3554c729d71929e0b84489addee6b2e8d5cb48595adfc51868c299c0c218e
x-oss-async-process=audio/concat,f_aac,ac_1,ar_44100,ab_96000,align_2/pre,o_cHJlMS5tcDMK/pre,o_cHJlMi53YXYK,t_2000/sur,o_c3VyMS5hYWMK,ss_4000,t_10000/sur,o_c3VyMi53bWEK,ss_10000|sys/saveas,b_b3V0YnVja2V0,o_b3V0b2JqLnthdXRvZXh0fQo/notify,topic_QXVkaW9Db252ZXJ0
OSS SDK
OSS SDK for Java、Python、または Go を使用して、非同期処理により音声マージを実行できます。
前提条件
-
OSS_ACCESS_KEY_IDおよびOSS_ACCESS_KEY_SECRET環境変数が設定されていることを確認します。 -
バケット名を指定します(例:
examplebucket)。 -
出力音声ファイル名を指定します(例:
dest.aac)。 -
マージするソース音声ファイル名を指定します(例:
src1.mp3およびsrc2.mp3)。
Java
OSS SDK for Java 3.17.4 以降が必要です。
import com.aliyun.oss.ClientBuilderConfiguration;
import com.aliyun.oss.OSS;
import com.aliyun.oss.OSSClientBuilder;
import com.aliyun.oss.common.auth.CredentialsProviderFactory;
import com.aliyun.oss.common.auth.EnvironmentVariableCredentialsProvider;
import com.aliyun.oss.common.comm.SignVersion;
import com.aliyun.oss.model.AsyncProcessObjectRequest;
import com.aliyun.oss.model.AsyncProcessObjectResult;
import com.aliyuncs.exceptions.ClientException;
import java.nio.charset.StandardCharsets;
import java.util.Base64;
public class Demo {
public static void main(String[] args) throws ClientException {
// バケットが配置されているリージョンのエンドポイントを設定します。
String endpoint = "https://oss-cn-hangzhou.aliyuncs.com";
// Alibaba Cloud リージョン ID を指定します(例:cn-hangzhou)。
String region = "cn-hangzhou";
// 環境変数からアクセス認証情報を取得します。このサンプルコードを実行する前に、OSS_ACCESS_KEY_ID および OSS_ACCESS_KEY_SECRET 環境変数が設定されていることを確認してください。
EnvironmentVariableCredentialsProvider credentialsProvider = CredentialsProviderFactory.newEnvironmentVariableCredentialsProvider();
// バケット名を指定します。
String bucketName = "examplebucket";
// 出力音声ファイル名を指定します。
String targetAudio = "dest.aac";
// マージする音声ファイル名を指定します。
String audio1 = "src1.mp3";
String audio2 = "src2.mp3";
// OSSClient インスタンスを作成します。
// 完了後は、OSSClient をシャットダウンしてリソースを解放します。
ClientBuilderConfiguration clientBuilderConfiguration = new ClientBuilderConfiguration();
clientBuilderConfiguration.setSignatureVersion(SignVersion.V4);
OSS ossClient = OSSClientBuilder.create()
.endpoint(endpoint)
.credentialsProvider(credentialsProvider)
.clientConfiguration(clientBuilderConfiguration)
.region(region)
.build();
try {
// 音声処理および音声マージのスタイル文字列を構築します。
String audio1Encoded = Base64.getUrlEncoder().encodeToString(audio1.getBytes(StandardCharsets.UTF_8)).replace("=", "");
String audio2Encoded = Base64.getUrlEncoder().encodeToString(audio2.getBytes(StandardCharsets.UTF_8)).replace("=", "");
String style = String.format("audio/concat,f_aac,ac_1,ar_44100,ab_96000,align_2/pre,o_%s/pre,o_%s,t_0", audio1Encoded, audio2Encoded);
// 非同期処理命令を構築します。
String bucketEncoded = Base64.getUrlEncoder().encodeToString(bucketName.getBytes(StandardCharsets.UTF_8)).replace("=", "");
String targetEncoded = Base64.getUrlEncoder().encodeToString(targetAudio.getBytes(StandardCharsets.UTF_8)).replace("=", "");
String process = String.format("%s|sys/saveas,b_%s,o_%s/notify,topic_QXVkaW9Db252ZXJ0", style, bucketEncoded, targetEncoded);
// AsyncProcessObjectRequest オブジェクトを作成します。
AsyncProcessObjectRequest request = new AsyncProcessObjectRequest(bucketName, audio1, process);
// 非同期処理タスクを実行します。
AsyncProcessObjectResult response = ossClient.asyncProcessObject(request);
System.out.println("EventId: " + response.getEventId());
System.out.println("RequestId: " + response.getRequestId());
System.out.println("TaskId: " + response.getTaskId());
} finally {
// OSSClient をシャットダウンします。
ossClient.shutdown();
}
}
}
Python
OSS SDK for Python 2.18.4 以降が必要です。
# -*- coding: utf-8 -*-
import base64
import oss2
from oss2.credentials import EnvironmentVariableCredentialsProvider
def main():
# 環境変数からアクセス認証情報を取得します。このサンプルコードを実行する前に、OSS_ACCESS_KEY_ID および OSS_ACCESS_KEY_SECRET 環境変数が設定されていることを確認してください。
auth = oss2.ProviderAuthV4(EnvironmentVariableCredentialsProvider())
# バケットが配置されているリージョンのエンドポイントを設定します。たとえば、中国 (杭州) の場合は https://oss-cn-hangzhou.aliyuncs.com を設定します。
endpoint = 'https://oss-cn-hangzhou.aliyuncs.com'
# Alibaba Cloud リージョン ID を指定します(例:cn-hangzhou)。
region = 'cn-hangzhou'
# バケット名を指定します(例:examplebucket)。
bucket = oss2.Bucket(auth, endpoint, 'examplebucket', region=region)
# 出力音声ファイル名を指定します。
target_audio = 'dest.aac'
# マージする音声ファイル名を指定します。
audio1 = 'src1.mp3'
audio2 = 'src2.mp3'
# 音声処理および音声マージのスタイル文字列を構築します。
audio1_encoded = base64.urlsafe_b64encode(audio1.encode()).decode().rstrip('=')
audio2_encoded = base64.urlsafe_b64encode(audio2.encode()).decode().rstrip('=')
style = f"audio/concat,f_aac,ac_1,ar_44100,ab_96000,align_2/pre,o_{audio1_encoded}/pre,o_{audio2_encoded},t_0"
# 非同期処理命令を構築します。
bucket_encoded = base64.urlsafe_b64encode(bucket.bucket_name.encode()).decode().rstrip('=')
target_encoded = base64.urlsafe_b64encode(target_audio.encode()).decode().rstrip('=')
process = f"{style}|sys/saveas,b_{bucket_encoded},o_{target_encoded}/notify,topic_QXVkaW9Db252ZXJ0"
print(process)
# 非同期処理タスクを実行します。
try:
result = bucket.async_process_object(audio1, process)
print(f"EventId: {result.event_id}")
print(f"RequestId: {result.request_id}")
print(f"TaskId: {result.task_id}")
except Exception as e:
print(f"Error: {e}")
if __name__ == "__main__":
main()
Go
OSS SDK for Go 3.0.2 以降が必要です。
package main
import (
"encoding/base64"
"fmt"
"log"
"os"
"github.com/aliyun/aliyun-oss-go-sdk/oss"
)
func main() {
// 環境変数からアクセス認証情報を取得します。このサンプルコードを実行する前に、OSS_ACCESS_KEY_ID、OSS_ACCESS_KEY_SECRET、および OSS_SESSION_TOKEN 環境変数が設定されていることを確認してください。
provider, err := oss.NewEnvironmentVariableCredentialsProvider()
if err != nil {
fmt.Println("Error:", err)
os.Exit(-1)
}
// OSSClient インスタンスを作成します。
// バケットが配置されているリージョンのエンドポイントを設定します。たとえば、中国 (杭州) の場合は https://oss-cn-hangzhou.aliyuncs.com を設定します。
// Alibaba Cloud リージョン ID を設定します(例:cn-hangzhou)。
client, err := oss.New("https://oss-cn-hangzhou.aliyuncs.com", "", "", oss.SetCredentialsProvider(&provider), oss.AuthVersion(oss.AuthV4), oss.Region("cn-hangzhou"))
if err != nil {
fmt.Println("Error:", err)
os.Exit(-1)
}
// バケット名を指定します(例:examplebucket)。
bucketName := "examplebucket"
bucket, err := client.Bucket(bucketName)
if err != nil {
fmt.Println("Error:", err)
os.Exit(-1)
}
// マージする音声ファイル名を指定します。
audio1 := "src1.mp3"
audio2 := "src2.mp3"
// 出力音声ファイル名を指定します。
targetAudio := "dest.aac"
// 音声処理および音声マージのスタイル文字列を構築します。
audio1Encoded := base64.URLEncoding.EncodeToString([]byte(audio1))
audio2Encoded := base64.URLEncoding.EncodeToString([]byte(audio2))
style := fmt.Sprintf("audio/concat,f_aac,ac_1,ar_44100,ab_96000,align_2/pre,o_%s/pre,o_%s,t_0", audio1Encoded, audio2Encoded)
// 非同期処理命令を構築します。
bucketEncoded := base64.URLEncoding.EncodeToString([]byte(bucketName))
targetEncoded := base64.URLEncoding.EncodeToString([]byte(targetAudio))
process := fmt.Sprintf("%s|sys/saveas,b_%s,o_%s/notify,topic_QXVkaW9Db252ZXJ0", style, bucketEncoded, targetEncoded)
// 非同期処理タスクを実行します。
result, err := bucket.AsyncProcessObject(audio1, process)
if err != nil {
log.Fatalf("Failed to async process object: %s", err)
}
fmt.Printf("EventId: %s\n", result.EventId)
fmt.Printf("RequestId: %s\n", result.RequestId)
fmt.Printf("TaskId: %s\n", result.TaskId)
}