All Products
Search
Document Center

Intelligent Media Services:Ikhtisar Real-time Conversational AI

Last Updated:Jun 05, 2026

Real-time Conversational AI memungkinkan interaksi audio dan video yang efisien antara AI agent dan pengguna.

Pengenalan Produk

Real-time Conversational AI membantu Anda membangun aplikasi panggilan audio dan video antara AI agent dan pengguna. Konfigurasikan AI agent kustom melalui antarmuka visual dan deploy dalam waktu kurang dari 10 menit. AI agent terhubung ke pengguna melalui jaringan ApsaraVideo Real-time Communication (ARTC) dan mendukung berbagai skenario, seperti layanan pelanggan online, asisten AI, teman AI, asisten pencocokan, serta guru virtual.

Kemampuan

AI agent berinteraksi dengan pengguna melalui panggilan audio dan video, percakapan pesan, serta . Konfigurasikan alur kerja untuk mengaktifkan kemampuan berikut:

Panggilan audio dan video

Voice Calls

Berbicara dengan asisten AI menggunakan suara.

555d2e763e3c49c23ac59cb7060d2a44

Digital Human Calls

Berinteraksi dengan digital human melalui video untuk pengalaman yang lebih realistis.

lQDPJwMuwU90JFXNC6zNBaCwNbn8uKeIjbgHiTmd5-WQAA_1440_2988

Visual Understanding Calls

Agent menggabungkan input suara dan video untuk memberikan umpan balik kontekstual.

lQDPJwpRBT4ppFXNC6zNBaCwzODP1_m-L7MHiTmc7Nh_AA_1440_2988

Video Calls

Digital human menggunakan visual understanding untuk panggilan video dua arah dengan pengguna.image

Panduan Cepat Panggilan Audio dan Video.

Alur kerja voice call hanya memerlukan tiga node.

image

Chat messages

Berchat dengan AI agent melalui suara atau teks dalam kotak dialog.

lQDPKHl9TD29I1XNC6zNBaCwklTx59f8apsHiTmbKaTPAA_1440_2988

image

Panduan Cepat Chat Messages.

Alur kerja chat message menggunakan konfigurasi berikut.

image

Istilah

SessionId

Identifier unik yang ditentukan developer untuk catatan chat. Contoh:

  • Asosiasi pengguna: Hubungkan sesi lintas waktu di perangkat mobile atau PC menggunakan sessionId.

  • Isolasi sesi: Gunakan sessionId untuk memisahkan beberapa sesi dari pengguna yang sama.

Chat messages

Pengguna berinteraksi dengan AI agent melalui suara atau teks dalam kotak dialog chat untuk mengajukan pertanyaan atau memperoleh informasi.

Voice calls

Pengguna berbicara dengan asisten AI untuk memperoleh informasi dan dukungan secara cepat.

3D digital human calls

Digital human 3D mensimulasikan karakter virtual dengan interaksi suara, bahasa tubuh, dan ekspresi wajah untuk meningkatkan realisme dan keterlibatan.

Visual understanding calls

Menggabungkan feed kamera langsung dan perintah suara melalui interaksi multimodal untuk memberikan umpan balik yang presisi, intuitif, dan personal—melampaui komunikasi berbasis suara atau teks saja.

Video calls

Panggilan video menggabungkan digital humans dan visual understanding. Kedua pihak muncul di layar, dan digital human memahami serta merespons feed video pengguna.

Interactive messages

Pesan interaktif meningkatkan komunikasi antar pengguna dan memperkuat keterlibatan selama live streaming.

Real-Time Communication (ARTC)

Alibaba Cloud ARTC menggunakan WebRTC dan lebih dari 3.200 node global untuk menghadirkan panggilan audio dan video berkualitas tinggi, ketersediaan tinggi, dan latensi ultra-rendah antara pengguna dan AI agent. Ikhtisar Real-Time Communication.

Real-time workflow

Bagian inti dari AI agent, dibangun dengan menyeret dan meletakkan komponen AI seperti speech-to-text, model bahasa besar, text-to-speech, dan database vektor Alibaba Cloud. AI agent menjalankan setiap langkah alur kerja secara berurutan.

AI agent

Pengguna berbasis cloud yang sangat realistis, dibuat sebelumnya atau dikustomisasi, yang berinteraksi dengan end user melalui audio dan video.

Manfaat

  • Ketersediaan tinggi global dan latensi rendah: Jaringan audio-video real-time Alibaba Cloud mencakup lebih dari 3.200 node global dengan optimasi QoS, memastikan panggilan AI agent berjalan lancar di seluruh dunia.

  • Integrasi dan debugging mudah: Pasang komponen AI—speech-to-text, model bahasa besar, text-to-speech, dan database vektor—ke dalam alur kerja Anda untuk peluncuran cepat dan debugging yang mudah.

  • Perilaku mirip manusia: Pengurangan kebisingan cerdas, deteksi penyelaan, dan segmentasi ucapan membuat AI agent berperilaku lebih seperti manusia.

  • Integrasi mudah: Empat metode integrasi memungkinkan Anda memilih opsi terbaik sesuai skenario Anda.

Cara Kerja

image

  1. Pengguna memulai panggilan audio-video real-time dengan AI agent berbasis cloud menggunakan SDK.

  2. AI agent menerima input audio dan video pengguna, menjalankan alur kerja, dan menghasilkan tanggapan.

  3. AI agent mendorong aliran tanggapan ke jaringan ARTC. Pengguna berlangganan dan memutar aliran tersebut, menyelesaikan percakapan.

Fitur

Fitur

Deskripsi

Real-time workflow

Bangun alur kerja AI agent menggunakan antarmuka visual drag-and-drop.

  • Speech-to-text:

    • Kemampuan Tongyi Qwen bawaan.

  • Text-to-speech:

    • Kemampuan Tongyi Qwen bawaan.

    • Sambungkan modul text-to-speech kustom Anda menggunakan protokol standar.

    • Integrasikan kemampuan speech MiniMax sebagai plugin pihak ketiga.

  • Large language model (text-to-text):

    • Kemampuan Tongyi Qwen bawaan.

    • Pilih model AI dari Model Hub atau Application Center di Alibaba Cloud Model Studio.

    • Integrasikan model bahasa besar kustom Anda menggunakan standar OpenAI.

  • Digital human

    • Integrasikan kemampuan digital human Xiangxin sebagai plugin pihak ketiga.

  • Video frame extraction

  • Multimodal large language model:

    • Kemampuan Tongyi Qwen bawaan.

    • Integrasikan model bahasa besar multimodal kustom Anda menggunakan standar OpenAI.

Custom AI agent appearance

Unggah gambar untuk merepresentasikan AI agent Anda selama panggilan suara.

AI agent emotion recognition

AI agent mendeteksi emosi pengguna saat ini dan memberikan respons dengan konteks emosional.

Welcome message

Atur pesan selamat datang di Konsol. Agen AI akan mengucapkan pesan tersebut saat percakapan dimulai.

Proactive announcements

Server bisnis Anda menggunakan OpenAPI untuk memicu output audio-video dari AI agent.

Real-time captions

Menampilkan teks percakapan secara real-time pada antarmuka end user.

Intelligent noise reduction

AI agent menyaring kebisingan latar belakang dari sisi pengguna. Saat beberapa orang berbicara sekaligus, AI agent menangkap suara paling keras terlebih dahulu.

Intelligent interruption detection

AI agent mendeteksi saat pengguna mencoba menyela selama percakapan.

Intelligent Sentence Segmentation

AI agent membagi kalimat panjang atau kompleks secara otomatis untuk meningkatkan keterbacaan.

Per-sentence audio callbacks

Konfigurasikan audio callbacks di Konsol untuk menyimpan audio data real-time di OSS.

Walkie-talkie mode

Aktifkan walkie-talkie mode saat startup atau selama panggilan. Tekan tombol untuk berbicara dengan AI agent.

ASR hotwords

Tentukan hotword spesifik bisnis untuk meningkatkan akurasi pengenalan suara.

Voiceprint noise reduction

Dalam percakapan kelompok, AI agent mengidentifikasi dan mempertahankan voiceprint pembicara utama sambil mengurangi kebisingan yang tidak relevan.

Live agent takeover

Jika AI agent tidak dapat menangani permintaan atau diperlukan keputusan penting, alihkan percakapan ke live agent.

Graceful shutdown

Saat server bisnis Anda menghentikan AI agent, biarkan agent menyelesaikan responsnya terlebih dahulu sebelum dimatikan agar tidak terjadi gangguan mendadak.

Data archiving

Konversi percakapan AI agent ke teks dan ambil melalui API. Simpan rekaman audio-video di OSS atau ApsaraVideo VOD.

Penagihan

Real-time Conversational AI sedang dalam masa pratinjau publik dan gratis selama periode ini.

FAQ

Hubungi kami

Untuk pertanyaan produk atau dukungan, cari nomor grup DingTalk 106730016696 dan bergabunglah ke dalam grup tersebut.