Real-time Conversational AI memungkinkan interaksi audio dan video yang efisien antara AI agent dan pengguna.
Pengenalan produk
Real-time Conversational AI membantu Anda membangun aplikasi panggilan audio dan video antara AI agent dan pengguna. Konfigurasikan AI agent kustom melalui antarmuka visual dan deploy dalam waktu kurang dari 10 menit. AI agent terhubung ke pengguna melalui jaringan ApsaraVideo Real-time Communication (ARTC) dan mendukung berbagai skenario, seperti layanan pelanggan online, asisten AI, teman AI, asisten pencocokan, serta guru virtual.
Kemampuan
AI agent berinteraksi dengan pengguna melalui panggilan audio dan video, percakapan pesan, dan . Konfigurasikan alur kerja untuk mengaktifkan kemampuan berikut:
Panggilan audio dan video
|
Voice Calls Berbicara dengan asisten AI menggunakan suara.
|
Digital Human Calls Berinteraksi dengan digital human melalui video untuk pengalaman yang lebih realistis.
|
Visual Understanding Calls Agent menggabungkan input suara dan video untuk memberikan umpan balik kontekstual.
|
Video Calls Digital human menggunakan visual understanding untuk panggilan video dua arah dengan pengguna. |
|
Panduan Cepat Panggilan Audio dan Video. Alur kerja voice call hanya memerlukan tiga node.
|
|||
Jenis panggilan yang berbeda terikat pada alur kerja yang berbeda. Untuk beralih dari Voice Call ke jenis panggilan lain seperti Visual Understanding Calls, akhiri panggilan saat ini terlebih dahulu, lalu mulai panggilan baru menggunakan ID AI agent yang terikat pada alur kerja target. Untuk penggunaan API, lihat Panduan Cepat Panggilan Audio dan Video.
Chat messages
Berchat dengan AI agent menggunakan suara atau teks dalam kotak dialog.
|
|
|
|
Alur kerja chat message menggunakan konfigurasi berikut.
|
|
Istilah
|
SessionId |
Identifier unik yang ditentukan developer untuk catatan chat. Contoh:
|
|
Chat messages |
Pengguna berinteraksi dengan AI agent melalui suara atau teks dalam kotak dialog chat untuk mengajukan pertanyaan atau mendapatkan informasi. |
|
Voice calls |
Pengguna berbicara dengan asisten AI untuk mendapatkan informasi dan dukungan secara cepat. |
|
3D digital human calls |
Digital human 3D mensimulasikan karakter virtual dengan interaksi suara, bahasa tubuh, dan ekspresi wajah untuk meningkatkan realisme dan keterlibatan. |
|
Visual understanding calls |
Menggabungkan feed kamera langsung dan perintah suara melalui interaksi multimodal untuk memberikan umpan balik yang tepat, intuitif, dan personal di luar komunikasi hanya suara atau hanya teks. |
|
Video calls |
Panggilan video menggabungkan digital humans dan visual understanding. Kedua pihak muncul di layar, dan digital human memahami serta merespons feed video pengguna. |
|
Interactive messages |
Pesan interaktif meningkatkan komunikasi antar pengguna dan meningkatkan keterlibatan selama live streaming. |
|
Real-Time Communication (ARTC) |
Alibaba Cloud ARTC menggunakan WebRTC dan lebih dari 3.200 node global untuk menghadirkan panggilan audio dan video berkualitas tinggi, ketersediaan tinggi, dan latensi ultra-rendah antara pengguna dan AI agent. Ikhtisar Real-Time Communication. |
|
Real-time workflow |
Bagian inti dari AI agent, dibangun dengan menyeret dan meletakkan komponen AI seperti speech-to-text, large language model, text-to-speech, dan database vektor Alibaba Cloud. AI agent menjalankan setiap langkah alur kerja secara berurutan. |
|
AI agent |
Pengguna berbasis cloud yang sangat realistis, yang telah dibuat sebelumnya atau dikustomisasi, berinteraksi dengan end user melalui audio dan video. |
Manfaat
-
Ketersediaan tinggi global dan latensi rendah: Jaringan audio-video real-time Alibaba Cloud mencakup lebih dari 3.200 node global dengan optimisasi QoS, memastikan panggilan AI agent berjalan lancar di seluruh dunia.
-
Integrasi dan debugging mudah: Pasang komponen AI — speech-to-text, large language model, text-to-speech, dan database vektor — ke dalam alur kerja Anda untuk peluncuran cepat dan debugging yang mudah.
-
Perilaku mirip manusia: Pengurangan kebisingan cerdas, deteksi penyelaan, dan segmentasi ucapan membuat AI agent berperilaku lebih seperti manusia.
-
Integrasi mudah: Empat metode integrasi memungkinkan Anda memilih opsi terbaik sesuai skenario Anda.
Cara kerja

-
Pengguna memulai panggilan audio-video real-time dengan AI agent berbasis cloud menggunakan SDK.
-
AI agent menerima input audio dan video pengguna, menjalankan alur kerja, dan menghasilkan respons.
-
AI agent mendorong aliran respons ke jaringan ARTC. Pengguna berlangganan dan memutar aliran tersebut, menyelesaikan percakapan.
Setiap AIAgentId terikat pada alur kerja tertentu. Anda tidak dapat mengganti AIAgentId selama panggilan sedang berlangsung, dan UpdateAIAgentInstance tidak mendukung modifikasi parameter AIAgentId. Untuk beralih ke AI agent yang berbeda, panggil StopAIAgentInstance untuk menghentikan panggilan saat ini terlebih dahulu, lalu panggil StartAIAgentInstance atau GenerateAIAgentCall untuk memulai AI agent target.
Fitur
|
Fitur |
Deskripsi |
|
Real-time workflow |
Bangun alur kerja AI agent menggunakan antarmuka visual drag-and-drop.
|
|
Custom AI agent appearance |
Unggah gambar untuk merepresentasikan AI agent Anda selama panggilan suara. |
|
AI agent emotion recognition |
AI agent mendeteksi emosi pengguna saat ini dan membalas dengan konteks emosional. |
|
Welcome message |
Tetapkan pesan sambutan di Konsol. AI agent akan mengucapkannya saat percakapan dimulai. |
|
Proactive announcements |
Server bisnis Anda menggunakan OpenAPI untuk memicu output audio-video dari AI agent. |
|
Real-time captions |
Menampilkan teks percakapan secara real-time pada antarmuka end user. |
|
Intelligent noise reduction |
AI agent menyaring kebisingan latar belakang dari sisi pengguna. Saat beberapa orang berbicara sekaligus, AI agent menangkap suara paling keras terlebih dahulu. |
|
Intelligent interruption detection |
AI agent mendeteksi saat pengguna mencoba menyela selama percakapan. |
|
Intelligent Sentence Segmentation |
AI agent secara otomatis membagi kalimat panjang atau kompleks untuk meningkatkan keterbacaan. |
|
Per-sentence audio callbacks |
Konfigurasikan callback audio di Konsol untuk menyimpan audio data secara real-time di OSS. |
|
Walkie-talkie mode |
Aktifkan mode walkie-talkie saat startup atau selama panggilan. Tekan tombol untuk berbicara dengan AI agent. |
|
ASR hotwords |
Tentukan hotword spesifik bisnis untuk meningkatkan akurasi pengenalan ucapan. |
|
Voiceprint noise reduction |
Dalam percakapan kelompok, AI agent mengidentifikasi dan mempertahankan voiceprint pembicara utama sambil mengurangi kebisingan yang tidak relevan. |
|
Live agent takeover |
Saat AI agent tidak dapat menangani permintaan atau diperlukan keputusan penting, alihkan percakapan ke live agent. |
|
Graceful shutdown |
Saat server bisnis Anda menghentikan AI agent, biarkan AI agent menyelesaikan respons saat ini sebelum dimatikan agar tidak terjadi gangguan mendadak. |
|
Data archiving |
Konversi percakapan AI agent menjadi teks dan ambil melalui API. Simpan rekaman audio-video di OSS atau ApsaraVideo VOD. |
Penagihan
Real-time Conversational AI sedang dalam masa pratinjau publik dan gratis selama periode ini.
FAQ
-
Apakah saya perlu melakukan deploy AI agent di origin server saya?
-
Klien saya mengembalikan “AgentNotFound” saat memulai chat messages.
-
Klien saya mengembalikan “UnsupportedWorkflowType” saat memulai chat messages.
Hubungi kami
Untuk pertanyaan produk atau dukungan, cari nomor grup DingTalk 106730016696 dan bergabunglah ke dalam grup tersebut.






