適用於多個應用情境,包括智能問答、智能質檢、即時演講字幕、訪談錄音轉寫等情境,在金融、保險、電商、智能家居等多個領域均有應用案例。使用者可以使用自學習平台等工具改善語音辨識效果,而且提供了功能更豐富的管理主控台和更易用的SDK,歡迎開通體驗。
產品優勢

-
識別準確率高
中國首家使用字級LC-BLSTM/DFSMN-CTC建模,相對業界傳統CTC方法降低了20%的錯誤率,大幅提高了語音辨識的精度。

-
超快的解碼速率
中國首家使用LFR解碼技術, 在不損失識別精度的情況下,將解碼速率提高了3倍以上,大幅縮短了反饋時間,提升使用者體驗。

-
獨創的模型最佳化工具
業內首家提供自學習平台的系統。同時支援熱詞定製和模型定製。使用者可以根據業務需求上傳相關的資料,對各種語音產品進行定製,形成自己的專屬模型,從而最大限度的提升識別效果。

-
廣泛的領域覆蓋
目前已經積累了大量行業客戶,在金融、保險、電商、智能家居等多個領域均有成熟的應用案例,業務情境包括智能問答、智能質檢、庭審記錄、字幕翻譯、語音助手等,可以滿足不同客戶多樣化的需求。
產品與服務
錄音檔案識別
對使用者上傳的錄音檔案進行識別,上傳完之後24小時內完成識別並返回識別文本。可用於話務中心語音質檢、庭審資料庫錄入、會議記錄總結、醫院病曆錄入等情境。
即時語音辨識
對不限時間長度的音頻流做即時識別,達到“邊說邊出文字”的效果,內建智能斷句,可提供每句話開始結束時間。可用於視頻即時直播字幕、即時會議記錄、即時法庭庭審記錄等情境。
一句話識別
對時間長度較短(一分鐘以內)的語音進行識別,適用於較短的語音互動情境,如語音搜尋、語音指令、語音短訊息等,可整合在各類App、智能家電、智能助手等產品中。
語音合成
語音合成服務,將文本轉換成自然流暢的語音。目前有多種音色可供選擇,並提供調節語速、語調、音量等功能,適用於智能客服、語音互動、文學有聲閱讀和無障礙播報等情境。
語言模型自學習工具
使用者可以自行上傳資料,對阿里的語音技術進行深度定製,從而提升特定業務領域的識別準確度。目前僅支援上傳文本資料對語言模型進行定製,未來會推出上傳音頻資料對聲學模型進行定製。
