本文主要介紹工作流程的搭配和節點配置操作。
智能工作流程 = 把多個節點像樂高一樣拼起來,自動跑通整個流程
人臉提取+視頻摘要(OTT)
流程:

適用情境:需要快速提取視頻中人臉資訊,並產生視頻摘要(如影視內容中明星片段剪輯、新聞人物集錦等)。
優勢:一鍵完成“人臉定位+內容摘要”,減少手動篩選成本。
抽幀檢測(Custom)
流程:

適用情境:需要對視頻進行逐幀分析(如廣告幀檢測、畫面合規性檢查、主要畫面格提取等)。
優勢:專註“幀級內容檢測”,滿足精細化畫面分析需求。
提取語音+ASR + 常值內容提取 + 抽幀檢測(Custom)
流程:

適用情境:需要同時處理“音頻轉文字、文本資訊提取、畫面幀檢測”的全流程(如直播回放的內容合規審查、長視頻的多維度分析等)。
優勢:覆蓋“音頻→文本→畫面”的全鏈路分析,避免多工具切換。
自訂工作流程
自訂工作流程允許使用者根據業務需求,自由組合多個節點(Face Service、提取語音+ASR、常值內容提取、視頻摘要(OTT)、抽幀檢測(Custom))。
具體節點能力,請參見:產品能力說明
提取語音+ASR 、常值內容提取 、抽幀檢測(Custom)三個節點搭配使用
「提取語音+ASR」為「常值內容提取」節點的輸入項,建議一起使用,否則將導致結果失敗!
推薦配置組合(典型情境參考)
方案一:全鏈路串列深度分析
流程:

適用情境: 採用單串線行模式。適用於對視頻內容進行標準化的、按部就班的深度結構化處理,確保每個環節的資料都能被下一個環節利用。
優勢: 流程線性清晰,便於排查問題;能夠在一個任務中完成從畫面到聲音再到語義的全維度解析。
方案二:畫面與語音串列處理
流程:

適用情境: 採用單串線行模式。側重於內容語義分析,不需要識別具體人物,但需要保留主要畫面格畫面和語音轉文字內容的情境(如普通會議記錄、Vlog內容分析)。
優勢: 相比方案一減少了人臉計算資源消耗,處理速度更快,專註於“畫面存檔+語音語義”。
方案三:音視頻並行獨立處理
流程:

適用情境: 採用雙線並聯模式。絕大多數媒資入庫情境。既需要知道視頻裡是誰(人臉),也需要知道說了什麼(文本提取),且兩者互不干擾。
優勢: 平行處理效率極高,互不阻塞;如果某一路(如Face Service)失敗,不會影響另一路(如文本提取)的結果產出。
方案四:畫面檢測與人物識別平行處理
流程:

適用情境: 適用於需要快速抓取人物資訊,同時對視頻內容進行抽幀和語音分析的情境。
優勢: 靈活度高,將“內容分析”和“人物識別”解耦,適合對處理時效性要求較高的業務。
方案五:抽幀驅動的多模態分析
流程:

適用情境: 側重於畫面資訊挖掘(如廣告畫面文字提取、PPT畫面識別),同時兼顧語音轉寫。
優勢: 最大化利用畫面資訊,適合“畫面即內容”的視頻類型(如教程、廣告)。
方案六:複雜依賴交叉處理
流程:

適用情境: 需要進行多模態融合分析的進階情境,例如“畫面出現某人且說了某話”的聯合檢索。
優勢: 資料維度最全,能夠捕捉跨模態的關聯資訊。