Meta發布即時音訊感知AI模型Muse Voice Transcribe,支援20餘人分軌轉寫
0
PANews 9月2日消息,根據IT之家引用9to5Mac報道,Meta推出首個即時音訊感知模型Muse Voice Transcribe,開發者可透過Meta Model API調用,定價為每1,000分鐘音訊3美元(約合每小時0.18美元)。 此模型在同一流程中整合串流自動語音辨識、說話者分離與端點偵測,使用者說話時可同步輸出文字,無需等待完整錄音結束後再處理。 模型支援70餘種語言(25種已驗證)、超1小時音訊及多語言切換,可在包含20餘名說話者的錄音中分離不同發言者。 Meta引入自適應延遲機制,對易辨識語音快速輸出,對複雜詞語呼叫更多上下文以兼顧速度與準確度。
來源:
登入回覆
登入分享您的看法評論
相關文章