BTCC / BTCC Square / PanewslabTW /
Meta發布即時音訊感知AI模型Muse Voice Transcribe,支援20餘人分軌轉寫

Meta發布即時音訊感知AI模型Muse Voice Transcribe,支援20餘人分軌轉寫

PanewslabTW
發佈時間:
2026-09-02 01:08:00
0
PANews 9月2日消息,根據IT之家引用9to5Mac報道,Meta推出首個即時音訊感知模型Muse Voice Transcribe,開發者可透過Meta Model API調用,定價為每1,000分鐘音訊3美元(約合每小時0.18美元)。 此模型在同一流程中整合串流自動語音辨識、說話者分離與端點偵測,使用者說話時可同步輸出文字,無需等待完整錄音結束後再處理。 模型支援70餘種語言(25種已驗證)、超1小時音訊及多語言切換,可在包含20餘名說話者的錄音中分離不同發言者。 Meta引入自適應延遲機制,對易辨識語音快速輸出,對複雜詞語呼叫更多上下文以兼顧速度與準確度。
本站轉載文章皆來自公開網絡,部分由AI整理,僅為傳遞產業訊息,不代表BTCC立場。原創權益歸原作者所有。如發現版權問題,請透過[email protected]聯絡我們,我們將依法處理。 BTCC不對資訊準確性、時效性及完整性作任何保證,不承擔因依賴資訊而產生的任何責任。內容僅供參考,不構成投資、法律或商業建議。