NVIDIA公開Granary開源語音數據庫及AI模型 強化多語言翻譯能力
18
2
btccSquare新聞報導:
NVIDIA近日發布了GranARy開源語音數據庫,以及兩款先進AI模型「Canary-1b-v2」和「Parakeet-tdt-0.6b-v3」,旨在革新語音識別與翻譯技術。 此計劃針對當前主流AI語音技術僅支持全球7,000種語言中的一小部分之現況,提出解決方案。
Granary由NVIDIA與卡內基梅隆大學及Bruno Kessler基金會合作開發,包含約65萬小時的語音識別數據和35萬小時的翻譯素材。 該數據庫涵蓋25種歐洲語言,包括愛沙尼亞語、克羅埃西亞語和馬爾他語等稀有語言,同時也支持俄語和烏克蘭語。 NVIDIA的NeMo工具能將非結構化的公開音頻轉換為高質量訓練樣本,無需大量人工標註。
研究顯示,Granary僅需一半訓練數據即可達到與其他數據庫相當的準確度。 此突破將加速開發包容性多語言AI解決方案,應用於自動語音識別(ASR)和翻譯(AST)領域。
來源: