騰訊混元推出輕量級AI模型Hunyuan-A13B 採用MoE架構
20
3
btccSquare消息:騰訊混元部門最新發布的AI模型Hunyuan-A13B,以更精簡的架構挑戰大型競爭對手。 這個130億參數的模型在推理時僅激活其800億總參數中的一小部分,透過混合專家(MoE)架構顯著降低運算成本,同時保持強勁性能。
該模型採用64個專家模組,每次推理僅激活8個,結合SWiGLU激活函數和分組查詢注意力技術。 其訓練數據包含2000萬個token,其中2500億個STEM領域token,增強了邏輯推理能力。 該架構透過三階段訓練方案,支援最高256K token的上下文窗口。
Hunyuan-A13B引入雙模態推理功能,能根據任務複雜度動態切換快速響應和深度分析模式。 這項創新正值業界努力平衡AI能力與資源需求之際,可能為高效大型語言模型部署樹立新標準。
來源: