BTCC / BTCC Square / Abmedia /
LLM 微調 15 技術總覽:LoRA、DPO、GRPO 一次整理

LLM 微調 15 技術總覽:LoRA、DPO、GRPO 一次整理

Abmedia
Author:
Abmedia
發佈時間:
2026-07-11 15:53:04
0

AI/LLM 技術寫作者 Akshay Pachaar 於 7 月 10 日在 X 發表一份完整的 LLM 微調(fine-tuning)技術清單,列出 15 種主流方法,累積 917 次按讚、1,361 次書籤收藏,成為近期 AI 開發者社群最受收藏的參考文之一。這 15 種技術可依用途歸為三大類:參數效率微調、對齊訓練,以及訓練規模/部署場景。以下依 akshay 的原始順序整理,並補充實務背景。

清單全貌:15 種微調技術的原始排序

Akshay 原始清單依序為:1. LoRA、2. QLoRA、3. Prefix Tuning、4. Adapter Tuning、5. Instruction Tuning、6. P-Tuning、7. BitFit、8. Soft Prompts、9. RLHF、10. RLAIF、11. DPO(Direct Preference Optimization)、12. GRPO(Group Relative Policy Optimization)、13. RLAIF with AI Feedback、14. Multi-Task Fine-Tuning、15. Federated Fine-Tuning。他強調這份清單是「若要自己動手客製化 LLM,會優先學的技術組合」。

參數效率微調(PEFT):LoRA 家族與其變體

清單前 8 項屬於「參數效率微調」(Parameter-Efficient Fine-Tuning, PEFT)—只更新少量參數就能達到接近全參數微調的效果,是消費級硬體上訓練 LLM 的主流方法。LoRA(Low-Rank Adaptation)以低秩矩陣分解實現參數增量、記憶體需求低;QLoRA 是 LoRA 的量化版本,可在單張 24GB 消費級 GPU 上微調 65B 模型。

Prefix Tuning、P-Tuning、Soft Prompts 屬於「提示微調」家族—只調整輸入層的可訓練 embedding,不動主網路權重;Adapter Tuning 在每層插入小型 adapter 模組,適合多任務切換;BitFit 只更新偏置項(bias),是所有技術中參數更新量最小的方法。Instruction Tuning 是廣義概念,指用「指令-回應」格式資料訓練,讓模型學會遵循指示,常作為對齊訓練的基底。

對齊訓練與規模應用:RLHF 到 GRPO 與聯邦微調

清單第 9 到 13 項屬於對齊訓練家族。RLHF(Reinforcement Learning from Human Feedback)是 ChatGPT 早期採用的經典方法,用人類偏好資料訓練獎勵模型再做強化學習;RLAIF 把人類回饋改為 AI 回饋以降低成本;DPO 直接以偏好對做梯度優化,省去獎勵模型訓練;GRPO 是 DeepSeek 提出的群體相對策略優化,透過群體採樣估計優勢函數,被 DeepSeek R1 系列採用並成為 2025 年後的新標準。

清單最後兩項處理訓練規模與資料分佈。Multi-Task Fine-Tuning 用多個任務資料同時訓練提升泛化能力;Federated Fine-Tuning 讓模型在多個裝置上分散訓練、資料不離開本地,適用於隱私敏感場景(醫療、金融)。akshay 這份 15 項清單基本涵蓋了 2026 年做 LLM 客製化訓練的完整工具箱,適合開發者依實際需求(成本、資料量、隱私、任務數)挑選組合。

本站轉載文章皆來自公開網絡,部分由AI整理,僅為傳遞產業訊息,不代表BTCC立場。原創權益歸原作者所有。如發現版權問題,請透過[email protected]聯絡我們,我們將依法處理。 BTCC不對資訊準確性、時效性及完整性作任何保證,不承擔因依賴資訊而產生的任何責任。內容僅供參考,不構成投資、法律或商業建議。