第 20 課模組五:本地部署與高效微調 14 分鐘· 程度: 進階

參數高效微調:用一張顯示卡也能微調大模型(LoRA 與 QLoRA)

由描圖紙的比喻講起,說明 LoRA 與 QLoRA 怎樣讓學校用一張消費級顯示卡就微調出「懂得校本評分準則」的模型,以及甚麼情況其實不應該微調。

Read in English

一句話答案:微調一個大模型不一定要重新訓練整個模型。LoRA 的做法是在原本的模型上加一層「描圖紙」,只訓練這一層;QLoRA 再把原書壓細,於是一張消費級顯示卡就夠用。Edor.ai 的校內部署正是用這條路,讓學校在自己的伺服器上微調。

由一次暑假會議說起

八月中,一間中學的資訊科技組主任開會時提出一個問題:「我們中文科用了十幾年的作文評語格式,每次叫 AI 寫,它都寫成大陸或台灣的語氣,老師每次都要改。有沒有辦法一次過教曉它?」

科主任補充:「而且我們不想把過往學生的作文送去外國的伺服器。」

這兩句話合起來,就是本課要處理的問題:怎樣把一個通用模型,改造成「懂我們學校規矩」的模型,而且整個過程留在校內。

描圖紙的比喻

想像模型是一本印好的教科書,厚一千頁。你想改動當中的用語習慣,有兩個做法:

  • 重印整本書。把一千頁全部重排、重印。這就是全參數微調(full fine-tuning)。效果最徹底,但要動用的機器、電力與時間,是一般學校完全負擔不起的。
  • 鋪一張描圖紙。書照樣放着,上面蓋一張透明描圖紙,你只在描圖紙上寫修改。讀的時候,眼睛同時看到原書與描圖紙,得出的就是修改後的版本。原書一個字都沒有改。

第二個做法,就是 LoRA(Low-Rank Adaptation,低秩調適)。所謂「參數高效微調」(PEFT),整個家族的核心思想都是這一句:凍結原本的模型,只訓練一小片新加上去的東西。

至於「低秩」這個詞,可以這樣理解:老師改一份試卷,如果每一題都要獨立想一次,那是一千個獨立決定;但實際上老師心裡只有幾條原則(例如「口語化的詞要改」「論點要有例證」),幾條原則就足以解釋一千個修改。LoRA 假設微調所需的改動也是這樣——改動雖然遍佈全書,但背後只由很少幾條「原則」驅動,所以描圖紙可以做得很薄。

薄到甚麼程度?一個七十億參數的模型,LoRA 描圖紙通常只有原模型的百分之一以下。這也是為甚麼微調完之後,學校要儲存與備份的只是那一小片檔案,而不是整個模型。

QLoRA:先把原書影印縮細

LoRA 解決了「要訓練多少東西」,但沒有解決「原書要放在哪裡」。訓練的時候,那本一千頁的原書仍然要整本攤開在顯示卡的記憶體(VRAM)裡。

QLoRA 多做一步:先把原書用較粗糙但省位的方式影印一次——這就是量化,把每個參數由 16 位元壓到 4 位元——再在縮細版上鋪描圖紙。原書佔的位置少了大約四分之三,一張消費級顯示卡就放得下。

量化本身是下一課的主題,這裡只需要記住一件事:QLoRA = 量化過的原書 + LoRA 描圖紙。詳細的取捨見 模型量化:由 FP16 壓到 INT8、INT4 換來甚麼

一個課室裡的例子

回到那間中學。他們最後做的事,分四步:

  1. 收集示例。中文科三位教師,由過去兩年的評卷紀錄中揀出 400 份作文與教師原本寫的評語,由科主任逐份覆核,刪走含學生姓名、班別與任何可辨識身份的內容。
  2. 整理格式。每一組資料寫成「輸入是學生作文 + 題目要求,輸出是教師評語」的一對。這一步最花時間,大約佔整個計劃七成工夫。
  3. 訓練。在資訊科技室一台裝有單張消費級顯示卡的機器上跑 QLoRA,一晚跑完。
  4. 對照試用。開學前,同一批新作文分別交給原模型與微調後的模型,由三位教師盲評,看哪一份評語比較像「我們學校會寫的」。

結果值得留意:微調後的模型在語氣與格式上明顯貼近校本習慣,但在判斷內容深淺上沒有明顯進步。這正正符合預期——微調教的是說話的方式,不是專業判斷。

實作長甚麼樣

一個 QLoRA 訓練設定的骨架大致如下。這裡不是叫你照抄執行,而是讓你在跟 IT 同事或供應商開會時看得懂他們在說甚麼:

基礎模型   : 一個 70 億至 80 億參數級別的開源權重模型
載入方式   : 4-bit 量化載入(這就是 QLoRA 的 Q)
LoRA rank  : 8 至 32(描圖紙的厚度,愈厚容量愈大,亦愈易過擬合)
LoRA alpha : 一般設為 rank 的兩倍
套用位置   : 注意力層的投影矩陣
學習率     : 1e-4 至 2e-4 這個量級
訓練輪數   : 2 至 3 輪(資料少時多跑幾輪,但要盯住過擬合)
輸出       : 一個數十至數百 MB 的 adapter 檔案,不是完整模型

硬件期望要說得誠實。VRAM 需求是一個範圍,不是一個數字,它同時取決於模型大小、量化位元數、序列長度(一次餵多長的文字)與批次大小:

  • 三十億參數以下的小模型做 QLoRA:大約 8 GB 至 12 GB VRAM 這個量級,一張中階遊戲顯示卡通常應付得來。
  • 七十至八十億參數:大約 12 GB 至 24 GB,視乎序列長度。這是最多學校落腳的區間。
  • 一百三十億參數以上:一般要 24 GB 起跳,而且要縮短序列長度來換空間。

換句話說,一張 RTX 4090 級別(24 GB)的卡,已經覆蓋了絕大部分學校真正需要的場景。真正的樽頸從來不是顯示卡,而是有沒有人願意花時間整理那 400 份示例

甚麼時候不應該微調

這是本課最重要、也最少人說的一段。以下情況,微調是錯的工具:

  • 想模型知道新事實(今年的校曆、新的獎懲條例、最新課程指引)。用知識庫檢索,見 知識庫與 RAG
  • 只是輸出格式不穩定。先試強制結構化輸出與更嚴謹的提示,見 一課讀懂提示工程
  • 需求每個月都在變。微調是一次性的固化,變得太快的東西不應該固化。
  • 手上沒有經人覆核的示例。垃圾入、垃圾出;沒有乾淨資料的微調,只會把壞習慣訓練得更牢固。

這對你的課堂意味甚麼

  1. 微調不是萬能鑰匙,而是「風格校準器」。當你發現 AI 的內容大致正確、只是「不像我們學校寫的」,那才是微調發揮作用的位置。
  2. 你手上的評卷紀錄是有價值的資產。教師日常在平台上寫的評語與修改,累積起來就是最貼近校本標準的訓練素材;前提是收集時已經去識別化,並經科主任覆核。
  3. 這件事在校內做得到。不需要雲端超級電腦,一台放在伺服器房的機器就夠。對於資料政策要求「不出校網」的學校,這是關鍵。
  4. 要有對照才知道有沒有用。微調前後必須用同一批題目盲測,否則你只是在感覺上覺得好了。評估方法見 自動化評估與排行榜

在 Edor.ai 裡是怎樣運作的

Edor.ai 提供雲端與校內兩種部署,功能相同。選擇校內部署的學校,可以在自己的伺服器上進行 LoRA 與 QLoRA 微調——這不是理論上的可能性,而是部署方案本來就支援的能力:單張消費級顯示卡(RTX 4090 級別)已足以微調中小型開源權重模型,不需要學校添置超級電腦或整櫃 GPU。訓練資料、adapter 檔案與推論全程留在校園網絡內。

配套上有三點值得留意。第一,平台的教師工具與評卷紀錄可一鍵匯出成 JSON / CSV,這是整理訓練集最省力的起點,而資料本來就屬於學校。第二,微調完成後的模型透過本地 Ollama 供應商接入平台,教師介面完全不變。第三,我們的預設建議仍然是先用校本知識庫:對八成學校而言,RAG 已經解決問題,微調是留給語氣要求特別嚴格的科組。

部署方式的整體比較,見 本地部署 vs 雲端部署:學校該怎樣選?

小結

LoRA 把「重印整本書」變成「加一張描圖紙」,QLoRA 再把原書壓細,兩者合起來把微調由資料中心的工作,搬進了學校的伺服器房。但技術門檻降低之後,真正的門檻就浮現出來:你有沒有一批乾淨、經覆核、代表校本標準的示例。

下一課我們拆解 QLoRA 裡那個「Q」:模型量化:由 FP16 壓到 INT8、INT4 換來甚麼。上一課關於開發框架的內容,見 LangChain 與 LlamaIndex

本課重點

  • 全參數微調等於把整本教科書重印一次,LoRA 只是在原書上加一層描圖紙,寫上修改,原書半個字都不改。
  • QLoRA 先把「原書」壓細(4-bit 量化)再加描圖紙,所以一張消費級顯示卡就足以微調中小型模型。
  • 微調教的是語氣、格式與判斷習慣,不是新事實;要模型知道新資料,應該用知識庫檢索而不是微調。
  • Edor.ai 的校內部署可以在學校自己的伺服器上做 LoRA / QLoRA,不需要超級電腦,但需要一批整理過的校本示例。

常見問題

不會。微調改變的是「怎樣說」而不是「知道甚麼」。校本資料(課程綱要、通告格式、學生名冊)應該放進知識庫讓模型檢索,詳見第 15 課。把事實硬塞進微調,反而會令模型更自信地講錯。

視乎目標。要模型穩定跟從一種評語格式,幾百組高質素示例通常已經看得出分別;要覆蓋整個科組的評分習慣,則要上千組。質素遠比數量重要,一百組經科主任覆核的示例,勝過一千組隨手匯出的紀錄。

有可能。過度微調會令模型只懂做那一件事,其他能力退步,這叫災難性遺忘。實務做法是保留一份未微調的模型作對照,並用固定的小型評估題目集比較兩者,詳見第 27 課。

資料來源、信任標籤與免責聲明
  • · 本文所有價格、功能與規格以上列官方文檔為準;供應商可隨時調整,請於採購前自行覆核。
  • · 文中提及的產品名稱與商標均屬其各自擁有者所有。Edor.ai 與該等公司並無合作、代理或贊助關係。
  • · 本文為教育用途的獨立整理與評測,不構成任何採購建議或法律意見。
  • · 涉及學生個人資料的應用,請按學校政策及《個人資料(私隱)條例》(PDPO)自行評估後才使用。
訂閱教育 AI 通訊

每月一封:給香港學校的 AI 教學實戰文章、平台更新與撥款資訊。隨時可取消。

我們只會用此電郵寄送通訊,不會分享給第三方。