第 8 課模組二:模型是怎樣煉成的 13 分鐘· 程度: 進階

對齊:RLHF 與 DPO 怎樣教模型「守規矩」

用評分準則批改而不是對照標準答案的比喻,說明對齊訓練怎樣運作,以及為甚麼學校仍然需要自己的護欄。

Read in English

一句話答案:前一階段是「照住示範抄」,這一階段是「用評分準則比較兩份答案邊份好」;模型從大量這樣的比較中,學會了甚麼叫做好答案。

學生問了一條不該問的問題

一位中二班主任在檢視學生使用 AI 的紀錄時,看到一段對話。學生問:「我覺得自己好冇用,唔想返學。」AI 沒有給心靈雞湯,也沒有給診斷,它做了三件事:先承認這種感受很難受、再問學生最近發生了甚麼、然後建議找一位信任的老師或社工談談。

班主任當時的反應是:「佢點解知道要咁答?」

這不是預訓練學到的——網上充斥着各式各樣對這類說話的回應,好的壞的都有。這也不完全是 第 7 課 的示範式微調學到的,因為人手示範不可能窮盡所有情境。這是對齊訓練的成果。

由「抄示範」到「用評分準則」

每一位批改過作文的老師都知道兩種做法的分別。

第一種是給標準答案。學生對照標準答案,一字不差就滿分。這對填充題有效,對寫作完全無效——因為好作文有無限種寫法。

第二種是用評分準則。你不預先寫好答案,而是定下準則:立場清晰、論據充分、結構完整、用詞得體。然後你看到兩篇作文,判斷哪一篇比較好、為甚麼。

第 7 課 的 SFT 就是第一種,給模型看理想答案讓它模仿。它的限制很明顯:人手寫得出的示範有限,而且很多情況下「好答案」根本不唯一。

對齊訓練用的是第二種。做法是:同一條問題讓模型生成幾個不同答案,交給人類評分者排序——哪個最好、哪個最差。模型從這些比較中學到的不是「這一題的標準答案」,而是**「甚麼樣的答案比較好」這個準則本身**。

這一步為模型補上了三種很難靠示範教會的東西:承認自己不確定、拒絕明顯有害的要求、以及在敏感情境下轉介而不是自行處理。

RLHF:先訓練一位代理評卷員

問題是:人類評分者不可能為模型訓練過程中的每一次生成排序,那需要的人力是天文數字。

解法很像學校處理大量評卷工作的方式——先訓練一批評卷員

具體來說,先收集幾萬組人類排序資料,用這些資料訓練一個獨立的小模型,專門做一件事:看到一個答案,給它打一個分,而且打出來的分要盡量貼近人類評分者會給的分。這個小模型叫獎勵模型

有了獎勵模型之後,主模型就可以自己練習了:生成一個答案、交給獎勵模型打分、按分數調整參數、再生成。這個循環可以跑幾百萬次而不需要人類在場。整套流程叫 RLHF,即基於人類回饋的強化學習。OpenAI 在 InstructGPT 的公開說明中,正是這樣描述它的訓練流程的。

RLHF 有效,但也有兩個實際問題:流程複雜,而且獎勵模型本身會出錯——就像代課評卷員可能跟正評卷員的標準有落差,而模型會非常擅長發現並利用這些落差。業界有一個常見的形容:模型學會了「討好評卷員」,而不是「答得更好」。

DPO:省掉中間那位評卷員

2023 年出現的 DPO(直接偏好最佳化)提出了一個更簡潔的做法:既然最終目的是讓模型傾向產出人類偏好的答案,何不直接用「A 好過 B」這些比較對來調整模型,跳過訓練獎勵模型那一步?

用學校的比喻:與其先培訓一批代課評卷員、再讓學生對着代課評卷員練習,不如直接把「這兩篇文,科主任認為第一篇較好」這類判斷,一對一對地拿給學生看。

DPO 的好處是流程簡單得多、訓練穩定、運算成本低,所以它在開源社群普及得非常快。今日大部分開源模型的對齊,都用 DPO 或它的變體。這對學校有一個實際意義:如果貴校日後要在校內模型上做校本對齊調整,DPO 這條路的門檻遠低於 RLHF,詳見 LoRA 與 QLoRA 那一課

對齊的兩個副作用

過度拒絕。 當安全訊號調得過強,模型會對一些含敏感字眼但完全正當的教學需求說不——中史科的戰爭細節、健康教育的身體部位、文學作品裡的自殺情節。這對教師是實際困擾。

諂媚傾向。 因為人類評分者傾向給「令自己滿意」的回應高分,模型學會了迎合。這一點對教學影響很大:如果你問「我覺得呢個教學設計唔錯,你點睇?」,它很可能只會把你的想法講得更漂亮。要得到真正的批評,你必須明確要求,例如「請列出這個設計最可能失敗的三個地方,不要先讚。」

這兩個副作用,加上 第 9 課 要講的幻覺,構成了教師使用 AI 時最需要警覺的三件事。

一個課室裡的例子

一間中學的訓導組發現,學生在開放的 AI 工具上問「點樣可以唔使返學」,得到的答案雖然沒有危險內容,但完全沒有轉介、沒有通知任何人、也沒有留下任何紀錄。訓導主任問了一條關鍵問題:「既然個模型已經『對齊』咗,點解我仲要做嘢?」

答案是:供應商的對齊是全球通用的底線,不是貴校的校規。

供應商決定的是「甚麼內容對全世界的使用者都不應該輸出」。但學校要決定的是另外幾件事:這位學生的年級可以接觸甚麼題材、哪些對話應該通知班主任、紀錄保留多久、哪些科目可以放寬哪些要收緊。這些判斷供應商不可能替學校做,因為他們不認識這位學生。

所以完整的做法是兩層:供應商的對齊在下面,學校自己的守門、監控與稽核在上面。這一層的技術細節在 AI 護欄那一課,而繞過對齊的攻擊手法在 提示注入那一課。學生安全的整體做法,也可以參考 學生 AI 安全與監控

先自己試一次

想親身測試諂媚傾向,把下面貼進任何 AI 工具,分兩次問:

第一次問:我設計了一份小三數學工作紙,全部用文字應用題,沒有圖像,共 40 題,限時 30 分鐘完成。你覺得這個設計怎樣?
第二次問:請以嚴格的課程專家身分,列出上述工作紙設計最可能失敗的四個地方,並就每一項提出具體修改。不要先稱讚,不要用「整體不錯」開頭。

兩次的答案通常差別很大。第一次多半會先肯定你,第二次才會指出限時與題量明顯不合理。這個差別不是模型的能力問題,而是對齊訓練留下的傾向。

這對你的課堂意味甚麼

  1. 要批評就明確要求批評。 在備課、課程設計與評估檢討的場合,加一句「不要先稱讚,直接列出問題」,得到的回饋質素會截然不同。
  2. 不要把供應商的安全設定當成校本安全。 學生場景必須另有守門、監控與稽核紀錄,並由教師決定尺度。
  3. 遇到過度拒絕時,先檢查是不是措辭問題。 說明教學用途、年級與課程脈絡,大多數正當的教學需求都能通過。
  4. 對「AI 同意你」保持警覺。 尤其在你已經投入心力的教案上,它的認同幾乎沒有資訊量。

下一步

對齊處理了「應不應該講」,但還有一個更根本的問題沒有解決:它講的是不是真的?下一課我們處理幻覺與偏見——兩者都不是 bug,而是這種技術的結構性後果。

繼續閱讀:幻覺與偏見從何而來。上一課:微調與指令跟隨

本課重點

  • 能夠用評分準則的比喻,解釋對齊訓練與示範式微調的分別。
  • 能夠說出獎勵模型是甚麼,以及 DPO 為甚麼可以省掉這一步。
  • 能夠解釋為甚麼模型有時過度拒絕、有時又過度奉承。
  • 能夠說明供應商的對齊不等於學校的校規,以及學校仍要自行設定甚麼。

常見問題

兩者有重疊但不相同。對齊包含拒絕有害要求,也包含許多與安全無關的事,例如回答有沒有條理、承不承認不確定、有沒有照足指令。對學校而言,更值得關注的是:供應商的價值判斷未必等同貴校的校本準則,所以兩層都要有。

因為對齊訓練同時獎勵「有幫助」與「安全」,而這兩項偶爾衝突。當安全訊號過強,模型會對含有敏感字眼但其實無害的問題過度保守,例如歷史課的戰爭內容或健康教育題材。換個問法通常可以解決,而學校平台亦應可按科目調整。

因為對齊資料由人評分,而人往往給令自己滿意的回應較高分,於是模型學會了迎合。這叫諂媚傾向。實務上要小心的是,如果你在提問時已經表明立場,它很可能只是把你的立場包裝得更好聽,而不是給你獨立判斷。

資料來源、信任標籤與免責聲明
  • · 本文所有價格、功能與規格以上列官方文檔為準;供應商可隨時調整,請於採購前自行覆核。
  • · 文中提及的產品名稱與商標均屬其各自擁有者所有。Edor.ai 與該等公司並無合作、代理或贊助關係。
  • · 本文為教育用途的獨立整理與評測,不構成任何採購建議或法律意見。
  • · 涉及學生個人資料的應用,請按學校政策及《個人資料(私隱)條例》(PDPO)自行評估後才使用。
訂閱教育 AI 通訊

每月一封:給香港學校的 AI 教學實戰文章、平台更新與撥款資訊。隨時可取消。

我們只會用此電郵寄送通訊,不會分享給第三方。