第 13 課模組三:生態系與模型取得 11 分鐘· 程度: 進階

小型語言模型的崛起:Phi、Gemma 與 8B 級模型

學校不一定需要最大的模型。本課用「校內全科老師與大學教授」的比喻解釋為甚麼幾十億參數的小模型已足以應付大部分校務工作,以及甚麼場合仍然要動用旗艦模型。

Read in English

在一次教師工作坊上,有位老師問了一條很直接的問題:「既然最強的模型也就是每月幾百元,為甚麼還要研究那些小模型?我們不是應該用最好的嗎?」

反問一句就清楚了:你會為了改一份小三默書卷,而請一位大學教授來嗎?

校內全科老師與大學教授

一位經驗豐富的小學全科老師,對課程、學生程度、家長溝通與校內流程都熟悉。她不會發表國際期刊論文,但學校九成日常工作她做得又快又準,而且她就在校內,你隨時找得到她。

一位大學教授在專門領域深不可測,能處理最艱深的問題。但你要預約、要付費、而且他不熟悉你校的做事方式。

大模型與小模型的關係就是這樣。問題從來不是「哪個更聰明」,而是「這件事需要多聰明」。

小模型不是縮水版

一個常見誤解是以為小模型只是把大模型砍掉幾層。實際上近年小模型變強的主因是訓練材料的質素

以微軟的 Phi 系列為例,它的設計理念是用大量精心篩選與合成的「教科書式」材料訓練,而不是照抄整個網絡。結果是一個 14B 參數的模型,在數學與推理測試上追近甚至超越體積大幾倍的對手。用教育的語言說:這是「用好教材教出來的學生」,而不是「讀得多但雜」的學生。

Google 的 Gemma 系列走另一條路線:把旗艦 Gemini 的研究成果做成可下載的公開權重模型,並且刻意做得能在一般硬件上運行。近期版本已支援文字、影像與語音輸入,並涵蓋一百四十多種語言與長上下文。

至於 Meta、Alibaba Qwen 與 Mistral 的 7B 至 9B 級模型,則是目前學校本地部署最常見的一批,因為中文支援與社群資源都相對成熟。各家現行陣容見 AI 模型資料庫

要留意一點:每個模型的 Model Card 都會寫明語言支援。例如 Phi 系列的 Model Card 明確表示主力英文、不以多語言為設計目標,這對中文校本應用就是重要警示。讀法見 看懂 Model Card、GGUF 與 Safetensors

甚麼任務用小模型就夠

按我們在學校實地觀察,以下任務用 8B 級模型幾乎感覺不到差距:

  • 把一段會議錄音的文字稿整理成議決要點;
  • 把教師寫的一段說明,轉成工作紙表格格式;
  • 把同一段閱讀理解材料,改寫成小四、小五、小六三個難度版本;
  • 把一百條學生問卷開放式答案分類;
  • 檢查一份通告有沒有漏了日期、地點與回覆期限;
  • 為一份英文文章列出詞彙表並標註難度。

共通點是:這些任務的答案主要來自你提供的材料,不是來自模型的記憶。

甚麼時候仍然需要旗艦模型

  • 需要多步推理的題目,例如中五數學證明、物理應用題的完整解法;
  • 需要在一份長文件內找出前後矛盾之處;
  • 語氣要求極高的對外文書,例如處理投訴的家長信;
  • 需要同時處理影像與文字的複雜判斷。

這類任務的關鍵不是知識量,而是推理深度,詳見 多模態、推論型模型與具身智能

一個課室裡的例子

一所中學的通識與生涯規劃組要處理一份問卷:全校九百名學生,每人回答三條開放式問題,合共約二千七百段文字。要人手分類,一位老師要花整個星期。

他們的做法是分兩層。第一層用校內伺服器上運行的 8B 模型,把每段答案歸入「升學」、「就業」、「情緒支援」、「課外活動」、「其他」五類,並抽出關鍵字。這一步處理了全部二千七百段,學生的原文一秒都沒有離開校網。

第二層才把去識別化後的統計摘要,交給雲端旗艦模型撰寫一份給校方管理層的分析報告,因為那份報告需要細緻的語氣與跨項目的推論。

結果是:一位老師用兩節課完成原本一星期的工作,而最敏感的原始文字始終留在校內。這種「小模型做量、大模型做質」的分工,是目前最務實的校本設計。

這對你的課堂意味甚麼

  1. 不要用價錢判斷能力需求。 先問「這件事的答案在我提供的材料裡嗎」。如果是,小模型通常就夠。
  2. 敏感資料的處理應該優先考慮校內模型。 學生作文、輔導紀錄、SEN 相關資料,能在校內處理就在校內處理。
  3. 小模型的事實錯誤要用知識庫補,不要用微調補。 很多學校誤以為要「訓練 AI 認識我們學校」,其實正確做法是檢索,見 校本知識庫與檢索增強生成
  4. 速度本身就是教學價值。 課堂上要即時生成三個難度版本的例句,小模型在本地跑通常比雲端旗艦更快,而課堂等不起十秒。

一個可以立即試的小練習

拿任何一個小模型與一個旗艦模型,同時試這一段提示。你會發現兩者表現接近,因為答案全在材料裡:

以下是五位學生對「你最想學校增加甚麼課外活動」的回答。請把它們分成不多於三類,為每類取一個名稱,並列出屬於該類的答案編號。
只可以根據我提供的答案分類,不要補充你自己的想法,也不要評價學生。
1. 想有攝影學會,因為我喜歡拍照。
2. 希望多些球類比賽。
3. 想學煮飯。
4. 想有羽毛球隊。
5. 想學剪片。

然後把提示換成「請根據香港現行高中課程,分析增加這些活動對其他學習經歷的影響」——這一次差距會立刻出現。這就是「需要多聰明」的分界線。

接下來

模組三到這裡結束。下一個模組進入應用開發的核心概念,由最基本、也最常被低估的一項開始:一課讀懂 Prompt 工程。想回顧模型檔案格式,回到 看懂 Model Card、GGUF 與 Safetensors;想了解為甚麼小模型微調成本低,見 LoRA 與 QLoRA

本課重點

  • 小模型不是縮水的大模型,而是用精選教材訓練出來的專才,在指定任務上可以追近大模型
  • 學校八成的日常任務(整理、分類、改寫、格式轉換)其實不需要旗艦模型
  • 小模型的真正價值是可以在校內一台機器上運行,讓資料不離開校網,並且回應更快
  • 小模型的弱點是冷知識與複雜多步推理,所以校本應用要靠知識庫補上事實,而不是靠模型記憶

常見問題

分任務。整理會議紀錄、把文字轉成表格、把一段中文改寫成三個難度版本,幾乎感覺不到差距。要求它推導一道中五數學證明題、分析一份長篇政策文件的矛盾之處,或寫一封語氣微妙的家長信,差距就很明顯。實務做法是簡單任務用小模型、難題升級到旗艦。

是,因為參數少代表能記住的東西少,尤其是冷門與本地化的知識。但這個弱點有明確解法:不要靠模型記憶,改為讓它每次回答前先檢索學校自己的文件。這就是 [校本知識庫與檢索增強生成](/learn/llm/knowledge-base-and-rag) 要處理的事。

一張 12GB 至 16GB 顯示卡記憶體的消費級顯示卡,配一台普通伺服器,已足以運行 8B 級模型的量化版本並同時服務數十位教師。具體選型與安裝步驟見 [用 Ollama 與 LM Studio 做本地部署](/learn/llm/ollama-and-lm-studio-local-deployment)。

資料來源、信任標籤與免責聲明
  • · 本文所有價格、功能與規格以上列官方文檔為準;供應商可隨時調整,請於採購前自行覆核。
  • · 文中提及的產品名稱與商標均屬其各自擁有者所有。Edor.ai 與該等公司並無合作、代理或贊助關係。
  • · 本文為教育用途的獨立整理與評測,不構成任何採購建議或法律意見。
  • · 涉及學生個人資料的應用,請按學校政策及《個人資料(私隱)條例》(PDPO)自行評估後才使用。
訂閱教育 AI 通訊

每月一封:給香港學校的 AI 教學實戰文章、平台更新與撥款資訊。隨時可取消。

我們只會用此電郵寄送通訊,不會分享給第三方。