第 4 課模組一:模型內部是怎樣運作 11 分鐘· 程度: 入門

參數的意義:百億到萬億參數究竟代表甚麼

用腦細胞數量的比喻說明參數是甚麼、它儲存的是關係而不是條目,以及為甚麼不應把參數量當作採購指標。

Read in English

一句話答案:參數的數量大致等於「腦細胞數量」——它決定模型能夠記住幾多種規律,但它記的是規律與習慣,不是一條條可以查閱的資料。

校長在會議上問了一條數字題

一間中學的資訊科技委員會在討論 AI 採購,校長看着廠商簡報上的「萬億參數」問了一條很直接的問題:「另一間公司話佢哋係七千億,咁係咪差咗三成?我哋係咪應該揀多嗰個?」

這是一條完全合理的問題,而答案是:這個比較方式幾乎沒有意義,就好像用「有幾多個腦細胞」來比較兩位老師誰教得好。腦細胞數量當然重要——太少一定不行——但它不會告訴你這位老師有沒有受過訓練、熟不熟悉課程、懂不懂得跟學生溝通。

腦細胞:一個好用的比喻,以及它的邊界

把參數想成腦細胞之間的連接強度。一個成年人的腦有大量神經連接,每一個連接的強弱決定了你的習慣、直覺與技能。你不會在腦裡找到一個「儲存了中三課程大綱的細胞」,你的知識是分散在無數連接的強弱之中。

模型的參數就是這樣的東西:一大堆數字,每一個都很小、單獨看毫無意義,但合起來決定了「見到這些字,下一個字最可能是甚麼」。訓練的過程,就是把這些數字反覆微調到能夠準確預測為止。

所以「一百億參數」的意思是:這個模型有一百億個這樣的旋鈕。旋鈕愈多,能夠容納的規律愈細緻;但旋鈕的數值好不好,取決於用甚麼資料、怎樣訓練——這是 第 6 課 的題目。

參數儲存的是甚麼:經驗,而不是書櫃

這是整課最重要的一點。

一位教了二十年中文的老師,腦裡儲存的不是一本一本教科書的副本。她儲存的是經驗:哪種文章開頭學生容易寫得好、哪個字學生最常寫錯、哪一類題目要先鋪墊。你問她「《岳陽樓記》第三段第二句是甚麼」,她可能答不出,但她不用翻書就知道整篇的結構與情感轉折。

模型也是這樣。它在訓練中見過大量文字,但它不是把文字存起來,而是把文字裡的規律壓縮進參數。所以:

  • 它知道「議論文的結構通常是甚麼」——規律學得很好。
  • 它知道「香港的中學一般有中一至中六」——足夠常見的事實,也變成了規律。
  • 記不準「貴校 2018 年校外評核報告的第三項建議」——這件事在訓練資料裡出現過零次或一次,壓縮不進去。

而當你問第三類問題時,它不會說「我冇見過」,它會用第一類和第二類的規律砌一個看起來合理的答案出來。這就是幻覺的機制來源,第 9 課 會完整處理。

換句話說:參數不是資料庫,不要當資料庫用。 學校自己的資料應該放在可檢索、可引用的知識庫裡,而不是期望它在參數中。

一個課室裡的例子

一間小學的 IT 主任想在校內伺服器上跑一個模型,讓教師在不連外網的情況下起草通告。他有兩個選擇:一個七十億參數的模型,可以在學校現有那部有獨立顯示卡的電腦上運行;或者一個七百億參數的模型,需要另外購置約十萬元的設備。

他先做了一件很聰明的事:拿二十份過去一年真正寫過的通告,用兩個模型分別生成,再請三位科主任盲評。

結果是,七十億的版本在「通告格式」與「語氣」上表現接近,主要差別在兩處:長段落的邏輯偶爾鬆散,以及遇到較冷門的教育局政策名稱時錯得較多。而後者這一項,在兩個模型加上校本文件檢索之後,差距幾乎消失。

他的結論是先用小模型加知識庫,把省下的預算放在教師培訓上。這是一個很典型、也很正確的校本決定:對大部分學校任務而言,把正確的資料放到模型面前,比換一個大三倍的模型更有效。 這個判斷在 小型語言模型那一課本地部署那一課 會有更多實作細節。

看懂那些數字標示

你在模型名稱裡會見到幾種標示,認得就夠:

  • 7B、13B、70B:B 是十億。7B 即七十億參數,屬於「一張顯示卡跑得動」的級別;70B 需要工作站或多卡。
  • MoE(混合專家):總參數可能有幾千億,但每次回答只啟動其中一小部分,好比一間有六十位老師的學校,每條問題只找相關那兩位科任來答。所以它的「總參數」與「實際每次用的參數」是兩個不同的數字,宣傳時通常講前者。
  • 未公開參數量:大部分閉源旗艦模型(包括各主要供應商的最新型號)根本不公佈參數量。所以如果有人拿一個閉源模型的「參數量」來比較,那個數字很可能是外界估算。

參數量還直接關係到硬件需求,而 量化那一課 會講怎樣把同一個模型壓到更小的記憶體裡運行。

先自己試一次

想親身感受「參數儲存的是規律不是條目」,把下面貼進任何 AI 工具:

請憑記憶完整寫出香港中學文憑試中國語文科的評分準則全文,不要概括、不要改寫。
如果你做不到,請改為說明你實際上記得的是哪一類東西,以及你記不住哪一類東西,並各舉一個例子。

模型通常會坦白它記得的是「一般結構與常見準則」而不是條文原文。這個自述剛好說明了參數的性質。

這對你的課堂意味甚麼

  1. 不要用參數量做採購準則。 要問的是:支援繁體中文與香港用語嗎?可以把資料留在校內嗎?有沒有教師監控與稽核?這三條問題比任何參數數字都重要。
  2. 凡是校本事實,一律餵文件。 課程進度、校規、評分準則、通告範本,全部應該放進知識庫讓 AI 引用,而不是靠它「記得」。
  3. 小模型加好資料,往往勝過大模型加空提示。 尤其在校內部署的場景,這個取捨可以省下六位數的硬件預算。
  4. 向家長與同事解釋時,用腦細胞比喻。 它足夠準確,而且自然帶出下一句:「所以它記得規律,但記不準你學校的細節。」這一句可以省掉很多誤會。

下一步

參數是一大堆數字,但這些數字具體排成甚麼形狀、在做甚麼工作?下一課我們拆開三個最關鍵的零件:把字變成座標的 embedding、記住次序的位置編碼,以及決定「看哪裡」的 self-attention。

繼續閱讀:Embedding、位置編碼與 Self-Attention。上一課:Tokenization 與中文成本

本課重點

  • 能夠用腦細胞的比喻,向同事解釋參數是甚麼以及它為甚麼不是資料庫。
  • 能夠解釋為甚麼模型「記得」很多事,卻記不準任何一件具體的事。
  • 能夠看懂 7B、70B、MoE 這些標示,並判斷哪一種跑得動校內那部電腦。
  • 能夠在採購會議上指出,參數量不應該是選型的首要準則。

常見問題

不是。參數量只是容量上限,訓練資料質素、訓練方法與對齊做得好不好同樣關鍵。一個訓練精良的中型模型,在教育寫作與中文回饋這類任務上往往贏過訓練馬虎的大模型,而且便宜很多、快很多。

B 是 billion,即十億。7B 就是七十億個參數。粗略的硬件對照是,7B 模型量化之後可以在一張有 8GB 顯示記憶體的顯示卡上運行,70B 則需要工作站級的配置。第 22 課會講量化怎樣把這個門檻降下來。

你透過對話貼進去的內容不會改變參數,參數只在訓練或微調時才改變。不過對話內容是否被供應商保留或用於改善服務,屬於合約與部署方式的問題。要完全確定資料不外流,最穩妥的做法是把模型放在校內網絡運行。

訂閱教育 AI 通訊

每月一封:給香港學校的 AI 教學實戰文章、平台更新與撥款資訊。隨時可取消。

我們只會用此電郵寄送通訊,不會分享給第三方。