參數的意義:百億到萬億參數究竟代表甚麼
用腦細胞數量的比喻說明參數是甚麼、它儲存的是關係而不是條目,以及為甚麼不應把參數量當作採購指標。
Read in English一句話答案:參數的數量大致等於「腦細胞數量」——它決定模型能夠記住幾多種規律,但它記的是規律與習慣,不是一條條可以查閱的資料。
校長在會議上問了一條數字題
一間中學的資訊科技委員會在討論 AI 採購,校長看着廠商簡報上的「萬億參數」問了一條很直接的問題:「另一間公司話佢哋係七千億,咁係咪差咗三成?我哋係咪應該揀多嗰個?」
這是一條完全合理的問題,而答案是:這個比較方式幾乎沒有意義,就好像用「有幾多個腦細胞」來比較兩位老師誰教得好。腦細胞數量當然重要——太少一定不行——但它不會告訴你這位老師有沒有受過訓練、熟不熟悉課程、懂不懂得跟學生溝通。
腦細胞:一個好用的比喻,以及它的邊界
把參數想成腦細胞之間的連接強度。一個成年人的腦有大量神經連接,每一個連接的強弱決定了你的習慣、直覺與技能。你不會在腦裡找到一個「儲存了中三課程大綱的細胞」,你的知識是分散在無數連接的強弱之中。
模型的參數就是這樣的東西:一大堆數字,每一個都很小、單獨看毫無意義,但合起來決定了「見到這些字,下一個字最可能是甚麼」。訓練的過程,就是把這些數字反覆微調到能夠準確預測為止。
所以「一百億參數」的意思是:這個模型有一百億個這樣的旋鈕。旋鈕愈多,能夠容納的規律愈細緻;但旋鈕的數值好不好,取決於用甚麼資料、怎樣訓練——這是 第 6 課 的題目。
參數儲存的是甚麼:經驗,而不是書櫃
這是整課最重要的一點。
一位教了二十年中文的老師,腦裡儲存的不是一本一本教科書的副本。她儲存的是經驗:哪種文章開頭學生容易寫得好、哪個字學生最常寫錯、哪一類題目要先鋪墊。你問她「《岳陽樓記》第三段第二句是甚麼」,她可能答不出,但她不用翻書就知道整篇的結構與情感轉折。
模型也是這樣。它在訓練中見過大量文字,但它不是把文字存起來,而是把文字裡的規律壓縮進參數。所以:
- 它知道「議論文的結構通常是甚麼」——規律學得很好。
- 它知道「香港的中學一般有中一至中六」——足夠常見的事實,也變成了規律。
- 它記不準「貴校 2018 年校外評核報告的第三項建議」——這件事在訓練資料裡出現過零次或一次,壓縮不進去。
而當你問第三類問題時,它不會說「我冇見過」,它會用第一類和第二類的規律砌一個看起來合理的答案出來。這就是幻覺的機制來源,第 9 課 會完整處理。
換句話說:參數不是資料庫,不要當資料庫用。 學校自己的資料應該放在可檢索、可引用的知識庫裡,而不是期望它在參數中。
一個課室裡的例子
一間小學的 IT 主任想在校內伺服器上跑一個模型,讓教師在不連外網的情況下起草通告。他有兩個選擇:一個七十億參數的模型,可以在學校現有那部有獨立顯示卡的電腦上運行;或者一個七百億參數的模型,需要另外購置約十萬元的設備。
他先做了一件很聰明的事:拿二十份過去一年真正寫過的通告,用兩個模型分別生成,再請三位科主任盲評。
結果是,七十億的版本在「通告格式」與「語氣」上表現接近,主要差別在兩處:長段落的邏輯偶爾鬆散,以及遇到較冷門的教育局政策名稱時錯得較多。而後者這一項,在兩個模型加上校本文件檢索之後,差距幾乎消失。
他的結論是先用小模型加知識庫,把省下的預算放在教師培訓上。這是一個很典型、也很正確的校本決定:對大部分學校任務而言,把正確的資料放到模型面前,比換一個大三倍的模型更有效。 這個判斷在 小型語言模型那一課 與 本地部署那一課 會有更多實作細節。
看懂那些數字標示
你在模型名稱裡會見到幾種標示,認得就夠:
- 7B、13B、70B:B 是十億。7B 即七十億參數,屬於「一張顯示卡跑得動」的級別;70B 需要工作站或多卡。
- MoE(混合專家):總參數可能有幾千億,但每次回答只啟動其中一小部分,好比一間有六十位老師的學校,每條問題只找相關那兩位科任來答。所以它的「總參數」與「實際每次用的參數」是兩個不同的數字,宣傳時通常講前者。
- 未公開參數量:大部分閉源旗艦模型(包括各主要供應商的最新型號)根本不公佈參數量。所以如果有人拿一個閉源模型的「參數量」來比較,那個數字很可能是外界估算。
參數量還直接關係到硬件需求,而 量化那一課 會講怎樣把同一個模型壓到更小的記憶體裡運行。
先自己試一次
想親身感受「參數儲存的是規律不是條目」,把下面貼進任何 AI 工具:
請憑記憶完整寫出香港中學文憑試中國語文科的評分準則全文,不要概括、不要改寫。
如果你做不到,請改為說明你實際上記得的是哪一類東西,以及你記不住哪一類東西,並各舉一個例子。
模型通常會坦白它記得的是「一般結構與常見準則」而不是條文原文。這個自述剛好說明了參數的性質。
這對你的課堂意味甚麼
- 不要用參數量做採購準則。 要問的是:支援繁體中文與香港用語嗎?可以把資料留在校內嗎?有沒有教師監控與稽核?這三條問題比任何參數數字都重要。
- 凡是校本事實,一律餵文件。 課程進度、校規、評分準則、通告範本,全部應該放進知識庫讓 AI 引用,而不是靠它「記得」。
- 小模型加好資料,往往勝過大模型加空提示。 尤其在校內部署的場景,這個取捨可以省下六位數的硬件預算。
- 向家長與同事解釋時,用腦細胞比喻。 它足夠準確,而且自然帶出下一句:「所以它記得規律,但記不準你學校的細節。」這一句可以省掉很多誤會。
下一步
參數是一大堆數字,但這些數字具體排成甚麼形狀、在做甚麼工作?下一課我們拆開三個最關鍵的零件:把字變成座標的 embedding、記住次序的位置編碼,以及決定「看哪裡」的 self-attention。
本課重點
- 能夠用腦細胞的比喻,向同事解釋參數是甚麼以及它為甚麼不是資料庫。
- 能夠解釋為甚麼模型「記得」很多事,卻記不準任何一件具體的事。
- 能夠看懂 7B、70B、MoE 這些標示,並判斷哪一種跑得動校內那部電腦。
- 能夠在採購會議上指出,參數量不應該是選型的首要準則。
常見問題
不是。參數量只是容量上限,訓練資料質素、訓練方法與對齊做得好不好同樣關鍵。一個訓練精良的中型模型,在教育寫作與中文回饋這類任務上往往贏過訓練馬虎的大模型,而且便宜很多、快很多。
B 是 billion,即十億。7B 就是七十億個參數。粗略的硬件對照是,7B 模型量化之後可以在一張有 8GB 顯示記憶體的顯示卡上運行,70B 則需要工作站級的配置。第 22 課會講量化怎樣把這個門檻降下來。
你透過對話貼進去的內容不會改變參數,參數只在訓練或微調時才改變。不過對話內容是否被供應商保留或用於改善服務,屬於合約與部署方式的問題。要完全確定資料不外流,最穩妥的做法是把模型放在校內網絡運行。