第 11 課模組三:生態系與模型取得 10 分鐘· 程度: 入門

Hugging Face:AI 界的 GitHub,教師也可以逛

一個公開存放 AI 模型的網站,教師即使不寫程式,也可以用它查證一個模型的來源、授權與已知限制。本課用「全球共用的教材櫃」比喻帶你逛一次,並說明學校選模型時真正該看的三件事。

Read in English

在一次資訊科技委員會會議上,一位科主任提出:「我聽說有些學校用『開源模型』,不用把資料交給外國公司。那些模型到底在哪裡拿?我們怎樣知道那個模型是誰做的、可不可信?」

這是一條非常好的問題,而答案通常指向同一個網站。

先想像一個全球共用的教材櫃

假設全世界的教師把自己做的工作紙、教案與評分準則,全部放進一個公開的資源庫。每份教材有一頁說明:誰做的、給哪個級別用、試教過多少次、有甚麼要注意的地方。你可以下載、可以改、可以把改良版再放回去,但要遵守原作者定下的使用條件。

Hugging Face 就是 AI 模型版本的這個資源庫。它是目前全球最主要的公開模型存放與分享平台,超過二百萬個模型公開在上面。工程師常說它是「AI 界的 GitHub」,因為它同時提供版本紀錄、分支、下載與協作功能。

對教師而言,重要的不是它的技術架構,而是這一點:當有人告訴你某個模型很好,你可以自己去看那個模型的說明頁,而不必只聽轉述。

網站上其實有三種東西

初次進去會覺得很亂,因為它同時放着三類內容:

  • 模型(Models):實際的 AI 模型檔案,加上一頁說明文件。這是最主要的部分。
  • 資料集(Datasets):訓練或評估用的資料。對學校來說,這裡最值得看的是「原來模型是用這種資料學的」,有助理解偏見從何而來。
  • 示範應用(Spaces):別人做好的網頁小程式,可以直接在瀏覽器試用某個模型,不需要安裝任何東西。這是教師最容易上手的一區,適合在課堂上示範。

如果你只有十分鐘,建議先逛 Spaces:找一個文字生成或語音辨識的示範,親手試一次,比讀十篇文章有感覺。

教師逛的時候應該看甚麼

打開任何一個模型頁,先看四樣東西,順序如下:

  1. 授權(License)。這是唯一不能忽略的一項。有些模型可自由商用,有些只准研究用途,有些對使用者人數設上限。學校要在課堂使用,甚至讓學生透過學校網站使用,屬於哪一類必須先弄清楚。
  2. 體積。模型頁會顯示參數量,例如 8B(八十億)。這決定學校要買甚麼硬件才跑得動,詳見 小型語言模型的崛起
  3. 有沒有人維護。看最後更新日期與討論區。一個兩年沒更新、沒人回覆問題的模型,不適合放進學校的日常流程。
  4. 說明頁寫得多詳細。這一頁叫 Model Card,是下一課的主題,見 看懂 Model Card、GGUF 與 Safetensors

「開源」在這裡有三種不同意思

教師最常誤解的一點是把「開源」當成單一狀態。實際上至少有三層:

  • 公開權重:你可以下載模型檔案自己運行,但訓練資料與訓練程式不公開。市面上大部分「開源模型」屬於這一類,包括 Meta 與 Alibaba 的主力模型。
  • 附條件開放:可下載,但授權加上限制,例如不得用於某些用途,或超過一定規模的機構需另行申請。
  • 完全開放:權重、資料、程式與訓練紀錄全部公開。數量少,多來自研究機構。

寫撥款申請或校本政策時,建議直接寫明「公開權重模型」而不是「開源模型」,因為前者才是準確的描述。

一個課室裡的例子

一所中學的中文科想試用 AI 協助批改作文,但科主任堅持學生作文不可以離開校網。IT 主任於是做了三件事:

第一,在 Hugging Face 上篩選支援中文、體積在 8B 以下、授權允許機構使用的模型,列出三個候選。

第二,用 Spaces 裡的示範版本,把三篇已去除學生姓名的舊作文貼進去,比較三個模型的回饋質素。這一步完全不需要安裝軟件,一節空堂就做完。

第三,把選中的那個模型頁列印出來,連同授權條款一併交給校長,作為採購建議的附件。校長第一次看到 AI 選型有可查證的文件依據,而不是「供應商說很好」。

三個月後,這個模型透過 Ollama 在校內伺服器運行,學生作文從未離開校網。整個過程的起點,只是有人願意打開那個網站看一看。

這對你的課堂意味甚麼

  1. 你有了查證的能力。 下次供應商或同事提到某個模型名稱,你可以自己去看它的說明頁,判斷描述是否誇大。這對科主任與 IT 主任特別有用。
  2. 示範不用等 IT 部門。 Spaces 讓你在瀏覽器直接試玩,可以在教師專業發展工作坊上即時演示「同一句提示、不同模型、不同答案」。
  3. 授權要寫進校本政策。 如果學校打算長期用某個公開權重模型,把授權條款存檔,並在資訊科技使用政策中註明,這在撥款審核時會被問到。
  4. 不要用學生真實資料試玩。 Spaces 上的示範由第三方運行,你貼進去的內容可能被記錄。試玩請用去識別化或虛構的內容;這條原則在 提示注入與越獄防護 會再談。

一個可以立即試的小練習

在任何 Spaces 示範或 AI 工具貼入以下提示,同一段話分別試兩三個模型,你會很快看出差異:

你是香港小學中文科教師。以下是一位小四學生的日記,請用三句話給回饋:一句讚賞具體做得好的地方、一句指出一個要改的地方、一句給下一步練習的建議。
不要重寫整篇日記,不要用台灣用語,不確定的地方寫「請教師核實」。
[貼上一段去除姓名的示例文字]

同一段輸入、同一段指示,不同模型的語氣與嚴謹度會明顯不同。這種差異不是隨機,而是來自訓練與對齊方式的分別,見 對齊:RLHF 與 DPO

接下來

模型頁上那份說明文件寫了甚麼、檔案名稱後面的 GGUF 與 Safetensors 是甚麼意思,是下一課 看懂 Model Card、GGUF 與 Safetensors 的內容。想先回顧模型內部運作,可回到 Transformer 架構白話版;想比較各大供應商的現行陣容,見 AI 模型資料庫

本課重點

  • Hugging Face 是一個公開存放 AI 模型、資料集與示範應用的平台,像一個全球教師共用的教材櫃
  • 教師不需要下載任何檔案,也可以透過它查證模型由誰做、用甚麼資料訓練、有哪些已知限制
  • 「開源」不等於「可以隨便用」,授權條款才決定學校能否用於課堂或對外服務
  • 學校選模型該看的是授權、體積與有沒有人持續維護,而不是排行榜的名次

常見問題

有,而且是最實際的用法。你可以把它當成查證工具:當供應商說「我們用了某個開源模型」,你可以在網站上找到那個模型的說明頁,看它的授權、訓練資料描述與作者聲明的限制。這是評估校本 AI 方案時少有的、不需要對方提供的獨立資料來源。

權重檔案本身多數可免費下載,但要有人運行它。運行需要伺服器或顯示卡、需要有人維護與更新、需要處理安全守門。對大部分學校來說,總成本並不會比訂閱便宜,分別在於資料是否留在校網內。可讀 [開源與閉源的成本與私隱權衡](/blog/open-source-vs-closed-llm-cost-privacy)。

排行榜衡量的是通用能力,不是「適合小五學生的中文回饋」。而且很多榜單題目已流入訓練資料。評估方法本身是一整課的內容,見 [用 LLM 當評審與各種排行榜](/learn/llm/llm-as-a-judge-mmlu-gpqa-chatbot-arena);實務上更可靠的做法是拿本校真實的十份作業試一次。

資料來源、信任標籤與免責聲明
  • · 本文所有價格、功能與規格以上列官方文檔為準;供應商可隨時調整,請於採購前自行覆核。
  • · 文中提及的產品名稱與商標均屬其各自擁有者所有。Edor.ai 與該等公司並無合作、代理或贊助關係。
  • · 本文為教育用途的獨立整理與評測,不構成任何採購建議或法律意見。
  • · 涉及學生個人資料的應用,請按學校政策及《個人資料(私隱)條例》(PDPO)自行評估後才使用。
訂閱教育 AI 通訊

每月一封:給香港學校的 AI 教學實戰文章、平台更新與撥款資訊。隨時可取消。

我們只會用此電郵寄送通訊,不會分享給第三方。