為甚麼教師需要理解 LLM(而不只是會用)
由教員室的真實疑問開始,說明教師為甚麼需要理解 LLM 的運作,以及本課程七個模組會帶你走過甚麼。
Read in English一句話答案:你不需要懂得維修引擎才可以揸車,但你需要知道儀表板上哪一個燈亮起就要立刻停低。這門課教的,就是 AI 的儀表板。
由一張寫錯了的通告說起
上學期尾,一位訓導主任用 AI 草擬了一封給家長的通告。文句流暢、格式齊整、語氣專業,他幾乎想直接寄出。幸好覆核時發現兩處問題:一是把學校的創校年份寫早了十二年,二是引用了一份根本不存在的教育局指引編號。兩處錯誤都寫得非常肯定,沒有任何「我不確定」的語氣。
這位主任事後問了一條很好的問題:「它明明連標點都用得比我準,點解會喺呢啲地方錯得咁離譜?」
這條問題答得出,就等於掌握了這門課的一半。而答案不是「AI 不夠聰明」,而是「AI 根本不是在做你以為它在做的事」。
懂得用,與懂得判斷
現時大部分教師培訓停留在「懂得用」:教你打甚麼提示、用哪個按鈕、怎樣把輸出貼回 Word。這很有用,但不足夠,因為教師的專業判斷需要的是另一層能力。
想像一位新入職的實習老師。他讀書很多、寫作很好、態度極其熱心,但有三個特點:他從來不肯說「我唔知」;他對你的學校一無所知;他上一次看報紙是幾個月前。如果你知道這三件事,你自然懂得怎樣用他——可以叫他草擬工作紙,但不會叫他自行核實學生資料;可以叫他整理會議紀錄,但一定會自己看一次才發出。
「懂得判斷」就是知道這三個特點從何而來。它們不是缺陷,而是這種技術的運作方式所必然帶來的結果。
一個課室裡的例子
一位中三英文科老師要在兩星期內批改四十份議論文,同時要為科主任準備一份寫作表現分析。她把作文逐份貼進 AI,要求按「內容、語言、組織」三項評分並寫評語。
結果很有啟發性。評語的質素相當不錯,尤其是指出文法問題和段落結構鬆散之處,比她自己在深夜十一點批改時更有耐性。但有三份作文的分數明顯偏高,而這三份的共通點是字數特別多、用詞特別花巧,內容其實空洞。另外,當她要求 AI 統計「全班最常犯的三個文法錯誤」時,AI 給出的百分比看來很精確,但她抽樣核對後發現數字是估出來的。
這位老師最後的做法是:保留 AI 的評語作為初稿、自己調整分數、統計工作改用 Excel。這是一個完全正確的判斷,而她之所以做得出這個判斷,是因為她大致猜到 AI 在做甚麼——它在模仿「好評語應該長成甚麼樣」,而不是在「理解」這篇文章的論證是否站得住。
為甚麼會這樣?對齊那一課會講到,模型被訓練成傾向產出人類評分者喜歡的答案,而人類評分者往往偏好看起來豐富的文字。至於統計數字為甚麼會錯,幻覺那一課會詳細處理。
這門課會帶你走過甚麼
整個課程分七個模組,由模型內部一路講到未來趨勢。
模組一(第 1 至 5 課):模型內部是怎樣運作。 由 Transformer 架構的白話版 開始,再講 Tokenization 與中文為甚麼較貴、參數究竟儲存了甚麼,以及 Embedding、位置編碼與 Self-Attention 三個關鍵零件。
模組二(第 6 至 10 課):模型是怎樣煉成的。 預訓練與資料清洗、微調與指令跟隨、RLHF 與 DPO 對齊、幻覺與偏見的來源,以及 知識截止日與版本管理。
模組三:生態系與模型取得。 Hugging Face 這個 AI 界的 GitHub、Model Card 與模型檔案格式,以及 小型語言模型。
模組四:應用開發核心概念。 提示工程、知識庫與 RAG、Chunking 與重排序、上下文快取與成本控制、AI Agent 與 MCP,以及 開發框架。
模組五:本地部署與高效微調。 LoRA 與 QLoRA、量化、Ollama 與 LM Studio,以及 端側 AI 與私隱。
模組六:安全、評估與核心痛點。 AI 護欄、提示注入防護、私隱、偏見與版權倫理,以及 模型評估與排行榜。
模組七:未來趨勢。 多模態、推論型模型與具身智能。
如果你只有一小時,建議路線是第 1、3、9、10 課,再跳去 知識庫與 RAG。這五課足以應付大部分教員室裡會出現的疑問。
先自己試一次
打開任何一個 AI 工具,把下面這段貼進去,換上你自己學校的名字。你會得到一個非常有用的示範:
請告訴我「(你的學校全名)」的創校年份、現任校長姓名、學校的辦學團體,以及最近一次校外評核的年份。
每一項請在括號內標明你有幾成把握,並清楚說明哪些資料你其實並不確定。
大部分情況下,你會見到兩件事:第一,AI 會答得非常肯定;第二,當中至少有一項是錯的,除非你的學校在網上資料極多。這正是第 9 課要處理的核心問題,也是我們在平台內用校本知識庫來解決的問題。
這對你的課堂意味甚麼
- 凡是會傳出課室的文字,都要覆核。 家長通告、學生評語、對外報告、校友資料——這些場合 AI 可以做初稿,但簽名的是你。把 AI 的輸出當作一位勤力但不熟悉學校的實習老師交來的初稿來處理。
- 凡是涉及校本事實的問題,都要餵資料。 課程進度、評分準則、校規、通告格式,模型一概不知。與其期望它猜中,不如把文件給它——這就是 校本知識庫與 RAG 要解決的事。
- 凡是學生直接使用的場合,都要有守門。 學生不會像你一樣覆核答案。學生場景需要的是有提示層級、有教師監控、有稽核紀錄的環境,而不是一個公開聊天視窗。
- 凡是採購決定,都不要只看參數量與跑分。 第 4 課會講參數量的真正意義,第 27 課會講排行榜的限制。對學校而言,「能否把資料留在校網內」往往比「哪個模型跑分高」更重要。
下一步
下一課我們拆開模型本身,看一句話送進去之後究竟發生甚麼事。不會有數學,只會有一排批改工作紙的老師。
繼續閱讀:Transformer 架構白話版。
如果你想先看看這些技術在一個實際平台內長成甚麼樣子,可以看 平台功能 與 資料安全;如果你正在準備撥款申請,『智』啟學教資助 一頁整理了申請要點。
本課重點
- 能夠向同事解釋「懂得用」與「懂得判斷」的分別,並說出三個必須由教師把關的場合。
- 能夠辨認四類最常見的 AI 出錯情況,並知道每一類在本課程哪一課會處理。
- 能夠按自己的角色(前線教師、科主任、IT 主任)決定先讀哪幾課。
- 能夠在科組會議上用一個比喻,說明為甚麼 AI 會非常肯定地講錯嘢。
常見問題
讀得懂。全課程沒有數學公式、沒有程式碼,每一個概念都先用課室或日常生活的比喻講一次,再引入術語。你需要的只是願意花大約三小時,把二十八課分幾個星期讀完。
需要,而且正正因為你用得多才更需要。懂得用的人會發現 AI 有時答得很好、有時錯得離譜,但說不出為甚麼;理解原理之後,你可以預測它在哪些任務上會出事,並在出事之前改寫提示或加上校本資料。
課程內容免費公開,可直接用作科組共同備課、教師工作坊或校本培訓教材。實際時數認可由學校自行按校本專業發展政策處理,我們建議把每個模組當作一節共同備課時段來安排。