校本知識庫與檢索增強生成(RAG)
通用 AI 不知道你校小四上學期教到哪一課。RAG 的做法是回答前先翻閱學校自己的文件,像一場只給學生相關幾頁的開卷考試。本課解釋原理與為甚麼它比「訓練 AI 認識我們學校」正確得多。
Read in English一位小四班主任試過一件事。她問 AI:「本校小四上學期中文科教到哪幾個單元?」AI 給了一個非常流暢、非常詳細、非常肯定的答案——而且完全是編的。
她的結論很合理:「這東西不能用。」
但問題不在 AI 不夠聰明,而在她問了一條它不可能知道答案的問題。它從來沒有讀過你學校的文件。
開卷考試,而且只給相關的幾頁
想像兩種考試。
第一種是閉卷考試:學生靠記憶答題。記得就答對,記不清就靠推理,推理不出就……很多學生會寫一個看起來合理的答案。這正是通用 AI 回答校本問題時的狀態。
第二種是開卷考試,但不是把整箱課本搬進考場——那樣學生會翻不完。老師事先看過題目,只把最相關的三四頁遞給學生,並要求答案必須註明頁數。
RAG(檢索增強生成)就是第二種。 它的英文全稱直譯是「檢索之後再生成」,而順序正是重點:先找資料,後寫答案。
三個步驟,一句話一個
- 切段與建索引。 學校把文件上傳後,系統把每份文件切成一段一段,並為每段建立一個「意思指紋」。
- 檢索。 有人提問時,系統先為問題也做一個意思指紋,然後在所有段落中找出指紋最接近的幾段。
- 生成。 系統把這幾段連同問題一起交給模型,並要求它只根據這些段落作答,同時註明來源。
第二步的「意思指紋」就是 embedding,原理已在 Embedding、位置編碼與自注意力 講過。這裡只需要一個直覺:電腦不是靠字面相同找資料,而是靠意思相近。 所以問「學生病假要交甚麼」也能找到寫着「請假證明文件」的那一段,即使沒有一個字相同。
為甚麼不用微調?
這是學校最常走錯的一步。很多人的直覺是:「既然它不認識我們學校,那就用我們的資料訓練它。」
但比較一下:
| 校本知識庫(RAG) | 微調模型 | |
|---|---|---|
| 更新一份政策 | 上傳新版本,即時生效 | 要重新訓練一次 |
| 刪除一份文件 | 刪掉即不再被引用 | 資料已融入參數,無法逐份取回 |
| 答案可否標明來源 | 可以 | 不可以 |
| 需要的技術與硬件 | 一般伺服器 | 顯示卡與專業人手 |
| 適合處理甚麼 | 事實、政策、課程內容 | 語氣、格式、專門任務風格 |
結論很清楚:要 AI 知道「事實」,用檢索;要 AI 學會「說話方式」,才考慮微調。 微調的正確用途見 LoRA 與 QLoRA。
來源標註不是裝飾
一個沒有來源的答案,教師只能選擇相信或不信。一個附上「來源:《功課政策 2026》第 3 節」的答案,教師可以點開核對三十秒。
這個差別對學校來說是決定性的。它把 AI 由「一位很有自信的陌生人」變成「一位會引用文件的同事」。它不能消除幻覺——模型仍可能誤讀段落——但它把錯誤變成可發現的錯誤。
要讓答案穩定附上來源,提示要寫得很硬,例如下面這一段。
一條可以直接試的接地提示
把以下提示連同任何一份學校文件貼進 AI 工具,你會親眼看到「開卷但只准看這幾頁」的效果:
以下三角括號內是本校文件的節錄。請只根據這些節錄回答我的問題。
規則:每一句結論後面用方括號註明出自哪一段(例如[段落 2]);節錄中找不到答案時,直接回答「文件中沒有提及」,不要用你自己的知識補充;不要推測,不要舉節錄以外的例子。
問題:學生因病缺席測驗,補測安排是甚麼?
<<<
[段落 1] ……
[段落 2] ……
[段落 3] ……
>>>
然後做一個對照實驗:把問題換成一條文件裡完全沒有答案的問題,例如「學生因家庭旅行缺席測驗怎麼辦」。寫了「找不到就說沒有提及」的提示會老實回答沒有提及;沒寫這一句的話,你會看到一段編得很好的答案。這一句就是接地提示的全部價值,更完整的寫法見 RAG 的引用式提示。
一個課室裡的例子
一所小學的新入職教師,第一個月最常問同一批問題:家課量上限是多少?學生連續兩天缺席要通知誰?小息值日的交接流程?
這些答案全部寫在教師手冊、功課政策與行政通函裡,散在三個共用資料夾、七份文件之中。以往新老師會直接問身邊的同事,而同事往往憑印象回答,有時說錯。
學校把這七份文件放進校本知識庫,並開放給全體教職員檢索。新老師問「家課量上限」,得到的答案附上「來源:《功課政策 2026》第 2.3 節」。他點開核對,順手看到同一節還寫了長假期的安排——這是他本來不會想到要問的。
半年後最明顯的變化不是省了多少時間,而是答案一致了。以前八位老師憑印象給八個版本,現在全部指向同一份文件的同一節。至於哪些文件該上傳、權限怎樣分層、由誰負責維護,已在 校本知識庫實務文章 完整處理,這裡不重複。
這對你的課堂意味甚麼
- 問對問題,AI 才幫得上忙。 涉及校本事實的問題,必須在有知識庫的環境裡問;在通用聊天工具裡問,你得到的是編出來的答案。
- 要求來源應該成為習慣。 無論在哪個工具,加一句「答案必須註明出自哪一段,找不到就說沒有提及」,成本是十個字,回報是可核對性。
- 知識庫是科組資產,不是 IT 專案。 最有價值的內容是課程進度、評分準則與教材,而這些只有科主任與前線教師寫得出來。
- 文件品質決定答案品質。 一份寫得含糊、版本混亂的政策,檢索出來也是含糊的。導入知識庫往往順帶迫使學校整理文件,這是意外的好處。
接下來
如果檢索永遠找對段落,RAG 就沒有難處了。但實際上「怎樣切文件」、「找到十段時哪一段先讀」、「長文件中間的資訊為甚麼會被忽略」都會影響答案,這是下一課 Chunking、檢索重排與「迷失在中間」 的內容。想回顧為甚麼提示要寫限制,見 一課讀懂 Prompt 工程;想知道平台如何保障學生資料,見 安全與私隱。
本課重點
- RAG 是一場開卷考試,而且是老師只把相關幾頁遞給學生的那種開卷考試
- 文件不會進入模型訓練,只是在回答那一刻被翻閱,所以隨時可以增刪與匯出
- 讓 AI 認識你的學校,正確做法是檢索文件,不是微調模型,兩者成本與風險差距極大
- 有來源標註的答案才可以被核對,而可核對正是校本 AI 與通用聊天工具最根本的分別
常見問題
不是,而這個分別非常重要。訓練是把資料融進模型的參數,之後無法逐份取回或刪除。RAG 只是在回答的那一刻把相關段落貼進提示裡,文件本身留在學校的資料庫。刪一份文件,AI 下一秒就不再引用它。
因為檢索本身可能找錯,或者找到的段落被切得不完整。這正是下一課要處理的問題,見 [Chunking、檢索重排與迷失在中間](/learn/llm/chunking-reranking-and-lost-in-the-middle)。實務上的解法是要求答案必須附來源,讓教師一眼看出它讀的是哪一份文件。
少而準勝過多而雜。我們建議第一個月只放三類:課程進度表、功課政策、通告範本。實際導入次序與文件分類,見 [校本知識庫實務文章](/blog/school-knowledge-base-rag-ai)。
- · 本文所有價格、功能與規格以上列官方文檔為準;供應商可隨時調整,請於採購前自行覆核。
- · 文中提及的產品名稱與商標均屬其各自擁有者所有。Edor.ai 與該等公司並無合作、代理或贊助關係。
- · 本文為教育用途的獨立整理與評測,不構成任何採購建議或法律意見。
- · 涉及學生個人資料的應用,請按學校政策及《個人資料(私隱)條例》(PDPO)自行評估後才使用。