本地部署實作:用 Ollama 與 LM Studio 在校內跑模型
由資訊科技室一台機開始,示範用 Ollama 與 LM Studio 在校網內跑模型的完整流程、硬件期望、常見陷阱,以及甚麼任務適合放在校內。
Read in English一句話答案:在校內跑模型,技術上比想像中容易——裝一個工具、下載一個模型、打一句指令就會動。難的是之後那些沒人提的事:誰維護、誰備份、放在校網哪一段、學生用出問題時誰看得到。本課兩邊都講。
由一個「試一試」開始
九月開學前的教師發展日,一位物理科老師在午飯時問資訊科技組:「我聽說可以把 AI 裝在電腦裡,完全不用上網。真的假的?」
資訊科技組主任下午就在自己的辦公電腦上示範了一次。由開始下載到模型答出第一句話,不用二十分鐘。全場的反應是:「就這樣?」
是,也不是。 「跑起來」確實只需要二十分鐘;「讓全校八百名學生穩定地用」則是另一件事。這一課把兩段路都走一次。
兩件工具,一個比喻
如果把模型想像成一台影印機:
- Ollama 是機身背後的控制板,用打字指令操作。你要它做甚麼,就打一行字。不好看,但可靠、可以被其他程式呼叫、適合長期開着服務全校。
- LM Studio 是同一台機前面的觸控面板。有按鈕、有下拉選單、可以在介面裡搜尋和比較模型。適合教師自己在辦公電腦上試,不需要記任何指令。
兩者做的其實是同一件事:下載一個已經量化好的模型檔案(第 21 課 講過量化,第 12 課 講過 GGUF 格式),再在你的顯示卡上執行它。分別只在於介面給誰用。
二十分鐘的實作
以下是 Ollama 最基本的流程。命令在 Windows、macOS 與 Linux 上一樣:
# 1. 下載一個小模型(第一次會花幾分鐘,視乎網速)
ollama pull llama3.2:3b
# 2. 直接對話,輸入 /bye 離開
ollama run llama3.2:3b
# 3. 看看本機有甚麼模型、各佔多少空間
ollama list
# 4. 看看現在有沒有模型正在佔用記憶體
ollama ps
# 5. 用完刪走,釋放硬碟空間
ollama rm llama3.2:3b
要讓校內其他電腦(或 Edor.ai 平台)連上這台機,Ollama 會在本機開一個服務埠。快速確認它有沒有在運作:
# 確認服務有回應
curl http://localhost:11434/api/tags
# 用一句話測試生成
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "用三句話向小五學生解釋甚麼是浮力",
"stream": false
}'
LM Studio 那邊不用打字:在應用程式內搜尋模型名稱、按下載、在對話分頁選定模型就可以用;要給其他程式呼叫,在設定中開啟本機伺服器功能即可。
硬件期望,說範圍不說死數
這是最多學校被誤導的地方。沒有一條「幾多 GB 就夠」的通則,因為需求同時取決於模型大小、量化位元與上下文長度:
- 三十億參數、4 位元量化:大約 4 GB 至 6 GB 顯示卡記憶體。很多學校現有的教師電腦或多媒體室電腦已經達標。
- 七十至八十億參數、4 位元量化:大約 6 GB 至 10 GB。這是「教師日常用得順手」的甜蜜點。
- 一次讀長文件(長上下文):記憶體需求會再往上加,而且加得比預期快。同一個模型,上下文由 4K 開到 32K,可以多吃幾 GB。
- 沒有獨立顯示卡的電腦:也能跑,靠 CPU 運算,但速度慢很多,只適合示範,不適合服務學生。
另一個常被忽略的維度是同時使用人數。一個模型在一張卡上服務一位教師,回應流暢;同一張卡服務三十位學生,大家就要排隊。要支援整班同時使用,需要規劃並行處理能力,或者索性把學生場景留在雲端。
一個課室裡的例子
一間中學把校內模型用在一個很具體的場景:英文科的詞彙與句式練習。
理由是這樣的。這個任務重複性高(每日大量、每次都很短)、風險低(不涉及評分、不涉及個人資料)、對精確推理要求不高。這三個條件加起來,正是校內量化模型的理想用途。
他們的做法:資訊科技室一台裝了單張消費級顯示卡的機器,放在伺服器房,跑一個八十億參數的 4 位元模型;在 Edor.ai 後台把英文科的詞彙練習模組切換到本地 Ollama 供應商;其餘模組維持雲端。
三個月後的觀察:
- 教師介面完全沒有分別,大部分老師不知道背後換了模型。
- 有一次校外光纖故障,全校對外斷網半日,詞彙練習照常運作,而其他線上工具停擺。這一次意外反而成了最有說服力的示範。
- 學生對話仍然經過平台的安全守門與教師監控——模型跑在校內,不代表守門可以省掉。這一點見 AI 護欄實戰。
沒有人提的四件事
- 更新。模型與工具都會更新,沒有人負責的話,兩年後就變成「無人敢碰的舊系統」。要在校曆上排定檢查日。
- 備份。模型檔案可以重新下載,但學校的設定、提示模板與紀錄不可以。備份策略要一併規劃。
- 網絡位置。這台機放在校網哪一段、誰可以連、有沒有對外開放?一台不小心暴露在互聯網的推論伺服器,是真實的保安風險。
- 電力與散熱。一張顯示卡長時間滿載,耗電與發熱都不容忽視。伺服器房的散熱要先確認。
這對你的課堂意味甚麼
- 先試,後買。 用現有電腦跑一個小模型讓幾位同事試兩星期,得到的資訊比任何供應商簡報都準確。
- 選對任務比選對模型重要。 重複、短、低風險、不計分的任務放校內;評分、長篇推理、對外文件仍然應該用最好的模型加教師覆核。
- 離線可用是一項真實的課堂保障。 網絡故障那半日,你會慶幸有一個不需要外網的選項。
- 本地不等於安全。 資料留在校內解決了「送去哪裡」的問題,但沒有解決「學生問了甚麼、AI 答了甚麼」的問題。守門與監控仍然必須。
在 Edor.ai 裡是怎樣運作的
Edor.ai 把本地 Ollama 列為可切換的供應商之一,與 OpenAI、Azure OpenAI、Anthropic、Poe 並列。管理員在後台填入校內伺服器位址,即可把指定模組切換到校內模型,教師與學生的介面完全不變。
三點值得強調。第一,混合使用是常態:學校不需要全部搬進來,可以按模組決定。第二,安全機制照樣生效:即使推論在校內完成,四層守門、教師監控與 ai_audit_logs 稽核紀錄仍然運作,用量與安全動作在同一份報表中檢視。第三,校內部署的完整版本(整個平台而非只有模型)也是支援的選項,功能與雲端相同,詳見 本地部署 vs 雲端部署。
小結
在校內跑模型不再是研究室的專利,一台電腦、二十分鐘就能開始。但由「跑得起」到「全校用得穩」,中間是網絡、權限、更新與備份這些不性感卻決定成敗的工作。把它當成一個小型 IT 系統來規劃,而不是一個週末實驗。
下一課我們把範圍再縮小,由校內伺服器走到學生手上的裝置:端側 AI 與 Apple Intelligence。上一課見 模型量化。
本課重點
- Ollama 像一台命令列操作的影印機,LM Studio 像同一台機的圖形化面板,兩者做的事一樣,分別在誰來用。
- 先在一台現有電腦上跑通一個小模型,再談買伺服器;由試用到全校服務,中間隔着網絡、權限與備份三件事。
- 校內模型最適合的是離線、重複、低風險的任務,不是取代雲端旗艦處理所有工作。
- Edor.ai 支援把本地 Ollama 設為供應商,教師介面完全不變,但仍然經過同一套安全守門與稽核紀錄。
常見問題
不一定,而且不應該一開始就買。先在資訊科技室一台現有的、有獨立顯示卡的電腦上裝 Ollama,跑一個三十億參數級別的小模型,讓幾位教師試兩個星期。確認真的有人用、用在甚麼場景,再按實際需要決定硬件。
看使用者。LM Studio 有圖形介面,適合教師自己在電腦上試用與比較模型;Ollama 以命令列與 API 為主,適合放在伺服器上長期服務全校。很多學校兩者都用,前者用來選型,後者用來上線。
在同一張消費級顯示卡上,小型量化模型的回應速度通常可以接受,但同時有二三十位學生使用時就會排隊。要支援整班同時使用,需要規劃並行處理能力,這是硬件規劃時最容易被忽略的一項。
- · 本文所有價格、功能與規格以上列官方文檔為準;供應商可隨時調整,請於採購前自行覆核。
- · 文中提及的產品名稱與商標均屬其各自擁有者所有。Edor.ai 與該等公司並無合作、代理或贊助關係。
- · 本文為教育用途的獨立整理與評測,不構成任何採購建議或法律意見。
- · 涉及學生個人資料的應用,請按學校政策及《個人資料(私隱)條例》(PDPO)自行評估後才使用。