Blog · 教育 AI

模型與 LLM 觀察

大型語言模型橫評、推理革命、開源與閉源、Agent 與安全風險

模型與 LLM 觀察 2026年9月11日 7 分鐘閱讀

2026 全模型橫評:15 家供應商、一套學校用的選型框架

由 OpenAI、Anthropic、Google、xAI、Meta、Mistral,到 DeepSeek、Qwen、Kimi、GLM、MiniMax、豆包、混元、文心,再加上編碼專用的 Cursor Composer。本文以同一套學校用量估算,把 15 家供應商的價格、上下文、開放權重與實際可用性放在同一張表上,並提供一套四問選型框架。

閱讀全文
模型與 LLM 觀察 2026年9月11日 8 分鐘閱讀

中國大模型橫評:DeepSeek、Qwen、Kimi、GLM 等八家,香港學校可以怎樣用?

DeepSeek 的價格是 GPT-6 Astra 的六十七分之一,中文能力亦不輸人。那為甚麼校本平台不直接接上去?本文橫評 DeepSeek、Qwen、Kimi、GLM、MiniMax、豆包、混元與文心八家,說明開放權重與雲端 API 的關鍵分別,以及《個人資料(私隱)條例》下香港學校真正可行的三條路線。

閱讀全文
模型與 LLM 觀察 2026年9月11日 7 分鐘閱讀

由聊天機械人到 AI 代理:工具呼叫、多步驟自動化與 MCP,學校應該自動化甚麼?

聊天機械人只會說話,AI 代理會動手:查資料、讀文件、呼叫系統、連續執行多個步驟。本文用教師看得懂的方式解釋工具呼叫與 MCP 標準,對照各家的工具收費,並提出一份「應該自動化 / 不應該自動化」清單——關鍵不是 AI 能做甚麼,而是哪一步必須由人按下確認。

閱讀全文
模型與 LLM 觀察 2026年9月11日 8 分鐘閱讀

四大美國模型供應商橫評:OpenAI、Anthropic、xAI、Google 哪一家適合學校?

2026 年 9 月,四家美國前沿供應商的旗艦價格由每 100 萬 token 0.75 美元到 10 美元,相差 13 倍。本文以香港學校最關心的六條軸線(價格、上下文、中文處理、內容安全、平台可用性、成本陷阱)做橫評,並解釋為甚麼「最強的模型」通常不是學校應該用的模型。

閱讀全文
模型與 LLM 觀察 2026年9月11日 7 分鐘閱讀

安全、幻覺與風險控制:提示注入、幻覺後果,以及校本平台必須有的護欄

AI 在通告草稿裏引用了一個格式完全正確、但根本不存在的課程指引編號。這類錯誤不是偶發,而是語言模型的結構性特徵。本文用 OWASP 十大風險與 NIST 風險管理框架為骨架,逐項對照香港學校的真實場景,並列出一個校本 AI 平台必須具備的護欄與稽核安排。

閱讀全文
模型與 LLM 觀察 2026年9月11日 7 分鐘閱讀

開源權重還是閉源 API?自架與租用的成本真帳,以及私隱在哪一刻改變答案

很多學校以為「自己買機跑開源模型」一定慳錢。把真實用量代進 2026 年 9 月的官方價格後,答案往往相反:雲端 API 的年費低到硬件根本追不上。本文算清兩邊的真帳,列出對學校現實可行的開源型號與硬件門檻,並說明私隱與資料政策在哪一刻會令天秤倒向自架。

閱讀全文
模型與 LLM 觀察 2026年9月11日 7 分鐘閱讀

推理革命:由思維鏈到自適應思考,對評卷、數學與科學教學改變了甚麼?

2024 年的模型是「脫口而出」,2026 年的模型會先想清楚才答,而且自己決定想多久。本文用教師看得懂的方式解釋思維鏈、推理力度與自適應思考的演變,對照四家供應商的調節掣設計,並說明它在評卷、數學與科學教學上真正改變了甚麼——以及仍然改變不了甚麼。

閱讀全文
資源中心
訂閱教育 AI 通訊

每月一封:給香港學校的 AI 教學實戰文章、平台更新與撥款資訊。隨時可取消。

我們只會用此電郵寄送通訊,不會分享給第三方。