2026 全模型橫評:15 家供應商、一套學校用的選型框架
由 OpenAI、Anthropic、Google、xAI、Meta、Mistral,到 DeepSeek、Qwen、Kimi、GLM、MiniMax、豆包、混元、文心,再加上編碼專用的 Cursor Composer。本文以同一套學校用量估算,把 15 家供應商的價格、上下文、開放權重與實際可用性放在同一張表上,並提供一套四問選型框架。
同一間學校、同一套用量,一年的模型帳單可以是 7,410 美元,也可以是 46 美元——相差超過 160 倍。兩個數字都不是推銷話術,而是把同一組使用量估算,乘上 2026 年 9 月各家官方公佈的 token 價格所得的結果。橫在中間的,是 15 家供應商、幾十個型號,以及一連串學校不會在報價單上看到的條款。
這篇是我們每季重做一次的完整對照。它的目的不是選出冠軍,而是讓科主任與 IT 主任在面對供應商時,手上有一份可以查證的底稿。
原理:三個決定成本的變數
第一是上下文長度,即模型的「大腦記憶體」。 2026 年的主流已經是 100 萬 token 上下,足夠一次過讀完整套校本課程文件。但記憶體大不代表用得好,而且部分供應商對超長輸入另設加價條款。
第二是參數量,即「腦細胞數量」。 2026 年的分水嶺不再是總參數,而是「啟動參數」:MoE(混合專家)架構的模型可能有 5,520 億總參數,推論時卻只啟動 80 億至 160 億。這就是為甚麼 DeepSeek 可以用 0.15 美元的價格提供 100 萬 token 上下文——它每次只叫醒一小部分腦細胞。
第三是推理力度。 四家美國供應商與多數中國供應商現在都提供「想多久」的調節掣,而思考過程本身按輸出價收費。同一條問題,low 與 max 的帳單可以差幾倍。詳見 推理革命。
實戰橫評:15 家供應商一覽
價格為美元,每 100 萬 token(輸入 / 輸出),數據截至 2026 年 9 月各家官方文件。
| 供應商 | 代表型號 | 發佈 | 價格 | 上下文 | 開放權重 | 在 Edor.ai 的接入 |
|---|---|---|---|---|---|---|
| OpenAI | GPT-6 Astra | 2026-09-03 | 10 / 50 | 105 萬 | 否 | 原生(預設) |
| Anthropic | Claude Fable 5.1 | 2026-09-01 | 10 / 50 | 100 萬 | 否 | 原生 |
| Gemini 3.8 Flash | 2026-09-02 | 0.75 / 3.75(導入價) | 約 105 萬 | 否(Gemma 除外) | 經 Poe | |
| xAI | Grok 4.6 | 2026-08-12 | 2 / 6 | 50 萬 | 否 | 經 Poe |
| Meta | Muse Glimmer 30B | 2026-08-09 | 0.35 / 1.50 | 13.1 萬 | 是(Apache 2.0) | 經 Ollama 自架 |
| Mistral AI | Mistral Large 3 | 2025-12 | 0.5 / 1.5 | 25.6 萬 | 是(Apache 2.0) | 經 Ollama 自架 |
| Cursor | Composer 2.5 | 2026-05-18 | 0.5 / 2.5 | 官方未公佈 | 否 | 不適用 |
| DeepSeek | DeepSeek-V4.1-Flash | 2026-09-10 | 0.15 / 0.60(非高峰) | 100 萬 | 是(MIT) | 經 Ollama 自架 |
| Alibaba Qwen | Qwen3.8-Max | 2026-09-03 | 2 / 6 | 100 萬 | 部分型號 | 經 Ollama 自架 |
| Moonshot Kimi | Kimi K3 | 2026-07-16 | 3 / 15 | 100 萬 | 是(自訂授權) | 未接入 |
| Zhipu GLM | GLM-5.3 | 2026-08-14 | 1.4 / 4.4 | 100 萬 | 部分型號(MIT) | 經 Ollama 自架 |
| MiniMax | MiniMax M3 | 2026-06 | 0.30 / 1.20(推廣價) | 100 萬 | 是(自訂授權) | 未接入 |
| ByteDance 豆包 | Doubao Seed 2.1 Pro | 2026-06-23 | 人民幣 6 / 30 | 25.6 萬 | 否 | 未接入 |
| Tencent 混元 | Hunyuan Hy4 Preview | 2026-08-28 | 輸入 0.83(輸出未公佈) | 100 萬 | 是(Apache 2.0) | 經 Ollama 自架 |
| Baidu 文心 | ERNIE 5.1 | 2026-08 | 人民幣 0.004 / 0.018 每千 token | 12.8 萬 | 部分(4.5 系列) | 未接入 |
三點要特別留意:
- Cursor Composer 不屬於學校平台的選項。 它是 Cursor 編輯器內建的編碼專用模型,沒有可當作模型端點呼叫的推論 API——官方的 Cloud Agents API 與 SDK 只能驅動編碼代理,不是對話模型接口。資訊科技科教編程時可以把 Cursor 當教具,但學與教平台的模型選擇不在它身上。見 Cursor Composer 模型頁。
- 「部分開放權重」不等於開放。 Qwen 的旗艦 Qwen3.8-Max 是閉源雲端 API,同架構的開源版本採自訂授權且不含圖像輸入;GLM-5.3 旗艦在本文更新時權重仍未公開,公開的是 GLM-5.2 與 GLM-5.3-Flash。學校要求「可自架」時,必須指名具體型號,而不是供應商。
- 「未接入」是現況陳述,不是評價。 我們沒有原生接入 DeepSeek、Kimi、MiniMax、GLM、豆包、混元與文心;當中幾家的開源權重可以用 Ollama 在校內自架。
把價格變成學校看得懂的數字
token 價格對學校沒有意義,年度帳單才有。以下用一組明確標示的假設作換算:全校 800 名學生、100 名教職員;每個上課日 600 次 AI 請求;每次平均 3,000 token 輸入、700 token 輸出;每學年 190 個上課日。 這是我們的估算假設,不是供應商公佈的數字;學校應按自己的使用密度調整。
| 型號 | 每年輸入成本 | 每年輸出成本 | 每年合計(美元) |
|---|---|---|---|
| GPT-6 Astra / Claude Fable 5.1 | 3,420 | 3,990 | 約 7,410 |
| Kimi K3 | 1,026 | 1,197 | 約 2,223 |
| Claude Sonnet 5 | 684 | 798 | 約 1,482 |
| Grok 4.6 / Qwen3.8-Max | 684 | 479 | 約 1,163 |
| GLM-5.3 | 479 | 351 | 約 830 |
| Gemini 3.8 Flash(導入價) | 257 | 299 | 約 556 |
| Mistral Large 3 | 171 | 120 | 約 291 |
| Muse Glimmer 30B | 120 | 120 | 約 239 |
| DeepSeek-V4.1-Flash(非高峰) | 51 | 48 | 約 99 |
| GLM-5.3-Flash(推廣價) | 26 | 20 | 約 46 |
這張表要看出三件事。第一,選型號比選供應商重要:同一家 Anthropic,由 Fable 5.1 換成 Sonnet 5,帳單少八成。第二,便宜的型號在學校日常任務上往往足夠,真正需要旗艦的請求可能不足兩成。第三,這些都是浮動數字:Gemini 的導入價 2027 年 1 月會加倍,DeepSeek 的非高峰價在高峰時段翻倍,GLM-5.3-Flash 的 0.075 / 0.25 是推廣價(標價為 0.15 / 0.50)。學校若自己接 API,實際上是在承受這些波動。
邊界與局限:這張表沒有告訴你的事
價格表不等於總成本。 學校要算的還有:embedding(校本知識庫)、語音辨識與合成(口語練習)、工具呼叫費用(部分供應商按次收費)、以及最容易被忽略的——IT 人手時間。一個沒有配額機制的整合,一次失控的批量任務就可以燒掉一個月預算。
benchmark 分數對學校幾乎沒有參考價值。 業界常引用的評測大多針對編碼與競賽數學,與「批改一篇中三英文作文並給三項具體回饋」的相關度很低。學校唯一可靠的評估方法,是用自己的材料做盲測。同樣道理,凡是聲稱某模型「快 X 倍」而不交代測試方法與硬件的數字,都應該打折看待。
所有模型都會幻覺,而且在香港本地資訊上最嚴重。 課程代碼、通函編號、學校全名、政府部門架構——這些在訓練資料中最稀薄。我們見過模型生成格式完全正確但根本不存在的課程編號。這不是換一家供應商可以解決的,只能靠 RAG 引用學校自己的文件加上教師覆核。見 校本知識庫(RAG)。
知識截止日期是隱形陷阱。 2026 年 9 月的旗艦,知識截止分別落在 2026 年 1 月至 6 月之間。問「今個學年」的問題,模型可能在答上個學年的事,語氣卻一樣肯定。
跨境傳輸是條款問題,不是技術問題。 表上八家中國供應商的官方 API 都在內地,直接呼叫即構成跨境資料傳輸,須先按《個人資料(私隱)條例》做評估。詳見 中國模型橫評。
落地指南:四問選型框架
與其逐家比較,不如按次序回答四條問題。大部分學校在第二條就有答案了。
問題一:這批資料可不可以離開校網? 不可以 → 只考慮開放權重並在校內自架(Qwen3.8-27B、Muse Glimmer 30B、Mistral 系列是現實選擇),其餘 11 家不用看。 可以 → 去問題二。
問題二:我們需要 embedding 與語音嗎? 需要(即要做校本知識庫或口語練習)→ 主供應商必須是 OpenAI 或 Azure OpenAI,因為 Anthropic 與 Poe 都不提供這兩類模型。 不需要 → 去問題三。
問題三:這個任務屬於哪一檔?
- 高頻低難度(分類、標記、格式轉換、通告草稿)→ 最平的一檔,Claude Haiku 4.5 或 Gemini 3.8 Flash 級別。
- 日常主力(備課、出題、初步評分、學生對話)→ 中階,Claude Sonnet 5 或同級。
- 高難度(跨文件推理、多步驟數理講解、政策交叉引用)→ 旗艦,而且只在這裏用。
問題四:這個決定能不能撤回? 如果換供應商需要重建知識庫、重新培訓教師或失去歷史紀錄,答案就不合格。合格的條件是:後台切換、資料一鍵完整匯出、模型升級包含在年費內。
一份可以本周執行的檢查清單
- 統計上學期實際用了多少次 AI 功能,按上表假設換算成三個型號檔次的年度成本;
- 抽三份真實校本材料做盲測,遮蓋供應商名稱,由三位科主任評分;
- 向現有或潛在供應商索取書面確認:模型升級是否包含在年費、有沒有 token 超額費、資料匯出是否免費;
- 把「可切換供應商」與「一鍵完整匯出」寫進採購條件;
- 如有敏感資料場景,同步評估 校內部署 的可行性。
購買前的完整提問清單,見 買校本 AI 平台前要問的 12 條問題。
結語
2026 年模型市場最值得學校記住的一件事是:能力差距在收窄,價格差距在擴大,而換代速度沒有放慢。 在這個環境下,選一個「今天最強的模型」幾乎沒有意義;選一個「可以在半年內無痛換掉任何模型」的平台架構,才是真正的採購決策。
想看完整的 15 家供應商資料頁與型號時間線,見 模型資料庫。
常見問題
不需要。實際上絕大多數學校只會用到兩至三家:一家原生供應商處理日常、一個較平的型號做批量任務、必要時一個本地自架模型處理敏感資料。這張表的用途是讓學校知道自己沒有錯過甚麼,以及在供應商報價時有一個對照基準。
不是。價格差距遠大於能力差距,這正是 2026 年最重要的觀察。在備課、出題、摘要與初步評分這類學校日常任務上,中階與旗艦的分別通常需要仔細比對才看得出;在多步驟推理與跨文件交叉引用上,分別才明顯。
開放權重解決的是「資料去了哪裏」,不是「答案對不對」。自架模型同樣會幻覺,而且缺少雲端供應商的內容安全分類器,學校要自行補上守門與監控。兩者的風險清單不同,不是誰取代誰。
不是技術問題,是取捨。DeepSeek、Kimi、MiniMax、GLM、豆包、混元與文心目前都沒有原生接入 Edor.ai;當中部分可以用 Ollama 在校內自架其開源權重版本。直接呼叫這些供應商的官方 API 屬跨境傳輸,須先完成私隱評估。
型號一定會過時,選型原則不會。正確做法是把「可切換供應商」「資料可完整匯出」「模型升級包含在年費內」寫進合約,這樣換代就是後台一個設定,而不是一次重新採購。
文中價格與規格數據截至 2026-09
- OpenAI — API 定價頁
- Anthropic — Claude 定價頁
- Google — Gemini API 定價頁
- xAI — API 定價頁
- DeepSeek — API 官方文件
- Z.ai — GLM 定價頁
- Qwen — Hugging Face 官方組織頁
- Meta — Hugging Face 官方組織頁(Muse Glimmer 30B)
- · 本文所有價格、功能與規格以上列官方文檔為準;供應商可隨時調整,請於採購前自行覆核。
- · 文中提及的產品名稱與商標均屬其各自擁有者所有。Edor.ai 與該等公司並無合作、代理或贊助關係。
- · 本文為教育用途的獨立整理與評測,不構成任何採購建議或法律意見。
- · 涉及學生個人資料的應用,請按學校政策及《個人資料(私隱)條例》(PDPO)自行評估後才使用。
延伸閱讀
中國大模型橫評:DeepSeek、Qwen、Kimi、GLM 等八家,香港學校可以怎樣用?
DeepSeek 的價格是 GPT-6 Astra 的六十七分之一,中文能力亦不輸人。那為甚麼校本平台不直接接上去?本文橫評 DeepSeek、Qwen、Kimi、GLM、MiniMax、豆包、混元與文心八家,說明開放權重與雲端 API 的關鍵分別,以及《個人資料(私隱)條例》下香港學校真正可行的三條路線。
閱讀全文四大美國模型供應商橫評:OpenAI、Anthropic、xAI、Google 哪一家適合學校?
2026 年 9 月,四家美國前沿供應商的旗艦價格由每 100 萬 token 0.75 美元到 10 美元,相差 13 倍。本文以香港學校最關心的六條軸線(價格、上下文、中文處理、內容安全、平台可用性、成本陷阱)做橫評,並解釋為甚麼「最強的模型」通常不是學校應該用的模型。
閱讀全文由聊天機械人到 AI 代理:工具呼叫、多步驟自動化與 MCP,學校應該自動化甚麼?
聊天機械人只會說話,AI 代理會動手:查資料、讀文件、呼叫系統、連續執行多個步驟。本文用教師看得懂的方式解釋工具呼叫與 MCP 標準,對照各家的工具收費,並提出一份「應該自動化 / 不應該自動化」清單——關鍵不是 AI 能做甚麼,而是哪一步必須由人按下確認。
閱讀全文