模型與 LLM 觀察 發表於 2026年9月11日 8 分鐘閱讀

四大美國模型供應商橫評:OpenAI、Anthropic、xAI、Google 哪一家適合學校?

2026 年 9 月,四家美國前沿供應商的旗艦價格由每 100 萬 token 0.75 美元到 10 美元,相差 13 倍。本文以香港學校最關心的六條軸線(價格、上下文、中文處理、內容安全、平台可用性、成本陷阱)做橫評,並解釋為甚麼「最強的模型」通常不是學校應該用的模型。

Edor.ai 教育團隊
前線教師、教育科技顧問與 AI 工程師
Read in English

一間中學的資訊科技主任把同一份 22 頁校本評估政策,分別丟給四家供應商的旗艦模型做摘要。最貴的一次收費,是最平那次的 13 倍——而四份摘要放在科主任面前,沒有人能指出哪一份值這個差價。這不是個別現象:以 2026 年 9 月的官方定價計,OpenAI GPT-6 Astra 每 100 萬 token 輸入 10 美元,Google Gemini 3.8 Flash 是 0.75 美元,兩者剛好相差 13.3 倍。

學校要回答的問題,從來不是「哪一家最強」,而是「哪一家在我們實際會做的任務上,質素夠用而成本可控」。這兩條問題的答案,往往不是同一家。

先拆開三個常被混淆的概念

在比較之前,先用日常比喻把三個詞講清楚,因為幾乎所有選型錯誤都源自這三個詞被混為一談。

上下文長度就是模型的「大腦記憶體」。 它決定模型一次過可以「記住」多少內容。100 萬 token 大約等於一整個學期的教材加上校本政策。但記憶體大不等於記得好——把整箱文件倒進去,模型反而容易抓錯重點,而且如下文所述,超長輸入通常會觸發加倍收費。

參數量就是模型的「腦細胞數量」。 腦細胞多代表潛在能力強,但一份小五中文工作紙不需要博士級的腦。用旗艦模型出一份填充題,就像請大律師幫你影印。

推理力度(reasoning effort)是模型「想多久才答」的調節掣。 這是 2026 年四家共同的設計:OpenAI 的 reasoning.effort、Anthropic 的 effort、Google 的 thinking_level、xAI 的 reasoning_effort。想得越久,答得越好,但思考過程本身按輸出價收費。這一點詳見 推理革命:由思維鏈到自適應思考

實戰橫評:六條學校真正在意的軸線

以下全部為 2026 年 9 月各家官方文件所列的規格與定價(美元,每 100 萬 token)。

軸線OpenAI GPT-6 AstraAnthropic Claude Fable 5.1Google Gemini 3.8 FlashxAI Grok 4.6
發佈日期2026-09-032026-09-012026-09-022026-08-12
輸入 / 輸出價10 / 5010 / 500.75 / 3.75(導入價)2 / 6
快取讀取價1.000.250.075(導入價)0.50
上下文長度105 萬100 萬約 105 萬50 萬
最大輸出12.8 萬12.8 萬6.55 萬文件未設上限
知識截止2026 年 4 月 30 日2026 年 6 月官方未在定價頁列出2026 年 2 月 1 日
長輸入成本陷阱超過 27.2 萬 token,整筆按 2 倍輸入、1.5 倍輸出無同類條款無同類條款達到 20 萬 token,整筆按 4 / 12 計
開放權重否(Gemma 系列另計)
在 Edor.ai 的接入原生(預設)原生需經 Poe需經 Poe

幾點必須讀清楚:

  • Gemini 的 0.75 / 3.75 是有期限的。 Google 定價頁寫明此價維持至 2026 年 12 月 31 日,2027 年 1 月 1 日起變成 1.50 / 7.50。做三年預算的學校要按後者計算。
  • 快取價差距比正價更大。 Claude Fable 5.1 的快取讀取只需 0.25 美元,是 GPT-6 Astra 的四分之一。對於每次都要重複載入同一份校本課程綱要的場景,這一欄比正價更影響實際帳單。
  • 兩家有「長輸入懸崖」。 OpenAI 與 xAI 都採用同一種計法:一旦請求跨過門檻,不是只有超出部分加價,而是整筆請求按高價計。把整個學期的教材一次貼進去,帳單可以在無預警下翻倍。

至於速度,四家官方文件都沒有提供可直接互相比較的 tokens/sec 數字。Anthropic 在模型頁公佈的是相對延遲分級(Fable 5.1 標示為 Slower、Opus 5 為 Moderate、Sonnet 5 為 Fast、Haiku 4.5 為 Fastest),屬供應商自報的相對描述而非實測值。任何聲稱「A 家比 B 家快 X 倍」的市場材料,學校都應該要求對方交出測試方法。

逐家拆解:對學校的實際意義

OpenAI:唯一一家「三件齊」

OpenAI 的不可替代之處不是 GPT 最強,而是同一家同時提供聊天模型、embedding 模型與語音模型。校本知識庫要 embedding、口語練習要語音辨識與合成,少一樣都做不成完整平台。這也是 Edor.ai 以 OpenAI 為預設供應商的原因。已購買 Azure 的辦學團體可改走 Azure OpenAI,由學校自己的訂閱管理資料所在地。詳見 OpenAI 模型頁

Anthropic:中文寫作回饋與長文件的穩定選擇

Claude 的 adaptive thinking 在 Fable 5.1 上是永久開啟、預設 effort 為 high,亦即它預設會「想清楚才答」。這對作文回饋與評分準則對照這類需要判斷的任務有幫助。代價是延遲較高、輸出價與 GPT-6 Astra 同為 50 美元。要注意的是 Anthropic 沒有 embedding 與語音模型,若學校完全停用 OpenAI,知識庫與口語練習需另行安排。若成本是考慮,Claude Sonnet 5 的 2 / 10 美元已在 2026 年 8 月 10 日確認為長期價格,對學校而言是這家最實際的一檔。詳見 Anthropic Claude 模型頁

Google:最便宜的大量文件處理,但接入是門檻

Gemini 3.8 Flash 是四家之中唯一原生支援文字、圖像、音訊與影片四種輸入的型號,而且導入價遠低於其餘三家。對「把兩年通告掃描件整理成結構化資料」這類粗活,它的性價比明顯。問題在接入:Edor.ai 沒有原生 Gemini 供應商,只能經 Poe 呼叫,而 Poe 不提供 embedding 與語音。已購買 Google Workspace for Education 的學校可以兩者並行使用。詳見 Google Gemini 模型頁

xAI:價格中位,但內容政策要自行評估

Grok 4.6 的 2 / 6 美元介乎 Gemini 與另外兩家之間,50 萬 token 上下文對絕大部分校務文件已綽綽有餘,xhigh 推理級別亦已到位。真正需要學校自行判斷的是內容取向:Grok 與 X 平台內容緊密結合,這在學生場景中屬於必須先評估、並把評估結果寫進校本 AI 政策的事項。同樣只能經 Poe 接入。詳見 xAI Grok 模型頁

邊界與局限:報價單不會寫的部分

四家都會幻覺,而且在本地化資訊上最嚴重。 香港的課程代碼、科目編號、EDB 通函編號、學校中英文全名——這些是模型訓練資料中最稀薄的部分,偏偏又是教師最容易順手貼進通告的部分。我們見過模型憑空生成一個格式完全正確、但根本不存在的課程代碼。任何會發給家長或學生的文件,都必須教師覆核。

知識截止日期各家不同,而且比你想像中早。 GPT-6 Astra 是 2026 年 4 月 30 日,Grok 4.6 是 2026 年 2 月 1 日,Claude Sonnet 5 更早至 2026 年 1 月。問一個「今個學年」的問題,模型很可能在答上個學年的事,而且語氣一樣肯定。需要現行資料的場景,答案必須來自學校自己的知識庫,而不是模型記憶。

價格會變,而且雙向都會。 OpenAI 的 GPT-5.6 Luna 在 2026 年 7 月 30 日減價八成,Sol 在 8 月 21 日減價逾兩成;而 Gemini 3.8 Flash 已預告 2027 年 1 月加價一倍。學校若直接自己接 API,預算幾乎無法鎖定——這正是我們選擇以固定年費吸收模型價格波動的原因。

上下文長並不等於理解得好。 100 萬 token 的宣傳數字,在實務上不代表把 100 萬 token 塞進去會得到好答案。正確做法是用 RAG 只檢索相關段落,既準確亦避開長輸入加價。見 校本知識庫(RAG)

「原生接入」不是市場術語,是功能差別。 經 Poe 呼叫 Gemini 或 Grok,拿到的是聊天能力,不是 embedding 與語音。這個分別在示範會上看不出來,在部署第三週才會浮現。

落地指南:這個星期可以做的四件事

第一,先分清哪些任務需要旗艦。 按我們在學校的觀察,大約八成請求(出題、摘要、格式轉換、初步評分、通告草稿)用中階型號已經足夠。只有跨文件推理、多步驟數理講解、需要引用多份政策交叉對照的任務,才值得升級。選對分流,比選對供應商省得更多。

第二,用你們自己的材料做盲測,而不是看 benchmark。 方法很簡單:抽三份真實材料(一份中文作文、一份校本課程節錄、一份家長通告草稿),同一條提示跑四家,把供應商名稱遮蓋,交三位科主任評分。這份記錄同時是 『智』啟學教撥款 申請與匯報的有用附件。

第三,照以下條件對號入座:

  • 想要一家搞掂聊天、知識庫與口語練習 → OpenAI(或 Azure OpenAI)。
  • 最重視中文寫作回饋與長文件判斷的穩定度 → Anthropic Claude,日常用 Sonnet 5,難題才升 Fable 5.1。
  • 要用最低成本處理大量文件或影音,且已在用 Google Workspace → Gemini,但要按 2027 年價格做預算。
  • 想在成本與能力之間取中位,且已完成內容安全評估 → Grok
  • 資料完全不能離開校網 → 四家都不適用,請改看 開源與閉源的成本與私隱權衡

第四,把「可切換」寫進採購條件。 2026 年這九個月內,四家都至少換過一次旗艦。任何把學校鎖死在單一供應商的合約,在兩年內都會變成負擔。學校要問的是:換供應商時,教師介面會不會變?校本知識庫要不要重建?歷史紀錄能不能保留?三個答案都應該是「不用」。

結語

四家美國供應商在 2026 年 9 月的能力差距,遠小於它們的價格差距。對學校而言,真正的選型能力不是挑出最強那一家,而是建立一套「日常用平、難題用貴、資料敏感用本地」的分流機制,並確保這套機制可以在供應商換代時原封不動地沿用。

想看全部 15 家(包括中國與歐洲供應商)的完整對照,見 2026 全模型橫評;想先弄清楚 token、上下文、幻覺這些詞的意思,由 LLM 教室 第一課開始。

常見問題

通常不應該。備課、出工作紙、初步評分這類任務,中階型號的質素分別在教師眼中幾乎看不出來,但價格可以差 5 至 13 倍。合理做法是日常用中階、難題才升級,由平台按任務自動分流。

要留意兩件事。第一,Gemini 3.8 Flash 每 100 萬 token 0.75 / 3.75 美元是導入價,Google 文件寫明 2027 年 1 月 1 日起升至 1.50 / 7.50 美元。第二,Edor.ai 沒有原生接入 Gemini,要經 Poe 呼叫,而 Poe 不提供 embedding 與語音模型,校本知識庫與口語練習仍需 OpenAI 或 Azure 金鑰。

我們的建議是先由科主任與 IT 主任評估。Grok 與 X 平台內容緊密結合,內容安全政策與其他三家的取向不同;在學生場景使用前,學校應自行測試並記錄評估結果。

沒有一家在所有中文任務上全面領先。以我們在學校的使用經驗,Claude 在中文寫作回饋與長文件理解上較穩定,OpenAI 的粵語語音辨識較成熟,Gemini 在大量文件的低成本處理上較划算。與其押注一家,不如選一個可以切換的平台。

對學校而言應該只是後台改一個設定。管理員在 Edor.ai 後台切換供應商或按模組指定型號即可,教師與學生的介面、校本知識庫與過往紀錄都不受影響。

資料來源、信任標籤與免責聲明

文中價格與規格數據截至 2026-09

  • · 本文所有價格、功能與規格以上列官方文檔為準;供應商可隨時調整,請於採購前自行覆核。
  • · 文中提及的產品名稱與商標均屬其各自擁有者所有。Edor.ai 與該等公司並無合作、代理或贊助關係。
  • · 本文為教育用途的獨立整理與評測,不構成任何採購建議或法律意見。
  • · 涉及學生個人資料的應用,請按學校政策及《個人資料(私隱)條例》(PDPO)自行評估後才使用。
模型比較OpenAIAnthropicGoogle GeminixAI Grok
分享:WhatsAppFacebookLinkedInX
訂閱教育 AI 通訊

每月一封:給香港學校的 AI 教學實戰文章、平台更新與撥款資訊。隨時可取消。

我們只會用此電郵寄送通訊,不會分享給第三方。

延伸閱讀

模型與 LLM 觀察 2026年9月11日 7 分鐘閱讀

2026 全模型橫評:15 家供應商、一套學校用的選型框架

由 OpenAI、Anthropic、Google、xAI、Meta、Mistral,到 DeepSeek、Qwen、Kimi、GLM、MiniMax、豆包、混元、文心,再加上編碼專用的 Cursor Composer。本文以同一套學校用量估算,把 15 家供應商的價格、上下文、開放權重與實際可用性放在同一張表上,並提供一套四問選型框架。

閱讀全文
模型與 LLM 觀察 2026年9月11日 8 分鐘閱讀

中國大模型橫評:DeepSeek、Qwen、Kimi、GLM 等八家,香港學校可以怎樣用?

DeepSeek 的價格是 GPT-6 Astra 的六十七分之一,中文能力亦不輸人。那為甚麼校本平台不直接接上去?本文橫評 DeepSeek、Qwen、Kimi、GLM、MiniMax、豆包、混元與文心八家,說明開放權重與雲端 API 的關鍵分別,以及《個人資料(私隱)條例》下香港學校真正可行的三條路線。

閱讀全文
模型與 LLM 觀察 2026年9月11日 7 分鐘閱讀

由聊天機械人到 AI 代理:工具呼叫、多步驟自動化與 MCP,學校應該自動化甚麼?

聊天機械人只會說話,AI 代理會動手:查資料、讀文件、呼叫系統、連續執行多個步驟。本文用教師看得懂的方式解釋工具呼叫與 MCP 標準,對照各家的工具收費,並提出一份「應該自動化 / 不應該自動化」清單——關鍵不是 AI 能做甚麼,而是哪一步必須由人按下確認。

閱讀全文