推理革命:由思維鏈到自適應思考,對評卷、數學與科學教學改變了甚麼?
2024 年的模型是「脫口而出」,2026 年的模型會先想清楚才答,而且自己決定想多久。本文用教師看得懂的方式解釋思維鏈、推理力度與自適應思考的演變,對照四家供應商的調節掣設計,並說明它在評卷、數學與科學教學上真正改變了甚麼——以及仍然改變不了甚麼。
一位數學科教師用 AI 初批中三的二元一次方程題。最終答案全對,評語也寫得頭頭是道,但她翻到第三步時停住了:模型在移項時漏了負號,後面兩步卻用一個湊巧抵消的錯誤把答案「救」了回來。學生若照抄這份步驟,會學到一個錯的方法,而且會以為自己做對了。這正是 2024 年模型最典型的失敗模式——而 2026 年的推理模型,把這類錯誤減少了很多,卻沒有消滅它。
這兩年模型最大的改變不是「更聰明」,而是**「先想清楚才答」變成了預設行為**。對學校來說,這個轉變改變了三件事:評卷的可用程度、數理講解的可信度,以及帳單的形狀。
原理白話化:由「脫口而出」到「先打草稿」
早期的語言模型像一個被點名的學生:老師一問,他立刻開口,邊講邊想。答得快,但一遇到多步驟的題目就容易在中途走錯路。
思維鏈(chain-of-thought) 是最早的補救:在提示中加一句「請一步一步思考」,模型就會先把推導過程寫出來,再給結論。這招之所以有效,原因很樸素——模型是逐個 token 預測下一個 token 的,把中間步驟寫出來,等於給自己一張草稿紙,後面的每一步都能「看見」前面的推導。
到了 2024 至 2025 年,這張草稿紙被搬到幕後:模型在回答之前,先在內部生成一段使用者看不到(或只看到摘要)的思考內容,再輸出最終答案。OpenAI 的 o1、o3、o4-mini 系列是第一批這樣做的主流模型。2025 年 1 月 20 日,DeepSeek-R1 以開源權重公開了一個同類推理模型,證明這種能力不是大廠專利。2025 年 2 月 24 日,Anthropic 的 Claude 3.7 Sonnet 把「延伸思考」做成一個可切換的開關,是鏈式思考普及的里程碑。
2026 年進入第三階段:自適應思考(adaptive thinking)。模型不再等人類決定要不要思考,而是自己判斷這條問題值不值得想、想多久。教師可以這樣理解:第一代是「你叫他想他才想」,第二代是「你可以開一個思考開關」,第三代是「他自己看題目難度決定」,而你只能給他一個大致的力度指引。
實戰橫評:四家的「想多久」調節掣
以下為 2026 年 9 月各家官方文件所載的設計,不是效能評比。
| 供應商 | 參數名稱 | 可設層級 | 預設行為 | 對學校的實際意義 |
|---|---|---|---|---|
| OpenAI | reasoning.effort | low 至 max(GPT-6 Astra 不支援 none) | 依型號而定,GPT-5.6 預設 medium | 分檔最細,另有 standard 與 pro 兩種推理模式可獨立設定 |
| Anthropic | thinking 加 effort | low / medium / high / xhigh / max | Claude Fable 5.1 的 adaptive thinking 永久開啟,effort 預設 high | 預設就是「想清楚才答」,適合需要判斷的評語類任務 |
thinking_level | low / medium / high | 預設啟用動態思考 | 官方建議以降低 thinking_level 控制成本,而不是縮短 max_output_tokens | |
| xAI | reasoning_effort | low / medium / high / xhigh | 預設 high | 級別較少,設定較簡單 |
三點必須讀清楚:
- 力度是「行為指引」,不是硬上限。 Anthropic 文件寫得很直接:即使設為較低力度,遇到夠難的問題,模型仍然會選擇思考;真正的硬性上限是
max_tokens。學校不能靠調低力度來「保證」成本。 - 思考 token 按輸出價收費。 Google 的定價頁直接把該欄標示為「輸出價(包含思考 token)」。由於旗艦的輸出價通常是輸入價的五倍(GPT-6 Astra 是 10 對 50 美元),推理力度是 2026 年最容易失控的成本項。
- 「一步一步思考」這招過時了。 OpenAI 的推理最佳實踐文件明確指出,這類提示技巧對推理模型未必有幫助,有時反而有害。與其教模型怎樣想,不如把任務、輸出格式與限制寫清楚。這一點改變了整套提示寫法,詳見 提示工程課程。
對三個教學場景的實際改變
評卷:由「像評語」到「貼準則」
2024 年的 AI 評語最常見的問題是空泛:「內容尚可,結構可以改善」。它其實沒有真正對照過評分準則,只是生成了一段像評語的文字。
推理模型改變了這一點。它在回答前會逐條比對準則、在原文中找對應的句子,再決定分數。實務上的分別是:評語開始引用學生原文的具體句子,而且同一份準則跑三次的分數一致性明顯提高。這正是 AI 評卷 由「有趣的示範」變成「可以進教員室」的關鍵。
但有一條線沒有移動:評分結果仍須教師覆核才可發放。 推理讓評語更貼準則,不代表它理解你這一班的學情、不代表它知道上星期課堂上講過的重點。
數學:會展示步驟,但步驟仍可能錯
推理模型在多步驟計算上的可靠度明顯提升,而且能把中間步驟寫成可以放進工作紙的形式。對「差異化教學」尤其有用:同一條題目可以要求它生成三個難度層級的解法示範。
但開頭那位教師遇到的問題依然存在,只是頻率降低了:模型可以用完整而有條理的步驟,推導出一個錯的結論。 而且因為步驟寫得整齊,錯誤比以前更難被發現。我們的建議很具體:任何會發給學生的數學解題步驟,教師必須逐步核對,不能只核對最終答案。
科學:解釋能力提升,事實錯誤沒有變少
科學科的多步驟因果解釋(為甚麼會這樣、如果改變條件會怎樣)是推理模型最明顯的得益場景。但要分清兩件事:推理能力提升的是「由已知推出未知」,不是「知道得更多」。 模型仍然會記錯實驗數據、記錯教科書版本、記錯香港課程的單元編排,而且語氣一樣肯定。
邊界與局限:推理解決不了的四件事
一,推理不修正事實。 知識截止日期依然存在,而且各家不同:GPT-6 Astra 是 2026 年 4 月 30 日,Grok 4.6 是 2026 年 2 月 1 日,Claude Sonnet 5 更早至 2026 年 1 月。想得再久,也想不出截止日之後發生的事。需要現行資料的場景,答案必須來自學校自己的知識庫,見 校本知識庫(RAG)。
二,推理不修正本地知識的空白。 香港課程代碼、EDB 通函編號、學校全名——這些在訓練資料中本來就稀薄,推理只會讓錯誤的內容看起來更有條理。
三,延遲是真實的教學成本。 推理模型「想」的時候,學生在等。在課堂上,十五秒的等待已足以讓一班中三學生分心。這是為甚麼學生對話介面不應該一律使用高推理力度。
四,成本曲線是非線性的。 把力度由 medium 升到 xhigh,輸出 token 可能倍增,而輸出價是輸入價的五倍。一個沒有分流機制的整合,可以在一次批量評卷中燒掉整月預算。學校若直接自己接 API,務必先設用量上限。
還有一點值得說清楚:思考內容通常不可見或只有摘要。 這對追溯有影響——你能看到最終答案與理由陳述,但看不到模型完整的內部推導。因此稽核紀錄應保存輸入、輸出與模型設定,而不是假設可以事後重現思路。
落地指南:一套分流原則與一個提示框架
分流原則(平台層應該自動做,學校應該知道在做):
| 任務類型 | 建議力度 | 理由 |
|---|---|---|
| 分類、標記、格式轉換、通告草稿 | 最低 | 沒有推理需求,低延遲最重要 |
| 備課、出題、摘要 | 低至中 | 質素足夠,教師無論如何都會改 |
| 作文回饋、評分準則對照 | 中至高 | 需要判斷與逐條對照 |
| 多步驟數理講解、跨文件政策交叉引用 | 高 | 值得付這個錢的少數場景 |
| 學生即時對話 | 低至中 | 延遲比深度重要,導師模式本來就只給提示 |
推理時代的提示框架(四段式):
- 角色與脈絡:「你是香港中學數學科教師,對象是中三學生。」
- 任務:一句話說清要做甚麼,不要教它怎樣想。
- 輸出格式:明確列出要甚麼欄位、多少項、用甚麼語言。
- 限制:這一段最重要——不確定的地方要註明而不是自行填補、用繁體中文與香港用語、不要直接給答案。
實例:
你是香港中學數學科教師,對象是中三學生。
任務:就以下二元一次方程應用題,寫出完整解題步驟,並在每一步後加一句說明該步的目的。
輸出:步驟表(步驟 / 運算 / 目的),以及三個學生最常犯的錯誤。
限制:用繁體中文(香港用語);每一步的運算必須可以獨立驗算;若題目資料不足,寫明「資料不足」而不要自行假設數值。
[貼上題目]
最後一句是關鍵:明確要求「每一步可以獨立驗算」,把教師的覆核成本由「重做一次」降到「逐行掃一次」。
結語
推理革命讓 AI 由「快而淺」變成「慢而準」,並把「想多久」這個決定交回模型自己。對學校而言,真正的收穫是評卷與數理講解終於進入可用範圍;真正的風險是條理分明的錯誤比雜亂無章的錯誤更難被發現,而成本會隨思考深度悄悄上升。
正確的應對不是關掉推理,也不是全開,而是按任務分流,並在所有會流向學生的輸出前面保留教師這一關。想了解平台如何處理這一層,見 功能總覽;想比較四家供應商在其他方面的差異,見 四大美國模型供應商橫評。
常見問題
不是。推理降低的是「粗心」與「跳步」的錯誤,不是事實錯誤。模型仍然會用完整而有條理的步驟,推導出一個錯的結論;而且知識截止日期與本地資訊的幻覺問題完全沒有改變。數學與科學的輸出仍須教師覆核。
因為 2026 年的模型會自行決定「想多久」。Anthropic 稱之為 adaptive thinking,Google 的 dynamic thinking 亦是預設行為。供應商文件明確說明,力度參數是行為指引而非硬性上限——即使設為最低,遇到夠難的題目模型仍會選擇思考。
對新一代推理模型,通常不需要,而且可能有反效果。OpenAI 的推理最佳實踐文件明確指出,「think step by step」這類技巧對推理模型未必有幫助,有時反而有害。與其教模型怎樣思考,不如把任務、輸出格式與限制寫清楚。
會。思考產生的 token 按輸出價計算。Google 的定價頁直接把該欄寫成「輸出價(包含思考 token)」。由於旗艦模型的輸出價通常是輸入價的五倍,把推理力度調高一級,帳單可以明顯上升。
不需要。這是平台層的工程決定,應該由平台按任務類型自動分流。學校要關心的是結果:日常任務夠快,難題夠準,而帳單是固定年費。
文中價格與規格數據截至 2026-09
- OpenAI — 推理模型文件(reasoning.effort)
- OpenAI — 推理最佳實踐
- OpenAI — API 部署檢查清單
- Anthropic — Thinking 文件(adaptive thinking)
- Anthropic — Effort 參數文件
- Google — Gemini API thinking 文件
- xAI — Grok 4.6 文件(reasoning 級別)
- · 本文所有價格、功能與規格以上列官方文檔為準;供應商可隨時調整,請於採購前自行覆核。
- · 文中提及的產品名稱與商標均屬其各自擁有者所有。Edor.ai 與該等公司並無合作、代理或贊助關係。
- · 本文為教育用途的獨立整理與評測,不構成任何採購建議或法律意見。
- · 涉及學生個人資料的應用,請按學校政策及《個人資料(私隱)條例》(PDPO)自行評估後才使用。
延伸閱讀
2026 全模型橫評:15 家供應商、一套學校用的選型框架
由 OpenAI、Anthropic、Google、xAI、Meta、Mistral,到 DeepSeek、Qwen、Kimi、GLM、MiniMax、豆包、混元、文心,再加上編碼專用的 Cursor Composer。本文以同一套學校用量估算,把 15 家供應商的價格、上下文、開放權重與實際可用性放在同一張表上,並提供一套四問選型框架。
閱讀全文中國大模型橫評:DeepSeek、Qwen、Kimi、GLM 等八家,香港學校可以怎樣用?
DeepSeek 的價格是 GPT-6 Astra 的六十七分之一,中文能力亦不輸人。那為甚麼校本平台不直接接上去?本文橫評 DeepSeek、Qwen、Kimi、GLM、MiniMax、豆包、混元與文心八家,說明開放權重與雲端 API 的關鍵分別,以及《個人資料(私隱)條例》下香港學校真正可行的三條路線。
閱讀全文由聊天機械人到 AI 代理:工具呼叫、多步驟自動化與 MCP,學校應該自動化甚麼?
聊天機械人只會說話,AI 代理會動手:查資料、讀文件、呼叫系統、連續執行多個步驟。本文用教師看得懂的方式解釋工具呼叫與 MCP 標準,對照各家的工具收費,並提出一份「應該自動化 / 不應該自動化」清單——關鍵不是 AI 能做甚麼,而是哪一步必須由人按下確認。
閱讀全文