Context Caching 與成本控制:為甚麼重複問同一份文件會便宜
同一份課程綱要問十條問題,第二條開始其實可以便宜很多。本課用「工作紙留在桌上不用重印」的比喻解釋 Context Caching,並說明它為甚麼順帶告訴你提示應該怎樣排列。
Read in English一位科主任在暑假做了一件很聰明的事。她把整份高中課程綱要貼進 AI,然後連續問了十四條問題:每個單元的核心概念是甚麼、哪些課題與初中重疊、建議的評估方式、可以連結的時事議題……
她後來問我們:「我每一條問題都要重新貼一次那份綱要嗎?好像很浪費。」
這條問題的答案,正好是理解 AI 成本結構最好的入口。
工作紙留在桌上,不用每次重印
想像你在做小組活動。每一組要用同一份三頁的資料,加上不同的討論題目。
笨的做法:每次換題目,就把那三頁資料重印一份,連同新題目一起發下去。三十組就印了九十頁。
聰明的做法:三頁資料印一次,留在桌上;每次只發一張寫着新題目的小紙條。
Context Caching 做的就是第二件事。當你連續多次向 AI 送出開頭完全相同的內容,供應商可以把處理那段開頭的結果暫存起來,下一次直接沿用,不必從頭再算一次。你付的是「小紙條」的錢,而不是「九十頁」的錢。
為甚麼便宜:省的是重複的功夫
模型每次讀輸入時,要把每一個字轉換成內部狀態,這一步佔用大量運算。這也是為甚麼輸入越長、費用越高。
快取的邏輯是:既然這段開頭上一分鐘才算過一次,結果還在,那就直接拿來用。主要供應商都提供這項機制,而且折扣幅度相當可觀——快取命中的輸入部分通常只需付原價的一小部分。Google 的 Gemini 對較新的型號預設啟用隱式快取,OpenAI 也對支援的型號預設開啟,Anthropic 則讓開發者明確標示要快取到哪一段。
對學校來說不需要記住哪一家怎樣做,只要記住一條實務原則。
那條原則:不變的放前面,會變的放後面
快取是由開頭往後比對的。只要開頭一模一樣,那部分就可以沿用;一旦開頭有任何改動,整段就對不上,要重新處理。
所以提示應該這樣排:
- 最前面:每次都相同的長材料——課程綱要、政策全文、評分準則、範例作品。
- 中間:任務說明。
- 最後:這一次獨有的問題,以及最重要的限制與格式要求。
眼利的讀者會發現,這個排法跟 Chunking、檢索重排與「迷失在中間」 教的完全一致:長材料在前、關鍵指示在最後。兩個完全不同的原因,指向同一個寫法。 一個是成本考慮,一個是準確度考慮,而它們剛好互相加強——這種巧合在實務上很少見,值得記住。
一個對學校最實際的推論
很多教師的習慣是:每問一條新問題就開一個新對話,把資料重新貼一次。這在成本與速度上都是最差的做法。
正確做法是一份材料、連續多條問題,留在同一個對話裡。這樣做有三個好處:快取生效所以更快更便宜;上下文一致所以答案之間不會互相矛盾;而且你可以在後面追問「剛才第三點,請引用原文」。
但要注意一個相反的情況:如果對話已經很長、話題已經漂走,那就應該重新開始。長對話會累積大量無關內容,而那正是上一課講的高風險區。規則是:同一份材料的連續追問留在同一個對話;換了主題就重開。
一個課室裡的例子
一所中學的英文科要為中四級製作一套閱讀材料題庫。原始材料是六篇文章,每篇要出四種題型:詞彙、理解、推論、寫作延伸。
第一位老師的做法是開二十四個新對話,每次貼一篇文章加一種題型要求。她花了一個下午,而且發現不同對話出來的題目風格不一致,還要再統一一次。
第二位老師的做法是:一篇文章開一個對話,先貼文章與科組的出題格式規範(這兩項每次都一樣),然後在同一個對話裡連續要求四種題型。六個對話完成全部工作,速度明顯快得多,而且同一篇文章的四種題型風格自然一致,因為它們共用同一段上下文。
更有意思的是第三步:她把「文章 + 出題格式規範」這個固定開頭存成科組模板,放進共用資料夾。下一位老師只要換文章那一段,格式規範完全不用重寫。這時候「快取」已經不只是技術機制,而變成科組的工作方法。
這對你的課堂意味甚麼
- 同一份材料的問題,一次問完。 這是最省時間、最省成本、也最容易得到一致風格的做法。
- 把固定的規範寫成模板放最前面。 科組出題格式、評分準則、用語規範這些每次都一樣的東西,值得存成一段可以直接複製的固定開頭。
- 不要在文件前面加會變動的東西。 一句「今天是九月十一日」放在最前面,就足以讓整份文件的快取失效。要寫日期,寫在最後。
- 理解成本結構,才看得懂報價。 供應商按 token 計費時,一份長文件重複問二十次的帳單與問一次差距極大;校本平台採固定年費的意義正在這裡,詳見 收費方式。
- 成本考慮不能凌駕私隱考慮。 便宜不等於適合。學生個人資料的處理位置,永遠先看 安全與私隱 再看價錢。
一個可以立即試的排列練習
同一份材料,兩種排法,你會感覺到回應速度的差別:
(排法 A:建議)
以下是本校中文科小五單元三的教材全文。
<<<
[貼上教材,長段落放這裡]
>>>
任務:根據上述教材出題。
本次問題:請出三條推論題。
最後要求:只可根據教材內容出題,不要引入教材以外的資訊;每條題目附一句評分要點,不超過 25 字。
(排法 B:不建議)
請出三條推論題,只可根據教材內容,每條附評分要點。今天是 9 月 11 日。
以下是教材全文:
<<<
[貼上教材]
>>>
排法 A 的固定部分在前,換問題時只改最後兩行,快取容易命中,而且最重要的限制落在注意力最高的位置。排法 B 每次都在最前面改動,快取幾乎不會命中,而限制又被埋在開頭。
接下來
到目前為止,AI 都只是在讀你給它的東西。下一課要處理一個本質不同的問題:如果它可以自己去查、自己去算、自己去執行動作呢?見 由 Chatbot 到 AI Agent:Tool Calling 與 MCP。想回顧為甚麼中文的 token 數較多,見 Tokenization 與中文為何較貴;想比較各供應商的實際定價,見 AI 模型資料庫。
本課重點
- Context Caching 就是把同一份工作紙留在桌上,下一位學生直接用,不必重印一次
- 快取只認提示的開頭部分,所以固定不變的材料要放最前,每次改變的問題放最後
- 快取節省的是重複處理輸入的成本,主要供應商的折扣幅度相當大
- 對學校而言最實際的用法是「一份文件、連續多條問題」,而不是每次重新開一個新對話
常見問題
需要,原因有兩個。一是理解成本結構,你才看得懂為甚麼有些供應商用得越多越貴、而校本平台可以用固定年費;二是快取的原理直接影響你寫提示的順序,而這一點在任何工具裡都用得上。
快取是短期的技術性暫存,用來加速同一段開頭的重複處理,一般在數分鐘至數十分鐘後失效,並非長期儲存,也不等於用於訓練。但這不改變原則:敏感資料應在有守門與稽核的平台內處理,或選擇本地部署,見 [安全與私隱](/security)。
通常是因為開頭有東西改變了。哪怕在文件前面多加了一句「今天是九月十一日」,整段開頭就對不上,快取就失效。這也是為甚麼建議把所有會變動的內容一律放到最後。
- · 本文所有價格、功能與規格以上列官方文檔為準;供應商可隨時調整,請於採購前自行覆核。
- · 文中提及的產品名稱與商標均屬其各自擁有者所有。Edor.ai 與該等公司並無合作、代理或贊助關係。
- · 本文為教育用途的獨立整理與評測,不構成任何採購建議或法律意見。
- · 涉及學生個人資料的應用,請按學校政策及《個人資料(私隱)條例》(PDPO)自行評估後才使用。