第 27 課模組六:安全、評估與核心痛點 13 分鐘· 程度: 進階

自動化評估與排行榜:MMLU、GPQA 與 Chatbot Arena 怎樣看

用公開試排名的比喻解釋 AI 排行榜的價值與盲點,說明 MMLU、GPQA、Chatbot Arena 與 LLM-as-a-Judge 各自量度甚麼,以及學校自己那 30 條題目為甚麼更重要。

Read in English

一句話答案:排行榜像公開試排名——它告訴你一些真實的事,但不會告訴你這間學校適不適合你的孩子。學校要看榜,但決定要由自己那三十條題目來做。

由一次採購會議說起

一位副校長把一張列印出來的排行榜放在會議桌上:「這個模型排第一,我們就用這個吧?」

資訊科技組主任問了一條問題:「這張榜有沒有一項是測繁體中文寫作的語感?」

沉默。榜上有數學、有科學、有程式碼、有多語言平均分,但沒有一項回答「它幫我們中文科老師寫的評語像不像人話」。

這不是說榜單沒用,而是說它回答的問題和學校要問的問題不同。

公開試排名的比喻

想像一份學校排名表。它是真實資料,由真實的公開試成績算出來,排第一的學校確實有它的實力。但你決定送孩子去哪一間學校時,只看這張表就作決定,你會漏掉甚麼?

  • 這張表沒有量度校風、師生關係、課外活動、家校溝通
  • 這張表沒有量度適不適合你的孩子。有些孩子在競爭激烈的環境會發光,有些會枯萎。
  • 有些學校會針對排名優化——收生篩選、集中資源在計分科目。分數是真的,但代表的東西變了。
  • 這張表是過去的,而學校今年換了校長。

AI 排行榜的四個限制,和這四點一一對應。

三種常見的榜,各自量度甚麼

MMLU 是一份跨學科的多項選擇題卷,涵蓋數十個學科,由中學程度到專業程度都有。它的長處是覆蓋面廣、容易比較;短處是多項選擇題與真實使用差距很大——會揀答案不等於會解釋給小五學生聽。它推出得早,現在大部分新模型分數都擠在很高的區間,分辨力已經下降。

GPQA 是研究生程度的科學問答,而且刻意設計成「搜尋引擎幫不到」——即使給非該領域的專家上網查,也很難答對。它量度的是深層推理能力。對學校的直接參考價值不大(沒有幾位教師需要模型答研究生化學題),但它是一個有用的間接訊號:在 GPQA 表現好的模型,通常在多步驟推理上比較穩。

Chatbot Arena 的做法完全不同。它不出題,而是讓真人使用者同時看到兩個匿名模型的回答,投票選哪個較好,再用類似棋類的等級分制度排名。長處是它量度的是人類實際偏好,不是考試分數;短處是投票者不是你的教師群體,而且人類偏好本身有傾向——較長、格式工整、語氣自信的答案容易贏,即使內容未必更準確。

LLM-as-a-Judge:用 AI 評 AI

當題目多到人手評不完,業界的做法是找一個強力模型來當評審,給每個回答打分。這叫 LLM-as-a-Judge,它便宜、快、可以重複跑。

它也有幾個已知的偏好,學校自己做評估時要留意:

  • 偏愛長答案。同樣正確的兩個回答,長的容易得高分。
  • 偏愛格式工整。有標題、有項目符號的答案看起來更專業。
  • 位置效應。同樣兩個答案,調換先後次序,評分可能改變。
  • 同門偏袒。評審模型有時對風格相近的模型評分較高。

實務上的對策很簡單:讓每對答案跑兩次並調換次序、明確寫出評分準則而不是只問「哪個比較好」、並且用少量人手覆核校準。

排行榜是可以被針對的

這一點必須說清楚,因為它直接影響學校該怎樣讀那些數字。

資料污染是最主要的機制。公開的測試題目會流到網上,模型訓練時讀了進去,考試時答對可能只是背過答案。這不一定是供應商刻意作弊,但結果一樣:分數高估了真實能力。這也是為甚麼新發布的評測、私有題目集,以及「模型發布日期之後才出現的題目」特別有價值。

還有一種更軟性的針對:照着榜單的題型優化。當整個行業都盯着幾個榜,模型自然會在那幾類題目上愈做愈好,而在沒人量度的地方(例如繁體中文的語氣是否自然)沒有進步的壓力。

結論不是「榜單都是假的」,而是:榜單告訴你哪些模型值得放進候選名單,但不能替你做最後決定。

一個課室裡的例子

一間中學做了一件很簡單但非常有效的事:建立一份校本評估集

他們花了兩個下午,由五個科組各交五至十條題目,合共 40 條,全部來自教師真實會做的事:

  • 中文科:三份初中作文,要求生成三項具體改進建議(不給分數)
  • 英文科:五條詞彙練習生成、兩段作文回饋
  • 數學科:五條中三程度文字題的分步解說
  • 常識 / 通識:五條需要引用香港本地資料的概念解釋
  • 校務:三份通告草稿(中英對照)、兩份會議紀錄摘要

評分方式刻意做得很粗:兩位教師盲看,每份只答「可以直接用 / 要小改 / 要大改」。沒有五分制,沒有加權平均。

結果推翻了會議桌上那張榜。榜上排名較後的一個模型,在繁體中文評語與通告草稿上明顯較好;榜上第一的模型在數學分步解說上確實領先。於是學校的決定不是「用哪一個」,而是「哪個模組用哪一個」。

這份 40 條的題目集後來成了常設工具:每次供應商更新模型、每次調整量化等級(第 21 課)、每次考慮微調(第 20 課),都重跑一次。

這對你的課堂意味甚麼

  1. 榜單用來篩選,不用來決定。 用它把候選由二十個縮到三個,然後用自己的題目分勝負。
  2. 建立你自己的三十條題目,今個學期就做。 這是整個 AI 採購流程中投資報酬率最高的兩個下午。
  3. 記錄基線,否則你無法察覺退步。 供應商靜靜換了模型版本、學校調了設定,沒有基線就只能靠感覺。
  4. 不要問「哪個模型最好」,要問「哪個模組用哪個模型」。 不同任務的贏家不同,這才是省錢又提升質素的做法。

在 Edor.ai 裡是怎樣運作的

平台的設計讓上述做法可以真的執行,而不是停留在建議。

管理員可在後台按模組切換供應商(OpenAI、Azure OpenAI、Anthropic、Poe、本地 Ollama),所以學校可以用同一批校本題目在不同模型上實測,再把作文回饋、數學解說、通告草稿分別指向表現最好的模型。ai_audit_logs 稽核紀錄會記下每次互動用了哪個模型與多少用量,讓學校在換模型前後有可比較的基線。

還有一項常被忽略的資源:評卷模組的即時回饋一律需要教師覆核,而教師每一次的修改本身就是一次人手評估。累積下來,這些修改既是校本評估集的素材,也是第 20 課提到的微調素材。

各模型的規格與定位比較,見 AI 模型資料庫2026 全模型橫評

小結

公開榜單是有用的地圖,但不是你學校的地形圖。它由別人的題目、別人的偏好、別人的使用場景組成,而且可以被針對。真正能回答「我們該用哪個模型」的,是一份四十條題目、來自你自己科組、每次改動都重跑一次的清單。

下一課是本課程最後一課,我們把視線放遠一點:未來趨勢:多模態、推論型模型與具身智能。上一課見 私隱、偏見與版權

本課重點

  • 排行榜像公開試排名,它告訴你一些真實的事,但不會告訴你這間學校適不適合你的孩子。
  • 榜單是可以被針對的,訓練資料混入測試題就會令分數失真,所以高分不等於在你的場景好用。
  • 用 AI 評 AI 有效率,但評審模型有自己的偏好,例如偏愛較長與格式工整的答案。
  • 一組 30 至 50 條、來自學校實際場景的題目,比任何公開排名更能決定你該用哪個模型。

常見問題

不建議。排行榜量度的是通用能力的平均值,而學校關心的是幾個很具體的場景,例如粵語口語回饋、香港課程用語、繁體中文寫作的語感。這幾項在通用榜單上幾乎不佔分數。用你自己的題目測,結論常常和榜單不同。

如果測試題目在網上公開,而模型訓練時把它們一併讀了進去,那模型答對就可能只是記得答案而不是懂得推理。這叫資料污染。它是所有公開評測的固有問題,也是為甚麼新推出的評測與私有題目集特別有價值。

30 至 50 條已經很有用,前提是題目來自教師實際會做的事,並涵蓋不同科目與難度。重點不是統計上嚴謹,而是每次換模型或換設定時可以重跑同一批題目,看得出變化。

資料來源、信任標籤與免責聲明
  • · 本文所有價格、功能與規格以上列官方文檔為準;供應商可隨時調整,請於採購前自行覆核。
  • · 文中提及的產品名稱與商標均屬其各自擁有者所有。Edor.ai 與該等公司並無合作、代理或贊助關係。
  • · 本文為教育用途的獨立整理與評測,不構成任何採購建議或法律意見。
  • · 涉及學生個人資料的應用,請按學校政策及《個人資料(私隱)條例》(PDPO)自行評估後才使用。
訂閱教育 AI 通訊

每月一封:給香港學校的 AI 教學實戰文章、平台更新與撥款資訊。隨時可取消。

我們只會用此電郵寄送通訊,不會分享給第三方。