第 16 課模組四:進階技巧與持續精進 12 分鐘· 程度: 實作

多模態提示:圖片、手寫功課與語音

拍下手寫功課、讀取圖表、評閱英文與普通話朗讀,三種多模態用法的提示寫法,以及中文手寫辨識與帶口音語音的準確度限制與教師覆核要求。

Read in English

場景:拍下一頁數學功課,AI 說學生把 7 寫成 1

一位小六數學老師想省下逐條核對的時間,把學生的一頁計算功課拍照上傳,問了一句:

幫我改這頁數學功課。

AI 很爽快地列出五題錯,並附上詳細解釋。老師翻回原簿一看,其中兩題其實是對的——AI 把學生寫的 7 讀成 1,又把一個潦草的「×」讀成「+」。更麻煩的是,它連「我可能看錯」這句都沒有說,五題錯誤全部語氣一致地肯定。

如果這五題直接抄進評語派回學生,學生會為兩題不存在的錯誤重做一次。

同一張照片,把流程拆成兩步:

角色:你是數學功課的辨識助理,現階段不作評改。
任務:把圖片中學生的每一題算式原樣抄錄出來。
輸出格式:逐題編號列出你讀到的算式原文;另設「辨識信心低」一節,列出你不確定的數字或符號及其所在題號。
限制:只抄錄,不得計算、不得判斷對錯、不得補上學生沒有寫的步驟。字迹無法辨認時寫「無法辨認」,不要推測學生想寫甚麼。

老師花四十秒核對辨識結果,改正兩個字,再把確認過的文字交給評改提示。這一次的錯題清單是準的。

原理

多模態模型處理圖片與聲音的方式,和處理文字其實是同一套:把輸入轉成模型能理解的表示,然後預測最合理的輸出。關鍵在於**「最合理」不等於「最忠於原件」。** 當它看到一個模糊的手寫符號,它不會停下來說看不清,而是輸出在這個位置最可能出現的符號。這正是幻覺在圖像與語音上的表現形式,原理見 LLM 教室:幻覺與偏見從何而來多模態、推論型模型與具身智能

所以多模態提示的核心設計只有一句:把「看到甚麼」與「怎樣判斷」分成兩步。 一步做完,錯誤會被下一步的推理掩蓋——AI 讀錯了數字,然後根據錯的數字寫出一段很有道理的分析,教師很難看出問題出在第一步。分成兩步之後,教師核對的是一份短短的辨識清單,而不是一段完整的分析。

第二個要接受的現實是準確度差異。印刷英文最好,印刷中文次之,英文手寫再次,中文手寫最弱——筆劃多、形近字多、學生的日常字迹變化大。語音方面,清晰的標準發音辨識良好,而帶口音的英語、小學生的普通話朗讀、加上課室環境噪音,錯誤率會明顯上升。這不是某一家模型的問題,而是這一類任務的現況,所以提示必須要求它標明不確定之處。

模板一:手寫功課的兩步處理

第一步只做辨識,見上文示例。確認之後才用這一步評改。

角色:你是小六數學科的評改助理。
任務:根據下方已由教師核對的算式文字評改,指出錯在哪一步。
輸出格式:表格四欄——題號、錯誤所在的步驟、錯誤類型(概念/計算/抄寫/未能判斷)、給學生的一句提示。
限制:只根據提供的文字判斷,不得重新解讀圖片。不得重寫學生的完整解法,提示不得包含最終答案。無法判斷錯在哪一步時,「錯誤類型」填「未能判斷」並在提示欄寫「請教師查看原簿」。
已核對的算式:
[貼上第一步確認後的文字]

模板二:讀取圖表與示意圖

科學科與常識科最常用。重點是把「讀數」與「詮釋」分開。

角色:你是[科學科/常識科]的圖表解讀助理,面對[年級]學生的學習材料。
任務:解讀下方圖片中的[圖表/示意圖],供教師判斷是否適合用作課堂提問材料。
輸出格式:
1. 「圖上讀到的」——逐點列出你能直接讀到的數值、標籤與座標軸資料,每點註明位置(例如橫軸第三個數據點)。
2. 「需要推論的」——任何不是直接讀到而是你推斷出來的內容,逐點列出並說明依據。
3. 「讀不清楚的」——圖中模糊、被遮蓋或解像度不足的部分。
4. 三條可用於課堂提問的引導問題。
限制:不得把常見的趨勢或課本上的典型結論當成圖中的資料;凡不是直接讀到的一律放入第 2 部分。數值不確定時寫出範圍並註明「請教師核實」,不要給出精確數字。不要為學生解答圖表題。

模板三:朗讀與口語練習的回饋

用於英語朗讀或普通話朗讀。定位是練習回饋,不是評估分數。

角色:你是[英語/普通話]朗讀練習的回饋助理,面對[年級]學生。
任務:比對學生的朗讀錄音與下方原文,給出可以練習的具體回饋。
輸出格式:
1. 「聽到的差異」——列出與原文不同之處,每項標明原文的字詞與你聽到的內容。
2. 「辨識信心低」——因發音、語速或背景噪音而無法確定的片段,標明位置。
3. 「建議練習三項」——每項一句,說明練甚麼以及怎樣練。
限制:不要給出分數、等級或百分比。不要評論學生的口音本身,只指出與原文不符之處。無法確定的片段一律放入第 2 部分,不得當成錯誤計算。回饋語氣要鼓勵而具體,不得使用「發音很差」這類評價。不要重錄或替學生示範整段,只就個別字詞說明。
原文:[貼上朗讀材料]

常見錯誤

  1. 一步到位,直接要求評改照片。 辨識錯誤會被後面的分析包裝得很合理。修正:辨識與判斷分兩步,中間插入教師核對。
  2. 沒有要求標明不確定之處。 模型預設不會主動說「我看不清」。修正:輸出規格一定要有「辨識信心低」或「讀不清楚的」一節,並在限制行禁止推測。
  3. 把口語練習的回饋當成評估分數。 同一段錄音重跑可能得到不同結果,而家長會拿這個分數來問。修正:明文禁止輸出分數與等級,只輸出可練習的具體項目。
  4. 照片拍到姓名欄與學號。 這是最容易忽略的私隱問題。修正:拍攝前遮蓋或裁切身分欄位,或在有加密儲存與稽核紀錄的校本平台內處理。

進階變化

  • **視覺藝術科的作品回饋:**模板二改為描述構圖、用色與媒材,並要求分開「畫面上看到的」與「我的詮釋」。限制加一句不得評價學生的創作能力,只描述可觀察的特徵,且不得建議重畫。
  • **中國語文的手寫作文:**先用模板一的辨識步驟,並在限制加一句「學生的錯別字必須原樣抄錄,不得自動更正」,否則 AI 會把錯字改對,錯別字統計就失去意義。
  • **科學科的實驗記錄照片:**要求把讀數與單位分欄列出,並加一欄註明是儀器顯示值還是學生手寫的記錄值。
  • **英語口語的差異化:**對能力較弱的學生,把模板三的建議練習由三項減至一項,並要求提供一句示範句而不是整段;對能力較強的學生,加入語調與連讀的觀察。
  • **SEN 調適:**語言障礙或有言語治療需要的學生不應使用自動朗讀回饋作為進度指標;若要使用,限制加一句要求 AI 只列出差異而不作任何優劣判斷,並由教師或言語治療師詮釋。

小結與下一步

多模態把 AI 的用途由文字擴到課室裡真實存在的東西——一頁功課、一張圖表、一段朗讀。代價是多了一層不確定:它可能看錯或聽錯,而且不會主動告訴你。兩步流程與「標明不確定」這兩個設計,足以把這層風險收在可控範圍,餘下的由教師覆核補上。

口語練習在課堂上的實際安排見 AI 口語練習,評卷流程見 AI 評卷與即時回饋;把這些提示整理成科組可以共用的資產,見下一課 建立科組提示模板庫

本課重點

  • 多模態任務要分兩步:先請 AI 把它看到或聽到的原樣寫出來,教師確認無誤後才進行評分或分析。
  • 中文手寫辨識的準確度明顯低於印刷體與英文,字迹潦草、擦改與格線干擾都會令它認錯,而它會用很肯定的語氣把錯字讀成別的字。
  • 帶口音的英語與普通話朗讀評分只能作為練習回饋,不應作為評估依據;提示要求 AI 標明不確定的片段而不是給出精確分數。
  • 圖表題要限制 AI 只描述圖上讀得到的數值,推論部分另行標示,否則它會把常見趨勢當成圖中資料。

常見問題

印刷體與工整的楷書通常沒有問題,但小學生的日常字迹、有擦改痕迹、寫出格或拍攝角度傾斜的情況下,錯認率明顯上升,而且它不會告訴你它不確定——它會直接讀成一個形近的字。所以本課的模板一定要求它先輸出辨識結果並標出低信心的字,由教師核對後才進入評分。

作為練習回饋可以,作為評估分數不可以。語音辨識對帶口音的發音、語速不穩與環境噪音都很敏感,同一段錄音重跑兩次也可能得到不同結果。合理的用法是給學生具體可練的三點(某幾個音、句子重音、停頓位置),而不是一個百分比。

兩件事。一是照片裡不要拍到姓名欄、班別與學號,拍前先遮蓋或裁切;二是不要把學生作品上傳到沒有不訓練條款、沒有加密儲存與稽核紀錄的消費者工具。在校本平台內處理,或先去識別化再使用,兩者擇一。

訂閱教育 AI 通訊

每月一封:給香港學校的 AI 教學實戰文章、平台更新與撥款資訊。隨時可取消。

我們只會用此電郵寄送通訊,不會分享給第三方。