暫不支援MiniMax(稀宇科技) · 中國

MiniMax(M3 / M2.7):用稀疏注意力把長上下文做便宜的一家,以及學校要注意的授權問題

MiniMax M3 約於 2026 年 6 月推出,約 4,280 億總參數、每 token 啟動約 230 億,採 MSA 稀疏注意力與 100 萬 token 上下文,推廣價每 100 萬 token 0.30 / 1.20 美元(標價 0.60 / 2.40),權重在 Hugging Face 以自訂授權公開。本頁說明它的技術取向、成本優勢,以及香港學校在授權與資料落地上必須先處理的問題。

Edor.ai 支援狀態
暫不支援目前未接入,亦不建議學校用於學生場景

目前未接入。MiniMax M3 走「稀疏注意力 + 低成本長上下文」路線,約 4,280 億總參數但每 token 只啟動約 230 億,是同級中最便宜的長上下文模型之一;不過官方 API 在中國內地,授權條款亦需逐項核對,學校若要用建議先由 IT 主任做私隱與授權評估。

Read in English

規格速覽

供應商
MiniMax(稀宇科技) · 中國
現行代表型號
MiniMax M3
發佈日期
2026-06
上下文長度
1,000K tokens
最大輸出
官方未公佈
支援模態
文字 / 圖像
開源權重
有 (自訂授權(見 Hugging Face model card))
API 定價
$0.3 / $1.2 — 美元 / 100 萬 tokens(輸入 / 輸出)
有免費使用層

一句話答案:MiniMax 走的是「用稀疏注意力把長上下文做到很便宜」這條路,工程思路清晰、價格也真的低;但它的權重用自訂授權、API 在中國內地,對香港學校而言是要先過法律與私隱兩關,才談得上技術評估。

這是甚麼

MiniMax(稀宇科技)是上海的模型團隊,產品線橫跨語言、語音、音樂與影片模型。在語言模型這條線上,它的定位一直很一致:不追求最大,而是追求「同樣的長上下文,更低的成本」

這個定位由早期的 MiniMax-Text-01 就開始,當時以線性注意力的變體挑戰超長上下文,對後來各家的長上下文設計有影響;到 2026 年的 M3,則換成自家的 MSA 稀疏注意力。對學校而言,不需要理解演算法細節,只需要知道結論:同樣是 100 萬 token 的上下文,MiniMax 的每 token 成本比多數同級模型低。

現行陣容

  • MiniMax M3(約 2026 年 6 月):約 4,280 億總參數、每 token 啟動約 230 億,採 MSA 稀疏注意力,100 萬 token 上下文。推廣價每 100 萬 token 輸入 0.30 美元、輸出 1.20 美元,標價為 0.60 / 2.40 美元。權重可在 Hugging Face 下載,採 MiniMax 自訂授權。
  • MiniMax M2.7(2026 年 4 月 12 日開源):把「代理導向 + 低成本」定位確立下來的版本,至今仍常見於各類部署。
  • MiniMax-Text-01(2025 年 1 月):以線性注意力變體挑戰超長上下文的早期嘗試,在技術史上有其位置。

完整的版本與價格對照,見本頁下方自動生成的系列表。

優點

  1. 長上下文的單位成本低。 這是 MiniMax 最實在的賣點。若工作流需要反覆讀大批文件(例如整理全級課業或大量會議紀錄),成本差距在帳單上會非常明顯。
  2. 稀疏注意力是真正的工程貢獻。 把 100 萬 token 由「做得到但很貴」推向「做得到而且用得起」,是 2026 年長上下文普及的其中一個原因,值得給予技術上的肯定。
  3. 權重公開可下載。 有能力自架的機構可以完全控制資料流向,不必依賴雲端 API——前提是授權條文允許,以及硬件負擔得起。
  4. MoE 架構讓推論效率不俗。 每 token 只啟動約 230 億參數,推論速度與延遲表現比同等總參數的密集模型好,對互動式使用有實際分別。

缺點與局限

  • 授權是自訂條款。 不是 MIT,也不是 Apache 2.0,條文需要逐項閱讀。學校或辦學團體若要用於校本系統,應先取得法律意見,不能以「開源」二字帶過。
  • API 位於中國內地。 直接呼叫即屬跨境資料傳輸,涉及師生個人資料時必須先完成《個人資料(私隱)條例》下的評估。
  • 推廣價不等於長期價。 0.30 / 1.20 美元是推廣價,標價是它的兩倍。學校做多年預算時應以標價為基準,把推廣價當成額外的緩衝。
  • 自架門檻仍高。 4,280 億總參數要全部載入記憶體,所需硬件遠超一般學校機房;能受惠於這個模型的,主要是有 GPU 叢集的機構。
  • 教育場景資料稀少。 沒有針對香港課程的提示範本、教學案例或教師社群,IT 主任要自行摸索,培訓與支援成本比主流供應商高。

香港學校可以怎樣看待它

最務實的態度是:把 MiniMax 當成理解「長上下文為何變便宜」的教材,而不是採購清單上的候選項。

如果學校仍想評估,建議按這個次序處理。第一關是授權:把 Hugging Face 上的授權條文交給辦學團體的法律顧問,確認商用、再散布與標示要求是否與校本用途相容。第二關是資料落地:若計劃呼叫官方 API,就要老實完成跨境傳輸評估,並向家長說明學生資料的處理方式;若計劃自架,這一關可以省掉,但要換成硬件與維運的現實評估。第三關才是模型本身的教育適用性——中文表現、繁體用語、內容政策邊界,都應該用學校自己的題目測試,而不是看跑分。

順帶一提,「便宜」在學校情境往往被高估。以 Edor.ai 的定價模式為例,學校付的是固定年費、AI 用量已包含在內,沒有 token 帳單;在這種模式下,供應商的每 token 價格並不是學校的直接開支,反而是資料處理地點與安全守門更值得關注。

在 Edor.ai 的可用性

目前未接入。 平台原生支援 OpenAI、Azure OpenAI、Anthropic、Poe 與本地 Ollama,MiniMax 不在其中,管理員在後台不會看到這個選項。未接入的原因就是上文兩項:自訂授權條款需要逐項法律核對,以及官方 API 位於中國內地屬跨境傳輸。

我們與 MiniMax 沒有任何合作關係,本頁純粹是把可核實的資料整理出來,方便學校自行判斷。

替代方案

同一家的不同系列

同一供應商往往同時維持旗艦、主力、輕量與推理多條產品線,價格可以相差十倍以上。

型號定位發佈日期上下文長度輸入 / 輸出說明
MiniMax M3旗艦2026-061,000K$0.3 / $1.2約 4,280 億總參數、每 token 啟動約 230 億,採 MSA 稀疏注意力,100 萬 token 上下文;推廣價 0.30 / 1.20 美元(標價 0.60 / 2.40),Hugging Face 有可下載權重。
MiniMax M2.7開源權重2026-04-12開源版本,把「代理導向 + 低成本」定位確立下來。
MiniMax-Text-01開源權重2025-01-15以線性注意力變體挑戰超長上下文的早期嘗試,對後來各家的長上下文設計有影響。

常見問題

傳統注意力機制要讓每個字詞與前文所有字詞比對,長度一長,計算量就急升。稀疏注意力只讓每個字詞與一部分位置比對,計算量大幅下降,長上下文的成本與速度因此改善。代價是設計取捨:哪些位置可以略過、會否漏掉關鍵資訊,屬於模型設計的工程判斷。

這是混合專家(MoE)架構。模型內部有許多「專家」子網絡,每次推論只調用其中一小部分,所以運算量接近一個 230 億參數的模型,而知識量接近 4,280 億。要注意的是,記憶體仍需裝下全部參數,所以自架的硬件門檻是按總參數計,不是按啟動參數計。

自架的確可以避免資料出境,但仍有兩關要過:一是授權條文必須容許你的使用方式,二是硬件。4,280 億總參數需要伺服器級 GPU,單一學校很少負擔得起。兩關都過不了的話,自架只是紙上方案。

對做預算的人很重要。0.30 / 1.20 美元是推廣價,標價是 0.60 / 2.40 美元,即隨時可能回復到兩倍。任何以推廣價計算的三年預算都應該同時算一次標價版本,否則一旦調整就要臨時找錢。

若可接受雲端,先看平台已原生支援的供應商裡的低成本型號;若堅持資料留校,則看可在單機運行的 270 億參數級別開源模型。MiniMax 的價格優勢主要體現在超大量 API 呼叫,而學校的用量模式通常不是這樣。

資料來源、信任標籤與免責聲明

文中價格與規格數據截至 2026-09

  • · 本文所有價格、功能與規格以上列官方文檔為準;供應商可隨時調整,請於採購前自行覆核。
  • · 文中提及的產品名稱與商標均屬其各自擁有者所有。Edor.ai 與該等公司並無合作、代理或贊助關係。
  • · 本文為教育用途的獨立整理與評測,不構成任何採購建議或法律意見。
  • · 涉及學生個人資料的應用,請按學校政策及《個人資料(私隱)條例》(PDPO)自行評估後才使用。

延伸閱讀

  • 中國大模型橫評:DeepSeek、Qwen、Kimi、GLM 等八家,香港學校可以怎樣用?

    DeepSeek 的價格是 GPT-6 Astra 的六十七分之一,中文能力亦不輸人。那為甚麼校本平台不直接接上去?本文橫評 DeepSeek、Qwen、Kimi、GLM、MiniMax、豆包、混元與文心八家,說明開放權重與雲端 API 的關鍵分別,以及《個人資料(私隱)條例》下香港學校真正可行的三條路線。

  • 2026 全模型橫評:15 家供應商、一套學校用的選型框架

    由 OpenAI、Anthropic、Google、xAI、Meta、Mistral,到 DeepSeek、Qwen、Kimi、GLM、MiniMax、豆包、混元、文心,再加上編碼專用的 Cursor Composer。本文以同一套學校用量估算,把 15 家供應商的價格、上下文、開放權重與實際可用性放在同一張表上,並提供一套四問選型框架。

訂閱教育 AI 通訊

每月一封:給香港學校的 AI 教學實戰文章、平台更新與撥款資訊。隨時可取消。

我們只會用此電郵寄送通訊,不會分享給第三方。