模型基礎框架 · 影片模型

MiniMax H3

想長期跟住本地部署嘅實測資訊?

用你嘅 agent 接我哋 MCP —— 接一次,之後你問同類問題,佢直接查我哋查證過嘅數字,唔使自己記。

用 agent 接駁 MCP →

呢一頁由開源模型專區嘅館主 agent NEO 維護 —— 資料由佢定期出去搵、核對原文、更新入庫。有錯或者想補充,右下角同佢講。

更新日期  · 資料版本 0d852ee5 · 綜合第三方實測,非本站自測

六格模型能力值Model Capability Score

畫面質素 · 文生片畫面質素 · 圖生片編輯能力物理遵從動作連貫 · 時間一致音畫同步

input文字(提示詞)圖片(圖生片)影片(改片)

output影片(含原生立體聲)

睇詳細 →

獨立顯卡Discrete GPU

4 張 GB200 出 832×480 一條片:5.1 秒

層硬件量化解像度步數引擎片長出片時間
消費級RTX 5090 32GB ×1 張卡BF161344×76850NVIDIA Sol Engine約 5.2 秒(=124 幀 ÷ 24 fps,計出)231.2 秒(≈ 3 分 51 秒)
消費級RTX 4070 12GB ×1 張卡LoRA 4-step576×8324ComfyUI約 5.2 秒(=124 幀 ÷ 24 fps,計出)79.36 秒(≈ 1 分 19 秒)
數據中心級NVIDIA GB200 ×4 張卡4-step832×4804FastH3(FastVideo)約 5.2 秒(=124 幀 ÷ 24 fps,計出)5.1 秒
數據中心級NVIDIA H100 ×4 張卡lossless1344×76850SGLang約 5.2 秒(=124 幀 ÷ 24 fps,計出)13.25 秒

每一行嘅量度條件都喺下面「出片速度」表;解像度、步數、量化唔同就唔可以直接比。

睇詳細 →

Apple 實測Apple Silicon

Apple 出 512×512 一條片(圖+聲):74.58 秒

機型量化解像度步數片長出片時間
Apple M4 Max 36GBMLX 4-step832×4804約 5.2 秒(=124 幀 ÷ 24 fps,計出)465 秒(≈ 7 分 45 秒)
Apple M5 Max 128GBint8512×51219原文冇寫25.8 秒

兩個解像度唔同(512×512 對 832×480),唔可以直接比;M5 嗰個 25.8 秒係去噪階段,端到端(圖+聲)74.58 秒。兩部都係社群加速版。

睇詳細 →

能力逐項睇Capability Detail

領先優良中弱落後

畫面質素 · 文生片表現:領先

淨係打字叫佢生成,出到嘅片靚唔靚、跟唔跟到你要嘅嘢

來源代號:S19/S44

  • AA Video Arena T2V 冇聲版 1302.19(第 3,同榜 88,票 5,574)
  • 有聲版 1220.23(第 4,同榜 37,票 8,602)
  • Arena AI T2V 1461.78(第 8,同榜 48,票 7,648,截止 2026-09-04)

≈ 線上付費模型:≈ Gemini Omni Flash 1330.41/Wan 3.0 1336.28(同榜付費模型)

認證級別:A 級(同榜 88 個模型)

邊界(幾時會唔準)

  • 同一個榜嘅冇聲版同有聲版唔可以互比
  • 榜上人數逐日變,要連讀取日一齊睇
畫面質素 · 圖生片表現:領先

餵一張圖叫佢動起來,出到嘅片靚唔靚、似唔似原圖

來源代號:S19/S44

  • AA Video Arena I2V 冇聲版 1353.89(第 4,同榜 82,票 5,535)
  • 有聲版 1181.44(第 2,同榜 36,票 6,949)
  • Arena AI I2V 1494.29(第 1,區間 1–3,同榜 48,票 49,443,截止 2026-09-14)

≈ 線上付費模型:≈ Gemini Omni Flash 1369.08/Wan 3.0 1360.63(同榜付費模型)

認證級別:A 級(同榜 82 個模型)

邊界(幾時會唔準)

  • Arena AI 嗰條係 API 版
  • 同榜另有 hailuo-2.3、hailuo-02-pro,引用要指明型號
編輯能力表現:良

叫佢改片(換物件、改天氣、改對白),改得準唔準

來源代號:S19/S44

  • AA Video Editing 有聲版總分 1132.48(第 2,同榜 9,票 11,757)
  • 冇聲版總分 1100.49(第 4,同榜 10,票 8,919)
  • Arena AI 改片 1392.20(第 3,區間 1–5,同榜 10,票 962)
  • CutCraft A 組 0.782(第 1,同榜 13,API 版)

≈ 線上付費模型:≈ Wan 3.0 1190.32(同榜付費模型)

認證級別:A 級(同榜 9 個模型)

邊界(幾時會唔準)

  • 呢幾個榜都係細榜(9 至 13 個)
  • AA 另有 5 個官方 tag 子榜(例如 1218.14),唔可以當總分
  • CutCraft 評嘅係 API 版

標註(榜況):AA Video Editing 有明確維護方(Artificial Analysis);同榜 9/10 個

物理遵從表現:領先

片入面嘅物理啱唔啱 —— 波會唔會穿牆、水會唔會倒流

來源代號:S46/S47

  • Physics-IQ Verified(README 視圖)39.8 ± 0.4(圖生片第 4,同榜 17,2026-09-04 入榜)
  • 官網視圖(Anates)39.8% ± 0.3(第 2,同榜 14,2026-08-24 入榜)

≈ 線上付費模型:≈ Grok Imagine Video 34.8 ± 0.6(xAI)/Sora 2 26.5 ± 0.8(OpenAI)

認證級別:A 級(同榜 17 個模型)

邊界(幾時會唔準)

  • 唔係 Google DeepMind 官方認證,榜由 Anates Labs 維護(官網明文 not endorsed)
  • 兩個視圖嘅同榜人數同誤差都唔一樣,引用要寫明用邊個

標註(榜況):榜由 Anates Labs 維護(官網明文 not endorsed by Google DeepMind)

動作連貫 · 時間一致表現:良

一條片由頭到尾,主體會唔會變形、跳格、前後唔一致

來源代號:S49

  • Sci-VBench(SC)2.62(第 5,同榜 16)

≈ 線上付費模型:≈ HappyHorse-1.1 2.66/Seedance-2.0 2.46(同榜付費/API 模型)

認證級別:A 級(同榜 16 個模型)

邊界(幾時會唔準)

  • 未獲公認(OpenAlex 學術引用 0)
  • 同榜只有 16 個

標註(榜況):未獲公認(OpenAlex 學術引用 0);同榜 16 個(影片類榜天生細)

音畫同步表現:弱

畫面同聲音夾唔夾 —— 嘴形對唔對得上、音效跟唔跟到動作

來源代號:S48/S50;同榜 13 個係 CutCraft 嘅榜(AVGen-Bench 同 StreamAV-Bench 同樣係 13 個,兩個榜都冇 H3)

  • CutCraft F1 0.603(10/13,同榜 13,API 版)
  • AVGen-Bench 榜首 Seedance 2.0 72.07(同榜 13,榜上冇 H3)
  • StreamAV-Bench 逐指標排名、冇總排名(同榜 13,榜上冇 H3)

≈ 線上付費模型:≈ Seedance 2.5 0.745/Veo 3.1 0.792(同榜 API 版)

認證級別:B 級(同榜 13 個模型)

邊界(幾時會唔準)

  • 三個公認榜都冇收錄 H3
  • F1 係子指標、唔係榜總分
  • 0.603 啱啱等於 P25 線(同「中」只差一線),一律評「弱」,唔可以講成明確落後
  • P50 中位 0.687 高於本值

點解唔係 A 級:CutCraft F1 係子指標、評嘅係 API 版、引用 0(未獲公認)

查證方法:2026-09-19 逐行核對三個業界榜:VBench 1.0(73 行)、AVGen-Bench(同榜 13)、StreamAV-Bench(13 個系統)—— 榜上冇 H3;CutCraft 有 H3 子指標分

EvalEvaluations

每一格背後嗰條榜、個分數、同池最接近嘅線上付費模型。

維度評測分數≈ 線上付費模型來源
畫面質素 · 文生片AA Video Arena(T2V)/Arena AI Video Arena AA Video Arena T2V 冇聲版 1302.19(第 3,同榜 88,票 5,574)/有聲版 1220.23(第 4,同榜 37,票 8,602)/Arena AI T2V 1461.78(第 8,同榜 48,票 7,648,截止 2026-09-04) ≈ Gemini Omni Flash 1330.41/Wan 3.0 1336.28(同榜付費模型) S44 S19
畫面質素 · 圖生片AA Video Arena(I2V)/Arena AI Video Arena AA Video Arena I2V 冇聲版 1353.89(第 4,同榜 82,票 5,535)/有聲版 1181.44(第 2,同榜 36,票 6,949)/Arena AI I2V 1494.29(第 1,區間 1–3,同榜 48,票 49,443,截止 2026-09-14) ≈ Gemini Omni Flash 1369.08/Wan 3.0 1360.63(同榜付費模型) S44 S19
編輯能力AA Video Editing/Arena AI Video Arena/CutCraft AA Video Editing 有聲版總分 1132.48(第 2,同榜 9,票 11,757)/冇聲版總分 1100.49(第 4,同榜 10,票 8,919)/Arena AI 改片 1392.20(第 3,區間 1–5,同榜 10,票 962)/CutCraft A 組 0.782(第 1,同榜 13,API 版) ≈ Wan 3.0 1190.32(同榜付費模型) S44 S48 S19
物理遵從Physics-IQ Verified Physics-IQ Verified(README 視圖)39.8 ± 0.4(圖生片第 4,同榜 17,2026-09-04 入榜)/官網視圖(Anates)39.8% ± 0.3(第 2,同榜 14,2026-08-24 入榜) ≈ Grok Imagine Video 34.8 ± 0.6(xAI)/Sora 2 26.5 ± 0.8(OpenAI) S46 S47
動作連貫 · 時間一致Sci-VBench(SC) Sci-VBench(SC)2.62(第 5,同榜 16) ≈ HappyHorse-1.1 2.66/Seedance-2.0 2.46(同榜付費/API 模型) S49
音畫同步CutCraft/AVGen-Bench/StreamAV-Bench CutCraft F1 0.603(10/13,同榜 13,API 版)/AVGen-Bench 榜首 Seedance 2.0 72.07(同榜 13,榜上冇 H3)/StreamAV-Bench 逐指標排名、冇總排名(同榜 13,榜上冇 H3) ≈ Seedance 2.5 0.745/Veo 3.1 0.792(同榜 API 版) S48 S50 S51

出片速度Seconds per Clip

逐條實測:邊部機、咩量化、幾多步、出幾長,跑幾多秒。單位係秒/條片。

硬件量化解像度片長步數引擎出片時間數字量嘅版本原文
RTX 5090 32GB ×1 張卡BF16 1344×768約 5.2 秒(=124 幀 ÷ 24 fps,計出)50 NVIDIA Sol Engine231.2 秒 Sol-Engine-H3-OnDevice 原文
DGX SparkBF16 832×480約 5.2 秒(=124 幀 ÷ 24 fps,計出)50 NVIDIA Sol Engine181.3 秒 Sol-Engine-H3-OnDevice 原文
RTX 5090 32GB ×2 張卡lossless 1344×7685 秒50 SGLang559.67 秒 SGLang-upstream 原文
RTX 5090 32GB ×2 張卡INT4(offload) 1344×768約 5.2 秒(=124 幀 ÷ 24 fps,計出)50 vLLM-Omni518 秒 vLLM-Omni-upstream 原文
Apple M4 Max 36GBMLX 4-step 832×480約 5.2 秒(=124 幀 ÷ 24 fps,計出)4 FastH3(FastVideo)465 秒 FastH3-MLX 原文
DGX SparkMLX 4-step 832×480約 5.2 秒(=124 幀 ÷ 24 fps,計出)4 FastH3(FastVideo)243 秒 FastH3-MLX 原文
NVIDIA GB200 ×4 張卡4-step 832×480約 5.2 秒(=124 幀 ÷ 24 fps,計出)4 FastH3(FastVideo)5.1 秒 FastH3-MLX 原文
RTX 4070 12GB ×1 張卡LoRA 4-step 576×832約 5.2 秒(=124 幀 ÷ 24 fps,計出)4 ComfyUI79.36 秒 Turbo LoRA 原文
Apple M5 Max 128GBint8 512×512原文冇寫19 antirez h3.c(Metal)25.8 秒 h3.c-Metal 原文
NVIDIA H100 ×4 張卡lossless 1344×768約 5.2 秒(=124 幀 ÷ 24 fps,計出)50 SGLang13.25 秒 SGLang-upstream 原文

「數字量嘅版本」=原版官方權重/社群衍生模型/上游引擎配置。解像度、步數、量化方式唔同嘅秒數唔可以直接比。

VRAM 峰值 Peak VRAM

解像度量化峰值記憶體硬件原文
1344×768lossless26.3 GiB/GPU RTX 5090 32GB ×2 張卡原文
1344×768INT4(offload)22.6 GiB/GPU RTX 5090 32GB ×2 張卡原文
576×832LoRA 4-step10.66 GiB RTX 4070 12GB ×1 張卡原文
512×512int825.9 GiB Apple M5 Max 128GB原文
1344×768lossless66.04 GB/GPU NVIDIA H100 ×4 張卡原文

片長・fps・音訊 Length · Frame Rate · Audio

項目官方規格來源
片長上限15 秒(官方 model card)G03
輸出幀率24 FPS(官方 model card)G03
音訊32 kHz 立體聲(原生生成,非配音)G03
最低記憶體查唔到(官方只講 consumer GPU 跑得到、冇出最低記憶體;第三方實測峰值 10.66–31.8 GiB)G03

真實成功部署實例Real Deployments

以下每一個,都係有人真係咁砌、真係跑過嘅實例;每個數字都可以開原文核對。

硬件
RTX 5090 32GB ×1 張卡 · BF16 · NVIDIA Sol Engine
片長
約 5.2 秒(=124 幀 ÷ 24 fps,計出)
出片時間
231.2 秒(≈ 3 分 51 秒)
量度條件
warm、batch 1;同機未優化 1045.4 秒(4.52×)
原文
開原文 V01|Sol-Engine-H3-OnDevice
硬件
DGX Spark · BF16 · NVIDIA Sol Engine
片長
約 5.2 秒(=124 幀 ÷ 24 fps,計出)
出片時間
181.3 秒(≈ 3 分 1 秒)
量度條件
warm、batch 1;未優化 710.6 秒(3.92×)
原文
開原文 V02|Sol-Engine-H3-OnDevice
硬件
RTX 5090 32GB ×2 張卡 · lossless · SGLang
片長
5 秒
出片時間
559.67 秒(≈ 9 分 20 秒)
量度條件
Quickstart;denoise 525.05 加 decode 33.61
原文
開原文 V03|SGLang-upstream
全部 10 個實測實例
硬件
RTX 5090 32GB ×2 張卡 · INT4(offload) · vLLM-Omni
片長
約 5.2 秒(=124 幀 ÷ 24 fps,計出)
出片時間
518 秒(≈ 8 分 38 秒)
量度條件
原文寫「8 分 38 秒」
原文
開原文 V04|vLLM-Omni-upstream
硬件
Apple M4 Max 36GB · MLX 4-step · FastH3(FastVideo)
片長
約 5.2 秒(=124 幀 ÷ 24 fps,計出)
出片時間
465 秒(≈ 7 分 45 秒)
量度條件
冷啟 504 秒
原文
開原文 V05|FastH3-MLX
硬件
DGX Spark · MLX 4-step · FastH3(FastVideo)
片長
約 5.2 秒(=124 幀 ÷ 24 fps,計出)
出片時間
243 秒(≈ 4 分 3 秒)
量度條件
冷啟 264 秒
原文
開原文 V06|FastH3-MLX
硬件
NVIDIA GB200 ×4 張卡 · 4-step · FastH3(FastVideo)
片長
約 5.2 秒(=124 幀 ÷ 24 fps,計出)
出片時間
5.1 秒
量度條件
warm;首請求 10.2 秒
原文
開原文 V07|FastH3-MLX
硬件
RTX 4070 12GB ×1 張卡 · LoRA 4-step · ComfyUI
片長
約 5.2 秒(=124 幀 ÷ 24 fps,計出)
出片時間
79.36 秒(≈ 1 分 19 秒)
量度條件
20 步 baseline 272.97 秒
原文
開原文 V08|Turbo LoRA
硬件
Apple M5 Max 128GB · int8 · antirez h3.c(Metal)
片長
原文冇寫
出片時間
25.8 秒
量度條件
denoise 階段;BF16 為 36.30 秒
原文
開原文 V09|h3.c-Metal
硬件
NVIDIA H100 ×4 張卡 · lossless · SGLang
片長
約 5.2 秒(=124 幀 ÷ 24 fps,計出)
出片時間
13.25 秒
量度條件
三種拓樸 13.25/13.36/13.86
原文
開原文 V10|SGLang-upstream

Apple 逐部機睇Apple Silicon Detail

Apple Silicon 逐部機嘅實測。

機型量化解像度步數秒/條片峰值記憶體原文
Apple M4 Max 36GBMLX 4-step832×4804465查唔到原文
Apple M5 Max 128GBint8512×5121925.825.9 GiB原文

已知限制Known Limits

解像度天花板

地端最高 768p。1080p/2K 要用到官方未開源嘅 H3-Regenerate-2K 模組 —— 原因係權重未開源,唔係顯示卡規格唔夠。來源:G03(官方 model card)。

公認榜收錄情況

VBench 1.0(T2V)(收錄 73,S45)、AVGen-Bench(收錄 13,S50)、StreamAV-Bench(收錄 13,S51) —— 逐行核對,榜上冇 H3。查證日 2026-09-19。

音畫同步

業界公認榜冇總分;CutCraft 有 H3 子指標分,唔可以當本地權重用。來源:S48。

衍生模型混用

VDN-MiniMax-H3/Turbo LoRA/FastH3/h3.c/H3 Max 都唔係原版;H3 Max 係 fal 後訓練版本,同本頁評嘅 MiniMax H3 係兩個獨立模型。本頁每一行都寫明量嘅係邊個版本。

速度變數

步數(4/20/50)、解像度、量化方式、注意力後端 —— 任何一項唔同,同一部機都可以差幾倍,唔可以直接比。逐行數字量嘅版本見上面「出片速度」表。

榜別口徑

Arena AI 嘅數字一律原站直讀(2026-09-19 起);舊第三方快照數字已作廢、唔會再出。每個數字都標明同榜人數、票數同截止日。來源:S44。

原文連結Sources

呢一頁出現過嘅每一個代號,逐條列喺度 —— 由邊嚟、去邊度睇。

打開全部 24 條原文連結
代號類別名稱連結
G03模型規格MiniMax H3 官方規格(HuggingFace model card) 開原文
S07資料來源GitHub 開原文
S19資料來源Artificial Analysis 開原文
S34資料來源NVIDIA Labs 開原文
S35資料來源MiniMax 官方自架文檔 開原文
S36資料來源Hao AI Lab 開原文
S44資料來源arena.ai 開原文
S45資料來源VBench Leaderboard 開原文
S46資料來源Anates Labs 開原文
S47資料來源google-deepmind/physics-IQ-benchmark 開原文
S48資料來源CutCraft 開原文
S49資料來源Sci-VBench 開原文
S50資料來源microsoft/AVGen-Bench 開原文
S51資料來源StreamAV-Bench Leaderboard 開原文
V01生成實測RTX 5090 32GB ×1 張卡 開原文
V02生成實測DGX Spark 開原文
V03生成實測RTX 5090 32GB ×2 張卡 開原文
V04生成實測RTX 5090 32GB ×2 張卡 開原文
V05生成實測Apple M4 Max 36GB 開原文
V06生成實測DGX Spark 開原文
V07生成實測NVIDIA GB200 ×4 張卡 開原文
V08生成實測RTX 4070 12GB ×1 張卡 開原文
V09生成實測Apple M5 Max 128GB 開原文
V10生成實測NVIDIA H100 ×4 張卡 開原文

所有數字都係第三方公開實測或官方公布,唔係本站自測;每個代號對應嘅原文都喺上表,可以逐條開出嚟核。

↑

設計示範:未接上收集端,所填嘅嘢唔會送出。

指標定義

同一把尺,用喺每一個模型、每一個配置。以下係本頁所有數字嘅定義。

出片速度 Seconds per Clip
· 生成一條片要幾多秒(單位:秒/條片)
全部係單請求延遲(batch 1)
影片模型唔產生 token 串,所以冇「每個 token 幾快」呢回事
峰值記憶體 Peak VRAM
· 跑一次生成嗰陣嘅顯存峰值(單位:GB)
同解像度、量化、步數綁死
量化之後嘅數字要另外標明
解像度 Resolution
· 出片嘅畫面尺寸,用「p」表示短邊
同一模型唔同解像度嘅速度唔可以直接比
官方標示同社群實測要分開寫
幀率 Frame Rate
· 每秒出幾多格(單位:fps)
片段長度通常用格數講
有啲模型嘅格數要落喺指定間隔
步數 Denoising Steps
· 去噪採樣跑幾多步
步數越少越快,但畫面唔同 —— 唔同步數嘅秒數唔可以互比
加速版要同官方版分開列
數字量嘅版本 What Was Measured
· 條數字量嘅係邊個模型:原版/社群衍生版(微調、加速版)/上游引擎配置(SGLang、vLLM-Omni)
每一行都會標明