六格模型能力值Model Capability Score
輸入模態 Modalities
- 文字 有實測
- 圖片 有實測
- 影片 有實測
- 聲音 唔支援
模型基礎框架 · 文本模型
用你嘅 agent 接我哋 MCP —— 接一次,之後你問同類問題, 佢直接查我哋查證過嘅數字,唔使自己記。
呢一頁由開源模型專區嘅館主 agent ZERO 維護 —— 資料由佢定期出去搵、核對原文、更新入庫。有錯或者想補充,右下角同佢講。
輸入模態 Modalities
同時 128 條對話
實測配置 4 張 RTX 4090 24GB原文 R01
滿載合計2,278字/秒(條數 × 每條,計出嚟)
逐行原文連結見下面「速度・並發・上下文」大卡。
睇詳細 →77.6 字/秒
最快嘅 Apple 配置:Apple M3 Ultra 256GB(原文 R71)
最慢嗰部係 Apple M5 Pro 64GB,量化設定同其他唔同(8-bit),唔可以直接同上面幾部比。
睇詳細 ↓能力評級係同級模型嘅相對位置,唔等於適用於你嘅具體場景。 並發同速度都係實測:開幾多條、每條幾快、合計幾多。 每個數字都可追溯至來源(原文連結集中喺頁底「原文連結」),唔係本站自測。
LiveBench Agentic Coding 61.3637 / Terminal-Bench 4.0 5.5556% / OSWorld-Verified 84.3%
≈ 線上付費模型:≈ Claude Fable 5(max)62.1717(差 +0.808)|Muse Spark 1.1(xhigh)6.0606%|Claude Fable 5 = Claude Mythos 5 85%
GPQA Diamond 90.5051% / Humanity’s Last Exam 33.9203% / CritPt 5.4286%
≈ 線上付費模型:≈ GPT-5.2(xhigh)90.30%(GPQA Diamond,差 −0.21)
IFBench 79.5% / LiveBench Instruction Following 72.6583
≈ 線上付費模型:≈ Claude Fable 5.1(max)72.9878(差 +0.330)|Qwen3.7 Max 79.1%(差 −0.4pp)
MMLU-Pro 84.337%
≈ 線上付費模型:≈ Qwen3-Max 84.360%(同廠,差 +0.023)|非阿里最近:xAI Grok 4.1 Fast(reasoning)84.180%(差 −0.157)
LiveBench Coding 75.6890 / SWE-bench Verified 86.0% / LiveCodeBench 83.996%
≈ 線上付費模型:≈ GPT-5.2(2025-12-11 high)76.0715(差 +0.383)
LiveBench Mathematics 86.2127 / LMArena Math 1466
≈ 線上付費模型:≈ Gemini 3.6 Flash(high)86.4025(差 +0.190)
六格嘅評級,係由呢啲公開評測算出嚟 —— 每格同時列自己嘅分數同最接近嘅線上付費模型,好過淨係睇一個絕對數。
| 維度 | 評測 | 分數 | ≈ 線上付費模型 | 來源 |
|---|---|---|---|---|
| 數學 | LiveBench Mathematics | 86.2127 | ≈ Gemini 3.6 Flash(high)86.4025(差 +0.190) | LiveBench(2026-06-25 版) |
| LMArena Math 1466 | 1466 | ≈ Gemini 3.6 Flash(high)86.4025(差 +0.190) | S43 | |
| 代碼 | LiveBench Coding | 75.6890 | ≈ GPT-5.2(2025-12-11 high)76.0715(差 +0.383) | LiveBench(2026-06-25 版) |
| SWE-bench Verified | 86.0% | ≈ GPT-5.2(2025-12-11 high)76.0715(差 +0.383) | SWE-bench Verified | |
| LiveCodeBench | 83.996% | ≈ GPT-5.2(2025-12-11 high)76.0715(差 +0.383) | LiveCodeBench | |
| 智能體 | LiveBench Agentic Coding | 61.3637 | ≈ Claude Fable 5(max)62.1717(差 +0.808)|Muse Spark 1.1(xhigh)6.0606%|Claude Fable 5 = Claude Mythos 5 85% | LiveBench(2026-06-25 版) |
| Terminal-Bench | 5.5556% | ≈ Claude Fable 5(max)62.1717(差 +0.808)|Muse Spark 1.1(xhigh)6.0606%|Claude Fable 5 = Claude Mythos 5 85% | S43 | |
| OSWorld-Verified | 84.3% | ≈ Claude Fable 5(max)62.1717(差 +0.808)|Muse Spark 1.1(xhigh)6.0606%|Claude Fable 5 = Claude Mythos 5 85% | OSWorld-Verified | |
| 推理 | GPQA Diamond | 90.5051% | ≈ GPT-5.2(xhigh)90.30%(GPQA Diamond,差 −0.21) | GPQA Diamond |
| Humanity’s Last Exam | 33.9203% | ≈ GPT-5.2(xhigh)90.30%(GPQA Diamond,差 −0.21) | Humanity’s Last Exam | |
| CritPt | 5.4286% | ≈ GPT-5.2(xhigh)90.30%(GPQA Diamond,差 −0.21) | CritPt | |
| 指令跟隨 | IFBench | 79.5% | ≈ Claude Fable 5.1(max)72.9878(差 +0.330)|Qwen3.7 Max 79.1%(差 −0.4pp) | IFBench |
| LiveBench Instruction Following | 72.6583 | ≈ Claude Fable 5.1(max)72.9878(差 +0.330)|Qwen3.7 Max 79.1%(差 −0.4pp) | LiveBench(2026-06-25 版) | |
| 知識 | MMLU-Pro | 84.337% | ≈ Qwen3-Max 84.360%(同廠,差 +0.023)|非阿里最近:xAI Grok 4.1 Fast(reasoning)84.180%(差 −0.157) | MMLU-Pro |
全部數字嚟自公開評測或模型方公布,唔係本站自測。「≈」係同一個榜上最接近嘅付費模型,括號係差距。
同時 128 條對話
喺 262K 上下文之下(每條對話都食得落 一本 400 頁嘅書),滿載時每條 17.8 字/秒。
只有一條對話嗰陣 = 108 字/秒,即係打一封 500 字電郵要 4.6 秒(由單流速度計出)。
| 同時對話(條) | 每條速度(字/秒) | 合計產能(字/秒) |
|---|---|---|
| 1 條 | 108 | 108 |
| 16 條 | 50 | 800 |
| 48 條 | 36 | 1,728 |
| 96 條 | 23 | 2,208 |
| 128 條 | 17.8 | 2,278 |
上下文窗口 Context Window
支援 262K 上下文窗口
= 等於一本 400 頁嘅書
呢個砌法實際用足模型上限 262K 嘅 100%
由 96 條加到 128 條:每條由 23 跌到 17.8 字/秒,合計產能由 2,208 升到 2,278 字/秒。
來源喺 2 卡復測見到 96/128 條時 TTFT p95 跳到 11–13 秒,建議限流 48–64 條。
合計產能=同時對話條數 × 每條速度,四捨五入至整數;原文報 128 條聚合 2,274 字/秒。
以下每一個,都係有人真係咁砌、真係跑過、我哋開過原文核對嘅實例。撳入去睇細節。
呢個模型喺 Apple Silicon 上嘅實測 5 份。Apple 機嘅優點係細、靜、唔使砌; 缺點係速度同可加卡空間唔及獨立顯卡。
| Apple 機型 | 量化 | 單流(字/秒) | 並發 | 原文 |
|---|---|---|---|---|
| Apple M3 Ultra 256GB | oQ4e(MLX 4-bit) | 77.6 | 查唔到 | R71 |
| Apple M4 Max 40c 128GB | 4-bit(MTP) | 70 | 查唔到 | R69 |
| Apple M4 Max 40c 128GB | oQ4e(MLX 4-bit) | 53.3 | 查唔到 | R68 |
| MacBook Pro 48GB 統一記憶體 | 4-bit(MLX) | 14 | 查唔到 | R17 |
| Apple M5 Pro 64GB | 8-bit | 4.7 | 4 條 | R66 |
原文連結見頁底「原文連結」。每個數字都可追溯至來源,非本站自測。
⚠️ LiveBench 由官方逐題表(2026-06-25 版)自算分類平均,與官方分類加權有微差。LMArena 係人類偏好 Elo,唔係準確率,唔可同 LiveBench 直接互比。Epoch OTIS Mock AIME 池大(273/97 新)但冇 Qwen3.8-27B
⚠️ 官方榜全凍結 —— 官方 LiveCodeBench(28 模型/0 近期)同官方 SWE-bench Verified(180 筆/0 近期)都停收新模型;只有 Vals 重跑版有近期分(143/45、88/50)。LiveCodeBench 一律用 Vals 版、永不使用 AA 版
⚠️ Terminal-Bench 4.0 中位僅 1.01% → 唔可以用絕對分數判「弱」。Terminal-Bench 2.1 同 4.0 係同族不同版,唔可以互比(同一模型 79.78% vs 5.56%)。OSWorld-Verified 係 (b) 廠商自報,而且係系統成績(模型+未公開 scaffold),唔係純模型
同場景取最低 → HLE 同 CritPt 都落 P75–P90 故評「優」。⚠️ GPQA 90.5051% 同 P90 逐位相同(貼線)→ 池一換就跌格,唔可以單靠佢
⚠️ IFBench 池偏細模型 → P75/P90 線偏低,Qwen 嘅「前四分一」有部分係被細池撐高。IFBench 最新版池 450(127 個 2026-03 後),唔係細榜嗰個 43
⚠️ 呢格只有一條 benchmark —— 已查 Epoch AI 全量資料庫(1,719 行/211 模型/83 task),Qwen3.8-27B 只出現喺 6 個檔,全部唔係知識類;MMLU(249 模型)/SimpleQA/TriviaQA/HellaSwag/ARC/BBH 等全部冇。LMArena 根本冇 knowledge 榜。結構性原因:舊知識榜已飽和停收新模型
呢一頁出現過嘅每一個代號,逐條列喺度 —— 由邊嚟、去邊度睇。
| 代號 | 類別 | 名稱 | 連結 |
|---|---|---|---|
R01 | 實測報告 | 博客園 cnblogs.com | 開原文 |
R03 | 實測報告 | 抡锤者 lcz.me | 開原文 |
R04 | 實測報告 | Reddit r/LocalLLaMA | 開原文 |
R05 | 實測報告 | Reddit r/LocalLLaMA | 開原文 |
R06 | 實測報告 | Reddit r/LocalLLaMA | 開原文 |
R07 | 實測報告 | Reddit r/LocalLLaMA | 開原文 |
R11 | 實測報告 | 雷峰網 leiphone | 開原文 |
R13 | 實測報告 | GitHub(實測倉庫+Discussions) | 開原文 |
R14 | 實測報告 | Hugging Face(模型頁討論區+Datasets) | 開原文 |
R17 | 實測報告 | newtype 電子報 | 開原文 |
R20 | 實測報告 | GitHub(實測倉庫+Discussions) | 開原文 |
R21 | 實測報告 | kgptalkie | 開原文 |
R22 | 實測報告 | GitHub(實測倉庫+Discussions) | 開原文 |
R23 | 實測報告 | Inference Guru | 開原文 |
R24 | 實測報告 | 博客園 cnblogs.com | 開原文 |
R25 | 實測報告 | 4sysops | 開原文 |
R26 | 實測報告 | 4sysops | 開原文 |
R27 | 實測報告 | NVIDIA Developer Forums | 開原文 |
R28 | 實測報告 | NVIDIA Developer Forums | 開原文 |
R29 | 實測報告 | NVIDIA Developer Forums | 開原文 |
R30 | 實測報告 | NVIDIA Developer Forums | 開原文 |
R31 | 實測報告 | NVIDIA Developer Forums | 開原文 |
R32 | 實測報告 | NVIDIA Developer Forums | 開原文 |
R33 | 實測報告 | NVIDIA Developer Forums | 開原文 |
R34 | 實測報告 | NVIDIA Developer Forums | 開原文 |
R35 | 實測報告 | NVIDIA Developer Forums | 開原文 |
R36 | 實測報告 | NVIDIA Developer Forums | 開原文 |
R37 | 實測報告 | NVIDIA Developer Forums | 開原文 |
R38 | 實測報告 | Kubesimplify Blog | 開原文 |
R39 | 實測報告 | Kubesimplify Blog | 開原文 |
R40 | 實測報告 | Reddit r/LocalLLaMA | 開原文 |
R41 | 實測報告 | Reddit r/LocalLLaMA | 開原文 |
R46 | 實測報告 | LINUX DO | 開原文 |
R47 | 實測報告 | LINUX DO | 開原文 |
R48 | 實測報告 | Hacker News | 開原文 |
R51 | 實測報告 | GitHub(實測倉庫+Discussions) | 開原文 |
R52 | 實測報告 | GitHub(實測倉庫+Discussions) | 開原文 |
R53 | 實測報告 | GitHub(實測倉庫+Discussions) | 開原文 |
R54 | 實測報告 | GitHub(實測倉庫+Discussions) | 開原文 |
R55 | 實測報告 | GitHub(實測倉庫+Discussions) | 開原文 |
R56 | 實測報告 | Reddit r/LocalLLaMA | 開原文 |
R60 | 實測報告 | Reddit r/LocalLLaMA | 開原文 |
R61 | 實測報告 | Reddit r/LocalLLaMA | 開原文 |
R62 | 實測報告 | Hugging Face(模型頁討論區+Datasets) | 開原文 |
R63 | 實測報告 | Hugging Face(模型頁討論區+Datasets) | 開原文 |
R64 | 實測報告 | Hugging Face(模型頁討論區+Datasets) | 開原文 |
R65 | 實測報告 | LINUX DO | 開原文 |
R66 | 實測報告 | arXiv(學術預印本) | 開原文 |
R68 | 實測報告 | GitHub(實測倉庫+Discussions) | 開原文 |
R69 | 實測報告 | GitHub(實測倉庫+Discussions) | 開原文 |
R71 | 實測報告 | GitHub(實測倉庫+Discussions) | 開原文 |
S01 | 資料來源 | Hugging Face(模型頁討論區+Datasets) | 開原文 |
S02 | 資料來源 | Reddit r/LocalLLaMA | 開原文 |
S04 | 資料來源 | Hacker News | 開原文 |
S05 | 資料來源 | 抡锤者 lcz.me | 開原文 |
S06 | 資料來源 | 博客園 cnblogs.com | 開原文 |
S07 | 資料來源 | GitHub(實測倉庫+Discussions) | 開原文 |
S08 | 資料來源 | newtype 電子報 | 開原文 |
S10 | 資料來源 | kgptalkie | 開原文 |
S12 | 資料來源 | LINUX DO | 開原文 |
S13 | 資料來源 | 雷峰網 leiphone | 開原文 |
S23 | 資料來源 | Inference Guru | 開原文 |
S28 | 資料來源 | 4sysops | 開原文 |
S30 | 資料來源 | NVIDIA Developer Forums | 開原文 |
S31 | 資料來源 | Kubesimplify Blog | 開原文 |
S33 | 資料來源 | arXiv(學術預印本) | 開原文 |
S42 | 資料來源 | Vals AI(獨立模型評測) | 開原文 |
S43 | 資料來源 | LiveBench(客觀題目、自動評分) | 開原文 |
我哋引用人哋嘅嘢,公開多謝。所有數字都係第三方公開實測或官方公布,唔係本站自測。
同一把尺,用喺每一個模型、每一個配置。以下六項係本頁所有數字嘅定義。