模型基礎框架 · 文本模型

Qwen3.8-27B

想長期跟住本地部署嘅實測資訊?

用你嘅 agent 接我哋 MCP —— 接一次,之後你問同類問題, 佢直接查我哋查證過嘅數字,唔使自己記。

用 agent 接駁 MCP →

呢一頁由開源模型專區嘅館主 agent ZERO 維護 —— 資料由佢定期出去搵、核對原文、更新入庫。有錯或者想補充,右下角同佢講。

更新日期  · 資料版本 29673490 · 綜合實測數據,非本站自測

六格模型能力值Model Capability Score

智能體推理指令跟隨知識代碼數學

輸入模態 Modalities

  • 文字 有實測
  • 圖片 有實測
  • 影片 有實測
  • 聲音 唔支援
睇詳細 →

顯卡・一體機GPU / Mini-PC

同時 128 條對話

實測配置 4 張 RTX 4090 24GB原文 R01

單流108字/秒
滿載每條17.8字/秒
上下文262K窗口

滿載合計2,278字/秒(條數 × 每條,計出嚟)

逐行原文連結見下面「速度・並發・上下文」大卡。

睇詳細 →

Apple 電腦Apple Silicon

77.6 字/秒

最快嘅 Apple 配置:Apple M3 Ultra 256GB(原文 R71)

  • Apple M3 Ultra 256GB77.6字/秒
  • Apple M4 Max 40c 128GB70字/秒
  • Apple M4 Max 40c 128GB53.3字/秒
實測份數5份
中位53.3字/秒
最慢4.7字/秒

最慢嗰部係 Apple M5 Pro 64GB,量化設定同其他唔同(8-bit),唔可以直接同上面幾部比。

睇詳細 ↓

能力評級係同級模型嘅相對位置,唔等於適用於你嘅具體場景。 並發同速度都係實測:開幾多條、每條幾快、合計幾多。 每個數字都可追溯至來源(原文連結集中喺頁底「原文連結」),唔係本站自測。

能力逐項睇Capability Detail

智能體 良

LiveBench Agentic Coding 61.3637 / Terminal-Bench 4.0 5.5556% / OSWorld-Verified 84.3%

≈ 線上付費模型:≈ Claude Fable 5(max)62.1717(差 +0.808)|Muse Spark 1.1(xhigh)6.0606%|Claude Fable 5 = Claude Mythos 5 85%

推理 優

GPQA Diamond 90.5051% / Humanity’s Last Exam 33.9203% / CritPt 5.4286%

≈ 線上付費模型:≈ GPT-5.2(xhigh)90.30%(GPQA Diamond,差 −0.21)

指令跟隨 良

IFBench 79.5% / LiveBench Instruction Following 72.6583

≈ 線上付費模型:≈ Claude Fable 5.1(max)72.9878(差 +0.330)|Qwen3.7 Max 79.1%(差 −0.4pp)

知識 良

MMLU-Pro 84.337%

≈ 線上付費模型:≈ Qwen3-Max 84.360%(同廠,差 +0.023)|非阿里最近:xAI Grok 4.1 Fast(reasoning)84.180%(差 −0.157)

代碼 中

LiveBench Coding 75.6890 / SWE-bench Verified 86.0% / LiveCodeBench 83.996%

≈ 線上付費模型:≈ GPT-5.2(2025-12-11 high)76.0715(差 +0.383)

數學 中

LiveBench Mathematics 86.2127 / LMArena Math 1466

≈ 線上付費模型:≈ Gemini 3.6 Flash(high)86.4025(差 +0.190)

領先優良 中弱落後

Eval · 每個評級背後嘅數字Evaluation

六格嘅評級,係由呢啲公開評測算出嚟 —— 每格同時列自己嘅分數同最接近嘅線上付費模型,好過淨係睇一個絕對數。

維度評測分數≈ 線上付費模型來源
數學 LiveBench Mathematics 86.2127 ≈ Gemini 3.6 Flash(high)86.4025(差 +0.190) LiveBench(2026-06-25 版)
LMArena Math 1466 1466 ≈ Gemini 3.6 Flash(high)86.4025(差 +0.190) S43
代碼 LiveBench Coding 75.6890 ≈ GPT-5.2(2025-12-11 high)76.0715(差 +0.383) LiveBench(2026-06-25 版)
SWE-bench Verified 86.0% ≈ GPT-5.2(2025-12-11 high)76.0715(差 +0.383) SWE-bench Verified
LiveCodeBench 83.996% ≈ GPT-5.2(2025-12-11 high)76.0715(差 +0.383) LiveCodeBench
智能體 LiveBench Agentic Coding 61.3637 ≈ Claude Fable 5(max)62.1717(差 +0.808)|Muse Spark 1.1(xhigh)6.0606%|Claude Fable 5 = Claude Mythos 5 85% LiveBench(2026-06-25 版)
Terminal-Bench 5.5556% ≈ Claude Fable 5(max)62.1717(差 +0.808)|Muse Spark 1.1(xhigh)6.0606%|Claude Fable 5 = Claude Mythos 5 85% S43
OSWorld-Verified 84.3% ≈ Claude Fable 5(max)62.1717(差 +0.808)|Muse Spark 1.1(xhigh)6.0606%|Claude Fable 5 = Claude Mythos 5 85% OSWorld-Verified
推理 GPQA Diamond 90.5051% ≈ GPT-5.2(xhigh)90.30%(GPQA Diamond,差 −0.21) GPQA Diamond
Humanity’s Last Exam 33.9203% ≈ GPT-5.2(xhigh)90.30%(GPQA Diamond,差 −0.21) Humanity’s Last Exam
CritPt 5.4286% ≈ GPT-5.2(xhigh)90.30%(GPQA Diamond,差 −0.21) CritPt
指令跟隨 IFBench 79.5% ≈ Claude Fable 5.1(max)72.9878(差 +0.330)|Qwen3.7 Max 79.1%(差 −0.4pp) IFBench
LiveBench Instruction Following 72.6583 ≈ Claude Fable 5.1(max)72.9878(差 +0.330)|Qwen3.7 Max 79.1%(差 −0.4pp) LiveBench(2026-06-25 版)
知識 MMLU-Pro 84.337% ≈ Qwen3-Max 84.360%(同廠,差 +0.023)|非阿里最近:xAI Grok 4.1 Fast(reasoning)84.180%(差 −0.157) MMLU-Pro

全部數字嚟自公開評測或模型方公布,唔係本站自測。「≈」係同一個榜上最接近嘅付費模型,括號係差距。

並發・吞吐量・上下文窗口Concurrency, Throughput & Context

同時 128 條對話

喺 262K 上下文之下(每條對話都食得落 一本 400 頁嘅書),滿載時每條 17.8 字/秒。

108字/秒 · 單流

只有一條對話嗰陣 = 108 字/秒,即係打一封 500 字電郵要 4.6 秒(由單流速度計出)。

同時對話(條)每條速度(字/秒)合計產能(字/秒)
1 條108108
16 條50800
48 條361,728
96 條232,208
128 條17.82,278

上下文窗口 Context Window

支援 262K 上下文窗口

= 等於一本 400 頁嘅書

呢個砌法實際用足模型上限 262K 嘅 100%

由 96 條加到 128 條:每條由 23 跌到 17.8 字/秒,合計產能由 2,208 升到 2,278 字/秒。
來源喺 2 卡復測見到 96/128 條時 TTFT p95 跳到 11–13 秒,建議限流 48–64 條。
合計產能=同時對話條數 × 每條速度,四捨五入至整數;原文報 128 條聚合 2,274 字/秒。

真實成功部署實例Real Deployments

以下每一個,都係有人真係咁砌、真係跑過、我哋開過原文核對嘅實例。撳入去睇細節。

4 張 RTX 4090 24GBAWQ-INT4 同時 128 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,4.6 秒(計出)
並發承載
同時 128 條對話,每條 17.8 字/秒
上下文窗口
一本 400 頁嘅書
硬件配置
RTX 4090 24GB ×4 張卡(TP=4;另再切 2 張卡復測) · AWQ-INT4 · vLLM 0.25.0
實測來源
原文 最完整
2 張 RTX 3090 24GBW4A16-AutoRoun 同時 2 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,6.3 秒(計出)
並發承載
同時 2 條對話,每條 42 字/秒
上下文窗口
一本 400 頁嘅書
硬件配置
RTX 3090 24GB ×2 張卡(無 NVLink) · W4A16-AutoRound · vLLM 0.27.1(MTP-3+prefix cache)
實測來源
原文
2 張 RTX 4090 24GBAWQ-INT4 同時 128 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,6.3 秒(計出)
並發承載
同時 128 條對話,每條 24 字/秒
上下文窗口
一本 400 頁嘅書
硬件配置
RTX 4090 24GB ×2 張卡(TP=2,由 4 卡切返) · AWQ-INT4 · vLLM 0.25.0
實測來源
原文
全部 22 個實測實例
4 張 RTX 4090 24GBAWQ-INT4 同時 128 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,4.6 秒(計出)
並發承載
同時 128 條對話,每條 17.8 字/秒
上下文窗口
一本 400 頁嘅書
硬件配置
RTX 4090 24GB ×4 張卡(TP=4;另再切 2 張卡復測) · AWQ-INT4 · vLLM 0.25.0
實測來源
原文
2 張 RTX 3090 24GBW4A16-AutoRoun 同時 2 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,6.3 秒(計出)
並發承載
同時 2 條對話,每條 42 字/秒
上下文窗口
一本 400 頁嘅書
硬件配置
RTX 3090 24GB ×2 張卡(無 NVLink) · W4A16-AutoRound · vLLM 0.27.1(MTP-3+prefix cache)
實測來源
原文
2 張 RTX 4090 24GBAWQ-INT4 同時 128 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,6.3 秒(計出)
並發承載
同時 128 條對話,每條 24 字/秒
上下文窗口
一本 400 頁嘅書
硬件配置
RTX 4090 24GB ×2 張卡(TP=2,由 4 卡切返) · AWQ-INT4 · vLLM 0.25.0
實測來源
原文
1 張 Arc Pro B70 32GBQ4_K_M 同時 64 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,20.3 秒(計出)
並發承載
同時 64 條對話,每條 1.3 字/秒
上下文窗口
查唔到
硬件配置
Intel Arc Pro B70 32GB ×1 張卡 · Q4_K_M · llama.cpp SYCL
實測來源
原文
1 部 DGX SparkFP8 同時 32 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,63.3 秒(計出)
並發承載
同時 32 條對話,每條 7.9 字/秒
上下文窗口
查唔到
硬件配置
DGX Spark(GB10 Grace Blackwell, SM 12.1, 128 GB UMA, 273 GB/s LPDDR5X) · FP8(Qwen/Qwen3.8-27B-FP8, 30.9 GB) · vLLM(原文未標版本)
實測來源
原文
1 部 DGX SparkFP8 + MTP n=3 同時 32 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,29.2 秒(計出)
並發承載
同時 32 條對話,每條 17.1 字/秒
上下文窗口
查唔到
硬件配置
DGX Spark(GB10 Grace Blackwell, SM 12.1, 128 GB UMA, 273 GB/s LPDDR5X) · FP8 + MTP n=3 · vLLM(原文未標版本)
實測來源
原文
1 部 DGX SparkNVFP4 同時 32 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,51.5 秒(計出)
並發承載
同時 32 條對話,每條 9.7 字/秒
上下文窗口
查唔到
硬件配置
DGX Spark(GB10 Grace Blackwell, SM 12.1, 128 GB UMA, 273 GB/s LPDDR5X) · NVFP4(Inferact/Qwen3.8-27B-NVFP4, ~18 GB) · vLLM(原文未標版本)
實測來源
原文
1 部 DGX SparkNVFP4+ MTP n=3 同時 32 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,27.0 秒(計出)
並發承載
同時 32 條對話,每條 18.5 字/秒
上下文窗口
查唔到
硬件配置
DGX Spark(GB10 Grace Blackwell, SM 12.1, 128 GB UMA, 273 GB/s LPDDR5X) · NVFP4(Inferact)+ MTP n=3, vLLM official · vLLM official(原文未標版本)
實測來源
原文
1 部 DGX SparkNVFP4+ RadixAr 同時 32 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,13.7 秒(計出)
並發承載
同時 32 條對話,每條 36.6 字/秒
上下文窗口
查唔到
硬件配置
DGX Spark(GB10 Grace Blackwell, SM 12.1, 128 GB UMA, 273 GB/s LPDDR5X) · NVFP4(RadixArk/Qwen3.8-27B-NVFP4)+ RadixArk/Qwen3.8-27B-DSpark · SGLang(原文未標版本;DSpark k=7)
實測來源
原文
2 部 DGX SparkNVFP4+ MTP n=3 同時 32 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,21.4 秒(計出)
並發承載
同時 32 條對話,每條 23.4 字/秒
上下文窗口
查唔到
硬件配置
DGX Spark(GB10 Grace Blackwell, SM 12.1, 128 GB UMA, 273 GB/s LPDDR5X) · NVFP4(Inferact)+ MTP n=3, vLLM official · vLLM official(原文未標版本)
實測來源
原文
2 部 DGX SparkNVFP4+ MTP n=3 同時 32 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,15.2 秒(計出)
並發承載
同時 32 條對話,每條 33 字/秒
上下文窗口
查唔到
硬件配置
DGX Spark(GB10 Grace Blackwell, SM 12.1, 128 GB UMA, 273 GB/s LPDDR5X) · NVFP4(Inferact)+ MTP n=3, eugr vLLM(dgx-vllm-eugr-nightly) · eugr vLLM(dgx-vllm-eugr-nightly,版本號原文未標)
實測來源
原文
2 部 DGX SparkNVFP4+ DSpark 同時 32 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,9.7 秒(計出)
並發承載
同時 32 條對話,每條 51.8 字/秒
上下文窗口
查唔到
硬件配置
DGX Spark(GB10 Grace Blackwell, SM 12.1, 128 GB UMA, 273 GB/s LPDDR5X) · NVFP4(RadixArk)+ DSpark · SGLang(原文未標版本;DSpark k=7)
實測來源
原文
4 部 DGX SparkNVFP4+ DSpark 同時 32 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,6.5 秒(計出)
並發承載
同時 32 條對話,每條 77.3 字/秒
上下文窗口
查唔到
硬件配置
DGX Spark(GB10 Grace Blackwell, SM 12.1, 128 GB UMA, 273 GB/s LPDDR5X) · NVFP4(RadixArk)+ DSpark · SGLang(原文未標版本;DSpark k=7)
實測來源
原文
4 張 RTX 3090 24GBAWQ-INT4 同時 32 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,7.0 秒(計出)
並發承載
同時 32 條對話,每條 71.9 字/秒
上下文窗口
查唔到
硬件配置
4× RTX 3090 24GB, NVLink between pairs (GPU0↔2, GPU1↔3 = NV4), vLLM 0.20.1, --kv-cache-dtype fp8, gpu-mem-util 0.90, 1k in / 512 out · AWQ-INT4(cyankiwi/Qwen3.8-27B-AWQ-INT4) · vLLM 0.20.1
實測來源
原文
4 張 RTX 3090 24GBAWQ-INT4 同時 32 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,5.6 秒(計出)
並發承載
同時 32 條對話,每條 88.5 字/秒
上下文窗口
查唔到
硬件配置
4× RTX 3090 24GB(TP=4 全部四張卡), vLLM 0.20.1, --kv-cache-dtype fp8, gpu-mem-util 0.90, 1k in / 512 out · AWQ-INT4(cyankiwi/Qwen3.8-27B-AWQ-INT4) · vLLM 0.20.1
實測來源
原文
1 部 DGX SparkBF16 同時 16 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,111.1 秒(計出)
並發承載
同時 16 條對話,每條 4.5 字/秒
上下文窗口
查唔到
硬件配置
DGX Spark(GB10 Grace Blackwell, SM 12.1, 128 GB UMA, 273 GB/s LPDDR5X) · BF16(Qwen/Qwen3.8-27B, 55.6 GB) · vLLM(原文未標版本)
實測來源
原文
1 部 DGX SparkBF16 + MTP n=3 同時 16 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,50.5 秒(計出)
並發承載
同時 16 條對話,每條 9.9 字/秒
上下文窗口
查唔到
硬件配置
DGX Spark(GB10 Grace Blackwell, SM 12.1, 128 GB UMA, 273 GB/s LPDDR5X) · BF16 + MTP n=3 · vLLM(原文未標版本)
實測來源
原文
1 部 DGX SparkFP8 同時 10 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,61.0 秒(計出)
並發承載
同時 10 條對話,每條 8.2 字/秒
上下文窗口
查唔到
硬件配置
DGX Spark, GB10, 128GB unified memory · FP8(Qwen/Qwen3.8-27B-FP8 @017b9c7a, 29GB) · vLLM(原文未標版本)
實測來源
原文
1 部 DGX SparkNVFP4 同時 10 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,43.5 秒(計出)
並發承載
同時 10 條對話,每條 11.5 字/秒
上下文窗口
查唔到
硬件配置
DGX Spark, GB10, 128GB unified memory · NVFP4(unsloth/Qwen3.8-27B-NVFP4, ~16GB) · vLLM(原文未標版本)
實測來源
原文
1 張 3090 同時 4 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,11.9 秒(計出)
並發承載
同時 4 條對話,每條 42 字/秒
上下文窗口
查唔到
硬件配置
3090 + llama.cpp(原文「on 3090/llama.cpp」) · 查唔到 · llama.cpp(原文未標版本)
實測來源
原文
1 張 RTX 5060 TiUD-Q3_K_XL 同時 1 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,14.7 秒(計出)
並發承載
同時 1 條對話,每條 34 字/秒
上下文窗口
查唔到
硬件配置
RTX 5060 Ti 16G, 448 GB/s · UD-Q3_K_XL(12.2G) · 引擎+版本查唔到(原文未報)
實測來源
原文
1 張 RTX 5060 Ti 同時 1 條請求
能力評級
見上方(能力由模型決定,換硬件改唔到)
單流生成速度
打一封 500 字電郵,14.3 秒(計出)
並發承載
同時 1 條對話,每條 35 字/秒
上下文窗口
查唔到
硬件配置
RTX 5060 Ti 16G · 查唔到(帖 #1 只寫「不开多模态」) · 引擎+版本查唔到(原文未報)
實測來源
原文

Apple 逐部機睇Apple Silicon Detail

呢個模型喺 Apple Silicon 上嘅實測 5 份。Apple 機嘅優點係細、靜、唔使砌; 缺點係速度同可加卡空間唔及獨立顯卡。

Apple 機型量化單流(字/秒)並發原文
Apple M3 Ultra 256GBoQ4e(MLX 4-bit) 77.6 查唔到 R71
Apple M4 Max 40c 128GB4-bit(MTP) 70 查唔到 R69
Apple M4 Max 40c 128GBoQ4e(MLX 4-bit) 53.3 查唔到 R68
MacBook Pro 48GB 統一記憶體4-bit(MLX) 14 查唔到 R17
Apple M5 Pro 64GB8-bit 4.7 4 條 R66

原文連結見頁底「原文連結」。每個數字都可追溯至來源,非本站自測。

已知限制Known Limits

數學

⚠️ LiveBench 由官方逐題表(2026-06-25 版)自算分類平均,與官方分類加權有微差。LMArena 係人類偏好 Elo,唔係準確率,唔可同 LiveBench 直接互比。Epoch OTIS Mock AIME 池大(273/97 新)但冇 Qwen3.8-27B

代碼

⚠️ 官方榜全凍結 —— 官方 LiveCodeBench(28 模型/0 近期)同官方 SWE-bench Verified(180 筆/0 近期)都停收新模型;只有 Vals 重跑版有近期分(143/45、88/50)。LiveCodeBench 一律用 Vals 版、永不使用 AA 版

智能體

⚠️ Terminal-Bench 4.0 中位僅 1.01% → 唔可以用絕對分數判「弱」。Terminal-Bench 2.1 同 4.0 係同族不同版,唔可以互比(同一模型 79.78% vs 5.56%)。OSWorld-Verified 係 (b) 廠商自報,而且係系統成績(模型+未公開 scaffold),唔係純模型

推理

同場景取最低 → HLE 同 CritPt 都落 P75–P90 故評「優」。⚠️ GPQA 90.5051% 同 P90 逐位相同(貼線)→ 池一換就跌格,唔可以單靠佢

指令跟隨

⚠️ IFBench 池偏細模型 → P75/P90 線偏低,Qwen 嘅「前四分一」有部分係被細池撐高。IFBench 最新版池 450(127 個 2026-03 後),唔係細榜嗰個 43

知識

⚠️ 呢格只有一條 benchmark —— 已查 Epoch AI 全量資料庫(1,719 行/211 模型/83 task),Qwen3.8-27B 只出現喺 6 個檔,全部唔係知識類;MMLU(249 模型)/SimpleQA/TriviaQA/HellaSwag/ARC/BBH 等全部冇。LMArena 根本冇 knowledge 榜。結構性原因:舊知識榜已飽和停收新模型

原文連結Sources

呢一頁出現過嘅每一個代號,逐條列喺度 —— 由邊嚟、去邊度睇。

打開全部 68 條原文連結
代號類別名稱連結
R01實測報告博客園 cnblogs.com 開原文
R03實測報告抡锤者 lcz.me 開原文
R04實測報告Reddit r/LocalLLaMA 開原文
R05實測報告Reddit r/LocalLLaMA 開原文
R06實測報告Reddit r/LocalLLaMA 開原文
R07實測報告Reddit r/LocalLLaMA 開原文
R11實測報告雷峰網 leiphone 開原文
R13實測報告GitHub(實測倉庫+Discussions) 開原文
R14實測報告Hugging Face(模型頁討論區+Datasets) 開原文
R17實測報告newtype 電子報 開原文
R20實測報告GitHub(實測倉庫+Discussions) 開原文
R21實測報告kgptalkie 開原文
R22實測報告GitHub(實測倉庫+Discussions) 開原文
R23實測報告Inference Guru 開原文
R24實測報告博客園 cnblogs.com 開原文
R25實測報告4sysops 開原文
R26實測報告4sysops 開原文
R27實測報告NVIDIA Developer Forums 開原文
R28實測報告NVIDIA Developer Forums 開原文
R29實測報告NVIDIA Developer Forums 開原文
R30實測報告NVIDIA Developer Forums 開原文
R31實測報告NVIDIA Developer Forums 開原文
R32實測報告NVIDIA Developer Forums 開原文
R33實測報告NVIDIA Developer Forums 開原文
R34實測報告NVIDIA Developer Forums 開原文
R35實測報告NVIDIA Developer Forums 開原文
R36實測報告NVIDIA Developer Forums 開原文
R37實測報告NVIDIA Developer Forums 開原文
R38實測報告Kubesimplify Blog 開原文
R39實測報告Kubesimplify Blog 開原文
R40實測報告Reddit r/LocalLLaMA 開原文
R41實測報告Reddit r/LocalLLaMA 開原文
R46實測報告LINUX DO 開原文
R47實測報告LINUX DO 開原文
R48實測報告Hacker News 開原文
R51實測報告GitHub(實測倉庫+Discussions) 開原文
R52實測報告GitHub(實測倉庫+Discussions) 開原文
R53實測報告GitHub(實測倉庫+Discussions) 開原文
R54實測報告GitHub(實測倉庫+Discussions) 開原文
R55實測報告GitHub(實測倉庫+Discussions) 開原文
R56實測報告Reddit r/LocalLLaMA 開原文
R60實測報告Reddit r/LocalLLaMA 開原文
R61實測報告Reddit r/LocalLLaMA 開原文
R62實測報告Hugging Face(模型頁討論區+Datasets) 開原文
R63實測報告Hugging Face(模型頁討論區+Datasets) 開原文
R64實測報告Hugging Face(模型頁討論區+Datasets) 開原文
R65實測報告LINUX DO 開原文
R66實測報告arXiv(學術預印本) 開原文
R68實測報告GitHub(實測倉庫+Discussions) 開原文
R69實測報告GitHub(實測倉庫+Discussions) 開原文
R71實測報告GitHub(實測倉庫+Discussions) 開原文
S01資料來源Hugging Face(模型頁討論區+Datasets) 開原文
S02資料來源Reddit r/LocalLLaMA 開原文
S04資料來源Hacker News 開原文
S05資料來源抡锤者 lcz.me 開原文
S06資料來源博客園 cnblogs.com 開原文
S07資料來源GitHub(實測倉庫+Discussions) 開原文
S08資料來源newtype 電子報 開原文
S10資料來源kgptalkie 開原文
S12資料來源LINUX DO 開原文
S13資料來源雷峰網 leiphone 開原文
S23資料來源Inference Guru 開原文
S28資料來源4sysops 開原文
S30資料來源NVIDIA Developer Forums 開原文
S31資料來源Kubesimplify Blog 開原文
S33資料來源arXiv(學術預印本) 開原文
S42資料來源Vals AI(獨立模型評測) 開原文
S43資料來源LiveBench(客觀題目、自動評分) 開原文

我哋引用人哋嘅嘢,公開多謝。所有數字都係第三方公開實測或官方公布,唔係本站自測。

↑

設計示範:未接上收集端,所填嘅嘢唔會送出。

指標定義

同一把尺,用喺每一個模型、每一個配置。以下六項係本頁所有數字嘅定義。

能力評級 Capability
· 相對同級模型全體分佈嘅位置
· 由公開 benchmark 分數對照六格刻度
· 「中位」=同一榜單上面全部模型嘅中位數;每個指標配自己嗰個中位
· 同場景多個 benchmark,取最低
單流生成速度 Throughput
· 只有一條請求進行時嘅出字速度
· 單位:字/秒
· 唔包括同時多人使用
並發承載 Concurrency
· 同一時間進行嘅獨立生成請求條數(實測)
· 唔混入「幾多個人」—— 條數 ≠ 人數,換算要補假設,所以本頁唔換算
· 想知夠唔夠用:你哋同時最多有幾多條對話,就係要對照嘅數
合計產能 Aggregate Throughput
· 同時對話條數 × 每條速度
· 睇整體「做得幾多嘢」,唔受單條快慢影響
· 開得越多條,每條越慢,但合計會升到某點就飽和
上下文窗口 Context Window
· 一次過可以輸入嘅最大內容長度
· 模型本身有上限
· 實際可用長度受硬件記憶體限制
輸入模態 Modalities
· 模型接受嘅輸入類型
· 做到=有人實測並公開
· 只有官方規格=官方話得但未見實測
· 唔支援=規格本身就冇