Qwen 27B(千問 27B 系列)

Qwen 27B 系列喺自己公司機器上面跑得到:單卡 24GB 已經可以起步,32 份實測報告、10 個獨立站, 最慢同最快嘅配置差好遠。以下每一格數字都連得返原文。

32 份實測報告 · 10 個獨立站 · 最後更新 2026-09-17 · 綜合實測數據,非本站自測 · 數據版本 3184d3026e5e

呢個模型適合邊種公司?單卡夠唔夠?

🅲 我哋講 可以喺你自己公司嘅機器上面跑,讀圖、讀文件、寫程式、做長任務都應付得嚟 —— 而且單卡就夠起步,唔一定要兩張卡。

Qwen 27B 嘅基本規格係咩?

參數量27B官方模型卡(S13/R06/R19)
多模態文字+圖片+影片官方;社群用 MLX-VLM 實跑
原生上下文262144(256K)官方模型卡
授權Apache 2.0官方
最低記憶體24GB 起(4-bit);32GB 係實際起點S13/R06/R19
同名世代Qwen3.5-27B/3.6-27B/3.8-27B(三代唔可以直接互比)三代唔可以直接互比
官方連結https://huggingface.co/Qwen/Qwen3.8-27B

唔同硬件配置跑幾快?(卡數同框,唔准拆開睇)

去重鍵=硬件型號 × 卡數 × 量化 × 上下文:四項完全相同=重複只留一份;有任何一項唔同=唔同配置,必須出。 全 32 行報告去重後=22 個配置,冇人手加減。收起唔等於刪走。

1 張卡11 個配置)
硬件卡數上下文速度(tokens/秒)來源
RTX 3090 24GB ×1 張卡1查唔到(未標)
~30–32
單流(來源未標並發)|Q5_K_M|未標|llama.cpp+Pi harness
R07
Apple M4 Pro 48GB 統一記憶體(1 部機)164K
14
單流|4-bit MLX|64K|LM Studio
R08
RX 7900 XTX 24GB ×1 張卡1查唔到
38–41
單流|Q4_K_M|未標|llama.cpp Vulkan 38/Ollama ROCm 41
R09
RTX 5090 32GB ×1 張卡164K
171
單流(16 題平均)|Q4_K_M|64K|Ollama 0.32.12
R14
RTX 5090 32GB ×1 張卡1230K
150.4
單流|NVFP4|230K|llama.cpp b9415(MTP;短文本 143.4/工具呼叫 127.9)
R15
RTX 5090 32GB ×1 張卡1測試覆蓋 pp128–16,384
84.3
單流(llama-bench tg128)|NVFP4|測試至 16K|llama.cpp b9365(Q4_K_M 77.1/Q6_K 61.9)
R16
MacBook Pro 48GB 統一記憶體(1 部機)1查唔到
~14
單流|4-bit MLX|未標|MLX(同帖非 MLX 版為 ~10)
R17
Apple M4 Max 40c 128GB(1 部機)165,536
6.9
單流(TG)|量化查唔到|65,536|oMLX v0.3.6(1k 為 9.2/128K 為 4.4)
R18L8
RTX 3090 24GB ×1 張卡1262,144
35–45
單流(社群回報)|Q4_K_M+q4_0 KV|262,144|llama.cpp(DFlash N=5 路線 ~106)
R19
Beelink GTR9 Pro(Ryzen AI MAX+ 395)128GB(1 部機)1262,144(實測檢索過 50,059)
20.42
單流(生成)|Q4_K_M|262,144|Ollama 0.32.13 Vulkan-RADV
R20
RTX 5090 32GB ×1 張卡1查唔到
79–205
單流(視工作負載)|Q4_K_M|未標|llama.cpp(draft 開 88–205;draft 關 79)
R21
2 張卡10 個配置)
硬件卡數上下文速度(tokens/秒)來源
RTX 4090 24GB ×4 張卡(TP=4;另再切 2 張卡復測)4262,144
~108
單流|AWQ-INT4|262,144|vLLM 0.25.0(4 卡 TP=4;同一帖 2 卡時 79)
R01L2
RTX 4090 24GB ×4 張卡(TP=4;另再切 2 張卡復測)2262,144
查唔到
單流|AWQ-INT4|262,144|vLLM 0.25.0(4 卡 TP=4;同一帖 2 卡時 79)
R01L2
RTX 3090 24GB ×2 張卡(PCIE 3.0 8X/8X)2230K
~65
單流(來源未標並發)|DENSE 27B INT8-W8A8|230K|SGLang
R02L5
RTX 3090 Ti 24GB + RTX 3060 12GB(2 張卡)2196,608
53–58
單流(tg)|Q4_K_M+q4_0 KV|196,608|llama.cpp(draft-mtp n=2)
R03L5
RTX 3090 24GB ×2 張卡(無 NVLink)2262,144
80–90
單流(基準上限 106.9)|W4A16-AutoRound|262,144|vLLM 0.27.1
R04L4
RTX 3090 ×2 張卡216K
查唔到
無 tok/s 數字:來源只報 GSM8K/MATH-500/HumanEval/MBPP 分數
R05L1
RTX 3090 24GB ×2 張卡(降到 250W)2查唔到
110
單流(來源未標並發)|量化查唔到|未標|tedivm 容器(2×3090 250W)
R10
A100 ×2 張卡2未標(模型原生 262K)
41.77
單流(7 題平均)|bf16|未標|vLLM 41.77(SGLang 40.06/llama.cpp 23.50)
R11L3
ASRock Arc Pro B70 32GB ×2 張卡(TP2)2p512/n128(模型 context 未標)
31.26
單流(llama-bench decode)|Q8_0|p512/n128|llama.cpp SYCL fork(2 卡 TP2)
R12L6
RTX 4080 Super ×2 張卡2查唔到
查唔到
無 tok/s 數字:來源只給架構同部署方式(vLLM+KServe+Envoy)
R13
2 個裝置以上1 個配置)
硬件卡數上下文速度(tokens/秒)來源
Ryzen AI MAX+ 395 128GB + RTX 3090 Ti 24GB(2 個裝置)2 裝置262,144
153.32
單流|KV q4_0|32K(同帖 200K 為 87.74)|llama.cpp(Strix Halo+3090 Ti)
R06L7

⭐ 唔一定需要兩張卡 —— 單卡 3090(24GB)已經跑得滿 262K。多卡買嘅係「並發吞吐」同「長上下文容量」,唔係單人更快。 以上每格速度都係原文數字,我哋冇換算、冇排序偏好、冇篩走任何一行。

呢個模型做邊種任務得,邊種唔得?

等級唔用我哋嘅判斷:表 5 出尺(同級參考=中位/前 10% 線)、表 9 落判斷。 分數 > 前 10% 線 → 強;中位 ≤ 分數 ≤ 前 10% 線 → 中;分數 < 中位 → 弱;冇同級參考 → 待評級;同場景多個 benchmark 取最低。

場景搜得到嘅講法(實測)Benchmark分數適合度來源
數學解題ai 數學解題
GSM8K小學程度嘅多步數學應用題(要列式、要推理,唔係純計算)
MATH-500高中競賽級數學(難好多)
GSM8K 96.7%;MATH-500 86.4%待評級R05
寫程式ai 寫程式
HumanEval寫一個 Python 函數,跑測試睇過唔過
MBPP基礎 Python 編程題
HumanEval 95.5%;MBPP 80.0%待評級R05
寫作摘要ai 寫作/ai 摘要
AA-Briefcase知識工作長文任務(寫作、分析、簡報),由 AI 評審按 rubric 打分
AA-Briefcase rubric 通過率 47.8%;分析質素 Elo 1581.3待評級S19
客服ai 客服
Tau-Banking銀行客服對話:按政策查數據、多輪工具呼叫,睇最終有無做對
Tau-Banking 48.0%(前 10% 線 41.6%/中位 16.7%,榜內排第 5)S19/R05/R01
知識庫ai 知識庫/ai 整理文件
AA-LCR長上下文檢索:喺超長文件內搵出並整合答案
MLCR多步連結推理:要跨好幾份文件串連先答到
AA-LCR 82.0%(前 10% 線 79.7%/中位 55.3%,排第 20);MLCR 21.7%(前 10% 線 45.6%/中位 12.8%,排第 27)S19
自動化ai 自動化/ai agent 香港
AutomationBench真實辦公自動化:跨應用完成多步工作流程
EnterpriseOps-Gym企業營運情境模擬:處理採購、排程等多步任務
Terminal-Bench 4.0喺真實終端機環境完成系統管理任務
AutomationBench 48.2%(前 10% 線 57.9%/中位 18.4%,排第 58/248);EnterpriseOps-Gym 44.2%(前 10% 線 50.1%/中位 40.2%,排第 16/59);Terminal-Bench 4.0 5.6%(前 10% 線 26.3%/中位 1.0%,排第 50/169)S19/R11/R15
翻譯ai 翻譯
查唔到
查唔到未測查唔到

未有數據嘅場景照出「查唔到/未採集」—— 唔會用「大約」「應該」填。搜唔到嘅場景唔做頁。

有咩會壞、有咩限制、有咩教訓?

呢段係我哋同賣機網站最大嘅分別:成功同失敗放同一個庫,一條都唔收埋。 失敗 9 條、 跨配置教訓 2 條。

  1. L1失敗限制🅲 我哋講 觸發:思考模式開(預設 xhigh)+難題,輸出預算用盡前思考鏈唔停|症狀:只燒 reasoning token、正文空白|後果:GSM8K 停滯項 52.4% vs 完成項 98.1%;MATH-500 停滯 6.7% vs 94.3%;3–9% 題目吃掉大部分錯誤|解:有 —— 對空白項關思考重問原文
  2. L2失敗限制🅲 我哋講 觸發:生成請求 `max_tokens` 設得太細(例 512)+思考開|症狀:預算用盡、正文返回空字串|後果:單次請求白跑要重試|解:有 —— 生成類 ≥2048、檢索類關思考;另:冷門事實會編(2019 圖靈獎答錯)、競賽難題思考跑滿唔收斂原文
  3. L3失敗限制🅲 我哋講 觸發:複雜長鏈 agent 任務(3D 網站生成)+上下文反覆回灌|症狀:拆 75 step/3 turn/124 次請求,思考時間 5,974 秒|後果:9 題燒 13,995,350 token、197 次請求、6 小時 17 分;單一 3D 網站題就 11.5M token|解:部分 —— 要約束 step 數同輸出邊界原文
  4. L4失敗限制🅲 我哋講 觸發:262K 上下文+2 路並發|症狀:decode 被攤分|後果:各自只剩 ~42 tok/s(唔係 2×90);聚合 ~3,200 tok/min|解:冇(架構性)—— 要分清加總吞吐同單流速度原文
  5. L5失敗限制🅲 我哋講 觸發:雙卡 3090+262K ctx+fp8 KV+4 路並發|症狀:聚合吞吐回落|後果:4 並發 243.4 t/s < 2 並發 260.9 t/s(疑 KV 觸發 preempt)|解:有(診斷向)—— 睇 #retract/#preempt 計數同 mem_fraction_static,縮短 ctx 再測;另 NVLink 效益被指誇大原文
  6. L6失敗限制🅲 我哋講 觸發:有利 prompt 形狀+DFlash5 草稿|症狀:單次衝高、唔可複現|後果:65.00 tok/s vs 固定套件中位數 38.08(差 1.7 倍)|解:有 —— 只引用固定套件中位數;報告明寫「must not be quoted as target-only」原文
  7. L7失敗限制🅲 我哋講 觸發:照抄標題數字|症狀:同一帖標題寫 45 tok/s、內文寫 456 tok/s|後果:引用會錯一個數量級|解:有 —— 以配置齊備嘅內文為準,標題只作線索原文
  8. L8失敗限制🅲 我哋講 觸發:context 由 1k 推到 128K|症狀:TG 單調下跌|後果:TG 9.2(1k)→ 8.8(8k)→ 6.9(64k)→ 4.4(128K),跌 52%|解:部分 —— 按實際需要設 ctx 上限(Apple 統一記憶體係容量換速度)原文
  9. L9失敗限制🅲 我哋講 觸發:升到含 commit c7d8722 之後嘅版本(Strix Halo HIP 路徑)|症狀:agent 模式靜默產生無限 "/" token|後果:輸出唔可信但唔會報錯;issue 至今 open、8 則留言|解:待驗 —— 候選修復 PR #25863 未做 matched local A/B原文
  10. L10跨配置教訓🅲 我哋講 觸發:agent 場景觸發大量 tool call|症狀:效能明顯下降|後果:純文字速度結論唔可以照搬落 agent 工作流(報告原文:agent workload 要當獨立驗收面)|解:部分 —— issue 已 closed、僅 1 則留言,未見具體修復版本,採用前要自己 A/B原文
  11. L11跨配置教訓🅲 我哋講 觸發:用 Anthropic 兼容端點 /v1/messages + xhigh(Qwen3.8 預設)|症狀:xhigh 被映射成 high、破壞 chat template|後果:同一模型同一機、換客戶端協議就壞;issue 至今 open|解:有(替代路徑)—— 改用原生 /api/chat原文

自己砌機幾時回本?

成本由實測配置推算:硬件(香港零售價)+ 3 年電費 = 3 年總成本 → 除以每月 API 成本 = 回本月。 每格綁一個價格截至日;過咗覆核日未更新就要標「報價已過期,僅供參考」。

方案硬件(HK$)電費情境3 年總成本(HK$)回本月價格截至
T01Mac mini M5 Pro 64GB|25,249中電 138.63/月;港燈 157.29/月中電 30,240;港燈 30,912A 235.3 月/B 23.5 月/C 2.4 月2026-09-17
T02Mac Studio M5 Ultra 96GB|44,999中電 509.31/月;港燈 521.92/月中電 63,334;港燈 63,788A 492.9 月/B 49.3 月/C 4.9 月2026-09-17
T03RTX 5090 32GB 卡|47,999–49,999中電 615.42/月;港燈 637.59/月中電 70,154;港燈 70,952A 545.9 月/B 54.6 月/C 5.5 月2026-09-17

⚠️ 每月用量係假設值,唔係實測。香港嘅 CPU/主板/火牛損耗、零售整機價、保養成本 —— 查唔到

每一條數字喺邊度嚟?

呢頁做唔到咩?

🅲 我哋講 唔會幫你買機 · 唔會幫你裝 · 唔會判斷你公司適唔適合 · 唔會報價 · 唔會假裝識香港價


綜合實測數據,非本站自測。本頁由知識庫自動讀出(kb.json,32 份報告、83 行記錄), 數據版本 sha256 3184d3026e5e13e7…|建置 2026-09-17T19:13:31.000Z。 「查唔到」係有效值,代表我哋查唔到 —— 唔係 0,唔會留白。

Qwen 27B 本地部署實測:速度、限制同成本(27B 系列) · AntiSystem