Qwen 27B(千問 27B 系列)
Qwen 27B 系列喺自己公司機器上面跑得到:單卡 24GB 已經可以起步,32 份實測報告、10 個獨立站, 最慢同最快嘅配置差好遠。以下每一格數字都連得返原文。
32 份實測報告 · 10 個獨立站 · 最後更新 2026-09-17 · 綜合實測數據,非本站自測 · 數據版本 3184d3026e5e
呢個模型適合邊種公司?單卡夠唔夠?
🅲 我哋講 可以喺你自己公司嘅機器上面跑,讀圖、讀文件、寫程式、做長任務都應付得嚟 —— 而且單卡就夠起步,唔一定要兩張卡。
Qwen 27B 嘅基本規格係咩?
| 參數量 | 27B | 官方模型卡(S13/R06/R19) |
|---|---|---|
| 多模態 | 文字+圖片+影片 | 官方;社群用 MLX-VLM 實跑 |
| 原生上下文 | 262144(256K) | 官方模型卡 |
| 授權 | Apache 2.0 | 官方 |
| 最低記憶體 | 24GB 起(4-bit);32GB 係實際起點 | S13/R06/R19 |
| 同名世代 | Qwen3.5-27B/3.6-27B/3.8-27B(三代唔可以直接互比) | 三代唔可以直接互比 |
| 官方連結 | https://huggingface.co/Qwen/Qwen3.8-27B | |
唔同硬件配置跑幾快?(卡數同框,唔准拆開睇)
去重鍵=硬件型號 × 卡數 × 量化 × 上下文:四項完全相同=重複只留一份;有任何一項唔同=唔同配置,必須出。 全 32 行報告去重後=22 個配置,冇人手加減。收起唔等於刪走。
1 張卡(11 個配置)
| 硬件 | 卡數 | 上下文 | 速度(tokens/秒) | 來源 |
|---|---|---|---|---|
| RTX 3090 24GB ×1 張卡 | 1 | 查唔到(未標) | ~30–32 單流(來源未標並發)|Q5_K_M|未標|llama.cpp+Pi harness | R07 |
| Apple M4 Pro 48GB 統一記憶體(1 部機) | 1 | 64K | 14 單流|4-bit MLX|64K|LM Studio | R08 |
| RX 7900 XTX 24GB ×1 張卡 | 1 | 查唔到 | 38–41 單流|Q4_K_M|未標|llama.cpp Vulkan 38/Ollama ROCm 41 | R09 |
| RTX 5090 32GB ×1 張卡 | 1 | 64K | 171 單流(16 題平均)|Q4_K_M|64K|Ollama 0.32.12 | R14 |
| RTX 5090 32GB ×1 張卡 | 1 | 230K | 150.4 單流|NVFP4|230K|llama.cpp b9415(MTP;短文本 143.4/工具呼叫 127.9) | R15 |
| RTX 5090 32GB ×1 張卡 | 1 | 測試覆蓋 pp128–16,384 | 84.3 單流(llama-bench tg128)|NVFP4|測試至 16K|llama.cpp b9365(Q4_K_M 77.1/Q6_K 61.9) | R16 |
| MacBook Pro 48GB 統一記憶體(1 部機) | 1 | 查唔到 | ~14 單流|4-bit MLX|未標|MLX(同帖非 MLX 版為 ~10) | R17 |
| Apple M4 Max 40c 128GB(1 部機) | 1 | 65,536 | 6.9 單流(TG)|量化查唔到|65,536|oMLX v0.3.6(1k 為 9.2/128K 為 4.4) | R18L8 |
| RTX 3090 24GB ×1 張卡 | 1 | 262,144 | 35–45 單流(社群回報)|Q4_K_M+q4_0 KV|262,144|llama.cpp(DFlash N=5 路線 ~106) | R19 |
| Beelink GTR9 Pro(Ryzen AI MAX+ 395)128GB(1 部機) | 1 | 262,144(實測檢索過 50,059) | 20.42 單流(生成)|Q4_K_M|262,144|Ollama 0.32.13 Vulkan-RADV | R20 |
| RTX 5090 32GB ×1 張卡 | 1 | 查唔到 | 79–205 單流(視工作負載)|Q4_K_M|未標|llama.cpp(draft 開 88–205;draft 關 79) | R21 |
2 張卡(10 個配置)
| 硬件 | 卡數 | 上下文 | 速度(tokens/秒) | 來源 |
|---|---|---|---|---|
| RTX 4090 24GB ×4 張卡(TP=4;另再切 2 張卡復測) | 4 | 262,144 | ~108 單流|AWQ-INT4|262,144|vLLM 0.25.0(4 卡 TP=4;同一帖 2 卡時 79) | R01L2 |
| RTX 4090 24GB ×4 張卡(TP=4;另再切 2 張卡復測) | 2 | 262,144 | 查唔到 單流|AWQ-INT4|262,144|vLLM 0.25.0(4 卡 TP=4;同一帖 2 卡時 79) | R01L2 |
| RTX 3090 24GB ×2 張卡(PCIE 3.0 8X/8X) | 2 | 230K | ~65 單流(來源未標並發)|DENSE 27B INT8-W8A8|230K|SGLang | R02L5 |
| RTX 3090 Ti 24GB + RTX 3060 12GB(2 張卡) | 2 | 196,608 | 53–58 單流(tg)|Q4_K_M+q4_0 KV|196,608|llama.cpp(draft-mtp n=2) | R03L5 |
| RTX 3090 24GB ×2 張卡(無 NVLink) | 2 | 262,144 | 80–90 單流(基準上限 106.9)|W4A16-AutoRound|262,144|vLLM 0.27.1 | R04L4 |
| RTX 3090 ×2 張卡 | 2 | 16K | 查唔到 無 tok/s 數字:來源只報 GSM8K/MATH-500/HumanEval/MBPP 分數 | R05L1 |
| RTX 3090 24GB ×2 張卡(降到 250W) | 2 | 查唔到 | 110 單流(來源未標並發)|量化查唔到|未標|tedivm 容器(2×3090 250W) | R10 |
| A100 ×2 張卡 | 2 | 未標(模型原生 262K) | 41.77 單流(7 題平均)|bf16|未標|vLLM 41.77(SGLang 40.06/llama.cpp 23.50) | R11L3 |
| ASRock Arc Pro B70 32GB ×2 張卡(TP2) | 2 | p512/n128(模型 context 未標) | 31.26 單流(llama-bench decode)|Q8_0|p512/n128|llama.cpp SYCL fork(2 卡 TP2) | R12L6 |
| RTX 4080 Super ×2 張卡 | 2 | 查唔到 | 查唔到 無 tok/s 數字:來源只給架構同部署方式(vLLM+KServe+Envoy) | R13 |
⭐ 唔一定需要兩張卡 —— 單卡 3090(24GB)已經跑得滿 262K。多卡買嘅係「並發吞吐」同「長上下文容量」,唔係單人更快。 以上每格速度都係原文數字,我哋冇換算、冇排序偏好、冇篩走任何一行。
呢個模型做邊種任務得,邊種唔得?
等級唔用我哋嘅判斷:表 5 出尺(同級參考=中位/前 10% 線)、表 9 落判斷。 分數 > 前 10% 線 → 強;中位 ≤ 分數 ≤ 前 10% 線 → 中;分數 < 中位 → 弱;冇同級參考 → 待評級;同場景多個 benchmark 取最低。
| 場景 | 搜得到嘅講法(實測) | Benchmark | 分數 | 適合度 | 來源 |
|---|---|---|---|---|---|
| 數學解題 | ai 數學解題 | GSM8K — 小學程度嘅多步數學應用題(要列式、要推理,唔係純計算) MATH-500 — 高中競賽級數學(難好多) | GSM8K 96.7%;MATH-500 86.4% | 待評級 | R05 |
| 寫程式 | ai 寫程式 | HumanEval — 寫一個 Python 函數,跑測試睇過唔過 MBPP — 基礎 Python 編程題 | HumanEval 95.5%;MBPP 80.0% | 待評級 | R05 |
| 寫作摘要 | ai 寫作/ai 摘要 | AA-Briefcase — 知識工作長文任務(寫作、分析、簡報),由 AI 評審按 rubric 打分 | AA-Briefcase rubric 通過率 47.8%;分析質素 Elo 1581.3 | 待評級 | S19 |
| 客服 | ai 客服 | Tau-Banking — 銀行客服對話:按政策查數據、多輪工具呼叫,睇最終有無做對 | Tau-Banking 48.0%(前 10% 線 41.6%/中位 16.7%,榜內排第 5) | 強 | S19/R05/R01 |
| 知識庫 | ai 知識庫/ai 整理文件 | AA-LCR — 長上下文檢索:喺超長文件內搵出並整合答案 MLCR — 多步連結推理:要跨好幾份文件串連先答到 | AA-LCR 82.0%(前 10% 線 79.7%/中位 55.3%,排第 20);MLCR 21.7%(前 10% 線 45.6%/中位 12.8%,排第 27) | 中 | S19 |
| 自動化 | ai 自動化/ai agent 香港 | AutomationBench — 真實辦公自動化:跨應用完成多步工作流程 EnterpriseOps-Gym — 企業營運情境模擬:處理採購、排程等多步任務 Terminal-Bench 4.0 — 喺真實終端機環境完成系統管理任務 | AutomationBench 48.2%(前 10% 線 57.9%/中位 18.4%,排第 58/248);EnterpriseOps-Gym 44.2%(前 10% 線 50.1%/中位 40.2%,排第 16/59);Terminal-Bench 4.0 5.6%(前 10% 線 26.3%/中位 1.0%,排第 50/169) | 中 | S19/R11/R15 |
| 翻譯 | ai 翻譯 | 查唔到 | 查唔到 | 未測 | 查唔到 |
未有數據嘅場景照出「查唔到/未採集」—— 唔會用「大約」「應該」填。搜唔到嘅場景唔做頁。
有咩會壞、有咩限制、有咩教訓?
呢段係我哋同賣機網站最大嘅分別:成功同失敗放同一個庫,一條都唔收埋。 失敗 9 條、 跨配置教訓 2 條。
- L1(失敗限制)🅲 我哋講 :觸發:思考模式開(預設 xhigh)+難題,輸出預算用盡前思考鏈唔停|症狀:只燒 reasoning token、正文空白|後果:GSM8K 停滯項 52.4% vs 完成項 98.1%;MATH-500 停滯 6.7% vs 94.3%;3–9% 題目吃掉大部分錯誤|解:有 —— 對空白項關思考重問原文
- L2(失敗限制)🅲 我哋講 :觸發:生成請求 `max_tokens` 設得太細(例 512)+思考開|症狀:預算用盡、正文返回空字串|後果:單次請求白跑要重試|解:有 —— 生成類 ≥2048、檢索類關思考;另:冷門事實會編(2019 圖靈獎答錯)、競賽難題思考跑滿唔收斂原文
- L3(失敗限制)🅲 我哋講 :觸發:複雜長鏈 agent 任務(3D 網站生成)+上下文反覆回灌|症狀:拆 75 step/3 turn/124 次請求,思考時間 5,974 秒|後果:9 題燒 13,995,350 token、197 次請求、6 小時 17 分;單一 3D 網站題就 11.5M token|解:部分 —— 要約束 step 數同輸出邊界原文
- L4(失敗限制)🅲 我哋講 :觸發:262K 上下文+2 路並發|症狀:decode 被攤分|後果:各自只剩 ~42 tok/s(唔係 2×90);聚合 ~3,200 tok/min|解:冇(架構性)—— 要分清加總吞吐同單流速度原文
- L5(失敗限制)🅲 我哋講 :觸發:雙卡 3090+262K ctx+fp8 KV+4 路並發|症狀:聚合吞吐回落|後果:4 並發 243.4 t/s < 2 並發 260.9 t/s(疑 KV 觸發 preempt)|解:有(診斷向)—— 睇 #retract/#preempt 計數同 mem_fraction_static,縮短 ctx 再測;另 NVLink 效益被指誇大原文
- L6(失敗限制)🅲 我哋講 :觸發:有利 prompt 形狀+DFlash5 草稿|症狀:單次衝高、唔可複現|後果:65.00 tok/s vs 固定套件中位數 38.08(差 1.7 倍)|解:有 —— 只引用固定套件中位數;報告明寫「must not be quoted as target-only」原文
- L7(失敗限制)🅲 我哋講 :觸發:照抄標題數字|症狀:同一帖標題寫 45 tok/s、內文寫 456 tok/s|後果:引用會錯一個數量級|解:有 —— 以配置齊備嘅內文為準,標題只作線索原文
- L8(失敗限制)🅲 我哋講 :觸發:context 由 1k 推到 128K|症狀:TG 單調下跌|後果:TG 9.2(1k)→ 8.8(8k)→ 6.9(64k)→ 4.4(128K),跌 52%|解:部分 —— 按實際需要設 ctx 上限(Apple 統一記憶體係容量換速度)原文
- L9(失敗限制)🅲 我哋講 :觸發:升到含 commit c7d8722 之後嘅版本(Strix Halo HIP 路徑)|症狀:agent 模式靜默產生無限 "/" token|後果:輸出唔可信但唔會報錯;issue 至今 open、8 則留言|解:待驗 —— 候選修復 PR #25863 未做 matched local A/B原文
- L10(跨配置教訓)🅲 我哋講 :觸發:agent 場景觸發大量 tool call|症狀:效能明顯下降|後果:純文字速度結論唔可以照搬落 agent 工作流(報告原文:agent workload 要當獨立驗收面)|解:部分 —— issue 已 closed、僅 1 則留言,未見具體修復版本,採用前要自己 A/B原文
- L11(跨配置教訓)🅲 我哋講 :觸發:用 Anthropic 兼容端點 /v1/messages + xhigh(Qwen3.8 預設)|症狀:xhigh 被映射成 high、破壞 chat template|後果:同一模型同一機、換客戶端協議就壞;issue 至今 open|解:有(替代路徑)—— 改用原生 /api/chat原文
自己砌機幾時回本?
成本由實測配置推算:硬件(香港零售價)+ 3 年電費 = 3 年總成本 → 除以每月 API 成本 = 回本月。 每格綁一個價格截至日;過咗覆核日未更新就要標「報價已過期,僅供參考」。
| 方案 | 硬件(HK$) | 電費情境 | 3 年總成本(HK$) | 回本月 | 價格截至 |
|---|---|---|---|---|---|
| T01 | Mac mini M5 Pro 64GB|25,249 | 中電 138.63/月;港燈 157.29/月 | 中電 30,240;港燈 30,912 | A 235.3 月/B 23.5 月/C 2.4 月 | 2026-09-17 |
| T02 | Mac Studio M5 Ultra 96GB|44,999 | 中電 509.31/月;港燈 521.92/月 | 中電 63,334;港燈 63,788 | A 492.9 月/B 49.3 月/C 4.9 月 | 2026-09-17 |
| T03 | RTX 5090 32GB 卡|47,999–49,999 | 中電 615.42/月;港燈 637.59/月 | 中電 70,154;港燈 70,952 | A 545.9 月/B 54.6 月/C 5.5 月 | 2026-09-17 |
⚠️ 每月用量係假設值,唔係實測。香港嘅 CPU/主板/火牛損耗、零售整機價、保養成本 —— 查唔到。
每一條數字喺邊度嚟?
- R01 · 四卡 4090 实测最强小模型:Qwen3.8 27B(softlin|2026-08-18|中國)🅲 我哋講 動機:技術長文分享(無帶貨;結尾叫人少踩坑)
- R02 · 【倡議】3090 單/雙/多卡聯合評測帖(stxpnet|2026-09-16|中國)🅲 我哋講 動機:發起社群聯合評測、想有可比數據(社群聲望)
- R03 · 同上帖(回帖貼即時 log)(joker_chang|2026-09-17|中國)🅲 我哋講 動機:貼即時 log 求指教(純分享)
- R04 · ~3,200 tok/min on Two 3090s, No NVLink(CryptographerLow7817|2026-08-23|美國)🅲 我哋講 動機:分享自家 agent 實戰配置(無商業)
- R05 · I ran those benchmarks we all see on YouTube locally(on_line187|2026-08-21|美國)🅲 我哋講 動機:質疑 YouTube 跑分、自費機械評分(純分享)
- R06 · Qwen3.8-27B at 262K on Strix Halo + RTX 3090 Ti(TrifleHopeful5418|2026-08-21|美國)🅲 我哋講 動機:159 次實驗記錄(純分享)
- R07 · How many tokens/second are you getting with Qwen3.8-27B?(原帖)(CooLittleFonzies|2026-08-17|美國)🅲 我哋講 動機:收集大家數據做對照(純分享)
- R08 · 同上帖(回帖)(MCS87_|2026-08-18|美國)🅲 我哋講 動機:答別人提問(純分享)
- R09 · 同上帖(回帖)(tony_montana091|2026-08-18|美國)🅲 我哋講 動機:分享自己實測(純分享)
- R10 · Qwen 3.6 27B is the sweet spot for local development(stared(發帖)+ tedivm(留言)|2026-06-29|美國)🅲 我哋講 動機:討論+開源自己 docker 倉(純分享)
- R11 · 阿里开源 Qwen3.8-27B 本地实测(A100 雙卡)(吳海明、何宇軒(編輯:李娜、岑峰)|2026-09-01|中國)🅲 我哋講 動機:媒體實測報導(流量;非賣機)
- R12 · b70-optimization-lab 參考實驗室驗證(steveseguin 社群/mndodd(fork 作者)|2026-08-12|全球)🅲 我哋講 動機:實驗室式驗證 fork 真偽(附負面結果;無商業)
- R13 · qwen3.8-27b-self-hosted(redaER7|查唔到(GitHub API 限流)|全球)🅲 我哋講 動機:開源分享自己嘅自架 stack
- R14 · Qwen/Qwen3.8-27B discussions #103(laxmimerit|2026-08-16|全球)🅲 我哋講 動機:導流自己教學 blog/YouTube(內容行銷)
- R15 · michaelw9999/Qwen3.6-27B-NVFP4 discussions #3(raulgdm|2026-05-30|全球)🅲 我哋講 動機:幫量化作者驗證質素(無商業)
- R16 · witcheer/rtx-5090-benchmarks — NVFP4 vs Q6(witcheer|2026-05-28(倉庫建立)|全球)🅲 我哋講 動機:建立自家硬件 benchmark 倉(附可重跑腳本)
- R17 · Qwen 3.8 27B 很值得本地部署(huangyihe|2026-08-22|中國)🅲 我哋講 動機:導流付費知識社群(自述想換 Mac Studio,有型號偏好)
- R18 · Jackrong:Qwen3.5-27B-GLM5.1-Distill-v1 on M4 Max(社群提交(oMLX 平台收錄)|2026-04-20|全球)🅲 我哋講 動機:參加公開社群 benchmark 榜(平台導流自家工具)
- R19 · qwen36-27b-single-3090 · llama.cpp 配方(noonghunna|2026-04-24(倉庫建立)|全球)🅲 我哋講 動機:傳授省 VRAM 配方(無 affiliate)
- R20 · strix-halo-guide · QWEN38_STRIX_HALO.md(hogeheer499-commits|2026-08-30(證據檢視日)|全球)🅲 我哋講 動機:公開配置採購指南(明示無 affiliate,但叫人 star)
- R21 · Qwen3.8-27B llama.cpp speed settings(laxmimerit|2026-08(同作者系列)|美/印)🅲 我哋講 動機:教學導流(內容行銷)
呢頁做唔到咩?
🅲 我哋講 唔會幫你買機 · 唔會幫你裝 · 唔會判斷你公司適唔適合 · 唔會報價 · 唔會假裝識香港價
綜合實測數據,非本站自測。本頁由知識庫自動讀出(kb.json,32 份報告、83 行記錄), 數據版本 sha256 3184d3026e5e13e7…|建置 2026-09-17T19:13:31.000Z。 「查唔到」係有效值,代表我哋查唔到 —— 唔係 0,唔會留白。