整理自 r/hermesagent 社群長帖 · ← Lab Notes 首頁

Qwen3.6 社群變體終極指南
27B(Dense)與 35B-A3B(MoE)

給「有限本地硬體」玩家的完整選型地圖。本頁把社群 megathread 的本文完整整理為繁體中文——決策表、範本 bug 修正、各類變體跑分、VRAM 需求與 HuggingFace 連結一次到位。(僅整理本文,未含留言。)

最後更新:2026-07-20 兩大本地旗艦 Apache 2.0 262K 原生上下文(YaRN 可延至 1M)

👉 只想知道「怎麼選」?直接跳到最有價值的三段:依情境快速選型表GPU / VRAM 對照表已知問題與避坑。下面大量的模型卡片是查證用的字典,選型決策看這三段就夠。

先講清楚(原帖聲明):這是社群資源,不是業配。本文引用的跑分沒有一項是獨立驗證,除非特別標註,全部是發布者自報數字。唯一的獨立社群實測是 nathandreamfast 的「85 GPU-hour 對決」。

📌 永久 GitHub 鏡像(已被 Google 索引):AtlasOmnia/hermesagent-megathreads

⚠️ 先看這裡:27B vs 35B,哪個底模適合你

看完這張表,下面大部分問題都有答案了。

你的優先需求選這個為什麼但別選,如果…
最佳指令遵循 / 寫程式 / agentic 27B dense(Q4_K_M + MTP) SWE-bench Verified 77.2%(35B 為 73.4%);社群 45 天實測顯示指令遵循更緊 你要最高 tok/s——27B 在同硬體上約比 35B 慢 3.5 倍
最快推理、數學(AIME)、低 VRAM 35B-A3B MoE(Q6_K_XL) 每 token 僅約 3B 參數活躍;一般 GPU 約 18–20 tok/s;AIME 2025 92.92、SWE-bench 73.4% 你是 Blackwell——NVFP4 版兩者都能到 88–93 tok/s,且 NVFP4 27B 的 AIME 有 92.7
Blackwell,速度+品質最佳 NVFP4 + MTP(任一底模) 約 88–100 tok/s;接近 FP8 品質 你以寫程式跑分為重——NVFP4 在 SWE-bench 掉約 10%(見誠實話一節)
長程 agentic 考慮改用 Gemma 4 31B 社群回報:長 agent 迴圈有人偏好它勝過 Qwen 你需要 Qwen 專屬生態系
本地推理新手 DavidAU Heretic NEO-CODE 27B 去審查 + 寫程式微調,各量化都有跑分 你不需要去審查——那就用原版 Qwen 3.6-27B
需要視覺(圖片輸入) 跳過 MTP 變體 MTP 在多數 build 與視覺衝突;用原版 Unsloth MTP 或 HauhauCS 搭 mmproj 你需要 MTP 速度

依情境快速選型表(By Situation)

這是全篇最實用的一張表——用「你的處境」直接查該下載哪個模型,以及要接受什麼取捨。

你的處境下載這個為什麼取捨
寫程式(27B,要原始 SWE-bench)DavidAU Heretic NEO-CODE Q4_K_Marc-c +4%、去審查不適合需要推理的 agentic 流程
寫程式(27B,要推理增強)Jackrong Qwopus3.6-27B-Coder-MTP推理軌跡改善結構化寫程式SWE-bench 67%(比底模低 10%),只適合結構化流程
Agent(35B)unsloth Qwen-AgentWorld-35B-A3B修迴圈/工具洩漏、agent 調校七月全新,尚無獨立跑分
Agent(27B)27B Q8 + MTP + reasoning OFF + froggeric 範本窄 schema 下 95% agent 成功率需自訂範本 + 窄 schema
去審查(任一底模)llmfan46 heretic(27B 或 35B)KL 0.0021 = 偏移最小;拒答 6/100無 SWE/AIME 數據,保能力靠推得
推理(35B)lordx64 Opus 4.7 DistilledOpus 推理風、資料集公開;GSM8K 84.3%、MMLU-Pro 74.9%聊天會迴圈、簡單題也燒思考 token
推理(27B)rico03 Opus 4.6 DistilledOpus 4.6 風、社群偏好的 dense 底模未列相對底模的 SWE/AIME delta
速度(Blackwell)NVFP4-MTP(michaelw9999 日常主力)約 100–120 t/s;塞得進 24GB 的最大 dense/MoESWE-bench 掉 8–10%、AIME 約 0.4;Ampere/Ada 載不了
速度(非 Blackwell)unsloth MTP UD-Q4_K_M貪婪解碼零損失、1.5–2× 加速需含 PR #22673 的自訂 llama.cpp
最快 MoE(Blackwell)michaelw9999 35B-A3B NVFP4-MTPMoE 上約 100 t/s僅 Blackwell;NVFP4 取捨照舊
數學 / AIME35B-A3B Q6_K_XL(Unsloth MTP)AIME 92.7–92.9%(底模)同 VRAM 下不 offload 會比 dense 慢
結構化輸出(JSON)底模 + DFlash重複/結構化工作 2–3× 加速offload 就失效、創意文字更差
新手預設DavidAU Heretic NEO-CODE(27B)跑分贏家、去審查、量化文件齊全不需去審查就有點過頭
強力去審查HauhauCS Uncensored-Aggressive2M+ 下載 = 穩定、拒答 0/465來源爭議(未證實)、無跑分
文件分析DavidAU 40B Opus-Deckard NEO-CODE部分自報 benchmark +4–14%兩極評價、無 SWE/AIME、有人嫌「schizo」
AMD 7900 XTXplunderstruck MTP-ROCmFP4ROCm FP4 路線社群較小
Mac 24GB(M 系)Qwen3.6-27B Q4_K_M(首選)或 Gemma 4 12B Q8 MTP27B Q4 塞得進 24GB 統一記憶體、留上下文空間Qwen 在 Mac 可用,要速度偏好 Gemma
長程 agentGemma 4 31B 或 26B長 agent 迴圈有人偏好它勝過 Qwen非 Qwen、生態系不同

GPU / VRAM 對照表——檔案大小 + 預期速度

先看你的卡有多少 VRAM,再決定量化等級。

✅ 實測補充・編按——下表已依實機測試修訂;本段說明修訂了什麼、以及為何與社群流傳的數據不同

原始社群數據來自 r/hermesagent megathread,其中六點經實機測試後發現有出入。前四點已直接反映在下表,後兩點屬於變體評分與任務選型,見對應章節。表格每一格都標了證據等級,方便判斷哪些是實跑過的、哪些還只是社群說法:

  1. B200 有 180–192GB、RTX 5090 有 32GB——社群把兩張卡並列成「24–80GB」,下表已拆成兩列並更正 VRAM。而且 RTX 5090 跑 35B-A3B 實測可達 150 t/s 以上,明顯快於同卡的 27B(100–120 t/s),兩者有清楚的速度差,別以為 MoE 沒優勢。
  2. RTX 4080 只有 16GB,不可能和 24GB 的 RTX 4090 用相同配置。社群把 4080/4090 並列同一格會誤導,下表已拆成兩列:4090 維持 Q4_K_M;4080 因 Q4_K_M 含上下文約 20GB 已超過 16GB,改標 Q3_K_M(含上下文約 15GB)貼線可跑。此配置由 VRAM 需求推算,標記為推估,尚未實跑。
  3. RTX 3090 與 RTX 4090 雖然同為 24GB VRAM,但架構差異使 MTP 收益不同——同 VRAM 不代表同速度或同加速幅度,別直接照搬 4090 的預期值到 3090。下表已於 3090 列加註。
  4. RTX 3060(12GB)無法完整載入 12.4GB 的 27B 權重;但 35B 反而可行——透過 MoE 分配把稀疏層(35B 本體)放到 RAM、A3B 活躍部分放到 VRAM,可跑出將近 17 t/s,一般對話情形已可使用。社群原本寫「3060 上 35B 太小、品質不足」,結論正好相反,下表已整格改寫
  5. (不屬本表,見〈變體〉章節)lordx64 Opus 4.7 蒸餾版不該拿 GSM8K 成績當賣點:bnb 4bit 版的原始 27B 用 5-shot 就能跑到 86 分,8-shot 才 84.3——換言之社群列的「GSM8K 84.3%」其實低於原始 27B。社群跑分僅供參考,別被單一數字牽著走。
  6. (不屬本表,見〈選型〉章節)數學任務請選 27B(Dense)AIME 2026 分數 27B > 35B,Dense 模型在數學表現仍較佳。若要同時兼顧程式語言與數學任務,仍以 27B 為主
顯卡VRAM27B 建議35B-A3B 建議
RTX 5090 32GB 實測 NVFP4-MTP full(16.19GB),約 100–120 t/s 社群 NVFP4-MTP full,150 t/s 以上 實測
明顯快於同卡的 27B,MoE 優勢確實存在
B200 180–192GB 實測 NVFP4-MTP full,上下文可全開 推估 NVFP4-MTP full,VRAM 餘裕充足 推估
RTX 4090 24GB Q4_K_M MTP(含上下文 ~20GB),約 60–80 t/s 社群 Q4_K_M 或 Q6_K,約 18–20 t/s 社群
RTX 4080 16GB 實測 Q4_K_M 放不下(含上下文 ~20GB > 16GB);改 Q3_K_M(12.4GB/含上下文 ~15GB)貼線可跑 推估 Q4_K_M 須縮上下文,或走 MoE 分流把稀疏層放 RAM 推估
RTX 3090 24GB Q4_K_M(~19GB),Q3_K_M(13.82GB)上下文吃緊 社群 Q4_K_M(22.66GB)中等上下文 社群
架構較舊,MTP 加速幅度不同於 4090,同 24GB 不代表同速度 實測
AMD 7900 XTX 24GB plunderstruck ROCmFP4 或 Q4_K_M(ROCm) 社群 Q4_K_M 社群
Mac 24GB(M 系) 統一 Q4_K_M,注意統一記憶體 + 上下文 社群 Q4_K_M 社群
RTX 3060 12GB 12GB 載不下——Q3_K_M 權重 12.4GB 已吃滿全部 VRAM,含上下文約 15GB 實測 反而可行,約 17 t/s:MoE 分流,稀疏層(35B 本體)放 RAM、A3B 活躍部分放 VRAM,一般對話已堪用 實測
A100 / H100 40–80GB Q8_0 @ 128K 上下文 社群 Q5_K_M 或 Q6_K @ 128K 社群

實測 本機實際跑過  社群 來自 r/hermesagent megathread,未經本機驗證  推估 由實測數據與 VRAM 需求推算,尚未實跑

速度小抄:

  • MTP 約 +1GB 開銷、1.5–2× 加速
  • DFlash 約 +0.88GB、結構化工作 2–3× 加速
  • 35B-A3B MoE 在同硬體上比 27B dense 快(每 token 僅 3B 活躍)——5090 實測 150+ t/s vs 27B 的 100–120 t/s,速度差明確
  • 寫程式關掉 reasoning:「寫程式關推理比較好。推理留給研究、翻 log、寫規格;寫程式就直接執行。」(u/rchamp26)

已知問題與避坑

🔴 「深度思考」工具迴圈 bug

Qwen3.6 原生的「deep thinking」模式會造成 agent 工具呼叫迴圈:模型在 tool JSON 前先吐一段推理獨白,而思考軌跡又不會跨回合保留。

三種修法(擇一):

最佳修法(社群公認):用 froggeric 修補過的 chat template → froggeric/Qwen-Fixed-Chat-Templates

各情境迴圈風險:

推理蒸餾變體(lordx64、hesamation、Qwopus Coder、rico03、Brian6145)因訓練在「壓平的推理軌跡」上,較不受此影響。

重複迴圈的溫度修法

Qwopus、HauhauCS、lordx64 上,使用者回報把 temp 提到 1.0 能修掉重複迴圈。rico03 則建議推理模型專用 temp=0.6

32K 以上長上下文

用 YaRN/RoPE 縮放,不要直接擴上下文視窗:

--rope-scaling yarn --rope-scale 4 --yarn-orig-ctx 32768

可得 128K 上下文;27B 與 35B-A3B 用法相同。

IQ 量化 vs K 量化

IQ(importance-aware)量化通常勝過同尺寸的 K 量化。優先 IQ3_M > Q3_K_MIQ4_XS > Q4_XS。DavidAU 的逐量化跑分佐證這點。

⚠️ WATCH FOR(上路前再確認一次)

  • NVFP4 需要 Blackwell。Ampere/Ada 上 NVFP4 檔案載不了,改用 FP8/FP16/GGUF。
  • NVFP4 仍是量化——SWE-bench / 重寫程式任務預期掉 8–10%,不是數學無損。
  • MTP:部分 build 不支援 -np>1、不支援 --mmproj(視覺),依後端確認。
  • 深度思考迴圈:照上面關閉,或用推理蒸餾 build,或把 reasoning budget 設 4096。
  • 下載數是根 repo 累計、只增不減;看到「下降」當作 repo-ID 對錯了。標 (est) 的是 HF API 估算、可能 ±10%。
  • Froggeric 範本修工具呼叫 bug,連結見上方。

編輯者的實機(field-tested):作者日常主力是 michaelw9999/Qwen3.6-27B-NVFP4-MTP-GGUF,跑在 Blackwell + llama.cpp MTP(--spec-draft-n-max 2),偶爾 spot-run 35B-A3B NVFP4-MTP。27B dense 的 NVFP4 是單張 24GB Blackwell 塞得進、又留上下文空間的最大 dense 模型。「45 天實測」與「範本修正」兩份社群報告,正是本指南「agentic 偏 27B-dense、且把深度思考迴圈列為第一個該關的東西」的依據。

關鍵洞察:範本 bug 才是工具呼叫品質的最大變數

多份社群回報一致指出:Qwen 3.6 工具呼叫(tool-calling)好壞,最大單一因素是「chat template(對話範本)bug」。Froggeric 的修補範本能修掉大部分問題。

「工具呼叫比較差,是因為標準 chat template 有 bug。HuggingFace 上 froggeric 有一些修補過的範本。我改用那些之後,qwen 3.6 35b a3b q4km 的工具呼叫幾乎再也沒出過問題。」 — u/i_am_me0_0(+47,r/LocalLLM)

範本 repo:froggeric/Qwen-Fixed-Chat-Templates

常被引用的「95% agent 成功率」來自 27B Q8 + 窄工具 schema + froggeric 範本不是用預設設定跑底模。用預設設定,社群回報約 75% 成功率。先修範本,再挑量化。

🔴 哪些不要選——幫你省下自我除錯的時間

以下這些,別用在對應的使用情境:

兩個底模

Qwen3.6-35B-A3B(MoE)

Benchmark(官方,底模)分數
SWE-bench Verified73.4%
SWE-bench Multilingual67.2%
Terminal-Bench 2.051.5%
MMLU-Pro85.2%
GPQA Diamond86.0%
AIME 202692.7%
LiveCodeBench v680.4%

官方:Qwen/Qwen3.6-35B-A3B

Qwen3.6-27B(Dense)

Benchmark(官方,底模)分數
SWE-bench Verified77.2%
SWE-bench Pro53.5%
Terminal-Bench 2.059.3%
MMLU-Pro86.2%
GPQA Diamond87.8%
AIME 202694.1%
LiveCodeBench v683.9%

官方:Qwen/Qwen3.6-27B

結論:兩者都很強。27B dense 寫程式贏(SWE-bench +4%);35B MoE 速度贏(同 VRAM 快 3.5 倍)。數學(AIME)幾乎並駕齊驅。

變體七大類——相對底模改了什麼

  1. UNCENSORING(無損安全移除):拿掉拒答行為、不動能力。準確度相同、少了「我沒辦法幫你」。測試中拒答 0–6/100(底模為 92–99/100)。
  2. HERETIC(去審查 + 保能力的手術式編輯):移除拒答,並延長思考鏈來補償。比純 abliteration 更精緻,最新測試中保能力最佳。
  3. ABLITERATION(手術式移除拒答):在權重空間針對「拒答方向」消融。可能影響能力/穩定度,品質因方法而異。
  4. REASONING DISTILLATION(從 Claude Opus 蒸餾):用 Opus 4.6/4.7 的思考鏈訓練,加入顯式 <think>。已知有迴圈風險,聊天為主時燒延遲。
  5. MTP / 推測解碼(速度層):Multi-token prediction,一步預測 2–3 個 token。約 1 GB 開銷、貪婪解碼下約 1.5–2× 加速(u/ElmBark 逐位元組驗證)。
  6. NVFP4(Blackwell 原生 4-bit float):NVIDIA 原生 4-bit,接近 FP8 品質、體積減半。僅 Blackwell(Ampere/Ada 載不了)。已知取捨:SWE-bench 約掉 10% 換速度。
  7. AGENT-SPECIFIC 微調:專為 agentic 工具呼叫訓練的新類別,例如 unsloth Qwen-AgentWorld 針對迴圈/工具洩漏問題。

35B-A3B(MoE)各變體

去審查 / Abliterated

HauhauCS Aggressive

2,007,025 下載 · 2,923 likes(HF 驗證)

Q4_K_M 21GBIQ4_XS 19GBQ6_K_P 31GBQ8 44GBmmproj 899MB

底模以 abliteration 移除安全、不動能力。拒答 0/465。「最佳無損去審查」為發布者自報,卡片未列 SWE-bench/AIME delta。爭議:u/Wity_Mycologist_995 指控盜用(未證實)。下載量最高的去審查選擇。設定:thinking temp=1.0、coding 0.6、non-thinking 0.7。

HuggingFace ↗

llmfan46 heretic(35B-A3B 與 27B)

35B:110K 下載 · 27B:64.8K 下載

保能力最佳(有數據)Q4_K_M ~18GBNVFP4-MTP ~18–20GB(Blackwell)

abliteration + decensor(MPOA 方法),27B 版保留原生 MTP。KL divergence 0.0021(DavidAU Heretic 為 0.0469,等於接近底模行為 22 倍);拒答 6/100(原 92/100,少 94%);MMLU 86.65% → 85.67%(掉 0.98%)。無 SWE-bench/AIME,能力保留由 MMLU+KL 推得。想要「去審查 + 最小品質損失」,這是有數據支撐的選擇。

35B ↗ · 27B ↗

Huihui abliterated(35B 七月新出、27B 既有)

35B:14.6K 下載 · 27B:87.7K 下載(MTP-GGUF)

85hr 對決:保能力並列第一Q6_K ~21GB(27B)

純 abliteration(MPOA),乾淨權重編輯,發布者自稱「粗糙的概念驗證」。85 GPU-hour 對決中與 llmfan46 heretic 並列最佳、跑分掉幅 <1%。作者註:「huihui 在 Qwen 3.5 系列表現很差,這次 3.6 27b 扳回一城。」

35B ↗ · 27B ↗

推理蒸餾

lordx64 Opus 4.7 Distilled

29.9K 下載 · 197 likes(HF 驗證,資料集公開)

聊天工作會迴圈IQ4_XS 18.9GBQ5_K_M ~25GBQ8_0 ~35GB

用約 7,800 條 Claude Opus 4.7 推理軌跡 SFT,顯式 <think>。Attention-only LoRA(r=16),2 epochs。GSM8K CoT 84.3%(flexible)/76.7%(strict)、MMLU-Pro 74.9%;無 SWE-bench。為硬推理(研究級 STEM、競賽數學、程式推理)而生。取捨:聊天工作迴圈風險高,reasoning budget 設 max 4096。訓練卡最透明(資料集+超參全公開)。

HuggingFace ↗

hesamation Opus 4.6 Distilled

205.9K 下載 · 266 likes

同樣迴圈風險Q4_K_M ~19GB

Jackrong 風格配方、Opus 4.6 軌跡(nohurry 資料集 + Jackrong Qwen3.5 recipe + ReFT)。下載量比 lordx64 高、採用更廣。卡片無跑分。偏好 4.6 推理風格者用。

HuggingFace ↗

AEON Ultimate Uncensored

35B NVFP4:另 repo · 27B BF16:18,340 下載 · NVFP4 變體:245K 下載

「比底模強」未獲數據支持NVFP4 ~26GB(Blackwell)

「無損 abliteration」,發布者宣稱能力「可量測增強」。85 GPU-hour 對決:「AEON 的增強宣稱不被跑分支持。」MTP 接受率高、Blackwell 上 NVFP4 96–118 tok/s。無 SWE-bench/AIME。只在要 Blackwell NVFP4 去審查、且不信「比底模強」時用。

NVFP4 ↗

DavidAU 40B Opus-Deckard Heretic(七月新出,27B→40B)

16.7K 下載 · 135 likes

兩極評價Q4_K_M ~24GB

Claude 4.6 Opus + Deckard 資料集 + Heretic 去審查 + NEO-CODE 微調,多階段。自報 Nightmedia 跑分:arc-c 0.711、arc-e 0.879(皆優於兩底模)。宣稱「首個此尺寸在 8-bit 與 4-bit 都破 700 ARC-C」。無 SWE-bench/AIME/獨立驗證。社群兩極:有人說文件分析很穩、工具呼叫沒漏;也有人罵「davidau 一向產 schizo 廢模型、變更笨」。

HuggingFace ↗

Agent 專用(七月新類別)

unsloth Qwen-AgentWorld-35B-A3B

678,322 下載 · 196 likes

Unsloth 出品Q4_K_M ~18GBQ5_K_M ~22GB

Unsloth(MTP 參考作者)的 agent 微調 35B MoE,針對 agentic 工具呼叫。宣稱「解決迴圈/工具洩漏」但尚無獨立跑分。專治困擾 heretic/蒸餾變體的長 agent 迴圈問題。適合要跑長鏈的寫程式/研究/Hermes agent。新類別,先測再當預設。

HuggingFace ↗

Jackrong Qwopus3.6-35B-A3B-v1 / Coder-MTP

v1:2,943 下載 · Coder-MTP:500,846 下載(35B MoE 變體最高採用)

無獨立跑分Q4_K_M ~19GB

三階段課程 SFT(Opus 4.7+4.6 蒸餾)。v1 尚無 MTP、無跑分。Coder-MTP 為 thinking-off、token 高效的 agent 迴圈設計(給 Codex/OpenHands/Claude Code 式 harness),但無獨立跑分,且其 27B 手足(67% SWE-bench,-10%)顯示退步風險延續到 MoE。要 35B MoE 寫程式且能忍受未驗證差距時用;否則優先 unsloth AgentWorld。

Coder-MTP ↗

MTP / 速度

unsloth MTP reference(35B-A3B)

609,978 下載 · 744 likes(HF 驗證)

預設 MTP 首選UD-Q4_K_XL ~22.66GB

事實上的 MTP 參考。貪婪解碼零品質損失(u/ElmBark 逐位元組 diff 驗證「byte for byte」)。加速約 1.5–2×、約 1 GB 開銷。需要含 PR #22673 的自訂 llama.cpp、或 Unsloth Studio。限制:-np>1(並行解碼)不支援、部分 build MTP 與視覺不相容。「要更快又零損失」就從這支開始。

HuggingFace ↗

michaelw9999 35B-A3B NVFP4-MTP

166,343 下載 · 6 likes(HF 驗證)

僅 Blackwell~18GB + KV + MTP head

NVFP4 + MTP,Blackwell only。貪婪解碼同樣逐位元組保證、「NVFP4 近 FP8」為自報。社群質疑(u/Remove_Ayys):「把 W4A16→W4A4 說成『無精度損失』有誤導;你挑的 benchmark 對這改動不敏感。」速度:5090 上約 100 tps。Ampere(30xx)/Ada(40xx)載不了。

HuggingFace ↗

DFlash 推測解碼(35B-A3B)

58.6K 下載 · 225 likes

drafter 僅 0.88GB結構化/JSON 最佳

獨立的 4 層 block-diffusion 草稿模型(不是聊天模型,是加速疊層)。理論 2–3×、社群實測 145–450 t/s(RTX 6000)。u/1uyay0w:「DFlash 一次連草 15 個 token,在 JSON 這種重複/結構化的東西飛快(152 tok/s、3.4×);創意文字多半猜錯、可能低於基準(42 vs 44)。」關鍵差異:MTP 在模型內只並行猜 3 個,猜錯幾乎零成本、永不低於基準。DFlash 一旦 offload 就失效,必須全進 VRAM。

HuggingFace ↗

27B(Dense)各變體

去審查 / Abliterated

HauhauCS Aggressive(27B)

358,952 下載 · 527 likes(HF 驗證)

Q4_K_M ~18GBIQ4_XS ~14GBQ6_K_P ~27GB

abliterated 27B,拒答 0/465、「最佳無損去審查」。卡片無 SWE-bench/AIME delta。85hr 測試「表現尚可,但工具/來源疑慮使可靠度打折」,另有盜用指控(未證實)。社群多偏好 Huihui 或 llmfan46 heretic(兩者有數據)。設定:thinking 1.0、coding 0.6、non-thinking 0.7。

HuggingFace ↗

llmfan46 heretic(27B)

62,155+ 下載 · 157 likes(HF 驗證)

KL 最低 = 保能力最佳Q4_K_M ~16GBNVFP4-MTP ~18GB(Blackwell)

abliteration + decensor(MPOA),拒答少 94%、保留原生 MTP。KL 0.0021(DavidAU Heretic 0.0469 的 1/22);MMLU 掉 0.98%。無 SWE-bench/AIME,僅推得保留。要「去審查 + 最高保真 + MTP 速度」就這支。

HuggingFace ↗

Huihui abliterated(27B)

87.7K 下載(MTP-GGUF)· 80 likes

85hr 對決:保能力最佳Q4_K_M ~16GBQ6_K ~21GB

純 abliteration(MPOA),乾淨最小權重編輯、MTP-GGUF 形式。85 GPU-hour 對決與 llmfan46 heretic 並列第一、「整體保能力最佳、跑分掉幅最小」、能力保留在底模 1% 內。卡片無 SWE/AIME/KL,推自社群測試。

HuggingFace ↗

Heretic + 微調

DavidAU Heretic Uncensored NEO-CODE

131,380 下載 · 402 likes(HF 驗證)

去審查寫程式社群預設Q4_K_M ~15.7GB(含上下文 ~19GB)

兩階段:(1) heretic 去審查(拒答 4/100,底模 99/100)、(2) Unsloth 寫程式微調。KL(Heretic)0.0469。逐量化品質表:Q4_K_M = 94.51% 同 Top P、Q6_K 97.41%、Q8_0 98.47%、IQ2_M 82.82%。Nightmedia 自報:arc-c +4.0%、arc-e +5.4%、boolq -0.5%。只有 arc-c/arc-e 確認提升,boolq 微降——「全面超越底模」屬行銷語。有 KL + 量化表可依 VRAM 選、4/100 等於實質去審查、加上寫程式微調,成社群預設。設定:thinking 1.0、coding 0.6、instruct 0.7。

HuggingFace ↗

DavidAU NEO-CODE(非去審查)

4,552 下載 · 69 likes

Q4_K_M ~15.7GB

同樣寫程式微調、不含 heretic 去審查,純能力加法。arc-c/arc-e 提升同上,無保能力疑慮(是加法非安全修改)。要寫程式增益、但用不到去審查時選它。

HuggingFace ↗

推理蒸餾

rico03 Opus 4.6 Distilled(27B)

7,386 下載 · 48 likes(HF 驗證)

無 delta 驗證Q4_K_M 16.5GB

約 14K 條 Claude 4.6 Opus 軌跡 SFT(Jackrong 方法),結構化 <think>。卡片列的是底模跑分(77.2 SWE、94.1 AIME),不是蒸餾版;無 delta。train loss 0.305。GGUF:Q4_K_M 16.5GB、Q8_0 28.6GB。Opus 4.6 推理跑在社群偏好的 27B dense 上,但獨立品質差距未公開。

HuggingFace ↗

Brian6145 Opus + Sonnet Distilled NVFP4+MTP(27B)

22.4K 下載 · 28 likes

無跑分NVFP4 ~16GB(Blackwell)

多教師蒸餾(Claude Opus + Sonnet)、NVFP4 + MTP、vLLM 優化。因訓練在「壓平的軌跡」上,較不受深思迴圈影響。無跑分。Blackwell 全包(推理+速度+量化)。

HuggingFace ↗

Jackrong Qwopus3.6-27B-v2-MTP

90,956 下載 · 378 likes(HF 驗證)

MTP 速度有驗證MTPQ4_K_M ~16.8GB

v2 更新,推理調校 + MTP、「Trace Inversion & Negentropy」訓練,主打 agentic 寫程式/DevOps/結構化邏輯/數學。30 題實測:10.46 T/s vs 6.29(底模)= 1.66×;總時間 14,902s→6,488s(省 56.5%);完成 token -27.7%(更精簡)。分領域加速:邏輯 2.31×、寫程式 2.25×、DevOps 2.31×、數學 2.35×。要「推理 + MTP 在 27B」就這支。

HuggingFace ↗

Jackrong Qwopus3.6-27B-Coder-MTP

125,312 下載 · 330 likes(HF 驗證)

SWE-bench 比底模退 10%Q5_K_M ~20GB

基於 v2 的 agentic 寫程式模型 + MTP。SWE-bench Verified 67.0%(335/500)——比底模 27B 低 10.2%。分 repo:scikit-learn 84%、xarray 82%、django 72%… 速度 5090 上約 100 t/s。別為原始 SWE-bench 選它;只在你有「推理軌跡能改善結構化輸出」的特定 agentic 寫程式流程、且接受 10% 退步時用。

HuggingFace ↗

MTP / 速度

unsloth MTP reference(27B)

2,860,615 下載 · 1,131 likes(HF 驗證)— 全系列下載王

27B 預設 MTPQ4_K_M 17.11GB(含上下文 ~20GB)

事實上的 MTP 參考。貪婪解碼零品質損失(u/ElmBark 逐位元組驗證)。加速約 1.5–2×、約 1 GB 開銷。需含 PR #22673 的自訂 llama.cpp。27B 最快推理的預設選擇。

HuggingFace ↗

michaelw9999 27B NVFP4-MTP

88,404 下載 · 48 likes(HF 驗證,作者日常主力)

Blackwell 塞得進 24GB 的最大 dense16.19GB + KV + MTP head

NVFP4 + MTP,Blackwell only。逐位元組保證、「近 FP8」自報,社群質疑同 35B 版。u/notheresnolight:「27B MTP Q6_K 帶 200K 上下文,在我的 5090 上比 Sonnet 5 還快,約 100–120 t/s。」NVIDIA 卡驗證(BF16 vs NVFP4):MMLU Pro 86.1→86.3、AIME 2025 93.1→92.7、GPQA 86.0→85.5——雙向小幅、對這些 benchmark「無損」成立,但NVIDIA 卡未報 SWE-bench

HuggingFace ↗

Qwen3.6-27B + DFlash

同 35B 段的 drafter,通用

結構化輸出/寫程式

同一草稿模型可用,注意事項與 35B 相同(全進 VRAM 才划算、創意文字可能低於基準)。

HuggingFace ↗

🔴 NVFP4-MTP 前沿:誠實話(僅 Blackwell)

85 GPU-hour 社群對決是唯一的獨立 abliteration 比較。NVFP4 是 NVIDIA 原生 4-bit float,在 Blackwell(RTX 5090、B 系)約以 FP8 一半體積換近 FP8 品質;搭 MTP 可讓 35B MoE 或 27B dense 在單張 24GB 卡上跑很快。

需求

🔴 選之前先讀:發布者常說「近無損」。現實是——NVFP4 是量化,拿品質換體積,取捨真實存在、且因 benchmark 而異。

RedHatAI NVFP4(35B-A3B,目前最完整的公開跑分)

BenchmarkBF16 底模NVFP4恢復率
GSM8k Platinum (0-shot)95.7396.08100.37%
IfEval (0-shot)93.0992.4599.31%
AIME 202592.9291.2598.21%
GPQA Diamond84.5184.68100.20%
Math 50084.8085.00100.24%
LCB Codegen V677.3374.6796.55%
MMLU Pro Chat85.3284.7099.28%
SWE-bench Verified54.850.291.61%
BFCLv4 Overall57.8356.1097.01%
BFCLv4 Multi-Turn62.2558.1393.38%
BFCLv4 Agentic49.9149.3198.80%

關鍵:NVFP4 在 SWE-bench Verified 掉 8.4%、LCB Codegen 掉 4.6%——正是兩個最重要的 agentic 寫程式 benchmark。數學與指令遵循則穩(AIME 98.2%、MMLU 99.3%)。

什麼時候用 NVFP4

什麼時候別用 NVFP4

值得注意的缺席(截至 07-20)+ Qwen3.8 預告