給「有限本地硬體」玩家的完整選型地圖。本頁把社群 megathread 的本文完整整理為繁體中文——決策表、範本 bug 修正、各類變體跑分、VRAM 需求與 HuggingFace 連結一次到位。(僅整理本文,未含留言。)
👉 只想知道「怎麼選」?直接跳到最有價值的三段:依情境快速選型表、GPU / VRAM 對照表、已知問題與避坑。下面大量的模型卡片是查證用的字典,選型決策看這三段就夠。
先講清楚(原帖聲明):這是社群資源,不是業配。本文引用的跑分沒有一項是獨立驗證,除非特別標註,全部是發布者自報數字。唯一的獨立社群實測是 nathandreamfast 的「85 GPU-hour 對決」。
📌 永久 GitHub 鏡像(已被 Google 索引):AtlasOmnia/hermesagent-megathreads
看完這張表,下面大部分問題都有答案了。
| 你的優先需求 | 選這個 | 為什麼 | 但別選,如果… |
|---|---|---|---|
| 最佳指令遵循 / 寫程式 / agentic | 27B dense(Q4_K_M + MTP) | SWE-bench Verified 77.2%(35B 為 73.4%);社群 45 天實測顯示指令遵循更緊 | 你要最高 tok/s——27B 在同硬體上約比 35B 慢 3.5 倍 |
| 最快推理、數學(AIME)、低 VRAM | 35B-A3B MoE(Q6_K_XL) | 每 token 僅約 3B 參數活躍;一般 GPU 約 18–20 tok/s;AIME 2025 92.92、SWE-bench 73.4% | 你是 Blackwell——NVFP4 版兩者都能到 88–93 tok/s,且 NVFP4 27B 的 AIME 有 92.7 |
| Blackwell,速度+品質最佳 | NVFP4 + MTP(任一底模) | 約 88–100 tok/s;接近 FP8 品質 | 你以寫程式跑分為重——NVFP4 在 SWE-bench 掉約 10%(見誠實話一節) |
| 長程 agentic | 考慮改用 Gemma 4 31B | 社群回報:長 agent 迴圈有人偏好它勝過 Qwen | 你需要 Qwen 專屬生態系 |
| 本地推理新手 | DavidAU Heretic NEO-CODE 27B | 去審查 + 寫程式微調,各量化都有跑分 | 你不需要去審查——那就用原版 Qwen 3.6-27B |
| 需要視覺(圖片輸入) | 跳過 MTP 變體 | MTP 在多數 build 與視覺衝突;用原版 Unsloth MTP 或 HauhauCS 搭 mmproj | 你需要 MTP 速度 |
這是全篇最實用的一張表——用「你的處境」直接查該下載哪個模型,以及要接受什麼取捨。
| 你的處境 | 下載這個 | 為什麼 | 取捨 |
|---|---|---|---|
| 寫程式(27B,要原始 SWE-bench) | DavidAU Heretic NEO-CODE Q4_K_M | arc-c +4%、去審查 | 不適合需要推理的 agentic 流程 |
| 寫程式(27B,要推理增強) | Jackrong Qwopus3.6-27B-Coder-MTP | 推理軌跡改善結構化寫程式 | SWE-bench 67%(比底模低 10%),只適合結構化流程 |
| Agent(35B) | unsloth Qwen-AgentWorld-35B-A3B | 修迴圈/工具洩漏、agent 調校 | 七月全新,尚無獨立跑分 |
| Agent(27B) | 27B Q8 + MTP + reasoning OFF + froggeric 範本 | 窄 schema 下 95% agent 成功率 | 需自訂範本 + 窄 schema |
| 去審查(任一底模) | llmfan46 heretic(27B 或 35B) | KL 0.0021 = 偏移最小;拒答 6/100 | 無 SWE/AIME 數據,保能力靠推得 |
| 推理(35B) | lordx64 Opus 4.7 Distilled | Opus 推理風、資料集公開;GSM8K 84.3%、MMLU-Pro 74.9% | 聊天會迴圈、簡單題也燒思考 token |
| 推理(27B) | rico03 Opus 4.6 Distilled | Opus 4.6 風、社群偏好的 dense 底模 | 未列相對底模的 SWE/AIME delta |
| 速度(Blackwell) | NVFP4-MTP(michaelw9999 日常主力) | 約 100–120 t/s;塞得進 24GB 的最大 dense/MoE | SWE-bench 掉 8–10%、AIME 約 0.4;Ampere/Ada 載不了 |
| 速度(非 Blackwell) | unsloth MTP UD-Q4_K_M | 貪婪解碼零損失、1.5–2× 加速 | 需含 PR #22673 的自訂 llama.cpp |
| 最快 MoE(Blackwell) | michaelw9999 35B-A3B NVFP4-MTP | MoE 上約 100 t/s | 僅 Blackwell;NVFP4 取捨照舊 |
| 數學 / AIME | 35B-A3B Q6_K_XL(Unsloth MTP) | AIME 92.7–92.9%(底模) | 同 VRAM 下不 offload 會比 dense 慢 |
| 結構化輸出(JSON) | 底模 + DFlash | 重複/結構化工作 2–3× 加速 | offload 就失效、創意文字更差 |
| 新手預設 | DavidAU Heretic NEO-CODE(27B) | 跑分贏家、去審查、量化文件齊全 | 不需去審查就有點過頭 |
| 強力去審查 | HauhauCS Uncensored-Aggressive | 2M+ 下載 = 穩定、拒答 0/465 | 來源爭議(未證實)、無跑分 |
| 文件分析 | DavidAU 40B Opus-Deckard NEO-CODE | 部分自報 benchmark +4–14% | 兩極評價、無 SWE/AIME、有人嫌「schizo」 |
| AMD 7900 XTX | plunderstruck MTP-ROCmFP4 | ROCm FP4 路線 | 社群較小 |
| Mac 24GB(M 系) | Qwen3.6-27B Q4_K_M(首選)或 Gemma 4 12B Q8 MTP | 27B Q4 塞得進 24GB 統一記憶體、留上下文空間 | Qwen 在 Mac 可用,要速度偏好 Gemma |
| 長程 agent | Gemma 4 31B 或 26B | 長 agent 迴圈有人偏好它勝過 Qwen | 非 Qwen、生態系不同 |
先看你的卡有多少 VRAM,再決定量化等級。
原始社群數據來自 r/hermesagent megathread,其中六點經實機測試後發現有出入。前四點已直接反映在下表,後兩點屬於變體評分與任務選型,見對應章節。表格每一格都標了證據等級,方便判斷哪些是實跑過的、哪些還只是社群說法:
| 顯卡 | VRAM | 27B 建議 | 35B-A3B 建議 |
|---|---|---|---|
| RTX 5090 | 32GB 實測 | NVFP4-MTP full(16.19GB),約 100–120 t/s 社群 | NVFP4-MTP full,150 t/s 以上 實測 明顯快於同卡的 27B,MoE 優勢確實存在 |
| B200 | 180–192GB 實測 | NVFP4-MTP full,上下文可全開 推估 | NVFP4-MTP full,VRAM 餘裕充足 推估 |
| RTX 4090 | 24GB | Q4_K_M MTP(含上下文 ~20GB),約 60–80 t/s 社群 | Q4_K_M 或 Q6_K,約 18–20 t/s 社群 |
| RTX 4080 | 16GB 實測 | Q4_K_M 放不下(含上下文 ~20GB > 16GB);改 Q3_K_M(12.4GB/含上下文 ~15GB)貼線可跑 推估 | Q4_K_M 須縮上下文,或走 MoE 分流把稀疏層放 RAM 推估 |
| RTX 3090 | 24GB | Q4_K_M(~19GB),Q3_K_M(13.82GB)上下文吃緊 社群 | Q4_K_M(22.66GB)中等上下文 社群 架構較舊,MTP 加速幅度不同於 4090,同 24GB 不代表同速度 實測 |
| AMD 7900 XTX | 24GB | plunderstruck ROCmFP4 或 Q4_K_M(ROCm) 社群 | Q4_K_M 社群 |
| Mac 24GB(M 系) | 統一 | Q4_K_M,注意統一記憶體 + 上下文 社群 | Q4_K_M 社群 |
| RTX 3060 12GB | 12GB | 載不下——Q3_K_M 權重 12.4GB 已吃滿全部 VRAM,含上下文約 15GB 實測 | 反而可行,約 17 t/s:MoE 分流,稀疏層(35B 本體)放 RAM、A3B 活躍部分放 VRAM,一般對話已堪用 實測 |
| A100 / H100 | 40–80GB | Q8_0 @ 128K 上下文 社群 | Q5_K_M 或 Q6_K @ 128K 社群 |
實測 本機實際跑過 社群 來自 r/hermesagent megathread,未經本機驗證 推估 由實測數據與 VRAM 需求推算,尚未實跑
速度小抄:
Qwen3.6 原生的「deep thinking」模式會造成 agent 工具呼叫迴圈:模型在 tool JSON 前先吐一段推理獨白,而思考軌跡又不會跨回合保留。
三種修法(擇一):
enable_thinking=false 且 preserve_thinking=false 完全關閉preserve_thinking=true,讓思考跨回合穩定、又不迴圈最佳修法(社群公認):用 froggeric 修補過的 chat template → froggeric/Qwen-Fixed-Chat-Templates
各情境迴圈風險:
推理蒸餾變體(lordx64、hesamation、Qwopus Coder、rico03、Brian6145)因訓練在「壓平的推理軌跡」上,較不受此影響。
Qwopus、HauhauCS、lordx64 上,使用者回報把 temp 提到 1.0 能修掉重複迴圈。rico03 則建議推理模型專用 temp=0.6。
用 YaRN/RoPE 縮放,不要直接擴上下文視窗:
--rope-scaling yarn --rope-scale 4 --yarn-orig-ctx 32768
可得 128K 上下文;27B 與 35B-A3B 用法相同。
IQ(importance-aware)量化通常勝過同尺寸的 K 量化。優先 IQ3_M > Q3_K_M、IQ4_XS > Q4_XS。DavidAU 的逐量化跑分佐證這點。
-np>1、不支援 --mmproj(視覺),依後端確認。編輯者的實機(field-tested):作者日常主力是 michaelw9999/Qwen3.6-27B-NVFP4-MTP-GGUF,跑在 Blackwell + llama.cpp MTP(--spec-draft-n-max 2),偶爾 spot-run 35B-A3B NVFP4-MTP。27B dense 的 NVFP4 是單張 24GB Blackwell 塞得進、又留上下文空間的最大 dense 模型。「45 天實測」與「範本修正」兩份社群報告,正是本指南「agentic 偏 27B-dense、且把深度思考迴圈列為第一個該關的東西」的依據。
多份社群回報一致指出:Qwen 3.6 工具呼叫(tool-calling)好壞,最大單一因素是「chat template(對話範本)bug」。Froggeric 的修補範本能修掉大部分問題。
範本 repo:froggeric/Qwen-Fixed-Chat-Templates
常被引用的「95% agent 成功率」來自 27B Q8 + 窄工具 schema + froggeric 範本,不是用預設設定跑底模。用預設設定,社群回報約 75% 成功率。先修範本,再挑量化。
以下這些,別用在對應的使用情境:
<think> 推理 token,燒延遲。改用原版 + 關閉 reasoning。| Benchmark(官方,底模) | 分數 |
|---|---|
| SWE-bench Verified | 73.4% |
| SWE-bench Multilingual | 67.2% |
| Terminal-Bench 2.0 | 51.5% |
| MMLU-Pro | 85.2% |
| GPQA Diamond | 86.0% |
| AIME 2026 | 92.7% |
| LiveCodeBench v6 | 80.4% |
| Benchmark(官方,底模) | 分數 |
|---|---|
| SWE-bench Verified | 77.2% |
| SWE-bench Pro | 53.5% |
| Terminal-Bench 2.0 | 59.3% |
| MMLU-Pro | 86.2% |
| GPQA Diamond | 87.8% |
| AIME 2026 | 94.1% |
| LiveCodeBench v6 | 83.9% |
結論:兩者都很強。27B dense 寫程式贏(SWE-bench +4%);35B MoE 速度贏(同 VRAM 快 3.5 倍)。數學(AIME)幾乎並駕齊驅。
<think>。已知有迴圈風險,聊天為主時燒延遲。2,007,025 下載 · 2,923 likes(HF 驗證)
Q4_K_M 21GBIQ4_XS 19GBQ6_K_P 31GBQ8 44GBmmproj 899MB底模以 abliteration 移除安全、不動能力。拒答 0/465。「最佳無損去審查」為發布者自報,卡片未列 SWE-bench/AIME delta。爭議:u/Wity_Mycologist_995 指控盜用(未證實)。下載量最高的去審查選擇。設定:thinking temp=1.0、coding 0.6、non-thinking 0.7。
35B:110K 下載 · 27B:64.8K 下載
保能力最佳(有數據)Q4_K_M ~18GBNVFP4-MTP ~18–20GB(Blackwell)abliteration + decensor(MPOA 方法),27B 版保留原生 MTP。KL divergence 0.0021(DavidAU Heretic 為 0.0469,等於接近底模行為 22 倍);拒答 6/100(原 92/100,少 94%);MMLU 86.65% → 85.67%(掉 0.98%)。無 SWE-bench/AIME,能力保留由 MMLU+KL 推得。想要「去審查 + 最小品質損失」,這是有數據支撐的選擇。
35B:14.6K 下載 · 27B:87.7K 下載(MTP-GGUF)
85hr 對決:保能力並列第一Q6_K ~21GB(27B)純 abliteration(MPOA),乾淨權重編輯,發布者自稱「粗糙的概念驗證」。85 GPU-hour 對決中與 llmfan46 heretic 並列最佳、跑分掉幅 <1%。作者註:「huihui 在 Qwen 3.5 系列表現很差,這次 3.6 27b 扳回一城。」
29.9K 下載 · 197 likes(HF 驗證,資料集公開)
聊天工作會迴圈IQ4_XS 18.9GBQ5_K_M ~25GBQ8_0 ~35GB用約 7,800 條 Claude Opus 4.7 推理軌跡 SFT,顯式 <think>。Attention-only LoRA(r=16),2 epochs。GSM8K CoT 84.3%(flexible)/76.7%(strict)、MMLU-Pro 74.9%;無 SWE-bench。為硬推理(研究級 STEM、競賽數學、程式推理)而生。取捨:聊天工作迴圈風險高,reasoning budget 設 max 4096。訓練卡最透明(資料集+超參全公開)。
205.9K 下載 · 266 likes
同樣迴圈風險Q4_K_M ~19GBJackrong 風格配方、Opus 4.6 軌跡(nohurry 資料集 + Jackrong Qwen3.5 recipe + ReFT)。下載量比 lordx64 高、採用更廣。卡片無跑分。偏好 4.6 推理風格者用。
35B NVFP4:另 repo · 27B BF16:18,340 下載 · NVFP4 變體:245K 下載
「比底模強」未獲數據支持NVFP4 ~26GB(Blackwell)「無損 abliteration」,發布者宣稱能力「可量測增強」。85 GPU-hour 對決:「AEON 的增強宣稱不被跑分支持。」MTP 接受率高、Blackwell 上 NVFP4 96–118 tok/s。無 SWE-bench/AIME。只在要 Blackwell NVFP4 去審查、且不信「比底模強」時用。
16.7K 下載 · 135 likes
兩極評價Q4_K_M ~24GBClaude 4.6 Opus + Deckard 資料集 + Heretic 去審查 + NEO-CODE 微調,多階段。自報 Nightmedia 跑分:arc-c 0.711、arc-e 0.879(皆優於兩底模)。宣稱「首個此尺寸在 8-bit 與 4-bit 都破 700 ARC-C」。無 SWE-bench/AIME/獨立驗證。社群兩極:有人說文件分析很穩、工具呼叫沒漏;也有人罵「davidau 一向產 schizo 廢模型、變更笨」。
678,322 下載 · 196 likes
Unsloth 出品Q4_K_M ~18GBQ5_K_M ~22GBUnsloth(MTP 參考作者)的 agent 微調 35B MoE,針對 agentic 工具呼叫。宣稱「解決迴圈/工具洩漏」但尚無獨立跑分。專治困擾 heretic/蒸餾變體的長 agent 迴圈問題。適合要跑長鏈的寫程式/研究/Hermes agent。新類別,先測再當預設。
v1:2,943 下載 · Coder-MTP:500,846 下載(35B MoE 變體最高採用)
無獨立跑分Q4_K_M ~19GB三階段課程 SFT(Opus 4.7+4.6 蒸餾)。v1 尚無 MTP、無跑分。Coder-MTP 為 thinking-off、token 高效的 agent 迴圈設計(給 Codex/OpenHands/Claude Code 式 harness),但無獨立跑分,且其 27B 手足(67% SWE-bench,-10%)顯示退步風險延續到 MoE。要 35B MoE 寫程式且能忍受未驗證差距時用;否則優先 unsloth AgentWorld。
609,978 下載 · 744 likes(HF 驗證)
預設 MTP 首選UD-Q4_K_XL ~22.66GB事實上的 MTP 參考。貪婪解碼零品質損失(u/ElmBark 逐位元組 diff 驗證「byte for byte」)。加速約 1.5–2×、約 1 GB 開銷。需要含 PR #22673 的自訂 llama.cpp、或 Unsloth Studio。限制:-np>1(並行解碼)不支援、部分 build MTP 與視覺不相容。「要更快又零損失」就從這支開始。
166,343 下載 · 6 likes(HF 驗證)
僅 Blackwell~18GB + KV + MTP headNVFP4 + MTP,Blackwell only。貪婪解碼同樣逐位元組保證、「NVFP4 近 FP8」為自報。社群質疑(u/Remove_Ayys):「把 W4A16→W4A4 說成『無精度損失』有誤導;你挑的 benchmark 對這改動不敏感。」速度:5090 上約 100 tps。Ampere(30xx)/Ada(40xx)載不了。
58.6K 下載 · 225 likes
drafter 僅 0.88GB結構化/JSON 最佳獨立的 4 層 block-diffusion 草稿模型(不是聊天模型,是加速疊層)。理論 2–3×、社群實測 145–450 t/s(RTX 6000)。u/1uyay0w:「DFlash 一次連草 15 個 token,在 JSON 這種重複/結構化的東西飛快(152 tok/s、3.4×);創意文字多半猜錯、可能低於基準(42 vs 44)。」關鍵差異:MTP 在模型內只並行猜 3 個,猜錯幾乎零成本、永不低於基準。DFlash 一旦 offload 就失效,必須全進 VRAM。
358,952 下載 · 527 likes(HF 驗證)
Q4_K_M ~18GBIQ4_XS ~14GBQ6_K_P ~27GBabliterated 27B,拒答 0/465、「最佳無損去審查」。卡片無 SWE-bench/AIME delta。85hr 測試「表現尚可,但工具/來源疑慮使可靠度打折」,另有盜用指控(未證實)。社群多偏好 Huihui 或 llmfan46 heretic(兩者有數據)。設定:thinking 1.0、coding 0.6、non-thinking 0.7。
62,155+ 下載 · 157 likes(HF 驗證)
KL 最低 = 保能力最佳Q4_K_M ~16GBNVFP4-MTP ~18GB(Blackwell)abliteration + decensor(MPOA),拒答少 94%、保留原生 MTP。KL 0.0021(DavidAU Heretic 0.0469 的 1/22);MMLU 掉 0.98%。無 SWE-bench/AIME,僅推得保留。要「去審查 + 最高保真 + MTP 速度」就這支。
87.7K 下載(MTP-GGUF)· 80 likes
85hr 對決:保能力最佳Q4_K_M ~16GBQ6_K ~21GB純 abliteration(MPOA),乾淨最小權重編輯、MTP-GGUF 形式。85 GPU-hour 對決與 llmfan46 heretic 並列第一、「整體保能力最佳、跑分掉幅最小」、能力保留在底模 1% 內。卡片無 SWE/AIME/KL,推自社群測試。
131,380 下載 · 402 likes(HF 驗證)
去審查寫程式社群預設Q4_K_M ~15.7GB(含上下文 ~19GB)兩階段:(1) heretic 去審查(拒答 4/100,底模 99/100)、(2) Unsloth 寫程式微調。KL(Heretic)0.0469。逐量化品質表:Q4_K_M = 94.51% 同 Top P、Q6_K 97.41%、Q8_0 98.47%、IQ2_M 82.82%。Nightmedia 自報:arc-c +4.0%、arc-e +5.4%、boolq -0.5%。只有 arc-c/arc-e 確認提升,boolq 微降——「全面超越底模」屬行銷語。有 KL + 量化表可依 VRAM 選、4/100 等於實質去審查、加上寫程式微調,成社群預設。設定:thinking 1.0、coding 0.6、instruct 0.7。
4,552 下載 · 69 likes
Q4_K_M ~15.7GB同樣寫程式微調、不含 heretic 去審查,純能力加法。arc-c/arc-e 提升同上,無保能力疑慮(是加法非安全修改)。要寫程式增益、但用不到去審查時選它。
7,386 下載 · 48 likes(HF 驗證)
無 delta 驗證Q4_K_M 16.5GB約 14K 條 Claude 4.6 Opus 軌跡 SFT(Jackrong 方法),結構化 <think>。卡片列的是底模跑分(77.2 SWE、94.1 AIME),不是蒸餾版;無 delta。train loss 0.305。GGUF:Q4_K_M 16.5GB、Q8_0 28.6GB。Opus 4.6 推理跑在社群偏好的 27B dense 上,但獨立品質差距未公開。
22.4K 下載 · 28 likes
無跑分NVFP4 ~16GB(Blackwell)多教師蒸餾(Claude Opus + Sonnet)、NVFP4 + MTP、vLLM 優化。因訓練在「壓平的軌跡」上,較不受深思迴圈影響。無跑分。Blackwell 全包(推理+速度+量化)。
90,956 下載 · 378 likes(HF 驗證)
MTP 速度有驗證MTPQ4_K_M ~16.8GBv2 更新,推理調校 + MTP、「Trace Inversion & Negentropy」訓練,主打 agentic 寫程式/DevOps/結構化邏輯/數學。30 題實測:10.46 T/s vs 6.29(底模)= 1.66×;總時間 14,902s→6,488s(省 56.5%);完成 token -27.7%(更精簡)。分領域加速:邏輯 2.31×、寫程式 2.25×、DevOps 2.31×、數學 2.35×。要「推理 + MTP 在 27B」就這支。
125,312 下載 · 330 likes(HF 驗證)
SWE-bench 比底模退 10%Q5_K_M ~20GB基於 v2 的 agentic 寫程式模型 + MTP。SWE-bench Verified 67.0%(335/500)——比底模 27B 低 10.2%。分 repo:scikit-learn 84%、xarray 82%、django 72%… 速度 5090 上約 100 t/s。別為原始 SWE-bench 選它;只在你有「推理軌跡能改善結構化輸出」的特定 agentic 寫程式流程、且接受 10% 退步時用。
2,860,615 下載 · 1,131 likes(HF 驗證)— 全系列下載王
27B 預設 MTPQ4_K_M 17.11GB(含上下文 ~20GB)事實上的 MTP 參考。貪婪解碼零品質損失(u/ElmBark 逐位元組驗證)。加速約 1.5–2×、約 1 GB 開銷。需含 PR #22673 的自訂 llama.cpp。27B 最快推理的預設選擇。
88,404 下載 · 48 likes(HF 驗證,作者日常主力)
Blackwell 塞得進 24GB 的最大 dense16.19GB + KV + MTP headNVFP4 + MTP,Blackwell only。逐位元組保證、「近 FP8」自報,社群質疑同 35B 版。u/notheresnolight:「27B MTP Q6_K 帶 200K 上下文,在我的 5090 上比 Sonnet 5 還快,約 100–120 t/s。」NVIDIA 卡驗證(BF16 vs NVFP4):MMLU Pro 86.1→86.3、AIME 2025 93.1→92.7、GPQA 86.0→85.5——雙向小幅、對這些 benchmark「無損」成立,但NVIDIA 卡未報 SWE-bench。
同 35B 段的 drafter,通用
結構化輸出/寫程式同一草稿模型可用,注意事項與 35B 相同(全進 VRAM 才划算、創意文字可能低於基準)。
85 GPU-hour 社群對決是唯一的獨立 abliteration 比較。NVFP4 是 NVIDIA 原生 4-bit float,在 Blackwell(RTX 5090、B 系)約以 FP8 一半體積換近 FP8 品質;搭 MTP 可讓 35B MoE 或 27B dense 在單張 24GB 卡上跑很快。
🔴 選之前先讀:發布者常說「近無損」。現實是——NVFP4 是量化,拿品質換體積,取捨真實存在、且因 benchmark 而異。
| Benchmark | BF16 底模 | NVFP4 | 恢復率 |
|---|---|---|---|
| GSM8k Platinum (0-shot) | 95.73 | 96.08 | 100.37% |
| IfEval (0-shot) | 93.09 | 92.45 | 99.31% |
| AIME 2025 | 92.92 | 91.25 | 98.21% |
| GPQA Diamond | 84.51 | 84.68 | 100.20% |
| Math 500 | 84.80 | 85.00 | 100.24% |
| LCB Codegen V6 | 77.33 | 74.67 | 96.55% |
| MMLU Pro Chat | 85.32 | 84.70 | 99.28% |
| SWE-bench Verified | 54.8 | 50.2 | 91.61% |
| BFCLv4 Overall | 57.83 | 56.10 | 97.01% |
| BFCLv4 Multi-Turn | 62.25 | 58.13 | 93.38% |
| BFCLv4 Agentic | 49.91 | 49.31 | 98.80% |
關鍵:NVFP4 在 SWE-bench Verified 掉 8.4%、LCB Codegen 掉 4.6%——正是兩個最重要的 agentic 寫程式 benchmark。數學與指令遵循則穩(AIME 98.2%、MMLU 99.3%)。