
這次英偉達也下場了放出了nvidia/Qwen3.6-27B-NVFP4乍一看很香官方 ModelOpt 量化Apache 2.0vLLM 直接 serve模型卡寫著磁盤和 GPU 顯存需求大約降低2.5x但我翻完模型卡和社區(qū) discussion 后感覺有必要詳細介紹一下先說結(jié)論顯存收益是真實的官方說把 transformer block 里的 linear operators 權(quán)重和激活量化到 NVFP4參數(shù)位寬從 16 bit 降到 4 bit磁盤和 GPU 顯存需求大約降 2.5x精度基本穩(wěn)住了官方評測里 NVFP4 和 FP8 很接近MMLU Pro 甚至 86.3 vs 86.1小贏 0.2性能有分歧有測試 NVFP4 在 RTX PRO 6000 Blackwell 上 decode 可以跑到 200 t/s 左右FP8 約 112 t/s但也有更完整對測里FP8 在 decode-bound 場景反而快 8-12%坑也很具體B200 / DGX Spark / RTX PRO 6000 Blackwell 上都有人遇到 Marlin 警告、modelopt_mixed、以及重復!/dtoken 的問題生產(chǎn)建議很樸素顯存緊張、長上下文、想跑 27B 的同學可以試 NVFP4追求穩(wěn)定吞吐的同學務必拿 FP8 在同一套 vLLM / FlashInfer / MTP 配置下 A/B這個模型到底是什么項目信息基座Alibaba Qwen3.6-27B參數(shù)量27B架構(gòu)Hybrid AttentionGated DeltaNet Gated Attention上下文262KQwen 原版還寫了可擴展到 1,010,000 tokens量化工具nvidia-modelopt v0.45.0量化目標transformer blocks 內(nèi) linear operators 的權(quán)重與激活推理引擎vLLM官方測試硬件NVIDIA GB300硬件兼容Hopper / BlackwellLicenseApache 2.0Qwen3.6-27B 自身的亮點也很明確主打 Agentic Coding、倉庫級推理、Thinking Preservation以及更長的上下文對本地部署玩家來說最關(guān)鍵的其實就兩個詞27B 262K27B 代表它還在個人工作站和單卡專業(yè)卡的想象范圍里262K 代表它適合 Agent、RAG、長文檔、代碼倉庫這類吃上下文的任務英偉達這次做 NVFP4理論上的吸引力很直接把 27B 再壓一壓讓它更容易塞進顯存同時盡量保住 Qwen3.6 的能力官方精度表沒明顯變傻官方模型卡給了 NVFP4 和 FP8 的 accuracy benchmark我把關(guān)鍵數(shù)字搬出來BenchmarkFP8NVFP4差值MMLU Pro86.186.30.2GPQA Diamond86.085.5-0.5HLE21.721.80.1τ2-Bench Telecom95.295.40.2MMMU Pro74.674.3-0.3SciCode44.844.5-0.3AIME 202593.192.7-0.4AA-LCR68.868.3-0.5IFBench65.165.50.4一句話精度層面基本可以放心差值大多在 0.5 以內(nèi)考慮到 benchmark 本身的波動這個結(jié)果挺漂亮社區(qū)的質(zhì)量測試也支持這個判斷7 個 prompt 的質(zhì)量檢查包括詩歌、投訴郵件、HTML todo、HTML Snake、邏輯題轉(zhuǎn) JSON、merge_intervals、59KB 文檔轉(zhuǎn) JSON結(jié)果很接近邏輯題兩邊都是5/5 correctmerge_intervals兩邊都過6/6 edge cases都能處理 ValueError也都沒有 mutation59KB 文檔轉(zhuǎn) JSON 兩邊都能產(chǎn)出 valid JSON嚴重程度都判成highHTML todo 和 Snake 都是 valid single-file關(guān)鍵 API 存在Thinking mode 下NVFP4 在一個 trivial Python 任務里 16K token budget 都沒把函數(shù)收完FP8 能正確完成所以我的判斷是正常非思考模式下NVFP4 沒有明顯質(zhì)量塌陷但做確定性代碼任務時Thinking mode 要謹慎官方部署方式NVIDIA 模型卡給的 vLLM 命令很簡短vllm serve nvidia/Qwen3.6-27B-NVFP4 \ --port 8000 \ --quantization modelopt \ --max-model-len 262144 \ --reasoning-parser qwen3如果你要上工具調(diào)用、MTP、前綴緩存、chunked prefill有 DGX Spark 用戶貼過一組更詳細的命令vllm serve ~/models/hf/Qwen3.6-27B-NVFP4 \ --trust-remote-code \ --served-model-name qwen36-27b \ --gpu-memory-utilization 0.45 \ --dtype bfloat16 \ --max-num-seqs 4 \ --max-model-len 131072 \ --reasoning-parser qwen3 \ --enable-auto-tool-choice \ --tool-call-parser qwen3_coder \ --speculative-config {method:mtp,num_speculative_tokens:3} \ --max-num-batched-tokens 16384 \ --enable-chunked-prefill \ --async-scheduling \ --enable-prefix-caching \ --quantization modelopt社區(qū)實測一NVFP4 看起來真能打測試條件RTX PRO 6000 Blackwell 96GB開啟MTP speculative decoding先看 NVFP4Qwen3.6-27B-NVFP4 在 RTX PRO 6000 Blackwell 上的社區(qū)實測再看 FP8Qwen3.6-27B-FP8 在 RTX PRO 6000 Blackwell 上的社區(qū)實測把圖里的關(guān)鍵數(shù)字拎出來場景NVFP4 decode t/sFP8 decode t/s觀察pp256 / tg32 / d0204112NVFP4 明顯高pp256 / tg256 / d0201111NVFP4 明顯高pp4096 / tg32 / d0117112接近pp4096 / tg256 / d0159112NVFP4 高pp16384 / tg32 / d0205119NVFP4 高pp16384 / tg256 / d0200111NVFP4 高pp256 / tg32 / d4k161113NVFP4 高pp4096 / tg32 / d4k203117NVFP4 高pp16384 / tg32 / d4k204112NVFP4 高pp256 / tg32 / d8k205113NVFP4 高pp4096 / tg32 / d8k204117NVFP4 高pp16384 / tg32 / d8k204113NVFP4 高NVFP4 decode 都在200 t/s左右FP8 大多在111-119 t/s區(qū)間但別只看 decodeprefill 上 FP8 反而更強比如 pp4096 / tg32 / d0FP8 是9,785 t/sNVFP4 是6,782 t/sTTFT 也有類似現(xiàn)象pp16384 / tg32 / d0FP8 是1,605 msNVFP4 是2,595 ms某些 decode 場景里NVFP4 的確能跑出很漂亮的數(shù)字但長 prompt 和 prefill 場景下FP8 依然有反殺空間社區(qū)實測二另一組完整對測里FP8 反而更快有網(wǎng)友把 NVFP4 和 FP8 放到兩張 RTX PRO 6000 Blackwell 96GB 上并行跑配置大概是項目NVFP4FP8模型nvidia/Qwen3.6-27B-NVFP4Qwen/Qwen3.6-27B-FP8GPU1× RTX PRO 6000 Blackwell 96GB1× RTX PRO 6000 Blackwell 96GBvLLM0.24.00.23.1rc1.devSpec decodingMTP, 3 tokensMTP, 3 tokensKV cachefp8_e4m3fp8_e4m3max len262K262Kgpu util0.920.92max seqs128128它的吞吐結(jié)論和 前面實測的截圖相反場景NVFP4FP8結(jié)論single small decode77.1 tok/s84.7 tok/sFP8 10%warm TTFT0.09 s0.09 s持平big prompt decode98.7 tok/s111.0 tok/sFP8 12%big prompt prefill~5,700 tok/s / 3.9 s~7,000 tok/s / 3.2 sFP8 更強16 并發(fā) aggregate891.7 tok/s963.3 tok/sFP8 8%16 并發(fā) per-request67.4 tok/s68.5 tok/s接近4 并發(fā) big aggregate358.9 tok/s342.5 tok/sNVFP4 5%4 并發(fā) big per-request100.4 tok/s103.7 tok/s接近這里我覺得最關(guān)鍵的是這句話FP8 在 decode-bound 場景里穩(wěn)定快 8-12%NVFP4 只在大 prompt 并發(fā)這種 prefill-bound 場景里小幅領先再看 per-prompt latency也挺扎心PromptNVFP4FP8捷克語 2000 詞故事49.3 s / 74.4 tok/s36.8 s / 87.3 tok/sHTML todo16.3 s / 104 tok/s15.9 s / 116 tok/sHTML Snake17.6 s / 124 tok/s15.8 s / 141 tok/s邏輯題轉(zhuǎn) JSON2.75 s / 104 tok/s2.6 s / 129 tok/sPythonmerge_intervals1.78 s / 122 tok/s1.87 s / 129 tok/s捷克語投訴郵件11.0 s / 60.5 tok/s6.0 s / 110 tok/s59KB 轉(zhuǎn) JSON20.0 s / 103 tok/s25.2 s / 103 tok/s這組測試有點局限了兩邊 vLLM build 不同attention / MoE backend 也有差異但它依然給了一個很重要的提醒NVFP4 的速度優(yōu)勢沒有形成統(tǒng)一規(guī)律尤其別把顯存下降自動等價成吞吐上漲重復 token這坑有點嚇人這個 bug 典型現(xiàn)象是模型能正常加載但極簡 prompt 也會輸出一串d d d d d或者滿屏!Qwen3.6-27B-NVFP4 社區(qū)反饋的重復感嘆號問題有用戶反饋 vLLM release0.24.0正常nightly 有問題從vllm/vllm-openai:nightly換到vllm/vllm-openai:v0.24.0-cu129-ubuntu2404后緩解但也有人說vllm0.24.0和 nightly 都遇到過更細的反饋是0.24.0里 flashinfer0.6.12會讓 AutoTuner 出現(xiàn)三百多次[AutoTuner]: Tuning fp8_gemm: 100%nightly 升到0.6.13后 AutoTuner 異常緩解但 CoT 中輸出!!!的問題還在最后對于正在迷茫擇業(yè)、想轉(zhuǎn)行提升或是剛?cè)腴T的程序員、編程小白來說有一個問題幾乎人人都在問未來10年什么領域的職業(yè)發(fā)展?jié)摿ψ畲蟠鸢钢挥幸粋€人工智能尤其是大模型方向當下人工智能行業(yè)正處于爆發(fā)式增長期其中大模型相關(guān)崗位更是供不應求薪資待遇直接拉滿——字節(jié)跳動作為AI領域的頭部玩家給碩士畢業(yè)的優(yōu)質(zhì)AI人才含大模型相關(guān)方向開出的月基礎工資高達5萬—6萬元即便是非“人才計劃”的普通應聘者月基礎工資也能穩(wěn)定在4萬元左右。再看阿里、騰訊兩大互聯(lián)網(wǎng)大廠非“人才計劃”的AI相關(guān)崗位應聘者月基礎工資也約有3萬元遠超其他行業(yè)同資歷崗位的薪資水平對于程序員、小白來說無疑是絕佳的轉(zhuǎn)型和提升賽道。如果你還不知道從何開始我自己整理一套全網(wǎng)最全最細的大模型零基礎教程我也是一路自學走過來的很清楚小白前期學習的痛楚你要是沒有方向還沒有好的資源根本學不到東西下面是我整理的大模型學習資源希望能幫到你。掃碼免費領取全部內(nèi)容最后1、大模型學習路線2、從0到進階大模型學習視頻教程從入門到進階這里都有跟著老師學習事半功倍。3、 入門必看大模型學習書籍文檔.pdf書面上的技術(shù)書籍確實太多了這些是我精選出來的還有很多不在圖里4、AI大模型最新行業(yè)報告2026最新行業(yè)報告針對不同行業(yè)的現(xiàn)狀、趨勢、問題、機會等進行系統(tǒng)地調(diào)研和評估以了解哪些行業(yè)更適合引入大模型的技術(shù)和應用以及在哪些方面可以發(fā)揮大模型的優(yōu)勢。5、面試試題/經(jīng)驗【大廠 AI 崗位面經(jīng)分享107 道】【AI 大模型面試真題102 道】【LLMs 面試真題97 道】6、大模型項目實戰(zhàn)配套源碼適用人群四階段學習規(guī)劃共90天可落地執(zhí)行第一階段10天初階應用該階段讓大家對大模型 AI有一個最前沿的認識對大模型 AI 的理解超過 95% 的人可以在相關(guān)討論時發(fā)表高級、不跟風、又接地氣的見解別人只會和 AI 聊天而你能調(diào)教 AI并能用代碼將大模型和業(yè)務銜接。大模型 AI 能干什么大模型是怎樣獲得「智能」的用好 AI 的核心心法大模型應用業(yè)務架構(gòu)大模型應用技術(shù)架構(gòu)代碼示例向 GPT-3.5 灌入新知識提示工程的意義和核心思想Prompt 典型構(gòu)成指令調(diào)優(yōu)方法論思維鏈和思維樹Prompt 攻擊和防范…第二階段30天高階應用該階段我們正式進入大模型 AI 進階實戰(zhàn)學習學會構(gòu)造私有知識庫擴展 AI 的能力。快速開發(fā)一個完整的基于 agent 對話機器人。掌握功能最強的大模型開發(fā)框架抓住最新的技術(shù)進展適合 Python 和 JavaScript 程序員。為什么要做 RAG搭建一個簡單的 ChatPDF檢索的基礎概念什么是向量表示Embeddings向量數(shù)據(jù)庫與向量檢索基于向量檢索的 RAG搭建 RAG 系統(tǒng)的擴展知識混合檢索與 RAG-Fusion 簡介向量模型本地部署…第三階段30天模型訓練恭喜你如果學到這里你基本可以找到一份大模型 AI相關(guān)的工作自己也能訓練 GPT 了通過微調(diào)訓練自己的垂直大模型能獨立訓練開源多模態(tài)大模型掌握更多技術(shù)方案。到此為止大概2個月的時間。你已經(jīng)成為了一名“AI小子”。那么你還想往下探索嗎為什么要做 RAG什么是模型什么是模型訓練求解器 損失函數(shù)簡介小實驗2手寫一個簡單的神經(jīng)網(wǎng)絡并訓練它什么是訓練/預訓練/微調(diào)/輕量化微調(diào)Transformer結(jié)構(gòu)簡介輕量化微調(diào)實驗數(shù)據(jù)集的構(gòu)建…第四階段20天商業(yè)閉環(huán)對全球大模型從性能、吞吐量、成本等方面有一定的認知可以在云端和本地等多種環(huán)境下部署大模型找到適合自己的項目/創(chuàng)業(yè)方向做一名被 AI 武裝的產(chǎn)品經(jīng)理。硬件選型帶你了解全球大模型使用國產(chǎn)大模型服務搭建 OpenAI 代理熱身基于阿里云 PAI 部署 Stable Diffusion在本地計算機運行大模型大模型的私有化部署基于 vLLM 部署大模型案例如何優(yōu)雅地在阿里云私有部署開源大模型部署一套開源 LLM 項目內(nèi)容安全互聯(lián)網(wǎng)信息服務算法備案…掃碼免費領取全部內(nèi)容3、這些資料真的有用嗎這份資料由我和魯為民博士(北京清華大學學士和美國加州理工學院博士)共同整理現(xiàn)任上海殷泊信息科技CEO其創(chuàng)立的MoPaaS云平臺獲Forrester全球’強勁表現(xiàn)者’認證服務航天科工、國家電網(wǎng)等1000企業(yè)以第一作者在IEEE Transactions發(fā)表論文50篇獲NASA JPL火星探測系統(tǒng)強化學習專利等35項中美專利。本套AI大模型課程由清華大學-加州理工雙料博士、吳文俊人工智能獎得主魯為民教授領銜研發(fā)。資料內(nèi)容涵蓋了從入門到進階的各類視頻教程和實戰(zhàn)項目無論你是小白還是有些技術(shù)基礎的技術(shù)人員這份資料都絕對能幫助你提升薪資待遇轉(zhuǎn)行大模型崗位。這份完整版的大模型 AI 學習資料已經(jīng)上傳CSDN朋友們?nèi)绻枰梢晕⑿艗呙柘路紺SDN官方認證二維碼免費領取【保證100%免費】