Qwen 27B 家族:三代迭代大事記
從 2025 年 2 月的 MoE 旗艦,到 2026 年 4 月的 Dense 反擊,再到 2026 年 8 月的混合注意力突破—— Qwen 在 27B 這個參數級別上,用不到十八個月完成了三輪架構演進。以下是這條迭代軌跡的關鍵節點。
"參數規模不再是故事的主線,架構的效率才是。Qwen 用三輪迭代證明了這一點。"
—— 本地 AI 技術專刊 編輯部
Qwen3.8-27B:混合注意力的新時代
2026 年 8 月 14 日,阿里巴巴 Qwen 團隊發布了 Qwen3.8-27B——一個在 27B 參數級別上 再次刷新認知的 Dense 視覺語言模型。它沒有走「堆參數」的老路,而是引入了一種全新的 Gated DeltaNet 混合注意力架構,在長上下文推理解碼效率與注意力精度之間取得了前所未有的平衡。
與四個月前的 Qwen3.6-27B 相比,Qwen3.8-27B 保留了 27B Dense 的核心設計與 262K 原生上下文, 但在注意力機制上做出了關鍵進化:部分層採用 Gated DeltaNet 線性注意力(計算複雜度隨序列長度 線性增長),部分層保留標準全注意力(確保精確的長程依賴捕獲)。這種混合設計讓模型在處理 長文本時顯著降低 KV cache 佔用,同時不犧牲推理質量。
更為重要的是,Qwen3.8-27B 首次將視覺語言能力整合進 27B 級別的開源模型, 支援文字、影像、影片輸入。這意味著本地部署的 AI 不僅能寫代碼,還能「看懂」 UI 截圖、技術文檔和影片內容,為 agentic 自動化場景奠定了基礎。 模型同樣以 Apache 2.0 協議發布,完全開源可商業使用。
"27B 參數,三種架構代際,每一次進化都在重新定義本地 AI 的天花板。"
—— Qwen 團隊官方部落格
基準測試:數據說的話
以下是 Qwen3.8-27B 在主要編程與 agentic 基準測試中的表現,並與 Qwen3.6-27B 及 Claude Opus 4.6 進行對比。每一項成績都展示了 3.8 相對於 3.6 的顯著進步。
Qwen 27B 家族三代對比
- 發布時間
- Qwen3.5-397B-A17B:2025 年 2 月 · Qwen3.6-27B:2026 年 4 月 · Qwen3.8-27B:2026 年 8 月
- 架構
- Qwen3.5:MoE(397B 總參數 / 17B 活躍)· Qwen3.6:Dense 27B · Qwen3.8:Dense 27B + Gated DeltaNet 混合注意力
- SWE-bench Verified
- Qwen3.5:76.2% · Qwen3.6:77.2% · Qwen3.8:官方未公布(SWE-bench Pro 61.7%)
- 多模態
- Qwen3.5:純文字 · Qwen3.6:文字 + 影像 · Qwen3.8:文字 + 影像 + 影片
- 本地部署
- Qwen3.5:需雲端 · Qwen3.6:24 GB GPU(Q5_K_P)· Qwen3.8:24 GB GPU(Q6_K,約 20 GB)
- 量化貢獻者
- Qwen3.6:HauhauCS(MTP-Q5_K_P)· Qwen3.8:JonathanColetti(Uncensored Q6_K)
JonathanColetti Q6_K:Uncensored 的藝術
在 Qwen3.8-27B 發布後,Hugging Face 上的量化貢獻者 JonathanColetti 迅速釋出了 Qwen3.8-27B-Uncensored-GGUF 系列。與 Qwen3.6 時期的 HauhauCS MTP-Q5_K_P 不同, 這次 JonathanColetti 選擇了 Q6_K 精度,並保留了 MTP 頭、去除了模型的拒答方向, 打造出一個「既快速又自由」的本地部署版本。
Q6_K 量化技術解析
- 量化方法
- K-Quantization(K 量化),llama.cpp 引入的新一代量化算法,在精度-體積比上優於傳統 Q5/Q6。
- 精度等級
- 6-bit 平均精度,相比 Q5_K 進一步減少量化損失,相比 Q8_0 仍保持顯著體積優勢。對於 27B 級別模型,Q6_K 是「品質優先」的甜點。
- 預估體積
- 約 20 GB(原始 BF16 約 54 GB),壓縮比約 63%。在 24 GB 顯存 GPU 上可完整載入並保留 KV cache 空間。
- 硬體需求
- 建議 24 GB GPU VRAM(如 RTX 4090/5090 / A6000),或使用 CPU + GPU 混合推理模式。16 GB 顯存需部分層 offload 至 CPU。
- 與 Q5_K_P 對比
- Q5_K_P(3.6 時期)約 17–18 GB,品質略低於 Q6_K;Q6_K 在生成品質與長文本一致性上更穩定,適合對輸出敏感場景。
MTP 多令牌預測:保留的速度倍增器
- MTP 是什麼
- Multi-Token Prediction(多令牌預測),Qwen3.8-27B 原生包含 1 層 MTP 頭,可同時預測多個未來令牌。
- 如何加速
- 透過 Speculative Decoding(猜測解碼)機制,MTP 頭先猜測多個後續令牌,然後由主模型驗證。若猜測正確,則跳過中間生成步驟,大幅提升吞吐量。
- 加速效果
- 在支援 MTP 的推理框架(如 SGLang、vLLM、llama.cpp 新版本)中,生成速度可提升 1.5x 至 2x。Unsloth 在 L4 24 GB 上實測 23 tok/s decode(104K 上下文)。
- 品質保證
- Speculative Decoding 保證了最終輸出的概率分佈與原始模型一致。JonathanColetti 在量化後特別驗證了 MTP 頭的完整性,確保加速不犧牲品質。
Uncensored:Heretic 消融去拒答
- 什麼是 Abliteration
- Abliteration(消融)是一項技術,通過移除模型權重中的「拒答方向」向量,降低模型對特定主題的保守傾向,讓輸出更直接。
- Heretic 方法
- JonathanColetti 採用 Heretic 消融技術,在 Qwen3.8-27B 上精準定位並削弱拒答行為。相比粗暴的 fine-tune,Abliteration 保留了模型的其他能力。
- 實際效果
- 拒答行為「顯著減少但未完全消除」。對技術文檔、代碼生成、創意寫作等場景,Uncensored 版本更適合需要「直球」輸出的使用者。
- 注意事項
- Uncensored 不意味著「無所不答」,官方建議對關鍵應用仍保留人工審查。FriendliAI 等推理服務商也提供了 Measured behaviour 報告供參考。
將 Q6_K 高精度量化、MTP 加速與 Heretic 去拒答三者結合,JonathanColetti 的這個版本 在本地部署場景中提供了「品質、速度、自由度」的三贏。對於需要實時互動的開發輔助、 內容創作或 agentic 自動化場景,這是一個值得關注的選擇。
本地部署:從下載到運行
無論你是選擇 Ollama、LM Studio、SGLang 還是 Unsloth Desktop,部署 Qwen3.8-27B 的量化版本 已變得前所未有的簡單。以下是針對不同場景的推薦配置。
推薦硬體配置
- 最低配置
- 16 GB VRAM GPU(如 RTX 4070 Ti Super)+ 16 GB 系統記憶體,可運行 Q4_K 量化版本(約 16 GB),部分層 offload 至 CPU。
- 推薦配置
- 24 GB VRAM GPU(如 RTX 4090 / 5090 / A6000)+ 32 GB 系統記憶體,可完全將 JonathanColetti Q6_K 版本(約 20 GB)載入 GPU,獲得最佳推理速度與 KV cache 空間。
- 理想配置
- 48 GB VRAM(如雙 RTX 3090/4090 / A6000 雙卡 / 單卡 A100 48GB)+ 64 GB 系統記憶體,可運行 Q8_0 或 FP8 版本,並處理 100K+ 長上下文。
- AMD 支援
- Qwen3.8-27B 在發布首日即獲得 AMD Ryzen AI 與 Radeon GPU 支援,可透過 LM Studio 或 ROCm 在 AMD 硬體上運行。
推薦推理框架
- llama.cpp / Ollama
- 最易上手的方案,支援 GGUF 格式,適合個人開發者和本地部署。Ollama 一行命令即可啟動。llama.cpp 新版本已支援 MTP Speculative Decoding。
- SGLang
- 支援 MTP Speculative Decoding 的首選框架,可最大化 Qwen3.8-27B 的生成速度。適合需要高吞吐量的 agentic 場景。
- LM Studio
- 圖形化介面,適合不熟悉命令列的用戶。支援 GGUF 格式和 GPU 加速,開箱即用。AMD 與 NVIDIA 皆有 Day 0 支援。
- vLLM
- 適合生產環境部署,支援 PagedAttention 和連續批處理,吞吐量表現優秀。Qwen3.8-27B-FP8 檢查點在 vLLM 上表現尤佳。
- Unsloth Desktop
- Unsloth 推出的本地推理工具,支援 Qwen3.8-27B 的 GGUF / NVFP4 格式,並提供 MTP 加速。L4 24 GB 實測 23 tok/s(104K 上下文)。
對於 JonathanColetti 的 Q6_K 版本,建議使用支援 MTP 的推理框架(如 SGLang、vLLM 或 llama.cpp 新版本) 以獲得最佳體驗。同時確保啟用 Thinking 模式以獲得模型最強大的推理能力,對於簡單查詢則可以關閉 以減少延遲。若追求「去拒答」的直球輸出,請下載 Qwen3.8-27B-Uncensored-GGUF 的 Q6_K 檔案。
結語:本地 AI 的新常態
Qwen3.8-27B JonathanColetti Q6_K 量化版本代表了本地 AI 部署的又一個里程碑。
它證明了你不需要雲端 API、不需要昂貴的 GPU 叢集、也不需要妥協於模型能力,就能在本地獲得旗艦級的編程輔助體驗。 61.7% 的 SWE-bench Pro、73.0% 的 Terminal-Bench 2.1、42.2% 的 DeepSWE(前代三倍), 這些數字不僅超越了 Qwen3.6-27B,甚至在多項 agentic 基準上追平或超越了 Claude Opus 4.6—— 而代價是完全的本地控制、零 API 費用,以及沒有任何數據離開你的基礎設施。
回顧這三輪迭代:2025 年 2 月的 MoE 旗艦樹立了標竿,2026 年 4 月的 Dense 反擊顛覆了認知, 2026 年 8 月的混合注意力則重新定義了效率。Qwen 在 27B 這個參數級別上, 用不到十八個月完成了三輪架構演進——這不僅是技術上的進步,更是本地 AI 生態成熟的信號。
"本地 AI 不再意味著妥協。它意味著自由,而自由正在隨著每一代模型變得更加具體。"
—— 本地 AI 社區共識
無論是獨立開發者、小型團隊,還是注重數據隱私的企業,Qwen3.8-27B 的 JonathanColetti Q6_K 量化版本都提供了一個兼具效能、速度與自由度的選擇。如果你曾經在 2026 年 4 月因為 Qwen3.6-27B 而轉向本地部署,那麼 3.8 的到來意味著你手中的硬體又變得更值錢了。