怎么工作?從稀疏激活到部署的完整路徑)
Qwen MoE 架構(gòu)怎么工作從稀疏激活到部署的完整路徑【免費(fèi)下載鏈接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5當(dāng)你要跑一個(gè) 235B 的大模型卻發(fā)現(xiàn)它塞不進(jìn)顯卡而小模型又壓不住復(fù)雜推理時(shí)Qwen 的混合專家Mixture of Experts, MoE架構(gòu)給出了折中模型存下大參數(shù)但每個(gè) token 只激活其中一小部分。本文把 MoE 的路由原理和參數(shù)命名講清楚帶你跑通 Qwen3 的本地推理與服務(wù)部署不涉及訓(xùn)練與偏好對(duì)齊。它到底解決了什么想象兩個(gè)場(chǎng)景。一是你只有一臺(tái)單卡機(jī)器想部署大模型二是線上服務(wù)要扛住高并發(fā)但顯存和算力都緊張。密集Dense模型的問(wèn)題在于參數(shù)量多大每個(gè) token 就要算多大模型越大越貴。MoE 的思路是把「存儲(chǔ)知識(shí)」和「計(jì)算量」解耦。以 Qwen3 為例它提供兩個(gè) MoE 型號(hào)30B-A3B和235B-A22B。前者總共 30B 參數(shù)但每個(gè) token 只激活 3B后者總共 235B每個(gè) token 激活 22B。維度密集模型30B 級(jí)MoE30B-A3B每 token 激活參數(shù)30B全部3B知識(shí)存儲(chǔ)總量30B30B單位推理計(jì)算量基準(zhǔn)約 1/10同樣的知識(shí)容量下MoE 把每個(gè) token 的計(jì)算量壓到密集模型的約十分之一而單卡 96GBH20就能在 BF16 下跑30B-A3B這點(diǎn)來(lái)自項(xiàng)目自帶的速度基準(zhǔn)。拆解 Qwen MoE 架構(gòu)的五步路由原理MoE 的核心不在「專家」本身而在「誰(shuí)來(lái)選專家」。下面按一個(gè) token 的前向過(guò)程分五步走。第一步特征提取。輸入文本先經(jīng) BPE 分詞切成 token 序列再過(guò)詞嵌入層和 Transformer 編碼器得到該位置的隱藏狀態(tài)向量。Qwen 的詞匯表約 151,646 個(gè) token。第二步門控打分。一個(gè)輕量門控網(wǎng)絡(luò)Gating Network讀取隱藏狀態(tài)對(duì)每個(gè)專家輸出一個(gè)選擇分?jǐn)?shù)判斷「這個(gè)問(wèn)題該交給誰(shuí)」。第三步Top-K 選擇。只挑分?jǐn)?shù)最高的 K 個(gè)專家常見(jiàn) K2其余專家本次不激活——這正是計(jì)算量被省下來(lái)的關(guān)鍵。第四步專家前向。被選中的專家各自做前向計(jì)算專家內(nèi)部結(jié)構(gòu)與普通 FFN 子網(wǎng)類似但各專家參數(shù)相互獨(dú)立。第五步加權(quán)合并。把選中專家的輸出按第二步的分?jǐn)?shù)加權(quán)求和再經(jīng)殘差連接送回主干得到該位置的最終表示。這里要強(qiáng)調(diào)命名規(guī)則它直接暴露了激活量A前的數(shù)字是總存儲(chǔ)參數(shù)A后是每個(gè) token 激活的參數(shù)所以235B-A22B意味著存了 235B 知識(shí)、每 token 只算 22B。從零上手先用最輕量的方式跑通本地推理。下面這條命令啟動(dòng)一個(gè) OpenAI 兼容服務(wù)并加載Qwen3-8B密集版適合單卡驗(yàn)證流程vllm serve Qwen/Qwen3-8B --port 8000 --enable-reasoning --reasoning-parser qwen3它做的事是加載模型、在 8000 端口起一個(gè) OpenAI 兼容 API并開(kāi)啟思考模式解析。啟動(dòng)成功后訪問(wèn)http://localhost:8000/v1即可用 OpenAI SDK 發(fā)請(qǐng)求思考內(nèi)容會(huì)從reasoning_content字段返回。如果要跑 MoE 型號(hào)把模型名換成Qwen/Qwen3-30B-A3B-Instruct-2507即可。支持的主要框架及最低版本如下框架用途最低版本Transformers本地推理/微調(diào)4.51.0vLLM高吞吐部署0.9.0SGLang高吞吐部署0.4.6.post1llama.cpp端側(cè)推理b5401Ollama本地運(yùn)行v0.9.0mlx-lmApple Silicon0.24.0關(guān)鍵細(xì)節(jié)與注意事項(xiàng)?? 思考模式下別用貪心解碼?,F(xiàn)象temperature0或貪心采樣時(shí)思考模型輸出質(zhì)量下降甚至無(wú)限重復(fù)。原因貪心采樣不適合思考類模型。解決思考模式用temperature0.6、top_p0.95、top_k20非思考模式用temperature0.7、top_p0.8見(jiàn) 快速上手。?? 上下文設(shè)太大直接 OOM?,F(xiàn)象vLLM/SGLang 啟動(dòng)時(shí)報(bào)顯存不足。原因--max-model-len超過(guò)了顯存承載。解決按顯存下調(diào)235B-A22B的 BF16 需 8 卡、FP8 需 4 卡見(jiàn) 速度基準(zhǔn)。MoE 量化在內(nèi)核上不一定支持?,F(xiàn)象Transformers 下30B-A3B的 GPTQ-INT4 無(wú)法運(yùn)行標(biāo)注 MoE Kernel Unsupported。原因MoE 量化內(nèi)核缺失。解決改用 vLLM/SGLang或直接用 BF16/FP8。Ollama 默認(rèn)上下文太小?,F(xiàn)象對(duì)話生成異常、被截?cái)?。原因默認(rèn)num_ctx僅 2048 且允許無(wú)限生成。解決手動(dòng)設(shè)置num_ctx與num_predict見(jiàn) README。下一步MoE 讓「存得大、算得小」成為可能這也是 Qwen 能把大模型塞進(jìn)單卡的關(guān)鍵。 熟悉這套路由邏輯后你可以順著官方文檔繼續(xù)深挖快速上手指南 覆蓋從本地推理到 OpenAI 兼容 API 的完整調(diào)用速度基準(zhǔn) 給出各型號(hào)在不同量化下的吞吐與顯存vLLM 部署 則講解高并發(fā)場(chǎng)景下的服務(wù)化配置?!久赓M(fèi)下載鏈接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考