練紀(jì)錄:改結(jié)構(gòu)正在比堆算力更值錢)
據(jù)中新網(wǎng)等媒體報(bào)道中國(guó) AI 企業(yè)彩云科技的基礎(chǔ)模型算法團(tuán)隊(duì)在全球開源 AI 競(jìng)速項(xiàng)目 NanoGPT Speedrun 中兩次刷新世界紀(jì)錄把 1.24 億參數(shù) GPT-2 的達(dá)標(biāo)訓(xùn)練時(shí)間壓縮到了約 1 分 16 秒。相關(guān)代碼已并入官方開源倉(cāng)庫。這不是又一個(gè)大廠刷榜的新聞而是一個(gè)小團(tuán)隊(duì)在改模型結(jié)構(gòu)這條路上被公開驗(yàn)證了一次。NanoGPT Speedrun 到底比什么先說清楚這個(gè)項(xiàng)目為什么值得看。NanoGPT Speedrun 是一個(gè)面向全球開發(fā)者開放的開源競(jìng)速項(xiàng)目規(guī)則很純粹固定 8 張 H100、固定數(shù)據(jù)集、固定目標(biāo) loss。換句話說賽道一樣、燃料一樣唯一能拉開差距的就是訓(xùn)練技術(shù)本身——優(yōu)化器、并行策略、網(wǎng)絡(luò)結(jié)構(gòu)、數(shù)值精度。據(jù)公開信息彩云團(tuán)隊(duì)的兩項(xiàng)成績(jī)對(duì)應(yīng)官方紀(jì)錄榜的第 81 和第 85 位把達(dá)標(biāo)訓(xùn)練時(shí)間從約 84 秒壓到 76.3 秒。當(dāng)榜單已經(jīng)被擠到接近于硬件理論極限時(shí)再想省下幾秒靠調(diào)參已經(jīng)不夠了必須動(dòng)模型的底層結(jié)構(gòu)。兩項(xiàng)架構(gòu)創(chuàng)新是什么兩項(xiàng)工作分別是 DCMHA 和 MUDD據(jù)公開報(bào)道均已發(fā)表于 ICML代碼已被官方倉(cāng)庫合并全球開發(fā)者可以自由復(fù)現(xiàn)和迭代。DCMHA可動(dòng)態(tài)組合多頭注意力注意力機(jī)制里不同的注意力頭負(fù)責(zé)關(guān)注不同的信息。傳統(tǒng)做法是每個(gè)頭固定分工而 DCMHA 讓頭的組合方式隨輸入動(dòng)態(tài)變化相當(dāng)于讓模型自己決定這一句該重點(diǎn)看哪里。MUDD多路動(dòng)態(tài)稠密連接殘差連接residual是 Transformer 里信息跨層流動(dòng)的通道。MUDD 的思路是提供多條可動(dòng)態(tài)選擇的稠密通路讓信息按需要流轉(zhuǎn)而不是只走一條固定的加法支路。據(jù)團(tuán)隊(duì)論文口徑MUDD 只增加了約 0.23% 的參數(shù)和約 0.4% 的算力就能達(dá)到普通 Transformer 用 1.8–2.4 倍訓(xùn)練算力時(shí)的效果。這個(gè)交換比才是重點(diǎn)不是用更多資源換更好效果而是用更聰明的結(jié)構(gòu)換同等效果。變的是什么沒變的是什么變的是競(jìng)爭(zhēng)的主軸。近半年里不只是彩云多個(gè)團(tuán)隊(duì)都往同一個(gè)方向使勁Kimi 的 AttnRes、字節(jié) Seed 的 Hyper-Connections、DeepSeek 的 Engram以及催生 Kimi K2 的 Muon 優(yōu)化器指向的都是改造 Transformer 內(nèi)部的信息流轉(zhuǎn)機(jī)制而不是繼續(xù)單純地堆算力、擴(kuò)參數(shù)。當(dāng)誰卡多的邊際收益開始下降誰讓每次計(jì)算更值錢就變成了新的比較維度。沒變的是競(jìng)賽紀(jì)錄不等于商用能力。NanoGPT Speedrun 是固定硬件、固定數(shù)據(jù)的極限測(cè)試3% 左右的提速不能直接外推到千億級(jí)參數(shù)的真實(shí)訓(xùn)練里。從進(jìn)了公共代碼庫到跑通工業(yè)級(jí)訓(xùn)練中間還有大量工程適配要做。把榜單成績(jī)直接當(dāng)成商用模型的能力躍遷是很容易踩的認(rèn)知坑。對(duì)做模型/訓(xùn)練的開發(fā)者意味著什么如果你在做模型訓(xùn)練、微調(diào)或者只是關(guān)注底層技術(shù)這件事有幾個(gè)實(shí)際啟示。第一動(dòng)態(tài)連接類機(jī)制可以抄作業(yè)了。代碼已經(jīng)開源并進(jìn)官方倉(cāng)庫這給了中小團(tuán)隊(duì)一個(gè)低成本的實(shí)驗(yàn)起點(diǎn)。想驗(yàn)證方向先把競(jìng)速倉(cāng)庫拉下來跑通gitclone https://github.com/KellerJordan/modded-nanogptcdmodded-nanogpt這個(gè)倉(cāng)庫就是 NanoGPT Speedrun 的官方代碼庫紀(jì)錄榜和提交記錄都在里面可以對(duì)照著看別人是怎么把時(shí)間一秒一秒摳下來的。第二算力預(yù)算有限的團(tuán)隊(duì)架構(gòu)收益是實(shí)打?qū)嵉摹?duì)高校課題組、中小 AI 公司和獨(dú)立研究者來說架構(gòu)層面?zhèn)€位數(shù)的效率提升可能就決定了一個(gè)實(shí)驗(yàn)做不做得起。同一塊 H100結(jié)構(gòu)改對(duì)了能跑更多輪實(shí)驗(yàn)。第三盯緊單位 token 訓(xùn)練成本這條曲線。如果動(dòng)態(tài)殘差、動(dòng)態(tài)注意力這類機(jī)制被越來越多的模型默認(rèn)采用訓(xùn)練成本曲線會(huì)進(jìn)一步下探。這比追單個(gè)版本號(hào)更值得長(zhǎng)期關(guān)注。幾個(gè)要留意的點(diǎn)別把論文紅利當(dāng)工業(yè)級(jí)成果。競(jìng)速項(xiàng)目里的收益到了真實(shí)的大規(guī)模分布式訓(xùn)練可能被通信開銷、穩(wěn)定性問題吃掉一部分需要重新驗(yàn)證。別迷信小團(tuán)隊(duì)逆襲的敘事。真正值得記住的不是爽文情節(jié)而是動(dòng)態(tài)信息通路這個(gè)方向被公開驗(yàn)證、并且可被繼續(xù)迭代——這才是它留給行業(yè)最實(shí)在的東西。復(fù)現(xiàn)時(shí)注意環(huán)境一致性。這類極限成績(jī)高度依賴具體硬件、驅(qū)動(dòng)和精度設(shè)置換機(jī)器跑出來的數(shù)字和榜單不一致是正常的。結(jié)尾這場(chǎng)競(jìng)速最值得琢磨的地方是它把大模型競(jìng)爭(zhēng)的另一面擺到了臺(tái)面上在幾十萬張 GPU 的軍備競(jìng)賽之外模型結(jié)構(gòu)本身仍然有可挖的空間。對(duì)普通開發(fā)者來說把這套開源代碼拉下來跑一遍比看十條新聞都實(shí)在。你覺得下一步改結(jié)構(gòu)和堆算力哪個(gè)對(duì)行業(yè)影響更大評(píng)論區(qū)聊聊。