Transformer祖傳設計遭暴擊,COLM頂會三篇論文發難

克雷西 發自 凹非寺

量子位 | 公眾號 QbitAI

Transformer的許多關鍵技術論文,在一場會議上集體塌房了?!

COLM 2026上論文,多篇論文同時把矛頭對準了同一件事——

Transformer裡那些沒人再去質疑的設計,其實站不住腳論文

Transformer祖傳設計遭暴擊,COLM頂會三篇論文發難

Transformer幾乎是所有主流模型的預設架構,其設定也大多被奉為圭臬,很少有人回頭驗證論文

結果,這批論文分別從不同角度,把這些預設選擇重新算了一遍賬論文

而且不同人得到的結論出奇一致,Transformer的每一處標配設計,都在某個現有評測體系測不到的維度上,付出了實打實的代價論文

長上下文的裂縫

第一篇論文名叫《Cracks in the Foundation》,來自Ai2等機構,瞄準的是QK歸一化、GQA、滑動視窗注意力、預訓練上下文長度這幾個常年被當成「標配」的架構選擇論文

Transformer祖傳設計遭暴擊,COLM頂會三篇論文發難

展開全文

研究者從Llama 2、Llama 3、Qwen 3、Olmo 3這幾個真實模型裡,挑出各自用過的取值做排列組合,訓練了26個模型出來做對比論文

這些模型引數量都在7B到8B之間,資料、分詞器、上下文擴充套件的方案全部保持一致,只有架構不一樣論文

團隊把這批模型叫「OlmPool」,全部先預訓練140B個token,再用10B個token做長上下文的收尾訓練,前後一共燒了超過17萬個GPU小時論文

結果,26個模型在HELMET 32K這項測評上,分數最高56.4,最低29.9,差了26.5分,換算成相對差距是47%論文

資料一樣,架構大體相似,就因為四個開關撥的方向不一樣,分數能差出這麼多論文

Transformer祖傳設計遭暴擊,COLM頂會三篇論文發難

單獨撥一個開關,其實影響不大論文。預訓練時用4096還是8192的上下文長度,加不加滑動視窗注意力,平均只讓分數掉一兩分。

真正要命的是幾個選擇疊在一起,一旦SWA跟GQA放在同一個模型裡,平均要掉9分,比兩項各自的影響加起來還多得多論文

團隊測出來的最差組合,是GQA、滑動視窗注意力、逐頭QK歸一化三個一起上,掉分幅度同樣比單項加總還猛論文

後來他們發現,光數一數一個模型踩中了幾項「有害設計」,這個數字就能很準地預測出它的長上下文表現,比逐項分析架構還管用論文

QK歸一化是最反直覺的一項論文。它當初被加進模型裡,是為了讓訓練更穩定,業內基本都當它是好東西。

但論文測出來,把Olmo 3原本的QK歸一化和後置歸一化去掉,換成前置歸一化,HELMET分數反而漲了6分論文

同樣的改動放到Llama 3身上,效果卻是反的,掉了3.8分論文

同一個「標配」,換一個底子模型,結果能完全相反論文

Transformer祖傳設計遭暴擊,COLM頂會三篇論文發難

這一部分還測出了一個和不少人直覺相反的現象——「注意力匯聚」,指的是模型會把很大一部分注意力,堆在上下文最前面那幾個token上論文

這個現象一直被當成浪費算力的壞毛病,不少新方法專門拿消除它當賣點,但在OlmPool這批模型裡,注意力匯聚現象越明顯,長上下文表現反而越好論文

QK歸一化恰好會削弱這種匯聚,這可能就是它拖累長上下文能力的原因論文

被吃掉的梯度

第二篇論文名叫《Lost in Backpropagation》,來自康奈爾大學,瞄準的是幾乎所有語言模型都在用的最後一層——輸出投影層論文

Transformer祖傳設計遭暴擊,COLM頂會三篇論文發難

語言模型每處理一步,都會先算出一串數字,代表它對當下上下文的理解,這串數字叫隱藏狀態D論文

要預測下一個詞,模型得把隱藏狀態,換算成詞表裡每一個候選詞的打分,詞表有多少個詞,就要輸出多少個打分論文

這些打分叫logits,分數越高,模型認為這個詞是下一個詞的可能性就越大論文

做這個轉換的部件,就是輸出層,本質是一次矩陣運算論文

詞表的大小,通常比隱藏狀態的長度大得多,一個是幾萬,一個可能只有幾千論文

這個大小上的落差,以前只被當成一個問題看,叫「softmax瓶頸」,意思是詞表比隱藏狀態大太多,會讓模型能表達的下一詞分佈種類有限論文

這篇論文說,同一個落差還有另一層影響論文

反向傳播的時候,誤差訊號要經過輸出層,傳回去指導模型調整引數,這個環節也受到落差的影響論文

誤差訊號在傳回去之前,理論上包含的資訊量跟詞表一樣大論文

但輸出層能傳回去的資訊量,被它自己的結構限制住了,上限跟隱藏狀態的長度差不多大,比詞表小得多論文

論文在GPT-2、Pythia、Llama 3、OLMo 2、Qwen 3這幾個已經訓練好的模型上測了這一步的資訊損耗,把誤差訊號投影到輸出層權重的零空間裡再看還剩多少論文

結果在GPT-2、Pythia、Llama 3、OLMo 2、Qwen 3這幾個模型上,95%到99%的梯度範數都在這一步被削掉了論文

剩下的那點訊號,跟原始梯度的餘弦相似度只有0.1到0.2論文

Transformer祖傳設計遭暴擊,COLM頂會三篇論文發難

傳回去的訊號,九成以上在這一步被吃掉了,剩下的那一點,方向也跟原來該有的方向對不上論文

這道輸出層,是幾乎所有語言模型都繞不開的必經之路,沒人把它當成需要審視的物件,可它卻在每一次反向傳播裡,悄悄抹掉了大部分本該傳回去的訓練訊號論文

剪掉一層論文,斷的是推理鏈

還有一篇論文,名叫《When Fewer Layers Break More Chains》,來自圖賓根大學,說的是一個已經被廣泛使用的模型壓縮手段——層剪枝,也就是直接把Transformer裡的某幾層整個刪掉,減少模型深度來省算力論文

層剪枝能這麼做,是因為已經有研究發現,模型裡有一部分層對整體表現的貢獻很小,刪掉之後,用常規的知識類測評一測,分數掉得很少論文

剪掉四分之一的層,還能保留八成以上的原始準確率,這類結果讓層剪枝成了一種被普遍接受的效率手段論文

但這些測評測的都是知識類任務,答案短,靠模型記住的東西就能答對論文

這篇論文測了另一種能力——長鏈推理,論文用的方法是「測試時擴充套件」,簡單說就是讓模型多想一會兒,給它更多token去推理,或者讓它多生成幾遍答案再挑對的,正常情況下,想得越久,或者試得次數越多,正確率應該越高論文

Transformer祖傳設計遭暴擊,COLM頂會三篇論文發難

論文選了兩個本身就具備這種能力的模型,s1.1-7B和Qwen3-8B,用三種主流的層剪枝方法各剪一到兩層,再看這兩種擴充套件方式還靈不靈論文

結果在知識類測評上,分數掉得確實很平緩,但換成數學競賽難度的AIME24,s1.1-7B只剪一層,正確率就大幅下滑,剪兩層,直接掉到接近零論文

給模型更多思考token,本該讓它想得更明白,結果剪過層的模型,思考時間越長,反而越不見起色,測試時擴充套件這件事,等於是失效了論文

Transformer祖傳設計遭暴擊,COLM頂會三篇論文發難

作者接著測了能不能靠微調救回來,分別用LoRA微調和全引數微調,在剪過層的模型上重新訓練論文

剪一層的模型,微調幾乎沒什麼用論文。剪兩層的模型,微調能救回一部分分數,但離剪之前的水平還差得遠。

總之,這篇論文想要告訴人們,層剪枝沒有看上去那麼安全論文

三篇論文研究的物件完全不一樣,一篇看長上下文,一篇看訓練時的梯度,一篇看推理鏈論文

但放在一起看,能看出一個共同的模式——三篇論文盯上的,都是已經被主流模型廣泛採用、很少有人回頭質疑的常規設計論文

現在,這些「常規」操作,也開始被重新審視了論文

參考連結論文

[1]

[2]

[3]

本站內容來自使用者投稿,如果侵犯了您的權利,請與我們聯絡刪除。聯絡郵箱:835971066@qq.com

本文連結://www.yxd-1688.com/post/67775.html

🌐 /