谷歌RSI論文:AI自進化,做夢吧!

魚羊 發自 凹非寺

量子位 | 公眾號 QbitAI

有意思,谷歌剛被曝跑通了RSI,一篇關於如何讓AI實現自我進化的論文,就被官方發到了網上論文

開啟方式還挺別緻,“做夢”論文

谷歌RSI論文:AI自進化,做夢吧!

對,沒讓大模型重新訓練自己,也不是讓AI直接修改自己的權重,而是Dream-RSI,直接就是一個“夢中學”論文

不開玩笑論文,咱還是正經說,其實是研究人員們發現了一個有點妙的事情:

AI真實探索留存下的歷史記錄,本身就是一個模擬世界論文

於是,一次昂貴的真實探索結束後,Agent不必真的重新跑上幾百、幾千遍實驗,就可以在過去已經發生過的搜尋樹裡,進行虛擬推演(做夢),反覆試驗新的搜尋策略論文

等找到更好的策略,再回到真實環境裡跑一次論文

新的探索,又會產生一棵更大的搜尋樹論文

再拿來“做夢”論文

如此迴圈論文

谷歌RSI論文:AI自進化,做夢吧!

展開全文

省了一大筆錢不說,這法子還真的管用論文。在演算法工程、數學最佳化和GPU核心工程三類任務上,研究人員都證明,Dream‑RSI不僅能大幅降低探索的計算成本,還能達到甚至超越原有方案的發現效果。

歷史就是世界

一起來細扒一下論文論文

論文的核心思路可以這樣總結:把AI走過的彎路,變成AI新的訓練場論文

谷歌的研究人員認為,RSI的核心驅動力,其實在於高效探索論文。因此如何管控並最佳化探索策略,是一個非常關鍵的問題。

實際上論文,很多AI科研系統都已經實現了一個Loop:

生成一個方案 → 跑實驗 → 看結果 → 修改方案 → 再跑實驗論文

問題是,隨著搜尋空間的不斷擴大,固定的探索策略無法自適應調整;而線上策略最佳化,又存在迭代時間長、反饋滯後、代價高等等困境論文

Dream-RSI抓住了一個此前沒有被充分利用的東西:歷史論文

谷歌RSI論文:AI自進化,做夢吧!

一次Agent探索任務跑下來,其實會留下非常豐富的記錄,形成一棵發現樹(Discovery Tree)論文

be like論文

root

A B C

A1 B1 C1

A2 C2

谷歌的研究人員換了個視角論文,發現這一堆歷史日誌,不就是一個模擬器嘛!

舉個例子,Agent首次執行的策略,是把A、B、C分支依次都跑一遍,跑完之後每個節點的結果其實都存下來了:A1得多少分、B1會不會報錯、C2效果怎樣、各自花了多少計算量論文

現在,我們換一種搜尋策略,比如:先跑C,如果C1不夠好,再走A論文

從頭再跑一遍?大可不必,因為C、C1、A、A1這些結果都可以直接呼叫,只要讓新策略在舊樹上“重新走一遍”,就能算出,“如果當時這麼做,需要花費多少計算量,能達到什麼效果”論文

谷歌RSI論文:AI自進化,做夢吧!

也就是說,在Agent已經探索過的區域裡,歷史就是世界論文

只需要一次真實的執行,大量新的策略探索都能更低成本地在這個“模擬世界”中被驗證論文

在夢中自我進化

整個Dream-RSI系統分為三步論文

第一步,真實探索論文

當前探索策略控制一個Coding Agent,決定開哪些分支、繼續哪些方案、跑多少個並行任務、什麼時候結束論文

所有過程被記錄為一棵發現樹論文

第二步,開始做夢論文

引入另一個大語言模型來負責開發探索策略論文

每生成一種新的探索方案,不重新跑實驗,而是在過去積累的所有發現樹上“回放”結果論文

最終,綜合考慮答案質量、搜尋成本和並行效率,找出更好的動態策略論文

第三步,把贏家重新派出去論文。**

新策略進入真實環境,指揮下一輪探索論文

由於策略已經變化,它可能會走到上一代Agent沒有抵達過的位置論文

這樣就會產生新的發現樹,繼續擴大下一輪的“夢境”論文

也就是論文

真實探索 → 產生更多歷史 → 歷史變成更多模擬世界 → 在模擬世界中最佳化探索策略 → 更好的策略產生新的歷史……

大幅降低計算成本論文,效果不降反增

研究團隊把Dream-RSI扔到了8個發現任務裡,橫跨三個方向:演算法工程、數學最佳化和GPU Kernel最佳化論文

最直接的對照組叫Recursive Fixed Exploration論文

它和Dream-RSI使用相同模型、相同Evaluator、相同初始策略和資源約束論文

不同在於,一個每輪都會學習如何重新組織探索,另一個永遠按照第一輪的固定策略繼續搜尋論文

演算法工程

研究團隊讓Agent最佳化Lasso regularization path論文

當模型為Gemini 3.1 Pro時,固定探索最終消耗550次Agent呼叫,六個測試資料集平均執行時間3587.1ms論文

Dream-RSI則用了317次呼叫,最終做到2931.0ms論文

換成Gemini 3.7 Flash也是類似論文

固定策略用了3200次Agent呼叫,平均耗時2516.7ms;Dream-RSI用了1879次,耗時降到2350.6ms論文

谷歌RSI論文:AI自進化,做夢吧!

跟SimpleTES的對比結果差距更誇張論文

SimpleTES對應實驗預算達到51200次呼叫論文。Dream-RSI在部分設定下則只需幾百次呼叫。

兩者最高能差出去162倍論文

GPU Kernel

在VGG16和LayerNorm任務上,Dream-RSI分別相差2.43倍和1.79倍的生成次數,做到相近效能論文

在ConvDiv和ConvMax中,則在接近的計算預算下,把效能分別提高2.09倍和1.44倍論文

谷歌RSI論文:AI自進化,做夢吧!

數學最佳化

谷歌RSI論文:AI自進化,做夢吧!

在Sum Difference上,Dream-RSI拿到1.145427,高於論文列出的多個基線;Circle Packing打到2.635983論文

但Auto Correlation中,SimpleTES仍然是SOTA論文。不過Dream-RSI在結果相近的情況下,呼叫量做到了1000 vs 51200。

One More Thing

有意思的一點是,研究人員們還發現,給AI總結“經驗教訓”,結果反而更差了論文

谷歌RSI論文:AI自進化,做夢吧!

他們把之前探索中踩的坑直接塞進下一輪Prompt,結果萬萬沒想到:

加了顯式語義指導以後,不管是固定探索還是Dream-RSI,表現反而普遍下降了論文

論文給出的解釋是論文

長程科研搜尋往往同時存在很多並行路線論文

如果過早去總結“高層結論”,就相當於提前給未來的探索加上了很強的先驗論文

結果可能不是少走彎路,而是直接把一些看起來沒希望、實際上可能有價值的路線堵死了論文

最後,做個小小的總結,實際上,在Dream-RSI的整個實驗裡,模型本身沒有被重新訓練,與其說是模型的自進化,更像是Harness的自進化論文

過去我們談Agent自進化,關注最多的是兩件事:一、把成功經驗寫進Memory;二、把歷史資料重新拿去訓練模型論文

Dream-RSI提供了第三條路論文

模型可以不變,知識甚至不用先總結成文字,先讓「尋找知識的方法」自己進化論文

下一代Agent不必只從上一代留下的“答案”裡學習論文

而是學習論文

上一代到底是怎麼找到答案的,以及——有沒有一種更好的找法論文

論文由Google、Google DeepMind、馬里蘭大學和弗吉尼亞大學研究者共同完成,目前論文、專案頁和程式碼倉庫均已公開論文

專案地址論文

本站內容來自使用者投稿,如果侵犯了您的權利,請與我們聯絡刪除。聯絡郵箱:835971066@qq.com

本文連結://www.yxd-1688.com/tags-%E4%B8%8D%E9%A1%A7.html

🌐 /