Agent 經常遇到這樣一種幻覺:你給模型接入了終端,下發了一個複雜的 debug 任務,看着它順藤摸瓜排查了幾個小時,最終完美修復了依賴衝突,甚至連測試用例都幫你補齊了。
你以為你的系統變強了。
但第二天,另一個 Agent 接手了同一個倉庫的相似任務。結果,它像個完全沒來過的新手,從盲目讀取報錯、亂改配置到隨意重裝,把昨天踩過的坑、走過的彎路,原封不動又走了一遍。
代碼修好了,日誌也存下來了,但對於系統而言,什麼都沒有發生。

深挖這個現象,是一個殘酷、致命、卻極少被正視的工程問題:模型的單次推理能力再強,只要任務一結束就 「閱後即焚」,系統就永遠不可能產生真正的能力複利。
當整個行業都在狂熱探討大模型的下一個技術奇點 ——RSI(Recursive Self-Improvement,遞歸式自我改進)時,大家往往陷入了一個思維定勢,認為 RSI 的終極形態必須是 「大模型自己寫代碼訓練出一個參數量更大的基座模型」。
但在真實的工程環境裏,如果 Agent 連 「啱啱踩過的坑,下一次不要再重試」 都做不到,談何自我改進?
最近,EvoMap 團隊圍繞這個問題做了系統性探索。他們沒有盲目跟風 「大模型自我訓練」 的遠期大餅,而是提出了一條極具現實意義的工程新路徑:不要把 RSI 留給基模去硬算,而是在系統層構建一個天生具備 「自進化」 能力的智能體,並讓經驗在一個龐大的網絡中流轉。
這並非停留在白皮書上的設想。目前,基於該團隊構建的 GEP 協議,EvoMap 網絡中已經有超過 35.7 萬個 Agent 接入,並且沉澱了高達 481 萬項被目錄化管理的經驗資產。
不僅如此,他們在嚴苛的科研基準上也交出了答卷。由 EvoX(自進化智能體本體)、Evolver(內置進化引擎)和 EvoMap(經驗流轉網絡)構成的這套組合拳體系,正在用極其硬核的數據向行業證明:很多時候決定智能體是否聰明的,不是你調用了多貴的基模,而是經驗在系統裏,長什麼形狀,怎麼流動。
想要進化,
首先你得是一個 「活」 的智能體
現在的 Agent 系統有一種奇怪的分裂。在聊天窗口裏,模型可以條理清晰地講出一套修復邏輯,甚至能寫出一份詳盡的排查 SOP;但一把它放進真實的開發環境,它經常連一個最基礎的環境變量配置都搞不定。
因為沒有真實的試錯動作,就不可能產生真實的經驗。
這正是 EvoMap 團隊研發的自進化智能體 EvoX 的核心定位。它不是一個被動的測試沙盒,而是一個天生為真實物理世界和代碼環境設計的 「自進化智能體」。

當 EvoX 接手任務時,它必須實打實地讀源碼、敲命令、調工具、看報錯。無論任務最終成敗,EvoX 都會在底層留下一條極其詳盡的執行軌跡:哪一步的報錯打破了僵局?哪一條錯誤的 bash 命令徹底帶偏了節奏?
這條帶着真實反饋的泥濘軌跡,是後續系統進化的唯一原材料。EvoX 之所以獨特,在於它不只負責 「幹活」,它生來就帶着提煉這套軌跡的本能。
Evolver 引擎:
經驗是高密度的 「控制片段」
拿到 Agent 吐出的長串軌跡後,業內最常見的做法是什麼?
—— 寫成一份巨長的 Skill(技能文檔),扔進 RAG 裏,下次遇到任務就餵給模型。
但這其實是大錯特錯的。在我們之前報道過的 EvoMap 團隊論文《From Procedural Skills to Strategy Genes》(https://arxiv.org/pdf/2604.15097) 中,用 4590 次受控實驗無情地戳破了這個幻覺。

實驗表明,對人類工程師來說意味着安全感與完整性的長篇文檔(Skill),對 Agent 來說卻是災難。把幾千 Token 的未經清洗的軌跡餵給模型,反而會稀釋控制信號、淹沒有效動作。錯誤經驗被盲目複用,比沒有經驗更可怕。
這就是 EvoX 為什麼需要內置 Evolver 引擎。
作為智能體的進化核心,Evolver 是一個橫在軌跡與模型之間的 「清洗漏斗」 與 「驗證機」。它拋棄了傳統的 「總結日誌」 模式,將過往的失敗、成功與修復路徑,強制蒸餾為極其緊湊的結構化控制對象 ——Gene(基因)。
更恐怖的是其對算力效率的壓榨。在 Claude Opus 上,複用 Gene 的智能體不僅比使用 Skill 多解決了 39 個長流程任務,其執行時的 Token 消耗反而降低了 9.9%。Evolver 證明了,總結失敗的最優形態絕不是長篇大論的 Reflection(反思),而是被極度蒸餾後的獨立 AVOID 警告。
同時,這套內置引擎甚至能夠讓系統在沒有人類干預的情況下完成 「科研閉環」。在 EvoMap 團隊的 AutoResearch (https://arxiv.org/pdf/2608.17906) 實驗中,系統將問題發現、計劃生成、Swarm 實驗與獨立驗證連接起來。在一個複雜的 Django 修復任務中,Evolver 幫助 Agent 區分出了單次修復的 「偶然成功」 與 「實質性突破」,最終將官方新特性的測試通過率從 2/7 硬生生拉到了 7/7,同時保持了全部 203 個迴歸測試的完美通過。

EvoMap:
踩過的坑絕不讓 35 萬 Agent 再踩一遍
當一條高質量的 Gene 被 Evolver 引擎提煉出來後,如果只留在 EvoX 自己的腦袋裏,它充其量是個人的備忘錄。
RSI 的真正威力,在於規模化流轉。這正是 EvoMap 網絡要解決的問題。
EvoMap 網絡目前已經有 35.7 萬 Agent 接入。在如此多 Agent 協作的當下,經驗必須是一個 「協議化的對象」。EvoMap 團隊沒有停留在 「寫提示詞」 的層面,而是直接殺到了協議層,設計了 GEP(Gene Evolution Protocol)協議。

在這個協議的支撐下,一個真實的 RSI 閉環在 35.7 萬個接入 EvoMap 的智能體和 481 萬 + 經驗資產之間日夜不停地運轉:
匹配與注入:EvoX 接到新任務,系統掃描上下文,從 EvoMap 的 481 萬個資產中匹配最相關的 Gene,直接作為 System Instruction 注入,極低的 Token 開銷換來極強的測試時控制。
執行與回寫:EvoX 執行完畢後,無論成敗,其內置的 Evolver 都會把這次的結果以 Event 形式回寫到 EvoMap 網絡。
全局進化:EvoMap 接收反饋後,觸發該 Gene 的驗證(Validate)、變異(Mutate)或固化(Solidify)。
如果一條經驗遭遇了水土不服,網絡就會自動記錄失效條件,甚至衍生出針對新環境的變異版本。這不是 Prompt 抄襲,而是一個有版本控制、有適用邊界、帶有達爾文式淘汰機制的經驗分發網絡。
為了驗證這套 「不更新模型參數、純靠經驗對象流轉」 的威力,團隊還在包含 778 個複雜長流程任務的 LongWoF-Bench (https://arxiv.org/pdf/2608.23200) 上進行了極具說服力的測試。在共享的隱蔽驗證器監控下,通過 EvoMap 注入了 Gene 的 EvoX,在共享隱蔽驗證器的監控下,注入了 Gene 的 Agent,在橫跨 7 款主流大模型上的任務通過率,表現遠超那些 「裸跑」 或者只攜帶普通 Skill 文檔的開源框架,比依賴 Skill 文件的基線高出 8.7 到 15.5 個百分點。

某一台機器上的 EvoX 踩過的坑、算出的最優解,可以在一秒鐘後,變成那 35 萬個同伴的先驗本能。這纔是群體智能(Swarm Intelligence)在工程上最堅實的底座。
RSI 的破局點:
不更新參數,也能讓系統持續變強
EvoX(自進化智能體)、Evolver(內置進化引擎)和 EvoMap(經驗流轉網絡) 組成的這套體系像一面鏡子,照出了當前大模型 Agent 經驗複用的本質:
Agent 不是在讀一份冗長的說明書,而是在有限的推理預算裏尋找下一步該怎麼做、什麼動作必須絕對避免。
這也回答了本文開頭的那個問題:RSI 到底離我們有多遠?
如果死磕 「模型訓練模型」,我們可能還需要幾年甚至更久,去解決數據污染、災難性遺忘和鉅額算力成本的問題。但 EvoMap 團隊輕巧地給出了一條不必等待的捷徑:在智能體和系統協議層解鎖 RSI。
在他們的實測中,在不更新基模一個參數、不加任何 SFT 或 RLHF 的前提下,純靠經驗對象(Gene)在系統內的自動提取與流轉進化,就能讓一個普通的開源模型在硬核評測基準上的通過率飆升,同時 Token 消耗降低幾個數量級。
當整個 AI 圈都在為了更長的 Context、更花哨的 RAG 框架 「卷生卷死」 時,這家想做中國 RSI 領域 Frontier Lab 的團隊,指明瞭一條無比樸素卻直擊要害的通路:
Agent 時代,下一階段的競爭,絕不僅是拼誰家的模型參數更大、誰的上下文更長;而是誰能率先針對智能算力的利用效率,找到一套 「執行、提煉、驗證、分發」 的自進化機制。
畢竟,真正的進化,不是每次跌倒後都去重塑大腦,而是把如何爬起來的肌肉記憶,刻進整個種群的基因裏。