文婷 發自 凹非寺
量子位 | 公眾號 QbitAI
啥情況?統治科研圈幾十年的PDF格式論文,都需要因AI而“退休”…
因為以後論文的第一讀者不是人論文,而是AI??
近日,IEEE Spectrum重點關注了一項新研究——ARA(Agent-Native Research Artifact)論文。它不僅能讓AI理解研究結論,還能復現實驗、靈活規避失敗路線並繼續推進研究,讓AI從輔助工具升級為科研協作者
據IEEE報道論文,ARA團隊在一篇名為The Last Human-Written Paper: Agent-Native Research Artifacts的論文中,呼籲科學家們停止繼續使用PDF撰寫傳統論文,並表示:
AI需要一種不同的內容格式,而AI的需求,理應被置於首位論文。
論文的第一作者劉嘉晨核心論點是論文:
一旦AI“榨乾”了人類專家所有的資料,它就不再需要人類的任何輸入論文。到那時,AI將開始自主進化。
現在這些只提升AI科學家的能力,卻不改造科研知識的共享方式,就像在泥濘路上開F1賽車,難以復現並接續前人的工作論文。
而PDF就是過去科研知識共享的最核心代表論文。
是時候了,ARA當立論文。
為什麼PDF該死論文?
PDF代表的是傳統論文的最終結果,是科研最後成果的最終呈現,但就是這種呈現,“有問題”論文。
展開全文
ARA團隊認為,真實的科研從來不是一條從問題直通答案的直線,研究者往往要提出十幾個假設、嘗試幾十種方案、調整無數次引數,在經歷大量失敗後,才能摸索出一條走得通的路徑論文。
然而,當這些探索被寫成論文時,那棵枝杈橫生的“探索樹”通常會被修剪成一條幹淨、連貫的成功路徑論文。
而ARA團隊將這種損失稱為“敘事稅”,即為了讓研究成為一個有頭有尾、邏輯自洽且成功的故事,大量的探索過程被主動捨棄,後來者只能被閃耀的新突破亮瞎眼,卻看不見前人踩過的坑、受過的罪論文。
除了“敘事稅”,傳統論文還存在著“工程稅”論文。
一篇論文只要能讓審稿人信服,便算完成了使命論文。
但“說服審稿人”與“讓AI完整復現”完全是兩套標準論文。
模型版本、執行環境、超引數、預處理方式、訓練技巧……這些決定實驗成敗的關鍵細節,往往散落在正文、附錄和程式碼倉庫中,有些甚至從未被記錄論文。
研究團隊統計了PaperBench中的8921項專家復現要求,發現僅有45.4%在論文PDF中得到了完整說明論文。
對咱來說論文,實驗資訊少了,我們可以根據過往經驗、求助導師或者不斷試錯補上;
但對AI來說,論文裡沒寫,那就意味著只能靠猜(或者瞎編),它也很無奈論文。
因此,ARA選擇徹底換一種思路:
不再將線性敘事的論文視為科研成果本身,而是把研究重組為一個機器可直接操作的知識包論文。
這個知識包包含四個層次論文:
科學邏輯層論文:
記錄研究解決了什麼問題、為何採用該方法,以及哪些主張可被證偽論文。
可執行程式碼層論文:
不僅提供程式碼倉庫,還包含復現實驗所需的環境、配置與關鍵引數論文。
探索圖層論文:
將實驗過程還原為一張可追蹤的路線圖,成功與失敗的方向、放棄某條路線的原因均被保留論文。
證據層論文:
將論文中的每一項主張關聯至原始實驗結果,方便AI核驗結論,而非僅採信正文中的概括性描述論文。
概括來說論文,論文最後透過PDF呈現的只是“我們最後做成了什麼”;
但如果透過ARA,展現的還有“為什麼這麼做”“具體怎麼做”“哪些方法已失敗”以及“原始證據在哪裡”,追求的是知識優於敘事論文。
更形而上來說,PDF只有結果,ARA還包括了整個過程論文。
道理似乎是這個麼道理,但“一切存在皆合理”,PDF能成為人類科研論文最終呈現形式這麼多年,一定是有其內在合理性的論文。
ARA要取而代之,需要的就不光是理念了論文。
ARA真的比PDF好用嗎論文?
為了讓ARA真正跑起來論文,研究團隊設計了三套配套機制:
1、Live Research Manager:負責在研究過程中持續記錄實驗、決策、轉向與失敗路線論文;
2、ARA Compiler:負責將現有的PDF和程式碼倉庫轉換為ARA格式論文;
3、ARA原生審稿系統:負責讓機器先行完成結構檢查與復現驗證,並將創新性、重要性與研究品位等判斷留給人類審稿人論文。
為了體現ARA真的比PDF好用,研究團隊分別從理解、復現和延伸三個維度進行了測試論文。
在理解測試中,研究人員設定了450個問題,要求AI從ARA或傳統PDF加程式碼倉庫中尋找答案論文。
結果顯示,使用ARA的AI準確率達93.7%,而傳統材料組僅為72.4%,相差21.3%論文。
差距最大的是“覆盤失敗”,當問題涉及失敗方案、替代路線和實驗教訓時,ARA組準確率為81.4%,傳統材料組僅15.7%——原因很簡單,傳統論文裡壓根就沒有這些資訊論文。
在復現測試中,團隊選取了15篇附帶GitHub倉庫的機器學習論文,設定了150項復現任務論文。
其中,ARA組的難度加權成功率為64.4%,傳統組為57.4%論文。且任務越難,ARA的優勢就越明顯:
ARA在簡單、中等和困難三檔任務中,分別領先4.9%、5.6%和8.5%論文。
但ARA的表現並非一路開掛論文。
在最具挑戰性的研究延伸環節,ARA組贏下了3項RE-Bench開放任務,但另有2項被傳統論文組反超論文。
不過,也有可取之處論文。
ARA組在全部5項任務中,都搶先摸到了那步最關鍵、最值錢的第一步實驗操作:利用失敗記錄迅速繞開已經被驗證過無效的研究方向,省去大量重複探索論文。
這也對應了論文中的另一組資料論文。在論文分析24008次AI Agent執行中,90.2%的資金成本都消耗在失敗探索上,而傳統論文幾乎不會儲存這些失敗。
對劉嘉晨而言,這正是ARA最重要的價值論文。
在她設想的人機科研關係中,AI不再只是潤色論文、查詢資料或生成程式碼的輔助工具,而是能真正成為參與閱讀、復現和延伸研究的科研主體論文。
而科研人員則可以更加聚焦於那些AI難以替代的判斷、創新和品味工作,即判斷問題是否重要、工作是否真正新穎、某條路線是否值得投入論文。
ARA也並非完美
不過,雖然ARA的成績單看起來非常亮眼,但它目前更像一位野心勃勃、天資聰穎卻根基尚淺的高一新生,才剛入學就想要在高考中考進北大論文。
它離成為“PDF終結者”還有很長的一段道路要走論文。
篇幅有限,簡單說三點論文。
ARA的第一個缺陷,就是它目前實驗的範圍較窄,普適性較弱,只覆蓋了天然適合程式碼復現的機器學習領域,能否用於溼實驗或理論學科還尚未得到驗證論文。
第二個問題,就是隱私和資料安全問題論文。
ARA目前不僅還沒有實現細粒度的訪問控制,缺少沙箱執行和內容異常檢測,相關規則和標準也還沒完善妥當論文。
要是你就這麼大大咧咧地把機密資料餵給它,小心下一秒就被你的競爭對手拿走哦論文。
第三個是不可避免的AI幻覺和路徑依賴問題論文。
在15篇論文的復現實驗中,傳統材料組出現了2次結果編造,ARA組也出現了1次論文。
所以它目前應該既不能保證AI永遠不捏造結果、也不能保證它不會過度傻白甜地相信前人的判斷論文。
當然,這種思考和理念,依然有其創新性和價值論文。
如果你需要更詳細瞭解,建議你直接前往文末附上的論文和開源地址論文。
或者更進一步與ARA的研究團隊、提出者交流論文。
ARA提出者
ARA研究由來自斯坦福大學、密歇根大學、卡內基梅隆大學和MIT等多家機構的37名研究者共同完成論文。
其中第一作者是劉嘉晨論文。
她是密歇根大學的電腦科學博士,深耕機器學習系統與大模型基礎設施領域論文。
△劉嘉晨,來源IEEE Spectrum
她曾參與大模型服務、訓練系統和Agentic RL系統研究,也曾在Meta從事大模型預訓練與後訓練基礎設施相關工作論文。
劉嘉晨的個人主頁和密歇根大學官網顯示,她曾在2023年入選Machine Learning and Systems Rising Stars榮譽榜單論文。
△圖源密歇根大學官網
今年5月,劉嘉晨在帕洛阿爾託創立Agent-Native Research Lab,已經聯動產學研來推動ARA Commons科研生態建設論文。目前,其公開成果主要包括ARA協議及論文、配套程式碼、研究生態構想,以及面向NeurIPS 2026的AI驅動科研生態研討會。
實際上,這種Agent-Native的理念,也在AI狂飆這幾年,正在給千行百業帶來正規化變革論文。
從PDF到ARA,一方面是AI能力的湧現,可以讓整個科研過程的價值被重新發現和重視,而不僅僅是呈現一個最終的結果論文。
過去我們形成了PDF,是因為所有論文都是人類作為閱讀者、使用者、核心物件論文。
但現在AI能力加持論文,Agent能力突破,人類看不過來的科研過程Agent可以看,人類難以並行的科研復現Agent可以復現……
以前是人類—PDF—人類,以後可能是人類—Agent—ARA—Agent—人類論文。
這種變革也不侷限於科研領域論文,在更早之前,一脈源流的已經有:
GUI已死論文,CLI當立…
Markdown已死論文,HTML當立…
Prompt已死論文,Loop當立…
“PDF已死論文,ARA當立”
只是這種趨勢下的一種因循結果罷了論文。
這更本質的是一種AI觀、價值觀上的哲學體現論文,你依然支援的是“人是萬物的尺度”,還是AI才是更終極的尺度?
你是碳基生命守護者論文,還是完全擁抱矽基時代降臨…
這無關對錯,只是選擇,選擇的人多了,也就會在某個節點分出對錯論文。
而ARA的提出者,顯然選擇的是AI為中心、Agent Native論文。
當然,目前為止,ARA這篇研究和論文,依然是PDF提交和呈現的論文。
參考連結論文:
[1]
[2]
[3]
[4]
[5]
[6]
[7]