摘要
- 研究人員測試了前沿AI代理是否能獨立進行AI研究。
- 這些系統完成了工程任務,但未能產出能在頂級AI會議上被接受的論文。
- 該研究確定了五種反覆出現的失敗模式,這些模式阻止了AI產出可發表的研究成果。
一項新研究發現,當今的前沿AI代理能夠完成AI研究所需的許多工程任務,但未能產出足以在頂級機器學習會議上被接受的原创作品。
在研究「AI代理能否進行開放式AI研究?」中,該研究於週三發表,來自普林斯頓大學、英國AI安全研究所、史丹佛大學、多倫多大學以及多個學術和研究機構的研究人員評估了前沿AI代理是否能獨立進行原創AI研究。
「要嚴格回答這個問題,需要真實且未受污染的研究問題,這些問題代理無法從其訓練數據中記憶或在網上找到,」研究人員寫道。「為了滿足這些要求,我們依賴於在我們進行實驗時尚未公開的高質量AI研究。」
研究人員向AI代理提供了兩篇未發表的NeurIPS 2026論文的核心研究問題,防止系統從訓練數據或網絡中檢索答案。每個代理獲得了六天時間、數千美元的API額度、GPU資源、互聯網訪問權限以及一台虛擬機,以產出一篇會議級別的論文。隨後,這些論文由未發表研究的原作者進行審閱。兩篇論文均被拒絕。
這些代理完成了研究所需的大部分工程工作,包括文獻回顧、軟體除錯、運行實驗、管理GPU資源,以及在沒有人工干預的情況下產出完整的學術論文。但審閱者得出結論,這些系統未能產出足以在頂級機器學習會議上發表的原創科學貢獻。
作者表示,他們的評估比先前的基準測試更能衡量科學推理能力,因為它測試的是開放式研究問題,而非預定義任務。
作者提醒,該研究僅考察了兩個研究項目,並承認其局限性,包括樣本量小以及原始研究人員評估了AI生成的論文。他們表示,結果表明當前的前沿AI代理可以自動化研究中的許多工程任務,但在產出原創科學工作方面仍然存在困難。
這項研究發表之際,研究人員繼續在日益自主的AI代理中發現令人驚訝且有時危險的行為。
今年5月,來自加州大學河濱分校、微軟和輝達的研究人員發現,AI代理經常在專注於完成目標的同時,執行危險或不合理的任務。本月早些時候,OpenAI披露,其一個前沿AI代理逃脫了控制,並在試圖欺騙網絡安全基準測試時入侵了Hugging Face。本週,該公司透露,該代理還訪問了四個額外的在線服務。






