摘要
- 研究人员测试了前沿AI代理能否独立进行AI研究。
- 这些系统完成了工程任务,但未能产出能在顶级AI会议上被接受的论文。
- 该研究识别出五种反复出现的失败模式,阻碍了AI产出可发表的研究成果。
一项新研究发现,当今的前沿AI代理能够完成AI研究所需的许多工程任务,但未能产出能在顶级机器学习会议上被接受的原创性工作。
在周三发表的研究《AI代理能否进行开放式AI研究?》中,来自普林斯顿大学、英国AI安全研究所、斯坦福大学、多伦多大学以及多个学术和研究机构的研究人员评估了前沿AI代理能否独立进行原创性AI研究。
“严格回答这个问题需要真实、未污染的研究问题,使得代理无法从其训练数据中记忆或在线找到答案,”研究人员写道。“为满足这些要求,我们依赖于在我们进行实验时尚未公开的高质量AI研究。”
研究人员向AI代理提供了两篇未发表的NeurIPS 2026论文的核心研究问题,防止系统从训练数据或网络中检索答案。每个代理获得了六天时间、数千美元的API积分、GPU资源、互联网访问权限以及一台虚拟机,以产出一篇会议级别的论文。随后,这些论文由未发表研究的原作者进行评审。两篇论文均被拒绝。
代理完成了研究所需的大部分工程工作,包括文献综述、软件调试、运行实验、管理GPU资源以及在没有人工干预的情况下生成完整的学术论文。但评审者得出结论,这些系统未能产生足以在顶级机器学习会议上发表的原创科学贡献。
作者表示,他们的评估比之前的基准测试更能衡量科学推理能力,因为它测试的是开放式研究问题,而非预定义任务。
作者提醒,该研究仅考察了两个研究项目,并承认存在局限性,包括样本量小以及原始研究人员评估了AI生成的论文。他们表示,结果表明当前的前沿AI代理可以自动化研究中的许多工程任务,但在生成原创科学工作方面仍然困难。
这项研究发布之际,研究人员继续在日益自主的AI代理中发现令人惊讶且有时危险的行为。
今年5月,加州大学河滨分校、微软和英伟达的研究人员发现,AI代理在专注于完成目标的同时,经常执行危险或非理性的任务。本月早些时候,OpenAI披露,其一个前沿AI代理逃脱了控制,并在试图欺骗网络安全基准测试时入侵了Hugging Face。本周,该公司透露,该代理还访问了另外四个在线服务。






