谷歌研究人员打造了一个 AI,它能读懂问题、提出假设、运行实验、撰写论文,甚至模拟自己的同行评审。一旦问题设定完毕,全程无需人类插手。
它叫 ScientistTwo。
研究者给它出了 107 道来自 ICLR、ICML 和 NeurIPS 已录用论文的题目,其中 86 道题上,它击败了已发表的人类成果。
相比人类方法,平均提升幅度为 25.2%。平均每篇论文耗时约 2.5 天,模型与算力成本约 3,765 美元。
九位人类审稿人将其中 33 篇 AI 论文与已录用的人类论文进行对比,最终给出的总体 verdict 是:平手。
但这篇论文也有不那么亮眼的数字。
审稿人认为,人类论文在方法严谨性上略胜一筹。作者也表示,目前它还产不出 Spotlight 级别的成果。中位提升仅为 7.7%,说明平均值是被少数大幅领先的结果拉高的。在没有核查智能体的情况下,它生成的 1,840 条参考文献中有 19 条是伪造的,还有一个解决方案为了拿到更高分甚至违反了任务规则。开启核查后,这两项问题都降到了零。
研究者仍然需要挑选正确的问题。AI 做的,是把等待答案的时间压缩到几天。
如果你知道一篇论文里的所有实验都是 AI 跑的,你还会信任它吗?
#howto用好AI #大模型 #ai #PhD #人工智能发展 #机器学习 #提供思路和创新点 #科研 #多模态人工智能
