自主研究代理能够产出具有竞争力的解决方案和专业的文稿,但其输出包含表面评估无法检测到的可验证性缺陷:虚假引用、无法复现的分数以及与实现不符的方法描述。我们通过三项贡献解决了这个问题。第一,证据链(Chain-of-Evidence, CoE),这是一种要求每个主张都能追溯到证据源的可验证性框架。第二,ScientistOne,这是一个端到端的自主研究系统,在文献综述、解决方案发现和论文写作的全过程中通过构建保持证据链。第三,CoE审计,这是一种事后审计,其四项完整性检查——分数验证、规范违规、参考验证和方法代码对齐——统一应用于所有系统。在跨越五个系统和五个前沿研究任务的75篇论文中,每个基准都表现出至少一种系统性故障模式:幻觉参考率高达21%,分数验证通过率低至42%,方法代码对齐度在20%到80%之间。ScientistOne实现了零幻觉引用(0/337)、完美的分数验证(12/12),并拥有最高的方法代码对齐度(14/15),同时在所有五个任务上达到或超过了人类专家的表现。ScientistOne进一步泛化到跨越医学成像、细粒度识别、3D感知和语言建模的六个额外任务,在Parameter Golf上达到最先进水平,并在基准完全失败的MLE-Bench任务上获得金牌。
自主研究代理证据链可验证性框架ScientistOneCoE审计Artificial IntelligenceAI AgentLarge Language Model