近日,Anthropic研究员计划的研究人员展示了用AI模型训练其他AI模型的研究成果。Anthropic发布了论文《自动化研究员能够可靠缓解对齐失效》,介绍了如何利用AI系统改善模型在对齐基准测试中的表现。研究团队针对10种失调行为设置测试,自动化系统最终让全部10项指标都有所改善,同时没有牺牲模型的整体能力。
这套系统由Anthropic研究员计划成员陈岳翰领导开发,工作流程与传统科研相似。自动化系统会先查阅已有文献,提出训练方法,再按照方案训练模型30分钟,并通过多轮尝试逐步提高测试成绩。有效方案会留下,无效方案则被淘汰,使整个研究过程能够快速扩大规模。论文指出,这些结果初步证明,自动化对齐后训练有望在近期成为一种真正可行的方法。这项研究也向递归自我改进迈出了一步,而许多人把递归自我改进视为AI发展的下一个重要阶段。如果AI模型能够改进自身的对齐训练方法,那么进一步改进更广泛的训练流程也并非没有可能。

来源:一电快讯
返回第一电动网首页 >
以上内容由AI创作,如有问题请联系admin#d1ev.com(#替换成@)沟通,AI创作内容并不代表第一电动网(www.d1ev.com)立场。
文中图片源自互联网或AI创作,如有侵权请联系邮件删除。