Apple研究人员在一项新研究中详细介绍了SimpleDesign,这是一款轻量化人工智能模型,能够同步生成蛋白质序列与蛋白质三维结构。
去年9月,Apple研究人员发表题为《SimpleFold:蛋白质折叠远比你想象的简单》的论文,介绍了一种可依据氨基酸序列预测蛋白质三维结构的轻量化方案。
简单来说,SimpleFold采用流匹配模型,直接从氨基酸序列生成蛋白质三维结构。
流匹配技术的简要原理:该方法以带有噪声的随机基底作为起点,学习一条相对直接的路径,最终输出目标结果。
这和扩散模型有所区别,扩散模型一般通过反复去除噪声,逐步得到最终结果。
这两类技术最广为人知的应用领域是图像生成;Apple在内的研究人员,也已经探索过将扩散模型用于文本、代码生成。
回到SimpleFold:Apple将流匹配与通用Transformer模块(文本生成领域的常用基础组件)相结合,让模型避开传统蛋白质折叠模型里部分算力开销巨大的技术,例如知名的蛋白质预测模型所使用的方案。
如今,Apple研究人员推出SimpleDesign。该模型延续SimpleFold对简洁通用架构的探索,将适用范围拓展到更宽泛的蛋白质设计领域,不再局限于仅预测蛋白质三维结构。
Apple研究人员在新论文《SimpleDesign:蛋白质序列与结构协同设计联合模型》中作出如下阐释:
现有模型大多采用多阶段训练流程:第一阶段训练自编码器,把数据转换为隐空间表征;
第二阶段,基于自编码器生成的隐表征训练生成模型,也就是在隐空间内完成生成建模。
我们提出假设:想要获得高性能的协同设计模型,并不需要这种多阶段训练。
基于此,我们提出SimpleDesign,一款直接在原始数据空间完成训练的高效多模态蛋白质设计模型。
也就是说,很多现存蛋白质协同设计模型依赖多阶段流程,而SimpleDesign通过单端到端训练流程,学习同时生成氨基酸序列与连续三维结构。
目前多数蛋白质协同设计模型的工作逻辑:首先单独训练模型,将蛋白质结构转化为离散表征,也就是令牌;随后训练生成模型,基于这类表征生成全新的蛋白质序列与结构。
SimpleDesign省去这一中间步骤,直接从成对的氨基酸序列与三维坐标进行学习,无需先把蛋白质结构压缩为独立的令牌化表征。
Apple研究人员训练SimpleDesign的方式十分巧妙,训练数据集包含超过200万组蛋白质序列-结构配对样本,样本主要取自AFESM数据集,该数据集整合了数据库的预测结构与额外样本。
训练过程中,研究人员会对每组配对数据的两部分同时做破坏处理:序列内的氨基酸会被随机掩码隐藏,对应的三维结构同时加入噪声。
研究人员还会调整两者的破坏程度,当序列基本完好、但结构被大量加噪破坏时,任务就等同于蛋白质折叠,模型需要从已知序列还原对应的三维结构。
与之相反,如果结构基本完整、序列被大量掩码遮蔽,则属于逆折叠任务,模型需要生成能够形成指定结构的氨基酸序列。
当序列与结构都被部分打乱,模型就需要同时处理两项任务,以此完成蛋白质协同设计的训练。
论文数据显示,尽管SimpleDesign的训练流程更加简洁,在蛋白质协同设计、结构生成、序列生成的多项基准测试中,都取得了具备竞争力的结果。
研究人员同时发现,SimpleDesign可以生成合理可行的蛋白质结构,输出的氨基酸序列,整体性能能够达到甚至优于多数同类多模态模型的生成结果。
最后研究人员提到,SimpleDesign的成果目前仅停留在计算机仿真评估阶段,模型生成的蛋白质尚未经过生物实验验证,无法确认在真实生物系统中能否完成折叠、发挥相应功能,或是保证安全。
即便如此,这项研究的结果依然具备很高潜力,完整论文深入阐述了SimpleDesign的模型架构、训练流程、基准测试与实验结果,值得详细研读。
