苹果公司研究人员近日在蛋白质设计领域取得新进展,其开发的名为SimpleDesign的端到端模型通过预印本平台arxiv公开研究细节。该模型突破传统多阶段训练框架,实现了氨基酸序列与三维结构的同步生成,为蛋白质设计提供了更高效的解决方案。
传统蛋白质设计模型通常采用分阶段训练方式:先通过自编码器将蛋白质结构转换为离散潜在表示,再训练生成模型处理这些中间数据。而SimpleDesign创新性地采用直接训练策略,利用氨基酸序列和连续三维坐标进行端到端学习,省去了中间表示转换环节。这种设计思路延续了苹果此前SimpleFold项目的技术脉络,后者已实现基于氨基酸序列直接预测蛋白质三维结构的功能。
蛋白质折叠与逆折叠是该模型的核心应用场景。前者指根据氨基酸序列推导其三维构象,后者则是基于目标结构反推可能的氨基酸组合。SimpleDesign通过统一架构同时处理这两类问题,其训练数据中的序列遮盖比例最高达50%,结构噪声添加幅度最高达2埃,这种极端条件设计显著提升了模型的泛化能力。
基准测试显示,SimpleDesign在联合设计、结构生成和序列生成等任务中表现优异。生成的蛋白质结构具有合理空间构象,氨基酸序列质量与主流多模态模型相当,部分指标甚至更优。特别在逆折叠任务中,模型展现了对结构-序列对应关系的深刻理解,能够生成符合生物化学规律的氨基酸组合。
尽管计算机评估结果令人鼓舞,但研究团队明确指出,当前成果尚未通过湿实验验证。生成蛋白质的实际折叠能力、功能活性及生物安全性仍需后续实验研究。这种谨慎态度反映了人工智能辅助蛋白质设计领域的普遍现状——算法优化与实验验证的协同发展仍是关键挑战。




