基于蛋白质序列和深度学习的关键蛋白质预测方法
杨锦亮1,肖晨阳2,方艳橙2,潘 理1,2
(1.湖南理工学院 物理与电子科学学院,湖南 岳阳 414006;
2.湖南理工学院 信息科学与工程学院,湖南岳阳 414006)
摘 要:针对传统方法依赖蛋白质相互作用网络而面临噪声干扰、泛化能力有限等问题,提出一种基于蛋白质序列信息与多源生物数据融合的预测模型PSG。该模型通过多尺度TextCNN从位置特异性得分矩阵中提取384维序列特征,利用全连接网络将1024维亚细胞定位信息压缩为64维特征,并采用双向长短期记忆网络从基因表达谱中生成64维动态特征;随后将三类特征拼接为512维全局特征表示,输入深度多层感知机进行关键蛋白质分类。实验结果表明, PSG模型在敏感性、特异性、F1分数和准确率等指标上均优于10种中心性方法(DC、LAC、NC、EC、BC、CC、SC、PR、PeC、WDC)、8种机器学习方法(SVM、DT、KNN、RF、AdaBoost、XGBoost、LR、MLP)和4种深度学习方法(DeepEP、IBMI、MBIEP、ACDMBI)。消融实验进一步表明,序列特征是模型性能的关键因素,而序列、亚细胞定位与基因表达三类特征的融合则实现了最佳协同作用,显著提升了模型整体性能与鲁棒性。
关键词:关键蛋白质;蛋白质序列;深度学习