疾病监测

北大核心,CA,CSCD,WJCI,

国内刊号:11-2928/R

国际刊号:1003-9961

疾病监测杂志2025年第5期:基于泛基因组特征的机器学习模型预测肺炎克雷伯菌对美罗培南的表型耐药

发布日期:

作者:王瑜昊,赵俊岭,黄佳,吴鑫淼,卢昕,阚飙,李臻鹏

关键词:肺炎克雷伯菌, 机器学习, 美罗培南, 耐药

目的建立基于全基因组特征的肺炎克雷伯菌对美罗培南表型耐药的机器学习模型,发现潜在耐药相关基因。方法从细菌和病毒生物信息学资源中心数据库及美国国家生物技术信息中心的抗菌素耐药性生物体国家数据库数据库收集同时有表型数据和全基因组数据的菌株。 使用RGI 6.0.3软件分析菌株基因组携带的耐药基因,使用PanTa 1.0.0软件分析菌株的泛基因组,分别使用耐药基因和附属基因作为纳入特征,构建预测肺炎克雷伯菌对美罗培南耐药表型的LightGBM、随机森林、logistic回归模型,使用分层嵌套交叉验证对模型进行特征筛选、超参数优化及模型评估,得到最优模型,使用Shapley可加性解释算法对特征的贡献进行评估。结果经质量控制,有5 800株基因组纳入模型,其中对美罗培南耐药和敏感的菌株分别有2 171和3 629株,这些菌株包含泛基因258 333个,耐药基因436个。 基于耐药基因分别构建的3种模型中,随机森林的拟合效果最佳。 模型筛选到64种耐药基因,其曲线下面积(AUC)值、平衡准确度、召回率、特异度、精确度和阴性预测值分别为0.916、87.84%、81.66%、94.02%、89.09%和89.55%。 基于泛基因组构建的3种模型中,拟合效果最好的是了logistic回归。 经过筛选得到了156种耐药相关的候选基因,其中包括27个已证实的耐药基因和129个潜在耐药相关基因,该模型优于耐药基因构建的模型,其AUC值、平衡准确度、召回率、特异度、精确度和阴性预测值分别0.943、89.48%、85.16%、93.79%、89.16%和91.36%。 进一步使用Shapley可加性解释算法评估了特征基因对模型的贡献。 模型发现的前15个贡献最大的基因中有6个为未被证实的潜在耐药相关基因,如yojI、mobA、xerC和ynfE。 所建立的预测模型已被封装为命令行软件predMemRes(https://github.com/Wangyuhao66/predMemRes),该软件能够基于肺炎克雷伯菌基因组序列快速预测菌株对美罗培南的耐药表型。 结论机器学习模型可有效用于预测肺炎克雷伯菌对美罗培南表型耐药,并发现潜在耐药相关基因。

来源:2025年第5期

《疾病监测》期刊编辑部

查看疾病监测杂志2025年第5期

联系我们

  • 地址:北京昌平区昌百路155号
  • 电话:010-58900732
  • E-mail:jbjc@icdc.cn

咨询工作人员