医疗行业-支持向量机算法用于拮抗药化合物活性的模式识别 精品

支持向量机算法用于拮抗药化合物活性的模式识别陆文聪, 王焜, 陈念贻(上海大学化学系计算机化学研究室,上海,20XX36)摘要:本工作试用新近提出的、特别适合于小样本多变量训练集的支持向量机(sup

支持向量机算法用于拮抗药化合物活性的模式识别 1 陆文聪,王焜,陈念贻 20XX36 (上海大学化学系计算机化学研究室,上海,) 摘要: supportvectormachine 本工作试用新近提出的、特别适合于小样本多变量训练集的支持向量机(,简称 SVM26 )算法于复杂药物分子设计。对一批个处理化疗或放疗呕吐拮抗药的候选化合物筛选数据用留一法判 SVMKNNFisherSVM 别的预报能力。结果表明:与人工神经网络、最近邻法()、法相比,算法可以提供 误报率更低的数学模型。 关键词: QSAR, 支持向量机算法,药物分子设计 中图分类号 O06-04 : SupportVectorMachineAppliedtothePatternRecognitionofActivityofAntagonists LUWen-cong,WANGKun,CHENNian-yi (DepartmentofChemistry,SchoolofSciences,ShanghaiUniversity,Shanghai20XX36,China) Abstract Inthiswork,therelationshipbetweentheactivityandstructuraldescriptorswasinvestigatedbyusingthe supportvectormachinedevelopedbyVapnik.Forthesamplesetwith26poundsasantagonists,thecrossvalidationby leaving-onemethodwasusedtoparethepredictionabilityofsupportvectormachinemethodwithKNNandFisher method.ItwasfoundthatthepredictionresultbysupportvectormachinewasbetterthanthatofKNNorFisher method. KeyWords: antagonist,supportvectormachine,patternrecognition 有机分子的结构-活性关系研究是药物分子设计的重要手段。一般用线性回归方法总结各种量子 化学、结构化学参数与分子生物活性的关系。但当训练集各分子的结构相差较大时,上述关系有时呈 Bienfait 现强非线性。不少作者采用人工神经网络或非线性映照方法作数据处理,如将自组织人工神 [1] QSARLivinstoneReNdeR 经网络用于研究,应用型人工神经网络对复杂分子训练集作非线性二维投 [2] 影,都取得相当的成果。然而,如所周知:对于小样本、多变量的训练集,人工神经网络会产生较 (overfitting) 严重的过拟合问题,即拟合结果好而预报效果差的问题。而药物分子设计中由于训练样本 不易取得,经常是用小样本、多因子训练集。如何降低误报率,提高药物分子设计效果,是一个很现 [3] 实的研究课题。最近,已有个别作者试用新发展的支持向量机算法于药物设计,为解决这一问题提 供了一条新途径。 传统的统计预报方法都以概率论中的大数定理为基础。大数定律认为:训练集数目极大时,拟合 建模的结果才能完全反映真实规律。但实际问题又不可能取得无限多个样本。传统的统计数学假定: 可以用经验风险最小,即拟合的最小二乘法误差为建模的判据。但这一假定在理论上并无充分根据, 并不能保证所建的数学模型过拟合最小。 Vapnik 为解决统计预报中如何使过拟合最小的问题,以为代表的数学家作了长期系统的理论研究, [4] 提出了有别于传统统计数学的“统计学习理论”,近年来又根据这一理论提出了新的算法——支持 [5] (supportvectormachine) 向量机算法,应用于人脸和语音识别效果良好,现已开始引起国际计算机学 SVM 界的重视,但在计算化学领域尚少有应用。本工作以一个复杂分子集合的数据挖掘为例,考察 算法在药物分子设计中应用的实际效果。 1 收稿日期: 2002-06-102002-09-10 ;修回日期: 资金资助: 国家自然科学基金委和美国福特公司联合资助,批准号: 作者简介: 1964 陆文聪(—),男,教授。研究方向:计算机化学。

腾讯文库医疗行业-支持向量机算法用于拮抗药化合物活性的模式识别