论文部分内容阅读
以支持向量机为分类器,序列的k-letter词为特征,建立了原核生物的基因识别模型。分别选取已知功能的基因为正样本,和与等长正样本的随机突变序列为负样本组成训练集。5倍交叉实验的结果表示,对于具有不同核函数的支持向量机以及不同长度的词特征,其预测准确率不同,最高的可达94%以上,最差的低于60%;长度为3的词的特征的分类结果最好,其次是长度为4。这说明3联核苷酸为基因序列比较好的统计特征。