跳到正文
格致开物MATHWIKI

2000年国赛A题:DNA序列分类

2000年国赛A题:DNA序列分类是2000年全国大学生数学建模竞赛的A题。

返回2000年国赛赛题

分类对象

题目以 DNA 序列的结构研究为背景。DNA 中的碱基通常用 A、T、C、G 四个字母表示;本题研究的是给定序列集合的分类,而不是要求破译整个人类基因组。

资料分为人工序列与自然序列。人工数据文件名为 Art-model-data,共 40 个序列;自然数据文件名为 Nat-model-data,共 182 个较长的自然 DNA 序列。完整字符数据见文末官方附件。

问题一:人工序列分类

人工序列中,编号 1—10 已知属于 A 类,编号 11—20 已知属于 B 类。利用这 20 个已知类别的序列提取特征、构造分类方法,并通过已知类别检验方法的效果。题目以分类正确率作为评价依据。

然后对编号 21—40 的另外 20 个、未标明类别的人工序列分类。结果分别列成 A 类、B 类两个序号表,各表按编号从小到大排列;无法归类的序列不写入类别表。

需要详细说明所采用的方法,给出计算程序。如果部分使用已有分类方法,应准确写出该方法的名称。

问题二:自然序列分类

用所构造的分类方法处理自然数据文件中的 182 个序列,并按第一问同样的形式给出分类结果。

数据编号与版本

汇编 PDF 的人工测试集附录内部从 1 编到 20,对应题目要求的全体编号 21—40;最终结果应使用题目要求的全体编号,不能把两个编号范围混为一谈。

官方发布页同时保留独立的人工数据 TXT 和汇编 PDF。二者并非逐字符相同,例如部分序列长度不同,PDF 的测试序列还出现四种基本字母以外的印刷字符;独立 TXT 的第 37 条也含有字母 s。读取或清理数据时须说明所用版本及处理方式,不能在不作说明的情况下把不同版本拼接为同一个数据集。这些差异不改变题目给定的样本数量、已知类别范围与提交编号要求。

附件与来源

官方题目汇编 PDF人工序列 Art-model-data(TXT)自然序列 Nat-model-data(ZIP)。本题见汇编第16—18页。

来源:全国大学生数学建模竞赛官方发布页。核对日期:2026年9月22日。