1.一种基于半监督学习的拷贝数变异检测方法,其特征在于,包括以下步骤,
步骤一,输入参考基因组序列、待检测的测序数据样本以及种子文件,将测序数据样本与参考基因组序列进行比对、排序,获得排序后的BAM文件;
步骤二,在参考基因组坐标系下,将参考基因组序列划分为固定大小且不重叠的窗口,获取排序后BAM文件中的测序读段,根据测序读段的比对信息统计参考基因组序列所有窗口的读段计数,识别并移除参考基因组序列中包含N碱基的异常窗口,保留不包含N碱基的正常窗口;其中,对于测序读段的比对信息出现的缺失值,采用零填充的方式替代缺失值;
步骤三,从测序读段的比对信息中获取参考基因组序列每个正常窗口的读段深度信号和映射质量信号,保存参考基因组序列所有正常窗口的特征;其中,读段深度信号为RD信号,用于表示测序数据样本中碱基的测序深度;映射质量信号为MQ信号,用于表示测序数据样本与参考基因组序列比对的质量;
步骤四,对所有正常窗口的读段深度信号进行GC含量偏差矫正;
步骤五,基于矫正后的读段深度信号,采用循环二进制分割算法,将所有正常窗口分割为读段深度信号均一的分段区域,结合拆分读段策略,识别潜在的拷贝数变异断点位置;
步骤六,对所有分段区域的映射质量信号进行归一化处理;
步骤七,对所有分段区域的读段深度信号进行平滑降噪处理;
步骤八,基于种子文件中拷贝数变异的起始结束位置,为对应的分段区域标注伪标签;种子文件由多个现有拷贝数变异检测工具检测结果的交集区域构建而成,标注伪标签的分段区域若满足以下两个筛选条件,标注伪标签的分段区域属于现有拷贝数变异检测工具检测结果的交集区域,以及标注伪标签的分段区域对应的读段深度信号超过原则,即标注伪标签的分段区域的读段深度信号超过所有分段区域的读段深度信号平均值的三个标准差以上,则被视为高置信度伪标签区域,即,其中表示第个分段区域的读段深度信号,表示所有分段区域读段深度信号的平均值,表示所有分段区域读段深度信号的标准差;
步骤九,将标注伪标签的分段区域作为半监督学习聚类过程的聚类核心,所有分段区域的读段深度信号作为聚类特征,通过改进型密度聚类算法对所有分段区域进行聚类分析,所得的聚类分析结果通过聚类标签标记为正常分段区域或异常分段区域;改进型密度聚类算法基于传统密度聚类算法,在原有的邻域半径与最小邻居数两个参数的基础上,引入z-score作为改进型密度聚类算法的第三个约束条件,用于量化某一分段的读段深度信号相对于所有分段区域读段深度信号平均值的偏离程度;在满足邻域半径与最小邻居数的条件下,z-score高于偏离程度阈值的分段区域通过聚类标签标记为异常分段区域,反之标记为正常分段区域,其中,为第个分段区域的z-score,表示第个分段区域的读段深度信号,表示所有分段区域读段深度信号的平均值,表示所有分段区域读段深度信号的标准差;
步骤十,将异常分段区域进行整合与变异类型判定,输出拷贝数变异检测结果。
2.根据权利要求1所述的一种基于半监督学习的拷贝数变异检测方法,其特征在于,在步骤二中,对参考基因组序列中含有N碱基的位置进行识别处理,将参考基因组序列划分为固定大小不重叠的窗口,检测含有N碱基的窗口,将包含N碱基的窗口定义为异常窗口,异常窗口的读段计数标记为特定负值以作区分,读段计数指BAM文件中测序读段出现在参考基因组序列窗口内的次数,用于反映窗口的测序覆盖情况;若窗口的读段计数为负值,则判定窗口为异常窗口并删除;反之判定为正常窗口,记录正常窗口的起始结束位置;对于测序读段的比对信息出现的缺失值,采用零填充的方式替代缺失值。
3.根据权利要求2所述的一种基于半监督学习的拷贝数变异检测方法,其特征在于,在步骤三中,获取测序读段的比对信息,根据参考基因组序列中每个正常窗口的起始结束位置统计正常窗口内每个碱基的读段深度信号,并以正常窗口内所有碱基的读段深度信号平均值,作为正常窗口的读段深度信号,即,其中,表示第个正常窗口的读段深度信号,表示正常窗口的长度,表示第个正常窗口中第个碱基的读段深度信号;
获取测序读段的比对信息,根据参考基因组序列中每个正常窗口的起始结束位置统计正常窗口内每个碱基的映射质量信号,并以正常窗口内所有碱基的映射质量信号平均值,作为正常窗口的映射质量信号,即,其中,表示第个正常窗口的映射质量信号,表示正常窗口的长度,表示第个正常窗口中第个碱基的映射质量信号。
4.根据权利要求3所述的一种基于半监督学习的拷贝数变异检测方法,其特征在于,在步骤四中,对所有正常窗口的读段深度信号进行GC含量偏差矫正,即,其中,表示矫正后第个正常窗口的读段深度信号,表示矫正前第个正常窗口的读段深度信号,表示矫正前所有正常窗口的读段深度信号平均值,表示矫正前与第个正常窗口GC含量高度一致的正常窗口的读段深度信号平均值。
5.根据权利要求4所述的一种基于半监督学习的拷贝数变异检测方法,其特征在于,在步骤五中,利用循环二进制分割算法对所有正常窗口进行分割,将正常窗口分割为具有均一读段深度信号的分段区域;在分割过程中,对于包含间隙的不连续窗口,将不连续窗口按分段区域的固定长度进行切分合并,恢复参考基因组序列坐标的连续性;对于窗口长度超过预设长度阈值的宽窗口,使用固定大小的滑动窗口,从宽窗口的起点开始,按设定步长依次滑动,将宽窗口进一步细分为长度一致的分段区域;
采用基于CIGAR字符串的拆分读段策略来识别拷贝数变异的断点位置,通过比较CIGAR字符串中截断部分与参考基因组序列所匹配区域的相对位置关系进行断点推断,若截断部分位于所匹配区域之前,则断点位置定位于截断部分的末端位置;若截断部分位于所匹配区域之后,则断点位置定位于截断部分的开始位置;即,其中,表示测序读段与参考基因组序列匹配的连续区域,表示CIGAR字符串中的软截断,表示CIGAR字符串中的硬截断,表示测序读段中有个碱基与参考基因组序列匹配,表示测序读段中长度为个碱基未比对到参考基因组序列,但仍保留在测序读段中,表示测序读段中长度为个碱基未比对到参考基因组序列,且在测序读段中被丢弃;和表示截断部分位于所匹配区域之后,和表示截断部分位于所匹配区域之前。
6.根据权利要求5所述的一种基于半监督学习的拷贝数变异检测方法,其特征在于,在步骤六中,对所有分段区域的映射质量信号进行归一化处理,消除由测序深度差异引入的系统性偏差,使映射质量信号更真实地反映映射质量,即,其中,表示归一化处理后第个分段区域的映射质量信号,表示归一化处理前第个分段区域的映射质量信号的平均值,表示归一化处理前第个分段区域的读段深度信号的平均值。
7.根据权利要求6所述的一种基于半监督学习的拷贝数变异检测方法,其特征在于,在步骤七中,采用全变分模型对所有分段区域的读段深度信号进行平滑降噪处理,通过计算原始读段深度信号与平滑降噪后读段深度信号之间的差值构建保真项,用于约束平滑降噪过程,确保在平滑降噪过程中保持原始读段深度信号的主要特征;通过计算读段信号中相邻分段区域之间差值的绝对值之和作为全变分正则项,量化相邻分段区域间读段深度信号的变化,根据相邻分段区域读段深度信号差值大小为不同分段区域分配不同的优化权重;即,其中表示平滑降噪后分段区域的读段深度信号,表示平滑降噪前分段区域的读段深度信号,即原始读段深度信号,表示正则化参数,用于平衡读段深度信号保真度和平滑度,表示分段区域的数量,是全变分模型的保真项,防止平滑降噪后的读段深度信号过度偏离原始读段深度信号,表示第个分段区域与第个分段区域的读段深度信号的偏离程度,表示全变分正则项,惩罚读段深度信号中的剧烈波动,平滑读段深度信号,保留真实的拐点或突变。
8.根据权利要求7所述的一种基于半监督学习的拷贝数变异检测方法,其特征在于,在步骤十中,从聚类分析结果中筛选出的异常分段区域,按起始位置进行排序,若相邻两个异常分段区域之间的间隔很小,则将两个异常分段区域合并,并对读段深度信号、GC含量和映射质量信号各取平均值作为合并后分段区域的新特征,若间隔较大,则将异常分段区域作为独立变异区域记录;对于合并后的分段区域,若异常分段区域的读段深度信号高于所有合并后分段区域读段深度信号的平均值,则将异常分段区域的变异类型定义为重复,否则变异类型定义为缺失;将合并后异常分段区域的起始位置、结束位置、读段深度信号及变异类型整合后,作为检测结果保存至TXT文件中输出。