1.一种非参数Watson混合模型的基因表达数据聚类方法,其特征在于,包括:S101,获取待聚类的基因数据集;其中,所述基因数据集包括N条基因表达数据向量;
S102,使用非参数Watson混合模型对基因表达数据向量进行建模;
S103,通过变分贝叶斯推断算法估算所述非参数Watson混合模型的模型参数;
S104,根据估算的所述模型参数,判断所述非参数Watson混合模型是否收敛;若否,则返回步骤S103,若是,则执行步骤S105;
S105,根据指示因子的后验概率判断每条基因表达数据向量的所属类别,从而根据所属类别对所述基因表达数据向量进行聚类。
2.根据权利要求1所述的非参数Watson混合模型的基因表达数据聚类方法,其特征在于,所述使用非参数Watson混合模型对基因表达数据向量进行建模,具体包括:对于服从Watson概率分布的D维向量 定义其概率密度函数为:其中, 为含有N条基因表达数据向量的数据集, 为位置参数并满足条件||·||为L2范数的计算;γ为刻度参数并满足条件γ>0,Γ(·)为Gamma函数,M(·)为Kummer函数;
对服从非参数Watson混合模型的每条基因表达数据向量都服从非参数Watson混合模型,其概率密度函数表达式如下:其中,该非参数Watson混合模型共由无穷多个混合组件组成,每个混合组件对应一个Watson概率分布 是第k个混合组件的参数,而πk>0为相应的“混合系数”,并满足条件
为每条基因表达数据向量 指派一个二元隐变量 做为指示因子:当Znk=1时,表明基因表达数据向量 属于第k个类别;否则,Znk=0;其中隐变量 的概率分布为给非参数Watson混合模型的参数 和 指派先验概率分布;其中,采用Watson-Gamma分布作为参数 的联合先验分布:其中,pg(·)为Gamma分布;
获得基于Pitman-Yor过程模型的非参数Waston混合模型的全概率表达式:
3.根据权利要求2所述的非参数Watson混合模型的基因表达数据聚类方法,其特征在于,所述非参数Watson混合模型基于采用Stick-Breaking表示方法的Pitman-Yor过程模型构建而成;在基于Stick-Breaking表示方法的Pitman-Yor过程模型中,混合系数πk的表示如下:服从Beta分布,表达形式如下:
其中pb(·)为Beta分布,ζ为Pitman-Yor过程模型中的折扣参数并满足条件0≤ζ≤1,ξ为密度参数满足条件ξ>-ζ。
4.根据权利要求3所述的非参数Watson混合模型的基因表达数据聚类方法,其特征在于,所述通过变分贝叶斯推断算法估算所述非参数Watson混合模型的模型参数,以及根据估算的所述模型参数,判断所述非参数Watson混合模型是否收敛;
具体包括:
初始化模型参数;其中,包括初始化截断层数K=15;初始化超参数0
根据更新的期望值获取更新后的
获得当前迭代所产生的变分下界;
将当前迭代产生的变分下界与上一次迭代产生的变分下界进行对比以判断所述非参数Waston混合模型是否收敛。
5.根据权利要求4所述的非参数Watson混合模型的基因表达数据聚类方法,其特征在于,利用当前的模型参数更新变分后验以及期望值具体为:定义变分下界为:
L(q)=
其中,K为截断层数,即类别的个数;K值将于收敛时达到最优值;
通过最大化变分下界L(q)来优化所有的变分后验:式中的超参数由公式(4)-(11)计算得出:
中最大的特征值(12)
的特征向量(13)
上式中的期望值的计算由下面公式计算得出:
6.根据权利要求4所述的非参数Watson混合模型的基因表达数据聚类方法,其特征在于,将当前迭代产生的变分下界与上一次迭代产生的变分下界进行对比以判断所述非参数Watson混合模型是否收敛具体为:当前迭代产生的变分下界与上一次迭代产生的变分下界的差是否小于预设阈值;所述预设阈值为0.0001若是,则判定所述非参数Watson混合模型收敛;
若否,则判定所述非参数Watson混合模型不收敛。
7.根据权利要求5所述的非参数Watson混合模型的基因表达数据聚类方法,其特征在于,根据指示因子的后验概率判断每条基因表达数据向量的所属类别,从而根据所属类别对所述基因表达数据向量进行聚类,具体为:获取指示因子的后验概率rnk,rnk表示第n个基因表达数据向量 属于第k个类别的概率;
选取概率最大的类别作为基因表达数据向量 的类别。
8.根据权利要求1至7任意一项所述的非参数Watson混合模型的基因表达数据聚类方法,其特征在于,还包括:对所述基因表达数据向量进行预处理:
去除基因表达数据向量中含有空项的数据;
去除基因表达数据向量中含有特征值为“NAN”的数据;
去除基因表达数据向量中随时间变化较小的数据;
对剩余的基因表达数据向量进行L2范数归一化。
9.一种非参数Watson混合模型的基因表达数据聚类装置,其特征在于,包括:基因数据集获取单元,用于获取待聚类的基因数据集;其中,所述基因数据集包括N条基因表达数据向量;
建模单元,用于使用非参数Watson混合模型对基因表达数据向量进行建模;
模型参数估算单元,用于通过变分贝叶斯推断算法估算所述非参数Watson混合模型的模型参数;
收敛判断单元,用于根据估算的所述模型参数,判断所述非参数Watson混合模型是否收敛;若否,则通知模型参数估算单元,若是,则通知分类单元;
分类单元,用于根据指示因子的后验概率判断每条基因表达数据向量的所属类别,从而根据所属类别对所述基因表达数据向量进行聚类。
10.一种非参数Watson混合模型的基因表达数据聚类设备,其特征在于,包括存储器以及处理器,所述存储器内存储有待聚类的基因数据集以及计算机程序,所述计算机程序能够被所述处理器执行,以实现如权利要求1至8任意一项所述的非参数Watson混合模型的基因表达数据聚类方法。