1.一种基于强化学习的虚假评分检测方法,其特征在于,该方法基于Q网络,包括以下步骤:定义买家评分状态向量st,st由四元组构成,反映了买家的状态特征:其中,表示买家自身的内在属性,表示买家所处外部环境的特征;
在买家评分状态向量st中,
表示买家Bi在他评分时序t的评分间隔时间天,T是平台全局时间戳;表示买家Bi在他评分时序t对卖家Sj的评分;得到如式(8)所示的梯度
2.如权利要求1所述的一种基于强化学习的虚假评分检测方法,其特征在于,迭代k的目标取决于网络权重。
3.如权利要求1所述的一种基于强化学习的虚假评分检测方法,其特征在于,Q网络中,输入为买家评分的状态向量st,中间使用了一个由20个节点组成的全连接隐藏层,输出层使用了Softmax输出at,DQN的目标就是通过agent不断的对环境的感知,按照策略和最优状态‑动作值函数Q*(s,a)来选择动作,最终能够使未来的回报最大化。