1.基于增强学习的信息中心网络兴趣包转发方法,包括探索阶段和利用阶段,其特征在于:具体步骤为:步骤一、探索阶段的具体步骤为:
(1)智能体收到n个兴趣包时,先查询转发信息表,在转发信息表中添加一个Q值,Q值用于计算前缀端口对,并根据最长前缀匹配来获取候选端口列表,最后通过候选端口转发兴趣包;
(2)数据包中添加离开时间和最小Q值两个属性,智能体收到数据包时,通过数据包中所携带的信息计算数据包端口数据流的Q值,并将Q值添加到转发信息表中,其中,Q值的计算公式为公式四:式中,ω(t)为学习率, 为智能体v到i的时间, 为从智能体v到d端的最短时间;
(3)智能体转发N1个兴趣包后,结束当前的探索阶段,开始进入利用阶段;步骤二、利用阶段的具体步骤为:a.智能体转发兴趣包时依据概率选择转发最佳端口,概率的计算公式为公式二:式中, 为在端口j上前缀f的兴趣包的转发概率, 为在端口j上前缀f的数据流的Q值,k为常量,k>0;
b.当满足公式五的条件或是发送了N2个兴趣包时,结束利用阶段,重新开始进入探索阶段;
c.智能体代理接收到m个数据包时,根据包所携带的信息计算Q值,Q值的计算公式为公式四,并同时更新FIB、Data包中的Q值。
2.根据权利要求1所述的基于增强学习的信息中心网络兴趣包转发方法,其特征在于:步骤一中还在Q值的学习算法中加入具有启发知识的函数H:S×A→R来影响学习过程中智能体动作选择。
3.根据权利要求2所述的基于增强学习的信息中心网络兴趣包转发方法,其特征在于:设S为智能体代理有状态集合,A为动作集合,启发式函数的在t时刻的动作选择规则如公式一所示:式中,δ为常量,S和A为有限集,s∈S,a∈A,st为在t时刻的状态,at为在t时刻的动作;
在执行选择动作的同时观察下一个状态并接收强化信息r(s,a),Q值的更新公式如下所示:式中,γ为常量且0≤γ<1,s和a为第n次循环中更新的状态和动作,kn(s,a)是状态s和动作a在这n次循环内被访问的总次数。
4.根据权利要求1所述的基于增强学习的信息中心网络兴趣包转发方法,其特征在于:所述转发信息表包括名字前缀、陈旧时间、端口号和Q值。
5.根据权利要求1所述的基于增强学习的信息中心网络兴趣包转发方法,其特征在于:数据表信息包括数据、元消息、数据内容、数据签名、离开时间和最小Q值。