欢迎来到知嘟嘟! 联系电话:13336804447 卖家免费入驻,海量在线求购! 卖家免费入驻,海量在线求购!
知嘟嘟
我要发布
联系电话:13336804447
知嘟嘟经纪人
收藏
专利号: 2022100285547
申请人: 电子科技大学
专利类型:发明专利
专利状态:已下证
专利领域: 计算;推算;计数
更新日期:2026-07-21
缴费截止日期: 暂无
价格&联系人
年费信息
委托购买

摘要:

权利要求书:

1.一种基于深度强化学习的群体教学推荐系统,其特征在于,包括:用户终端、知识点管理模块,学生数据管理模块,学生模型模块,预训练模块和群体教学推荐模块;

所述用户终端用于教师或学生登录系统,为用户与系统的交互输入和输出终端;

所述知识点管理模块用于教师用户录入知识点数据,并将知识点数据发送至学生模型模块和预训练模块群体教学推荐模块;

所述学生数据管理模块用于学生用户录入学生基础数据,并将学生基础数据发送至学生模型模块;以及用于在课堂中采集学生课堂反馈并发送给群体教学推荐模块;

所述学生模型模块根据预置的创建策略,基于当前录入的知识点数据和学生基础数据创建学生模型并发送至预训练模块;

所述预训练模块以学生模型模块创建的学生模型为学习主体,以知识点管理模块和学生数据管理模块发送的数据为训练数据,对预置的初始群体推荐模型进行训练,得到训练好的群体推荐模型;所述初始群体推荐模型包括第一神经网络模型和第二神经网络模型,所述第一和第二神经网络模型包括输入层、至少一层隐藏层和输出层,其中,输入层为学生课堂反馈数据序列,隐藏层为能够处理序列输入的神经网络,第一神经网络模型的输出层用于输出当前课程的各知识点的推荐度;第二神经网络模型的输出层用于输出当前课堂教学的评价值;

所述群体教学推荐模块调用预训练模块训练好的群体推荐模型,在课程教学过程中结合课程的每一堂课的学生课堂反馈输出教学推荐信息并发送给对应的教师用户;以及保存生数据管理模块采集的学生课堂反馈;在课程教学过程中按照配置的模型更新周期,基于当前周期保存的学生课堂反馈对群体推荐模型进行更新训练;

输出教学推荐信息包括下一堂课的推荐知识点和当前学生课堂反馈数据序列的评价值,其中下一堂课的推荐知识点为推荐度最大的知识点。

2.如权利要求1所述的群体教学推荐系统,其特征在于,所述知识点数据包括:知识点ID,所属课程名称,知识点名称,知识点简介,知识点内容,知识点难度系数,该知识点的前置知识点ID,该知识点配套的课堂测试题目,以及知识点相关资料。

3.如权利要求1所述的群体教学推荐系统,其特征在于,所述学生基础数据包括:学生的学号,姓名,年龄,性别,年纪和学生类型;所述学生课堂反馈包括的数据有:测试题目名称,所属知识点ID,测试题目内容,参与测试学生ID和学生测试结果。

4.如权利要求1所述的群体教学推荐系统,其特征在于,所述学生模型模块使用学生模型模拟真实学生参与预训练模块中的群体推荐模型训练过程,所述学生模型的构建模型为艾宾浩斯记忆模型,半衰期记忆模型或贝叶斯知识追踪模型;

且所述模型的描述包括:

描述虚拟学生当前对于每个知识点的掌握状态;

描述虚拟学生如何通过学习从一个状态转变为另一个状态的过程;

描述学习后的课堂反馈。

5.如权利要求1所述的群体教学推荐系统,其特征在于,所述预训练模块对所述初始群体推荐模型的训练包括:以学生模型模块创建的学生模型作为虚拟学生组成一个班级参与训练;

设定课程要求信息,以及初始所述初始群体推荐模型的网络参数;

以全班的虚拟学生作为环境,初始群体推荐模型的第一神经网络模型和第二神经网络模型作为智能体,采用近端策略优化算法对智能体进行训练,当满足预设的训练结束条件时,保存当前的网络参数,得到训练好的群体推荐模型。

6.如权利要求5所述的群体教学推荐系统,其特征在于,所述课程要求信息包括:课时数,以及课程结束时需要达到的及格率,优秀率和平均分。

7.如权利要求1所述的群体教学推荐系统,其特征在于,采用近端策略优化算法对智能体进行训练包括:步骤S1:记录虚拟学生的初始状态;

步骤S2:判断第一循环次数是否达到预置的第一最大循环次数,若是,则执行步骤S3;

否则,循环执行下列处理:

步骤S201:将虚拟学生状态重置为步骤S1中记录的初始状态;

步骤S202:循环执行步骤S202‑1至步骤S202‑4,直到循环次数达到预置的最大子循环次数;记录每个循环中虚拟学生的学生课堂反馈,第一神经网络模型输出的知识点的推荐度,第二神经网络模型输出的评价值,以及通过所有虚拟学生的课堂反馈根据课程要求信息计算出上次学习的知识点所获得的奖励值;

步骤S202‑1:所有虚拟学生参与课堂学习,虚拟学生给出学生课堂反馈;

步骤S202‑2:将步骤S202‑1给出的学生课堂反馈组成学生课堂反馈数据序列并输入第一神经网络模型,基于其输出得到下一个教学的知识点,即将推荐度最大的知识点作为下一个教学的知识点;

步骤S202‑3:将步骤S202‑1给出的学生课堂反馈组成学生课堂反馈数据序列并输入第二神经网络模型,基于其输出得到该学生课堂反馈数据序列的评价值;

步骤S202‑4:所有虚拟学生学习基于第一神经网络模型得到的下一个教学的知识点;

步骤S3:判断是否达到预置的第二最大循环次数,若是,则结束;否则,循环执行下列处理:步骤S301:对步骤S2收集的学生课堂反馈数据进行采样;

步骤S302:基于采样的数据计算第一目标函数,并根据预置的随机梯度上升算法调整第一神经网络模型的网络参数,所述第一目标函数用于表征第一神经网络模型的输出损失;

步骤S303:基于采样的数据计算第二目标函数,并根据预置的随机梯度上升算法调整第二神经网络模型的网络参数,所述第二目标函数用于表征第二神经网络模型的输出损失。

8.如权利要求7所述的群体教学推荐系统,其特征在于,所述第一目标函为:其中,

θk+1表示第一神经网络在第k+1次训练时的网络参数;

Dk表示采样的数据集;

T表示课程时长;

τ表示一组教学路径下的采样数据;

πθ(at|st)表示网络参数为θ时,在t时刻,输入的学生课堂反馈为st,输出为at的概率;

函数clip()的输入参数包括rt(θ)和表示边界值∈,若rt(θ)小于等于1‑∈,则clip()=1‑∈;若rt(θ)大于等于1+∈,则clip()=1+∈,若1‑∈<rt(θ)<1+∈,则clip()=rt(θ);其中,表示t时刻行为的优势值,其计算公式为:

ξt=rt+γV(st+1)‑V(st);

其中,ξt表示t时刻的中间参数,γ表示预置的折扣因子,rt表示t时刻获得的奖励值,V(st)表示t时刻第二神经网络模型输出的评论值;

所述第二目标函数分别为:

其中,

表示第二神经网络模型在第k+1次训练时的网络参数;

表示基于当前网络参数 第二神经网络模型在在t时刻输出的评论值。

9.如权利要求1所述的群体教学推荐系统,其特征在于,所述群体教学推荐模块的推荐与训练处理为:初始化群体推荐模型,使用预训练模块训练完成后保存的网络参数进行初始化;

当教师开始教学后,基于学生通过用户终端在每堂课程中的学生课堂反馈组成学生课堂反馈数据序列,并分别输入群体推荐模型的第一和第二神经网络模型;基于其输出得到下一课堂的推荐教学知识点,以及对应的评价值,并保存所述学生课堂反馈数据序列、推荐教学知识点和评价值;并将下一课堂的推荐教学知识点发送给对应的教师;

在课后,基于当前更新周期保存的历史数据对群体推荐模型进行更新训练,所述历史数据包括多组数据记录,每一组数据包括学生课堂反馈数据序列、推荐教学知识点和评价值。

10.如权利要求1所述的群体教学推荐系统,其特征在于,第一和第二神经网络模型隐藏层为长短期记忆循环神经网络。