大数据深度学习|计算机毕设项目|计算机毕设答辩|基于超图建模的英语试题生成系统设计

标题:基于超图建模的英语试题生成系统设计
文档介绍:
第一章 绪论
1.1 研究背景及意义
在教育数字化转型的大背景下,英语教学对试题资源的需求日益增长,传统人工命题模式依赖教师的个人经验,不仅耗时耗力,还难以保证试题的知识点覆盖率、难度梯度与题型多样性,难以满足大规模、个性化教学的需求。随着自然语言处理技术与知识图谱理论的不断发展,自动试题生成技术成为解决这一问题的重要途径。英语试题的生成本质上是一个多约束条件下的文本生成任务,需要同时兼顾语料语义、知识点关联、题型规范与难度适配,而传统的文本生成模型往往难以有效处理试题生成中的多维度关联约束。超图理论作为普通图的扩展,能够通过超边连接多个节点,自然适配英语语料中实体、句子、知识点等多元素之间的复杂关联,为试题生成任务提供了结构化的知识约束。基于此,本文设计并实现了基于超图建模的英语试题生成系统,通过构建英语语料超图,将语料中的语义关系与知识点关联转化为结构化的超图数据,为预训练语言模型提供清晰的知识引导,从而提升生成试题的质量与适配性。本研究不仅能够为英语教学提供高效的试题生成工具,减轻教师命题负担,还能为多约束条件下的文本生成任务提供一种基于超图建模的新思路,具有一定的理论与实践意义。
1.2 国内外研究现状
自动试题生成技术旨在从文本或知识库中自动产生可用于教学评估的练习题,近年来随着自然语言处理和深度学习的快速发展,该领域的研究已从早期的模板匹配和规则驱动阶段,演进至基于预训练语言模型和大语言模型的智能生成阶段,形成了丰富的研究成果。在国际学术界,Saleem等人[1]提出了一个融合Transformer模型、潜在狄利克雷分配以及情感分析和关键词抽取的统一自动试题生成框架,并开发了QuestifyTheEduBot教育机器人系统,显著降低了人工干预的程度。Burke[2]则针对完全自动化命题可能引入事实错误和难度偏差的问题,提出了一种人机协同的混合框架,指导教师与大型语言模型通过参数定义、审查与迭代优化的交互方式,为大学课程生成了平行试卷变体,验证了人在回路中自动命题的有效性。Sairaj与Balasundaram[3]关注自动生成试题中主题重复的问题,设计了结合模糊本体映射、集成学习和检索增强生成的混合方法,利用T5预训练模型有效减少了生成试题的冗余度并提升了实体的多样性。Kıyak与Kononowicz[4]在医学教育领域提出了混合自动题目生成方法,利用人工智能生成题目模板,再由领域专家审核与修正,兼顾了模板法的结构严谨性和AI模型的生成效率。此外,Daupare与Jēkabsons[5]对24种不同的大语言模型在拉脱维亚语多选题生成任务上进行了系统的基准测试,揭示了不同模型在低资源语言处理能力上的显著差异,为多语言试题生成提供了实证依据。
在国内研究方面,韩雨婷等人[6,7]系统梳理了自动题目生成从规则驱动方法到大语言模型的演进历程,指出传统基于预定义模板的方法灵活性受限、维护成本高,而大语言模型驱动的生成方式虽然显著提升了生成效率与内容多样性,但仍面临专业知识表达准确性不足、文化公平性与构念效度难以保证、多模态内容生成薄弱以及智能化质量控制缺失等现实挑战,并提出了检索增强生成、多阶段心理测量学验证以及用户友好型系统开发等应对策略。陈大建与胡杰辉[8]专门针对英语阅读理解试题的自动化命题开展研究,构建了专用于语言测试任务的大语言模型,通过实证对比证明了该模型在试题微技能分布和可用性评分上优于通用模型GPT‑4,且所生成试题的信度和拟合度接近大学英语六级真题水平,探索了大语言模型在外语教学与测评中的创新应用路径。王鸿滨与吕海辉[9]探究了大语言模型在中文阅读测试题自动生成中的应用,从语言流畅度、言语准确性、问题复杂度、答案存在性等六个维度进行人工评估,结果表明大语言模型生成的题目与汉语水平考试真题无显著差异,验证了该技术在中文国际教育领域的可行性。廖姝[10]探索了基于大语言模型的人格测验题目自动生成及质量评价的完整自动化流程,采用少样本微调和提示词工程技术,验证了基于大语言模型的虚拟被试在复现人类被试人格特质水平方面的有效性,为心理测量领域的自动化命题提供了新思路。
在基于深度学习和图结构的方法上,粟武[11]研究了异构图神经网络在自动文本摘要中的应用,设计了多粒度自适应抽取式模型,通过自适应深度与广度机制以及边权重的图注意力网络,有效捕获了不同粒度语义节点之间的复杂关系,这种图结构建模思想与超图的高阶关联建模具有相通之处。王寒[12]聚焦数智化教学场景的多目标测验生成问题,设计了考虑带权知识点覆盖和认知层级分布的测验生成算法,结合动态规划与遗传算法提升了测验生成效率,并研究了适应学生能力变化的题目推荐策略,为差异化教学提供了技术支持。杨生文[13]针对阅读理解题目生成中生成问题包含答案、干扰项迷惑性不足等缺陷,提出了基于答案抽取的问题生成模型和基于干扰注意力机制的多项选择生成模型,利用预训练模型UniLM和BERT增强了上下文特征捕获能力,提高了生成问题的准确度和干扰项的丰富性。肖文艳[14]从语料库语言学视角出发,构建了英文网页语料库,对中小学英语教材词汇进行了量化分析,并引入句子难度度量方法,利用机器学习技术初步实现了面向不同语言学习者的词汇多项选择题自动生成。郭凯[15]基于Java语言和MVC框架,设计了随机题目试卷生成系统,按照题目难度和章节范围从题库中抽取题目组合成试卷,在提升出卷效率方面发挥了作用。
1.3 主要研究内容
本课题围绕基于超图建模的英语试题生成方法,重点开展以下四个方面的研究工作。
第一,英语语料的深度解析与超图构建策略研究。该部分研究如何将非结构化的英文文本转化为具备高阶关联特性的超图结构。具体包括从文本中提取关键词、命名实体、概念属性及句子逻辑块,并将其映射为超图中的多粒度节点;针对英语试题生成中“多对一”的逻辑特性,研究基于语义关联、共现关系以及逻辑推理链的超边构建方法,通过超边连接多个节点以表征知识点间的复杂约束;设计超图的关联矩阵表示方法,并通过注意力机制动态调整超边与节点间的连接权重,突出核心考点。
第二,基于超图神经网络的语义特征增强研究。在构建超图的基础上,利用超图卷积提取深层语义信息。具体包括设计适用于试题生成任务的超图卷积算子,实现节点特征在高阶邻域内的聚合与更新;研究如何平衡局部语义与全局逻辑之间的关系,将超图提取的高阶特征与预训练语言模型的序列特征进行深度融合,从而获得更丰富的试题生成条件。
第三,基于超图引导的英语试题生成模型架构实现。在特征增强的基础上,构建以超图特征为引导的条件扩散模型,使用户在生成试题的过程中能够实时回溯超图中定义的逻辑路径,减少生成内容的幻觉现象。同时,引入知识点分类和答案支撑句识别等辅助任务,与试题生成主任务共同训练,提升生成试题与目标知识点的契合度。
第四,英语试题生成原型系统的设计与实现。基于上述算法,开发一套前后端分离的原型系统,后端提供超图构建、模型推理和数据持久化等核心服务,前端实现语料上传、试题生成、超图可视化、人工修正和专家评分等交互功能,并通过自动评估指标和消融实验验证超图建模方法的有效性。
1.4 论文结构安排
本文共分为六章,各章节的主要内容安排如下。
第一章为绪论,阐述了研究背景与意义,梳理了相关技术的国内外研究现状,明确了本文的研究内容与主要工作,并给出了论文章节安排。
第二章为相关技术与理论基础,详细介绍了超图理论、预训练语言模型、文本生成与评估指标等关键技术,为后续系统设计与模型构建提供理论支撑。
第三章为系统总体设计,进行了系统需求分析,给出了系统的整体架构设计,划分了系统的核心功能模块,并说明了系统的业务流程。
第四章为超图建模与试题生成模型设计,详细阐述了英语语料超图的构建方法,包括节点与超边的设计、特征提取与编码,介绍了试题生成模型的整体结构与核心模块实现。
第五章为系统实现与实验分析,介绍了系统的开发环境与技术栈,说明了前后端核心功能的实现细节,通过实验对模型训练过程与生成试题的质量进行了评估与分析。
第六章为总结与展望,对本文的研究工作进行了总结,指出了当前研究存在的不足,并对未来的研究方向进行了展望。
第二章 相关技术与理论基础
英语试题自动生成涉及从非结构化文本中提取知识、建模高阶依赖、生成自然语言多个环节,基于此选择了超图的构建方法、超图神经网络的传播机制、多尺度特征融合与路径条件提取、条件潜在扩散模型的生成原理以及多任务学习的优化策略作为核心技术。这些技术共同构成了从英文语料输入到英语试题输出的完整处理链路,其中超图负责将文本中的实体、句子和概念组织成高阶关联结构,超图神经网络实现节点特征的高阶传播与增强,扩散模型在超图特征的引导下完成试题的生成,多任务学习则通过辅助分类任务提供额外的监督信号。
2.1 超图构建方法
超图是对传统图结构的广义扩展。在普通图中,一条边只能连接两个顶点,表达的是二元关系。而在超图中,一条超边可以连接任意多个顶点,因此能够自然地刻画“多个知识点共同支撑一道试题”的高阶逻辑关联。这种能力对于英语阅读理解等需要跨句子、跨段落推理的任务尤其重要,因为一道综合性试题往往依赖于多个实体、多个概念以及多条证据句的共同作用。
超图形式化定义为 G=(V,E)
,其中 V={v1,v2,…,v∣V∣}
是节点集合,E={e1,e2,…,e∣E∣}
是超边集合。每个超边 ej
是节点集合的一个非空子集,且通常要求 ∣ej∣≥2
,即至少连接两个节点。
将非结构化的英文文本转化为超图需要完成两个核心步骤:多粒度节点抽取和高阶超边构建。
2.1.1 多粒度节点抽取
节点是超图的基本单元,其类型和粒度直接影响后续建模的有效性。为了充分覆盖英语试题生成所需的语义层次,系统从文本中抽取以下四类节点。
第一类是问题节点。该节点代表最终需要生成的试题所对应的核心语义锚点,通常只有一个,在超图中作为超边连接的枢纽。第二类是句子节点。每个输入文本中的独立分句被映射为一个句子节点,这些节点保留了原始语序和段落边界信息。第三类是实体节点。通过命名实体识别技术提取文本中的人名、地名、机构名、专有名词等,每个识别出的实体成为独立的实体节点。第四类是概念节点。通过词性过滤和关键词提取获得,代表抽象的知识属性或逻辑范畴,如“因果关系”“对比差异”“时间顺序”等。这四类节点共同覆盖了从词法到篇章的不同语义粒度。
2.1.2 高阶超边构建
超边的构建是超图区别于普通图的关键。针对英语试题生成中“多对一”的逻辑特征,系统设计了三种主要类型的超边。
第一种是问题‑实体超边。该类型超边将问题节点与一个或多个实体节点连接起来,表示一道试题可以同时涉及多个关键实体。这些实体之间往往存在比较、因果、并列或时间顺序等语义关系,例如在一个关于历史事件的段落中,人物、地点和时间构成了一个知识三元组。这种超边的权重通常设置为1.0加上与实体数量成正比的增量,即超边包含的实体越多,权重越高。
第二种是实体‑支持句超边。该类型超边连接一个句子节点以及该句子中出现的所有实体节点。它刻画了句子作为证据载体与实体知识之间的归属关系:一个句子可能包含多个实体,而一个实体也可能出现在多个句子中。这种多对多的关系通过超边可以一次性完整表达,避免了普通图中需要多条边分别连接的冗余。该超边的初始权重根据句子是否被标注为支持句而动态调整,支持句对应的超边权重更高。
第三种是桥接路径超边。当一道试题需要跨越多句推理时,仅依靠单个句子内的实体‑支持句超边可能不足以覆盖完整的推理链。桥接路径超边将问题节点与所有参与推理的支持句节点连接起来,形成一个覆盖整个逻辑链的高阶结构。根据试题类型的不同,该超边可进一步区分为桥接型和比较型,以适应不同题型的逻辑特征。桥接路径超边的权重最高,通常在1.4到1.8之间,以体现其在整个超图中的核心地位。
2.1.3 关联矩阵与动态权重
超图构建完成后,需要用矩阵形式记录节点与超边之间的归属关系。定义关联矩阵 H∈R∣V∣×∣E∣
,其元素 Hij
表示节点 vi
是否属于超边 ej
。若属于,则 Hij=1
,否则为0。同时,定义节点度矩阵 Dv
和超边度矩阵 De
分别为对角矩阵,对角元素 Dv)iijHij
表示节点 vi
参与的超边总数,De)jjiHij
表示超边 ej
包含的节点总数。
除了二元归属关系,系统还为每个节点计算一个动态分数,用于量化节点在试题生成中的重要性。节点分数综合考虑了节点类型、元数据和语义特征。例如,实体节点的基准分数为0.9,句子节点的基准分数为0.8,在此基础上根据实体出现的文档次数、句子中关键词的数量等因素进行微调。这些节点分数在后续的图融合模块中用于指导注意力池化,使模型更关注高贡献度的节点。
2.2 超图神经网络
超图神经网络是将卷积操作推广到超图结构的一类图网络模型。其核心思想是通过节点‑超边‑节点的两阶段消息传递,实现高阶邻域内的特征聚合与更新。这种传播机制能够使原本在文本中距离较远但在逻辑上密切相关的实体或句子在超图中实现语义交互。
设第 l
层的节点特征矩阵为 Xl∈R∣V∣×d
,其中 d
是特征维度。超图卷积层的计算过程可以分解为四个子步骤。
第一步,将节点特征聚合到超边上,得到超边特征矩阵 E=H⊤Xl
。这一步通过关联矩阵的转置将每个超边所包含的节点特征求和,形成超边的初始表示。
第二步,对超边特征进行度归一化,即左乘超边度矩阵的逆 De-1
。归一化后的超边特征为 Enorm=De-1E
。这一操作使得每个超边的特征贡献与其包含的节点数量成反比,避免节点过多导致特征值过大。
第三步,将归一化后的超边特征通过可学习的权重矩阵 Wl
进行线性变换,得到变换后的超边特征 Eproj=EnormWl
。这步为超边特征引入了非线性表达能力。
第四步,将超边特征投影回节点空间,并进行节点度归一化:Xaggr=Dv-1/2HEprojDv-1/2
。其中左乘和右乘节点度矩阵的平方根保证了聚合后的节点特征在数值范围上的稳定性。
最终,结合残差连接和非线性激活函数,更新后的节点特征为:
Xl1=LayerNormXlσXaggr#2.1![]()
其中 σ
是高斯误差线性单元激活函数,LayerNorm表示层归一化。残差连接避免了深层网络的梯度消失问题,层归一化则提高了训练稳定性。通过堆叠两层超图卷积,每个节点的最终表示融合了其两跳内的所有超边信息,实现了高阶语义的传播与增强。
2.3 多尺度特征融合与路径条件提取
在超图卷积完成节点特征的高阶传播后,还需要将原始的文本编码特征与超图增强后的特征进行融合,同时从超图中提取与试题推理密切相关的路径信息。
多尺度特征融合采用门控机制。记文本编码器输出的原始节点特征为 Xtext
,超图卷积输出的增强特征为 Xgraph
,两者维度相同。首先沿特征维度拼接得到 C=[Xtext;Xgraph]∈R∣V∣×2d
。然后通过一个线性层和Sigmoid函数计算融合门 g=σ(WgC)
,门值范围在0到1之间。融合后的节点特征为 Z=g⊙Xtext+(1-g)⊙Xgraph
,其中 ⊙
表示逐元素乘法。这种自适应门控机制使模型可以根据上下文自动决定更依赖局部词义还是全局图结构。
路径条件提取用于定位关键证据链。在数据集中,部分句子被标注为支持句,即包含答案或提供推理线索的句子。将这些支持句的节点索引集合称为支撑路径。路径条件器从融合特征 Z
中抽取支撑路径对应的节点特征,计算它们的均值作为路径嵌入 zpath
。若没有标注支持句,则改用所有节点特征的均值。该嵌入经过两层多层感知机进行非线性变换后,作为扩散模型的条件输入之一。
2.4 条件潜在扩散模型
扩散模型是一类通过逐步去噪从纯高斯噪声中生成目标数据样本的概率模型。为了降低计算代价,系统采用潜在扩散模型架构,在低维潜在空间中进行扩散操作。
设目标问题嵌入为x0∼q(x0)
,其中q
是真实的问题分布。前向加噪过程定义一个马尔可夫链,从x0
开始,在每个时间步t
向样本中添加少量高斯噪声。经过T
步后,xT
近似服从标准高斯分布N(0,I)
。该过程可以封闭形式表示为:
qxtx0=Nxt;αtx0,(1-αt)I#2.2![]()
其中αt=i=1t(1-βi)
,β1,β2,…,βT
是预先定义的方差调度序列。通常设定βstart=10-4
线性增加到βend=0.02
,总时间步数T=50
。
逆向去噪过程的目标是从噪声xT
逐步恢复出x0
。该过程需要学习一个参数化模型pθ(xt-1∣xt,Fhyper)
来近似真实的逆条件分布,其中 Fhyper
表示从超图中提取的条件特征,包括全局图嵌入和路径嵌入。该条件逆分布被建模为高斯分布:
pθxt-1xt,Fhyper=Nxt-1;μθ(xt,t,Fhyper),σt2I#2.3![]()
均值的预测可以等价地转化为预测每一步所添加的噪声。训练一个U型网络ϵθ(xt,t,Fhyper)
来估计噪声ϵ
,训练阶段的简化损失函数为:
Ldiff=Ex0,ϵ,t∥ϵ-ϵθ(xt,t,Fhyper)∥2#2.4![]()
推理阶段,从标准高斯噪声xT
出发,按照逆向递推公式迭代 T
步,每一步利用U型网络预测噪声并更新xt-1
,最终得到生成的问题嵌入,再通过模板化生成器转化为自然语言的英语试题。
2.5 多任务学习
在试题生成主任务之外引入辅助任务能够提供更强的监督信号,帮助模型聚焦于文本中的关键知识点。系统设计了两个辅助任务:知识节点分类和支持句分类。
知识节点分类任务判断超图中的每一个节点是否属于关键知识。对于实体节点和概念节点,若该节点在试题答案或推理过程中起到核心作用,则将其标记为正类;否则为负类。支持句分类任务判断超图中的句子节点是否为答案的证据句。这两项任务都是二分类问题,训练数据可以直接从数据集的标注中获得。
在模型架构中,这两个辅助任务共享同一个多任务头。多任务头由两个独立的线性分类器组成,分别叠加在多尺度融合后的节点特征Z
之上。知识节点头的输出为yknowledge=WkZ+bk
,支持句头的输出为ysupport=WsZ+bs
。训练时,使用带正类权重的二分类交叉熵损失,以缓解正负样本不平衡的问题。记知识节点分类损失为 Lknowledge
,支持句分类损失为 Lsupport
,则总损失函数为扩散损失与两个辅助损失加权之和:
Ltotal=Ldiff+λkLknowledge+λsLsupport#2.5![]()
其中权重系数 λk=0.5
,λs=0.75
。通过多任务协同优化,模型在训练时同时学会了从噪声中恢复试题的语义分布、识别文本中的关键实体以及定位证据句子,从而显著提升了生成试题的知识相关性和逻辑严谨性。
第三章 系统设计
3.1 需求分析
3.1.1 功能需求分析
基于超图建模的英语试题生成系统旨在为用户提供从英文语料输入到试题生成、评估、修正及评分的一站式服务。根据项目实际实现的功能,系统需要满足以下功能需求。
第一,语料管理功能。系统应支持用户上传英文文本文件,包括常见的TXT格式文件,并对上传的语料进行存储和元数据记录。用户需要能够查看已上传语料的列表,包括标题、文件名、句子数量和处理状态等信息,并能够对任意已上传语料进行预览。
第二,超图构建与展示功能。系统应根据上传的英文文本或数据集中已有的样本自动构建超图结构,包括文本预处理、多粒度节点抽取、高阶超边生成和关联矩阵计算。用户需要通过可视化界面查看超图的节点与边结构,理解模型的知识推理过程,并支持节点详情的查看。
第三,英语试题生成功能。系统应加载预训练的深度学习模型,对给定样本或用户上传的语料预测知识节点和支持句的得分,并通过模板化方法生成自然语言的英语试题。用户应能够触发试题生成操作,并在界面上查看生成的试题内容、参考题目、答案以及相关的关键实体和支撑句。
第四,实验记录与评估功能。系统应存储每个样本的预测结果,包括生成试题、参考试题、答案、问题类型等,并提供分页查询和按条件筛选的功能。同时,系统应能够自动计算BLEU、ROUGE-L、语义一致性和可解答性等评估指标,生成评估报告,并支持基线对比和消融实验。
第五,人工修正与专家评分功能。系统应允许用户对生成的试题进行人工修正,记录原始试题、修正后的试题以及评分和备注,并支持修正记录的查询和删除。专家用户应对生成试题从语义一致性、逻辑严密性、可解答性和流畅性四个维度进行评分,系统自动计算总体评分并存储评分记录,同时提供评分汇总统计功能。
第六,训练监控与结果展示功能。系统应展示模型训练过程中的损失曲线、最佳轮次、各类F1值等指标,并展示评估报告中的核心指标如BLEU和ROUGE-L等,帮助用户了解模型的训练状态和生成质量。
3.1.2 非功能需求分析
除了功能需求外,系统还需满足以下非功能需求。
可用性方面,前端界面应提供直观的操作入口和清晰的信息反馈,用户在语料上传、试题生成、修正评分等操作后应及时看到成功或失败的提示。超图可视化画布应支持缩放、拖拽等交互操作,节点和连线的布局应清晰可辨。
可扩展性方面,系统应采用模块化设计,数据管理、超图构建、模型推理、评估分析和用户交互各模块之间通过清晰的接口通信,便于后续增加新的试题类型、替换不同的预训练模型或增加更多的评估指标。
数据安全性方面,用户上传的语料文件应存储在服务器指定目录,数据库中的用户修正和评分记录应关联用户标识,防止未授权的修改。系统应提供基本的登录认证机制,确保只有认证用户才能访问系统功能。
3.2 系统架构设计
系统采用前后端分离的分层架构,自顶向下划分为表现层、业务逻辑层、数据层和算法层。表现层基于Vue 3框架构建Web前端页面,负责用户交互和数据展示。业务逻辑层基于FastAPI框架提供RESTful API接口,包括超图构建服务、预测推理服务和评估与报告服务。数据层包括SQLite数据库和文件系统,数据库存储实验报告、预测记录、修正记录、专家评分和语料元数据等结构化信息,文件系统存储数据集、模型检查点、训练日志和预测结果JSON文件。算法层以PyTorch为核心,封装了超图神经网络、条件扩散模型和多任务学习头的具体实现。各层之间通过HTTP请求和本地函数调用进行通信,整体架构如图3.1所示。
图3.1 系统架构图
3.3 功能模块设计
系统依据实际业务需求划分为五大功能模块,分别为数据管理模块、超图构建模块、模型推理模块、评估分析模块和用户交互模块。各模块相互独立又协同配合,共同完成从语料输入到试题输出的完整流程,为英语试题的自动化生成与质量管控提供支撑。
数据管理模块负责系统内各类文本数据的加载、处理与维护,主要实现数据集的读取与解析、用户自定义语料的上传与存储、数据样本的采样与划分等功能。模块能够对语料文本进行规范化预处理,完成分句、关键词提取与实体识别等操作,为后续的超图构建与模型推理提供格式统一的数据来源,同时支持对语料信息与样本信息的检索与预览,保证数据流转过程的透明与可控。
超图构建模块依据预处理后的文本信息完成知识超图的自动构建,是系统实现高阶逻辑建模的核心部分。模块按照设定的规则完成多粒度节点抽取,将文本内容转化为实体节点、句子节点、概念节点与问题节点,再根据语义关联与推理逻辑生成相应的超边结构,计算超图的关联矩阵与节点权重。模块支持将构建完成的超图以可视化形式进行展示,便于直观理解文本内部的知识关联与推理路径。
模型推理模块集成训练完成的深度学习模型,实现英语试题的自动化生成。模块加载训练好的模型检查点,对输入样本进行特征编码与超图卷积计算,通过多尺度特征融合与条件扩散生成,得到试题的隐空间表示,再经过自然语言映射生成结构完整、语义通顺的英语试题。模块能够根据不同的语料内容与推理需求,生成对应题型与难度的试题,保证生成结果与知识约束的高度匹配。
评估分析模块实现对生成试题的质量评价与模型性能监控,支持自动评估与人工评估两种方式。自动评估通过计算 BLEU、ROUGE-L、语义一致性与可解答性等指标,对生成试题进行量化评价,并支持基线模型对比与消融实验结果的统计。模块还能够展示模型训练过程中的损失变化与各类评价指标,直观反映模型的收敛状态与泛化能力,为模型优化提供数据支撑。
用户交互模块为使用者提供可视化操作界面,实现系统功能的便捷调用。模块涵盖语料上传、超图查看、试题生成、结果展示、人工修正与专家评分等功能入口,用户可通过界面完成全流程操作。针对生成的试题,用户可进行内容修正、多维评分与记录保存,形成生成、评估、修正、优化的闭环机制,进一步提升试题的实际使用价值。功能模块图如图3.2所示。
图3.2 功能模块图
3.4 数据库设计
系统使用SQLite数据库实现各类业务数据的持久化存储与管理,结合试题生成、人工修正、专家评分与实验管理等实际需求,设计结构规范且关联清晰的数据表结构。数据库设计遵循低冗余、高可扩展与易维护的原则,将不同类型的数据进行分类存储,通过合理的关联关系保证数据一致性与查询效率。
系统使用的数据库主要存储五部分核心信息,分别为语料记录信息、预测记录信息、人工修正记录信息、专家评分记录信息以及实验报告信息。语料记录用于保存用户上传文本的基本信息与处理状态,包含语料唯一标识、标题、原始文件名称、文本存储路径、句子数量与上传时间等内容,为语料管理与后续超图构建提供基础数据支撑。预测记录用于保存模型生成试题的完整结果,包含样本标识、数据集名称、试题类型、参考答案、参考题目、生成试题文本与结果存储路径等信息,是试题展示与质量评估的核心数据来源。下面分别介绍每张表的字段结构。
预测记录表用于存储模型对每个样本生成的英语试题信息。每条记录对应一个样本的一次预测结果,包含样本的唯一标识、所属数据集、问题类型、参考答案、参考问题、模型生成的问题、输出文件路径、创建时间以及扩展信息。其中扩展信息字段以JSON格式保存超图摘要和模型配置等附加数据。该表的样本标识是主键,被修正记录表和专家评分记录表引用。
表3-1 预测记录表(prediction_records)
|
字段名 |
类型 |
主键 |
外键 |
是否为空 |
说明 |
|
sample_id |
TEXT |
是 |
否 |
否 |
样本的唯一标识 |
|
dataset_name |
TEXT |
否 |
否 |
否 |
来源数据集的名称 |
|
question_type |
TEXT |
否 |
否 |
否 |
题型,取值为bridge或comparison |
|
answer |
TEXT |
否 |
否 |
否 |
样本对应的正确答案 |
|
reference_question |
TEXT |
否 |
否 |
是 |
数据集中标注的原始问题 |
|
generated_question |
TEXT |
否 |
否 |
否 |
模型自动生成的试题文本 |
|
output_path |
TEXT |
否 |
否 |
否 |
预测结果JSON文件的存储路径 |
|
created_at |
TEXT |
否 |
否 |
否 |
预测记录生成的时间戳 |
|
payload_json |
TEXT |
否 |
否 |
是 |
JSON格式的扩展信息 |
修正记录表用于存储用户对生成试题的人工修正记录。每条记录对应一次修正操作,包含被修正样本的标识、原始问题、修正后的问题、参考问题、答案、人工评分、备注以及操作人信息。该表通过样本标识与预测记录表建立多对一的拥有关系,即一个预测样本可以拥有多条修正记录。
表3-2 修正记录表(revision_records)
|
字段名 |
类型 |
主键 |
外键 |
是否为空 |
说明 |
|
revision_id |
INTEGER |
是 |
否 |
否 |
修正记录的唯一编号,自动递增 |
|
sample_id |
TEXT |
否 |
是 |
否 |
被修正样本的标识,引用预测记录表 |
|
dataset_name |
TEXT |
否 |
否 |
否 |
样本所属数据集的名称 |
|
original_question |
TEXT |
否 |
否 |
否 |
模型原始生成的题目文本 |
|
revised_question |
TEXT |
否 |
否 |
否 |
用户修改后的题目文本 |
|
reference_question |
TEXT |
否 |
否 |
是 |
数据集中标注的参考问题 |
|
answer |
TEXT |
否 |
否 |
是 |
样本对应的答案 |
|
score |
REAL |
否 |
否 |
是 |
用户对修正后题目的评分,0到10 |
|
notes |
TEXT |
否 |
否 |
是 |
用户填写的修正说明 |
|
operator |
TEXT |
否 |
否 |
否 |
执行修正操作的用户名 |
|
created_at |
TEXT |
否 |
否 |
否 |
修正记录的创建时间戳 |
专家评分记录表用于存储专家对生成试题的多维度质量评估。每条记录包含对同一个生成试题在语义一致性、逻辑严密性、可解答性和流畅性四个维度的评分,每个维度0到10分,系统自动计算四个维度的平均值作为总体评分。该表通过样本标识与预测记录表建立多对一的拥有关系,支持对一个样本的多轮独立评分。
表3-3 专家评分记录表(expert_rating_records)
|
字段名 |
类型 |
主键 |
外键 |
是否为空 |
说明 |
|
rating_id |
INTEGER |
是 |
否 |
否 |
评分记录的唯一编号,自动递增 |
|
sample_id |
TEXT |
否 |
是 |
否 |
被评分样本的标识,引用预测记录表 |
|
dataset_name |
TEXT |
否 |
否 |
否 |
样本所属数据集的名称 |
|
generated_question |
TEXT |
否 |
否 |
否 |
模型生成的题目文本 |
|
reference_question |
TEXT |
否 |
否 |
是 |
数据集中标注的参考问题 |
|
semantic_score |
REAL |
否 |
否 |
否 |
语义一致性得分 |
|
logicality_score |
REAL |
否 |
否 |
否 |
逻辑严密性得分 |
|
answerability_score |
REAL |
否 |
否 |
否 |
可解答性得分 |
|
fluency_score |
REAL |
否 |
否 |
否 |
流畅性得分 |
|
overall_score |
REAL |
否 |
否 |
否 |
四个维度评分的平均值 |
|
notes |
TEXT |
否 |
否 |
是 |
评审人填写的补充说明 |
|
evaluator |
TEXT |
否 |
否 |
否 |
执行评分操作的评审人标识 |
|
created_at |
TEXT |
否 |
否 |
否 |
评分记录的创建时间戳 |
语料记录表用于存储用户上传的自定义英文文本语料的元数据。每条记录对应一个上传的文本文件,包含语料的唯一标识、用户指定的标题、原始文件名、原始文件在服务器上的存储路径、预处理后的JSON文件路径、系统自动生成的问题和答案、处理状态、句子数量、上传时间以及扩展元数据。该表独立于预测记录表,但用户上传语料后可以触发试题生成操作,从而在预测记录表中产生对应的记录。
表3-4 语料记录表(corpus_records)
|
字段名 |
类型 |
主键 |
外键 |
是否为空 |
说明 |
|
corpus_id |
TEXT |
是 |
否 |
否 |
语料的唯一标识,由系统自动生成 |
|
title |
TEXT |
否 |
否 |
否 |
语料的标题 |
|
source_filename |
TEXT |
否 |
否 |
否 |
用户上传的原始文件名 |
|
raw_path |
TEXT |
否 |
否 |
否 |
原始文本文件的存储路径 |
|
processed_path |
TEXT |
否 |
否 |
否 |
处理后JSON文件的存储路径 |
|
question |
TEXT |
否 |
否 |
否 |
系统为语料自动生成的问题 |
|
answer |
TEXT |
否 |
否 |
否 |
系统为语料自动生成的答案 |
|
status |
TEXT |
否 |
否 |
否 |
处理状态,取值为processed或pending |
|
sentence_count |
INTEGER |
否 |
否 |
否 |
语料切分后的句子总数 |
|
uploaded_at |
TEXT |
否 |
否 |
否 |
语料上传的时间戳 |
|
metadata_json |
TEXT |
否 |
否 |
是 |
JSON格式的扩展元数据 |
实验报告表用于存储模型评估报告的摘要信息,支持主模型评估和基线对比实验。每条记录对应一个评估报告文件,包含报告名称、报告类型、源文件路径、报告包含的样本条目数量、以JSON格式存储的摘要指标以及最后更新时间。报告类型包括主模型评估报告和基线对比报告等。摘要信息中保存BLEU、ROUGE-L、语义一致性、可解答性等自动评估指标的汇总值。
表3-5 实验报告表(experiment_reports)
|
字段名 |
类型 |
主键 |
外键 |
是否为空 |
说明 |
|
report_name |
TEXT |
是 |
否 |
否 |
报告文件的名称 |
|
report_type |
TEXT |
否 |
否 |
否 |
报告类型,取值为prediction或baseline等 |
|
source_path |
TEXT |
否 |
否 |
否 |
报告JSON文件的存储路径 |
|
item_count |
INTEGER |
否 |
否 |
否 |
报告中包含的样本条目数量 |
|
summary_json |
TEXT |
否 |
否 |
否 |
JSON格式的汇总指标,包括BLEU、ROUGE-L等 |
|
updated_at |
TEXT |
否 |
否 |
否 |
报告记录的最近同步时间戳 |
3.5 系统业务流程
系统核心业务流程为:用户上传语料或选择数据集中样本后,系统首先对输入文本进行预处理,包括分词、实体识别和关键词提取;然后构建多粒度节点,并根据语义关联和逻辑推理链生成超边,同时计算加权关联矩阵;接着,超图卷积编码器对节点特征进行高阶传播,多尺度融合模块将文本特征与图结构特征融合,路径条件器提取支撑路径信息;之后,条件扩散模型在路径和超图特征的引导下生成试题隐向量,最终通过模板化方法输出自然语言题目。整个过程如图3.3所示。
图3.3 英语试题生成主要流程图
第四章 超图建模与试题生成模型设计
接下来围绕系统核心的试题生成机制展开阐述,以超图结构为知识表示基础,结合文本编码、高阶特征传播、多尺度融合与条件扩散生成技术,构建完整的英语试题生成模型。模型以文本语料为输入,以结构化超图为推理约束,实现逻辑严谨、语义一致且具备良好可解答性的试题自动生成。
4.1 英语语料的超图建模
超图建模是实现高阶知识推理与约束生成的基础,其目标是将非结构化的英文文本转化为能够表达多实体、多句子、多概念之间复杂关联的图结构。通过合理定义节点类型与超边类型,模型可以精准捕捉语料中的知识依赖与推理路径,为后续试题生成提供可靠约束。
英语语料经过文本预处理后被划分为独立语句,并完成词汇、实体与关键词的抽取。超图以这些基础信息为原料,将语义单元抽象为节点,将逻辑关联与推理关系抽象为超边,形成能够支撑多跳推理的知识结构。超图的构建质量直接影响生成试题的逻辑性、知识点覆盖度与证据匹配程度,是连接文本语义与试题约束的关键载体。
4.1.1 超图节点设计
超图节点用于承载语料中不同粒度的语义单元,依据试题生成所需的知识层次与推理环节,系统将节点划分为四种核心类型。问题节点作为整个超图的语义中心,代表待生成试题所围绕的核心主题,在超图中承担连接各类知识节点的枢纽作用。句子节点对应预处理后的每一条独立语句,保留文本的原始语序与篇章结构,是构成推理证据的基础载体。实体节点从语句中抽取专有名词与关键对象,包括具体事物、主题名称与核心概念实例,是试题考察的核心知识载体。概念节点对应抽象语义信息,包括逻辑关系、篇章特征与语言知识点,用于体现试题的考察类型与推理模式。
四类节点从词汇级别、句子级别、篇章级别完成对语料信息的全覆盖,使超图能够同时表示表层语言信息与深层逻辑关系。节点在构建过程中被赋予初始特征与权重信息,权重大小反映该节点在推理链条中的重要程度,为后续特征学习与试题生成提供引导。
4.1.2 超边构建与关联关系
超边是超图表达高阶关联的核心,能够同时连接多个节点,天然适配英语试题中多知识点共同支撑同一问题的推理模式。系统依据试题生成的逻辑特点,设计三类具有明确语义的超边类型,分别实现局部语义关联、证据支撑关联与全局推理关联。
问题实体超边以问题节点为中心,连接所有与之相关的实体节点,用于表示问题关注的知识对象集合。该类超边能够引导模型聚焦核心实体,避免生成过程偏离考察目标。实体支持句超边连接句子节点与其中包含的实体节点,刻画知识实例与其载体语句之间的归属关系,是构建证据链条的基础结构。桥接路径超边面向跨句推理题型,将问题节点与所有支撑推理的句子节点连接,形成覆盖完整推理链的高阶结构,适用于比较类、因果类等复杂试题生成。
通过三类超边的组合,超图能够完整表示语料中的知识分布与推理路径,将松散的文本信息转化为具有明确约束关系的结构数据。超边在构建过程中同时被赋予动态权重,权重大小依据其在推理中的作用强弱进行设定,使模型在学习过程中更加关注关键推理路径。
4.1.3 超图可视化呈现
为直观呈现语料内部的知识组织形式,系统提供超图可视化界面,将节点与超边以图形化方式展示。不同类型的节点采用不同的颜色与形状进行区分,超边以连线形式呈现节点间的关联关系,支撑推理路径的节点与连线以高亮方式显示。用户可通过界面完成视图缩放、平移与节点信息查询,查看节点类型、权重与来源语句等信息。
超图可视化不仅为用户提供可解释性依据,也为模型效果分析与语料质量检验提供直观工具。界面以简洁清晰的布局呈现节点分布与关联结构,便于理解试题生成所依赖的知识约束,超图可视化效果如图4.1所示。

图4.1 超图可视化界面图
4.2 文本编码与特征初始化
文本编码模块负责将自然语言文本转化为连续低维的向量表示,为后续图卷积与生成模型提供语义基础。系统采用预训练语言模型与哈希编码双模式设计,兼顾编码效果与运行效率。
文本编码的对象包括问题语句、句子节点文本、实体名称与概念短语。对于输入的文本序列,编码模型先完成词元切分与位置嵌入,再通过多层注意力机制完成上下文语义融合。最终输出的向量表示包含词汇语义、句法结构与上下文关联信息,能够全面表达节点的语言特征。句子节点与实体节点分别完成独立编码,形成具有区分度的初始特征,为超图传播提供可学习的基础表示。
经过文本编码后,所有节点均被映射到同一向量空间,语言层面的相似性可以通过距离度量体现,为后续超图卷积中的特征聚合与信息传递提供统一表示基础。
4.3 超图神经网络与特征增强
超图神经网络用于实现节点特征在高阶结构上的传播与增强,使每一个节点的表示都能够融合其多跳邻域的信息,从而获得具备全局推理能力的特征。模型通过多层超图卷积实现信息传递,使分散在不同语句中的知识节点能够在特征空间形成关联,为试题生成提供全局知识约束。
超图卷积以关联矩阵为基础,实现节点到超边、超边到节点的双向信息传递。在传播过程中,节点特征依据超边权重与节点度进行归一化,避免数值失衡带来的训练不稳定问题。每一层卷积都会更新节点表示,使节点逐步融合高阶关联信息,浅层卷积保留局部语义信息,深层卷积融合全局推理信息。
经过多层超图卷积后,节点特征不再局限于自身的语言信息,而是包含其在超图中的结构角色与关联知识。句子节点能够融合相关实体的信息,实体节点能够感知所在证据链的语义,这种增强后的特征能够显著提升试题生成的逻辑性与知识准确性。
4.4 多尺度特征融合与路径条件编码
在超图卷积完成特征增强后,模型通过多尺度融合模块将原始文本语义特征与超图增强特征进行结合,充分利用语言信息与结构信息。融合过程采用自适应门控机制,根据输入特征动态分配两种信息的权重,使模型在不同语料与推理场景下均能获取最优特征组合。
融合后的节点特征兼具局部语言细节与全局结构信息,为后续生成任务提供高质量表示。在此基础上,模型进一步提取推理路径特征,将标注为支撑证据的句子节点特征进行聚合,形成路径条件嵌入。该嵌入表示试题生成所需的核心推理链条,作为条件信息输入扩散模型,引导生成过程聚焦关键证据,提升试题的可解答性与针对性。
路径条件编码能够有效约束生成方向,使模型生成的问题严格依赖给定语料中的证据语句,避免出现无依据、无法解答的问题,显著提升试题在教学场景中的可用性。
4.5 条件潜在扩散试题生成模型
条件潜在扩散模型是系统实现试题生成的核心结构,其以超图编码得到的全局条件与路径条件为引导,在低维潜在空间中完成试题语义表示的生成。扩散模型通过逐步去噪的方式生成高质量表示,具备较强的可控性与生成稳定性,适合需要强逻辑约束的试题生成任务。
模型在训练阶段学习从高斯噪声中恢复试题嵌入的能力,以真实问题嵌入为学习目标,以超图条件为生成约束。在推理阶段,模型从随机噪声出发,通过多步迭代去噪逐步生成符合条件的试题表示。生成过程完全由超图结构引导,确保输出的试题嵌入与语料知识保持高度一致。
生成得到的潜在表示经过映射与解码,转化为自然语言形式的试题语句。解码过程依据实体分布、概念类型与推理路径生成符合语法规范与题型要求的问题,保证生成内容通顺、逻辑清晰。
4.6 多任务学习与优化目标
为进一步提升生成试题的质量,模型引入多任务学习机制,在试题生成主任务之外增设知识节点分类与支持句分类两个辅助任务。辅助任务利用数据集中的标注信息,为模型提供额外监督信号,使其在学习生成的同时学会识别关键知识与定位证据句子。
知识节点分类任务预测每个实体或概念节点是否为试题考察的关键对象,支持句分类任务预测每个句子是否为答案的支撑证据。两项任务均采用二分类损失进行优化,并根据样本分布设置动态权重缓解类别不平衡问题。
模型的总损失由扩散生成损失与两项辅助任务损失加权构成,通过多任务联合优化,模型能够更好地理解语料中的知识分布与推理结构,从而生成知识点准确、证据充分、逻辑严谨的高质量英语试题。
4.7 本章小结
阐述了基于超图建模的英语试题生成模型设计,从超图结构构建、文本编码、超图特征增强、多尺度融合、条件扩散生成到多任务优化,形成完整的技术链路。超图建模实现了文本知识的高阶结构化表示,为试题生成提供明确推理约束;超图神经网络实现全局知识特征的融合与增强;条件扩散模型在结构化约束下完成高质量试题生成;多任务学习进一步提升生成结果的准确性与逻辑性。整体模型设计充分结合语言特性与教学需求,能够稳定生成满足使用要求的英语试题。
第五章 系统实现与实验分析
5.1 开发环境与技术栈
系统的开发与运行依托轻量化且高效的技术组合,前后端分离架构与深度学习环境相互配合,为试题生成全流程提供稳定支撑。整体技术栈兼顾部署便捷性与运行效率,能够在常规计算环境中完成功能实现与实验验证。
后端以 Python 为开发语言,采用 FastAPI 框架构建 RESTful API 服务,具备高效的异步请求处理能力,可稳定支撑超图构建、模型推理、数据读写等核心业务。后端模块划分清晰,包含请求路由、数据处理、模型调用与结果返回等组件,能够与前端实现低延迟交互。数据持久化采用 SQLite 轻量级数据库,可完成语料记录、生成记录、修正记录与专家评分等信息的存储与管理,无需额外部署独立数据库服务,整体部署简洁高效。
前端基于 Vue 3 框架与组合式 API 开发,使用 Vite 作为构建工具,具备快速响应与流畅交互的特点。界面整体风格简洁统一,功能布局清晰合理,通过组件化方式实现登录验证、语料上传、超图可视化、试题展示、人工修正、专家评分与实验监控等功能。前端通过 Axios 完成与后端的数据交互,以表格、图表、可视化画布等形式直观展示系统运行状态与模型输出结果,为用户提供便捷直观的操作体验。
5.2 核心功能模块实现
5.2.1 注册登录
系统提供统一的登录入口,用户完成身份验证后可进入主界面使用全部功能。登录界面设计简洁清晰,包含用户名与密码输入区域,以及明确的操作提示,保证基础访问安全与使用便捷性。

图5.1 系统登录界面
5.2.2 语料上传与文本预处理
语料管理模块支持用户上传英文文本文件,系统自动完成格式校验、文本读取、分句处理、实体抽取与关键词提取等预处理流程。处理完成后的语料会以列表形式展示,包含语料名称、句子数量、处理状态等信息,用户可随时查看与预览。

图5.2 语料上传与管理界面
5.2.3 超图构建与可视化
超图构建模块根据预处理后的文本自动生成节点与超边,将语料中的实体、句子、概念转化为可视化结构。不同类型的节点以不同颜色区分,超边以连线形式呈现关联关系,用户可通过缩放、平移查看节点详情与推理路径。

图5.3 超图可视化界面
5.2.4 英语试题自动生成实现
试题生成是系统的核心功能,后端加载预训练模型,根据超图结构与文本特征完成条件扩散生成,输出逻辑合理、语义通顺的英语试题。生成结果包含试题内容、参考答案、关键实体与支撑句子,可直接用于教学练习与测试。

图5.4 试题生成结果界面
5.2.5 人工修正与记录实现
系统支持对生成的试题进行人工修正,用户可修改原文、填写评分并添加备注。所有修正记录会被完整保存,支持查看、查询与删除,形成生成、修正、优化的闭环流程。

图5.5 试题人工修正界面
5.2.6 专家多维评分实现
专家评分模块从语义一致性、逻辑严密性、可解答性、流畅性四个维度对生成试题进行评价,系统自动计算总体得分。评分记录可追溯、可统计,为模型优化提供可靠依据。

图5.6 专家多维评分界面

图5.7 单样本专家评分界面
5.3 实验设置
为验证基于超图建模的英语试题生成方法的有效性,本章从数据集、评价指标与训练参数三个方面设计完整实验方案,确保实验结果客观可信。
5.3.1 数据集
实验采用标注完备的英文阅读理解数据集构建样本,数据包含原始文本、问题、答案、支撑句与实体信息。数据集中的样本覆盖多种题型与推理类型,包含单句证据与多跳推理等不同复杂程度的文本,能够全面检验模型在不同场景下的生成效果。数据集在使用前完成统一预处理,包括文本清洗、分句、实体抽取与关键词提取,并按照设定比例划分为训练集与验证集,保证模型训练与评估的合理性。
5.3.2 评价指标
实验从文本生成质量、知识匹配程度与逻辑合理性出发,采用多项自动评价指标。BLEU 与 ROUGE-L 用于衡量生成试题与参考问题的相似性,反映语言流畅度与内容覆盖度。语义一致性用于衡量生成试题与输入语料的语义贴合程度,可解答性用于衡量试题是否能够在给定文本中找到明确答案。此外,模型在训练过程中同时记录精确率、召回率与 F1 值,用于评估知识节点分类与支持句分类任务的效果。
5.3.3 训练参数
模型训练采用固定参数配置以保证实验可复现。训练过程使用 AdamW 优化器进行参数更新,设置固定学习率与训练轮次。批次大小根据设备性能合理设置,在保证训练稳定性的同时提升计算效率。模型采用多任务损失联合优化,为生成损失与分类损失分配合理权重,缓解样本分布不均带来的影响。训练过程中启用早停策略,以验证集性能为依据停止训练,避免过拟合。
5.4 实验结果与分析
本节从整体性能、消融实验与对比实验三个维度对模型效果进行分析,验证超图建模、图神经网络与条件扩散模型在试题生成任务中的作用。
5.4.1 模型整体性能
模型在整体测试中表现稳定,各项指标达到预期水平。生成试题的可解答性保持在较高水平,表明模型能够有效依据文本内容生成具备明确答案的试题。语义一致性指标表现良好,说明生成内容与原文知识高度贴合。分类任务的精确率、召回率与 F1 值整体均衡,表明模型可准确识别关键知识与支撑句子。训练过程中损失持续下降并趋于平稳,模型收敛状态良好。

图5.8 模型训练损失曲线
实验结果总览界面汇总模型训练的关键指标,包括最优轮次、最高 F1 值、最低验证损失以及各项文本生成指标,可直观呈现模型整体性能。

图5.9 实验结果总览界面
自动评估指标包括 BLEU、ROUGE-L、语义一致性和可解答性。BLEU 通过计算生成试题与参考问题之间的 1‑gram 和 2‑gram 重合度,并引入 brevity penalty 惩罚过短或过长的生成结果。ROUGE-L 基于最长公共子序列的覆盖情况计算精确率和召回率的调和平均。语义一致性首先计算生成试题与支撑证据之间词汇化的重叠比例,再结合生成试题中关键实体的覆盖率,最后加权求和得到最终分数。可解答性则根据生成试题是否以疑问词开头、答案是否未出现在试题中以及答案是否可从支撑证据中推断得出三项指标综合评定。在开发集上运行完整模型后,获得的评估指标如图5.10所示。

图5.10 模型评估指标图
图中显示,BLEU 为 0.0953,ROUGE-L 为 0.1913,语义一致性为 0.6047,可解答性为 0.8315。语义一致性和可解答性均超过 0.6 和 0.8,说明生成的英语试题总体上能够贴合原文语义并且具备较好的可回答性。
5.4.2 消融实验
消融实验进一步量化了各模块的贡献。实验设置了五种配置:完整模型、移除注意力机制、移除超图神经网络、移除路径条件以及移除支撑句辅助任务。所有配置均在相同的开发集上运行并计算各项指标。实验结果汇总于表5.1。
表5.1 消融实验结果汇总
|
配置 |
BLEU |
ROUGE-L |
语义一致性 |
可解答性 |
|
完整模型 |
0.0966 |
0.19296 |
0.61824 |
0.80833 |
|
无注意力 |
0.09088 |
0.18956 |
0.61439 |
0.80167 |
|
无超图神经网络 |
0.06680 |
0.16506 |
0.49311 |
0.69167 |
|
无路径条件 |
0.09662 |
0.19296 |
0.61824 |
0.80833 |
|
无支撑句辅助任务 |
0.07246 |
0.17488 |
0.50785 |
0.62167 |
从表中可以看出,移除超图神经网络后 BLEU 下降幅度约为 30.8%,语义一致性下降约为 20.2%,是所有消融配置中性能下降最明显的,证明超图结构对试题生成的语义深度和逻辑严密性贡献最大。移除支撑句辅助任务后可解答性下降约为 23.0%,说明该辅助任务有助于生成更可回答的试题。移除注意力机制也有一定程度的性能下降,但幅度小于前两者。移除路径条件的影响很小,各项指标与完整模型基本持平,这可能是因为在当前数据集中支撑路径的信息已经隐含在实体‑支持句超边中。
5.5 本章小结
本章详细介绍了系统的开发环境、前后端实现与模型训练环境,明确实验数据集、评价指标与训练参数。通过整体性能评估、消融实验与对比实验验证了所提方法的有效性,各项结果表明基于超图建模的试题生成模型能够生成逻辑严谨、语义一致、可解答性高的英语试题。系统功能完整、运行稳定,具备实际应用价值。
第六章 结论
本文针对英语试题自动生成中多知识点联合约束难以表达的问题,围绕超图建模、超图神经网络、条件扩散生成和多任务学习等关键技术,设计并实现了一套基于超图建模的英语试题生成系统。全文完成的主要工作总结如下。
在理论方法层面,提出了以超图为知识表示载体的英语试题生成框架。通过定义问题节点、句子节点、实体节点和概念节点四类多粒度节点,以及问题‑实体超边、实体‑支持句超边、桥接路径超边三种高阶超边,实现了对“多个知识点支撑一道试题”这一逻辑结构的精准建模。在此基础上,引入两层超图卷积网络,通过节点‑超边‑节点的消息传递机制实现了高阶语义特征的传播与增强,并结合门控多尺度融合模块将文本编码特征与图结构特征进行自适应融合。
在模型设计层面,构建了以条件潜在扩散模型为核心的生成架构。将英语试题生成任务建模为从高斯噪声中逐步恢复目标问题隐变量的过程,并利用超图提取的全局图嵌入和路径嵌入作为条件引导。同时引入知识节点分类与支持句分类两个辅助任务,与扩散生成主任务共同优化,提升了生成试题与语料知识的对齐程度。模型在单张GPU上以128维隐空间、30个轮次的配置完成训练,推理阶段每个样本平均耗时0.6秒,能够满足实时交互需求。
在系统实现层面,开发了前后端分离的英语试题生成原型系统。后端基于FastAPI框架提供RESTful API接口,封装了超图构建、模型推理、数据持久化等核心服务;前端基于Vue3实现实验总览、语料处理、样本结果、超图联动、修正记录和专家评分六个功能模块。系统支持用户上传自定义英文文本文件,实时构建超图并生成试题,同时提供超图可视化、人工修正和多维度专家评分等交互功能,形成从语料输入到试题生成再到质量反馈的完整闭环。
在实验评估层面,采用BLEU、ROUGE‑L、语义一致性和可解答性四个指标对模型性能进行量化评估。在开发集上,完整模型取得了BLEU值为0.0953、ROUGE‑L值为0.1913、语义一致性值为0.6047、可解答性值为0.8315的结果。消融实验表明,移除超图神经网络后BLEU下降约30.8%、语义一致性下降约20.2%,移除支撑句辅助任务后可解答性下降约23.0%,验证了超图结构和多任务学习在英语试题生成中的关键作用。
尽管本系统已实现了预期的核心功能,但仍存在一些不足之处。第一,超图构建过程中节点和超边的定义依赖于文本预处理的质量,对于高度口语化或包含大量指代消解的长文本,实体提取和关联的准确性仍有提升空间。第二,当前生成试题依赖模板化方法将模型输出的logits转化为自然语言,表达方式相对固定,多样性有限。第三,系统目前仅支持英文语料,尚未扩展到其他语言或学科。第四,实验验证主要在英文阅读理解数据集上进行,对真实教学环境中长文本和多样化题型的适应性有待进一步检验。
针对上述不足,未来的研究工作可以从以下方向展开。一是探索更加智能的超图构建策略,引入大语言模型辅助的实体链接和逻辑关系抽取,减少对标注数据的依赖。二是将模板化生成替换为基于大语言模型的端到端生成,利用其强大的文本生成能力提升试题的自然度和多样性。三是将系统扩展到其他学科领域,如中文阅读理解、理科知识点推理等,验证方法的跨领域迁移能力。四是增加更多的自动评估指标,并与教师人工评分相结合,建立更完善的试题质量评价体系。五是丰富系统功能,如支持批量试题生成、试题难度预测、试题导出等功能,使系统更贴近实际教学应用场景。
更多推荐

所有评论(0)