本推文介绍了AAAI 2026收录的一篇论文《SlideBot: A Multi-Agent Framework for Generating Informative, Reliable, Multi-Modal Presentations》。SlideBot是一种创新性地将检索增强生成(Retrieval-Augmented Generation, RAG)、教育学理论以及多智能体技术相结合的幻灯片自动生成框架。针对当前大语言模型生成教学幻灯片时普遍存在的幻觉问题、知识过时、缺乏教学理论支撑、质量不稳定等重要问题,SlideBot框架通过模块化多智能体框架与教学理论的创新性融合,为高等教育场景下的高质量教学幻灯片自动生成提供了系统性的解决方案。

论文链接:https://arxiv.org/abs/2511.09804

本文作者为王一鸣,审校为龚裕涛和黄忠祥。

一、研究背景与主要贡献

1.1 研究背景

幻灯片是高等教育中非常重要的教学工具之一。作为传递知识以及融合多模态教学元素的核心载体,幻灯片的设计质量直接影响学生的知识吸收效率。根据认知负荷理论,有效的幻灯片设计可以极大程度地减轻学生的认知负荷。但高质量的教学幻灯片需要教师拥有庞大的专业知识储备,同时幻灯片设计必须符合学生的认知规律,还需要搭配相应的可视化元素,整个过程耗时久、成本高。

随着大语言模型的发展,交互式幻灯片生成工具可以做到根据提示自动生成幻灯片。但现有基于大语言模型的自动化生成工具,在教学幻灯片场景中面临多种挑战。第一,内容可靠性不足,模型依赖训练阶段习得的参数化知识,极易产生事实性幻觉或输出过时内容,在人工智能、生物医学等知识迭代极快的领域,风险尤为突出。第二,缺乏教学理论指导,多数工具只能关注幻灯片的内容生成,而未融入教育学相关的设计原则,不合理的内容排版会额外增加学习者的认知负荷,削弱教学效果。第三,多模态生成质量不稳定,大语言模型同时处理文本和视觉结构时极易出现格式混乱、内容缺失等问题,导致教学幻灯片难以直接投入使用。

为解决上述痛点,弗吉尼亚大学的研究团队提出了SlideBot多智能体幻灯片生成框架。

1.2 主要贡献

(1)教学理论深度融合

该框架首次系统性将认知负荷理论(Cognitive Load Theory, CLT)与多媒体学习认知理论(Cognitive Theory of Multimedia Learning, CTML)嵌入幻灯片生成全流程,为教育类AI内容生成工具提供了标准化的设计与评价框架。

(2)模块化多智能体生成架构

该框架将复杂的幻灯片生成任务拆解为内容检索、草稿生成、展示增强三个独立阶段,由中心协调者智能体统一调度多类专用智能体协同完成,大幅提升幻灯片生成能力。

(3)代码生成式多模态输出方案

该框架采用LaTeX Beamer代码生成路径替代直接多模态生成,配合编译错误迭代修正机制,有效降低了生成过程中的幻觉风险。

(4)双领域及双视角的全面实证验证

该论文在计算机科学与生物医学两个领域开展实验,通过学生群体的学习者视角与领域专家的教学者视角双向评估,全面验证框架的教学价值与实用优势。

二、研究方法

SlideBot采用模块化多智能体流水线架构,将教学幻灯片生成系统性地拆解为三个核心阶段,由中心协调者智能体统一调度各专用智能体协同完成全流程。图1是SlideBot的整体框架,接下来将具体介绍各部分结构。

图1 SlideBot的整体框架

2.1 内容检索模块

该模块是幻灯片生成流程的基础模块,核心目标是为内容生成提供可信的领域知识支撑,从根源降低大语言模型的幻觉风险。模块基于RAG技术构建,设计了模块化语料库接口,允许根据同学科的内容需求灵活切换不同类型的知识来源。

检索工作由专用检索者智能体完成。针对学术文献类语料,系统调用arXiv API通过关键词匹配筛选相关论文。针对教材等其他语料,采用BM25概率排序算法对关键词进行排序,从而定位高相关段落。检索完成后,检索者智能体对获取的内容生成详细摘要,同时提取文献标题、作者、发表时间等要素,以便于用于后续引用标注。所有内容返回中心协调者后,由协调者进行二次筛选,仅保留高质量、高相关性的内容进入后续生成环节。

2.2 幻灯片草稿生成模块

该模块是框架的核心,负责将检索到的知识转化为符合教学规律的幻灯片内容,由协调者智能体与代码生成器智能体协作完成。

协调者智能体将会基于检索到的内容,结合作者预设的结构指南构建详细的幻灯片生成计划。该结构指南融入了CLT与CTML的核心原则。具体而言,幻灯片开篇引入核心概念的介绍来建立知识基础,管控学习者的内在认知负荷。幻灯片主体按照主题展开深度讲解。幻灯片结尾提炼核心要点,从而巩固学习效果。在内容细节设计中,通过加粗关键词、层级化要点实现信号原则,通过限制单页信息密度实现一致性原则,通过图文配对与摆放位置规划实现空间接近原则。

随后,幻灯片计划传递给代码生成器智能体。针对大语言模型直接生成多模态内容的稳定性缺陷,框架利用大语言模型的代码生成优势,将结构化蓝图转化为LaTeX Beamer代码。为保障代码可用性,框架设置了编译验证与迭代修正机制:生成的代码首先由协调者编译验证,若出现错误则将错误信息与修改建议返回代码生成器进行修正,通过循环迭代保障输出可正常执行。

2.3 幻灯片草稿生成模块

该阶段由增强器智能体完成,目标是进一步提升幻灯片的教学价值与视觉质量。协调者首先识别适合加入视觉元素的幻灯片,如方法架构、流程示意、数据图表等,再由增强器添加对应可视化内容。为保障视觉风格一致性与生成效率,增强器采用预编写的图表宏库,生成图表时仅需传入对应参数即可,无需每次从零生成代码。

除视觉元素外,增强器还会添加仅教师可见的注释内容,包括知识点展开提示、常见学生误区提醒、教学辅助工具建议等,为教师提供教学法层面的指导。增强完成后,完整的幻灯片文件交付给用户,同时支持教师提交修订意见,由协调者调度对应智能体完成迭代优化,确保内容完全匹配教学需求。

三、实验结果

3.1 实验准备

(1)评估指标

如表1所示,评估维度包含信息性、可靠性、实用性。每个维度都由学生和专家进行不同角度的打分,所有指标采用1-5分评分尺度。

表1 研究中使用的评估指标

(2)对比模型

采用主流商业工具Microsoft Copilot,可通过直接提示的方式生成幻灯片。

(3)评估人员

评估人员包括计算机领域学生调查15人和专家7人,以及生物医学领域学生调查13人、专家4人。

(4)实验设置

实验中,SlideBot中所有智能体均使用GPT-4o-mini为基础模型。

3.2 定性对比分析 

图2 三种幻灯片自动生成方式的效果对比

如图2所示,作者以“流形学习”主题的生成为例,对比了使用Copilot、对基础模型直接提示,使用SlideBot三类生成方式的质量差异。Copilot生成的幻灯片存在无关配图、无引用标注、要点模糊等问题,而直接提示生成的幻灯片除教学设计缺陷外,还出现了图片缺失、内容超出页面边界等功能性错误。而SlideBot生成的幻灯片要点清晰、标注引用来源,配图与讲解内容直接对应,同时嵌入了教师教学注释,完整符合相关的教学理论,具备良好的教学价值。

3.3 与Copilot的定量对比实验

表2 在不同维度下SlideBot与Copilot各指标的平均得分

如表2所示,SlideBot在所有评估指标上均显著优于Copilot。信息性维度的得分证明SlideBot生成的幻灯片在内容清晰度、准确性与全面性上均实现大幅提升。在可靠性维度,各项指标说明幻灯片不同主题下的生成质量更稳定,有效缓解了幻觉问题。而在实用性维度,结构与流畅度、整体适用性、教师效用三项指标都明显提升,生成结果更适配真实教学场景。

3.4 多智能体架构的效果验证

图3 SlideBot框架与直接提示GPT-4o-mini生成幻灯片的平均得分

为分离多智能体架构本身的作用,研究将SlideBot与直接提示基线进行对照,结果如图3所示。可以看出,SlideBot在几乎所有指标上都显著优于直接提示生成,仅主题覆盖度两项得分相近,说明主题覆盖广度更多由基础模型的知识储备决定,而内容的准确性、清晰度、可用性则高度依赖多智能体生成架构。这一结果证明,将复杂任务拆解为多个子任务、由专用智能体协同完成的模式,能够全方位提升幻灯片生成质量。

3.5 模型规模的影响分析

图4 GPT-4o与GPT-4o-mini在有无检索上下文时的平均得分

研究进一步对比了不同模型规模对生成幻灯片效果的影响,结果如图4所示。数据显示,四种配置下的主题覆盖度差异不大,但概念准确性在加入检索模块后得到了十分显著的提升。值得注意的是,GPT-4o-mini得分略高于GPT-4o,可能原因是,小模型知识有限,会更严格地遵循检索内容生成输出,而大模型更容易依赖自身内部知识,反而可能出现准确性不足的问题。

四、总结

本文介绍了SlideBot,这是一个融合了RAG方法、CLT和CTML理论与模块化多智能体架构的自动化教学幻灯片生成系统。该系统能够自动化产出知识点准确、符合教育理论且契合教学需求的高质量幻灯片,显著减轻了教师的备课负担。

然而,SlideBot仍存在一定局限性。例如,当前实验只聚焦了高等教育的理工科领域,在人文学科的适配性尚未验证。同时框架仅支持LaTeX格式输出,对其他通用场景的适配性不足。

更多推荐