摘要:我们引入了“废话学”(Drivelology)这一独特的语言现象,其特点可概括为“有深度的废话”,即这些话语在句法上连贯,但在语用上却自相矛盾、情感充沛或修辞上具有颠覆性。尽管这类表达看似只是表面上的无意义之语,但它们却蕴含着隐含意义,需要结合语境进行推断、进行道德推理或情感解读才能领会。我们发现,尽管当前的大型语言模型(LLMs)在许多自然语言处理(NLP)任务中表现出色,但它们始终无法把握废话学文本的分层语义。为了对此展开研究,我们构建了一个规模虽小但多样化的基准数据集,其中包含1200多个精心挑选的示例,部分示例采用英语、普通话、西班牙语、法语、日语和韩语。标注工作极具挑战性:每个示例都需要经过专家仔细审查,以验证其是否真正反映了废话学的特征。这一过程涉及多轮讨论和裁决,以解决分歧,凸显了废话学微妙且主观的特性。我们在分类、生成和推理任务上对一系列大型语言模型进行了评估。我们的研究结果揭示了大型语言模型的明显局限性:模型常常将废话学与浅显的废话相混淆,给出不连贯的解释,或完全忽略其中隐含的修辞功能。这些发现凸显了大型语言模型在语用理解方面存在更深层次的表征差距,并对“统计流畅性即意味着认知理解”这一假设提出了质疑。我们公开了数据集和代码,以便进一步研究如何在超越表面连贯性的基础上对语言深度进行建模。Huggingface链接:Paper page,论文链接:2509.03867

研究背景和目的

研究背景
随着自然语言处理(NLP)技术的快速发展,大型语言模型(LLMs)在多项任务中展现了卓越的性能,包括机器翻译、文本摘要、常识推理和对话生成等。然而,尽管这些模型在处理表面语言结构上表现出色,但其对语言深层语义和社会文化背景的理解能力仍然存疑。特别是,互联网语言的动态演变和文化嵌入性为评估LLMs的真正理解能力提供了独特的视角。Drivelology(“有深度的废话”)作为一种独特的语言现象,结合了表面上的无意义与深层次的隐含意义,成为检验LLMs深层语义理解能力的理想测试平台。

研究目的
本研究旨在通过构建一个多语言、多样化的Drivelology基准数据集(DRIVELHUB),评估当前LLMs在理解和推理Drivelology文本方面的能力。具体目标包括:

  1. 构建基准数据集:收集并标注一个包含超过1200个Drivelology样本的数据集,涵盖英语、中文、西班牙语、法语、日语和韩语等多种语言。
  2. 评估LLMs性能:通过分类、生成和推理任务,系统评估一系列开源和专有LLMs在Drivelology理解方面的表现。
  3. 揭示模型局限:分析LLMs在处理Drivelology文本时面临的挑战,特别是它们在理解隐含意义、文化背景和情感解读方面的不足。
  4. 推动未来研究:为开发更具社会和文化意识的AI系统提供基础,激励进一步研究如何提升AI模型在复杂语言现象中的理解和生成能力。

研究方法

数据集构建

  1. 数据收集:从Instagram、Threads、TikTok、Facebook、Line、RedNote、Pinterest、Naver和YouTube等社交媒体平台手动收集Drivelology样本,确保样本的多样性和广泛性。同时,从名言警句、谚语和Ruozhiba论坛等来源收集非Drivelology样本作为对照。
  2. 数据标注:采用多轮独立审查和小组讨论的方式,确保每个样本的标注质量。标注过程包括Drivelology检测、多标签分类(如误导、悖论、转换诱饵、反转和文字游戏)、隐含叙事生成和叙事选择。
  3. 质量控制:由具有语言学和心理学背景的元审查员对所有标注进行最终审核,排除有争议或模糊的样本,确保标注的一致性和准确性。

实验设计

  1. 任务设计:设计四个核心任务来评估LLMs的Drivelology理解能力,包括Drivelology检测(二分类)、Drivelology标签分类(多标签分类)、隐含叙事生成(生成任务)和叙事选择(多选任务)。
  2. 模型选择:评估一系列开源和专有LLMs,包括GPT-4、Claude-3、Qwen3、Qwen2.5、Llama3.1、Llama3和DeepSeek V3等。
  3. 评估指标:使用准确率评估Drivelology检测任务,F1分数评估Drivelology标签分类任务,准确率评估多选任务,BERTScore和LLM-as-a-judge评估生成任务。

研究结果

模型性能

  1. 分类任务:DeepSeek V3在所有模型中表现最佳,Drivelology检测准确率为81.67%,标签分类F1分数为55.32%。其他模型如Claude-3.5-haiku和GPT-4也表现出色,但明显落后于DeepSeek V3。
  2. 生成任务:尽管BERTScore-recall值普遍较高,表明模型在生成流畅文本方面的能力,但GPT-4-as-a-judge评分显示,只有DeepSeek V3和Claude-3.5-haiku的输出被认为具有较高的语义质量。
  3. 多选任务:在Hard设置下,所有模型的准确率显著下降,表明模型在处理复杂推理任务时存在明显局限。Qwen3-8b-instruct在Easy任务中表现尚可,但在Hard任务中表现不佳。

语言影响

  1. 提示语言选择:英文提示在需要词汇精确性和复杂逻辑推理的任务中表现更佳,而中文提示在直接内容理解任务中更具优势。
  2. 多语言表现:DeepSeek V3在所有语言中均表现出色,而韩语和中文样本在Hard任务中对模型来说最具挑战性。

研究局限

  1. 语言不平衡:数据集中近一半的样本为中文,其他语言的样本数量相对较少,可能影响研究结果的普适性。
  2. 计算资源限制:由于预算限制,未能评估更强大的专有LLMs,如GPT-4.5、Claude-3.7和DeepSeek R1。同时,开源模型的实验仅限于140亿参数模型,未能评估更大规模的模型。
  3. 生成能力评估不足:本研究主要关注LLMs的理解和推理能力,而非生成能力。尽管进行了生成能力的初步探索,但未深入分析模型生成Drivelology文本的质量和多样性。

未来研究方向

改进模型训练方法

  1. 利用GRPO优化:探索使用GRPO(Group Relative Preference Optimization)技术,通过多候选响应的相对偏好学习,提升模型在复杂推理任务中的表现。
  2. 多任务学习:结合分类、生成和推理任务,设计多任务学习框架,提升模型在处理Drivelology文本时的综合性能。

开发Drivelology生成评估框架

  1. 定义评估指标:开发专门用于评估生成Drivelology文本质量的指标,包括娱乐性、相关性、连贯性和悖论深度等。
  2. 构建生成数据集:扩展数据集,增加高质量的Drivelology生成样本,为训练和评估生成模型提供基础。

跨语言和文化研究

  1. 扩展语言覆盖:收集更多语言的Drivelology样本,特别是低资源语言,提升研究结果的普适性。
  2. 文化背景分析:深入研究不同文化背景下Drivelology文本的特点和差异,为开发具有文化敏感性的AI系统提供依据。

伦理和社会影响

  1. 内容审查:建立严格的内容审查机制,确保数据集和生成文本不包含冒犯性或有害内容。
  2. 用户研究:开展用户研究,了解用户对AI生成Drivelology文本的接受度和期望,为开发用户友好的AI应用提供参考。

通过上述研究方向的深入探索,可以进一步提升AI系统在处理复杂语言现象时的理解和生成能力,推动NLP技术的持续进步。

更多推荐