Exploring large language models for the generation of synthetic training samples for aspect-based sentiment analysis in low resource settings

探索利用大语言模型为低资源场景下的方面级情感分析生成合成训练样本

发表于 2025.2.1 Expert Systems with Applications

未提供代码

文章链接:Exploring large language models for the generation of synthetic training samples for aspect-based sentiment analysis in low resource settings - ScienceDirect

2025.9.14

  • 简介及动机:

方面级情感分析(ABSA)是SA的一个分支领域,旨在识别产品、服务或实体特定方面或特征所关联的情感倾向。

与NLP的其他方向类似,由于人工标注耗时费力,ABSA面临着标注语料库稀缺的环境,而LLM在这一领域展现出巨大潜力。

在文档级、句子级和方面级层面,语言模型(LLM)无需大量数据标注即可实现零样本、单样本及少量样本的情感分类,展现出令人瞩目的性能表现。

在综述中,也提到了关于LLM在SA上的应用,即创建合成数据。

该篇论文研究了使用LLMs在低资源场景下生成ABSA任务的标注样本。

  • 实验

实验目的:

探究在低资源条件下,利用大语言模型生成的合成训练样本能否有效提升ABSA任务的性能,并评估在不同真实数据数量以及在不同的大模型下的补充质量。

使用的语言模型:

Llama-3-70B和GPT-3.5-turbo3

实验变量:

  1. 真实样本的数量
  2. 由500条真实样本产生的合成样本数量
  3. 由25条真实样本产生的合成样本数量

这三个变量组成了九个实验组,如下表:

数据生成策略:

Promt包含任务名称、任务定义、输出格式以及包含标注示例的演示部分等要素。

少样本示例包含一个标签和对应的句子,标签为数组格式,可包含一个或多个元组,每个元组为 (aspect category, sentiment polarity)。

显示aspect用XML标签标注,举例如下:

在LRS25场景中,在500个真实数据中从5个aspect category中每类选5条。

在LRS500场景中,从500条中选出25条作为few-shot示例,保证每类至少出现一次。

Prompt末尾提供目标标签,LLM 的任务是:根据这个目标标签,生成一句符合标签内容的句子,并按要求标注aspect term。

在数据生成后,通过Baseline augmentation method进行数据增强,评估合成数据的有效性

实验对象和使用的模型:

四个常见的ABSA任务:

ACD、ACSA、端到端ABSA、TASD

1、ACD和ACSA:

两者均视为多标签分类任务,使用gbert-large模型

2、端到端ABSA:

使用BERT模型进行分词处理,使用gbert-large模型来完成任务。

我们采用二元交叉熵损失函数,并使用sigmoid函数作为激活函数。

3、目标方面情绪检测(TASD):

采用t5-base模型作为底层Seq2Seq模型

测试标准:

重新标注2400条LLM生成的句子,验证LLM的生成标注的准确性。

实验结果:

  1. 真实数据与合成数据的直观比较

合成数据在词汇多样性方面低于真实数据,表现为独特词语和句子数量较少,且句式开头存在较高重复率(如大量以限定词开头)。

总体来看,LRS500合成数据的独特标签等比LRS25要高。

  1. 合成标注评估

Llama-3-70B仅在aspect term上的召回率上优于GPT-3.5-turbo3

而在aspect term的准确率、sentiment polarity + aspect term的F1 score、aspect category的

F1 score、 Aspect category + sentiment polarity的F1 score以及Aspect term + aspect category + sentiment polarity的F1 score上,Llama-3-70B都不如GPT-3.5-turbo3

  1. 分任务评估性能

总体来说:

在LRS25的情景下,真实样例的F1 score基本都高于合成样例(除了ACSA的F1 macro)。

而在LRS500的情景下,真实样例的F1 score基本都低于合成样例(在ACD上几乎一致)。

  • 总结

根据实验结果,在ABSA的任务中,我们在只使用了500个标注数据的情况下,通过LLMs生成数据进行补充,就达到甚至超过了了2000个标注数据的的效果。

这意味着,数据标注工作可以在LLMs的帮助下减少大量的时间成本和人工成本,这无疑是振奋人心的。

经过这篇论文的启发,我想到了两个可以探索的方向:

  1. 在别的SA任务中,我们也可以采用LLMs生成标注数据的方法提高效率
  2. 未来是不是可以在没有标注数据(即零样本)的情况下,利用LLMs生成标注数据。

更多推荐