logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

低资源场景下大语言模型为方面级情感分析生成合成训练样本——论文阅读报告

根据实验结果,在ABSA的任务中,我们在只使用了500个标注数据的情况下,通过LLMs生成数据进行补充,就达到甚至超过了了2000个标注数据的的效果。探究在低资源条件下,利用大语言模型生成的合成训练样本能否有效提升ABSA任务的性能,并评估在不同真实数据数量以及在不同的大模型下的补充质量。Prompt末尾提供目标标签,LLM 的任务是:根据这个目标标签,生成一句符合标签内容的句子,并按要求标注as

#语言模型#论文阅读#人工智能
大脑启发的大语言模型功能网络和关键神经元探索

现有的大语言模型可解释性研究多集中于识别和解读单个神经元的功能,但这忽略了一个关键事实:无论是人脑还是人工智能,高级功能的实现都依赖于神经元群体之间复杂的交互网络。随后,逐步增加K(即保留更多的功能网络),观察模型性能的变化。更关键的是,这些网络在深层模型中分布更为集中,暗示高级抽象处理依赖于深层神经元间的功能连接,而这一组织原则与人脑中默认模式网络等多任务功能网络的存在具有深刻的相似性。这强有力

#语言模型#网络#人工智能 +2
重新审视使用神经元语义归因的大语言模型剪枝

然而,现有剪枝方法在多样化任务和数据集上的泛化能力尚不明确,尤其是在校准数据选择对剪枝效果的影响方面缺乏系统研究。而NSA这样的可解释性工具,则帮助我们了解了剪枝的内部原理以及大模型的神经网络结构。剪枝绝非简单的参数削减,我们要研究清楚大模型内部神经网络的结构,才能更好地压缩大模型的复杂结构,实现效率的提升。使用不同的剪枝方法,在指定的校准数据上,以特定的稀疏比和序列长度,对原始的大语言模型进行剪

#语言模型#剪枝#人工智能
LLaMA也有感情:通过 探针 揭示LLaMA模型中的情感和情绪表征

作者将SENTRILLAMA与在所有数据集上做了微调的DeBERTaV3-large和RoBERTa-large进行比较,得到了如下结论:SENTRILLAMA在GPU内存使用和推理速度方面更具优势,在所有维度上持续超越Instruct-Llama模型。作者在Llama大模型的基础上提出了一种新的模型,利用到L≤i层进行情感任务,其中i表示该任务最具代表性的层,用轻量级的分类头替代了原Llama的

#语言模型#人工智能#自然语言处理
通过LLM中的因果干预实现可控和可解释的文本生成

二进制掩码,是实现干预的参数。作者提出了一种结构因果模型,在以往的大模型结构中,大模型的输入输出往往体现出一定的相关性,而非因果逻辑性。这篇论文只是提出了一种因果机制在大模型具体位置干预大模型输出的理论方法,但是在具体的实现中,人工干预的方法效率不高。新的内生变量: C = {c₁, c₂, ..., cₖ}, 其中每个 cₖ 代表一个要控制的属性(如 c₁=风格, c₂=情感)。属性投影函数,这

#人工智能#算法#机器学习 +2
用大型语言模型评估零样本多语言方面级情感分析——论文阅读报告

用大型语言模型评估零样本多语言方面级情感分析论文链接:[2412.12564] Evaluating Zero-Shot Multilingual Aspect-Based Sentiment Analysis with Large Language Models没有提供实验代码链接发表于17 Dec 2024 (v1), 修改于 9 Jun 2025international Journal o

#语言模型#论文阅读#人工智能 +1
大型语言模型中情感推断的机制可解释性研究

为了验证实验结果的争取性,实验者采用了activation patching 方法,即把“来源句子”的中层激活贴到“目标句子”里,看能不能把目标的情绪预测强行改成来源的情绪。为了进一步的研究,我们分析了MHSA和FNN单元的补丁效应,FNN单元的效果最好的激活层出现的比MHSA出现的要晚。实验发现,准确率在中间层后就没有太大的变化,这说明,模型的输出情感主要由中间层决定,后续层级的处理贡献微乎其微

#语言模型#人工智能#自然语言处理 +1
到底了