
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
RAG主要关注通过检索到的信息来改善LLMs的回答质量,而很少关注LLMs真正需要回答原始查询的类型知识。作者提出,长尾知识对RAG至关重要,因为在大规模预训练期间LLMs已经记住了常见的世界知识。基于此观察,作者提出了一种简单但有效的长尾知识检测方法,引入了一种新的基于统计和语义的生成预期校准误差(GECE)指标来衡量知识的“长尾性”。大语言模型,LLM, 长尾知识,检索增强

文章提出了一个名为GradeOpt的统一多代理自动短答案评分(ASAG)框架,该框架利用大型语言模型(LLMs)作为评分员对开放性简答题(SAGs)进行评分。GradeOpt框架通过自我反思机制自动优化原始评分指南,以提高评分准确性和与人类评分员的行为一致性。通过在教育内容知识(PCK)和内容知识(CK)问题上的实验,证明了GradeOpt在评分准确性和与人类评分员行为一致性方面相较于现有基线模型

这篇论文的标题是《Enhancing Advanced Visual Reasoning Ability of Large Language Models》,由悉尼大学计算机学院的Zhiyuan Li, Dongnan Liu, Chaoyi Zhang, Heng Wang, Tengfei Xue, Weidong Cai撰写,投稿ACL ARR2024。这篇论文提出了一种新的方法,名为复杂视

随着视觉语言模型(VLMs)的出现,代理现在具备了增强的视觉理解能力,使它们能够仅使用视觉输入与游戏互动。尽管取得了这些进展,当前方法在动作导向任务中仍面临挑战,尤其是在动作角色扮演游戏(ARPGs)中,强化学习方法虽然普遍,但泛化能力差,需要大量的训练。为了解决这些限制,我们选择ARPG《黑神话:悟空》作为研究平台,探索现有VLMs在需要视觉输入和复杂动作输出的场景中的性能边界。

本研究系统探索了大语言模型(LLM)指令微调中不同类型指令数据的混合策略。将指令分为NLP任务、代码生成和通用对话三类,通过控制实验发现:1) NLP任务指令会提升专业性能但损害对话能力;2) 代码指令能同时增强代码和对话能力;3) 13B大模型比7B小模型更能有效融合多种指令类型。研究还揭示了最优混合比例(1.5:1)和数据规模"甜点"现象,为指令混合提供了实用指导。这些发现

大型语言模型在作为智能体与外部环境(如搜索引擎等工具)交互方面已取得成功。然而,LLMs 在预训练或对齐阶段主要是针对语言生成而非工具使用进行优化的,这限制了它们作为智能体的有效性。为了解决这个问题,先前的工作通常先收集 LLM 与环境之间的交互轨迹,但仅使用那些成功完成任务的轨迹来微调较小的模型。这种做法使得微调数据变得稀缺,且获取数据既困难又昂贵。丢弃失败的轨迹也导致了数据和资源的大量浪费,并

训练大型语言模型(LLM)使用开放领域的指令遵循数据取得了巨大的成功。然而,手动创建此类指令数据非常耗时且劳动密集。此外,人类可能难以产生高复杂度的指令。本文展示了一种利用LLM而非人类来创建具有不同复杂度级别的大量指令数据的方法。从一个初始指令集开始,我们使用提出的Evol-Instruct方法,逐步将它们重写为更复杂的指令。然后,我们混合所有生成的指令数据来微调LLaMA模型,最终模型被称为W

AI + education, 大语言模型在教育的挑战与机遇。

本文是一篇叙述性综述,旨在评估大型语言模型(LLMs)在临床摘要任务中的当前评估状态,并提出未来的方向,以解决专家人工评估的资源限制问题。本研究旨在全面回顾和实证评估多模态大型语言模型(MLLMs)和大型视觉模型(VLMs)在交通系统目标检测中的应用。研究首先提供了MLLMs在交通应用中的潜在优势的背景,并回顾了先前研究中当前MLLM技术的有效性和局限性。然后提供了交通应用中端到端目标检测的分类法

关键词提取是信息检索和文本挖掘中的一项重要技术,它涉及从文本中识别和提取出最能代表文档内容的词语或短语。如下图所示,对于亚马逊上面的商品标题,在构建底层索引时,通常需要对标题做分词,提取里面核心词,用于构建倒排索引或者用于关键词匹配计算等。关键词提取技术可以通过多种方法实现,包括无监督学习和有监督学习的方法。首先,你需要定义一个LoRA模块,这个模块将被插入到BERT模型的特定层中。大语言模型,工








