
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
©PaperWeekly 原创 ·作者 |避暑山庄梁朝伟背景随着 ChatGPT 的火爆出圈,大模型也逐渐受到越来越多研究者的关注。有一份来自 OpenAI 的研究报告 (Scaling laws for neural language models) 曾经指出模型的性能常与模型的参数规模息息相关,那么如何训练一个超大规模的 LLM 也是大家比较关心的问题,常用的分布式训练框架有 Megatr..
引言在当今人工智能研究领域,视觉语言模型(VLMs)在多模态推理任务中展现了显著的进步。VLMs 的主要创新在于将语言和视觉两种模态进行有效的对齐,使其不仅能够进行基本的图像识别,还能执行基于视觉输入的动态内容推理和复杂问题解答。这一进展为自主驾驶、智能助手等各种应用提供了基础,推动了智能系统向更高的智能化方向发展。然而,尽管 VLMs 在多个任务中取得了可喜的成果,它们仍然面临诸多挑战。例如,V
「论文访谈间」是由 PaperWeekly 和中国中文信息学会社会媒体处理专委会(SMP)联合发起的论文报道栏目,旨在让国内优质论文得到更多关注和认可。论文动机作为典型...
©PaperWeekly 原创 ·作者 |黄融杰单位 |浙江大学研究方向 |Speech/NLP扩散模型在深度生成模型中自成一派,最近成为最热门的话题之一。扩散模型展示了强大的生成能力,无论是生成高水平的细节还是其生成的多样性,都让人印象深刻。扩散生成模型将生成式建模领域的标准提高到了一个全新的水平。迄今为止,扩散模型已被应用于各种生成式语音建模任务,如语音合成(speech synthe...
©PaperWeekly 原创 ·作者 |苏剑林单位 |追一科技研究方向 |NLP、神经网络LLM 是“Large Language Model”的简写,目前一般指百亿参数以上的语言模型,主要面向文本生成任务。跟小尺度模型(10 亿或以内量级)的“百花齐放”不同,目前 LLM 的一个现状是 Decoder-only 架构的研究居多,像 OpenAI 一直坚持 Decoder-only 的 ...
阿里巴巴达摩院和新加坡南洋理工大学的研究团队提出了一种创新方法——视觉对比解码(VCD),有效解决大型视觉语言模型中的对象幻觉问题,同时为提升模型在复杂视觉任务中的性能开辟新路径。在自然语言处理和计算机视觉领域,大型视觉语言模型(LVLMs)已经取得了显著成就,尤其是在图像和文本信息的交互处理方面。然而,尽管它们的高效能和多功能性,LVLMs 仍面临一个主要的挑战:对象幻觉。这个问题表现为模型生成
合适的工作难找?最新的招聘信息也不知道?AI 求职为大家精选人工智能领域最新鲜的招聘信息,助你先人一步投递,快人一步入职!AMDAMD 是高性能与自适应计算领域的领先企业,致力于提供优质的产品和服务,助力客户解决各种重大的挑战。我们的技术推动着数据中心、嵌入式系统、游戏和 PC 市场迈向未来。AMD 于 1969 年在硅谷创立,最初只有几十名员工,从那时起 AMD 便踏上创新之路,致力于引领半导体
We’re excited to announce thatthe test set for the ICDAR 2025 Competition on Historical Map Text Detection, Recognition, and Linkingis now available!With just a month to go before theApril 1, 2025...
©PaperWeekly 原创 ·作者 | 缥缈孤鸿影引言ChatGPT 的横空出世,在整个自然语言处理乃至人工智能领域均掀起波澜。不同于普通的闲聊式机器人和任务型智能客服仅局限于固定场景,ChatGPT 具有相当丰富的知识储备,对于很多冷门的知识,它亦能对答如流,堪称当代“百晓生”。因此,将语言模型与知识结合具有很高的研究价值,更强的知识性也标志着模型更加智能。本文先讲述预训练语言模型与知识的.
举个例子:模型在学习"中国的某某中心"时,频繁看到"北京"作为答案,而较少看到"上海"。这样的语言模型之所以在预训练后仍存在持续幻觉,正是因为其训练数据规模巨大、模型尺寸相对较小,产生了长尾式的知识遮蔽恢复曲线,从而导致预训练结束时取出的模型的知识遮蔽效应仍有残留。可以看作数据集中主流知识 (如"中国的某某中心是北京") 与冷门的知识 (如"中国的某某中心是上海") 中出现频次的比值。:当一个流行







