
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文是对LLaMA大模型研究系列的总结,重点解读了LLaMA论文的核心贡献。LLaMA证明了仅使用公开数据,通过合理的数据规模、模型结构和训练优化,就能训练出性能强大的基础语言模型。论文提出了7B-65B参数的模型系列,其中LLaMA-13B在多数任务上超越了GPT-3 175B,而LLaMA-65B则与Chinchilla-70B和PaLM-540B竞争。LLaMA的创新点在于强调"小而强"的路

摘要 论文《PatentGPT: A Large Language Model for Intellectual Property》提出了一套面向知识产权领域的领域大模型训练流程,而非全新架构。针对知识产权领域三大核心挑战——专业知识强、隐私要求高、文本极长,研究团队以LLaMA2/Mixtral等开源模型为基础,通过240B+token的IP领域数据继续预训练、指令微调(SFT)、强化学习对齐(
摘要 本文为Windows用户提供了一套便捷的大模型开发环境配置方案,推荐使用WSL2+Ubuntu替代传统虚拟机和双系统。教程包含以下核心内容: 环境选择:解释为何Linux更适合大模型开发,推荐WSL2作为Windows下的轻量级解决方案 安装部署:详细指导WSL2和Ubuntu的安装步骤 空间优化:重点介绍将Ubuntu系统从C盘迁移到其他磁盘的方法,避免存储空间不足 环境配置:涵盖基础工具

本文介绍了LLaVA(Large Language and Vision Assistant)模型,提出了一种视觉指令微调方法(Visual Instruction Tuning)。LLaVA通过连接CLIP视觉编码器和Vicuna语言模型,构建了一个能理解图像并遵循自然语言指令的多模态助手。论文创新性地利用GPT-4生成了158K高质量的视觉指令数据,包含对话、详细描述和复杂推理三类任务。模型采

《思维链提示激发大语言模型推理能力》论文摘要(150字): 本文提出思维链提示(Chain-of-Thought Prompting)方法,通过few-shot示例展示"问题-推理过程-答案"的完整链条,引导大语言模型在回答复杂推理问题时生成中间推理步骤。实验表明:1)CoT效果随模型规模增大而涌现;2)多步推理任务收益更显著;3)推理链必须置于答案前才有效;4)实质是扩展了自回归生成的序列计算深

摘要: 本文提出不确定性引导的视觉回看方法(Uncertainty-Guided Lookback),解决多模态推理中模型因视觉漂移导致的错误累积问题。研究发现,传统长思维链(CoT)可能因初始误读图片而持续偏离正确答案,而重新访问视觉证据比单纯延长语言推理更有效。该方法通过检测模型生成的不确定性短语(如“wait”),自动触发图片回看机制,在Qwen3-VL模型上使MMMU-val准确率提升2.

文章摘要 本文从新手视角系统讲解Git与GitHub在深度学习项目中的使用。首先介绍了Git作为版本控制工具的核心功能,以及GitHub作为远程托管平台的作用。然后详细阐述了WSL Ubuntu环境下Git工作流程,包括本地项目目录、Git仓库与远程仓库的关系。针对深度学习项目特点,重点说明为何不应将数据集、模型权重等大文件上传至GitHub,并推荐使用.gitignore文件进行过滤。文章通过四

BLIP-2 通过冻结图像编码器和大语言模型,只训练中间的 Q-Former,实现低成本视觉语言对齐。Q-Former 利用 learnable queries 从图像特征中提取关键信息,再通过两阶段训练完成图文对齐与文本生成适配,是连接视觉模型与 LLM 的经典桥接方案。

摘要 GPT-3论文《Language Models are Few-Shot Learners》开创性地展示了大规模语言模型通过上下文学习(In-Context Learning)的能力。研究表明,当模型参数量达到1750亿时,仅需在prompt中提供任务说明和少量示例(Few-shot),无需微调即可完成多种NLP任务。这种Decoder-only架构的Transformer模型通过单向注意力

这篇文章详细讲解了LLaMA模型的Transformer Block架构,主要包括以下核心内容: LLaMA采用Decoder-only Transformer结构,通过自回归方式预测下一个token。 每层Transformer Block由两个主要部分组成: Attention和 FFN/MLP。RMSNorm,causal attention,旋转位置编码 RoPE,SwiGLU,等








