
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
涵盖了 **Attention 机制原理、PyTorch Profiling 性能分析、显存优化** 以及 **数值调试技巧**。这四个模块并非孤立存在,它们共同构成了 **“LLM 底层系统工程”** 的基石。要从“学会知识点”进阶到“构建体系化能力”,需要将这四块内容重组为一条 **“正确性 → 可观测性 → 效率上限”** 的工程闭环。
本文提出DEIM框架,通过改进DETR模型的训练策略加速收敛。针对DETR中一对一匹配(O2O)存在的正样本稀疏和低质量匹配问题,DEIM采用两种创新方法:1)密集O2O匹配,通过数据增强增加目标数量从而提升正样本数量;2)匹配感知损失(MAL),优化不同质量匹配的梯度分配。实验表明,DEIM能将RT-DETR和D-FINE的训练时间减少50%的同时提升精度(如ResNet50模型单卡一天训练达5

**OOD 与 OSR 的内在关联**:两者本质上处理不同类型的分布偏移(OOD 侧重协变量偏移,OSR 侧重语义偏移),但方法性能高度相关,可交叉应用。幅度敏感的评分规则(如 MLS、Energy)优于传统方法(如 MSP、ODIN),因其利用特征幅度差异,对分布偏移更鲁棒。OE 在小规模基准中表现优异,但依赖辅助数据与测试数据的分布重叠,大规模场景下泛化性不足。传统小规模基准未分离语义与协变量

本文提出LLM系统工程的四大核心模块(KV Cache、混合精度/Tensor Core、Profiling、FlashAttention)体系化学习方法,构建"精度-显存-算力"三角权衡模型作为顶层框架。文章提出三维认知体系:1)建立数据流全栈视图,标注各环节数据类型/存储位置;2)培养显存估算、Profiling诊断、硬件特性等基础能力;3)选择FlashAttention内核或KV Cach
涵盖了 **Attention 机制原理、PyTorch Profiling 性能分析、显存优化** 以及 **数值调试技巧**。这四个模块并非孤立存在,它们共同构成了 **“LLM 底层系统工程”** 的基石。要从“学会知识点”进阶到“构建体系化能力”,需要将这四块内容重组为一条 **“正确性 → 可观测性 → 效率上限”** 的工程闭环。
近年来,基于transformer的端到端检测器(DETRs)取得了令人瞩目的进展。然而,DETRs的高计算成本问题并没有得到有效解决,这限制了它们的实际应用,并阻碍了它们充分利用无后处理的好处,如非最大抑制(NMS)。本文首先分析了现代实时目标检测器中NMS对推理速度的影响,并建立了端到端的速度基准。为了避免NMS造成的推理延迟,本文提出了实时检测变压器(RT-DETR),这是本文所知的第一个实

开放集识别的核心问题是传统深度学习模型在封闭集下工作,无法处理未知类。论文提出的 OpenMax 方法通过引入新的层来估计未知类的概率。利用倒数第二层的激活向量,结合元识别和极值理论来估计未知概率。OpenMax 修改了 SoftMax 层,允许未知类的存在。数学原理部分可能涉及 Weibull 分布的拟合,用于计算输入属于已知类的概率,从而估计未知类的概率。涉及特征空间中的距离度量,而非像素空间

相似的,对于卷积层输出的特征图也能够看成是不同频率分量的组合,对于输出特征图的低频部分,每一个位置都独立的储存着自己的特征描述子,而忽略了那些可以共同储存和处理的相邻区域的特征描述子,这就造成了在进行卷积运算时不必要的计算量的产生,因此可以将经过卷积层处理后的特征图分解成不同频率的两个部分,在卷积神经网络中,传统的卷积方式是使用一定大小的卷积核上的每一个元素乘以原图片或特征图上相应位置的特征值,最

开发大模型相关应用,其技术核心点虽然在大语言模型上,但一般通过调用 API 或开源模型来实现核心的理解与生成,通过 Prompt Enginnering 来实现大语言模型的控制,因此,虽然大模型是深度学习领域的集大成之作,大模型开发却更多是一个。作为重要的研究方向之一,语言模型得到了学术界的广泛研究,从早期的统计语言模型和神经语言模型开始,发展到基于Transformer的预训练语言模型。Chat









