logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

llm-algo-1

涵盖了 **Attention 机制原理、PyTorch Profiling 性能分析、显存优化** 以及 **数值调试技巧**。这四个模块并非孤立存在,它们共同构成了 **“LLM 底层系统工程”** 的基石。要从“学会知识点”进阶到“构建体系化能力”,需要将这四块内容重组为一条 **“正确性 → 可观测性 → 效率上限”** 的工程闭环。

【读点论文】DEIM: DETR with Improved Matching for Fast Convergence一个不改架构、只改匹配策略 + 损失函数 + 训练调度的可插拔训练框架

本文提出DEIM框架,通过改进DETR模型的训练策略加速收敛。针对DETR中一对一匹配(O2O)存在的正样本稀疏和低质量匹配问题,DEIM采用两种创新方法:1)密集O2O匹配,通过数据增强增加目标数量从而提升正样本数量;2)匹配感知损失(MAL),优化不同质量匹配的梯度分配。实验表明,DEIM能将RT-DETR和D-FINE的训练时间减少50%的同时提升精度(如ResNet50模型单卡一天训练达5

文章图片
#目标检测
【读点论文】Dissecting Out-of-Distribution Detection and Open-Set Recognition,分离语义偏移与协变量偏移,提供了可复现的实验框架

**OOD 与 OSR 的内在关联**:两者本质上处理不同类型的分布偏移(OOD 侧重协变量偏移,OSR 侧重语义偏移),但方法性能高度相关,可交叉应用。幅度敏感的评分规则(如 MLS、Energy)优于传统方法(如 MSP、ODIN),因其利用特征幅度差异,对分布偏移更鲁棒。OE 在小规模基准中表现优异,但依赖辅助数据与测试数据的分布重叠,大规模场景下泛化性不足。传统小规模基准未分离语义与协变量

文章图片
llm-algo-3

本文提出LLM系统工程的四大核心模块(KV Cache、混合精度/Tensor Core、Profiling、FlashAttention)体系化学习方法,构建"精度-显存-算力"三角权衡模型作为顶层框架。文章提出三维认知体系:1)建立数据流全栈视图,标注各环节数据类型/存储位置;2)培养显存估算、Profiling诊断、硬件特性等基础能力;3)选择FlashAttention内核或KV Cach

llm-algo-1

涵盖了 **Attention 机制原理、PyTorch Profiling 性能分析、显存优化** 以及 **数值调试技巧**。这四个模块并非孤立存在,它们共同构成了 **“LLM 底层系统工程”** 的基石。要从“学会知识点”进阶到“构建体系化能力”,需要将这四块内容重组为一条 **“正确性 → 可观测性 → 效率上限”** 的工程闭环。

【读点论文】DETRs Beat YOLOs on Real-time Object Detection,detr也能实时目标检测,去除了NMS耗时操作,混合编码器加上IOU感知查询助力检测

近年来,基于transformer的端到端检测器(DETRs)取得了令人瞩目的进展。然而,DETRs的高计算成本问题并没有得到有效解决,这限制了它们的实际应用,并阻碍了它们充分利用无后处理的好处,如非最大抑制(NMS)。本文首先分析了现代实时目标检测器中NMS对推理速度的影响,并建立了端到端的速度基准。为了避免NMS造成的推理延迟,本文提出了实时检测变压器(RT-DETR),这是本文所知的第一个实

文章图片
#人工智能#计算机视觉
【读点论文】Towards Open Set Deep Networks计算每个类别的激活向量均值,用Weibull分布拟合激活向量与均值距离,计算输入属于该类的 离群概率,引入未知类的伪激活

开放集识别的核心问题是传统深度学习模型在封闭集下工作,无法处理未知类。论文提出的 OpenMax 方法通过引入新的层来估计未知类的概率。利用倒数第二层的激活向量,结合元识别和极值理论来估计未知概率。OpenMax 修改了 SoftMax 层,允许未知类的存在。数学原理部分可能涉及 Weibull 分布的拟合,用于计算输入属于已知类的概率,从而估计未知类的概率。涉及特征空间中的距离度量,而非像素空间

文章图片
#算法
基于深度学习的铁路异物侵限检测算法研究_整体认知感觉欠点意思,但是有一个新的变形卷积-Octave 卷积

相似的,对于卷积层输出的特征图也能够看成是不同频率分量的组合,对于输出特征图的低频部分,每一个位置都独立的储存着自己的特征描述子,而忽略了那些可以共同储存和处理的相邻区域的特征描述子,这就造成了在进行卷积运算时不必要的计算量的产生,因此可以将经过卷积层处理后的特征图分解成不同频率的两个部分,在卷积神经网络中,传统的卷积方式是使用一定大小的卷积核上的每一个元素乘以原图片或特征图上相应位置的特征值,最

文章图片
#深度学习#算法#人工智能
跟着DW学习大语言模型-了解一些历史渊源

开发大模型相关应用,其技术核心点虽然在大语言模型上,但一般通过调用 API 或开源模型来实现核心的理解与生成,通过 Prompt Enginnering 来实现大语言模型的控制,因此,虽然大模型是深度学习领域的集大成之作,大模型开发却更多是一个。作为重要的研究方向之一,语言模型得到了学术界的广泛研究,从早期的统计语言模型和神经语言模型开始,发展到基于Transformer的预训练语言模型。Chat

文章图片
#学习#语言模型#人工智能
    共 171 条
  • 1
  • 2
  • 3
  • 18
  • 请选择