
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
为了方便理解记忆,在此总结归纳(阐述的思维逻辑:会给出大的结构类型,后续会继续整理对应的代表方法。LLM结构类型:自回归模型(AR)扩散语言模型(DLMs)|-连续空间DLMs|-离散空间DLMs|-混合AR-DLMs。
我们介绍了第一代推理模型,DeepSeek-R1-Zero和DeepSeek-Rl。DeepSeek-Rl-Zero是通过大规模增强学习(RL)训练的模型,而无需超级微调(SFT)作为初步的步骤,表明了出色的推理能力。通过RL,DeepSeek-R1-Zero自然而然地出现了许多强大而有趣的推理行为。但是,它遇到了挑战,例如不良的可读性和语言混合。为了解决这些问题并进一步提高推理性能,我们介绍了D
开源大型语言模型(LLMs)的快速发展确实引人注目。然而,先前文献中描述的缩放定律(scaling laws)得出了不同的结论,这给 LLMs 的规模化带来了阴影。我们深入研究了缩放定律,并提出了我们独特的发现,这些发现有助于在两种流行的开源配置——7B 和 67B 上实现大规模模型的扩展。在缩放定律的指导下,我们推出了 DeepSeek LLM,这是一个致力于以长远眼光推进开源语言模型发展的项目
我们发布了 DeepSeek-V2,这是一款具有经济化训练与高效推理特点的强大 Mixture-of-Experts(MoE)语言模型。其总参数量为 2360 亿,其中每个 token 仅激活 210 亿 参数,并支持 128K tokens 的上下文长度。DeepSeek-V2 采用了包括多头潜在注意力(MLA)和【2】在内的创新架构。MLA 通过将 Key-Value(KV)缓存显著压缩为潜在
我们提出了 DeepSeek-V3,一种强大的混合专家(MoE)语言模型,具有 671B 总参数,其中每个 token 激活 37B 参数。为了实现高效推理和具有成本效益的训练,DeepSeek-V3 采用了在 DeepSeek-V2 中经过充分验证的多头潜在注意力(MLA)和 DeepSeekMoE 架构。此外,DeepSeek-V3 首创了一种无辅助损失的负载平衡策略,并设置了多 token
1 旋转IOU"""2019.7.4 计算旋转的iou"""#coding=utf-8from __future__ import absolute_importfrom __future__ import divisionfrom __future__ import print_functionimport osimport numpy as npimport cv2...
本文系统梳理了Transformer模型中的位置编码方法。首先介绍了绝对位置编码(正弦编码和可学习编码)及其局限性;然后阐述了相对位置编码(T5式)的优势;重点分析了旋转位置编码(RoPE)的数学原理,通过复数旋转操作巧妙实现相对位置编码;最后总结了位置编码外推技术(ALiBi、PI、NTK-aware、YaRN),这些方法通过插值、动态调整等技术使模型能处理超长序列。
1 对目标数量,占比的统计2 对目标尺寸(长,宽及面积的箱型图)统计时你只需要修改对应目标的字典即可(下载STLITI.TTF字体格式,放到当前位置,替换fname中的位置)# encoding:utf-8""""#20200331 统计目标检测中的数据,需要输入dota格式的标签x1,y1....x4,y4,category"""import numpy as npimport osimport
1 目标检测算法的历程二 目标检测算法基本流程传统算法:下面绿色线的流程DL:橙色线的流程,到时one-stage与two-stage到时就在橙色框中进行相应的结构调整。...
我们呈现OLMo 2,这是我们下一代的“完全开放”语言模型。OLMo 2 包含一系列稠密自回归语言模型,规模涵盖7B、13B 和 32B,并完整公开全部研发产物——模型权重、完整训练数据、训练代码与配方、训练日志以及数千个中间检查点。在本工作中,我们描述了经过修改的模型架构与训练方案,重点介绍用于实现更高训练稳定性与更高每 token 训练效率的技术。我们更新后的预训练数据混合方式中引入了一种新的







