logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

DeepSeek V4 的架构详解

如果这一层交替到了HCA (重度压缩注意力),整个流程的矩阵维度变换逻辑几乎完全一致,核心区别在于第一步的序列压缩率HCA 的压缩率m′128m' = 128m′128。1000 个 Token 会被极端压缩成1000128≈81000/128≈8个 KV 块。由于序列极短,HCA完全跳过第四步的稀疏选择,Query 直接与这 8 个全局浓缩块(外加 128 个局部滑动窗口块)进行全局注意力计算

#深度学习
DeepSeek写的小说,prompt 是“写一个搞 大模型AI 的爽文男主小说,写 5 章内容,剧情搞笑好玩”

【代码】DeepSeek写的小说,prompt 是“写一个搞 大模型AI 的爽文男主小说,写 5 章内容,剧情搞笑好玩”

#人工智能
四个经典的深度学习与 Transformer 基础问题

Softmax 函数的作用是将一个包含任意实数的向量(通常是模型最后一层的原始输出 Logits)映射为一个概率分布。这种设计的巧妙之处在于,它通过不同频率的三角函数,让模型不仅能感知绝对位置,还能通过线性组合推导出相对位置关系,同时保持了维度不变。(这是 768 维模型的标准配置,如 BERT-base 或 GPT-2),那么每个头的维度。接着,模型会生成一个维度完全相同的绝对位置编码矩阵。,并

#深度学习#transformer#人工智能
分享一波chatgpt的常用prompt

【代码】分享一波chatgpt的常用prompt。

(顶刊)一种改进的Hypervolume(HV)计算的维简算法

An Improved Dimension-Sweep Algorithm for the Hypervolume Indicator1.摘要本文提出了一种递归的维数扫描算法,用于计算d>2维的n个非支配点质量的超体积指标。 通过对递归树进行剪枝,改进了现有的HSO (Hypervolume by Slicing Objectives)算法,避免了重复的支配检查和部分超体积的重新计算。 此外

怎么把claude code的claude模型的url和key永久设置成自己的

每次打开终端都要手动输入export确实非常繁琐。要让这些配置永久生效,你需要将export命令写入到你电脑终端(Shell)的默认配置文件中。这样,每次打开新的终端窗口时,系统都会自动为你加载这些变量。

#策略模式#python
DeepSeek写的小说,prompt 是“写一个搞 大模型AI 的爽文男主小说,写 5 章内容,剧情搞笑好玩”

【代码】DeepSeek写的小说,prompt 是“写一个搞 大模型AI 的爽文男主小说,写 5 章内容,剧情搞笑好玩”

#人工智能
RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control

RT-2 把动作极其细化了。它让每一次末端执行器的移动、每一次夹爪的收缩,都直接受到拥有数百亿参数的互联网常识模型的控制。这就解释了为什么 RT-2 能展现出惊人的泛化能力——因为它不是在机械地记忆动作,而是在用“大脑的常识”直接指挥“手指的微操”。

#人工智能#transformer#深度学习
VLA 方向代表性工作

如果你正关注 VLA 方向,建议深入研究RT-2 的 Tokenization 方案以及OpenVLA 的开源实现。在数据层面,目前行业趋势正从“昂贵的专家示教”转向“低成本人体穿戴设备采集”+“仿真数据合成”。对于 AI 研究者来说,VLA 的核心难题在于如何建立有效的atπstgat​πst​g映射(其中sss为多模态状态,ggg为目标指令,aaa为动作),并解决长序列推理过程中的误差累积问题

#深度学习#transformer#人工智能
    共 46 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择