
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
如果这一层交替到了HCA (重度压缩注意力),整个流程的矩阵维度变换逻辑几乎完全一致,核心区别在于第一步的序列压缩率HCA 的压缩率m′128m' = 128m′128。1000 个 Token 会被极端压缩成1000128≈81000/128≈8个 KV 块。由于序列极短,HCA完全跳过第四步的稀疏选择,Query 直接与这 8 个全局浓缩块(外加 128 个局部滑动窗口块)进行全局注意力计算
【代码】DeepSeek写的小说,prompt 是“写一个搞 大模型AI 的爽文男主小说,写 5 章内容,剧情搞笑好玩”
Softmax 函数的作用是将一个包含任意实数的向量(通常是模型最后一层的原始输出 Logits)映射为一个概率分布。这种设计的巧妙之处在于,它通过不同频率的三角函数,让模型不仅能感知绝对位置,还能通过线性组合推导出相对位置关系,同时保持了维度不变。(这是 768 维模型的标准配置,如 BERT-base 或 GPT-2),那么每个头的维度。接着,模型会生成一个维度完全相同的绝对位置编码矩阵。,并
【代码】分享一波chatgpt的常用prompt。
An Improved Dimension-Sweep Algorithm for the Hypervolume Indicator1.摘要本文提出了一种递归的维数扫描算法,用于计算d>2维的n个非支配点质量的超体积指标。 通过对递归树进行剪枝,改进了现有的HSO (Hypervolume by Slicing Objectives)算法,避免了重复的支配检查和部分超体积的重新计算。 此外
每次打开终端都要手动输入export确实非常繁琐。要让这些配置永久生效,你需要将export命令写入到你电脑终端(Shell)的默认配置文件中。这样,每次打开新的终端窗口时,系统都会自动为你加载这些变量。
【代码】DeepSeek写的小说,prompt 是“写一个搞 大模型AI 的爽文男主小说,写 5 章内容,剧情搞笑好玩”
RT-2 把动作极其细化了。它让每一次末端执行器的移动、每一次夹爪的收缩,都直接受到拥有数百亿参数的互联网常识模型的控制。这就解释了为什么 RT-2 能展现出惊人的泛化能力——因为它不是在机械地记忆动作,而是在用“大脑的常识”直接指挥“手指的微操”。
如果你正关注 VLA 方向,建议深入研究RT-2 的 Tokenization 方案以及OpenVLA 的开源实现。在数据层面,目前行业趋势正从“昂贵的专家示教”转向“低成本人体穿戴设备采集”+“仿真数据合成”。对于 AI 研究者来说,VLA 的核心难题在于如何建立有效的atπstgatπstg映射(其中sss为多模态状态,ggg为目标指令,aaa为动作),并解决长序列推理过程中的误差累积问题







