
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
是一个预训练的语言表征模型。它强调了不再像以往一样采用传统的单向语言模型或者把两个单向语言模型进行浅层拼接的方法进行预训练,而是采用新的masked language model(MLM),以致能生成深度的双向语言表征。BERT论文发表时提及在11个NLP(Natural Language Processing,自然语言处理)任务中获得了新的state-of-the-art的结果推荐链接:其实说白

我们用大模型时 总会遇到 temperature 和 top-p, 现在我们就详细看下 这两个参数是如何工作的提示:以下是本篇文章正文内容,下面案例可供参考1 temperature + top-p 如何影响输出2 为什么是temperature3 工作原理。

CLIP 和 SigLIP 都是由 Google、OpenAI 等顶级团队提出的多模态预训练模型,它们的核心任务都是将图像和文本映射到同一个向量空间,从而实现“看图识字”或“用文字搜图”。CLIP是OpenAI 在 2021 年发表的论文《Learning Transferable Visual Models From Natural Language Supervision》(从自然语言监督中学

自监督学出来的特征既能做全局语义(分类/检索),又能做局部密集任务(分割/匹配/深度)。但作者指出:当你把模型、数据、训练时长都继续放大时,会出现一个“已知但没彻底解决”的问题——dense feature map 在长训练/大模型时会退化(变噪、变糊、结构性崩坏),导致密集任务能力受损。DINOv3 的核心贡献之一就是专门把这个坑填了:提出 Gram anchoring 来“钉住”密集特征质量,

按照笔者之前的行业经验, 数据集的整理是非常重要的, 因此笔者这里增加原文中出现的几个数据集和环境的学习skill 例如:抓取(pick), 放置(place), 推动(pushing), 清扫(sweeping), 堆叠(stacking), 折叠(folding)trajectories 就是action集合:其中数据集合结构图如下:图像分辨率:640×480。

蛋疼的微信动不动就更新,更新了旧的还不能用这里 记录 ubuntu 20.04 安装 微信笔记。
11月工作996压力较大,任务完成后,目前休息了一个月,2025年新的一天继续开始补基础。本章节是单独的 NLP-transformer学习 章节,主要实践了evaluate。同时,最近将学习代码传到:https://github.com/MexWayne/mexwayne_transformers-code,作者的代码版本有些细节我发现到目前不能完全行的通,为了尊重原作者,我这里保持了大部分的内

随着大模型以及大head 的广泛使用, 很多特征需要压缩到 latent space, 然后在通过解码器解码到自己需要的维度.本文就vae 和 rae 进行学习论文链接: https://arxiv.org/pdf/2510.11690提示:以下是本篇文章正文内容,下面案例可供参考本文就是对VAE 用的 loss 原理进行了剖析:1 MSE 的原理和局限2 其他的 loss3 为什么要用 LPIP
继上一篇深扣pi0 ,这里 继续 看下 pi0 fast因为我的工程一直追求实践到机器人上干看论文只有空乏的理论. 我按照惯性一直使用的 lerobot, 我之前用的工程已经没有 pi0 fast, 这里我用之前的工程进行代码和 论文的研读. 代码链接见 https://github.com/MexWayne/mexwayne_lerobot_0605因为 pi0 代码非常简单,所以不详细说明,只

本章节主要是对 transformer 里的tokenizer 进行学习,tokenizer 比较简单,欢迎交流








