
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
A 局部最优梯度=0,Loss 较高动量、随机初始化、更深网络 B 梯度消失梯度≈0,Loss 高(平台区)ReLU、残差连接、批归一化 C 鞍点某些方向梯度为 0 动量、Adam 优化器 D 全局最优梯度=0,Loss。Adam+正确正则泛化好,收敛快计算略多大模型,Transformer,推荐默认。动量+自适应快速收敛,易用泛化略差默认首选,NLP,快速实验。:降采样操作,减少特征图尺寸,增强
本质:直接将原本用于处理文字的架构迁移到图像领域。跨界逻辑:把图片看作一篇文章,把图像块(Patches)看作单词(Words)。ViT 的出现不仅是换了一个算法,它代表了视觉与语言处理在架构上的大统一。这种统一性正是目前多模态大模型(如 GPT-4V、Gemini)能够同时理解图片和文字的技术根基。接下来,你想尝试从代码层面看看如何用 PyTorch 实现一个简单的 Patch Embeddin
规则:用维度等于类别总数的二进制向量表示离散类别。仅对应索引位置为1(激活),其余全为0(抑制)。示例:3 个类别(红、黄、蓝) $\to$ 3 维向量。红=[1,0,0], 黄=[0,1,0], 蓝=[0,0,1]。权重共享要分清“目标侧绑定”(通用)和“跨语言共享”(仅限同源语言)。One-Hot是理解 Embedding 查找机制的基石。Dropout的核心是倒置实现和打破共适应。代码层面明
1. 选 CNN 的场景:只有几千或几万张图。比如手机端、嵌入式设备的实时推理。基础的目标检测、分类。2. 选 Transformer 的场景:拥有百万级以上的标注数据。比如“以文生图”或“视频理解”,Transformer 是跨模态的通用语言。在算力和数据充足的情况下,Transformer 的上限通常高于 CNN。现在的技术趋势不再是“你死我活”,而是“双向奔赴”。例如引入了 CNN 的层次化
暴力回归:不再“找框”,而是将图片划分为网格(Grid Cell),每个网格直接预测 $(x, y, w, h)$ 和类别概率。通过双线性插值取代取整操作,解决了特征图与原图的对齐问题,实现了精确的实例分割。优势:在预测时能看到物体的上下文信息(例如:因为看到了水,所以判断这更可能是鸭子而不是鸡),极大减少了背景误报。技术的本质是博弈:深度与速度的博弈(R-CNN vs YOLO),全局语义与局部
Hypernetwork → 动态生成 mask 分类器Sigmoid → 多 mask 独立像素预测SAMv3 → Cross-modal attention(文本 + 图像)SAM3D → 3D/时空 attention + voxel mask。
👉 Diffusion 的本质(为什么不需要 KL) 👉 score matching 与噪声建模 👉 Latent Diffusion 完整链路。👉 VAE:在“表达能力 vs 信息压缩”之间做权衡 👉 VQ-VAE:放弃压缩约束,保证信息稳定,用离散结构替代。q(z|x) → 接近统一分布 → 不同 x 的 z 更相似 → 区分能力下降 → 信息减少。明确了 posterior co
下面给你做一份结构化学习总结(偏工程+原理融合版),把今天关于 GAN → WGAN → Diffusion 的关键认知全部串起来,方便你后续复习和扩展。目标:生成数据 方法:对抗训练 问题:不稳定 + collapse 根因:JS散度。你今天完成了从“会用生成模型”到“理解生成模型为什么这样设计”的关键跃迁。Diffusion的成功,本质是: 把“生成问题”转化成“去噪回归问题”检测模型 → 表
各大模型(豆包、即梦、ChatGPT、Grok)不是同一个模型,但采用相似技术范式。序列建模(Transformer / Decision Transformer)今天完成了从“理解生成图像”到“理解生成模型在智能系统中的作用”的认知跃迁。三、Diffusion 工程落地(Stable Diffusion)Diffusion(U-Net):在 latent 空间进行去噪生成。建立对 Diffusi
学习从噪声到数据分布的连续演化过程Diffusion 通过学习一个连续的去噪过程,将随机噪声逐步转化为符合数据分布的图像,并通过条件在每一步调控生成方向,实现稳定且可控的生成能力。







