
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
如果我们使用神经网络学习,每个节点都会历遍图片中的每一个像素,从而学习整个图片的特征。使用梯度方法来获得最低 loss,对应高数中求一阶导获得函数极值点,hyperparameters 对应参数变化的步长,因为 loss 并不是一个平滑的曲线,而是由一个个画成的,所以如果步长取得过大,可能会错过极值点。parameter sharing(参数共享):例如两个节点,都是对动物的眼睛进行检测,但是一个

我们希望归类只输出 0 和 1,但经过模型输出后 y 可能是任何值,所以我们需要softmax 操作进行归一化并去除负值,softmax 附加的一个效果是能让两个不同的 y 的差值更加的大(例如 1 和 3,经过 softmax 操作后成为 0.1 和 0.9 )在定义 loss 函数之后,我们希望有一个较好的训练集,能让我们在训练集上训练的函数,在测试集上有良好的表现,那我们该如何评价一个训练集

如上图所示,橙色叉叉为 critical point,当步长过大时,很容易导致 loss 值震荡,所以我们不断调小步长,得到右图,右图显然在y 轴梯度较大的情况下能很好的趋近橙色叉叉,但是在 x 轴方向上由于梯度过小,无论做多少次的迭代,只能在 x 轴方向轻微向橙色叉叉靠近。这样的想法非常好,但是同样有一个 bug,它仅仅适用于坡度一致的学习,当我们遇到下图的问题时,沿着 x 轴的方向,不同的 w

从而 generator 为了生成能够满足 discriminator 的图片,生成第二批图片,不断“进化”去满足 discriminator,第二批图像生成之后,discriminator 也会更新,提出更高的要求。这是因为神经网络在一张相似的图片中,既学习到了向左的车辆也学习到了向右的车辆,所以他会认为,同时发生向左向右都是可以的。discriminator 的参数是固定的,固定有一个打分的标

确保请求头包含正确的 API Key。: 流式响应间隔过长,客户端超时断开。: 生产环境建议配置 SSL/TLS。: 模型说话说到一半就没响应了。: 使用强密钥,定期更换。
确保请求头包含正确的 API Key。: 流式响应间隔过长,客户端超时断开。: 生产环境建议配置 SSL/TLS。: 模型说话说到一半就没响应了。: 使用强密钥,定期更换。
节点之间如何传递信息?Agent 需要记住什么?LangGraph 的State是所有节点共享的上下文(Context)。这是它与普通 Chain 的最大区别。必须在写 Node 代码前定义好 State,因为 Node 的输入输出都依赖它。构思要点:是否需要标准的messages列表(User/AI/Tool Message)?是否需要存储检索到的文档 (documents)、生成的草稿 (dr
State 是契约:所有节点(包括路由和功能节点)都需要读写 State。不先定义 State,就不知道节点函数的入参和返回值是什么。Nodes 是目的地:路由器的作用是将流量分发给具体的功能节点。如果你还没写好功能节点,路由器就没有“目的地”可指。Router 是决策者:它依赖于 State 中的历史信息,并决定流向哪些 Nodes。这是整个图的“内存”结构。对于路由架构,通常需要由系统默认的m
LLM训练三板斧,预训练,微调,RHLF。DPO属于是最后环节RHLF中的一个方法,关于RLHF主流方法有PPO,DPO,GROP。关于这三种介绍RLHF方法,我之前分享过对着三种方法的一些思考,有兴趣的同学可以看看。因为DPO对硬件的需求最小,显存占用最低,所以我们先采用DPO进行训练。硬件信息:4070 12g*2 、64g内存、操作系统:Ubuntu24.04、模型:QWEN-3vl-2B(
场景推荐优化器理由大语言模型 (LLM)、Transformer (BERT/GPT)AdamW这是目前的工业界标准。必须配合 Warmup 和 Cosine Decay 使用。计算机视觉 (ResNet/VGG)/ AdamW很多 CV 论文仍偏爱 SGD,认为其泛化极值点更好;但在 ViT (Vision Transformer) 中,AdamW 是主流。稀疏数据 / 简单的 NLPAdam/







