logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

神经网络基础[损失函数,bp算法,梯度下降算法 ]

神经网络的损失函数构建,反向传播算法和梯度下降算法的原理

文章图片
#神经网络#算法#人工智能
08_双向循环神经网络

双向循环神经网络(Bidirectional Recurrent Neural Network, BiRNN)通过同时捕捉序列的和依赖关系,增强模型对上下文的理解能力。与传统的单向网络不同,BIRNN 能够同时从过去和未来的上下文信息中学习,从而提升模型的表现。它并没有改变网络本身的内部结构而是将不同方向的序列输入对网络应用两次,再对两次得到的结果进行拼接作为双向网络模型的输出。

文章图片
#人工智能#深度学习#rnn
【强化学习杂记】TD-Learning的数学理解

本文从不动点视角解释了TD(0)算法中TD target更新的合理性。首先指出TD(0)通过TD误差将当前价值估计向TD目标$r_{t+1}+\gamma V(s_{t+1})$收缩,每次更新严格缩小二者距离。然后联系贝尔曼期望方程,说明真实价值函数是TD更新的不动点,TD学习本质是寻找一步推进后自洽的函数。最后从局部收缩、全局算子性质和长期收敛三个层面证明反复迭代会收敛到$V^\pi$。整个分析

#算法#人工智能#机器学习
[强化学习基础03]贝尔曼方程(Bellman Equation)

贝尔曼方程是强化学习的核心数学工具,描述了状态价值函数的递归关系。状态价值函数$v_{\pi}(s)$表示从状态$s$出发遵循策略$\pi$的期望回报,可分解为即时奖励和未来折扣奖励之和。动作价值函数$q_{\pi}(s,a)$则量化特定动作的长期价值。贝尔曼方程建立了状态间的递推关系,其矩阵形式可解析求解,也可通过迭代法收敛。该方程还延伸出最优贝尔曼方程,用于寻找最优策略。示例展示了如何用贝尔曼

#深度学习#人工智能
[强化学习基础05-2] 压缩映射定理

本文介绍了强化学习中的压缩映射定理及其在策略迭代中的应用。压缩映射定理表明,在完备度量空间中,压缩映射存在唯一不动点,可通过迭代收敛求得。在马尔可夫决策过程中,Bellman算子是压缩映射,其不动点即为状态价值函数。文章通过数学推导证明Bellman算子在无穷范数下满足压缩条件(压缩系数为折扣因子γ)。最后以4×4网格世界为例,展示了均匀随机策略下价值函数的迭代更新过程,直观演示了压缩映射定理在强

文章图片
#人工智能
模型训练实用之梯度检查点

以时间换空间,是训练大模型的必备技术。尽管会牺牲部分计算效率,但在显存不足时,它是实现模型训练的唯一可行方案。结合混合精度、梯度累积等技术,可进一步提升资源利用率。通过这种方式,内存占用减少50%,但计算量增加约33%(需额外进行一次前向计算)。,并在反向传播时重新计算未保存的激活值,从而减少内存需求。

#深度学习#人工智能#机器学习 +1
00-k8s入门介绍

Kubernetes是一个开源的容器编排平台,用于自动化部署、扩展和管理容器化应用。它解决了容器管理中的关键问题,如服务发现、负载均衡、存储编排、自动修复和水平扩展等。与传统虚拟化不同,Kubernetes在容器层面运行,提供更轻量级的资源隔离和更高的可移植性。不同于PaaS平台,Kubernetes不限制应用类型,而是提供基础架构支持开发者灵活构建。其发展源于从物理服务器到虚拟机再到容器的演进历

#kubernetes#容器#云原生
[强化学习基础05-2] 压缩映射定理

本文介绍了强化学习中的压缩映射定理及其在策略迭代中的应用。压缩映射定理表明,在完备度量空间中,压缩映射存在唯一不动点,可通过迭代收敛求得。在马尔可夫决策过程中,Bellman算子是压缩映射,其不动点即为状态价值函数。文章通过数学推导证明Bellman算子在无穷范数下满足压缩条件(压缩系数为折扣因子γ)。最后以4×4网格世界为例,展示了均匀随机策略下价值函数的迭代更新过程,直观演示了压缩映射定理在强

文章图片
#人工智能
神经网络基础[ANN网络的搭建]

精度高,性能优于其他的机器学习算法,甚至在某些领域超过了人类可以近似任意的非线性函数近年来在学界和业界受到了热捧,有大量的框架和库可供调。

文章图片
#神经网络#网络#人工智能
模型训练实用之梯度检查点

以时间换空间,是训练大模型的必备技术。尽管会牺牲部分计算效率,但在显存不足时,它是实现模型训练的唯一可行方案。结合混合精度、梯度累积等技术,可进一步提升资源利用率。通过这种方式,内存占用减少50%,但计算量增加约33%(需额外进行一次前向计算)。,并在反向传播时重新计算未保存的激活值,从而减少内存需求。

#深度学习#人工智能#机器学习 +1
    共 13 条
  • 1
  • 2
  • 请选择