logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

自动驾驶强化学习

可提供的服务

暂无可提供的服务

【学习强化学习】八、连续动作下的DQN设计

文章目录参考资料思路1思路2思路34. 练习1. Q-learning相比于policy gradient based方法为什么训练起来效果更好,更平稳?参考资料https://datawhalechina.github.io/easy-rl/#/chapter8/chapter8思路1a=arg⁡max⁡aQ(s,a)a=\arg \max _{a} Q(s, a) a=argamax​Q(s,

#机器学习#深度学习#算法
【学习强化学习】十一、Soft Actor-Critic

Soft Actor-Critic (SAC)是面向Maximum Entropy Reinforcement learning 开发的一种off policy算法,和DDPG相比,Soft Actor-Critic使用的是随机策略stochastic policy,相比确定性策略具有一定的优势。Soft Actor-Critic兼具稳定性高和样本利用率高的优点。......

#人工智能#python#机器学习
在 Mac/linux 的 VSCode 中使用Remote-SSH远程连接 Windows

最近遇到了一个需求,我的代码仓库放在 Windows 上,想在 Mac 的 VSCode 中直接打开它、编辑、运行、调试。直接连接windows 的ssh 连接ip 地址没法连接成功,后来发现原来是还有些工具需要安装。Mac 与 Windows 必须处于同一个局域网,否则就需要利用内网穿透等一些方法去配置。

#macos#linux#vscode +1
【周志华机器学习】十四、概率图模型

文章目录参考资料1. 基本概念2. 隐马尔可夫模型(HMM)2.1 隐马尔可夫三大问题1. 第一个问题解法2. 第二个问题解法3. 第三个问题解法3.马尔可夫随机场(MRF)3.1 MRF性质3.2 势函数4. 条件随机场(CRF)5. 学习与推断5.1 变量消去5.2 信念传播6. LDA话题模型7. 后记7.1 EM算法、HMM、CRF的比较参考资料Machine-learning-learn

#机器学习#人工智能
【机器学习】门控循环单元(GRU)

文章目录1. GRU2. ⻔控循环单元2.1 重置门和更新门2.2 候选隐藏状态2.3 隐藏状态1. GRU在循环神经⽹络中的梯度计算⽅法中,我们发现,当时间步数较⼤或者时间步较小时,循环神经⽹络的梯度较容易出现衰减或爆炸。虽然裁剪梯度可以应对梯度爆炸,但⽆法解决梯度衰减的问题。通常由于这个原因,循环神经⽹络在实际中较难捕捉时间序列中时间步距离较⼤的依赖关系。**门控循环神经⽹络(gated re

#机器学习#人工智能
【周志华机器学习】八、集成学习

文章目录参考资料1. 基本概念1.1 个体与集成2. Boosting3. Bagging4.随机森林5. 结合策略5.1 平均法(回归问题)5.2 投票法(分类问题)5.3 学习法6. 多样性(diversity)7. 后记7.1 随机森林分类效果的影响因素7.2 随机森林有什么优缺点7.3 随机森林如何处理缺失值?7.4 什么是OOB?随机森林中OOB是如何计算的,它有什么优缺点?7.5 随机

#机器学习#人工智能#集成学习
【周志华机器学习】九、聚类

文章目录参考资料1. 基本概念1.1 距离度量1.2性能度量1.2.1 外部指标1.2.2 内部指标参考资料Machine-learning-learning-notesLeeML-NotesML-NLP本博客是根据周志华的西瓜书和参考资料1、2、3所做的笔记,主要用于学习,非技术类博客,因此存在大量复制粘贴,请见谅。如果本篇博客有后记部分,则该部分表示的是在书本原有的基础知识上,进行的知识点的扩

#机器学习#人工智能#聚类
nndl-复旦-神经网络与深度学习笔记第二章习题

第二章习题习题 2-1 分析为什么平方损失函数不适用于分类问题.分类问题中的标签,是没有连续的概念的。每个标签之间的距离也是没有实际意义的,所以预测值 和 标签两个向量之间的平方差这个值不能反应分类这个问题的优化程度。假设分类问题的类别是1,2,3那么对于一个真实类别为2的样本X,模型的分类结果是 1 或 3,平方损失函数得到的结果都一样,显然不适合。解:yn维数为1∗1;wn和wn维数为n∗1&

#神经网络#深度学习#机器学习
【机器学习】长短时记忆网络(LSTM)

文章目录1. 基本概念2. 长短时记忆网络的前向计算2.1 门2.2 遗忘门1. 基本概念长短时记忆网络(Long Short Term Memory Network, LSTM),它成功的解决了原始循环神经网络的缺陷,成为当前最流行的RNN,在语音识别、图片描述、自然语言处理等许多领域中成功应用。原始RNN无法处理长距离依赖,原始RNN的隐藏层只有一个状态,即h,它对于短期的输入非常敏感。长短时

#机器学习#人工智能
【周志华机器学习】四、决策树

文章目录参考资料1. 基本概念2. 决策树的构造3.ID3算法(使用信息增益)4. C4.5算法(使用增益率)5. CART算法(使用基尼系数)三种不同的决策树算法小结6. 剪枝处理7. 连续值与缺失值处理7.1 连续值处理7.2 缺失值处理8. 后记1. 树形结构为什么不需要归一化?2. 分类决策树和回归决策树的区别参考资料Machine-learning-learning-notesLeeML

#机器学习#人工智能#决策树
    共 128 条
  • 1
  • 2
  • 3
  • 13
  • 请选择