logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

动态规划 解决矩阵链相乘问题

矩阵的乘法定义如下:设A是m×p的矩阵,B是p×n的矩阵,则A与B的乘积为m×n的矩阵,记作C=AB,其中,矩阵C中的第i行第j列元素cij​cij​k1∑p​aik​×bkj​ai1​b1j​ai2​b2j​⋯aip​bpj​当多个矩阵相乘时,采用不同的计算顺序所需的乘法次数不相同。

文章图片
#动态规划#算法#c++
吴恩达机器学习——强化学习理论知识,个人学习笔记

状态-动作 价值函数的定义(Q函数的定义)显然,这是一个关于 状态 和 动作 的函数,其结果为我们在整个决策过程中所获得的价值。这是一个递归的定义。以离散模型进行举例说明Q值的作用:共有6个状态,其中1、6为最终状态。根据回报公式 和 Q函数的定义,可以计算出Q(s, a)值:从上面的例子中,我们发现,计算出每个状态所有可能的Q值,挑选最大的Q值的动作a,则能获得最优策略。贝尔曼方程贝尔曼期望方程

文章图片
#机器学习#人工智能
到底了