
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
目录tf.keras.lossesfrom_logits=True 的作用tf.keras.lossesfrom_logits=True 的作用以 SparseCategoricalCrossentropy(from_logits=True) 为例,读keras源码,发现 losses.py 中定义的 SparseCategoricalCrossentropy 实际上调用的是 backend.py
目录Actor-Critic 方法QAC 算法Advantage Actor-Critic 算法Baseline invarianceOff-policy Actor-Critic重要性采样Deterministic Policy Gradient (DPG)系列笔记:【强化学习的数学原理】课程笔记–1(基本概念,贝尔曼公式)【强化学习的数学原理】课程笔记–2(贝尔曼最优公式,值迭代与策略迭代)【
当从状态 s 出发时,discounted return的期望值(从一个state出发,可能有多条路径到达terminal/或称多条trajectory,对所有可能的trajectory的discounted return求期望)State Value 是指从一个 state 出发的 average return,而 Action Value 是指从一个 state 出发,,eg:上图中第一个re
例如:1.对于同样一个prompt,给出三种不同回答的场景,这个prompt的 KV 就可以在三个数据中都使用,而不用复制三份,即虽然虚拟内存上看是有三份,但这三份在物理内存上都指向一份,实际只消耗了一份内存。2. 在 beam search 场景,top k 的序列往往有很多前置 token 是相同的,这些也可以用类似上面的方法,即虚拟内存各占各的,但相同 token 的在物理内存上指向同一份。
循环神经网络循环神经网络参数量梯度不稳定性(长程依赖)本文是邱锡鹏教授撰写的《神经网络与深度学习》一书中 第6章:循环神经网络 的读书笔记,主要内容是一些本人觉得比较值得记录的内容,中间也会包括一些拓展和思考。循环神经网络传统的前馈神经网络在处理带有时序的数据(例如文本,语音等)时往往能力有限:1. 由于其全连接的结构使得无法学到数据的时序信息,2. 时序数据的输入长度通常是不定的,而前馈神经网络
目录值函数近似一个例子TD 算法的值函数近似形式Sarsa, Q-learning 的值函数近似形式Deep Q-learningexperience replay策略梯度方法(Policy Gradient)Policy Gradient 的目标函数目标函数 1目标函数 2两种目标函数的同一性Policy Gradient 目标函数的梯度Policy Gradient 目标函数梯度的统一形式di
目录注意力评分函数基于循环神经网络的seq2seq模型本文是邱锡鹏教授撰写的《神经网络与深度学习》一书中 第8章:注意力机制与外部记忆 的读书笔记,主要内容是一些本人觉得比较值得记录的内容,中间也会包括一些拓展和思考。注意力评分函数以下为注意力机制的流程图,查询 q\boldsymbol qq 通过注意力评分函数 aaa 与键 k\boldsymbol kk 作用,并通过softmax得到对应 k
目录值函数近似一个例子TD 算法的值函数近似形式Sarsa, Q-learning 的值函数近似形式Deep Q-learningexperience replay策略梯度方法(Policy Gradient)Policy Gradient 的目标函数目标函数 1目标函数 2两种目标函数的同一性Policy Gradient 目标函数的梯度Policy Gradient 目标函数梯度的统一形式di
目录注意力评分函数基于循环神经网络的seq2seq模型本文是邱锡鹏教授撰写的《神经网络与深度学习》一书中 第8章:注意力机制与外部记忆 的读书笔记,主要内容是一些本人觉得比较值得记录的内容,中间也会包括一些拓展和思考。注意力评分函数以下为注意力机制的流程图,查询 q\boldsymbol qq 通过注意力评分函数 aaa 与键 k\boldsymbol kk 作用,并通过softmax得到对应 k
目录注意力评分函数基于循环神经网络的seq2seq模型本文是邱锡鹏教授撰写的《神经网络与深度学习》一书中 第8章:注意力机制与外部记忆 的读书笔记,主要内容是一些本人觉得比较值得记录的内容,中间也会包括一些拓展和思考。注意力评分函数以下为注意力机制的流程图,查询 q\boldsymbol qq 通过注意力评分函数 aaa 与键 k\boldsymbol kk 作用,并通过softmax得到对应 k







