logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

keras.losses中from_logits的作用

目录tf.keras.lossesfrom_logits=True 的作用tf.keras.lossesfrom_logits=True 的作用以 SparseCategoricalCrossentropy(from_logits=True) 为例,读keras源码,发现 losses.py 中定义的 SparseCategoricalCrossentropy 实际上调用的是 backend.py

#keras#tensorflow#深度学习
【强化学习的数学原理】课程笔记--6(Actor-Critic方法)

目录Actor-Critic 方法QAC 算法Advantage Actor-Critic 算法Baseline invarianceOff-policy Actor-Critic重要性采样Deterministic Policy Gradient (DPG)系列笔记:【强化学习的数学原理】课程笔记–1(基本概念,贝尔曼公式)【强化学习的数学原理】课程笔记–2(贝尔曼最优公式,值迭代与策略迭代)【

#机器学习
【强化学习的数学原理】课程笔记--1(基本概念,贝尔曼公式)

当从状态 s 出发时,discounted return的期望值(从一个state出发,可能有多条路径到达terminal/或称多条trajectory,对所有可能的trajectory的discounted return求期望)State Value 是指从一个 state 出发的 average return,而 Action Value 是指从一个 state 出发,,eg:上图中第一个re

#机器学习
LLM推理--vLLM解读

例如:1.对于同样一个prompt,给出三种不同回答的场景,这个prompt的 KV 就可以在三个数据中都使用,而不用复制三份,即虽然虚拟内存上看是有三份,但这三份在物理内存上都指向一份,实际只消耗了一份内存。2. 在 beam search 场景,top k 的序列往往有很多前置 token 是相同的,这些也可以用类似上面的方法,即虚拟内存各占各的,但相同 token 的在物理内存上指向同一份。

#深度学习
神经网络与深度学习5---循环神经网络

循环神经网络循环神经网络参数量梯度不稳定性(长程依赖)本文是邱锡鹏教授撰写的《神经网络与深度学习》一书中 第6章:循环神经网络 的读书笔记,主要内容是一些本人觉得比较值得记录的内容,中间也会包括一些拓展和思考。循环神经网络传统的前馈神经网络在处理带有时序的数据(例如文本,语音等)时往往能力有限:1. 由于其全连接的结构使得无法学到数据的时序信息,2. 时序数据的输入长度通常是不定的,而前馈神经网络

#神经网络#深度学习#rnn
【强化学习的数学原理】课程笔记--5(值函数近似,策略梯度方法)

目录值函数近似一个例子TD 算法的值函数近似形式Sarsa, Q-learning 的值函数近似形式Deep Q-learningexperience replay策略梯度方法(Policy Gradient)Policy Gradient 的目标函数目标函数 1目标函数 2两种目标函数的同一性Policy Gradient 目标函数的梯度Policy Gradient 目标函数梯度的统一形式di

#机器学习
神经网络与深度学习7---注意力机制与seq2seq模型

目录注意力评分函数基于循环神经网络的seq2seq模型本文是邱锡鹏教授撰写的《神经网络与深度学习》一书中 第8章:注意力机制与外部记忆 的读书笔记,主要内容是一些本人觉得比较值得记录的内容,中间也会包括一些拓展和思考。注意力评分函数以下为注意力机制的流程图,查询 q\boldsymbol qq 通过注意力评分函数 aaa 与键 k\boldsymbol kk 作用,并通过softmax得到对应 k

#深度学习
【强化学习的数学原理】课程笔记--5(值函数近似,策略梯度方法)

目录值函数近似一个例子TD 算法的值函数近似形式Sarsa, Q-learning 的值函数近似形式Deep Q-learningexperience replay策略梯度方法(Policy Gradient)Policy Gradient 的目标函数目标函数 1目标函数 2两种目标函数的同一性Policy Gradient 目标函数的梯度Policy Gradient 目标函数梯度的统一形式di

#机器学习
神经网络与深度学习7---注意力机制与seq2seq模型

目录注意力评分函数基于循环神经网络的seq2seq模型本文是邱锡鹏教授撰写的《神经网络与深度学习》一书中 第8章:注意力机制与外部记忆 的读书笔记,主要内容是一些本人觉得比较值得记录的内容,中间也会包括一些拓展和思考。注意力评分函数以下为注意力机制的流程图,查询 q\boldsymbol qq 通过注意力评分函数 aaa 与键 k\boldsymbol kk 作用,并通过softmax得到对应 k

#深度学习
神经网络与深度学习7---注意力机制与seq2seq模型

目录注意力评分函数基于循环神经网络的seq2seq模型本文是邱锡鹏教授撰写的《神经网络与深度学习》一书中 第8章:注意力机制与外部记忆 的读书笔记,主要内容是一些本人觉得比较值得记录的内容,中间也会包括一些拓展和思考。注意力评分函数以下为注意力机制的流程图,查询 q\boldsymbol qq 通过注意力评分函数 aaa 与键 k\boldsymbol kk 作用,并通过softmax得到对应 k

#深度学习
    共 14 条
  • 1
  • 2
  • 请选择