从零开始的推荐系统学习之路(十一)---- 动手学深度学习系列 从零实现L2正则化 & 从零实现DropOut丢弃法
·
文章目录
前引
这个课程真的很好 通过自己不停的去写代码 复现的过程中
会发现如果自己去复现 必须要自己完整理解核心过程 才能实现出来 从中又能学到很多东西
我觉得一句话特别好 纸上得来终觉浅 绝知此事要躬行
就是这样的
从零开始的推荐系统学习之路(十一)---- 动手学深度学习系列 从零实现L2正则化 & DropOut
1、L2正则化
1、理论部分

2、从零实现L2正则化(裸代码)
通常放在loss里面 如果手动实现 或者 放在trainer也可以。。
%matplotlib inline
import torch
import numpy
from torch import nn
from d2l import torch as d2l
n_train, n_test, num_inputs, batch_size = 20, 100, 200, 5
true_w, true_b = torch.ones((num_inputs, 1)) * 0.01, 0.05
train_data = d2l.synthetic_data(true_w, true_b, n_train)
train_iter = d2l.load_array(train_data, batch_size)
test_data = d2l.synthetic_data(true_w, true_b, n_test)
test_iter = d2l.load_array(test_data, batch_size, is_train=False)
# train_data, test_data
def InitWeight():
w, b = torch.normal(0, 0.1, true_w.shape, requires_grad=True), torch.zeros(1, requires_grad=True)
return w, b
def L2(w):
return 0.5 * torch.sum(w ** 2)
def MSELoss(y_hat, y):
return torch.mean(((y_hat - y) ** 2), )
def train(lambd):
w, b = InitWeight()
trainer = torch.optim.SGD(params=[w, b], lr=0.01)
net, loss = lambda X: d2l.linreg(X, w, b), MSELoss
num_epochs = 100
animator = d2l.Animator(xlabel='epochs', ylabel='loss', yscale='log',
xlim=[5, num_epochs], legend=['train', 'test'])
for epoch in range(num_epochs):
for X, y in train_iter:
# 增加了L2范数惩罚项,
# 广播机制使l2_penalty(w)成为一个长度为batch_size的向量
l = (loss(net(X), y)) + lambd * L2(w)
trainer.zero_grad()
l.backward()
trainer.step()
if (epoch + 1) % 5 == 0:
animator.add(epoch + 1, (d2l.evaluate_loss(net, train_iter, loss),
d2l.evaluate_loss(net, test_iter, loss)))
print('w的L2范数是:', torch.norm(w).item())
train(lambd=0)
train(lambd=3)

3、从零实现L2正则化(pytorch代码)
# next(iter(train_iter))[1].shape
net = nn.Sequential(nn.Linear(200, 1))
loss = nn.functional.mse_loss
def train(lambd):
w, b = InitWeight()
trainer = torch.optim.SGD(params=net.parameters(), lr=0.01, weight_decay=lambd)
num_epochs = 100
animator = d2l.Animator(xlabel='epochs', ylabel='loss', yscale='log',
xlim=[5, num_epochs], legend=['train', 'test'])
for epoch in range(num_epochs):
for X, y in train_iter:
l = loss(net(X), y)
trainer.zero_grad()
l.backward()
trainer.step()
if (epoch + 1) % 5 == 0:
animator.add(epoch + 1, (d2l.evaluate_loss(net, train_iter, loss),
d2l.evaluate_loss(net, test_iter, loss)))
print('w的L2范数是:{}'.format(torch.norm(net[0].weight.data).item()))
train(lambd=0)
train(lambd=3)

2、DropOut
1、理论部分

2、从零实现DropOut(裸代码)
这里需要用 之前写的 fashion那部分代码
def dropout_layer(X, dropout):
assert dropout >= 0 and dropout <= 1
if dropout == 1:
return torch.zeros_like(X)
elif dropout == 0:
return X
else :
mask = (torch.rand_like(X) > dropout).float()
return mask * X / (1 - dropout)
dropout_layer(torch.rand(1, 10).reshape(-1, 5), 0)
num_inputs, num_outputs, num_hiddens1, num_hiddens2 = 784, 10, 256, 256
dropout1, dropout2 = 0.1, 0.5
class Net(nn.Module):
def __init__(self, num_inputs, num_outputs, num_hiddens1, num_hiddens2, is_training = True):
super(Net, self).__init__()
self.num_inputs = num_inputs
self.training = is_training
self.lin1 = nn.Linear(num_inputs, num_hiddens1)
self.lin2 = nn.Linear(num_hiddens1, num_hiddens2)
self.lin3 = nn.Linear(num_hiddens2, num_outputs)
self.relu = nn.ReLU()
def forward(self, X):
h1 = self.relu(self.lin1(X.reshape(-1, num_inputs)))
if self.training:
h1 = dropout_layer(h1, dropout1)
h2 = self.relu(self.lin2(h1))
if self.training:
h2 = dropout_layer(h2, dropout2)
output = self.lin3(h2)
return output
net = Net(num_inputs, num_outputs, num_hiddens1, num_hiddens2)
num_epochs, lr, batch_size = 10, 0.5, 256
loss = nn.CrossEntropyLoss(reduction='none')
train_iter, test_iter = load_data_fashion_mnist(batch_size)
trainer = torch.optim.SGD(net.parameters(), lr=lr)
train_ch3(net, train_iter, test_iter, loss, num_epochs, trainer)


3、从零实现DropOut(pytorch代码)
net = nn.Sequential(nn.Flatten(),
nn.Linear(num_inputs, num_hiddens1),
nn.ReLU(),
nn.Dropout(dropout1),
nn.Linear(num_hiddens1, num_hiddens2),
nn.ReLU(),
nn.Dropout(dropout2),
nn.Linear(num_hiddens2, num_outputs))
trainer = torch.optim.SGD(net.parameters(), lr=lr)
loss = nn.CrossEntropyLoss(reduction='none')
train_ch3(net, train_iter, test_iter, loss, num_epochs, trainer)

更多推荐
所有评论(0)