数据收集
1 无论是什么数据,一般来说都是从数据库里提取出来
首先要对数据进行清洗,综合
2 将数据制作成集合
可以使用csv等文件存储数据集合
数据模拟和输入
为了通用性,我们使用模拟数据
time = torch.arange(1, T + 1, dtype=torch.float32)
返回大小为从1 到T+1 ,step为1 的1维张量数据 ,这是我们自己产生的数据,真实数据可以从数据库来
我们使用正弦函数和正太分布来描述张量数据,因为数据库的数据不太可能是间隔是1的数据。
x = torch.sin(0.01 * time) + torch.normal(0, 0.2, (T,))
d2l.plot(time, [x], 'time', 'x', xlim=[1, 1000], figsize=(6, 3))
接下来就是模拟真正的数据集合和制作标签数据集合,使用pytorch来装载数据集合data.TensorDataset,TensorDataset函数 可以用来对 tensor张量进行打包,包装成dataset数据集,接下来就是重点:创建并且使用多层感知机来训练网络。
show me the code
整个代码如下清单
import torch
from torch import nn
from wrapper import torch as wrapper
import cv2
from torch.utils import data
#features = torch.zeros((1000 - 4, 5))
#print(features.shape)
def load_array(data_arrays, batch_size, is_train=True):
"""Construct a PyTorch data iterator.
Defined in :numref:`sec_linear_concise`"""
dataset = data.TensorDataset(*data_arrays)
return data.DataLoader(dataset, batch_size, shuffle=is_train)
T = 1000 # 总共产生1000个点
time = torch.arange(1, T + 1, dtype=torch.float32)
x = torch.sin(0.01 * time) + torch.normal(0, 0.2, (T,))
wrapper.plot(time, [x], 'time', 'x', xlim=[1, 1000], figsize=(6, 3))
#cv2.waitKey(0)
tau = 4
features = torch.zeros((T - tau, tau))
print(features)
for i in range(tau):
features[:, i] = x[i: T - tau + i]
print(features)
labels = x[tau:].reshape((-1, 1))
batch_size, n_train = 16, 600
# 只有前n_train个样本用于训练
train_iter = load_array((features[:n_train], labels[:n_train]),
batch_size, is_train=True)
def init_weights(m):
if type(m) == nn.Linear:
nn.init.xavier_uniform_(m.weight)
# 一个简单的多层感知机
def get_net():
net = nn.Sequential(nn.Linear(4, 10),
nn.ReLU(),
nn.Linear(10, 1))
net.apply(init_weights)
return net
# 平方损失。注意:MSELoss计算平方误差时不带系数1/2
loss = nn.MSELoss(reduction='none')
def train(net, train_iter, loss, epochs, lr):
trainer = torch.optim.Adam(net.parameters(), lr)
for epoch in range(epochs):
for X, y in train_iter:
trainer.zero_grad()
l = loss(net(X), y)
l.sum().backward()
trainer.step()
print(f'epoch {epoch + 1}, '
f'loss: {wrapper.evaluate_loss(net, train_iter, loss):f}')
net = get_net()
train(net, train_iter, loss, 5, 0.01)
存成模型
PATH = './bigdata.pth'
torch.save(net.state_dict(), PATH)
这样存成模型,以后可以直接使用