文本分类|keras数据集新闻分类

最新推荐文章于 2024-08-31 21:21:20 发布

Lemon_ZL

最新推荐文章于 2024-08-31 21:21:20 发布

阅读量542

点赞数

原文链接：https://blog.csdn.net/einstellung/article/details/82695194?ops_request_misc=&request_id=&biz_id=102&utm_term=%E6%96%B0%E9%97%BB%E5%88%86%E7%B1%BB&utm_medium=distribute.pc_search_result.none-task-blog-2~all~sobaiduweb~default-0-82695194

版权

https://blog.csdn.net/einstellung/article/details/82695194?ops_request_misc=&request_id=&biz_id=102&utm_term=%E6%96%B0%E9%97%BB%E5%88%86%E7%B1%BB&utm_medium=distribute.pc_search_result.none-task-blog-2~all~sobaiduweb~default-0-82695194

1.准备数据

from keras.datasets import reuters
(x_train, y_train), (x_test, y_test) = reuters.load_data(num_words=10000,
                                                         test_split=0.2)

标签

不能将整数序列直接输入神经网络。你需要将列表转换为张量。转换方法有以下两种。

填充列表，使其具有相同的长度，再将列表转换成形状为 (samples, word_indices) 的整数张量，然后网络第一层使用能处理这种整数张量的层（即 Embedding 层，本书后面会详细介绍）。
对列表进行 one-hot 编码，将其转换为 0 和 1 组成的向量。举个例子，序列 [3, 5] 将会被转换为 10 000 维向量，只有索引为 3 和 5 的元素是 1，其余元素都是 0。然后网络第一层可以用 Dense 层，它能够处理浮点数向量数据。

import numpy as np
def vectorize_sequences(sequences, dimension=10000):
    results = np.zeros((len(sequences), dimension))
    for i, sequence in enumerate(sequences):
        results[i, sequence] = 1.
    return results
x_train = vectorize_sequences(x_train)
x_test = vectorize_sequences(x_test)

标签向量化

y_train = np.asarray(y_train).astype('float32')
y_test = np.asarray(y_test).astype('float32')

2.构建网络

Lemon_ZL

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫