nmt模型源文本词项序列_TensorFlow NMT的数据处理过程

最新推荐文章于 2023-09-20 22:39:11 发布

weixin_39897758

最新推荐文章于 2023-09-20 22:39:11 发布

阅读量328

点赞数

文章标签： nmt模型源文本词项序列

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_39897758/article/details/113468837

版权

在tensorflow/nmt项目中，训练数据和推断数据的输入使用了新的Dataset API，应该是tensorflow 1.2之后引入的API，方便数据的操作。如果你还在使用老的Queue和Coordinator的方式，建议升级高版本的tensorflow并且使用Dataset API。

本教程将从训练数据和推断数据两个方面，详解解析数据的具体处理过程，你将看到文本数据如何转化为模型所需要的实数，以及中间的张量的维度是怎么样的，batch_size和其他超参数又是如何作用的。

训练数据的处理

先来看看训练数据的处理。训练数据的处理比推断数据的处理稍微复杂一些，弄懂了训练数据的处理过程，就可以很轻松地理解推断数据的处理。

训练数据的处理代码位于nmt/utils/iterator_utils.py文件内的get_iterator函数。

函数的参数

我们先来看看这个函数所需要的参数是什么意思:

参数解释

src_dataset

源数据集

tgt_dataset

目标数据集

src_vocab_table

源数据单词查找表，就是个单词和int类型数据的对应表

tgt_vocab_table

目标数据单词查找表，就是个单词和int类型数据的对应表

batch_size

批大小

sos

句子开始标记

eos

句子结尾标记

random_seed

随机种子，用来打乱数据集的

num_buckets

桶数量

src_max_len

源数据最大长度

最低0.47元/天解锁文章

weixin_39897758

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
nmt模型源文本词项序列_TensorFlow NMT的数据处理过程

在tensorflow/nmt项目中，训练数据和推断数据的输入使用了新的Dataset API，应该是tensorflow 1.2之后引入的API，方便数据的操作。如果你还在使用老的Queue和Coordinator的方式，建议升级高版本的tensorflow并且使用Dataset API。本教程将从训练数据和推断数据两个方面，详解解析数据的具体处理过程，你将看到文本数据如何转化为模型所需要的实数...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。