tf.contrib.learn.preprocessing.VocabularyProcessor

最新推荐文章于 2022-06-27 14:56:40 发布

mstar1992

最新推荐文章于 2022-06-27 14:56:40 发布

阅读量1.5w

点赞数 4

分类专栏： tensorflow

本文链接：https://blog.csdn.net/u013713117/article/details/69261769

版权

tensorflow 专栏收录该内容

14 篇文章 1 订阅

订阅专栏

tf.contrib.learn.preprocessing.VocabularyProcessor (max_document_length, min_frequency=0, vocabulary=None, tokenizer_fn=None)

参数：

max_document_length: 文档的最大长度。如果文本的长度大于最大长度，那么它会被剪切，反之则用0填充。
min_frequency: 词频的最小值，出现次数小于最小词频则不会被收录到词表中。
vocabulary: CategoricalVocabulary 对象。
tokenizer_fn：分词函数

代码：

from tensorflow.contrib import learn
import numpy as np
max_document_length = 4
x_text =[
    'i love you',
    'me too'
]
vocab_processor = learn.preprocessing.VocabularyProcessor(max_document_length)
vocab_processor.fit(x_text)
print next(vocab_processor.transform(['i me too'])).tolist()
x = np.array(list(vocab_processor.fit_transform(x_text)))
print x

[1, 4, 5, 0]
[[1 2 3 0]
 [4 5 0 0]]

文档地址：http://tflearn.org/data_utils/

优惠劵

mstar1992

关注关注

4
点赞
踩
6

收藏

觉得还不错? 一键收藏
0
评论
tf.contrib.learn.preprocessing.VocabularyProcessor

tf.contrib.learn.preprocessing.VocabularyProcessor (max_document_length, min_frequency=0, vocabulary=None, tokenizer_fn=None)参数：max_document_length: 文档的最大长度。如果文本的长度大于最大长度，那么它会被剪切，反之则用0填充。 min_frequenc
复制链接

扫一扫