TfidfVectorizer、CountVectorizer 和 TfidfTransformer 的简单教程

最新推荐文章于 2025-02-28 19:40:48 发布

张贤同学

最新推荐文章于 2025-02-28 19:40:48 发布

阅读量1.1k

点赞数

分类专栏：机器学习文章标签：数据挖掘机器学习

本文链接：https://blog.csdn.net/BGH12ET/article/details/107793802

版权

本文介绍了scikit-learn库中用于自然语言处理的TfidfVectorizer、CountVectorizer和TfidfTransformer。CountVectorizer负责将文本文档转化为计数的稀疏矩阵，TfidfTransformer则计算tf-idf值。TfidfVectorizer整合了两者功能，简化了处理流程。文中通过实例展示了它们的使用方法和输出结果。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

TfidfVectorizer、CountVectorizer 和 TfidfTransformer 是 sklearn 中处理自然语言常用的工具。TfidfVectorizer 相当于 CountVectorizer + TfidfTransformer。
下面先说 CountVectorizer。

CountVectorizer

CountVectorizer 的作用是将文本文档转换为计数的稀疏矩阵。下面举一个具体的例子来说明(代码来自于官方文档)。

from sklearn.feature_extraction.text import CountVectorizer
# 定义一个 list，其中每个元素是一个文档(一个句子)
corpus = [
    'This is the first document.',
    'This document is the second document.',
    'And this is the third one.',
    'Is this the first document?',
]
vectorizer = CountVectorizer()
# 将文本数据转换为计数的稀疏矩阵
X = vectorizer.fit_transform(corpus)
# 查看每个单词的位置
print(vectorizer.get_feature_names())
#输出为 ['and', 'document', 'first', 'is',