2021年6月，CVTE NLP算法岗4道面试题分享

最新推荐文章于 2022-05-23 12:19:24 发布

niuyunpang

最新推荐文章于 2022-05-23 12:19:24 发布

阅读量191

点赞数

文章标签：聚类算法人工智能大数据机器学习

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/niuyunpang/article/details/118972176

版权

本文分享了2021年CVTE NLP算法岗位的面试题，涉及改进的TF-IDF、k-means与谱聚类、知识蒸馏的概念及其应用。同时提到了模型压缩的重要性，特别是知识蒸馏在大模型到小模型转移中的作用。评论区有《2021大厂最新AI面试题》免费赠送。

摘要由CSDN通过智能技术生成

文末彩蛋：七月在线干货组最新升级的《2021大厂最新AI面试题 [含答案和解析, 更新到前121题]》免费送！

1、讲一下改进的tf-idf

TF-IDF中的IDF是一种试图抑制噪声的加权，单纯的以为文本频率小的单词就越重要，文本频率越大的单词就越无用，这一方式会在同类语料库中存在巨大弊端，一些同类文本的关键词容易被掩盖。例如：语料库 D 中教育类文章偏多，而文本 j 是一篇属于教育类的文化在那个，那么教育类相关词语的IDF值就会较小，使提取本文关键词的召回率更低。

改进方法：TF−IWF (Term Frequency-Inverse Word Frequency)
在这里插入图片描述

2、讲一下k-means与谱聚类

聚类算法属于无监督的机器学习算法，即没有类别标签y，需要根据数据特征将相似的数据分为一组。K-means聚类算法即随机选取k个点作为聚类中心，计算其他点与中心点的距离，选择距离最近的中心并归类，归类完成后计算每类的新中心点，重新计算每个点与中心点的聚类并选择距离最近的归类，重复此过程，直到中心点不再变化。

谱聚类的思想是将样本看作顶点，样本间的相似度看作带权的边，从而将聚类问题转为图分割问题：找到一种图分割的方法使得连接不同组的边的权重尽可能低（这意味着组间相似度要尽可能低），组内的边的权重尽可能高（这意味着组内相似度要尽可能高），从而

最低0.47元/天解锁文章

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
2021年6月，CVTE NLP算法岗4道面试题分享

文末彩蛋：七月在线干货组最新升级的《2021大厂最新AI面试题 [含答案和解析, 更新到前121题]》免费送！1、讲一下改进的tf-idfTF-IDF中的IDF是一种试图抑制噪声的加权，单纯的以为文本频率小的单词就越重要，文本频率越大的单词就越无用，这一方式会在同类语料库中存在巨大弊端，一些同类文本的关键词容易被掩盖。例如：语料库 D 中教育类文章偏多，而文本 j 是一篇属于教育类的文化在那个，那么教育类相关词语的IDF值就会较小，使提取本文关键词的召回率更低。改进方法：TF−IWF (Term Fr
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。