2024年Python最新少有人知的python数据科学库

最新推荐文章于 2024-05-09 12:11:38 发布

2301_82241883

最新推荐文章于 2024-05-09 12:11:38 发布

阅读量15

点赞数 11

分类专栏：程序员文章标签： python 开发语言

本文链接：https://blog.csdn.net/2301_82241883/article/details/138370153

版权

程序员专栏收录该内容

118 篇文章 0 订阅

订阅专栏

3.imbalanced-learn

常见的机器学习分类算法都默认输入的数据是均衡数据，即假设训练集数据有A和B两个类别，A和B数据量大体相当。如果A和B数据量差别巨大，那么训练的效果会不理想。在实际收集和整理的数据，其实绝大多数是非均衡数据，这对于机器学习分类算法真的是个很大的问题。好在有imbalanced-learn库可以很好的解决这个问题。该库兼容scikit-learn，并且是作为scikit-learn-contrib项目的一部分。当你再遇到非均衡数据，记得试试它哦！

安装

pip install -U imbalanced-learn
#或者
conda install -c conda-forge imbalanced-learn

该库有高质量的文档 http://imbalanced-learn.org/en/stable,目前该库支持scikit-learn、keras、tensorflow库

4. FlashText

在NLP任务重经常会遇到替换指代同一个意思的多个词语，或者从句子中抽取关键词。通常我们一般的做法是使用正则表达式来完成这些脏活累活，但如果要操作的词语数量达到几千上万，使用正则这种方法就会变得很麻烦。FlashText库是基于FlashText算法，该库的最强大之处在于程序运行时间不受操作词语数量影响，即运行时间与操作的词汇数量无关。因此特别适合应用到 python文本分析 中去。

4.1 安装

pip install flashtext

4.2 用例

4.2.1 抽取关键词

我们都知道 Big Apple 指代纽约。所以抽取纽约这个城市词时候，我们要考虑到相同意思的不同词语。

from flashtext import KeywordProcessor

#设置关键词处理器
keyword_processor = KeywordProcessor()

#设置关键词及其近义词
keyword_processor.add_keyword('Big Apple', 'New York') #遇到Big Apple就会识别为New York
keyword_processor.add_keyword('Bay Area')

keywords_found = keyword_processor.extract_keywords("I love Big Apple and Bay Area.")

keywords_found

Run and output

['New York', 'Bay Area']

4.2.2 替换关键词

我们也经常需要将原始文本进行处理，比如将New Delhi（新德里）替换为NCR region（国家首都区）

keyword_processor.add_keyword('New Delhi', 'NCR region')
new_sentence = keyword_processor.replace_keywords('I love Big Apple and new delhi.')
new_sentence

Run and output

'I love New York and NCR region.'

想了解更多，请查看FlastText官方文档

https://flashtext.readthedocs.io/en/latest/#

5. Fuzzywuzzy

这个库的名字就有点怪，但ta拥有强大的字符串匹配功能。可以轻松实现字符串比较比率（comparison ratios），分词比率（token ratios)等操作。它还可以方便地匹配保存在不同数据库中的记录。

安装

pip install fuzzywuzzy

用例

from fuzzywuzzy import fuzz
from fuzzywuzzy import process

# Simple Ratio
print(fuzz.ratio("this is a test", "this is a test!"))
# Partial Ratio
print(fuzz.partial_ratio("this is a test", "this is a test!"))

Run and output!

97
100

更多有趣的例子可见 fuzzywuzzy库github账号 https://github.com/seatgeek/fuzzywuzzy

6.PyFlux/PyFTS.

在机器学习领域中经常遇到时间序列分析这种问题。PyFlux是专门为解决时间序列问题而开发的python库。这个库提供了很多现代时间序列算法，单不仅仅限于ARIMA、GARCH和VAR这三种模型。简而言之，PyFlux为我们分析时间序列数据提供了可能，你值得拥有。

安装

pip install pyflux

PyFlux用例可查看该库的文档 https://pyflux.readthedocs.io/en/latest/index.html

类似的时间序列库还有PyFTS, 教程链接

https://towardsdatascience.com/a-short-tutorial-on-fuzzy-time-series-dcc6d4eb1b15

文档链接

https://pyfts.github.io/pyFTS/.

7.Ipyvolume

数据科学中一个重要的部分就是分析结果的展示与交流，而良好的视觉传达是很有优势的。IPyvolume是3D可视化库，可以以最小的初始化设置就能在jupyter notebook中使用。做一个恰当的类比：matplotlib的imshow是2d数组，而IPyvolume的volshow是3d数组。

安装

pip install ipyvolume
#或者
conda install -c conda-forge ipyvolume

用例

8. Dash

文末有福利领取哦~

👉一、Python所有方向的学习路线

Python所有方向的技术点做的整理，形成各个领域的知识点汇总，它的用处就在于，你可以按照上面的知识点去找对应的学习资源，保证自己学得较为全面。

👉二、Python必备开发工具

👉三、Python视频合集

观看零基础学习视频，看视频学习是最快捷也是最有效果的方式，跟着视频中老师的思路，从基础到深入，还是很容易入门的。

👉 四、实战案例

光学理论是没用的，要学会跟着一起敲，要动手实操，才能将自己的所学运用到实际当中去，这时候可以搞点实战案例来学习。（文末领读者福利）

👉五、Python练习题

检查学习结果。

👉六、面试资料

我们学习Python必然是为了找到高薪的工作，下面这些面试题是来自阿里、腾讯、字节等一线互联网大厂最新的面试资料，并且有阿里大佬给出了权威的解答，刷完这一套面试资料相信大家都能找到满意的工作。

👉因篇幅有限，仅展示部分资料，这份完整版的Python全套学习资料已经上传

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化学习资料的朋友，可以戳这里无偿获取

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！
资料已经上传