C++计算机视觉
- CCV —基于C语言/提供缓存/核心的机器视觉库,新颖的机器视觉库
- OpenCV—它提供C++, C, Python, Java 以及 MATLAB接口,并支持Windows, Linux, Android and Mac OS操作系统。
- Closure Toolbox—Clojure语言库与工具的分类目录
- go-porterstemmer—一个Porter词干提取算法的原生Go语言净室实现
- paicehusk—Paice/Husk词干提取算法的Go语言实现
- snowball—Go语言版的Snowball词干提取器
数据分析/数据可视化 Java自然语言处理
- CoreNLP—斯坦福大学的CoreNLP提供一系列的自然语言处理工具,输入原始英语文本,可以给出单词的基本形式(下面Stanford开头的几个工具都包含其中)。
- Stanford Parser—一个自然语言解析器。
- Stanford POS Tagger —一个词性分类器。
- Stanford Name Entity Recognizer—Java实现的名称识别器
- Stanford Word Segmenter—分词器,很多NLP工作中都要用到的标准预处理步骤。
- Tregex, Tsurgeon and Semgrex —用来在树状数据结构中进行模式匹配,基于树关系以及节点匹配的正则表达式(名字是“tree regular expressions”的缩写)。
- Stanford Phrasal:最新的基于统计短语的机器翻译系统,java编写
- Stanford Tokens Regex—用以定义文本模式的框架。
- Stanford Temporal Tagger—SUTime是一个识别并标准化时间表达式的库。
- Stanford SPIED—在种子集上使用模式,以迭代方式从无标签文本中学习字符实体
- Stanford Topic Modeling Toolbox —为社会科学家及其他希望分析数据集的人员提供的主题建模工具。
- Twitter Text Java—Java实现的推特文本处理库
- MALLET -—基于Java的统计自然语言处理、文档分类、聚类、主题建模、信息提取以及其他机器学习文本应用包。
- OpenNLP—处理自然语言文本的机器学习工具包。
- LingPipe —使用计算机语言学处理文本的工具包。
通用机器学习
- MLlib in Apache Spark—Spark中的分布式机器学习程序库
- Mahout —分布式的机器学习库
- Stanford Classifier —斯坦福大学的分类器
- Weka—Weka是数据挖掘方面的机器学习算法集。
- ORYX—提供一个简单的大规模实时机器学习/预测分析基础架构。
- Twitter-text-js —JavaScript实现的推特文本处理库
- NLP.js —javascript及coffeescript编写的NLP工具
- natural—Node下的通用NLP工具
- Knwl.js—JS编写的自然语言处理器
通用机器学习
- Convnet.js—训练深度学习模型的JavaScript库。
- Clustering.js—用JavaScript实现的聚类算法,供Node.js及浏览器使用。
- Decision Trees—Node.js实现的决策树,使用ID3算法。
- Node-fann —Node.js下的快速人工神经网络库。
- Kmeans.js—k-means算法的简单Javascript实现,供Node.js及浏览器使用。
- LDA.js —供Node.js用的LDA主题建模工具。
- Learning.js—逻辑回归/c4.5决策树的JavaScript实现
- Machine Learning—Node.js的机器学习库。
- Node-SVM—Node.js的支持向量机
- Brain —JavaScript实现的神经网络