<?xml version="1.0" encoding="utf-8" ?><rss version="2.0"><channel><title><![CDATA[PrincessLin的专栏]]></title><description><![CDATA[]]></description><link>https://blog.csdn.net/PrincessLin</link><language>zh-cn</language><generator>https://blog.csdn.net/</generator><copyright><![CDATA[Copyright &copy; PrincessLin]]></copyright><item><title><![CDATA[【Spark+NLP】24、整理一些自己会用到的指令+操作]]></title><link>https://blog.csdn.net/PrincessLin/article/details/103155322</link><guid>https://blog.csdn.net/PrincessLin/article/details/103155322</guid><author>PrincessLin</author><pubDate>Wed, 20 Nov 2019 10:47:50 +0800</pubDate><description><![CDATA[1、tfos框架操作：

git克隆：git clone https://github.com/wjlx/tfos.git

搭建环境：根据requirement.txt 搭建

安装框架： cd /home/lin/tfos  (必须先移动进来，不然报错)   

         python3 setup.py install

卸载： sudo p...]]></description><category></category></item><item><title><![CDATA[【Spark+NLP】23、中低配电脑关于spark的一些血泪踩坑]]></title><link>https://blog.csdn.net/PrincessLin/article/details/102937733</link><guid>https://blog.csdn.net/PrincessLin/article/details/102937733</guid><author>PrincessLin</author><pubDate>Wed, 06 Nov 2019 16:36:59 +0800</pubDate><description><![CDATA[最近20天没有什么大的进展，一直各种踩坑，这里把当初的笔记记录下，以备后期查用。





1、https://blog.csdn.net/HJXINKKL/article/details/81951551

  https://blog.csdn.net/u013402321/article/details/83185345


2、停止运行着的Spark：stop-master.sh...]]></description><category></category></item><item><title><![CDATA[【Spark+NLP】22、下载、安装、部署github上的程序]]></title><link>https://blog.csdn.net/PrincessLin/article/details/102937125</link><guid>https://blog.csdn.net/PrincessLin/article/details/102937125</guid><author>PrincessLin</author><pubDate>Wed, 06 Nov 2019 16:24:01 +0800</pubDate><description><![CDATA[1、在linux上安装git

本人是ubuntu系统，运行$ sudo apt-get install git即可

centos可运行$ sudo yum install git



2、克隆项目

命令行代码：git clone https://你复制的项目地址。其中的项目地址点击下图图标可获得。（推荐）

（当然也可以点击右下角下载压缩包，然后自行解压）

以https://githu...]]></description><category></category></item><item><title><![CDATA[【Spark+NLP】21、在pyspark上使用tensorflow框架和tensorflowonspark框架]]></title><link>https://blog.csdn.net/PrincessLin/article/details/102587810</link><guid>https://blog.csdn.net/PrincessLin/article/details/102587810</guid><author>PrincessLin</author><pubDate>Wed, 16 Oct 2019 17:21:40 +0800</pubDate><description><![CDATA[安装方法见上上篇。

踩坑：

明明安装成功了tensorflow和tensorflowonspark，却在pyspark上用不起来。

报错：&gt;&gt;&gt; import tensorflow as tf
Traceback (most recent call last):
 File "&lt;stdin&gt;", line 1, in &lt;module&gt;
Import...]]></description><category></category></item><item><title><![CDATA[【Spark+NLP】20、使用pyspark运行程序]]></title><link>https://blog.csdn.net/PrincessLin/article/details/101455855</link><guid>https://blog.csdn.net/PrincessLin/article/details/101455855</guid><author>PrincessLin</author><pubDate>Wed, 16 Oct 2019 16:16:43 +0800</pubDate><description><![CDATA[一、仅使用pyspark运行超小程序

&gt;&gt;&gt; logFile="/hadoop-2.8.5/README.txt"
&gt;&gt;&gt; logData=sc.textFile(logFile).cache()
&gt;&gt;&gt; numAs=logData.filter(lambda s:'a' in s).count()
&gt;&gt;&gt; numBs=lo...]]></description><category></category></item><item><title><![CDATA[【Spark+NLP】19、在ubuntu上配置tensorflow的环境（python + tf + tfonSpark + pyspark）]]></title><link>https://blog.csdn.net/PrincessLin/article/details/101452552</link><guid>https://blog.csdn.net/PrincessLin/article/details/101452552</guid><author>PrincessLin</author><pubDate>Thu, 26 Sep 2019 16:57:23 +0800</pubDate><description><![CDATA[1、安装python：

ubuntu系统自带python，不是最新版但能凑合用。查看版本：

ls -l /usr/bin | grep python



2、安装pip：

sudo apt-get install python-pip python-dev



踩坑：



（python3.x版本对应的pip3，所以后面又将命令行改成：sudo apt-get install pyth...]]></description><category></category></item><item><title><![CDATA[【Spark+NLP】18、pyspark的安装和使用]]></title><link>https://blog.csdn.net/PrincessLin/article/details/101370020</link><guid>https://blog.csdn.net/PrincessLin/article/details/101370020</guid><author>PrincessLin</author><pubDate>Wed, 25 Sep 2019 16:27:16 +0800</pubDate><description><![CDATA[写在前面： nlp卡在cnn有一个星期了，遇到种种困难无法决定使用哪门语言来写：

1、scala：

优点：在spark环境下，scala是主流、速度最快、代码最简洁的语言，word2vec就是用的它。

缺点：用scala写神经网络没有现成的方法！（word2vec在spark-mllib库中有现成的直接用）

     让新手纯手写感觉天方夜谭！

     网上资料...]]></description><category></category></item><item><title><![CDATA[【Spark+NLP】17、spark-ml + spark-sql_关于rdd和dataframe的踩坑血泪史]]></title><link>https://blog.csdn.net/PrincessLin/article/details/100986242</link><guid>https://blog.csdn.net/PrincessLin/article/details/100986242</guid><author>PrincessLin</author><pubDate>Wed, 18 Sep 2019 16:27:17 +0800</pubDate><description><![CDATA[说明：

因为后期要做基于spark的项目，本人懒得纯手打了，决定在别的项目基础上修改过来即可。

项目中要用到spark-ml的word2vec生成词向量，于是直接借用之前的手机短信项目的前半截了。

代码不贴了，写下心得：



利用spark-mllib库现成的word2vec轻轻松松几句代码就实现了。得到的词向量等内容存储在preResultDF中，我想看下生成的词向量什么样。

1、sa...]]></description><category></category></item><item><title><![CDATA[【Spark+NLP】16、win10下使用IDEA完整运行一个spark ml机器学习程序]]></title><link>https://blog.csdn.net/PrincessLin/article/details/100880945</link><guid>https://blog.csdn.net/PrincessLin/article/details/100880945</guid><author>PrincessLin</author><pubDate>Mon, 16 Sep 2019 11:11:27 +0800</pubDate><description><![CDATA[1、在pom.xml中添加spark mllib依赖


&lt;dependency&gt;
    &lt;groupId&gt;org.apache.spark&lt;/groupId&gt;
    &lt;artifactId&gt;spark-mllib_2.12&lt;/artifactId&gt;
    &lt;version&gt;${spark.version}&lt;/ve...]]></description><category></category></item><item><title><![CDATA[【Spark+NLP】14、使用IDEA运行spark小程序 + jar包在spark分布式环境中运行]]></title><link>https://blog.csdn.net/PrincessLin/article/details/100737399</link><guid>https://blog.csdn.net/PrincessLin/article/details/100737399</guid><author>PrincessLin</author><pubDate>Wed, 11 Sep 2019 18:02:02 +0800</pubDate><description><![CDATA[统计E盘下helloSpark.txt文件中每个单词的出现次数

一、测试代码：


import org.apache.spark.{SparkContext, SparkConf}
object spamm {
  def main(args: Array[String]): Unit = {
    val conf = new SparkConf().setAppName("wordcou...]]></description><category></category></item><item><title><![CDATA[【Spark+NLP】13、使用IDEA创建spark项目 + pom.xml的配置]]></title><link>https://blog.csdn.net/PrincessLin/article/details/100562853</link><guid>https://blog.csdn.net/PrincessLin/article/details/100562853</guid><author>PrincessLin</author><pubDate>Wed, 11 Sep 2019 14:59:36 +0800</pubDate><description><![CDATA[说在前面：

之前spark的分布式环境终终终终于搭建好了，下一步就是开始spark编程了。

我用到的是IDEA。

临时先在windows环境下操作，过两天移到linux环境中。

一、IDEA的安装

https://blog.csdn.net/PrincessLin/article/details/91540040

二、idea安装scala + maven的安装和配置

https:/...]]></description><category></category></item><item><title><![CDATA[【Spark+NLP】11、免密钥ssh登录 + hadoop分布式环境搭建！]]></title><link>https://blog.csdn.net/PrincessLin/article/details/99698286</link><guid>https://blog.csdn.net/PrincessLin/article/details/99698286</guid><author>PrincessLin</author><pubDate>Thu, 05 Sep 2019 17:32:07 +0800</pubDate><description><![CDATA[一、ubuntu 18.04 vim的安装

VPS从16.04换到18.04，发现vim命令找不到了，只有vi，界面一般，方向键还不对。

重新安装vim就能解决问题：


sudo apt-get remove vim-common
sudo apt-get install vim




二、ssh免密登录

1、首先确认 openssh-server是否安装成功

确认命令：ps -e|...]]></description><category></category></item><item><title><![CDATA[【Spark+NLP】10、vmware虚拟机系统克隆后网络配置（2） （ubuntu18）]]></title><link>https://blog.csdn.net/PrincessLin/article/details/99687051</link><guid>https://blog.csdn.net/PrincessLin/article/details/99687051</guid><author>PrincessLin</author><pubDate>Thu, 05 Sep 2019 15:31:36 +0800</pubDate><description><![CDATA[说明：

上篇实现了单个虚拟机的网络配置，能够成功ping到百度等网站，但另外两台虚拟机网络配置时遇到各种问题，

参照本篇进行修改+配置后成功了。



1、Ubuntu18.04的网络配置

有台虚拟机死活连不上网，根据这个又配置了一遍居然成功了！！！！

https://www.cnblogs.com/opsprobe/p/9979234.html



2、Ubuntu18.04连不网...]]></description><category></category></item><item><title><![CDATA[【Spark+NLP】9、vmware虚拟机系统克隆 + 网络配置 （ubuntu18）]]></title><link>https://blog.csdn.net/PrincessLin/article/details/99669382</link><guid>https://blog.csdn.net/PrincessLin/article/details/99669382</guid><author>PrincessLin</author><pubDate>Fri, 16 Aug 2019 15:25:10 +0800</pubDate><description><![CDATA[一、说明：

要使用hadoop集群，最好使用三台电脑以上，因设备受限，故使用虚拟机上创建三台ubuntu系统的虚拟主机，这三台主机间设置网络连接，使其能够相互通信。通常命名为master和slaver1、slaver2，这样的三台主机可以搭建成hadoop集群。

二、克隆：

1、可以使用vmware自己创建三台主机并分别配置和安装软件，但太繁琐，感觉又得好几天，不推荐。

2、可以在一台虚拟...]]></description><category></category></item><item><title><![CDATA[【Spark+NLP】8、ubuntu18安装j和配置hadoop + 安装ssh]]></title><link>https://blog.csdn.net/PrincessLin/article/details/99618433</link><guid>https://blog.csdn.net/PrincessLin/article/details/99618433</guid><author>PrincessLin</author><pubDate>Thu, 15 Aug 2019 12:15:00 +0800</pubDate><description><![CDATA[1、前提：需要安装jdk，本人使用1.8版本，安装方法可往前翻。

        hadoop安装部分本人参考：https://blog.csdn.net/qjk19940101/article/details/70544197

2、下载软件压缩包：

官网：https://www.howtoing.com/how-to-install-hadoop-in-stand-alon...]]></description><category></category></item><item><title><![CDATA[【Spark+NLP】7、ubuntu18安装jdk]]></title><link>https://blog.csdn.net/PrincessLin/article/details/98756670</link><guid>https://blog.csdn.net/PrincessLin/article/details/98756670</guid><author>PrincessLin</author><pubDate>Wed, 07 Aug 2019 16:28:54 +0800</pubDate><description><![CDATA[1、官网下载linux环境下的jdk8

http://www.oracle.com/technetwork/java/javase/downloads/index.html

2、ubuntu18的桌面很像windows，能提供复制粘贴剪贴移动解压等功能。

故将下载的jdk8压缩包移动到合适的位置并解压。

本人：



1、命令行输入sudo nautilus，弹出有root权限的文件夹。（...]]></description><category></category></item><item><title><![CDATA[【Spark+NLP】6、vmware+ubuntu虚拟linux环境的搭建]]></title><link>https://blog.csdn.net/PrincessLin/article/details/98341586</link><guid>https://blog.csdn.net/PrincessLin/article/details/98341586</guid><author>PrincessLin</author><pubDate>Sat, 03 Aug 2019 15:57:20 +0800</pubDate><description><![CDATA[经过长时间的慎重考虑，决定弃坑windows，转向linux。

1、缘由：

1、企业均使用linux，坚持使用windows就将科研与生产脱节，实用性降低。
	2、spark集群的启动我只看到了.sh命令，并没有cmd命令，坚持用windows的话需要借助xshell、crontab、oozie之类的各种小软件，感觉费力不讨好。
	3、原本环境搭建就复杂，windows环境下hadoop的配置...]]></description><category></category></item><item><title><![CDATA[【Spark+NLP】5、使用spark-submit跑spark样例sparkpi.scala]]></title><link>https://blog.csdn.net/PrincessLin/article/details/98197392</link><guid>https://blog.csdn.net/PrincessLin/article/details/98197392</guid><author>PrincessLin</author><pubDate>Fri, 02 Aug 2019 13:54:41 +0800</pubDate><description><![CDATA[[学习笔记，欢迎指正]

1、我启动了hadoop，这么小的程序不需要启动。


使用单机local模式提交任务

    local模式也就是本地模式，也就是在本地机器上单机执行程序。使用这个模式的话，并不需要启动Hadoop集群，也不需要启动Spark集群，只要有一台机器上安装了JDK、Scala、Spark即可运行。


cmd命令：

cd D:\hadoop-2.8.3\sb...]]></description><category></category></item><item><title><![CDATA[【Spark+NLP】3、手机短信分类实例详细研究（2）变态详细版]]></title><link>https://blog.csdn.net/PrincessLin/article/details/96857846</link><guid>https://blog.csdn.net/PrincessLin/article/details/96857846</guid><author>PrincessLin</author><pubDate>Fri, 26 Jul 2019 10:49:35 +0800</pubDate><description><![CDATA[接上篇，本文为主体代码。

object SpamMessageClassifier {

object：声明一个单例对象

 def main(args: Array[String]) {

1、这儿，args是一个Array[String]类型的方法参数。也就是说，args是一个String数组。在Scala中，Array是一个具有类型参数指明其元素类型的类(一个真正的类，而不是JAVA中那...]]></description><category></category></item><item><title><![CDATA[【收集】NLP语料库数据集+持续更新]]></title><link>https://blog.csdn.net/PrincessLin/article/details/96871439</link><guid>https://blog.csdn.net/PrincessLin/article/details/96871439</guid><author>PrincessLin</author><pubDate>Mon, 22 Jul 2019 16:42:29 +0800</pubDate><description><![CDATA[来源：大数据文摘

本文共4270字，建议阅读7分钟。
本文为你奉上100多个按字母顺序排列的开源自然语言处理文本数据集列表。



奉上100多个按字母顺序排列的开源自然语言处理文本数据集列表（原始未结构化的文本数据），快去按图索骥下载数据自己研究吧！



数据集




	Apache软件基金会公开邮件档案：截止到2011年7月11日全部公开可用的Apache软件基金会邮件档案。（...]]></description><category></category></item></channel></rss>