spark
walk walk
这个作者很懒,什么都没留下…
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
spark-submit的一些参数
–master spark://masterhost:7077 #指定主服务器名称和端口 –executor-memory 6G executor内存 相当于Xmx=6G –executor-cores 4 启动4个核 –driver-memory 1G 每个driver1G内存 ,因为有4个core,所以总使用就是1*4G存 –conf spark.default.parallelism=10...原创 2019-11-19 15:00:58 · 415 阅读 · 0 评论 -
spark集群在windows下搭建
我用三台windows电脑,主机名 和 ip对应如下: (右键我的计算机 属性 修改计算机名分别为:win-master,win-salver1,win-salver2) win-master 192.168.0.1 win-salve1 192.168.0.2 win-salve2 192.168.0.3 每台电脑安装好对应的软件,建议安装目录保持一致 1.下载java:https://www....原创 2019-11-18 15:11:04 · 2645 阅读 · 2 评论 -
Ubuntu下spark安装
先安装jdk: sudo apt-get update sudo apt-get install default-jre sudo apt-get install openjdk-7-jdk 然后运行java -version 查看是否安装成功 下载spark: 最新版本为spark-2.0.2-bin-hadoop2.7.tgz 然后解压 tar -xvf spark-2.0.2-...原创 2016-11-22 10:26:19 · 266 阅读 · 0 评论 -
spark web ui 开启history server
在/tmp下建立目录 spark-events ./sbin/start-history-server.sh 修改配置文件./conf/spark-defaults.conf 添加这一行:spark.eventLog.enabled true 运行脚本 ./sbin/start-history-server.sh 查看地址http://localhost...原创 2016-11-29 17:22:09 · 540 阅读 · 0 评论 -
Spark ALS推荐系统简单例子(python)
采用MovieLens 100k数据集 http://files.grouplens.org/datasets/movielens/ml-100k.zip [code="java"] # -*- coding: utf-8 -*- # spark-submit movie_rec.py from pyspark import SparkConf, SparkContext from ...原创 2016-11-30 10:55:53 · 1698 阅读 · 0 评论 -
用Spark ALS通过预测推荐电影(python)
[code="java"] #!/usr/bin/env python # coding=utf-8 ''' 运行命令/yourpath/spark/bin/spark-submit --driver-memory 1g MovieLensALS.py movieLensDataDir personalRatingsFile movieLensDataDir 电影评分数据集目录 比如 m...原创 2016-12-02 11:34:09 · 1312 阅读 · 0 评论 -
在eclipse上搭建spark的java开发环境
首先安装好spark后 设置环境变量SPARK_HOME=d:\spark,在环境变量path后面添加%SPARK_HOME%bin; 启动Eclipse建立Java项目,建立一个测试的类 比如WordCount 用来统计文件中的字数 添加需要的jar库,选择菜单project=>properties, 然后在左侧选择java build path 右侧选择libraries, 然后选...原创 2016-12-05 09:52:27 · 525 阅读 · 0 评论 -
pyspark在windows下java.net.SocketException: Connection reset by peer 错误
pyspark在windows加载数据集 训练模型出现 以下错误 java.net.SocketException: Connection reset by peer: socket write error at java.net.SocketOutputStream.socketWrite0(Native Method) at java.net.Socket...原创 2016-12-05 16:12:51 · 1561 阅读 · 1 评论 -
spark2.3聚类算法lda代码(python)
spark的lda有两个一个是mllib下 一个是ml下的,下面代码是使用ml的 from pyspark import SparkConf, SparkContext,SQLContext from pyspark.sql import SparkSession from pyspark.ml.feature import Word2Vec,CountVectorizer from p...原创 2018-08-15 09:49:01 · 1073 阅读 · 1 评论 -
spark之word2vec使用(python)
[code="python"]from pyspark import SparkConf, SparkContext,SQLContext from pyspark.sql import SparkSession from pyspark.ml.feature import Word2Vec,CountVectorizer conf = SparkConf().setAppName("...原创 2018-08-15 09:57:59 · 1910 阅读 · 0 评论 -
spark进行svd降维和kmeans聚类
import jieba import jieba.analyse import jieba.posseg as pseg from pyspark import SparkConf, SparkContext,SQLContext from pyspark.ml.feature import Word2Vec,CountVectorizer import pandas as pd ...原创 2019-07-12 10:32:06 · 831 阅读 · 0 评论
分享