Apache Spark集成

Apache Spark集成

 

本文档在ES与 Hadoop集群安装成功条件下,参照:

https://www.elastic.co/guide/en/elasticsearch/hadoop/master/spark.html

版本信息:
HDP version : HDP-2.6.1.0

ES version : 5.6.0

Spark version : 2.2.0

maven version:3.5

Scala version 2.10.6

 

1. write data to elasticsearch

 

1.1. 方式一步骤解析


RDD先定义Map/JavaBean/Scala case class将其内容翻译成文件,利用elasticsearch Hadoop将保存到Elasticsearch中
在Scala中只需要以下几步:

1.Spark Scala imports

2.Elasticsearch-hadoop Scala imports

3.Start Spark through its Scala API

4.makeRDD

5.index content(内容索引) index ES under spark/docs

1.2. 代码如下:

import org.apache.spark.{SparkConf, SparkContext}
import org.elasticsearch.spark.rdd.EsSpark


/**
  * Created by hand on 2018/1/9.
  */

object Es_spark {
  def main(args: Array[String]): Unit = {

    case class Job(jobName: String, jobUrl: String, companyName: String, salary: String)
    var conf = new SparkConf()
    conf.setAppName("S2EExample")
    conf.setMaster("local[*]")
    conf.set("es.index.auto.create", "true")
    conf.set("es.nodes", "hdfs01.edcs.org:9200")
    val sc = new SparkContext(conf)

    val job1 = Job("C开发工程师", "http://job.c.com", "c公司", "10000")
    val job2 = Job("C++开发工程师", "http://job.c++.com", "c++公司", "10000")
    val job3 = Job("C#开发工程师", "http://job.c#.com", "c#公司", "10000")
    val job4 = Job("Java开发工程师", "http://job.java.com", "java公司", "10000")
    val job5 = Job("Scala开发工程师", "http://job.scala.com", "java公司", "10000")

    val rdd = sc.makeRDD(Seq(job1, job2, job3, job4, job5))
    EsSpark.saveToEs(rdd, "data/job01")

  }
}

 

1.3. 方式二步骤解析:

 

Scala用户可能会使用SEQ和→符号声明根对象(即JSON文件)而不是使用Map。而类似的,第一个符号的结果略有不同,不能相匹配的一个JSON文件:序列是一阶序列(换句话说,一个列表),←会创建一个Tuple(元组),或多或少是一个有序的,元素的定数。例如,一个列表的列表不能作为一个文件,因为它不能被映射到一个JSON对象;但是它可以在一个自由的使用。因此在上面的例子Map(K→V)代替SEQ(K→V)
作为一种替代上面的隐式导入,elasticsearch-hadoop支持spark的Scala用户通过org.elasticsearch.spark.rdd包作为实用类允许显式方法调用EsSpark。

步骤如下:

1.Spark Scala imports

2.Elasticsearch-hadoop Scala imports

3.Define a case class named Trip

4.Create an RDD around the Trip instances

5.Index the RDD explicitly through EsSpark

 

对于指定documents的id(或者其他类似于TTL或时间戳的元数据),可以设置名字为es.mapping.id的映射。下面以前的实例,Elasticsearch利用filed的id作为documents的id.更新RDD的配置configuration(也可以在SparkConf上设置全局的属性,不建议这样做)

 

 

注意:设置es.mapping.id属性,参数不可以设置包含_id(与ES中数据默认字段冲突)

 

1.4. 代码如下:

import org.apache.spark.{SparkConf, SparkContext}
import org.elasticsearch.spark.rdd.EsSpark


/**
  * Created by hand on 2018/1/9.
  */

object Es_spark {
  def main(args: Array[String]): Unit = {

    case class Trip(jobName: String, jobUrl: String, companyName: String, salary: String)
    var conf = new SparkConf()
    conf.setAppName("S2EExample")
    conf.setMaster("local[*]")
    conf.set("es.index.auto.create", "true")
    conf.set("es.nodes", "hdfs01.edcs.org:9200")
    val sc = new SparkContext(conf)

    val trip1 = Trip("C开发工程师", "http://job.c.com", "c公司", "10000")
    val trip2 = Trip("C++开发工程师", "http://job.c++.com", "c++公司", "10000")
    val trip3 = Trip("C#开发工程师", "http://job.c#.com", "c#公司", "10000")
    val trip4 = Trip("Java开发工程师", "http://job.java.com", "java公司", "10000")
    val trip5 = Trip("Scala开发工程师", "http://job.scala.com", "java公司", "10000")

    val rdd = sc.makeRDD(Seq(trip1, trip2, trip3, trip4, trip5))
    EsSpark.saveToEs(rdd, "data/job01")

  }
}

2. write data from elasticsearch

2.1. 步骤:

1.Spark Scala imports

2.elasticsearch-hadoop Scala imports

3.start Spark through its Scala API

4.a dedicated RDD for Elasticsearch is created for index eee/01

5.create an RDD streaming all the documents matching me* from index eee/01

代码如下:

import org.apache.spark.{SparkConf, SparkContext}
import org.elasticsearch.spark.rdd.EsSpark


/**
  * Created by hand on 2018/1/9.
  */

object Es_spark {
  def main(args: Array[String]): Unit = {

    case class Trip(jobName: String, jobUrl: String, companyName: String, salary: String)
    var conf = new SparkConf()
    conf.setAppName("S2EExample")
    conf.setMaster("local[*]")
    conf.set("es.index.auto.create", "true")
    conf.set("es.nodes", "hdfs01.edcs.org:9200")
    val sc = new SparkContext(conf)

    EsSpark.esRDD(sc, "eee/01", "q?name=*")
  }
}

 

 

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
数据来源:中经数据库 主要指标110多个(全部都是纯粹的 市辖区 指标),大致是: GDP GDP增速 第一产业增加值占GDP比重 第二产业增加值占GDP比重 第三产业增加值占GDP比重 人均GDP 社会消费品零售总额 固定资产投资(不含农户) 新设外商投资企业数_外商直接投资 实际利用外资金额(美元) 一般公共预算收入 一般公共预算支出 一般公共预算支出_教育 一般公共预算支出_科学技术 金融机构人民币各项存款余额_个人储蓄存款 金融机构人民币各项存款余额 金融机构人民币各项贷款余额 规模以上工业企业单位数 规模以上工业企业单位数_内资企业 规模以上工业企业单位数_港澳台商投资企业 规模以上工业企业单位数_外商投资企业 规模以上工业总产值 规模以上工业总产值_内资企业 规模以上工业总产值_港澳台商投资企业 规模以上工业总产值_外商投资企业 规模以上工业企业流动资产合计 规模以上工业企业固定资产合计 规模以上工业企业利润总额 规模以上工业企业应交增值税 规模以上工业企业主营业务税金及附加 户籍人口数 年均户籍人口数 户籍人口自然增长率 第一产业就业人员占全部城镇单位就业人员比重 第二产业就业人员占全部城镇单位就业人员比重 第三产业就业人员占全部城镇单位就业人员比重 城镇非私营单位就业人员数 城镇非私营单位就业人员数_第一产业 城镇非私营单位就业人员数_第二产业 城镇非私营单位就业人员数_第三产业 城镇非私营单位就业人员数_农、林、牧、渔业 城镇非私营单位就业人员数_采矿业 城镇非私营单位就业人员数_制造业 城镇非私营单位就业人员数_电力、热力、燃气及水生产和供应业 城镇非私营单位就业人员数_建筑业 城镇非私营单位就业人员数_批发和零售业 城镇非私营单位就业人员数_交通运输、仓储和邮政业 城镇非私营单位就业人员数_住宿和餐饮业 城镇非私营单位就业人员数_信息传输、软件和信息技术服务业 城镇非私营单位就业人员数_金融业 城镇非私营单位就业人员数_房地产业 城镇非私营单位就业人员数_租赁和商务服务业 城镇非私营单位就业人员数_科学研究和技术服务业 城镇非私营单位就业人员数_水利、环境和公共设施管理业 城镇非私营单位就业人员数_居民服务、修理和其他服务业 城镇非私营单位就业人员数_教育 城镇非私营单位就业人员数_卫生和社会工作 城镇非私营单位就业人员数_文化、体育和娱乐业 城镇非私营单位就业人员数_公共管理、社会保障和社会组织 城镇非私营单位在岗职工平均人数 城镇就业人员数_私营企业和个体 城镇非私营单位在岗职工工资总额 城镇非私营单位在岗职工平均工资 城镇登记失业人员数 建成区面积 建设用地面积 建设用地面积_居住用地 液化石油气供气总量 液化石油气供气总量_居民家庭 人工煤气、天然气供气总量 人工煤气、天然气供气总量_居民家庭 液化石油气用气人口 人工煤气、天然气用气人口 城市公共汽电车运营车辆数 城市出租汽车运营车辆数 城市公共汽电车客运总量 道路面积 排水管道长度 建成区绿化覆盖面积 建成区绿化覆盖率 绿地面积 公园绿地面积 维护建设资金支出 土地面积 生活用水供水量 供水总量 全社会用电量 城乡居民生活用电量 工业生产用电量 房地产开发投资 房地产开发投资_住宅 限额以上批发和零售业法人单位数 限额以上批发和零售业商品销售总额 普通中学学校数 中等职业教育学校数 普通小学学校数 普通高等学校专任教师数 普通中学专任教师数 中等职业教育专任教师数 普通小学专任教师数 普通高等学校在校生数 普通中学在校生数 中等职业教育在校生数 普通小学在校生数 电视节目综合人口覆盖率 公共图书馆总藏量_图书 医疗卫生机构数_医院和卫生院 卫生人员数_执业(助理)医师 医疗卫生机构床位数_医院和卫生院 城镇职工基本养老保险参保人数 职工基本医疗保险参保人数 失业保险参保人数
机器学习是一种人工智能(AI)的子领域,致力于研究如何利用数据和算法让计算机系统具备学习能力,从而能够自动地完成特定任务或者改进自身性能。机器学习的核心思想是让计算机系统通过学习数据中的模式和规律来实现目标,而不需要显式地编程。 机器学习应用非常广泛,包括但不限于以下领域: 图像识别和计算机视觉: 机器学习在图像识别、目标检测、人脸识别、图像分割等方面有着广泛的应用。例如,通过深度学习技术,可以训练神经网络来识别图像中的对象、人脸或者场景,用于智能监控、自动驾驶、医学影像分析等领域。 自然语言处理: 机器学习在自然语言处理领域有着重要的应用,包括文本分类、情感分析、机器翻译、语音识别等。例如,通过深度学习模型,可以训练神经网络来理解和生成自然语言,用于智能客服、智能助手、机器翻译等场景。 推荐系统: 推荐系统利用机器学习算法分析用户的行为和偏好,为用户推荐个性化的产品或服务。例如,电商网站可以利用机器学习算法分析用户的购买历史和浏览行为,向用户推荐感兴趣的商品。 预测和预测分析: 机器学习可以用于预测未来事件的发生概率或者趋势。例如,金融领域可以利用机器学习算法进行股票价格预测、信用评分、欺诈检测等。 医疗诊断和生物信息学: 机器学习在医疗诊断、药物研发、基因组学等领域有着重要的应用。例如,可以利用机器学习算法分析医学影像数据进行疾病诊断,或者利用机器学习算法分析基因数据进行疾病风险预测。 智能交通和物联网: 机器学习可以应用于智能交通系统、智能城市管理和物联网等领域。例如,可以利用机器学习算法分析交通数据优化交通流量,或者利用机器学习算法分析传感器数据监测设备状态。 以上仅是机器学习应用的一部分,随着机器学习技术的不断发展和应用场景的不断拓展,机器学习在各个领域都有着重要的应用价值,并且正在改变我们的生活和工作方式。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值