Spark程序结果包含括号的问题

一个简单的wordcount Spark程序如下所示:

import org.apache.spark.SparkConf
import org.apache.spark.SparkContext
import org.apache.spark.SparkContext._

/**
 * @author lming_08
 */
object WordCount {
  def main(args:Array[String]) {
    if (args.length < 2) {
      println("WordCount inputfile outputfile")
      return
    }
    val Array(inputFile, outputFile) = args
    val sc = new SparkContext(new SparkConf())

    val inputData = sc.textFile(inputFile)
    inputData.flatMap(_.split("\\s+")).map((_, 1)).reduceByKey(_+_)
      .saveAsTextFile(outputFile)
  }
}

输入文件input.dat内容:
OS:Red Hat Enterprise Linux Server release 6.4 (Santiago)
IntelliJ IDEA 13.1.3
输出文件内容:
(release,1)
(OS:Red,1)
(13.1.3,1)
(Hat,1)
(6.4,1)
(IntelliJ,1)
(IDEA,1)
(Linux,1)
(Server,1)
(Enterprise,1)
((Santiago),1)

显然,结果中含有该死的括号!所以需要想办法去掉括号!

val inputData = sc.textFile(inputFile)
    inputData.flatMap(_.split("\\s+")).map((_, 1)).reduceByKey(_+_)
      .map(line => {
        val word = line._1
        val cnt = line._2
        word + "\t" + cnt
      })
      .saveAsTextFile(outputFile)

这次结果才是预期的
release 1
OS:Red 1
13.1.3 1
Hat 1
6.4 1
IntelliJ 1
IDEA 1
Linux 1
Server 1
Enterprise 1
(Santiago) 1

评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值