DataFrame 对其列的各种转化处理

本文介绍了如何在Apache Spark的DataFrame中处理列,包括使用functions库进行字符串长度截取、字段拆分等操作,涵盖了多种场景,如保留原始列的拆分和不保留原始列的拆分。
摘要由CSDN通过智能技术生成

前置

Oracle中INSTR的用法:


INSTR(源字符串, 要查找的字符串, 从第几个字符开始, 要找到第几个匹配的序号)

例如:INSTR('CORPORATE FLOOR','OR', 3, 2)中,
源字符串为'CORPORATE FLOOR', 在字符串中查找'OR',
从第三个字符位置开始查找"OR",取第三个字后第2个匹配项的位置。

oracle的substr函数的用法:

 取得字符串中指定起始位置和长度的字符串   
 substr( string, start_position, [ length ] )
  如:
     substr('This is a test', 6, 2)     would return 'is'

import org.apache.spark.sql.functions._

场景1:我们想要对DataFrame a Column 进行进行字符串的长度截取

方式一:Function "expr" 
val data = List("first", "second", "third")
val testDF = sc.parallelize(data).toDF("col")
val result = testDF.withColumn("newcol", expr("substring(col, 1, length(col)-1)"))
result.show(false)

方式二: use $"COLUMN".substr
val
  • 0
    点赞
  • 2
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值