jdk
文章平均质量分 58
Yoga-jiang
在晶赞从事大数据研发工作
展开
-
hive优化大全-一篇就够了
1.概述 在工作中总结Hive的常用优化手段和在工作中使用Hive出现的问题。下面开始本篇文章的优化介绍。2.介绍 首先,我们来看看Hadoop的计算框架特性,在此特性下会衍生哪些问题?数据量大不是问题,数据倾斜是个问题。 jobs数比较多的作业运行效率相对比较低,比如即使有几百行的表,如果多次关联多次汇总,产生十几个jobs,耗时很长。原因是map reduce作业初始化的时间是比较长的。 sum,count,max,min等UDAF,不怕数据倾斜问题,hadoop在map端的汇总合并优转载 2021-01-25 14:36:43 · 3871 阅读 · 0 评论 -
基于Apache Kylin大数据多维查询分析平台实践
https://blog.csdn.net/liuxinli/article/details/84345248转载 2019-11-22 17:17:14 · 215 阅读 · 0 评论 -
【Jsoup学习礼记】消除不受信任的HTML (来防止XSS攻击)
问题在做网站的时候,经常会提供用户评论的功能。有些不怀好意的用户,会搞一些脚本到评论内容中,而这些脚本可能会破坏整个页面的行为,更严重的是获取一些机要信息,此时需要清理该HTML,以避免跨站脚本cross-site scripting攻击(XSS)。方法使用jsoup HTML Cleaner 方法进行清除,但需要指定一个可配置的 Whitelist。String un原创 2015-03-11 15:57:24 · 662 阅读 · 0 评论 -
【Jsoup学习礼记】解析一个HTML字符串
存在问题来自用户输入,一个文件或一个网站的HTML字符串,你可能需要对它进行解析并取其内容,或校验其格式是否完整,或想修改它。怎么办?jsonu能够帮你轻松解决这些问题解决方法使用静态Jsoup.parse(String html) 方法或 Jsoup.parse(String html, String baseUri)示例代码:String html = "F原创 2015-03-11 15:19:14 · 542 阅读 · 0 评论 -
【Jsoup学习礼记】从一个文件加载一个文档
问题在本机硬盘上有一个HTML文件,需要对它进行解析从中抽取数据或进行修改。办法可以使用静态 Jsoup.parse(File in, String charsetName, String baseUri) 方法:File input = new File("/tmp/input.html");Document doc = Jsoup.parse(input, "原创 2015-03-11 15:33:01 · 446 阅读 · 0 评论 -
【Jsoup学习礼记】从元素抽取属性,文本和HTML
问题在解析获得一个Document实例对象,并查找到一些元素之后,你希望取得在这些元素中的数据。方法要取得一个属性的值,可以使用Node.attr(String key) 方法对于一个元素中的文本,可以使用Element.text()方法对于要取得元素或属性中的HTML内容,可以使用Element.html(), 或 Node.outerHtml()方法示例原创 2015-03-11 15:45:51 · 526 阅读 · 0 评论 -
【Jsoup学习礼记】解析和遍历一个HTML文档
如何解析一个HTML文档:String html = "First parse" + "Parsed HTML into a doc.";Document doc = Jsoup.parse(html);(更详细内容可查看 解析一个HTML字符串.)其解析器能够尽最大可能从你提供的HTML文档来创见一个干净的解析结果,无论HTML的格式是否完整。比如它可以处理:原创 2015-03-11 15:16:40 · 329 阅读 · 0 评论 -
【Jsoup学习礼记】使用DOM方法来遍历一个文档
问题你有一个HTML文档要从中提取数据,并了解这个HTML文档的结构。方法将HTML解析成一个Document之后,就可以使用类似于DOM的方法进行操作。示例代码:File input = new File("/tmp/input.html");Document doc = Jsoup.parse(input, "UTF-8", "http://example.com原创 2015-03-11 15:34:40 · 544 阅读 · 0 评论 -
【Jsoup学习礼记】从一个URL加载一个Document
存在问题你需要从一个网站获取和解析一个HTML文档,并查找其中的相关数据。你可以使用下面解决方法:解决方法使用 Jsoup.connect(String url)方法:Document doc = Jsoup.connect("http://example.com/").get();String title = doc.title();说明con原创 2015-03-11 15:28:40 · 548 阅读 · 0 评论 -
【jsoup的学习礼记】设置一个元素的HTML内容
问题你需要一个元素中的HTML内容方法可以使用Element中的HTML设置方法具体如下:Element div = doc.select("div").first(); // div.html("lorem ipsum"); // lorem ipsumdiv.prepend("First");//在div前添加html内容div.append("Last");原创 2015-03-11 15:51:29 · 573 阅读 · 0 评论 -
使用JSoup解析HTML文件
HTML是WEB的核心,互联网中你看到的所有页面都是HTML,不管它们是由JavaScript,JSP,PHP,ASP或者是别的什么WEB技术动态生成的。你的浏览器会去解析HTML并替你去渲染它们。不过如果你需要自己在Java程序中解析HTML文档并查找某些元素,标签,属性或者检查某个特定的元素是否存在的话,那又该如何呢?如果你已经使用Java编程多年了,我相信你肯定试过去解析XML,也使用过类似原创 2015-03-11 16:57:54 · 779 阅读 · 0 评论 -
eclipse中maven配置
1.下载Maven官方下载地址:http://maven.apache.org/download.html选择你所希望下载的版本,并保存到常用安装目录。这里以Maven 3.2.2 (Binary zip)为例(二进制文件可直接使用)。2.解压maven到软件安装常用目录如: D:\Softwares\apache-maven-3.2.23.打开系统环境变量转载 2015-04-27 09:44:26 · 292 阅读 · 0 评论 -
Quartz使用-入门使用(java定时任务实现)
很久没有用Quartz了,居然忘记如何使用了,这里赶紧记录下对Quartz就不说明了,直接上代码这里使用的是quartz-1.8.3.jar简单的任务管理类/* * 版权所有: 姜勇刚 * 项目名称:公用模块 * 创建者:姜勇刚 * 创建日期:2015-10-27 * 最近修改者:姜勇刚 * 最经修改时间:2015-10-27 * */原创 2015-10-22 22:44:24 · 589 阅读 · 0 评论 -
下一代Apache Hadoop MapReduce框架的架构
背景随着集群规模和负载增加,MapReduce JobTracker在内存消耗,线程模型和扩展性/可靠性/性能方面暴露出了缺点,为此需要对它进行大整修。需求当我们对Hadoop MapReduce框架进行改进时,需要时刻谨记的一个重要原则是用户的需求。近几年来,从Hadoop用户那里总结出MapReduce框架当前最紧迫的需求有:(1)可靠性(Reliability)– JobTracker不可靠(转载 2017-04-05 10:09:13 · 675 阅读 · 0 评论 -
【Jsoup学习礼记】设置元素的文本内容
问题你需要修改一个HTML文档中的文本内容方法可以使用Element的设置方法::Element div = doc.select("div").first(); // div.text("five > four"); // five > fourdiv.prepend("First ");div.append(" Last");// now: First原创 2015-03-11 15:51:22 · 507 阅读 · 0 评论 -
【Jsoup学习礼记】示例程序: 获取所有链接
这个示例程序将展示如何从一个URL获得一个页面。然后提取页面中的所有链接、图片和其它辅助内容。并检查URLs和文本信息。运行下面程序需要指定一个URLs作为参数package org.jsoup.examples;import org.jsoup.Jsoup;import org.jsoup.helper.Validate;import org.jsoup.nodes.Docu原创 2015-03-11 15:48:03 · 727 阅读 · 0 评论 -
Jsoup 解析Html源码实例
最近在做数据挖掘的过程中需要对html的源码进行解析,用到了Jsoup这个解析工具,下面写个基本实例来展现它的用法。需要用到jar包:jsoup-1.7.2.jar,可以到jsoup的官网下载:http://jsoup.org/download[java] view plaincopyprint?import java.io.File原创 2015-03-11 17:29:47 · 567 阅读 · 0 评论 -
hive-学习内容
1 hive的正则匹配搜索表 show table原创 2014-09-18 10:26:33 · 470 阅读 · 0 评论 -
配置Hive
配置HiveHive的配置文件名为hive-site.xml,你可以在Hive安装目录下的conf目录下找到这个文件。如果你发现该目录下没有这个文件,你可以通过复制hive-default.xml.template来生成该文件。当然,你也可以在进入hive时指定参数来明确指明配置文件所在目录。比如:hive --config /home/user/hive-conf你也可以在进入h转载 2014-08-21 16:05:09 · 583 阅读 · 0 评论 -
CentOS-6.3安装配置JDK-8
系统环境:CentOS 6.3 64位安装方式:rpm安装 软件:jdk-8-linux-x64.rpm下载地址:http://www.oracle.com/technetwork/java/javase/downloads/jdk8-downloads-2133151.html检验系统原版本[plain] view plaincopyprint?转载 2014-09-19 14:31:45 · 534 阅读 · 0 评论 -
hive_优化
什么是数据倾斜•由于数据的不均衡原因,导致数据分布不均匀,造成数据大量的集中到一点,造成数据热点Hadoop框架的特性•不怕数据大,怕数据倾斜•jobs数比较多的作业运行效率相对比较低,比如即使有几百行的表,如果多次关联多次汇总,产生十几个jobs,耗时很长。原因是map reduce作业初始化的时间是比较长的•sum,count,max,min等UDAF,原创 2014-09-10 10:56:06 · 430 阅读 · 0 评论 -
hive 基础内容
(一): Hive 是什么 在接触一个新的事物首先要回到的问题是:这是什么? 这里引用 Hive wiki 上的介绍: Hive is a data warehouse infrastructure built on top of Hadoop. It provides tools to enable easy data ETL, a mechanism to put转载 2014-08-29 11:18:26 · 436 阅读 · 0 评论 -
linux远程下载文件 的两种方法之 ftp命令和scp命令
ftp命令: 服务器有安装ftp Server,另外一台linux可以使用ftp的client程序来进行文件的拷贝读取和下载。 1. 连接ftp服务器 格式:ftp [hostname| ip-address] a)在linux命令行下输入:ftp 192.168.26.66 b)服务器询问你用户名和口令,分别输入用户名和相应密码,待认证通过即可。 2. 下载文件转载 2014-09-03 09:57:57 · 2330 阅读 · 0 评论 -
Hadoop集群(第5期)_Hadoop安装配置
1、集群部署介绍1.1 Hadoop简介 Hadoop是Apache软件基金会旗下的一个开源分布式计算平台。以Hadoop分布式文件系统(HDFS,Hadoop Distributed Filesystem)和MapReduce(Google MapReduce的开源实现)为核心的Hadoop为用户提供了系统底层细节透明的分布式基础架构。 对于Hadoop的集群来讲,可以分转载 2014-09-03 10:20:12 · 374 阅读 · 0 评论 -
httpClient获取Jsoup解析网页
因项目需要从某个网站爬取一点数据,故我将爬取记录如下,以后说不定还能用得到呢,废话少说,进入正题:HttpClient 是 Apache Jakarta Common 下的子项目,可以用来提供高效的、最新的、功能丰富的支持 HTTP 协议的客户端编程工具包,并且它支持 HTTP 协议最新的版本和建议。本文首先介绍 HTTPClient,然后根据作者实际工作经验给出了一些常见问题的解决方法。转载 2015-03-20 11:49:36 · 465 阅读 · 0 评论 -
【Jsoup学习礼记】解析一个body片断
问题假如你有一个HTML片断 (比如. 一个 div 包含一对 p 标签; 一个不完整的HTML文档) 想对它进行解析。这个HTML片断可以是用户提交的一条评论或在一个CMS页面中编辑body部分。办法使用Jsoup.parseBodyFragment(String html)方法.String html = "Lorem ipsum.";Document d原创 2015-03-11 15:20:34 · 485 阅读 · 0 评论 -
【Jsoup的学习礼记】使用选择器语法来查找元素
问题你想使用类似于CSS或jQuery的语法来查找和操作元素。方法可以使用Element.select(String selector) 和 Elements.select(String selector) 方法实现:File input = new File("/tmp/input.html");Document doc = Jsoup.parse(inpu原创 2015-03-11 15:36:04 · 675 阅读 · 0 评论 -
【Jsoup学习礼记】处理URLs
问题你有一个包含相对URLs路径的HTML文档,需要将这些相对路径转换成绝对路径的URLs。方法在你解析文档时确保有指定base URI,然后使用 abs: 属性前缀来取得包含base URI的绝对路径。代码如下: Document doc = Jsoup.connect("http://www.open-open.com").get();Element l原创 2015-03-11 15:46:53 · 528 阅读 · 0 评论 -
【Jsoup学习礼记】设置属性的值
问题在你解析一个Document之后可能想修改其中的某些属性值,然后再保存到磁盘或都输出到前台页面。方法可以使用属性设置方法 Element.attr(String key, String value), 和 Elements.attr(String key, String value).假如你需要修改一个元素的 class 属性,可以使用 Element.原创 2015-03-11 15:48:02 · 680 阅读 · 0 评论 -
jsoup解析HTML用法小结
使用HttpClient+jsoup做采集器有一段时间了,发现jsoup很好用,而且还有很多方便的东西都没怎么用上。于是想根据官网上的cookbook来对jsoup的使用做个小结,或者是归纳。按功能分类做个列表,方便在写程序的时候快速翻阅。1、jsoup的HTML文档(Document)对象模型Document对象由Element和TextNode对象组成继承链Document原创 2015-03-11 17:06:10 · 970 阅读 · 0 评论 -
如何在Ubantu下安装jdk7版本
1.下载JDK目前最新的JDK版本是:Java SE Development Kit 7u5下载地址:http://download.oracle.com/otn-pub/java/jdk/7u5-b06/jdk-7u5-linux-i586.tar.gz查看最新:http://www.oracle.com/technetwork/java/javase/downloads原创 2014-05-22 20:54:50 · 730 阅读 · 0 评论