java
文章平均质量分 57
Yoga-jiang
在晶赞从事大数据研发工作
展开
-
jsoup解析HTML用法小结
使用HttpClient+jsoup做采集器有一段时间了,发现jsoup很好用,而且还有很多方便的东西都没怎么用上。于是想根据官网上的cookbook来对jsoup的使用做个小结,或者是归纳。按功能分类做个列表,方便在写程序的时候快速翻阅。1、jsoup的HTML文档(Document)对象模型Document对象由Element和TextNode对象组成继承链Document原创 2015-03-11 17:06:10 · 970 阅读 · 0 评论 -
Jsoup 解析Html源码实例
最近在做数据挖掘的过程中需要对html的源码进行解析,用到了Jsoup这个解析工具,下面写个基本实例来展现它的用法。需要用到jar包:jsoup-1.7.2.jar,可以到jsoup的官网下载:http://jsoup.org/download[java] view plaincopyprint?import java.io.File原创 2015-03-11 17:29:47 · 567 阅读 · 0 评论 -
【Jsoup学习礼记】解析和遍历一个HTML文档
如何解析一个HTML文档:String html = "First parse" + "Parsed HTML into a doc.";Document doc = Jsoup.parse(html);(更详细内容可查看 解析一个HTML字符串.)其解析器能够尽最大可能从你提供的HTML文档来创见一个干净的解析结果,无论HTML的格式是否完整。比如它可以处理:原创 2015-03-11 15:16:40 · 329 阅读 · 0 评论 -
【Jsoup学习礼记】解析一个HTML字符串
存在问题来自用户输入,一个文件或一个网站的HTML字符串,你可能需要对它进行解析并取其内容,或校验其格式是否完整,或想修改它。怎么办?jsonu能够帮你轻松解决这些问题解决方法使用静态Jsoup.parse(String html) 方法或 Jsoup.parse(String html, String baseUri)示例代码:String html = "F原创 2015-03-11 15:19:14 · 542 阅读 · 0 评论 -
【Jsoup学习礼记】设置属性的值
问题在你解析一个Document之后可能想修改其中的某些属性值,然后再保存到磁盘或都输出到前台页面。方法可以使用属性设置方法 Element.attr(String key, String value), 和 Elements.attr(String key, String value).假如你需要修改一个元素的 class 属性,可以使用 Element.原创 2015-03-11 15:48:02 · 680 阅读 · 0 评论 -
【Jsoup学习礼记】使用DOM方法来遍历一个文档
问题你有一个HTML文档要从中提取数据,并了解这个HTML文档的结构。方法将HTML解析成一个Document之后,就可以使用类似于DOM的方法进行操作。示例代码:File input = new File("/tmp/input.html");Document doc = Jsoup.parse(input, "UTF-8", "http://example.com原创 2015-03-11 15:34:40 · 544 阅读 · 0 评论 -
【Jsoup的学习礼记】使用选择器语法来查找元素
问题你想使用类似于CSS或jQuery的语法来查找和操作元素。方法可以使用Element.select(String selector) 和 Elements.select(String selector) 方法实现:File input = new File("/tmp/input.html");Document doc = Jsoup.parse(inpu原创 2015-03-11 15:36:04 · 675 阅读 · 0 评论 -
【jsoup的学习礼记】设置一个元素的HTML内容
问题你需要一个元素中的HTML内容方法可以使用Element中的HTML设置方法具体如下:Element div = doc.select("div").first(); // div.html("lorem ipsum"); // lorem ipsumdiv.prepend("First");//在div前添加html内容div.append("Last");原创 2015-03-11 15:51:29 · 573 阅读 · 0 评论 -
Quartz使用-入门使用(java定时任务实现)
很久没有用Quartz了,居然忘记如何使用了,这里赶紧记录下对Quartz就不说明了,直接上代码这里使用的是quartz-1.8.3.jar简单的任务管理类/* * 版权所有: 姜勇刚 * 项目名称:公用模块 * 创建者:姜勇刚 * 创建日期:2015-10-27 * 最近修改者:姜勇刚 * 最经修改时间:2015-10-27 * */原创 2015-10-22 22:44:24 · 589 阅读 · 0 评论 -
Windows + IntelliJ IDEA 下配置 python scala 插件的方法
Windows + IntelliJ IDEA 下配置 python scala 插件的方法1.访问http://www.python.org/download/下载最新的Python版本 2.下载,解压 3.配置环境变量,PATH 4.测试安装是否成功 5.Hello World 6.在intellij idea离线安装Python plugin (...原创 2017-03-20 16:01:40 · 4386 阅读 · 1 评论 -
常用 Git 命令清单
常用 Git 命令清单我每天使用 Git ,但是很多命令记不住。一般来说,日常使用只要记住下图6个命令,就可以了。但是熟练使用,恐怕要记住60~100个命令。下面是我整理的常用 Git 命令清单。几个专用名词的译名如下。 Workspace:工作区 Index / Stage:暂存区 Repository:仓库区(或本地仓库) Remote:远程仓库 一、新建代码库转载 2017-03-29 17:31:33 · 354 阅读 · 0 评论 -
【Jsoup学习礼记】从一个URL加载一个Document
存在问题你需要从一个网站获取和解析一个HTML文档,并查找其中的相关数据。你可以使用下面解决方法:解决方法使用 Jsoup.connect(String url)方法:Document doc = Jsoup.connect("http://example.com/").get();String title = doc.title();说明con原创 2015-03-11 15:28:40 · 548 阅读 · 0 评论 -
【Jsoup学习礼记】解析一个body片断
问题假如你有一个HTML片断 (比如. 一个 div 包含一对 p 标签; 一个不完整的HTML文档) 想对它进行解析。这个HTML片断可以是用户提交的一条评论或在一个CMS页面中编辑body部分。办法使用Jsoup.parseBodyFragment(String html)方法.String html = "Lorem ipsum.";Document d原创 2015-03-11 15:20:34 · 485 阅读 · 0 评论 -
【Jsoup学习礼记】消除不受信任的HTML (来防止XSS攻击)
问题在做网站的时候,经常会提供用户评论的功能。有些不怀好意的用户,会搞一些脚本到评论内容中,而这些脚本可能会破坏整个页面的行为,更严重的是获取一些机要信息,此时需要清理该HTML,以避免跨站脚本cross-site scripting攻击(XSS)。方法使用jsoup HTML Cleaner 方法进行清除,但需要指定一个可配置的 Whitelist。String un原创 2015-03-11 15:57:24 · 662 阅读 · 0 评论 -
配置Hive
配置HiveHive的配置文件名为hive-site.xml,你可以在Hive安装目录下的conf目录下找到这个文件。如果你发现该目录下没有这个文件,你可以通过复制hive-default.xml.template来生成该文件。当然,你也可以在进入hive时指定参数来明确指明配置文件所在目录。比如:hive --config /home/user/hive-conf你也可以在进入h转载 2014-08-21 16:05:09 · 585 阅读 · 0 评论 -
CentOS-6.3安装配置JDK-8
系统环境:CentOS 6.3 64位安装方式:rpm安装 软件:jdk-8-linux-x64.rpm下载地址:http://www.oracle.com/technetwork/java/javase/downloads/jdk8-downloads-2133151.html检验系统原版本[plain] view plaincopyprint?转载 2014-09-19 14:31:45 · 534 阅读 · 0 评论 -
hive 基础内容
(一): Hive 是什么 在接触一个新的事物首先要回到的问题是:这是什么? 这里引用 Hive wiki 上的介绍: Hive is a data warehouse infrastructure built on top of Hadoop. It provides tools to enable easy data ETL, a mechanism to put转载 2014-08-29 11:18:26 · 436 阅读 · 0 评论 -
linux远程下载文件 的两种方法之 ftp命令和scp命令
ftp命令: 服务器有安装ftp Server,另外一台linux可以使用ftp的client程序来进行文件的拷贝读取和下载。 1. 连接ftp服务器 格式:ftp [hostname| ip-address] a)在linux命令行下输入:ftp 192.168.26.66 b)服务器询问你用户名和口令,分别输入用户名和相应密码,待认证通过即可。 2. 下载文件转载 2014-09-03 09:57:57 · 2330 阅读 · 0 评论 -
Hadoop集群(第5期)_Hadoop安装配置
1、集群部署介绍1.1 Hadoop简介 Hadoop是Apache软件基金会旗下的一个开源分布式计算平台。以Hadoop分布式文件系统(HDFS,Hadoop Distributed Filesystem)和MapReduce(Google MapReduce的开源实现)为核心的Hadoop为用户提供了系统底层细节透明的分布式基础架构。 对于Hadoop的集群来讲,可以分转载 2014-09-03 10:20:12 · 374 阅读 · 0 评论 -
【Jsoup学习礼记】示例程序: 获取所有链接
这个示例程序将展示如何从一个URL获得一个页面。然后提取页面中的所有链接、图片和其它辅助内容。并检查URLs和文本信息。运行下面程序需要指定一个URLs作为参数package org.jsoup.examples;import org.jsoup.Jsoup;import org.jsoup.helper.Validate;import org.jsoup.nodes.Docu原创 2015-03-11 15:48:03 · 728 阅读 · 0 评论 -
使用JSoup解析HTML文件
HTML是WEB的核心,互联网中你看到的所有页面都是HTML,不管它们是由JavaScript,JSP,PHP,ASP或者是别的什么WEB技术动态生成的。你的浏览器会去解析HTML并替你去渲染它们。不过如果你需要自己在Java程序中解析HTML文档并查找某些元素,标签,属性或者检查某个特定的元素是否存在的话,那又该如何呢?如果你已经使用Java编程多年了,我相信你肯定试过去解析XML,也使用过类似原创 2015-03-11 16:57:54 · 779 阅读 · 0 评论 -
【Jsoup学习礼记】从一个文件加载一个文档
问题在本机硬盘上有一个HTML文件,需要对它进行解析从中抽取数据或进行修改。办法可以使用静态 Jsoup.parse(File in, String charsetName, String baseUri) 方法:File input = new File("/tmp/input.html");Document doc = Jsoup.parse(input, "原创 2015-03-11 15:33:01 · 446 阅读 · 0 评论 -
【Jsoup学习礼记】从元素抽取属性,文本和HTML
问题在解析获得一个Document实例对象,并查找到一些元素之后,你希望取得在这些元素中的数据。方法要取得一个属性的值,可以使用Node.attr(String key) 方法对于一个元素中的文本,可以使用Element.text()方法对于要取得元素或属性中的HTML内容,可以使用Element.html(), 或 Node.outerHtml()方法示例原创 2015-03-11 15:45:51 · 526 阅读 · 0 评论 -
【Jsoup学习礼记】设置元素的文本内容
问题你需要修改一个HTML文档中的文本内容方法可以使用Element的设置方法::Element div = doc.select("div").first(); // div.text("five > four"); // five > fourdiv.prepend("First ");div.append(" Last");// now: First原创 2015-03-11 15:51:22 · 507 阅读 · 0 评论 -
【Jsoup学习礼记】处理URLs
问题你有一个包含相对URLs路径的HTML文档,需要将这些相对路径转换成绝对路径的URLs。方法在你解析文档时确保有指定base URI,然后使用 abs: 属性前缀来取得包含base URI的绝对路径。代码如下: Document doc = Jsoup.connect("http://www.open-open.com").get();Element l原创 2015-03-11 15:46:53 · 528 阅读 · 0 评论 -
Java实现简单的网络爬虫
摘要 一直以来都希望自己做一个站内的搜索引擎,其实不一定是一个搜索引擎,关键是能分析网站数据的东西,java有很多开源的爬虫实现,但是开始还是从一个简单的里面了解其原理吧。 总共有6个类,先介绍下每个类的功能: DownloadPage.java的功能是下载此超链接的 一直以来都希望自己做一个站内的搜索引擎,其实不一定是一个搜索引擎,关键是能分析网站数据的东西,java有很多开源转载 2014-06-10 10:34:48 · 747 阅读 · 0 评论