关闭

如何提取CSDN博客正文内容

227人阅读 评论(0) 收藏 举报
分类:
document.getElementById("article_content").outerHTML;


在任意的一片博文运行以上代码都可以获得正文内容,但是对于代码、字体都没有渲染,甚是难看。


提取出来的博客关键代码:

<html>
<head>
    <meta http-equiv="Content-Type" content="text/html; charset=utf-8" />
    <script src="http://static.blog.csdn.net/scripts/jquery.js" type="text/javascript"></script>
    <link rel="Stylesheet" type="text/css" href="http://static.blog.csdn.net/skin/skin-blue/css/style.css?v=1.1" />
    <link rel="shortcut icon" href="http://c.csdnimg.cn/public/favicon.ico" />
    <link type="text/css" rel="stylesheet" href="http://static.blog.csdn.net/scripts/SyntaxHighlighter/styles/default.css" />
</head>
<body>
<div id="container">
<script type="text/javascript">
    var username = "x_iya";
    var _blogger = username;
    var blog_address = "http://blog.csdn.net/x_iya";
    var static_host = "http://static.blog.csdn.net";
    var currentUserName = "";  
</script>
<div id="body">
<div id="main">
<div class="main">
<div id="article_details" class="details">

<script type="text/javascript">
document.getElementById("article_content").outerHTML;
</script>

</div>                 
</div>
</div>
<script type="text/javascript" src="http://static.blog.csdn.net/scripts/newblog.min.js"></script>
</div>
</body>
</html> 
把正文的div写在<div id="article_details" class="details">here</div>中就可以达到博文的效果了。

js代码:

javascript:document.write("<html> <head> <meta http-equiv='Content-Type' content='text/html; charset=utf-8' /> <script src='http://static.blog.csdn.net/scripts/jquery.js' type='text/javascript'></script> <link rel='Stylesheet' type='text/css' href='http://static.blog.csdn.net/skin/skin-blue/css/style.css?v=1.1' /> <link rel='shortcut icon' href='http://c.csdnimg.cn/public/favicon.ico' /> <link type='text/css' rel='stylesheet' href='http://static.blog.csdn.net/scripts/SyntaxHighlighter/styles/default.css' /> </head> <body> <div id='container'> <script type='text/javascript'> var username = 'x_iya'; var _blogger = username; var blog_address = 'http://blog.csdn.net/x_iya'; var static_host = 'http://static.blog.csdn.net'; var currentUserName = ''; </script> <div id='body'> <div id='main'> <div class='main'> <div id='article_details' class='details'>", document.getElementById("article_content").outerHTML, "</div> </div> </div> <script type='text/javascript' src='http://static.blog.csdn.net/scripts/newblog.min.js'></script> </div> </body> </html>");

在地址栏输入以上JS代码或者在chrome新建一个网页


点击下就可以获得了。

0
0
查看评论
发表评论
* 以上用户言论只代表其个人观点,不代表CSDN网站的观点或立场

网页正文及内容提取算法

基于行块分布函数的通用网页正文抽取 http://wenku.baidu.com/link?url=TOBoIHWT_k68h5z8k_Pmqr-wJMPfCy2q64yzS8hxsgTg4lMNH8...
  • levy_cui
  • levy_cui
  • 2016-05-23 14:18
  • 2910

一种提取HTML网页正文的方法

这里所说的正文提取主要是针对新闻页面等网页的主体是文字的HTML页面。在做一些与文本处理相关的实验时往往需要大量的文本,虽然网络上已经存在了一些开放数据集如搜狗语料库,但是有的时候也需要根据具体的需求...
  • SeaTomorrow
  • SeaTomorrow
  • 2015-09-12 13:39
  • 6184

精确提取新闻内容

以前在《数学之美》的“余弦定理和新闻的分类”一文中看到,2002年夏天,Google推出了自己的新闻服务,而这些内容来源于对其它新闻网站内容的抓取、整理和分类,而构建这个新闻网站的关键技术是新闻的自动...
  • l294265421
  • l294265421
  • 2015-12-26 14:53
  • 1684

python beautifulsoup 抓取网页正文内容

使用python 的 beautifulsoup 来抓取网页
  • lan_se_ye_ge
  • lan_se_ye_ge
  • 2014-09-04 13:21
  • 4458

如何抽取HTML正文

网页展现给用户的是主要内容是它的文本。因此,在获取网页源代码时,针对网页抽取出它的特定的文本内容,是我们做网页爬虫的一个基本功。我们结合HtmlParser和正则表达式来实现这一目的。       第...
  • zhangppmm
  • zhangppmm
  • 2016-04-11 10:35
  • 1447

php实现的网页正文提取算法

Html2Article-php实现的提取网页正文部分,最近研究百度结果页的资讯采集,其中关键环节就是从采集回的页面中提取出文章。 因为难点在于如何去识别并保留网页中的文章部分,而且删除其它无用的信息...
  • qikexun
  • qikexun
  • 2016-10-11 20:05
  • 1477

[Python学习] 简单网络爬虫抓取博客文章及思想介绍

前面一直强调Python运用到网络爬虫方面非常有效,这篇文章也是结合学习的Python视频知识及我研究生数据挖掘方向的知识.从而简单介绍下Python是如何爬去网络数据的,文章知识非常简单,但是也分享...
  • Eastmount
  • Eastmount
  • 2014-10-04 16:33
  • 9202

PHP 利用Mail_MimeDecode类提取邮件正文

参考链接:http://blog.csdn.net/dmtnewtons_blog/article/details/18765289 rfc mail content-type: 参考链接:http...
  • dmtnewtons
  • dmtnewtons
  • 2014-02-17 10:53
  • 1726

备份CSDN博客正文到本地存档

大哥有了新想法,然而没有技术,令人欣慰的是大哥想到了我,于是我便答应免费帮个忙,这是一个基于云的项目,具体细节也就不透露了,然而在实现的过程中,其中一个模块我觉得可以自用,于是我就想把这个模块抽出来,...
  • roslei
  • roslei
  • 2016-12-06 17:40
  • 239

从HTML源代码和页面正文中提取特征向量

一、从样本页面的HTML源代码中提取特征向量 1、从HTML源代码中提取预设标签的数量     页面的HTML源代码中存在不同的Tag标签,服务器可以对这些标签的数量进行统计,获得钓鱼网站的特征向...
  • jcchri
  • jcchri
  • 2016-09-06 10:23
  • 740
    个人资料
    • 访问:1007771次
    • 积分:18221
    • 等级:
    • 排名:第599名
    • 原创:689篇
    • 转载:427篇
    • 译文:3篇
    • 评论:142条
    总有一天你将破蛹而出,成长得比人们期待的还要美丽。
    但这个过程会很痛,会很辛苦,有时候还会觉得灰心。
    面对着汹涌而来的现实,觉得自己渺小无力。
    但这,也是生命的一部分。做好现在你能做的,然后,一切都会好的。
    我们都将孤独地长大,不要害怕。

    —— 寂地《踮脚张望的时光》
    博客专栏
    最新评论