<?xml version="1.0" encoding="utf-8" ?><rss version="2.0"><channel><title><![CDATA[Jason]]></title><description><![CDATA[持之以恒！]]></description><link>https://blog.csdn.net/csdwb</link><language>zh-cn</language><generator>https://blog.csdn.net/</generator><copyright><![CDATA[Copyright &copy; csdwb]]></copyright><item><title><![CDATA[TCP/IP之协议关系与结构]]></title><link>https://blog.csdn.net/csdwb/article/details/25534533</link><guid>https://blog.csdn.net/csdwb/article/details/25534533</guid><author>csdwb</author><pubDate>Sun, 11 May 2014 10:18:38 +0800</pubDate><description><![CDATA[转载之：http://www.cnblogs.com/JCSU/articles/1323931.html]]></description><category></category></item><item><title><![CDATA[南瑞继保、国电南自、国电南瑞]]></title><link>https://blog.csdn.net/csdwb/article/details/8065852</link><guid>https://blog.csdn.net/csdwb/article/details/8065852</guid><author>csdwb</author><pubDate>Fri, 12 Oct 2012 20:18:45 +0800</pubDate><description><![CDATA[严格说来现在这两者没有任何关系了，两者的前身是同一个公司——南京电力自动化设备总厂，后来分为了两家，一个是现在的国家电网下属的自动化研究院，就是南瑞，另一个是中国华电集团下属的上市公司，就是国电南自。
国电南瑞科技股份有限公司成立于2001年2月28日，是由南京南瑞集团公司作为主发起人，以南京南瑞集团公司下属三家分公司的资产经过重组，联合其它七家战略投资者共同发起设立，2003年9月24日在上海]]></description><category></category></item><item><title><![CDATA[有8匹马，只有四个赛道，如何挑出前三名？]]></title><link>https://blog.csdn.net/csdwb/article/details/7168133</link><guid>https://blog.csdn.net/csdwb/article/details/7168133</guid><author>csdwb</author><pubDate>Sat, 31 Dec 2011 12:00:06 +0800</pubDate><description><![CDATA[基本想法：
 
假设马被编号1~8，第一轮，先让1~4号马跑，第二轮，再让5~8号马跑，分别得到两次的前三名（假设编号为1-3和5-7的马赢得了比赛，并且排名和它们的编号对应，因为第四名不可能是所有马当中的前三名，所以舍弃），这样得到了6匹马（1-3,5-7），再下来，第三轮，让1，2, 5，6四匹马跑，结果次序只有下面几种情况：
1  2  5  6 ……①
1  5  2  6……②]]></description><category></category></item><item><title><![CDATA[向量空间模型（VSM）]]></title><link>https://blog.csdn.net/csdwb/article/details/7110041</link><guid>https://blog.csdn.net/csdwb/article/details/7110041</guid><author>csdwb</author><pubDate>Wed, 28 Dec 2011 21:06:19 +0800</pubDate><description><![CDATA[向量空间模型（VSM）
向量空间模型将文档映射为一个特征向量V(d)=(t1,ω1(d)；…；tn, ωn(d))，其中ti(i=1,2, …,n)为一列互不雷同的词条项，ωi(d)为ti在d中的权值, 一般被定义为ti在d中出现频率tfi(d)的函数，即
。


在信息检索中常用的词条权值计算方法为 TF-IDF 函数，其中N为所有文档的数目，ni为含有词条ti的文档数目。TF-IDF]]></description><category></category></item><item><title><![CDATA[大端模式和小端模式的判别！]]></title><link>https://blog.csdn.net/csdwb/article/details/7109858</link><guid>https://blog.csdn.net/csdwb/article/details/7109858</guid><author>csdwb</author><pubDate>Wed, 28 Dec 2011 19:41:17 +0800</pubDate><description><![CDATA[大端模式：
    一般我们较习惯的模式，数值的高位存入低地址中，低位存入高地址中。如在16位的CPU中，一个整型占有2个字节，如0x1234，它存储在存储器的顺序是地址的低位存0x12，高位存0x34;
小端模式：
   与大端模式相反，数值的高位存入高地址，低位存入地址中。如条件同上，0x1234,它的存储的顺序是数值的高位0x12存入高地址，数值的低位0x34存入低地址。0x34,0x]]></description><category></category></item><item><title><![CDATA[各种排序算法稳定性的探讨]]></title><link>https://blog.csdn.net/csdwb/article/details/7109820</link><guid>https://blog.csdn.net/csdwb/article/details/7109820</guid><author>csdwb</author><pubDate>Wed, 28 Dec 2011 19:22:20 +0800</pubDate><description><![CDATA[首先，排序算法的稳定性大家应该都知道，通俗地讲就是能保证排序前2个相等的数其在序列的前后位置顺序和排序后它们两个的前后位置顺序相同。在简单形式化一下，如果Ai = Aj, Ai原来在位置前，排序后Ai还是要在Aj位置前。为了简便下面讨论的都是不降序排列的情形，对于不升序排列的情形讨论方法和结果完全相同。
    其次，说一下稳定性的好处。排序算法如果是稳定的，那么从一个键上排序，然后再从另一个键]]></description><category></category></item><item><title><![CDATA[海量数据处理专题（七）——数据库索引及优化]]></title><link>https://blog.csdn.net/csdwb/article/details/7103809</link><guid>https://blog.csdn.net/csdwb/article/details/7103809</guid><author>csdwb</author><pubDate>Mon, 26 Dec 2011 18:53:51 +0800</pubDate><description><![CDATA[索引是对数据库表中一列或多列的值进行排序的一种结构，使用索引可快速访问数据库表中的特定信息。
数据库索引
什么是索引
数据库索引好比是一本书前面的目录，能加快数据库的查询速度。
例如这样一个查询：select * from table1 where id=44。如果没有索引，必须遍历整个表，直到ID等于44的这一行被找到为止；有了索引之后(必须是在ID这一列上建立的索引)，直接在索引里面找]]></description><category></category></item><item><title><![CDATA[海量数据处理专题（六）——双层桶划分]]></title><link>https://blog.csdn.net/csdwb/article/details/7103801</link><guid>https://blog.csdn.net/csdwb/article/details/7103801</guid><author>csdwb</author><pubDate>Mon, 26 Dec 2011 18:48:44 +0800</pubDate><description><![CDATA[【什么是双层桶】
事实上，与其说双层桶划分是一种数据结构，不如说它是一种算法设计思想。面对一堆大量的数据我们无法处理的时候，我们可以将其分成一个个小的单元，然后根据一定的策略来处理这些小单元，从而达到目的。
【适用范围】
第k大，中位数，不重复或重复的数字
【基本原理及要点】
因为元素范围很大，不能利用直接寻址表，所以通过多次划分，逐步确定范围，然后最后在一个可以接受的范围内进行。可以通]]></description><category></category></item><item><title><![CDATA[任正非——《一江春水向东流》]]></title><link>https://blog.csdn.net/csdwb/article/details/7102586</link><guid>https://blog.csdn.net/csdwb/article/details/7102586</guid><author>csdwb</author><pubDate>Mon, 26 Dec 2011 11:39:59 +0800</pubDate><description><![CDATA[千古兴亡多少事，一江春水向东流。
小时候，妈妈给我们讲希腊大力神的故事，我们崇拜得不得了。少年不知事的时期我们崇拜上李元霸、宇文成都这种盖世英雄，传播着张飞“杀”(争斗)岳飞的荒诞故事。在青春萌动的时期，突然敏感到李清照的千古情人是力拔山兮的项羽。至此“生当作人杰，死亦为鬼雄”又成了我们的人生警句。当然这种个人英雄主义，也不是没有意义，它迫使我们在学习上争斗，成就了较好的成绩。
当我走向社会，]]></description><category></category></item><item><title><![CDATA[细说Cookies]]></title><link>https://blog.csdn.net/csdwb/article/details/7096517</link><guid>https://blog.csdn.net/csdwb/article/details/7096517</guid><author>csdwb</author><pubDate>Thu, 22 Dec 2011 20:00:10 +0800</pubDate><description><![CDATA[什么是Cookies？
Cookies是一些小文件，它们被创建在客户端的系统里，或者被创建在客户端浏览器的内存中（如果是临时性的话）。用它可以实现状态管理的功能。我们可以存储一些少量信息到可以短的系统上，以便在需要的时候使用。最有趣的事情是，它是对用户透明的。在你的web应用程序中，你可以到处使用它，它极其得简单。Cookies是以文本形式存储的。如果一个web应用程序使用cookies，那么服]]></description><category></category></item><item><title><![CDATA[细说Cache]]></title><link>https://blog.csdn.net/csdwb/article/details/7096512</link><guid>https://blog.csdn.net/csdwb/article/details/7096512</guid><author>csdwb</author><pubDate>Thu, 22 Dec 2011 19:58:22 +0800</pubDate><description><![CDATA[什么是缓存？
Web 应用程序通常都是被多个用户访问。一个Web站点可能存在一个“重量级”的加载，它能够使得站点在访问的时候，拖慢整个服务器。当站点被大量用户同时访问的时候，访问速度缓慢是大部分网站共同存在的问题。为了解决这个问题，我们可以使用一个更高级别的硬件配置，负载均衡器，高带宽，但是加载并不是拖慢站点唯一的“罪魁祸首”，所以我们需要提供一种方案，它也同样能够加速数据访问以及提升性能。而采]]></description><category></category></item><item><title><![CDATA[海量数据处理专题（五）——堆]]></title><link>https://blog.csdn.net/csdwb/article/details/7093318</link><guid>https://blog.csdn.net/csdwb/article/details/7093318</guid><author>csdwb</author><pubDate>Wed, 21 Dec 2011 19:40:34 +0800</pubDate><description><![CDATA[【什么是堆】
概念：堆是一种特殊的二叉树，具备以下两种性质
1）每个节点的值都大于（或者都小于，称为最小堆）其子节点的值
2）树是完全平衡的，并且最后一层的树叶都在最左边
这样就定义了一个最大堆。如下图用一个数组来表示堆：


那么下面介绍二叉堆：二叉堆是一种完全二叉树，其任意子树的左右节点（如果有的话）的键值一定比根节点大，上图其实就是一个二叉堆。
你一定发觉了，最小的一个元素就]]></description><category></category></item><item><title><![CDATA[海量数据处理专题（四）——Bit-map]]></title><link>https://blog.csdn.net/csdwb/article/details/7093295</link><guid>https://blog.csdn.net/csdwb/article/details/7093295</guid><author>csdwb</author><pubDate>Wed, 21 Dec 2011 19:33:30 +0800</pubDate><description><![CDATA[【什么是Bit-map】
 
所谓的Bit-map就是用一个bit位来标记某个元素对应的Value， 而Key即是该元素。由于采用了Bit为单位来存储数据，因此在存储空间方面，可以大大节省。
如果说了这么多还没明白什么是Bit-map，那么我们来看一个具体的例子，假设我们要对0-7内的5个元素(4,7,2,5,3)排序（这里假设这些元素没有重复）。那么我们就可以采用Bit-map的方法来达到]]></description><category></category></item><item><title><![CDATA[海量数据处理专题（三）——Hash]]></title><link>https://blog.csdn.net/csdwb/article/details/7093279</link><guid>https://blog.csdn.net/csdwb/article/details/7093279</guid><author>csdwb</author><pubDate>Wed, 21 Dec 2011 19:28:53 +0800</pubDate><description><![CDATA[【什么是Hash】
Hash，一般翻译做“散列”，也有直接音译为“哈希”的，就是把任意长度的输入（又叫做预映射， pre-image），通过散列算法，变换成固定长度的输出，该输出就是散列值。这种转换是一种压缩映射，也就是，散列值的空间通常远小于输入的空间，不同的输入可能会散列成相同的输出，而不可能从散列值来唯一的确定输入值。简单的说就是一种将任意长度的消息压缩到某一固定长度的消息摘要的函数。]]></description><category></category></item><item><title><![CDATA[海量数据处理专题（二）——Bloom Filter]]></title><link>https://blog.csdn.net/csdwb/article/details/7093272</link><guid>https://blog.csdn.net/csdwb/article/details/7093272</guid><author>csdwb</author><pubDate>Wed, 21 Dec 2011 19:25:52 +0800</pubDate><description><![CDATA[【什么是Bloom Filter】
Bloom Filter是一种空间效率很高的随机数据结构，它利用位数组很简洁地表示一个集合，并能判断一个元素是否属于这个集合。Bloom Filter的这种高效是有一定代价的：在判断一个元素是否属于某个集合时，有可能会把不属于这个集合的元素误认为属于这个集合（false positive）。因此，Bloom Filter不适合那些“零错误”的应用场合。而在能容]]></description><category></category></item><item><title><![CDATA[海量数据处理专题（一）——开篇]]></title><link>https://blog.csdn.net/csdwb/article/details/7093255</link><guid>https://blog.csdn.net/csdwb/article/details/7093255</guid><author>csdwb</author><pubDate>Wed, 21 Dec 2011 19:23:27 +0800</pubDate><description><![CDATA[大数据量的问题是很多面试笔试中经常出现的问题，比如baidu google 腾讯 这样的一些涉及到海量数据的公司经常会问到。

下面的方法是我对海量数据的处理方法进行了一个一般性的总结，当然这些方法可能并不能完全覆盖所有的问题，但是这样的一些方法也基本可以处理绝大多数遇到的问题。下面的一些问题基本直接来源于公司的面试笔试题目，方法不一定最优，如果你有更好的处理方法，欢迎与我讨论。]]></description><category></category></item><item><title><![CDATA[BM算法图解]]></title><link>https://blog.csdn.net/csdwb/article/details/7086938</link><guid>https://blog.csdn.net/csdwb/article/details/7086938</guid><author>csdwb</author><pubDate>Tue, 20 Dec 2011 11:08:58 +0800</pubDate><description><![CDATA[首先，先简单说明一下有关BM算法的一些基本概念。
BM算法是一种精确字符串匹配算法（区别于模糊匹配）。
BM算法采用从右向左比较 的方法，同时应用到了两种启发式规则，即坏字符规则 和好后缀规则 ，来决定向右跳跃的距离。
BM算法的基本流程: 设文本串T，模式串为P。首先将T与P进行左对齐，然后进行从右向左比较 ，如下图所示:



    若是某趟比较不匹配时，BM算法就采用两条启发]]></description><category></category></item><item><title><![CDATA[互联网海量数据蕴藏巨大“金矿”]]></title><link>https://blog.csdn.net/csdwb/article/details/7086714</link><guid>https://blog.csdn.net/csdwb/article/details/7086714</guid><author>csdwb</author><pubDate>Tue, 20 Dec 2011 10:32:24 +0800</pubDate><description><![CDATA[根据IDC的调查报告显示，2010年底全球数据量已达到1.2ZB。到2020年全球电子设备存储的数据将暴增30倍，达到35ZB（相当于10亿块1TB的硬盘的容量）。但对于有准备的企业来说这无疑是一座信息金矿，随着数据挖掘技术的进步，有价值的信息将变得容易获取。
随着大数据时代的到来，数据存储、数据挖掘以及处理和分析大数据的相关技术比以往任何时候都更受关注。大数据正成为企业发展的基石，并渐渐改变很]]></description><category></category></item><item><title><![CDATA[朴素贝叶斯分类流程图介绍]]></title><link>https://blog.csdn.net/csdwb/article/details/7084277</link><guid>https://blog.csdn.net/csdwb/article/details/7084277</guid><author>csdwb</author><pubDate>Mon, 19 Dec 2011 15:07:03 +0800</pubDate><description><![CDATA[1.1、摘要
      贝叶斯分类是一类分类算法的总称，这类算法均以贝叶斯定理为基础，故统称为贝叶斯分类。本文作为分类算法的第一篇，将首先介绍分类问题，对分类问题进行一个正式的定义。然后，介绍贝叶斯分类算法的基础——贝叶斯定理。最后，通过实例讨论贝叶斯分类中最简单的一种：朴素贝叶斯分类。
1.2、分类问题综述
      对于分类问题，其实谁都不会陌生，说我们每个人每天都在执行分类操作一点]]></description><category></category></item><item><title><![CDATA[TF-IDF原理简介]]></title><link>https://blog.csdn.net/csdwb/article/details/7083368</link><guid>https://blog.csdn.net/csdwb/article/details/7083368</guid><author>csdwb</author><pubDate>Mon, 19 Dec 2011 10:54:45 +0800</pubDate><description><![CDATA[TF-IDF（term frequency–inverse document frequency）是一种用于资讯检索与文本挖掘的常用加权技术。TF-IDF是一种统计方法，用以评估一字词对于一个文件集或一个语料库中的其中一份文件的重要程度。字词的重要性随着它在文件中出现的次数成正比增加，但同时会随着它在语料库中出现的频率成反比下降。TF-IDF加权的各种形式常被搜索引擎应用，作为文件与用户查询之间相]]></description><category></category></item></channel></rss>