<?xml version="1.0" encoding="utf-8" ?><rss version="2.0"><channel><title><![CDATA[机器学习和我关注的技术]]></title><description><![CDATA[自强不息，厚德载物]]></description><link>https://blog.csdn.net/beta2</link><language>zh-cn</language><generator>https://blog.csdn.net/</generator><copyright><![CDATA[Copyright &copy; beta2]]></copyright><item><title><![CDATA[多模式匹配ACBM]]></title><link>https://blog.csdn.net/beta2/article/details/5726164</link><guid>https://blog.csdn.net/beta2/article/details/5726164</guid><author>beta2</author><pubDate>Sat, 10 Jul 2010 22:34:00 +0800</pubDate><description><![CDATA[ACBM 算法又称为CW算法，其思想是结合和AC算法和BM技术，AC算法的思想已经在前一篇讲过了，这里想谈谈BM技术的特点。回忆下，单模式匹配算法，它可以分成两类：    1. 模式串从左向右匹配(e.g. KMP)     2. 模式串从右向左匹配（e.g. Booyer Moore)  BM算法的特点是： 最好情况下算法时间复杂度是（O(m/n)), m是字符串长度，n是pattern长度。    在一般的应用中BM算法被认为是最快的，可以称为亚线性的算法，和KMP相似的地方是，一般pattern和te]]></description><category></category></item><item><title><![CDATA[多模式匹配算法]]></title><link>https://blog.csdn.net/beta2/article/details/5698171</link><guid>https://blog.csdn.net/beta2/article/details/5698171</guid><author>beta2</author><pubDate>Sun, 27 Jun 2010 22:18:00 +0800</pubDate><description><![CDATA[1. 问题原型：           给定一篇网页，其中有很多敏感词汇或者无效的词，需要找到一种算法，找到这些敏感词。  2. 如何求解呢？        2.1 第一个简单的思路是：               step1： for i = 0 to in #text              step2:       foreach pattern p            step3：           比较 text[i+j] and p[0+j]  where j = 0 to #p      ]]></description><category></category></item><item><title><![CDATA[分布式文件系统 and Google File System]]></title><link>https://blog.csdn.net/beta2/article/details/5565096</link><guid>https://blog.csdn.net/beta2/article/details/5565096</guid><author>beta2</author><pubDate>Thu, 06 May 2010 23:24:00 +0800</pubDate><description><![CDATA[1. 目标：  设计一个分布式文件系统，它是：  1.  用于大型的，分布式，和海量数据进行访问。       它支持的数据必须是P级甚至是更高级别的。你可以像在本机器一样操纵文件，它提供必要的文件系统基本I/O功能，如创建，删除；但是设计的假设，I/O操作，文件块大小必须经过仔细斟酌。  2. 它运行在廉价的普通硬件上。硬件随时都也可能损害，磁盘每分钟都有可能损坏，网络随时都有可能受阻，宿主操作]]></description><category></category></item><item><title><![CDATA[距离度量分类体系]]></title><link>https://blog.csdn.net/beta2/article/details/5714733</link><guid>https://blog.csdn.net/beta2/article/details/5714733</guid><author>beta2</author><pubDate>Mon, 21 Dec 2009 14:23:00 +0800</pubDate><description><![CDATA[本篇文章并不打算描述所有这些类别，要具体阐述它们的细节和意义实在有点困难。这个大纲的目的，第一：提供一个貌似详细的距离度量的分类体系，列出相关的关键字。 第二：就像一个词典一样供参考和查阅，如果需要了解具体的细节，可以参考wiki或者具体文献。        大纲：    1. 相似性和不相似性的定义     2. 预备概念     3. 距离度量         3.1  Numerical Data               3.1.1 欧拉距离(Euclidean Distance)        ]]></description><category></category></item><item><title><![CDATA[距离和相似性度量]]></title><link>https://blog.csdn.net/beta2/article/details/5045020</link><guid>https://blog.csdn.net/beta2/article/details/5045020</guid><author>beta2</author><pubDate>Sun, 20 Dec 2009 23:06:00 +0800</pubDate><description><![CDATA[相似性度量或者距离函数对于像聚类，邻域搜索这样的算法是非常重要的。前面也提到，网页去重复也是相似性应用的一个例子。然而，如何定义个合适的相似或者距离函数，完全依赖于手头的任务是什么。一般而言，定义一个距离函数d(x,y),需要满足以下几个准则：  1.  d(x,x) = 0 ;//到自己的距离为0    2.  d(x,y)>=0 // 距离要非负     3.  对称性，d(x,y) = d(]]></description><category></category></item><item><title><![CDATA[网页去重-镜像站点的特殊处理]]></title><link>https://blog.csdn.net/beta2/article/details/5028411</link><guid>https://blog.csdn.net/beta2/article/details/5028411</guid><author>beta2</author><pubDate>Thu, 17 Dec 2009 23:15:00 +0800</pubDate><description><![CDATA[基于关键词的复制网页算法   想前面的提到的算法都是基于这个文档的，对于大型的搜索引擎来说，在性能上有些差距，所以有些优化，针对是网页的关键词，或者网页的meta描述部分。所以，必须有以下的技术做支撑：   1、网页中出现的关键词（中文分词技术）以及每个关键词的权重（关键词密度）；   2、提取meta descrīption或者每个网页的若干(比如：512）个字节的有效文字。      在以下算]]></description><category></category></item><item><title><![CDATA[网页去重-算法篇]]></title><link>https://blog.csdn.net/beta2/article/details/5014530</link><guid>https://blog.csdn.net/beta2/article/details/5014530</guid><author>beta2</author><pubDate>Tue, 15 Dec 2009 22:15:00 +0800</pubDate><description><![CDATA[前一篇提到了5个解决网页去重的算法，这里我想讨论下这些算法  1. I-Match  2. Shingliing  3. SimHashing（ locality sensitive hash）  4. Random Projection  5. SpotSig  6. combined  I-Match算法     I-Match算法有一个基本的假设说：不经常出现的词和经常出现的词不会影响文档的]]></description><category></category></item><item><title><![CDATA[网页去重-比较文本的相似度-Near duplication detection]]></title><link>https://blog.csdn.net/beta2/article/details/4974221</link><guid>https://blog.csdn.net/beta2/article/details/4974221</guid><author>beta2</author><pubDate>Wed, 09 Dec 2009 20:56:00 +0800</pubDate><description><![CDATA[near duplicate detection 的任务是检测重复的内容，这项工作在搜索引擎，版权保护，信息展示等方面都有很好的应用。在搜索引擎上，主要是去掉重复的页面，图片，文件，文档等等。下面就指讨论网页的deduplication。 问题是什么？    据统计，网页上的大部分相同的页面占29%，而主体内容完全相同的占22%，这些重复网页有的是没有一点改动的拷贝，有的在内容上稍作修]]></description><category></category></item><item><title><![CDATA[VI 使用手册]]></title><link>https://blog.csdn.net/beta2/article/details/1606107</link><guid>https://blog.csdn.net/beta2/article/details/1606107</guid><author>beta2</author><pubDate>Sat, 12 May 2007 17:26:00 +0800</pubDate><description><![CDATA[VI 使用手册进入vi的命令vi filename :打开或新建文件，并将光标置于第一行首vi +n filename ：打开文件，并将光标置于第n行首vi + filename ：打开文件，并将光标置于最后一行首vi +/pattern filename：打开文件，并将光标置于第一个与pattern匹配的串处vi -r filename ：在上次正用vi编辑时发生系统崩溃，恢复filenam]]></description><category></category></item><item><title><![CDATA[开学了，毕业了]]></title><link>https://blog.csdn.net/beta2/article/details/1191859</link><guid>https://blog.csdn.net/beta2/article/details/1191859</guid><author>beta2</author><pubDate>Thu, 07 Sep 2006 21:22:00 +0800</pubDate><description><![CDATA[9月4号，开学了，暑假的心情一直放不下来！但是，没有暑假学习的好心情。学校是一个恶心的地方，规矩特别多，老师特别差劲，一上课就决定自己又完了。这个学期该做点事了。1。想家，交新朋友，联络旧朋友。2。准备好保研，尽管不喜欢现在的学校。3。认认真真地学习一下English，这个东西害我不浅。4。找一份短工，先爬滚一段日子。5。研究一下BOOST，尽管是应用价值很低地东西。6]]></description><category></category></item><item><title><![CDATA[第15章:发现问题]]></title><link>https://blog.csdn.net/beta2/article/details/1173682</link><guid>https://blog.csdn.net/beta2/article/details/1173682</guid><author>beta2</author><pubDate>Sun, 03 Sep 2006 22:16:00 +0800</pubDate><description><![CDATA[在c被驯化到ANSI C之前，有一个小的玩笑是：我的代码编译过了，因此它也应该可以运行了。1。JUnit是一套单元测试框架。可以从www.junit.org获取。需要导入junit.framework.* 。最简单的测试     是把所有测试放到TextCase的某个子类中。每个测试必须是public的，不接受参数，返回void     并且以一个"test"开头的方法名。JUnit的反射机制]]></description><category></category></item><item><title><![CDATA[第14章:创建窗口与applet程序]]></title><link>https://blog.csdn.net/beta2/article/details/1173674</link><guid>https://blog.csdn.net/beta2/article/details/1173674</guid><author>beta2</author><pubDate>Sun, 03 Sep 2006 22:15:00 +0800</pubDate><description><![CDATA[设计中要遵循的一条基本原则是：让简单的事情变得容易，让困难的事情变得可行！1。java的GUI，有老版本的AWT，和新的Swing，eclipse也有一套全新的GUI库SWT。      AWT很老了，不要用，除非特殊情况。2。Swing比其他GUI编程模型好的多，JavaBean是这个库的框架。复杂的GUI，可以使用     GUI构造工具快速开发。     它的特定是：1)动态绑定事件。2]]></description><category></category></item><item><title><![CDATA[第13章:并发]]></title><link>https://blog.csdn.net/beta2/article/details/1173668</link><guid>https://blog.csdn.net/beta2/article/details/1173668</guid><author>beta2</author><pubDate>Sun, 03 Sep 2006 22:13:00 +0800</pubDate><description><![CDATA[对象技术提供了一种把程序划分为若干独立部分的方式。通常，还需要把程序转换为彼此分离的，能独立允许的子任务。1。写一个线程最简单的做法是从java.lang.Thread继承，这个类已经具有创建和运行线程    所必要的构架。Thread最重要的方法是run(),覆盖这个方法实现所要的功能。    start方法用来为线程执行特殊的初始化。2。yield()让步方法，给线程调度机制一个暗示：你的]]></description><category></category></item><item><title><![CDATA[第12章Java IO系统]]></title><link>https://blog.csdn.net/beta2/article/details/1173656</link><guid>https://blog.csdn.net/beta2/article/details/1173656</guid><author>beta2</author><pubDate>Sun, 03 Sep 2006 22:11:00 +0800</pubDate><description><![CDATA[对程序语言的设计者来说，创建一个好的输入/输出系统是一项艰难的任务。1。File类实际是filepath，它即能代表一个特定文件的名称，又能代表一个目录下的一组文件的名称。       用list(FilenameFilter)方法，获得此File对象包含的全部列表。FilenameFilter接口，重载accept方法      提供文件名过滤功能。2。File类不仅仅只代表存在的文件或者目]]></description><category></category></item><item><title><![CDATA[第11章:对象的集合.]]></title><link>https://blog.csdn.net/beta2/article/details/1173647</link><guid>https://blog.csdn.net/beta2/article/details/1173647</guid><author>beta2</author><pubDate>Sun, 03 Sep 2006 22:10:00 +0800</pubDate><description><![CDATA[如果一个程序只包含固定数量的且其生命都是已知的对象，那么这是一个非常简单的程序1。无论使用哪种类型的数组，数组标识符其实只是一个引用，指向在堆中创建的一个真实对象，这个数组对象用以      保存指向其它对象的引用。可以作为数组初始化语法隐式创建，或者用new 表达式显式的创建。只能用"[ ]"访问     数组对象唯一的方式。2。可以任意返回一个数组，不用担心回收，只要你需要，它就一直存]]></description><category></category></item><item><title><![CDATA[第10章:类型检查]]></title><link>https://blog.csdn.net/beta2/article/details/1156771</link><guid>https://blog.csdn.net/beta2/article/details/1156771</guid><author>beta2</author><pubDate>Fri, 01 Sep 2006 23:06:00 +0800</pubDate><description><![CDATA[运行时类型识别(run-time type identification ,RTTI)的概念处看非常简单：当只有一个指向对象基类的引用时RTTI机制可以让你找到这个对象的确切概念。1。Class对象是RTTI的核心，Class的类的类，每个类都有一个class对象。每当编写并且编译一个新类，就会      产生一个Class对象（被保存在同名的.class文件当中）2。Class.forN]]></description><category></category></item><item><title><![CDATA[第9章:异常处理]]></title><link>https://blog.csdn.net/beta2/article/details/1156762</link><guid>https://blog.csdn.net/beta2/article/details/1156762</guid><author>beta2</author><pubDate>Fri, 01 Sep 2006 23:04:00 +0800</pubDate><description><![CDATA[java的基本理念是：结构不佳的代码不能运行。1。异常情形是指发生阻止当前方法或者作用域继续执行的问题。但抛出异常后，java先使用new再堆上     创建一个异常对象的引用，然后当前执行路径被终止，并且从当前环境中弹出堆异常对象的引用。此时，    异常机制接管程序，并在异常处理程序中继续执行。2。java所有的标准异常都有两个构造器，一个缺省，一个接受字符串。异常根类为Throwab]]></description><category></category></item><item><title><![CDATA[第8章:接口与内部类]]></title><link>https://blog.csdn.net/beta2/article/details/1156737</link><guid>https://blog.csdn.net/beta2/article/details/1156737</guid><author>beta2</author><pubDate>Fri, 01 Sep 2006 22:57:00 +0800</pubDate><description><![CDATA[1。接口和内部类提供了一种用来组织和控制系统中的对象更加精细的方法。    interface 关键字使abstract的概念更向前迈进了一步。接口只提供定义，而没有任何具体的实现。2。java类不提供类的多重继承，但是可以实现多个接口，这是java的多重机制。     接口可以使用多重继承。语法型如：interface Ia extends I2,I3{}3。避免组合接口的名字冲突。]]></description><category></category></item><item><title><![CDATA[第7章:多态]]></title><link>https://blog.csdn.net/beta2/article/details/1156728</link><guid>https://blog.csdn.net/beta2/article/details/1156728</guid><author>beta2</author><pubDate>Fri, 01 Sep 2006 22:56:00 +0800</pubDate><description><![CDATA[1。面向对象设计中，多态是继数据抽象和继承之后的第三种基本特征。      在java中的方法，默认是晚绑定的（除了static ,private是final－内联的），这于c++要指定virtual关键字不同。2。向上转型使得派生类可以当基类来用。3。派生类可以重载（覆盖）基类的方法，但是私有方法对派生类是屏蔽的，派生类中可以"重载"基类私有方法，但不     能称为覆盖。但是建议不要写]]></description><category></category></item><item><title><![CDATA[第6章:复用类]]></title><link>https://blog.csdn.net/beta2/article/details/1156717</link><guid>https://blog.csdn.net/beta2/article/details/1156717</guid><author>beta2</author><pubDate>Fri, 01 Sep 2006 22:54:00 +0800</pubDate><description><![CDATA[1。组合和继承用来实现复用。   组合语法：   class Water{     private String s;     Water(){};   }   成员类（应用）自动初始化为null，如果初始化这些引用可以放在下列地方1）在定义对象的地方。    2）类的构造器中。3）使用对象之前（惰性初始化）   继承语法：   class A extends B   {   };   java不]]></description><category></category></item></channel></rss>