<?xml version="1.0" encoding="utf-8" ?><rss version="2.0"><channel><title><![CDATA[CSMrZ的博客]]></title><description><![CDATA[]]></description><link>https://blog.csdn.net/CSMrZ</link><language>zh-cn</language><generator>https://blog.csdn.net/</generator><copyright><![CDATA[Copyright &copy; CSMrZ]]></copyright><item><title><![CDATA[过拟合]]></title><link>https://blog.csdn.net/CSMrZ/article/details/82746217</link><guid>https://blog.csdn.net/CSMrZ/article/details/82746217</guid><author>CSMrZ</author><pubDate>Mon, 17 Sep 2018 20:47:34 +0800</pubDate><description><![CDATA[过拟合

在进行逻辑回归和线性回归时可能出现欠拟合和过拟合现象，欠拟合和过拟合均无法有效的应用到未测试数据中，过拟合对输入的实验数据的拟合效果异常完美，但是对未加入的数据拟合结果很差。下面三个图分别代指欠拟合，拟合良好和过拟合。（图片来自大牛吴恩达的课程） 




产生过拟合的原因

特征量太多，而测试数据太少。

解决方法



1.人为的舍弃特征量（略）

2.正则化

正则化的基本思想是在...]]></description><category></category></item><item><title><![CDATA[Classification----logisitic regression]]></title><link>https://blog.csdn.net/CSMrZ/article/details/82317328</link><guid>https://blog.csdn.net/CSMrZ/article/details/82317328</guid><author>CSMrZ</author><pubDate>Thu, 06 Sep 2018 15:45:32 +0800</pubDate><description><![CDATA[前言

在学习和实践了线性回归模型后,我们终于来到了下一站——分类问题,分类问题中经典的算法称为逻辑回归.



逻辑回归模型引入

给定一些样本以后,我们首先需要选用一个合适的样本估测函数去估计样本值,首先如果使用线性函数去模拟可以吗?现在想要预测肿瘤良性与肿瘤大小的关系,看下面这些样本在坐标系上的分布. 
 
此时使用线性回归可以得到如下图形:...]]></description><category></category></item><item><title><![CDATA[查找中的数据结构之无序表和有序表]]></title><link>https://blog.csdn.net/CSMrZ/article/details/82316170</link><guid>https://blog.csdn.net/CSMrZ/article/details/82316170</guid><author>CSMrZ</author><pubDate>Sun, 02 Sep 2018 15:52:47 +0800</pubDate><description><![CDATA[查找引入

在大数据时代,如何在海量数据中快速检索到自己想要的数据?首先需要设计高效的数据结构来表示这些数据,要存储的数据一般分为两个部分,键和值,如何根据键值去安排这些数据尤为重要,首先我们想到线性存储,即利用表的形式线性存储,线性查找,即符号表这种数据结构.



符号表

符号表线性存储数据,但是根据在插入操作过程中是否保证数据有序分为无序表和有序表:

0.无序表

无序表API(仅实现了...]]></description><category></category></item><item><title><![CDATA[经典排序算法总结]]></title><link>https://blog.csdn.net/CSMrZ/article/details/82315630</link><guid>https://blog.csdn.net/CSMrZ/article/details/82315630</guid><author>CSMrZ</author><pubDate>Sun, 02 Sep 2018 15:06:40 +0800</pubDate><description><![CDATA[排序算法的应用



0.利用算法的整体对各种数据排序

在工商业中的各种交易数据,职场,学校中各种员工学生的信息等等.一般涉及数据存储的地方都会有排序算法的应用

1.利用算法中的一部分解决某些问题


a.逆序对数量与插入排序交换次数的对应关系
b.中位数(或寻找第k小的值问题)与快排中切分的思想.


2.较复杂算法中应用到排序算法


a.优先队列与调度问题
b.微积分曲线下区域面积,优先...]]></description><category></category></item><item><title><![CDATA[索引优先队列]]></title><link>https://blog.csdn.net/CSMrZ/article/details/82260692</link><guid>https://blog.csdn.net/CSMrZ/article/details/82260692</guid><author>CSMrZ</author><pubDate>Fri, 31 Aug 2018 18:46:21 +0800</pubDate><description><![CDATA[索引优先队列

上篇讲述了优先队列,一种能够快速访问最大元素或最小元素的数据结构,但是考虑这样一种情况,公司按姓名录入员工信息,并按照薪水加入了优先队列,某员工薪水需要更改,假设薪水排名为n,那么我们需要怎样操作呢?首先将前n名员工出列,然后改正第n名薪水,最后将这n名员工入列,操作太复杂,不符合程序员追求性能(懒)的特性,于是想到将优先队列的元素加一个索引,可以随机访问.这种加入索引的优先队列就...]]></description><category></category></item><item><title><![CDATA[优先队列总结]]></title><link>https://blog.csdn.net/CSMrZ/article/details/82144067</link><guid>https://blog.csdn.net/CSMrZ/article/details/82144067</guid><author>CSMrZ</author><pubDate>Tue, 28 Aug 2018 10:43:09 +0800</pubDate><description><![CDATA[优先队列



引入

在生产调度中，事件都有优先级，那么如何快速的调度最高优先级的事件成为一件需要考虑的事情。调度中有两种操作，第一种是调度最高级事件，第二种是插入事件，那么优先队列这种数据结构完美解决了这两个操作，在优先队列中这两种操作完成的任务就是删除队列中最大值和插入新值。



优先队列初级实现

那么优先队列如何实现呢？简单的可以用数组来实现，有以下两种方法： 
1.数据插入随意，数据...]]></description><category></category></item><item><title><![CDATA[LeetCode中常见问题]]></title><link>https://blog.csdn.net/CSMrZ/article/details/82017528</link><guid>https://blog.csdn.net/CSMrZ/article/details/82017528</guid><author>CSMrZ</author><pubDate>Fri, 24 Aug 2018 14:21:20 +0800</pubDate><description><![CDATA[0.未看清是升序还是降序

在做Largest Number这道题时，本来需要升序排列，结果一直使用降序排列，导致结果出错，纠结了很久，浪费了大量时间。



1.归并排序的merge函数的参数问题

归并排序的归并函数merge（vector&amp;amp;lt;int&amp;amp;gt;a,int lo,int mid,int hi），hi的设定影响是否需要归并a[hi]，也就是辅助数组的复制是否需要复制到hi位置的元...]]></description><category></category></item><item><title><![CDATA[归并排序总结]]></title><link>https://blog.csdn.net/CSMrZ/article/details/82017354</link><guid>https://blog.csdn.net/CSMrZ/article/details/82017354</guid><author>CSMrZ</author><pubDate>Fri, 24 Aug 2018 14:12:44 +0800</pubDate><description><![CDATA[归并排序



主要思想

归并排序主要将数组分成等量的两部分，然后对每一部分进行排序，然后再将他们合并。与快速排序一样也是利用了分治法的思想，但是不同的是划分方式不同。



数组排序过程

用以下数组来进行描述： 
3 4 10 9 21 18 
将数组分成等量的两部分 
3 4 10 和9 21 18 
然后继续划分，直至划分成单个元素，可以用树形结构进行表示 




代码整理

那么分治...]]></description><category></category></item><item><title><![CDATA[MarkDown 编辑所遇问题]]></title><link>https://blog.csdn.net/CSMrZ/article/details/81975047</link><guid>https://blog.csdn.net/CSMrZ/article/details/81975047</guid><author>CSMrZ</author><pubDate>Thu, 23 Aug 2018 09:49:45 +0800</pubDate><description><![CDATA[0.文字显示不全

原因：有些转义字符不可以直接写，需要进行转义：




  字符
  转义书写格式



  &amp;lt;
  &amp;amp;lt;


  &amp;gt;
  &amp;amp;gt;


  &amp;amp;
  &amp;amp;amp;


  “
  &amp;amp;quot;


  ‘
  &amp;amp;apos;

...]]></description><category></category></item><item><title><![CDATA[三切分快速排序]]></title><link>https://blog.csdn.net/CSMrZ/article/details/81974470</link><guid>https://blog.csdn.net/CSMrZ/article/details/81974470</guid><author>CSMrZ</author><pubDate>Thu, 23 Aug 2018 09:17:10 +0800</pubDate><description><![CDATA[三切分快速排序

在普通的快速排序中，如果存在一组待排序的子数组全部为重复的元素，我们还对其进行划分排序，这样性能会下降，那么，如何改进存在大量重复元素的数组排序的性能呢？E.W.Dijkstra这个算法界无处不在的大佬提出了荷兰国旗问题，引出了三项切分快速排序的方法。这种方法与普通快排所区分的地方在于划分时不是划分成不大于和不小于两部分，而是划分成小于，等于，大于三部分，这样重复的值就可以不用再...]]></description><category></category></item><item><title><![CDATA[快速排序]]></title><link>https://blog.csdn.net/CSMrZ/article/details/81945206</link><guid>https://blog.csdn.net/CSMrZ/article/details/81945206</guid><author>CSMrZ</author><pubDate>Wed, 22 Aug 2018 15:38:42 +0800</pubDate><description><![CDATA[快速排序

快速排序是一种利用了分治法的排序方法，在数组中寻找一个基准量（数组第一个值或者随机选取某个值）每次循环过程中，将待排序的数组分成两组，小于基准量的值位于数组的左侧，大于基准量的值位于数组的右侧，这样每次循环均能够寻找到基准量在数组中的正确位置。 
快速排序主要的步骤就是，使用基准量划分数组，然后对划分的数组进行排序。 
例如数组： 
4 3 5 11 3 7 2 9 
将第一个值4当成...]]></description><category></category></item><item><title><![CDATA[CSDN-markdown编辑器]]></title><link>https://blog.csdn.net/CSMrZ/article/details/81944019</link><guid>https://blog.csdn.net/CSMrZ/article/details/81944019</guid><author>CSMrZ</author><pubDate>Wed, 22 Aug 2018 14:48:39 +0800</pubDate><description><![CDATA[欢迎使用Markdown编辑器写博客

本Markdown编辑器使用StackEdit修改而来，用它写博客，将会带来全新的体验哦：


Markdown和扩展Markdown简洁的语法
代码块高亮
图片链接和图片上传
LaTex数学公式
UML序列图和流程图
离线写博客
导入导出Markdown文件
丰富的快捷键






快捷键


加粗    Ctrl + B 
斜体    Ctrl + I...]]></description><category></category></item><item><title><![CDATA[Algorithm 4th------初级排序算法总结]]></title><link>https://blog.csdn.net/CSMrZ/article/details/81914514</link><guid>https://blog.csdn.net/CSMrZ/article/details/81914514</guid><author>CSMrZ</author><pubDate>Tue, 21 Aug 2018 21:01:45 +0800</pubDate><description><![CDATA[排序算法

  在日常生产生活中,将杂乱的一组数据转换成有顺序的另一组数据所使用的算法叫做排序算法.那么最基础的排序算法都有哪些?



0.冒泡排序

  主要思想:循环比较相邻数据并交换符合一定条件(升序则为靠前数据大于靠后数据)的数据,第i次循环都会使第i小或第i大的数据交换到正确的位置.

伪代码



for i=1 to a.length-1:
    for j=a.length t...]]></description><category></category></item><item><title><![CDATA[pandas基本操作]]></title><link>https://blog.csdn.net/CSMrZ/article/details/81021884</link><guid>https://blog.csdn.net/CSMrZ/article/details/81021884</guid><author>CSMrZ</author><pubDate>Thu, 12 Jul 2018 20:29:13 +0800</pubDate><description><![CDATA[1 pandas数据结构

1.1 series



s=pd.Series([1,2,3,np.nan,5,6])

pandas中的序列,接受参数为列表,默认索引为0,1,2….

1.2 DataFrame



dates=pd.date_range('20180310',periods=6)
df = pd.DataFrame(np.random.randn(6,4), index=d...]]></description><category></category></item><item><title><![CDATA[Numpy教程]]></title><link>https://blog.csdn.net/CSMrZ/article/details/80901045</link><guid>https://blog.csdn.net/CSMrZ/article/details/80901045</guid><author>CSMrZ</author><pubDate>Tue, 03 Jul 2018 16:51:33 +0800</pubDate><description><![CDATA[一.array属性

首先创建一个array: 
array=np.array([[1,2,3],[3,4,5]] 
array.ndim #array的维度 
array.shape #array的形状 
array.size #array数据多少



二.array的创建

a=np.array(list,dtype)#通用格式 
a=np.zeros((m,n))#生成m*n的全零矩阵 
...]]></description><category></category></item><item><title><![CDATA[Normal Equation]]></title><link>https://blog.csdn.net/CSMrZ/article/details/80777579</link><guid>https://blog.csdn.net/CSMrZ/article/details/80777579</guid><author>CSMrZ</author><pubDate>Fri, 22 Jun 2018 19:01:21 +0800</pubDate><description><![CDATA[标准化方程

在前面的梯度下降法中我们提到过如何用矩阵来表示线性回归:θTX=YθTX=Y\theta^TX=Y那么是否可以直接用矩阵运算来解决参数θθ\theta的取值问题呢?答案是可以的,即利用如下公式便可一步得到θθ\theta的值:θT=Y(XTX)−1XTθT=Y(XTX)−1XT\theta^T=Y(X^TX)^{-1}X^T 
但是该式子会引出以下在线性代数的相关问题.

为什么不直...]]></description><category></category></item><item><title><![CDATA[Mutiple Liner Regression]]></title><link>https://blog.csdn.net/CSMrZ/article/details/80775358</link><guid>https://blog.csdn.net/CSMrZ/article/details/80775358</guid><author>CSMrZ</author><pubDate>Fri, 22 Jun 2018 16:19:22 +0800</pubDate><description><![CDATA[一.多元线性

在上一节中提到了线性回归,不过特征量x只有1个,当特征量大于1个时,如下表:




  住房面积x1x1x_1
  层数x2x2x_2
  卧室个数x3x3x_3
  住宅年数x4x4x_4
  售出价格y



  2104
  5
  1
  45
  460


  1416
  3
  2
  40
  232


  1534
  3
  2
  30
  315


...]]></description><category></category></item><item><title><![CDATA[Liner Regression problem]]></title><link>https://blog.csdn.net/CSMrZ/article/details/80758397</link><guid>https://blog.csdn.net/CSMrZ/article/details/80758397</guid><author>CSMrZ</author><pubDate>Thu, 21 Jun 2018 11:54:34 +0800</pubDate><description><![CDATA[Model Representation（模型构建）

以房价预测为例，假设有如下可供训练的数据集(数据总量为m)：




  住宅面积 (x)
  销售价格(y)



  123
  45w


  145
  55w


  120
  42w


  …
  …


  80
  30w




将这些点绘制在直角坐标系上则为： 


其中x是住宅面积，y是销售的价格，那么假设预测函数为...]]></description><category></category></item><item><title><![CDATA[Machine Learning definition]]></title><link>https://blog.csdn.net/CSMrZ/article/details/80758375</link><guid>https://blog.csdn.net/CSMrZ/article/details/80758375</guid><author>CSMrZ</author><pubDate>Thu, 21 Jun 2018 11:53:00 +0800</pubDate><description><![CDATA[定义机器学习：对于一个具体的任务T，通过学习得到的经验E，不断的调整以优化它的性能P。（例如：对于判断邮件是否为垃圾邮件的任务，通过学习分类后得到的正确的或错误的标签，不断调整来尽可能使大部分标签正确）分类Supervised learning监督学习：给定的数据集有确定的标签，根据这些标签来进行学习，多用于回归（房价的预测）和分类（肿瘤良性判断）英文单词（malignant：恶性，benign:...]]></description><category></category></item><item><title><![CDATA[算法笔记二分治法]]></title><link>https://blog.csdn.net/CSMrZ/article/details/75093285</link><guid>https://blog.csdn.net/CSMrZ/article/details/75093285</guid><author>CSMrZ</author><pubDate>Thu, 13 Jul 2017 21:51:48 +0800</pubDate><description><![CDATA[分治法的概念分治法是一种将大规模的问题分解成若干个容易得到结论的小问题，然后递归地将这些小问题一一解决，最后将得到的解进行合并建立原问题的解。关键步骤-分解- 
-解决- 
-合并-实例（归并排序）步骤分析
分解原问题 
首先将要排序的n个元素的序列分为两个n/2的序列
递归解决 
对分解的子序列进行排序
合并子问题的解 
合并两个已经排序好的序列编码分析分解只需要进行将原序列分为两份，子序列排序递]]></description><category></category></item></channel></rss>