机器学习高频面试真题整理

添加微信:julyedufu77,回复 “ 6 ”,领取最新升级版《名企AI面试100题》电子书!!

51、KMeans算法k值及初始类簇中心点的选取

KMeans算法是最常用的聚类算法,主要思想是:在给定K值和K个初始类簇中心点的情况下,把每个点(亦即数据记录)分到离其最近的类簇中心点所代表的类簇中,所有点分配完毕之后,根据一个类簇内的所有点重新计算该类簇的中心点(取平均值),然后再迭代的进行分配点和更新类簇中心点的步骤,直至类簇中心点的变化很小,或者达到指定的迭代次数。

KMeans算法本身思想比较简单,但是合理的确定K值和K个初始类簇中心点对于聚类效果的好坏有很大的影响。

52、解释对偶的概念

一个优化问题可以从两个角度进行考察,一个是primal 问题,一个是dual 问题,就是对偶问题,一般情况下对偶问题给出主问题最优值的下界,在强对偶性成立的情况下由对偶问题可以得到主问题的最优下界,对偶问题是凸优化问题,可以进行较好的求解,SVM中就是将primal问题转换为dual问题进行求解,从而进一步引入核函数的思想。

53、如何进行特征选择?

特征选择是一个重要的数据预处理过程,主要有两个原因:一是减少特征数量、降维,使模型泛化能力更强,减少过拟合;二是增强对特征和特征值之间的理解。
常见的特征选择方式:

  1. 去除方差较小的特征
  2. 正则化。1正则化能够生成稀疏的模型。L2正则化的表现更加稳定,由于有用的特征往往对应系数非零。
  3. 随机森林,对于分类问题,通常采用基尼不纯度或者信息增益,对于回归问题,通常采用的是方差或者最小二乘拟合。一般不需要feature engineering、调参等繁琐的步骤。它的两个主要问题,1是重要的特征有可能得分很低(关联特征问题),2是这种方法对特征变量类别多的特征越有利(偏向问题)。
  4. 稳定性选择。是一种基于二次抽样和选择算法相结合较新的方法,选择算法可以是回归、SVM或其他类似的方法。它的主要思想是在不同的数据子集和特征子集上运行特征选择算法,不断的重复,最终汇总特征选择结果,比如可以统计某个特征被认为是重要特征的频率(被选为重要特征的次数除以它所在的子集被测试的次数)。理想情况下,重要特征的得分会接近100%。稍微弱一点的特征得分会是非0的数,而最无用的特征得分将会接近于0。

54、衡量分类器的好坏?

这里首先要知道TP、FN(真的判成假的)、FP(假的判成真)、TN四种(可以画一个表格)。

  • 0
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
本文解决了基于机器学习方法使用高频数据预测股票价格的问题。 我们在本文中研究了两件事(1)在寻找最佳样本内经验损失最小化器的过程中,根据所提出的评估措施,比较具有给定回溯参数的所选函数类之间的预测性能(2)比较在获得从交易和报价 (TAQ) 数据中提取的一组引入的高频数据特征后,通过更改金融时间序列数据的采样频率来分析这些结果。 对于 TAQ 数据的分析,特征工程涉及 56 个相关特征的计算,包括市场微观结构、统计和技术指标特征。 进行重新估计以提高数据模型的预测精度,以获得每个移动窗口的预测值。 另一方面,算法模型的使用无需重新估计实际问题,因为训练模型所花费的时间通常大于数据的采样频率。 此外,还引入了回溯参数来切断不相关的很久以前的历史数据。 在实验中选择的函数类中,结果表明 PCA 回归在给定采样频率(即 3 分钟、5 分钟等)的 NASDAQ100 指数和 TAQ 数据的平均方向准确度和简单回溯测试方面表现最好. 与之前使用 NASDAQ100 的研究相比,结果表明重新估计和正确选择的回溯参数提高了建议评估措施的预测性能。 当谈到最大回撤时,这是一个对风险管理至关重要的衡量标准,DA-RNN 呈现了最小值,因此是所有时间频率的 TAQ 数据表现最好的模型。 我们还提供了 DM 统计数据,其零假设是任何两个给定模型的预测值的准确性不会不同。 对于所有采样频率的 TAQ 数据,有证据表明在比较 PCA 回归和 DA-RNN 模型时我们不能拒绝原假设。 大量实验提供了使用高频时间序列数据正确评估最佳样本内经验损失最小化器的预测性能的见解。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值