自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(25)
  • 收藏
  • 关注

原创 从感知机到 Attention:我用 PyTorch 打穿 CS188 机器学习终章 CS188 Proj5 学习笔记

本文围绕 CS188 Project 5 的机器学习部分展开,以 PyTorch 基础为起点,依次梳理 Tensor、Shape、Batch、DataLoader 等核心概念,并完成从感知机、非线性回归、MNIST 数字分类、语言识别 RNN、手写卷积函数到 Attention 机制的完整实现。文章不仅记录代码解法,也重点解释输入输出维度、训练流程、损失函数、激活函数选择和模型结构设计,适合 PyTorch 零基础学习者借助项目实践建立机器学习整体框架。

2026-06-04 23:26:50 734 5

原创 从非线性分类到多层神经网络 CS188 Note21 学习笔记

本文介绍了非线性分类器和多层感知机(MLP)的核心概念。当数据线性不可分时,可通过添加新特征或使用MLP解决。MLP通过隐藏层学习中间特征表示,理论上能逼近任何连续函数。文章比较了阶跃、Sigmoid和ReLU等激活函数的特性,并重点讲解了反向传播算法的工作原理,包括前向计算和基于链式法则的梯度反向传播过程。反向传播能高效计算神经网络中大量参数的梯度,是训练深度网络的关键技术。

2026-06-03 22:51:39 433

原创 机器学习入门:从感知机到逻辑回归,理解线性分类器与Softmax CS188 Note20 学习笔记

本文围绕机器学习中的线性模型展开,系统梳理线性分类器、二分类与多分类感知机、线性回归、逻辑回归以及 Softmax 多分类方法。文章重点解释特征向量、权重、决策边界、Bias、损失函数、梯度下降和最大似然等核心概念,帮助读者建立从感知机到逻辑回归的整体理解。

2026-06-02 16:42:23 326

原创 从朴素贝叶斯到参数估计,机器学习到底在“学”什么? CS188 Note19 学习笔记

本文围绕 CS188 机器学习入门内容展开,介绍监督学习、数据集划分、朴素贝叶斯分类思想及其条件独立假设,并进一步说明如何通过最大似然估计学习模型参数。文章最后讨论了 MLE 的零概率问题,并引入 Laplace Smoothing 来提升模型的泛化能力。

2026-06-01 23:48:07 572

原创 贝叶斯网络到粒子滤波Python算法实现 CS188 Proj4 学习笔记

这篇博客介绍了CS188课程Project 4(Ghostbusters)中前所有问题的解决思路和代码实现。

2026-05-31 22:41:10 676

原创 粒子滤波介绍 CS188 Note18 学习笔记

本文介绍了Particle Filtering这种近似推理方法,用于解决HMM中状态空间过大时精确推理计算复杂的问题。Particle Filtering通过维护一组粒子来近似表示信念分布,基本过程包括:1)根据转移模型更新粒子状态(Time Elapse Update);2)结合观测证据计算粒子权重并重采样(Observation Update)。与精确推理的Forward Algorithm相比,Particle Filtering在状态空间大时更高效实用,精度取决于粒子数量。该方法通过粒子分布来近似概

2026-05-30 23:33:33 523

原创 隐马尔可夫模型( HMM )介绍 CS188 Note17 学习笔记

隐马尔可夫模型(HMM)扩展了马尔可夫模型,加入了不可观测的隐藏状态和可观测的evidence变量。HMM基于两个关键独立性假设:状态转移的马尔可夫性和当前观测仅依赖当前状态。Forward算法通过"时间更新"和"观测更新"两步递推更新belief分布。Viterbi算法则用于寻找最可能的隐藏状态序列,采用动态规划方法在状态网格中搜索最优路径,而非简单的贪心选择。两种算法都需要结合转移概率和观测概率进行计算,但Viterbi通过回溯指针恢复完整路径,优化的是整个序列的联合概率而非单个时间步的最优状态。

2026-05-29 22:44:57 605

原创 决策理论概念 CS188 Note16 学习笔记

本文介绍了CS188课程中关于决策理论的核心概念,主要包括三个部分: 效用理论:定义了Utility作为偏好量化指标,阐述了理性偏好的五个公理(可排序性、传递性等),并分析了风险态度(风险中性、厌恶和寻求)。 决策网络:结合贝叶斯网络和Expectimax,通过机会节点、行动节点和效用节点建模决策过程,以最大化期望效用(MEU)为目标,并给出具体计算示例。 完美信息价值(VPI):量化获取新证据带来的效用提升,通过数学推导和例子说明其非负性、不可加性和顺序无关性等性质。全文强调如何在不确定性下做出最优决策.

2026-05-28 23:34:06 433

原创 贝叶斯网络中四种近似推理方法 CS188 Note15 学习笔记

本文介绍了贝叶斯网络中的四种近似推理方法:Prior Sampling、Rejection Sampling、Likelihood Weighting和Gibbs Sampling。Prior Sampling通过随机抽样生成样本,但效率低下;Rejection Sampling舍弃与证据冲突的样本;Likelihood Weighting引入权重概念,保留所有样本但调整权重;Gibbs Sampling则通过马尔可夫毯进行局部重采样,避免罕见样本问题。

2026-05-27 21:50:26 550

原创 贝叶斯网络中精确推理方法--变量消除法 CS188 Note14 学习笔记

本文介绍了贝叶斯网络中的精确推理方法——变量消除(Variable Elimination)。该方法通过逐步消除变量来高效计算条件概率,避免了枚举法需要构建完整联合概率表的高计算成本。文章以宝藏陷阱模型为例,详细展示了变量消除的7个步骤:选择相关因子、连接因子、消除变量、归一化等。与枚举法相比,变量消除通过将无关项移出求和符号,显著减少了中间表的大小。作者还讨论了消除顺序的选择策略,建议采用贪心算法选择最小规模的变量优先消除以优化计算效率。伪代码展示了算法的实现框架。

2026-05-26 23:14:20 685

原创 强化学习策略参数调节方法及值迭代算法实现 CS188 Proj3 学习笔记

本文介绍了强化学习中的值迭代算法实现及策略参数调节方法。第一部分详细讲解了值迭代的batch版本实现,强调需要避免使用本轮更新的新值,严格遵循V_k由V_{k-1}推导的原则。代码实现了状态值计算、Q值计算和最优动作选择功能。第二部分探讨了如何通过调节折扣因子、噪声参数和存活奖励来优化策略,针对不同目标场景(如优先近端奖励、规避风险、追求长期回报等)给出了具体的参数设置建议。文中还通过图示直观展示了batch和online版本的区别,帮助理解值迭代的核心概念。

2026-05-25 23:20:29 1170

原创 贝叶斯网络中条件独立性的判断 CS188 Note13 学习笔记

本文介绍了贝叶斯网络中的D-separation概念,用于判断随机变量间的条件独立性。D-separation通过分析图结构中的路径活动性来确定变量是否条件独立。文章详细阐述了三种基本结构(因果链、共同原因、共同效应)在不同观测条件下的独立性变化,并给出了数学证明。重点讲解了D-separation判定算法:阴影化观测节点后,检查所有路径中的三元组是否活跃,若所有路径均不活跃则变量条件独立。最后通过示例展示了判定过程。D-separation为贝叶斯网络中的概率推理提供了有效的图论工具。

2026-05-24 23:59:35 396

原创 贝叶斯网络基本概念 CS188 Note12 学习笔记

本文介绍了贝叶斯网络(Bayes Net)的基本概念及其优势。贝叶斯网络通过有向无环图(DAG)表示随机变量之间的关系,利用条件概率表(CPT)存储变量在给定父节点下的概率分布,从而避免了联合概率表随变量数量指数增长的问题。文章给出了一个包含入室盗窃、地震、警报等变量的实例,展示了如何计算联合概率。贝叶斯网络虽然可能无法涵盖所有变量和相互作用,但其结构假设能够支持高效的推理技术,比简单枚举方法更具实用价值。

2026-05-24 23:47:06 393

原创 贝叶斯网络学习前置课程:概率论基础概念 CS188 Note11 学习笔记

本文摘要:文章介绍了概率论基础概念,包括随机变量、概率分布、联合分布和链式法则。重点讲解了边缘化、归一化、贝叶斯规则和独立性条件概率的计算方法。通过一个季节-天气概率表的枚举推理示例,展示了如何计算条件概率分布:首先筛选特定季节数据,然后对天气类型求和并归一化处理,最终得出冬季晴天和雨天的概率均为0.5。这些内容涵盖了高中概率论的核心知识点。

2026-05-23 22:11:10 496

原创 强化学习入门ⅡCS188 Note10 学习笔记

本文介绍了强化学习中的近似Q学习(Approximate Q-learning)及其相关概念。传统Q-learning缺乏泛化能力,近似Q-learning通过将状态表示为特征向量(如距离幽灵/食物的距离等),将Q函数建模为特征的线性组合,提高了内存效率和泛化能力。文章还探讨了探索与利用(Exploration vs. Exploitation)的平衡问题,介绍了ε-Greedy策略和探索函数两种方法。最后总结了基于模型和无模型学习的区别,以及on-policy与off-policy方法的对比。

2026-05-23 22:09:09 494

原创 强化学习入门 I CS188 Note9 学习笔记

本文介绍了强化学习中的几种核心方法。首先区分了离线规划和在线规划,重点讨论了基于模型和无模型两种学习方式。基于模型的方法通过统计样本估计转移和奖励函数,但面临状态爆炸问题。无模型学习则直接估计值函数,包括被动学习的直接评估法和时序差分学习(TD Learning),后者通过贝尔曼方程思想增量更新估值,效率更高。最后介绍了里程碑式的Q-learning算法,通过贝尔曼方程变体直接学习最优动作值函数,采用样本更新策略,是强化学习的重要突破。文章通过网格世界示例直观展示了各方法的计算过程。

2026-05-22 21:23:31 485

原创 多智能体搜索算法Python实现 CS188 Proj2 学习笔记

本文介绍了CS188课程项目2中关于多智能体搜索的实现过程。主要内容包括: Q1 Reflex Agent:通过改进评估函数来优化反射型智能体的表现。评估函数考虑了游戏分数、食物距离、幽灵状态等因素,并添加了对stop动作的惩罚。测试结果显示性能显著提升,但仍存在后期反复踱步的问题。 Q2 Minimax:开始实现Minimax算法,利用伪代码框架构建决策树。代码提供了游戏状态评估、合法动作获取等辅助函数,重点在于递归实现Minimax算法来评估各状态的价值。 项目展示了从简单反射型智能体到更复杂的对

2026-05-22 21:13:59 787

原创 马尔可夫决策过程解决方法 CS188 Note8 学习笔记

本文介绍了三种解决马尔可夫决策过程(MDP)问题的方法:Value Iteration、Policy Extraction和Policy Iteration。Value Iteration通过动态规划逐步更新状态效用值U*(s),利用Bellman方程求解最优Q值;Policy Extraction则在获得最优Q值后直接提取最优策略。Q-Value Iteration直接计算Q(s,a)值来简化策略提取过程。Policy Iteration通过固定策略→计算真实价值→改进策略的循环来优化策略,避

2026-05-21 16:20:12 494

原创 马尔可夫决策过程 CS188 Note7 学习笔记

本文介绍了马尔可夫决策过程(MDP)的核心要素和求解方法。MDP包含状态集合、动作集合、转移函数和奖励函数等基本要素。文章通过冷却系统示例展示了状态转移和奖励机制,并讨论了未折扣和折扣效用函数的区别。重点阐述了马尔可夫性、最优策略概念以及Bellman方程,该方程建立了状态值函数与Q值之间的关系,是求解MDP的关键。最后解释了求和运算的必要性,强调MDP中环境随机性的本质特征。

2026-05-21 16:09:11 499

原创 搜索算法Python入门 CS188 Proj1 学习笔记

本文介绍了四种搜索算法的Python实现:深度优先搜索(DFS)、广度优先搜索(BFS)、统一成本搜索(UCS)和A搜索。DFS使用栈结构实现深度优先遍历,BFS使用队列实现广度优先遍历,两者主要区别在于数据结构的选择。UCS和A都采用优先队列,UCS基于路径成本选择节点,A则结合启发式函数和路径成本。文章特别指出A实现中容易出现的环路问题,强调正确管理已访问节点的重要性。所有算法都遵循相似的框架:初始化数据结构、维护访问集合、扩展节点并检查目标状态。

2026-05-20 00:24:47 827

原创 CS188 Note6 学习笔记

本文摘要:Expectimax算法通过将最小化节点替换为随机节点并使用期望值,解决了对手非最优或游戏含随机性的问题。与Minimax不同,Expectimax通常无法进行α-β剪枝。在多智能体游戏中,每个代理最大化自身效用分量,产生合作行为。蒙特卡洛树搜索(MCTS)通过随机模拟和选择性扩展来估计最优动作,其UCT算法结合利用与探索,随着模拟次数增加会逼近Minimax行为。三种算法各有所长:Minimax适用于完全理性对手,Expectimax处理随机性,MCTS适合分支因子大的场景。

2026-05-20 00:24:14 497

原创 CS188 Note5 学习笔记

本文摘要: 博弈问题建模包含初始状态、玩家行动、状态转移等要素。Minimax算法通过后续遍历游戏树,在己方回合最大化收益,在对手回合最小化收益。Alpha-Beta剪枝通过维护α和β值来优化Minimax,在理想情况下可将时间复杂度降至O(b^(m/2))。对于深度受限的搜索,采用评估函数(如线性组合特征)来估计非终局状态的价值。评估函数设计需选择有效特征并调整权重,更深的搜索配合评估函数通常能获得更好结果。

2026-05-19 00:01:24 505 1

原创 CS188 Note4 学习笔记

本文摘要:局部搜索算法专注于寻找完整候选解而非路径,适用于约束满足和优化问题。主要算法包括:1) 爬山法,通过邻域搜索改进解,但易陷入局部最优;2) 模拟退火,结合随机游走和爬山法,理论上能收敛到全局最优;3) 局部束搜索,并行维护多个状态;4) 遗传算法,通过种群进化优化解,包含选择、交叉和变异操作。其中遗传算法通过交叉组合优良子结构,变异提供全局探索能力。这些算法各有特点,适用于不同优化场景,其中随机重启爬山法和模拟退火具有理论上的全局收敛性。

2026-05-19 00:00:21 513 1

原创 CS188 Note3 学习笔记

启发式搜索通过利用方向性信息显著提升搜索效率。核心概念是启发式函数,它估计当前状态到目标的距离,通常要求可采纳性(不高估真实代价)和一致性(每步代价限制)。启发式常通过放宽问题约束获得,如曼哈顿距离。多个可采纳启发式可通过取最大值组合成更强启发式(支配性),从而减少搜索节点。一致性是可采纳性的更强形式,确保算法高效收敛。典型应用包括路径规划中的启发式组合优化。

2026-05-18 23:29:00 454 1

原创 CS188 Note2 学习笔记

本文介绍了搜索问题的六要素:状态空间、动作集、转移模型、动作代价、初始状态和目标测试。以Pacman游戏为例,分析了状态空间大小的计算方法,指出实际应用中难以完全存储。对比了状态空间图(概念模型)和搜索树(实际结构)的区别,后者包含路径信息且同一状态可重复出现。最后比较了三种无信息搜索算法(DFS、BFS、UCS)的特性,包括数据结构、完备性、最优性、时空复杂度等,其中UCS能保证最优解但可能耗时较高。

2026-05-18 23:24:27 627 1

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除