人工智能入门课
文章平均质量分 94
Sherlock Ma
研究生在读,致力于分享编程技术。主要研究人工智能相关,包括大模型、AIGC等。偶尔也会更新Java内容
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
强化学习入门(2):DQN、Reinforce、AC、PPO
本文介绍了深度强化学习中的几种主流算法及其实现。首先详细解析了DQN及其改进算法DoubleDQN和DuelingDQN,它们通过引入经验回放、目标网络和动作价值分解等机制提升了性能。其次阐述了DDPG算法,该算法采用Actor-Critic框架和软更新技术处理连续动作空间。然后介绍了REINFORCE策略梯度算法及其蒙特卡洛更新方式。接着重点分析了SAC算法,它通过最大熵框架和自动温度调节实现高效探索。最后讲解了PPO算法,采用截断策略梯度更新确保训练稳定性。每种算法都配有核心代码实现,包括网络结构、训练原创 2026-02-04 16:44:19 · 828 阅读 · 0 评论 -
手搓GRPO:手把手教你从头跑通Deepseek关键算法GRPO
本文介绍了GRPO(广义奖励近端优化)算法在强化学习中的应用,特别是在大语言模型对齐任务中的优势。GRPO在PPO基础上改进,通过灵活的奖励建模和精细化策略控制提升训练稳定性和样本效率。文章详细展示了使用Qwen2.5-0.5B-Instruct模型在GSM8K数学推理数据集上的实现过程,包括数据准备、模型训练和评估。GRPO采用组相对优势计算和KL散度惩罚,有效解决了稀疏奖励、模式崩溃等问题。实验结果表明,该方法使模型准确率提升36.67%,达到40%。代码实现了完整的训练流程,包括梯度检查点优化和多GP原创 2025-12-17 16:06:48 · 1051 阅读 · 0 评论 -
强化学习入门(1):概念、Sarsa、Q-Learning、Dyna-Q
强化学习是一种人工智能范式,它让智能体在未知环境中通过试错自我进化,目标是最大化长期回报。其核心机制是基于“状态 - 动作 - 奖励”的闭环:智能体观察当前状态,根据策略选择一个动作,环境会立即返回一个标量奖励并转移到下一个状态。与监督学习不同,强化学习不需要预先提供样本标签,而是让智能体在与环境的动态交互中探索有效路径,同时利用已有经验避免重复无效尝试,平衡“探索”与“利用”是其关键挑战之一。原创 2025-10-03 16:45:01 · 1362 阅读 · 0 评论 -
西瓜书《机器学习》全网最详细解读 第六章:支持向量机
本文是《机器学习》(西瓜书)第六章支持向量机的详细解读。主要内容包括:1. 支持向量机的基本原理,介绍了最大间隔分类超平面的概念及其数学表达;2. 对偶问题的推导与求解方法,包括KKT条件和SMO算法;3. 核函数的作用与性质,如何通过核技巧解决非线性可分问题;4. 软间隔支持向量机,引入松弛变量处理噪声和异常点;5. 支持向量回归(SVR)的实现原理;6. 核方法在机器学习中的广泛应用。文章通过公式推导和图示说明,深入浅出地讲解了支持向量机的核心思想和技术细节,适合机器学习学习者和研究者参考。原创 2025-07-05 17:47:31 · 1762 阅读 · 1 评论 -
西瓜书《机器学习》全网最详细解读 第五章:神经网络
神经网络是一种模仿生物神经元结构和功能的人工智能模型。它由大量的节点(神经元)和连接这些节点的边(突触)组成,这些节点和边共同构成了一个复杂的网络结构。原创 2025-06-23 14:12:06 · 2024 阅读 · 0 评论 -
LLaMA-Factory:无代码微调大模型,小白也能上手(以Qwen3为例,包括lora、dpo、ppo等)
LLaMA Factory是一个功能强大的平台,专注于训练和微调大型语言模型。它支持多种模型和训练方法,涵盖了从预训练到微调的全过程,能够满足不同用户的需求。总的来说,LLaMA Factory是一个功能全面、使用方便的平台,能够为用户提供高效、灵活的模型训练和微调体验。原创 2025-06-13 15:28:54 · 3748 阅读 · 4 评论 -
西瓜书《机器学习》全网最详细解读 第四章:决策树
决策树(decision tree)是一类常见的机器学习方法,是一种基于树结构的监督学习算法,广泛应用于分类和回归任务中。原创 2025-06-09 22:10:04 · 2140 阅读 · 0 评论 -
西瓜书《机器学习》全网最详细解读 第三章:线性模型
机器学习》,又称西瓜书,是南京大学教授周志华教授编著的一本机器学习领域的经典教材。《机器学习》系统地介绍了机器学习的基本理论、常用算法及其应用。全书内容丰富,涵盖了机器学习的多个重要方面,包括监督学习、无监督学习、强化学习等主要学习范式。《机器学习》适合计算机科学、人工智能、数据科学等相关专业的本科生、研究生以及对机器学习感兴趣的自学者。无论是初学者希望系统地学习机器学习的基础知识,还是有一定基础的研究人员和从业者希望深入了解前沿技术,这本书都能提供有价值的参考。在接下来的日子里,我将。原创 2025-05-25 19:52:01 · 1736 阅读 · 0 评论 -
西瓜书《机器学习》全网最详细解释 第二章:模型评估
周志华西瓜书机器学习第二章原创 2025-05-18 19:17:25 · 1670 阅读 · 0 评论 -
西瓜书《机器学习》全网最详细解读 第一章:绪论
《机器学习》,又称西瓜书,是南京大学教授周志华教授编著的一本机器学习领域的经典教材。在接下来的日子里,我将每周精心打磨一章内容,全方位、多角度地为大家剖析书中精髓。原创 2025-04-12 18:32:52 · 4937 阅读 · 5 评论 -
人工智能入门课【手写自注意力机制】
总的来说,自注意力机制是一种强大的神经网络架构组件,用于动态地衡量输入序列中不同位置之间的关联程度。它通过计算查询(Query)、键(Key)和值(Value)之间的点积,生成注意力权重,再利用这些权重对值进行加权求和,从而实现对输入数据的全局信息捕捉。这种机制允许模型在处理每个元素时,同时考虑整个序列的信息,有效解决了传统序列模型难以捕捉长距离依赖的问题。自注意力机制的核心优势在于其并行计算能力和对全局信息的高效利用,使其在自然语言处理和计算机视觉等领域得到了广泛应用。原创 2025-02-01 20:21:12 · 1630 阅读 · 0 评论
分享