- 博客(889)
- 资源 (3)
- 收藏
- 关注
原创 PyTorch强化学习实战(24)——连续动作空间中的强化学习
连续动作空间问题是强化学习 (Reinforcement Learning, RL) 的重要分支,无论在理论还是实践层面都具有重要意义,因为它在机器人学、控制问题及其他与物理对象交互的领域有着重要应用。在本节中,我们将了解此类情况下的挑战并掌握相应的解决方案。
2026-09-10 11:36:23
147
3
原创 PyTorch计算机视觉(9)——变分自编码器(VAE)详解与实现
本节介绍了变分自编码器 (Variational Autoencoder, VAE) 及其改进版本 beta-VAE 的理论原理与实现方法。VAE 通过编码器将高维数据压缩至低维潜在空间,并利用解码器重构数据,其核心在于优化重构损失与 KL 散度之间的平衡。beta-VAE 通过引入超参数 β 调节这一平衡,增强了学习解耦表示的能力。
2026-09-07 11:07:16
872
4
原创 PyTorch强化学习实战——融合人类示范数据的高效强化学习
本节在A3C网页导航智能体中引入人类示范数据,以解决纯探索训练效率低、难以处理高维动作空间的问题。通过自定义录制工具捕获含像素信息的示范轨迹,并复用监督学习的交叉熵损失,以一定概率将示范样本与策略梯度训练混合,推动网络模仿人类动作选择。实验表明,在count-sides任务中,仅25个示范回合便使智能体在3万帧内达到0.5平均奖励,远优于12小时未使用示范的-0.4;在井字棋环境中,2小时训练后可达约0.05平均奖励,能赢得部分对局。结果表明,少量人类示范即可显著提升多模态网页导航任务的训练效率与最终表现。
2026-09-04 10:36:30
995
8
原创 PyTorch强化学习实战——基于图像-文本融合的自动化网页导航
本节在网页导航智能体中引入文本模态,改进原有仅依赖图像的点击模型。通过修改环境包装器保留观测中的文本描述,并设计多模态预处理器将图像与分词后的文本转换为模型输入(图像张量与打包序列)。模型采用CNN处理图像、LSTM 处理文本,融合二者特征后输出策略与价值。在按钮点击环境中,模型经 3 小时训练能学会点击操作,平均步数降至 5-7 步,奖励约 0.2。
2026-09-03 08:47:30
901
26
原创 PyTorch计算机视觉——cWGAN-GP实现可控图像生成
本节详细介绍了 cWGAN-GP 在"石头剪刀布"数据集上的实现与应用,展示了条件 GAN 在可控图像生成方面的强大能力。通过引入类别标签信息,我们能够精确控制生成图像的类别,同时保持了 WGAN-GP 的训练稳定性和高质量生成能力。
2026-08-31 09:17:04
1932
4
原创 PyTorch计算机视觉(7)——条件生成对抗网络(cGAN)
本节介绍了条件生成对抗网络 (GAN) 的原理与实现。CGAN 通过在生成器和判别器中同时引入标签信息(如图像类别),实现了对生成图像类型的精确控制。实践部分首先在 MNIST 和 Fashion-MNIST 数据集上构建 cDCGAN 模型,利用 nn.Embedding 将标签编码并与图像/噪声拼接,成功生成了指定数字的高质量图像。随后将该方法扩展到三分类的石头剪刀布手势数据集,采用 128×128 分辨率彩色图像,通过五层转置卷积生成器和六层卷积判别器配合指数衰减学习率调度器进行训练。
2026-08-27 11:42:11
2797
11
原创 2026年VLA训练数据破局:为什么遥操作无法规模化,网络视频能做到什么
VLA 规模化的核心瓶颈正从模型与算力转向数据。遥操作能提供精确动作监督,却受成本、吞吐和场景覆盖限制;网络视频可低边际成本扩展真实世界与长尾分布,但缺少机器人原生动作标签。本文拆解 Bright Data 的 Define→Search→Extract 管道,并给出“网络视频预训练、遥操作精调”的数据分层策略。
2026-08-27 09:31:21
11956
23
原创 PyTorch强化学习实战(23)——强化学习在网页导航中的应用
在本节中,探讨了强化学习方法在浏览器自动化中的实际应用,并使用了 MiniWoB++ 基准测试。浏览器自动化(以及与人类常用软件的交互)将是未来人工智能发展的重要方向。
2026-08-24 09:01:47
3070
36
原创 PyTorch强化学习实战——用预训练语言模型和ChatGPT玩转文本游戏
文本互动小说 (interactive fiction) 是强化学习研究中一个独特而富有挑战性的领域。与图形丰富的街机游戏不同,这类游戏通过纯文本描述呈现状态,要求智能体理解自然语言、进行长期规划并在复杂的语义空间中决策。在本节中,我们将借助 Hugging Face 预训练 Transformer 和 ChatGPT API 展现大语言模型在文本游戏中的强大能力。通过从手工特征到预训练模型的演进,我们将见证深度 NLP 技术如何赋能强化学习智能体。
2026-08-20 09:22:30
3147
43
原创 PyTorch强化学习实战(22)——将强化学习应用于TextWorld互动小说游戏
在本节中,我们介绍了如何将深度Q网络 (Deep Q-Network, DQN) 应用于交互式小说游戏,这是一个属于强化学习 (Reinforcement Learning, RL) 和自然语言处理 (Natural Language Processing, NLP) 的交叉领域。我们学习了如何使用 NLP 工具处理复杂的文本数据,并在交互式小说游戏环境中进行实验。
2026-08-17 09:30:18
2923
42
原创 PyTorch计算机视觉(2)——神经网络模型训练与PyTorch基础
本节介绍了 PyTorch 框架的核心应用。通过线性回归案例,详细阐述了梯度下降算法的工作原理,包括损失函数、学习率、权重更新等关键概念。随后展示了 PyTorch 的自动梯度计算机制,以及 LambdaLR、ReduceLROnPlateau 等多种学习率调度器的使用方法。在工程实践方面,讲解了 Dataset 与 DataLoader 的数据封装、GPU 加速训练、三种模型保存方式。最后以 Sigmoid 激活函数拟合指数曲线为例,说明了非线性建模的必要性。
2026-08-13 22:42:23
3092
29
原创 PyTorch计算机视觉(4)——迁移学习(Transfer Learning)详解与实现
本节介绍了迁移学习的概念、重要性及实现流程,并基于 ResNet 预训练模型完成了蔬菜图像分类任务。迁移学习通过利用在 ImageNet 等大型数据集上预训练的模型权重,有效解决了小样本数据集训练困难的问题。实验表明,微调 resnet18 模型在测试集上可达约 98% 的分类准确率。最后通过可视化模型参数,展示了预训练模型各层提取的特征模式,加深了对深度网络内部机制的理解。
2026-08-13 22:42:11
3018
31
原创 PyTorch计算机视觉(8)——WGAN及其变体WGAN-GP
本节介绍了 WGAN 及其改进版 WGAN-GP 的原理与实现,重点解决传统 GAN 的模式坍塌和训练不稳定问题。WGAN 通过引入 Wasserstein 距离作为损失函数,并采用权重裁剪满足 1-Lipschitz 连续性,但生成质量仍有限。WGAN-GP 进一步用梯度惩罚替代权重裁剪,通过计算插值样本的梯度范数约束判别器,显著提升训练稳定性。
2026-08-12 08:38:47
2606
10
原创 PyTorch计算机视觉——WGAN-GP在图像生成中的应用
生成对抗网络 (GAN) 自提出以来,已成为深度学习领域最具创新性的技术之一。然而,原始 GAN 面临着训练不稳定、模式坍塌等挑战,这些问题限制了其在实际应用中的效果。Wasserstein GAN with Gradient Penalty (WGAN-GP) 作为一种改进方案,通过引入 Wasserstein 距离和梯度惩罚项,有效解决了这些问题。本节将使用 WGAN-GP 在 CelebA 人脸数据集和动漫面孔数据集上实现图像生成,包括代码实现、训练过程分析以及结果评估。
2026-08-12 08:35:54
2762
13
原创 PyTorch计算机视觉(3)——卷积神经网络(CNN)详解与实现
本节系统介绍了基于 PyTorch 的图像分类实践,涵盖三个递进式项目:首先在 MNIST 数据集上构建全连接网络,完整演示了数据加载、模型训练、过拟合判断及基于混淆矩阵的评估指标计算;其次深入解析二维卷积的数学原理与 PyTorch 实现,最后利用 ResNet9 在 CIFAR-10 数据集上实现超 92% 的准确率,引入数据增强和 OneCycleLR 学习率调度策略。通过从基础全连接网络到残差卷积网络的演进,系统掌握图像分类的核心技术路线与评估方法,为迁移学习等高级应用奠定基础。
2026-08-11 08:53:49
3057
47
原创 Ubuntu极速部署OpenClaw完全指南(本地模型+DeepSeek)
OpenClaw 给是一个开源、可自托管的 AI 助手平台,原生支持 Ollama 本地模型和 DeepSeek 等云端 API,让你在隐私与性能之间自由切换。本文记录了我在 Ubuntu 上从零部署 OpenClaw 的全过程——踩过的坑、优化后的配置,一并进行分享。无论你是想搭建一个完全离线的私人助手,还是追求顶级大模型的推理能力,这篇指南都能帮你少走弯路,快速用起来。
2026-08-10 14:49:24
2276
34
原创 不会高效刷课?夸克承包你的网课全流程,从“看”到“会”一步到位
夸克浏览器通过AI功能重构网课学习流程,解决考公/考研党三大痛点:① 视频总结(B站/慕课1小时课程5分钟提取框架+分段跳转);② 字幕提取(自动生成完整讲义文稿并导出为可编辑文档);③ 截屏即问(不切屏解读图表/解题思路,侧边栏实时答疑)。搭配网盘存储、文档转换等工具,形成从听课到复习的闭环,大幅提升学习效率。
2026-08-10 10:51:08
37959
40
原创 2025年度总结:在代码中思考,于分享中前行
本文总结回顾了2025年度,我以实战和体系化方式分享AI知识的经历。全年通过347篇博客和数十万行代码,聚焦生成式AI(从GAN到扩散模型)和Transformer生态两大主线,致力于在理论与实践中搭建桥梁。我坚持以可运行代码为核心,构建了PyTorch实战、生成模型等系列专栏,形成模块化知识体系。高频输出源于将写作融入学习过程,并珍视读者互动。展望2026年,我计划探索AI智能体和边缘AI,推动技术向更自主、高效的方向发展,继续在分享与思考中前行。
2026-08-09 22:36:49
17563
78
原创 PyTorch计算机视觉(6)——深度卷积对抗神经网络(DCGAN)
本节探讨了深度卷积生成对抗网络 (DCGAN) 在图像生成中的应用。首先详细解析了转置卷积的数学原理,通过公式推导和代码示例阐明了其与标准卷积的互逆关系。随后在 MNIST 和 Fashion MNIST 数据集上构建四层 DCGAN 模型,通过设计分段学习率调度器并设置生成器学习率为判别器的 50 倍,有效平衡了双模型训练。最后将 DCGAN 应用于动漫人脸数据集,探讨了学习率比例 k 对训练稳定性的影响,揭示了 GAN 训练中双模型平衡的重要性。
2026-08-09 22:19:52
2048
12
原创 PyTorch计算机视觉(1)——计算机视觉的数学工具
本节介绍了计算机视觉中的关键数学工具,包括概率分布(二项分布、高斯分布)、香农熵、KL 散度、交叉熵和 Jensen 不等式。通过贝叶斯定理和最大似然估计,可推导出模型训练的损失函数,如交叉熵和均方误差。文中还讨论了过拟合问题及其缓解方法(如岭回归),并通过期望最大化算法演示了如何从数据中估计概率密度函数。这些概念为图像生成、分类等计算机视觉任务提供了理论基础。
2026-08-09 22:16:24
2839
16
原创 PyTorch计算机视觉(5)——生成对抗网络(Generative Adversarial Network,GAN)
本节介绍了生成对抗网络 (Generative Adversarial Network, GAN) 的理论基础与实现方法。GAN 通过生成器与判别器的对抗博弈,使生成器逐步学习真实数据分布,最终生成以假乱真的样本。理论部分详细推导了最优判别器表达式及损失函数界限。实践环节首先在二次曲线数据集上验证了 GAN 训练框架,损失曲线与理论值高度吻合,随后将简单全连接 GAN 应用于 MNIST 手写数字生成。
2026-08-09 22:11:34
3061
14
原创 PyTorch强化学习实战(21)——异步优势演员-评论家(Asynchronous Advantage Actor-Critic, A3C)
本节介绍了异步优势演员-评论家 (Asynchronous Advantage Actor-Critic, A3C) 方法,通过并行环境交互解决策略梯度算法中的样本关联性问题。相比 A2C,A3C 提出了两种并行方案:数据并行和梯度并行。数据并行将多个环境采集的样本汇集到主进程进行训练,实现简单;梯度并行则让各子进程独立计算梯度,由主进程汇总更新,具有更好的扩展性。
2026-08-03 09:28:25
2847
39
原创 PyTorch强化学习实战(20)——优势演员-评论家(Advantage Actor-Critic, A2C)
在本节中,我们深入探讨了深度强化学习中最广泛应用的方法之一:优势演员-评论家算法 (Advantage Actor-Critic, A2C)。该方法巧妙地将策略梯度更新与状态价值估计相结合。我们分析了基线值对梯度统计特性及收敛性的影响,进而研究了基线思想的扩展形式——A2C 算法,该算法通过独立的网络头部为当前状态提供基线值。
2026-07-27 10:10:07
3049
32
原创 PyTorch强化学习实战——基于策略梯度法解决Pong环境
策略梯度法在 CartPole 等简单环境中表现出色,但面对 Pong 这类 Atari 游戏时却面临严峻挑战。与深度Q网络 (Deep Q-Network, DQN) 仅需百万帧即可完美求解不同,原始策略梯度方法在 Pong 环境中难以收敛,且对超参数和初始化极其敏感。为提升性能,我们引入三项关键改进:采用移动平均基线以减少梯度方差、使用多并行环境降低样本相关性、以及通过梯度裁剪增强训练稳定性。
2026-07-23 11:35:16
2156
34
原创 PyTorch强化学习实战(19)——策略梯度法
在本节中,介绍了另一种解决强化学习问题的方式:策略梯度方法,该方法与 DQN 方法在多方面存在显著差异。与基于价值的方法不同,策略梯度直接优化行为策略,适用于连续动作空间和随机环境。策略通常表示为动作的概率分布,通过最大化策略梯度来更新网络参数。REINFORCE 利用完整回合的折扣奖励计算损失函数,无需显式探索机制或经验回放。然而,该方法存在高梯度方差、需完整回合、样本相关性高等局限。改进方案包括引入基线减少方差、使用熵奖励促进探索、采用多步贝尔曼展开以及并行环境。
2026-07-20 11:40:44
3045
37
原创 OpenCV-Python实战——分析与加速OpenCV应用程序
本节介绍了使用性能分析工具 pyinstrument 识别 OpenCV 应用程序瓶颈的方法,并以目标检测与跟踪中的 IoU 矩阵计算为例,展示了 Numba 的加速能力。通过 @numba.jit 装饰器优化循环和函数,CPU 下性能提升约 20 倍;进一步使用 @numba.guvectorize 实现向量化计算,速度提升达 1000 倍。最后简要介绍了基于 CUDA 的 GPU 加速方案,通过 @cuda.jit 将计算移植到 GPU,适用于深度神经网络等场景。
2026-07-16 08:50:59
1053
50
原创 OpenCV-Python实战(33)——构建实时目标检测与跟踪系统
我们已经动手实践了深度卷积神经网络,并使用迁移学习构建了深度分类和定位网络。已经开启了深度学习之旅,并熟悉了一系列深度学习概念,理解了深度模型是如何训练的,并且已经准备好学习更高级的深度学习概念。在本节中,我们将继续深度学习之旅,首先使用目标检测模型在相关场景(例如包含汽车和行人的街景)的视频中检测多种不同类型的目标。之后,将学习这类模型是如何构建和训练的。
2026-07-13 09:17:45
1690
44
原创 PyTorch强化学习实战(18)——基于DQN处理股票交易问题
本节通过强化学习实战案例,完整实现了股票交易智能体及自定义 Gymnasium 环境。我们对比测试了两种神经网络架构:接收价格历史数据输入的前馈网络与一维卷积网络。两种架构均采用深度Q网络 (Deep Q-Network, DQN) 方法,并融合了若干 DQN 改进技术。
2026-07-09 09:16:56
629
39
原创 OpenCV-Python实战(32)——基于深度学习的物体分类与定位
在本节中,我们使用 Oxford-IIIT-Pet 数据集创建并训练了分类和定位模型。我们学习了如何使用迁移学习来创建深度学习分类器和定位器。我们已经开始理解如何使用深度学习来解决现实世界的问题,已经理解了 CNN 的工作原理,并且知道如何使用基础模型创建新的 CNN。我们还介绍了用于计算梯度的反向传播算法。理解该算法将使我们能够在构建自定义模型架构时做出更明智的决策。
2026-07-06 09:22:56
1181
35
原创 OpenCV-Python实战(31)——实时面部情绪检测与识别系统
我们已经熟悉了目标检测和目标识别的概念。在本节中,我们将开发一个能同时完成这两项任务的应用程序。该应用能够在摄像头实时画面的每一帧中检测人物面部,识别面部情绪,并在图形用户界面 (Graphical User Interface, GUI) 上标注出来。本节的目标是开发一个应用,将人脸检测与人脸识别相结合,重点是对检测到的人脸进行情绪表达识别。读完本节后,我们将能够在自己的不同应用中使用人脸检测和人脸识别技术。
2026-07-02 10:33:47
1364
21
原创 PyTorch强化学习实战(17)——强化学习训练加速
我们已经学习了若干提升[深度Q网络 (Deep Q-Network, DQN) 方法稳定性与收敛速度的实用技巧。这些技巧通过对经典 DQN 方法进行改良(例如向网络注入噪声或展开贝尔曼方程),以更短的训练时间获得更优策略。而本节我们将探索另一种加速路径:通过调整方法实现细节来提升训练效率。这虽属纯工程优化范畴,却因其实用价值而至关重要。
2026-07-02 10:22:26
123
25
原创 魔珐星云 SDK 实战:快速开发一个会共情的具身陪伴 Agent
本文探讨了如何利用魔珐星云SDK开发具身陪伴Agent,以解决纯文字AI在情绪陪伴场景中的温度缺失问题。文字交互缺乏非语言信号(如表情、姿态、语速),难以传递真正的陪伴感。实验基于魔珐星云端侧渲染SDK(响应≤500ms),结合Qwen3-VL模型实现双层情绪感知,并将情绪映射为数字人的姿态、语速和动作。核心实现包括情绪驱动的姿态切换、流式语音共情回复及正念呼吸引导。
2026-06-30 17:34:56
8755
6
原创 PyTorch深度学习实战(61)——使用Optuna搜索最优超参数
自动机器学习 (AutoML) 能够为给定神经网络自动寻找最优架构与最佳超参数配置。在本节中,我们介绍了一个 AutoML 工具 Optuna,它专为 PyTorch 模型提供超参数搜索功能。通过本节的学习,可以运用 Optuna 为任何 PyTorch 编写的神经网络模型寻找最优超参数。当面对超大规模模型和/或需要调整的超参数数量极多时,Optuna 还支持分布式搜索。值得注意的是,Optuna 不仅支持 PyTorch,还兼容 TensorFlow、scikit-learn 等主流机器学习框架。
2026-06-29 08:31:47
1499
37
原创 PyTorch强化学习实战——整合DQN改进算法
本文总结了 Rainbow DQN 中七项改进技术的整合与验证。在实现 Dueling DQN、Noisy Networks、优先经验回放及N步贝尔曼展开的基础上,实验表明组合系统在 100 局内即可从负收益跃升至正收益,平滑奖励达 +18,显著优于经典DQN。
2026-06-28 15:23:55
210
1
原创 PyTorch强化学习实战(16)——Categorical DQN
分布强化学习通过建模完整的回报分布,突破了传统算法仅关注期望价值的局限。本节详细阐述了 Categorical DQN 核心原理:将价值分布表示为固定区间内的离散原子,通过投影操作实现贝尔曼算子的分布版本,并采用 KL 散度作为损失函数。实现上,网络输出每个动作对应原子的概率分布,通过 distr_projection 函数完成分布投影。
2026-06-25 09:45:46
713
19
原创 视觉Transformer实战 | Pyramid Vision Transformer(PVT)详解与实现
Pyramid Vision Transformer (PVT) 通过引入金字塔结构和空间缩减注意力机制,解决了Vision Transformer (ViT) 的单尺度低分辨率输出和计算开销大问题,成为首个专为密集预测任务设计的纯 Transformer 骨干网络。本节将深入解析 PVT 技术原理,并使用 PyTorch 从零开始实现 PVT 模型。
2026-06-25 09:05:11
836
22
原创 OpenCV-Python实战(30)——基于支持向量机的交通标志识别模型
在本节中,我们训练了一个多类分类器来识别 GTSRB 数据库中的交通标志。我们讨论了监督学习的基础知识,探索了特征提取的复杂性,并初步了解了神经网络。通过本节的方法,我们应该能够将实际问题表述为机器学习模型,利用 Python 技能下载带标签的样本数据集,编写将图像转换为特征向量的特征化函数,并使用 OpenCV 训练现成的机器学习模型,从而解决实际问题。
2026-06-22 08:39:47
1524
32
原创 PyTorch强化学习实战(15)——Dueling DQN
本文介绍了 Dueling DQN 的核心思想——将Q网络分解为状态价值流和动作优势流,通过显式建模两者关系提升学习效率。从经典 DQN 的局限性出发,详细解析了 Dueling Network 的架构设计、数学原理及实现细节,并通过减去优势均值的技巧确保网络正确学习。实验结果表明,该架构相比经典 DQN 具有更快的收敛速度,且优势值稳定在零均值附近,验证了设计的有效性。
2026-06-22 08:27:29
465
16
原创 OpenCV-Python实战(29)——基于视觉显著性的自动多目标跟踪系统
本节我们探索了一种标记视觉场景中潜在有趣物体的方法,即使这些物体的形状和数量都是未知的。我们利用傅里叶分析研究了自然图像统计特性,并实现了一种提取自然场景中视觉显著区域的方法。此外,我们将显著性检测器的输出与跟踪算法相结合,在一个足球比赛视频序列中跟踪了多个形状和数量未知的物体。我们还介绍了 OpenCV 中其他更复杂的跟踪算法,可以用它们替代应用程序中的均值漂移跟踪,甚至创建自己的应用程序。当然,也可以用之前学过的技术(如特征匹配或光流法)来替换均值漂移跟踪器。
2026-06-19 08:45:00
1015
10
原创 PyTorch深度学习实战(60)——PyTorch自动机器学习
在本节中,我们探讨了 AutoML 技术,其核心目标是提供模型选择与超参数优化的自动化方法。对于缺乏经验的初学者,AutoML 能帮助解决"模型应包含多少层"、"选择哪种优化器"等决策难题;对于经验丰富的研究人员,它既能加速模型训练流程,又能发现那些通过人工调参几乎不可能获得的最优模型架构。
2026-06-18 10:14:52
875
50
用于目标检测的 YOLO V3 模型架构及权重文件(含 OpenCV 使用示例)
2021-09-30
用于图像分类的 ResNet-50 模型架构及权重文件(使用 Caffe 框架进行预训练)
2021-09-30
用于目标检测的 MobileNet-SSD 模型架构及权重文件(使用 Caffe 框架进行预训练)
2021-09-30
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅