<?xml version="1.0" encoding="utf-8" ?><rss version="2.0"><channel><title><![CDATA[yumeiguo的博客]]></title><description><![CDATA[]]></description><link>https://blog.csdn.net/yumeiguo</link><language>zh-cn</language><generator>https://blog.csdn.net/</generator><copyright><![CDATA[Copyright &copy; yumeiguo]]></copyright><item><title><![CDATA[第95节：多模型多卡推理管理]]></title><link>https://blog.csdn.net/yumeiguo/article/details/150069079</link><guid>https://blog.csdn.net/yumeiguo/article/details/150069079</guid><author>yumeiguo</author><pubDate>Sun, 21 Sep 2025 14:15:42 +0800</pubDate><description><![CDATA[多模型推理：在同一硬件平台上同时部署多个不同或相同的深度学习模型，满足多任务需求。多卡推理：利用多块 GPU 资源，提升推理吞吐量与并发能力。目标：合理分配 GPU 资源，实现高效、低延迟的推理服务。]]></description><category></category></item><item><title><![CDATA[第94节：ONNX 模型在 GPU 部署]]></title><link>https://blog.csdn.net/yumeiguo/article/details/150069030</link><guid>https://blog.csdn.net/yumeiguo/article/details/150069030</guid><author>yumeiguo</author><pubDate>Sun, 21 Sep 2025 14:15:30 +0800</pubDate><description><![CDATA[是一个开源的深度学习模型交换格式，旨在促进不同框架间的模型互操作。由微软、Facebook 和 AWS 等联合开发。支持主流框架如 PyTorch、TensorFlow、Caffe2 等导出与导入。]]></description><category></category></item><item><title><![CDATA[第93节：深度学习框架 GPU 后端比较（PyTorch vs TensorFlow）]]></title><link>https://blog.csdn.net/yumeiguo/article/details/150068951</link><guid>https://blog.csdn.net/yumeiguo/article/details/150068951</guid><author>yumeiguo</author><pubDate>Sun, 21 Sep 2025 14:15:16 +0800</pubDate><description><![CDATA[PyTorch：Facebook 开发的动态计算图框架，近年来成为科研与工业界热门选择，强调灵活性和易用性。TensorFlow：Google 开发的静态计算图框架，广泛用于生产环境和大规模部署，现支持动态图（Eager Execution）。两者都支持 GPU 加速，底层均依赖 NVIDIA CUDA、cuDNN 等库。指标PyTorchTensorFlow灵活性高，适合研究和实验较高，支持动态图与静态图性能优化通过 XLA 和 TorchScript 支持静态图优化更强，XLA 加持。]]></description><category></category></item><item><title><![CDATA[第92节：TensorRT 简介与部署流程]]></title><link>https://blog.csdn.net/yumeiguo/article/details/150068887</link><guid>https://blog.csdn.net/yumeiguo/article/details/150068887</guid><author>yumeiguo</author><pubDate>Sun, 21 Sep 2025 14:15:04 +0800</pubDate><description><![CDATA[TensorRT是 NVIDIA 提供的高性能深度学习推理优化库，专门针对 GPU 进行模型推理加速，特点包括：高效的网络结构优化和层融合支持 FP32、FP16、INT8 混合精度推理自动调优内存和计算资源支持多种深度学习框架模型导入（TensorFlow, PyTorch via ONNX 等）TensorRT 主要用于在 GPU 上快速、高效地部署训练好的深度学习模型，广泛应用于自动驾驶、视觉识别、语音处理等领域。步骤说明训练模型在 TensorFlow、PyTorch 等框架中。]]></description><category></category></item><item><title><![CDATA[第91节：GPU 上的批处理与向量化]]></title><link>https://blog.csdn.net/yumeiguo/article/details/150068843</link><guid>https://blog.csdn.net/yumeiguo/article/details/150068843</guid><author>yumeiguo</author><pubDate>Sun, 21 Sep 2025 14:14:51 +0800</pubDate><description><![CDATA[定义：批处理是指一次性处理多个数据样本的操作，而非单个数据，常见于深度学习训练与推理中的多样本并行。目的提高计算资源利用率减少内存访问延迟提升吞吐量和带宽效率定义：向量化是指在硬件层面一次处理多个数据元素，利用 SIMD（单指令多数据）指令集和硬件特性提高吞吐量。在 GPU 中，向量化通常表现为一次内存访问加载多个数据，或通过数据布局优化实现。]]></description><category></category></item><item><title><![CDATA[第90节：GPU 加速卷积操作]]></title><link>https://blog.csdn.net/yumeiguo/article/details/150068776</link><guid>https://blog.csdn.net/yumeiguo/article/details/150068776</guid><author>yumeiguo</author><pubDate>Sat, 16 Aug 2025 23:34:11 +0800</pubDate><description><![CDATA[卷积操作是深度学习中卷积神经网络（CNN）的核心计算，涉及输入特征图与卷积核的滑动窗口乘加计算。]]></description><category></category></item><item><title><![CDATA[第89节：cuDNN 使用基础]]></title><link>https://blog.csdn.net/yumeiguo/article/details/150068684</link><guid>https://blog.csdn.net/yumeiguo/article/details/150068684</guid><author>yumeiguo</author><pubDate>Sat, 16 Aug 2025 23:33:58 +0800</pubDate><description><![CDATA[是由 NVIDIA 提供的深度神经网络加速库，基于 CUDA 构建，主要用于：高性能的卷积、池化、归一化、激活等操作支持 Tensor Core 混合精度加速（FP16/TF32）与 TensorFlow、PyTorch、MXNet 等框架集成。]]></description><category></category></item><item><title><![CDATA[第88节：cuBLAS 简介]]></title><link>https://blog.csdn.net/yumeiguo/article/details/150068623</link><guid>https://blog.csdn.net/yumeiguo/article/details/150068623</guid><author>yumeiguo</author><pubDate>Sat, 16 Aug 2025 23:33:44 +0800</pubDate><description><![CDATA[cuBLAS是 NVIDIA 提供的基于 CUDA 的 GPU 加速BLAS（Basic Linear Algebra Subprograms）库，用于高性能线性代数运算，广泛应用于深度学习、科学计算、工程仿真等领域。它是 CUDA 平台上的BLAS 实现的 GPU 加速版本，具备以下特点：高度优化，底层使用Tensor Core、共享内存、流水调度等技术完整支持 BLAS Level 1/2/3 接口支持多种数据类型：FP32、FP64、FP16、BF16、INT8 等。]]></description><category></category></item><item><title><![CDATA[第87节：使用 Tensor Core 进行矩阵乘法]]></title><link>https://blog.csdn.net/yumeiguo/article/details/150068541</link><guid>https://blog.csdn.net/yumeiguo/article/details/150068541</guid><author>yumeiguo</author><pubDate>Sat, 16 Aug 2025 23:33:31 +0800</pubDate><description><![CDATA[Tensor Core 的目标是加速，特别适用于深度学习训练与推理场景。本节重点讲解如何使用 Tensor Core 实现矩阵乘法。]]></description><category></category></item><item><title><![CDATA[第86节：Tensor Core 架构解析]]></title><link>https://blog.csdn.net/yumeiguo/article/details/150068483</link><guid>https://blog.csdn.net/yumeiguo/article/details/150068483</guid><author>yumeiguo</author><pubDate>Sat, 16 Aug 2025 23:33:16 +0800</pubDate><description><![CDATA[特性描述首次引入Volta 架构（V100）发展历程加速对象GEMM、矩阵乘加、深度学习卷积支持数据类型FP16, BF16, TF32, FP8, INT8, INT4（取决于架构）]]></description><category></category></item><item><title><![CDATA[第85节：OpenCL 与多设备协同（Multi-Device Collaboration in OpenCL）]]></title><link>https://blog.csdn.net/yumeiguo/article/details/150068375</link><guid>https://blog.csdn.net/yumeiguo/article/details/150068375</guid><author>yumeiguo</author><pubDate>Sat, 16 Aug 2025 23:33:04 +0800</pubDate><description><![CDATA[OpenCL 支持在多个设备（如多个 GPU、CPU、FPGA）之间进行并行任务调度。掌握多设备协同可以充分利用系统的所有计算资源，提升计算性能和资源利用率。]]></description><category></category></item><item><title><![CDATA[第84节：OpenCL 性能优化策略]]></title><link>https://blog.csdn.net/yumeiguo/article/details/150068277</link><guid>https://blog.csdn.net/yumeiguo/article/details/150068277</guid><author>yumeiguo</author><pubDate>Sat, 16 Aug 2025 23:32:51 +0800</pubDate><description><![CDATA[性能优化是高效使用 OpenCL 的关键。由于 OpenCL 是跨平台的通用计算框架，它的优化策略涉及主机、设备、内存、计算结构、线程组织等多个维度。]]></description><category></category></item><item><title><![CDATA[第83节：OpenCL 同步机制]]></title><link>https://blog.csdn.net/yumeiguo/article/details/150068209</link><guid>https://blog.csdn.net/yumeiguo/article/details/150068209</guid><author>yumeiguo</author><pubDate>Sat, 16 Aug 2025 23:32:36 +0800</pubDate><description><![CDATA[OpenCL 支持多种同步机制，用于保证不同命令之间、主机与设备之间、线程间的执行顺序与数据一致性。理解同步机制是实现正确且高效并行程序的关键。许多命令都可以传入：：表示当前命令要等待的事件：输出当前命令的事件句柄，可用于后续同步
cl_event write_event;
clEnqueueWriteBuffer(queue, buffer, CL_FALSE, 0, size, data, 0, NULL, &amp;write_event);

cl_event kernel_event;
clEnq]]></description><category></category></item><item><title><![CDATA[第82节：OpenCL 缓冲区管理]]></title><link>https://blog.csdn.net/yumeiguo/article/details/150068133</link><guid>https://blog.csdn.net/yumeiguo/article/details/150068133</guid><author>yumeiguo</author><pubDate>Sat, 16 Aug 2025 23:32:24 +0800</pubDate><description><![CDATA[OpenCL 中的缓冲区（Buffer）是主机和设备之间传递数据的核心机制。理解缓冲区的创建、读写、映射以及释放过程，对于 OpenCL 编程至关重要。]]></description><category></category></item><item><title><![CDATA[第81节：OpenCL 线程模型]]></title><link>https://blog.csdn.net/yumeiguo/article/details/150068038</link><guid>https://blog.csdn.net/yumeiguo/article/details/150068038</guid><author>yumeiguo</author><pubDate>Sat, 16 Aug 2025 23:32:08 +0800</pubDate><description><![CDATA[OpenCL 的线程模型定义了在并行计算中，线程如何组织、分组与调度。理解 OpenCL 的线程模型（NDRange、工作项、工作组）是高效并行编程的关键。]]></description><category></category></item><item><title><![CDATA[第80节：OpenCL 内核编译与运行]]></title><link>https://blog.csdn.net/yumeiguo/article/details/150067971</link><guid>https://blog.csdn.net/yumeiguo/article/details/150067971</guid><author>yumeiguo</author><pubDate>Sat, 16 Aug 2025 23:31:56 +0800</pubDate><description><![CDATA[/ 内核代码字符串。// 等待所有指令完成。3. 创建命令队列（Command Queue）：支持 1D、2D、3D 的线程分布。4. 编写并构建内核（Kernel）内核代码写在字符串中，或单独存储为。1. 获取平台与设备（前一节已讲）2. 创建上下文（Context）：每个工作组的线程数；5. 分配内存缓冲区。]]></description><category></category></item><item><title><![CDATA[第79节：OpenCL 平台与设备管理]]></title><link>https://blog.csdn.net/yumeiguo/article/details/150067911</link><guid>https://blog.csdn.net/yumeiguo/article/details/150067911</guid><author>yumeiguo</author><pubDate>Sat, 16 Aug 2025 23:31:43 +0800</pubDate><description><![CDATA[OpenCL 平台是 OpenCL 运行时环境的抽象，代表一组计算设备及其资源。每个平台对应一个或多个设备，如 CPU、GPU、加速器等。应用程序需要查询并选择合适的平台与设备进行计算任务。]]></description><category></category></item><item><title><![CDATA[第78节：OpenCL 与 CUDA 区别]]></title><link>https://blog.csdn.net/yumeiguo/article/details/150067873</link><guid>https://blog.csdn.net/yumeiguo/article/details/150067873</guid><author>yumeiguo</author><pubDate>Sat, 16 Aug 2025 23:31:32 +0800</pubDate><description><![CDATA[OpenCL和CUDA都是用于 GPU 通用计算的编程框架，但设计理念、支持平台、编程模型等方面存在显著差异。了解它们的区别有助于选择合适的工具进行 GPU 加速开发。适用场景说明OpenCL需要跨平台、多硬件支持，异构计算环境CUDA专注 NVIDIA 硬件，追求最高性能和成熟工具。]]></description><category></category></item><item><title><![CDATA[第77节：OpenCL 简介与架构]]></title><link>https://blog.csdn.net/yumeiguo/article/details/150067851</link><guid>https://blog.csdn.net/yumeiguo/article/details/150067851</guid><author>yumeiguo</author><pubDate>Sat, 16 Aug 2025 23:31:18 +0800</pubDate><description><![CDATA[是一个开放、跨平台的并行计算框架，由 Khronos Group 维护。旨在支持 CPU、GPU、FPGA 以及其他异构计算设备上的通用并行计算。提供统一的编程接口，实现跨硬件的可移植性。]]></description><category></category></item><item><title><![CDATA[第76节：光线追踪与 GPU 加速实现]]></title><link>https://blog.csdn.net/yumeiguo/article/details/150067809</link><guid>https://blog.csdn.net/yumeiguo/article/details/150067809</guid><author>yumeiguo</author><pubDate>Sat, 16 Aug 2025 23:31:04 +0800</pubDate><description><![CDATA[光线追踪（Ray Tracing）是一种模拟光线传播路径以生成高度真实感图像的渲染技术。通过追踪光线与场景中物体的交互，计算光的反射、折射和阴影等效果。]]></description><category></category></item></channel></rss>