<?xml version="1.0" encoding="utf-8" ?><rss version="2.0"><channel><title><![CDATA[eloudy的专栏]]></title><description><![CDATA[]]></description><link>https://blog.csdn.net/eloudy</link><language>zh-cn</language><generator>https://blog.csdn.net/</generator><copyright><![CDATA[Copyright &copy; eloudy]]></copyright><item><title><![CDATA[nv_hsb_ip 中的 RoCEv2 包结构与链路类型分析]]></title><link>https://blog.csdn.net/eloudy/article/details/166376255</link><guid>https://blog.csdn.net/eloudy/article/details/166376255</guid><author>eloudy</author><pubDate>Wed, 23 Sep 2026 01:43:59 +0800</pubDate><description><![CDATA[单向高吞吐图像流：FPGA 只做 RDMA Write 把传感器数据直接写进 GPU 显存环形 buffer，不需要对端回 ACK；BTH 中，FPGA 侧没有任何等待/处理 ACK 的逻辑；可靠性由上层保证：PSN + ImmDt 中的 buf_ptr + Metadata（frame_crc、帧号、PTP 时间戳）随包带给 NVIDIA host 软件，由软件检测丢包/乱序，而不是 IB 硬件重传；无需建立 QP 连接状态机。]]></description><category></category></item><item><title><![CDATA[GPU ↔ FPGA 建链与通信原理（NVQLink PoC 零 RTL 复现实验）]]></title><link>https://blog.csdn.net/eloudy/article/details/166367081</link><guid>https://blog.csdn.net/eloudy/article/details/166367081</guid><author>eloudy</author><pubDate>Tue, 22 Sep 2026 17:58:02 +0800</pubDate><description><![CDATA[/ 轮询 rx_buf+10 的 wcnt（显存读 ~百 ns）// 保证 NIC 写入的 payload 可见PCIe 读写不对称：NIC→GPU 是 posted write（流水推进），GPU 主动读 NIC 的 CQE 是 non-posted read（每轮一次 PCIe 往返 ~600ns–1µs）。让数据自己流进显存、GPU 轮询本地显存，是时延最优的到达通知机制（与 NVSHMEM put+signal 同构）。写序。]]></description><category></category></item><item><title><![CDATA[开源 gpunetio examples 01 解析 gpunetio_verbs_put_bw]]></title><link>https://blog.csdn.net/eloudy/article/details/166140735</link><guid>https://blog.csdn.net/eloudy/article/details/166140735</guid><author>eloudy</author><pubDate>Mon, 21 Sep 2026 21:41:13 +0800</pubDate><description><![CDATA[维度服务器端客户端启动方式不带-c数据 bufferCPU 内存（calloc），清零GPU 显存（doca_gpu_mem_alloc），按档填 idx+1内存注册普通ibv_reg_mr，开放 REMOTE_WRITE优先（GPUDirect），失败回退 nvidia-peermemOOB 角色TCP 服务端，发送addr/rkeyTCP 客户端，接收addr/rkey测试中角色空转（单边操作零参与）GPU kernel 直接发 RDMA WRITE 并 poll CQE。]]></description><category></category></item><item><title><![CDATA[恢复 CX6 Dx 网卡的 mac 地址]]></title><link>https://blog.csdn.net/eloudy/article/details/166248046</link><guid>https://blog.csdn.net/eloudy/article/details/166248046</guid><author>eloudy</author><pubDate>Mon, 21 Sep 2026 15:33:08 +0800</pubDate><description><![CDATA[这是一张网卡，两个物理端口/dev/mst/21:00.021:00.1双口卡只有，两个 function 共用同一份固件镜像和同一组 Base GUID/MAC，所以从哪里q读出来都一样。]]></description><category></category></item><item><title><![CDATA[GPUNetIO开源实现与FPGA的 RoCEv2 通信延迟实验]]></title><link>https://blog.csdn.net/eloudy/article/details/166137769</link><guid>https://blog.csdn.net/eloudy/article/details/166137769</guid><author>eloudy</author><pubDate>Sun, 20 Sep 2026 19:48:04 +0800</pubDate><description><![CDATA[主机侧 kernel 以显存中的seq字段作为"新包到达"标志轮询。因此必须保证在一个 RDMA Write 消息内，payload 的其余字节先于 seq 两字节的 PCIe 写完成。实现方式（推荐）：自定义 AXIS 源在单拍内交付整个 32B payload（512-bit 位宽下 tkeep=0x00000000FFFFFFFF，一拍一帧），32B 小于 PCIe MPS，将以单个 TLP 落盘，原子可见，天然满足写序；主机端 MR 不开即可。]]></description><category></category></item><item><title><![CDATA[cpu rdma 与 gpunetio 的关系]]></title><link>https://blog.csdn.net/eloudy/article/details/166013766</link><guid>https://blog.csdn.net/eloudy/article/details/166013766</guid><author>eloudy</author><pubDate>Sat, 19 Sep 2026 22:03:30 +0800</pubDate><description><![CDATA[gpunetio, 是类似cpu app doca sender，receiver 过程的 gpu化，现在探究两者的联系。——同一条流水线，一步都没少，只是干活的人换了。CPU 没有消失，而是从"数据面"退到了"控制面"。]]></description><category></category></item><item><title><![CDATA[fpga-latency 指标分析与触发机制]]></title><link>https://blog.csdn.net/eloudy/article/details/166012674</link><guid>https://blog.csdn.net/eloudy/article/details/166012674</guid><author>eloudy</author><pubDate>Sat, 19 Sep 2026 20:34:20 +0800</pubDate><description><![CDATA[是纯 FPGA 内部= 帧尾 write-with-imm 发出时刻 − 帧首数据进入打包器时刻两个时间戳来自 FPGA 内同一个自由运行的 PTP 计数器（同一时钟域），主机只计算差值，因此无需与主机对时，测量是精确的。// 起点: sof_ptp// 终点: cur_ptp① 帧尾识别dp_pkt_top.sv:833/893 sif_eof <= sif_eof | sif_wtlast (传感器侧 tlast)]]></description><category></category></item><item><title><![CDATA[RDMA 乒乓示例：CX5 ＜-＞ CX6 DX（QSFP28 直连）]]></title><link>https://blog.csdn.net/eloudy/article/details/166010376</link><guid>https://blog.csdn.net/eloudy/article/details/166010376</guid><author>eloudy</author><pubDate>Sat, 19 Sep 2026 17:34:04 +0800</pubDate><description><![CDATA[两台服务器，一台插，一台插，两块网卡用一根（不经过交换机）。两端通过接收方每轮逐字节校验“128 个字节全部等于本轮的填充值”，全部通过打印PASS。]]></description><category></category></item><item><title><![CDATA[RDMA 主要概念、通信流程描述、简单实验]]></title><link>https://blog.csdn.net/eloudy/article/details/165890199</link><guid>https://blog.csdn.net/eloudy/article/details/165890199</guid><author>eloudy</author><pubDate>Fri, 18 Sep 2026 21:46:06 +0800</pubDate><description><![CDATA[进程 A（机器甲） 进程 B（机器乙）│ CQ_A（可多个 QP 共享） │ 报文互发 │ CQ_B ││ 都在进程 A 的 DRAM 中 │ ◄────────► │ 都在进程 B 的 DRAM 中 ││ 门铃/DMA │ 门铃/DMA网卡甲 ─────────────────────────────────── 网卡乙（各自只消费自己"面对"的那个进程的队列）所以这句话落到咱们 demo 上就是：demo 里两个端点同属于一个进程，因此两套 SQ/RQ/CQ 都在这一个进程的地址空间里；]]></description><category></category></item><item><title><![CDATA[基于 PTP 的 FPGA→RoCE→CPU 单向延迟测量实验方案]]></title><link>https://blog.csdn.net/eloudy/article/details/165886536</link><guid>https://blog.csdn.net/eloudy/article/details/165886536</guid><author>eloudy</author><pubDate>Fri, 18 Sep 2026 18:25:02 +0800</pubDate><description><![CDATA[针对论文。本文结合（HSB IP）与（论文所用 RFSoC-PYNQ 参考设计）]]></description><category></category></item><item><title><![CDATA[GPUNetIO opensource]]></title><link>https://blog.csdn.net/eloudy/article/details/165756806</link><guid>https://blog.csdn.net/eloudy/article/details/165756806</guid><author>eloudy</author><pubDate>Thu, 17 Sep 2026 21:03:53 +0800</pubDate><description><![CDATA[分支被调用——cudaMalloc 一块显存，同时用 GDRCopy 映射出 CPU 侧指针。而谁会申请这种内存？另外如果应用自己申请 GPU_CPU 内存而 GDRCopy 不可用，代码会优雅降级为"CPU 内存 +（Unreliable Connected）——正对应论文里说的"选择不可靠连接、不做重传"。——控制路径和数据路径的分工正好体现了"CPU 只初始化、GPU 全权收发"的设计。的 DOCA_GPU_MEM_TYPE_GPU_CPU。，也是 AUTO 的优先选择）中，QP/CQ 用。]]></description><category></category></item><item><title><![CDATA[gpunetio_verbs_write_lat 延迟测试使用了哪些 GPUNetIO 能力]]></title><link>https://blog.csdn.net/eloudy/article/details/165757303</link><guid>https://blog.csdn.net/eloudy/article/details/165757303</guid><author>eloudy</author><pubDate>Thu, 17 Sep 2026 21:03:46 +0800</pubDate><description><![CDATA[write_lat 延迟测试 = Verbs CPU 控制路径（建队列）+ GPUNetIO CPU 控制路径（交给 GPU）+ RDMA 单边 GPU 数据路径（kernel 内 WRITE 乒乓），三者分别对应应用的"建资源、交棒、跑数据"三个阶段；双边、以太网、DMA 三条 GPU 数据路径因语义和场景不符，均未被触及。]]></description><category></category></item><item><title><![CDATA[全文 - DOCA GPUNetIO Open Source 仓库 README]]></title><link>https://blog.csdn.net/eloudy/article/details/165756422</link><guid>https://blog.csdn.net/eloudy/article/details/165756422</guid><author>eloudy</author><pubDate>Thu, 17 Sep 2026 20:30:45 +0800</pubDate><description><![CDATA[原文：DOCA GPUNetIO Open Source 仓库 README（本仓库提供和库的开源版本。其中包含的功能仅限于：在开源环境中，使用类 DOCA 风格的 API，基于 RDMA 协议（InfiniBand 和 RoCE）启用网络通信技术。]]></description><category></category></item><item><title><![CDATA[全文 - GDRCopy 仓库 README]]></title><link>https://blog.csdn.net/eloudy/article/details/165756402</link><guid>https://blog.csdn.net/eloudy/article/details/165756402</guid><author>eloudy</author><pubDate>Thu, 17 Sep 2026 20:05:02 +0800</pubDate><description><![CDATA[GPUDirect RDMA 的本意是让第三方设备直接访问 GPU 内存，但同样可以使用这些 API 来创建完全合法的 GPU 内存 CPU 映射。由 CPU 驱动拷贝的优势在于其开销极小。当需要低延迟时，这会非常有用。]]></description><category></category></item><item><title><![CDATA[全文 - DOCA GPUNetIO 闭源实现的 Doc]]></title><link>https://blog.csdn.net/eloudy/article/details/165756244</link><guid>https://blog.csdn.net/eloudy/article/details/165756244</guid><author>eloudy</author><pubDate>Thu, 17 Sep 2026 19:58:24 +0800</pubDate><description><![CDATA[DOCA 各库的质量状态列于此处。信号处理（Signal processing）网络安全（Network security）信息采集（Information gathering）输入重建（Input reconstruction）传统方法通常依赖以 CPU 为中心（CPU-centric）的模型：CPU 与网卡（NIC）协调，借助 GPUDirect RDMA 将数据包接收到 GPU 内存中；随后 CPU 通知 GPU 上的 CUDA kernel 来处理这些数据包。]]></description><category></category></item><item><title><![CDATA[RAM Player 实验：hololink-write 开流 + RoCEv2 接收分析]]></title><link>https://blog.csdn.net/eloudy/article/details/165741811</link><guid>https://blog.csdn.net/eloudy/article/details/165741811</guid><author>eloudy</author><pubDate>Thu, 17 Sep 2026 17:34:41 +0800</pubDate><description><![CDATA[│ 寄存器: 0x5000_0004 enable / 0x5000_0008 timer ││ 0x5010_0000+ RAM 内容 ││ 每 window_size 字节 = 1 帧 ─▶ RoCEv2 (UC QP) ││ RDMA WRITE（帧末 write-with-immediate）▼┌─ 主机 ────────────────────────────────────────────────┐。]]></description><category></category></item><item><title><![CDATA[holoscan-sensor-bridge 裸机构建（无 holoscan-sdk）和 RAM Player 实验]]></title><link>https://blog.csdn.net/eloudy/article/details/165633041</link><guid>https://blog.csdn.net/eloudy/article/details/165633041</guid><author>eloudy</author><pubDate>Thu, 17 Sep 2026 02:04:03 +0800</pubDate><description><![CDATA[日期：2026-09-16构建机：x86_64 Ubuntu 22.04，GCC 12.3.0，CMake 4.4.2，CUDA 12.8 (/usr/local/cuda)，libibverbs-dev 已安装，。]]></description><category></category></item><item><title><![CDATA[vitis 工程 ping FPGA 丢包（~50% 随机）问题分析]]></title><link>https://blog.csdn.net/eloudy/article/details/165496996</link><guid>https://blog.csdn.net/eloudy/article/details/165496996</guid><author>eloudy</author><pubDate>Wed, 16 Sep 2026 02:25:03 +0800</pubDate><description><![CDATA[日期：2026-09-16（xczu48dr，无此问题）]]></description><category></category></item><item><title><![CDATA[FPGA 综合中时序不收敛主要原因汇总]]></title><link>https://blog.csdn.net/eloudy/article/details/165474126</link><guid>https://blog.csdn.net/eloudy/article/details/165474126</guid><author>eloudy</author><pubDate>Tue, 15 Sep 2026 17:45:10 +0800</pubDate><description><![CDATA[原因解决方案速度等级选错（-1 当 -2 用）核对 part 型号速度等级温度/电压 corner 设置确认用工业级范围，别用错。]]></description><category></category></item><item><title><![CDATA[FPGA 开发与 IC 数字前端设计]]></title><link>https://blog.csdn.net/eloudy/article/details/165467756</link><guid>https://blog.csdn.net/eloudy/article/details/165467756</guid><author>eloudy</author><pubDate>Tue, 15 Sep 2026 13:00:20 +0800</pubDate><description><![CDATA[打个比方：像是"开自动挡车"和"做整车标定"的关系——方向盘油门是通的，其余都要重新学。]]></description><category></category></item></channel></rss>