自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(820)
  • 收藏
  • 关注

原创 端侧 NPU 与异构芯片的编译适配难题

在人工智能算力向智能手机、边缘汽车座舱、智能物联网(IoT)与穿戴设备深度渗透的今天,承担着在毫瓦级功耗下运行高频神经网络的核心使命。深入剖析端侧 NPU 编译适配的核心瓶颈,并构建基于,是打通端侧 AI 推理底座的必经之路。

2026-09-16 15:05:13 38

原创 分布式死锁检测算法:等待图与超时判定

在现代分布式事务数据库(如 TiDB、CockroachDB、Google Spanner)与分布式锁管理系统中,当采用悲观并发控制(2PL 两阶段锁)处理跨分片并发事务时,是系统可用性的头号致命威胁。在真实的分布式工业级系统中,如何以最低的通信代价精准揪出死锁环路?深入剖析以及,是攻克分布式事务内核的关键。

2026-09-16 15:04:32 5

原创 大模型投机采样的底层执行管道

在大语言模型(LLM)的自回归生成(Decode)阶段,存在一个根植于 Transformer 体系结构的物理痛点:每一次前向计算,GPU 必须从 HBM 显存中完整读取一遍高达几十吉字节的模型全部权重参数,却仅仅为了计算并吐出!这种极低的算术强度(Operational Intensity)导致 GPU 的浮点计算单元(Tensor Core)大部分时间处于严重的饥饿空转状态,生成速度被死死卡在显存带宽上限上。

2026-09-16 15:03:48 62

原创 分布式张量并行中的 All-Reduce 通信拓扑优化

在将超大参数量大模型(如 70B、405B)部署到多卡(如单机 8 卡)或跨节点多机 GPU 集群进行在线推理与训练时,单个 GPU 的显存容量无法容纳完整的模型权重。是将模型矩阵沿行(Row-Parallel)或列(Column-Parallel)切分到多个独立 GPU 上的核心并行模式。All-ReduceAll-Gather如果卡间通信拓扑设计不当,通信耗时会迅速吃掉整个前向计算耗时的。深入剖析,是攻克多卡极限吞吐的胜负手。

2026-09-16 15:03:05 34

原创 Rust 过程宏编写实战:从 TokenStream 到 AST

在 Rust 语言的元编程(Metaprogramming)武器库中,是站在类型系统最顶峰的终极神器。与 C/C++ 简单的文本宏替换(容易引发各种括号优先级灾难与作用域污染)以及 Rust 声明式声明宏(模式匹配)不同,从零手写一个自定义派生宏(Custom Derive Macro)与属性宏(Attribute Macro),是跨越 Rust 高级系统工程师门槛的核心实战。

2026-09-16 15:02:24 140

原创 技术的纯粹感:在代码的呼吸中找回专注的心流

技术的演进永远日新月异,但真正支撑一个人走得高远、走得扎实的,永远是内心的热爱、专注与纯粹。在喧嚣的时代里做一个安静的深耕者,在代码的每一次呼吸中雕刻出最坚固的系统,在对第一性原理的探索中找回最纯粹的自己。

2026-09-16 15:01:31 123

原创 基于 CAS 的无锁无等待算法设计准则

MutexRwLock从无锁(Lock-Free)迈向真正的无等待(Wait-Free),需要依靠怎样的数学模型与硬件原语?深入推导基于与的无等待算法设计准则,是登顶系统级并发高地的必修课。

2026-09-16 15:00:48 75

原创 Mio 与操作系统唤醒源机制的深度集成

在基于事件驱动(Event-Driven)的异步运行时(如 Tokio、Mio)中,Worker 线程在没有待处理的网络 I/O 事件时,会调用操作系统的阻塞系统调用(Linuxepoll_wait/ macOSkevent)陷入深度休眠,以彻底释放 CPU 算力与电力。然而,在异步世界中,有大量事件mpsc::send当 Worker 线程正死死阻塞在内核态的epoll_wait中时,深入剖析 Linux eventfd。

2026-09-16 15:00:03 160

原创 Multi-Raft 架构:Region 分裂、调度与跨分片路由

为了实现真正的海量横向扩展与分布式弹性,业界普遍采用Multi-Raft 架构是如何优雅处理的?

2026-09-16 14:59:18 200

原创 RPC 客户端负载均衡:从加权轮询到 P2C 最小负载算法

在分布式微服务架构与高性能 RPC 框架(如 gRPC、Dubbo、Finagle)中,是决定下游集群能否平稳分摊流量、消灭单点热点与长尾延迟的核心算法大脑。在早期架构中,开发者普遍采用最直观的或算法。然而,在面对真实的不可靠物理集群与复杂异构计算负载时,轮询算法存在着致命的缺陷——。Twitter Finagle 与现代化 RPC 框架广泛采用的,以极高的数学优雅彻底消除了负载倾斜。

2026-09-16 14:58:35 116

原创 图剪枝与张量别名在大模型显存压缩中的应用

在超大参数量大语言模型(如 70B、405B)的前向推理与长文本生成过程中,。很多开发者在分析显存占用时,往往只把目光集中在静态的模型权重(Weights)和自回归生成的 KV Cache 上,却完全忽视了计算图流转过程中产生的海量。在传统的计算图执行器中,每一个算子产出结果时都会向显存分配器申请一块全新的独立张量空间。ReshapeTransposeSqueezePermuteSlice结合与,能够在完全不损失任何计算精度的前提下,将前向传播过程中的激活值显存峰值直接压缩!

2026-09-15 21:16:44 8

原创 分布式配置中心动态推送的秒级生效与长轮询设计

在大型微服务架构与云原生基础设施中,以 Nacos / Apollo 为代表的,以极高的优雅度兼得了与。

2026-09-15 21:11:37 50

原创 GPU 共享内存 Bank Conflict 避免与冲突实测

在 GPU 高性能计算(CUDA / Triton Kernel)的微架构体系中,是性能仅次于寄存器的极速片上存储(访存延迟仅需 ~ 20 个时钟周期,带宽高达数十 TB/s)。它是实现矩阵乘分块(Tiling)、规约求和与 FlashAttention 片上闭环的核心物理基石。然而,共享内存并非一块可以随意并发读写的理想存储。在硬件物理实现上,NVIDIA GPU 的 Shared Memory 被精细划分为。如果一个 Warp(32 个线程)在同一指令周期内发起的内存访问请求,命中了。

2026-09-15 21:11:03 21

原创 大模型推理中的 PagedAttention 显存管理机制剖析

在 2026 年大语言模型(LLM)的在线推理服务架构中,是决定系统并发容量与服务成本的核心命脉。在 Transformer 模型的自回归生成(Decode)阶段,为了避免重复计算历史 Token 的注意力投影,系统会将每一层历史 Token 的 Key 和 Value 张量缓存在显存中。在传统的推理引擎(如早期的 HuggingFace Accelerate、FasterTransformer)中,KV Cache 的显存分配采用了最朴素的策略——

2026-09-15 21:10:28 20

原创 Rust 异步流在海量事件溯源中的吞吐调优

在现代金融风控、分布式审计日志分析以及事件驱动架构(Event-Driven / Event Sourcing)系统中,服务需要在极短时间内处理数以亿计的离散业务事件。在很多传统实现中,开发者处理海量事件时习惯于使用批处理切片(Vec<Batch>)或者粗粒度的循环。利用 Rust 的结合,能够构建一套端到端吞吐高达数百万 QPS 的极速流式事件处理管道。

2026-09-15 21:09:53 159

原创 在混沌中寻找确定性:分布式系统与人生的熵增对抗

在热力学第二定律中,有一个令所有物理学家感到敬畏的冷峻规律——。在计算机科学的世界里,在这样一个底层充满着不可靠、延迟、拜占庭错误与随机性的混沌网络中,计算机先驱们用 Paxos、Raft、两阶段提交与一致性哈希,。分布式系统的本质,就是一场。

2026-09-15 21:09:18 43

原创 基于 SIMD 指令集的向量化哈希表探测实战

在现代系统级编程与高性能计算中,是使用频率最高的基础数据结构。Google 开源的以及 Rust 官方标准库全面采用的 hashbrown,彻底颠覆了传统设计:通过将哈希值的高 7 位作为紧凑的,并利用,实现!深入推导 Swiss Table 的 SIMD 探测机制,是掌握现代硬件级数据结构设计的巅峰之作。

2026-09-15 21:08:43 108

原创 Mio 的 Poll 注册机制与跨平台事件多路复用抽象

在 Rust 异步生态体系(Tokio、Hyper、Actix)中,mio扮演着所有异步网络驱动的基石角色。如何在保持绝对零开销、不引入任何虚函数表或动态内存分配的前提下,将这三套截然不同的操作系统底层原语统合为一个统一、优雅且极速的 Rust 抽象接口?深入剖析mio::PollToken与Interest的底层注册流转,是掌握跨平台高性能系统开发的关键。

2026-09-15 21:08:09 178

原创 线性一致性读实战:ReadIndex 与 LeaseRead

在 Raft 分布式共识系统的生产实践中,业务读请求往往占据了总流量的 90% 以上。根据 Raft 论文的原始描述,所有的读请求必须像写请求一样,作为一条空操作日志(No-Op Log Entry)走一遍完整的多数派日志复制与磁盘 fsync 刷盘流程。为了释放只读吞吐,很多开发者试图直接让 Leader 从本地内存中读取数据并返回。然而这会引发严重的灾难:如果旧 Leader 已经被网络分区隔离,全集群已经选出了新 Leader,旧 Leader 盲目读取本地内存会读到严重滞后的脏数据,彻底破坏。

2026-09-15 21:07:34 177

原创 高性能 RPC 序列化协议横评:Protobuf、FlatBuffers 与 Cap‘n Proto

在分布式高性能微服务、跨进程通信(IPC)与大模型中间数据流转的架构选型中,是决定系统 CPU 占用与吞吐天花板的关键瓶颈。这三大二进制协议在上究竟有怎样的物理差异?通过深入底层二进制内存排布进行基准横评,才能看清高性能序列化的未来方向。

2026-09-15 20:56:59 161

原创 自动微分在推理图中的剪枝与反向传播依赖剔除

深入剖析与,是构建轻量级推理引擎的第一道硬核防线。

2026-09-14 08:35:01 10

原创 分布式缓存穿透、击穿与雪崩的防御体系建设

在大型高并发分布式系统与电商大促架构中,承担着抵御 95% 以上只读流量的核心屏障。构建一套包含的完整立体防御体系,是维系数据库生命的终极铠甲。

2026-09-14 08:34:20 24

原创 GPU 显存带宽打满实战:利用 Nsight Compute 分析 Roofline 模型

在 GPU 深度学习算子(CUDA Kernel / Triton Kernel)的性能调优深水区,许多工程师往往凭直觉进行优化:盲目尝试更大的分块尺寸、随意调整 Warp 数量,结果性能时好时坏,不知道优化的理论天花板在哪里。在高性能计算领域,著名的为算子性能提供了最坚实的定量分析物理指南:它将硬件的**峰值浮点算力(Peak FLOP/s)物理显存带宽(Peak Bandwidth)**统合在一个二维坐标系中,精准指出一个 Kernel 究竟是处于还是。结合 NVIDIA 官方性能分析神器。

2026-09-14 08:33:35 67

原创 Chunked Prefill 在超长输入大模型中的调度策略与吞吐实测

在 2026 年大语言模型(LLM)的工业级演进中,上下文窗口(Context Window)正在迅速向 32K、128K 甚至 1M Token 迈进。长文档总结、代码库全仓分析与复杂 RAG 检索成为了核心业务场景。然而,超长上下文给在线推理服务带来了毁灭性的彻底打破了超长 Prompt 的独占垄断,实现了超长输入与超低吐字延迟的完美兼得。

2026-09-14 08:32:43 62

原创 Tokio 生产环境大促压测:单机 10 万长连接下的内存与 CPU 表现

在互联网大促活动、百万在线即时推送(Push Notification)以及大模型流式 Server-Sent Events(SSE)长连接网关中,是衡量系统接入层工程水平的终极试金石。利用结合,单台 16 核 32GB 的云服务器在面对时,究竟能跑出怎样颠覆性的内存与 CPU 物理表现?通过复盘一场真实的生产级极限压测,才能看清系统级底座的真正威力。

2026-09-14 08:31:57 116

原创 系统的不可逆性:为什么好的架构必须支持平滑回滚

在初级架构设计中,许多工程师最容易犯的一个致命思维盲区就是——。在物理学中,熵增导致了时间的单向不可逆;但在高可用软件架构中,是衡量系统架构成熟度的最高道德底线。

2026-09-14 08:31:08 150

原创 并发哈希表从分段锁到无锁设计的演进

在多核高并发系统(如高频内存缓存、分布式路由表、在途请求 Pending Map)的设计中,是全系统访问最频繁、争用最激烈的核心数据结构。DashMapflurry深入推导并发哈希表的技术演进脉络,是掌握现代并发数据结构设计的经典范式。

2026-09-14 08:30:14 508

原创 深入 epoll 水平触发与边缘触发的物理差异

Tokio 底层的mio库全面采用 ET 模式(配合:通过边缘触发将操作系统的epoll_wait系统调用频次压制到物理最低,并结合防止多线程 Worker 之间的事件惊群与重复派发;水平触发 LT:则适合简单轻量、对单次读取逻辑容错度要求高、并发量较小的辅助通信工具。搞懂每一个状态跳变背后的内核链表流转,才能在编写高并发网络驱动时做到游刃有余、滴水不漏。

2026-09-14 08:29:34 270

原创 单节点 Raft 的生产退化与高可用最小集群约束

在分布式存储系统(如 TiKV、etcd、Kafka KRaft)的开发与测试过程中,开发者经常会在单机本地跑一个“单节点 Raft 集群(Single-Node Cluster)”进行快速调试。在单节点模式下,由于多数派法定人数(Quorum)为 $\lfloor 1/2 \rfloor + 1 = 1$,所有日志提案由自己一人直接批准,系统跑得飞快。然而,一旦将这种“单节点模式”或“偶数节点配置(如 2 节点、4 节点)”推向真实的生产容灾环境,就会遭遇残酷的分布式数学定律制裁。

2026-09-14 08:28:54 446

原创 自定义二进制通信协议的字段对齐与内存填充优化

这样既让结构体总尺寸严格对齐到 16 字节边界,又为未来的协议演进留出了一张合法的通行证。

2026-09-14 08:28:11 399

原创 AI 编译器的 Pass 编排与依赖管理体系

在现代 AI 编译器(如 MLIR、TVM、Torch-Inductor、XLA)的架构设计中,将一个高层深度学习计算图(Graph IR)一步步降维优化并最终生成高效汇编代码的过程,是由数十个甚至上百个独立的协同完成的。设计一套稳健、声明式且高效的,是构建大型编译器底座的核心骨架。

2026-09-13 15:58:34 10

原创 分布式唯一 ID 生成算法:从雪花算法到号段模式的权衡

在海量分布式存储、分布式数据库分库分表、以及全链路追踪系统中,是所有业务数据实体的物理身份证。工业界最主流的两大技术流派——与,各自的物理优劣在哪里?如何进行科学的架构选型?

2026-09-13 15:57:58 32

原创 GPU 架构演进对算子编写的影响:从 Pascal 到 Hopper 的 Tensor Core 变迁

在过去近十年的深度学习浪潮中,NVIDIA GPU 的底层微架构经历了翻天覆地的代际跃迁:从,到,到,到,再到现代大模型时代的。很多高层算法工程师习惯于在 PyTorch 中调用,感觉每一代显卡无非是“运行速度变快了”。然而在底层高性能算子开发者与 AI 编译器工程师的视角下,。深入推导 Tensor Core 在微架构层面的演进脉络,是手写现代化极致 Kernel 的核心基石。

2026-09-13 15:57:20 50

原创 大模型连续批处理与迭代级调度架构演进

在大语言模型(LLM)推理服务从传统的单次批处理演进到现代化高并发服务的过程中,是将系统端到端吞吐量提升整整 10 倍的最具革命性的架构突破。在这期间,GPU 的计算单元与显存带宽处于严重的空转与浪费状态。以为代表的,彻底打破了“请求级生命周期绑定”的枷锁,将调度的最小颗粒度细化到了每一个。

2026-09-13 15:56:41 62

原创 Rust 错误处理工程学:从 thiserror 到 anyhow 的分层落地

在工业级 Rust 系统工程的演进中,“错误处理(Error Handling)”绝不仅仅是在每个函数后面加上一个?操作符那么简单。建立一套thiserroranyhow的分层错误工程学体系,是维系大型 Rust 代码库清晰度与健壮性的关键基石。

2026-09-13 15:56:04 111

原创 工程师的技术断舍离:在功能膨胀期做减法的勇气

在软件工程的漫长生命周期中,有一股强大且不可逆转的自然法则——。当系统逐渐膨胀为一个步履蹒跚的庞然大物时,每一次微小的改动都会引发剧烈的震荡,系统的编译耗时成倍延长,线上 Bug 频频爆发。在这个阶段,。

2026-09-13 15:55:27 116

原创 用 Rust 实现一个工业级 LRU-K 缓存淘汰器

在分布式存储、数据库缓冲池(Buffer Pool Manager)以及大模型 KV Cache 管理系统中,是决定系统缓存命中率与 I/O 吞吐的核心大脑。经典的算法凭借实现简单(HashMap+ 双向链表)被广泛应用。然而在真实的工业级数据库与分布式场景中,标准 LRU 存在一个致命的软肋——通过将判定标准从“最近访问 1 次”提升为,以极高的优雅度彻底免疫了单次扫描引发的缓存污染。

2026-09-13 15:54:49 117

原创 无栈协程与有栈协程:内存占用与上下文切换的物理实测

在现代高性能并发编程语言的设计中,协程(Coroutines)是支撑单机处理数百万并发连接(C1000K 问题)的核心武器。.await这两套方案在上,究竟有怎样本质的物理差异?通过深入 CPU 寄存器与物理内存进行定量实测,才能看清两者的底层真相。

2026-09-13 15:54:11 192

原创 快照生成与日志截断的无阻塞设计

在基于 Raft 共识协议构建的分布式数据库与存储引擎(如 etcd、TiKV)中,会随着系统的持续写入而单调无限增长。为了控制磁盘体积与加速节点恢复,系统必须周期性地执行,将某个时间点之前的所有历史日志物理剔除——即。然而在工业级高并发系统中,生成一个几十吉字节的完整状态机快照需要消耗数秒甚至数十秒的磁盘 I/O。如果在生成快照期间对业务写操作进行全局锁死,整个集群的吞吐量将直接雪崩。如何设计出一套?

2026-09-13 15:53:33 195

原创 服务网格中边车代理的性能损耗剖析

在云原生微服务与 Kubernetes 基础设施的演进中,这凭空多出来的延迟与算力开销,究竟消耗在了操作系统的哪些微观物理路径上?深入剖析 Sidecar 数据面的性能账本,是理性进行云原生架构治理的关键。

2026-09-13 15:52:54 183

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除