- 博客(282)
- 资源 (6)
- 收藏
- 关注
原创 RTX 5060 Ti / RTX 3080 20GB / RTX 4080 32GB / RTX 5080 算力出租:个人开发者如何低成本租用 GPU
GPU 算力正在逐渐从“购买硬件”变成“按需使用”。需要的时候租 GPU,不需要的时候释放 GPU。如果你正在做 AI 模型训练、推理、ComfyUI、LoRA 或 CUDA 开发,可以根据实际显存需求选择对应 GPU。我在闲鱼发布了【GPU算力租赁服务】
2026-08-30 21:16:13
156
原创 rtx5060ti 16GB+rtx 5080 16GB 跑35B的模型 就实现一路并发110token/s ,四路并发每路并发70token/s
摘要:作者测试了RTX5060ti 16GB和RTX5080 16GB显卡在运行Qwen3.6-35B大模型时的性能表现。实验显示,单卡运行时RTX5080达到200token/s,RTX5060ti为120token/s;双卡协同(3:1分层比例)实现四路并发时,单路110token/s,四路平均70token/s。通过监测发现GPU算力和PCIe带宽未达上限,提出多卡并联新思路:用多张RTX5060ti分布式加载模型不同层,6卡组合(96GB显存)成本约2.4万即可媲美高端显卡性能。测试中特别启用了Fl
2026-07-10 08:21:34
291
原创 NVIDIA Nsight Compute 入门:从 Copy/Add Kernel 看懂 CUDA Kernel 性能瓶颈
本文介绍了NVIDIA Nsight Compute工具的使用方法,通过分析简单的Copy/Add CUDA内核性能,帮助开发者理解常见的性能瓶颈指标。文章首先区分了Nsight Systems(全局时间线分析)和Nsight Compute(内核级性能分析)的不同用途,然后详细解释了Nsight Compute中的关键指标,包括执行时间、计算吞吐量、内存吞吐量、寄存器使用量等。通过实验代码演示,文章展示了如何利用这些指标识别性能问题,如计算单元利用率不足、访存瓶颈等,并提供了优化方向的建议。该工具能帮助开
2026-07-05 23:09:20
278
原创 2026年关键预判:AI垄断财富的格局,离市场平衡还有多远?——调研与判断依据
当前AI产业呈现明显的"价值集中"现象,利润主要流向GPU厂商(如NVIDIA)、CUDA生态和大模型公司(如OpenAI)。这种失衡状态类似于历史上的技术革命初期,如PC和移动互联网时代都经历了从基础设施红利到应用繁荣的过程。预计AI产业将在2027-2030年进入应用加速期,2030年后真正成熟,届时推理成本下降、模型同质化将推动利润向行业应用转移。判断市场平衡的关键指标包括GPU厂商利润率下降、API价格稳定、AI应用公司数量激增等。建议从业者关注"基础设施+行业应用"的结合,把握未来5-10年的产业
2026-06-29 05:57:48
193
原创 四、Transformer之多头注意力机制的深度源码剖析
摘要:本文深入剖析了Transformer中多头注意力机制的PyTorch实现,揭示了其高效并行化设计原理。通过将多个独立子空间的注意力计算合并为一次大矩阵乘法,并利用张量重塑(view)和转置(transpose)操作实现逻辑分组,该设计在数学等价的前提下最大化GPU并行效率。文章从数学定义出发,逐行解析了类初始化、掩码处理、联合投影与多头拆分等关键步骤,特别强调了d_model % h == 0的整除约束、投影矩阵的合并优化,以及注意力计算中的缩放因子和mask处理技巧,展现了深度学习框架中算法
2026-06-18 05:54:13
377
原创 三、Transformer之注意力机制(attentoin)缩放点积注意力原理
Transformer的核心组件是注意力机制(Attention),其数学公式为$\text{Attention}(Q, K, V) = \text{softmax}(\frac{QK^T}{\sqrt{d_k}})V$。代码实现主要包括六个步骤:获取$d_k$维度、计算缩放点积得分、掩码处理、Softmax归一化、Dropout正则化和加权求和输出。该设计灵活支持多种掩码类型,确保数值稳定性,并保留了注意力权重的可解释性。理解这一机制是掌握Transformer及大语言模型的关键基础。
2026-06-18 03:51:25
343
原创 二、Transformer之位置编码
Transformer模型通过位置编码(Positional Encoding)将序列顺序信息注入到输入中,弥补自注意力机制缺乏位置感知的缺陷。位置编码采用正弦和余弦函数的组合,生成与位置相关的固定模式向量,其公式为交替使用sin和cos函数计算不同维度的值。代码实现中,通过预计算除数项(div_term)优化计算效率,并将位置编码与词嵌入相加后输出。该方法能有效建模序列中的相对和绝对位置关系,支持模型处理变长输入。
2026-06-16 09:40:24
243
原创 不追求最大模型——我们如何用10倍低的成本落地AI
摘要: 本文探讨了如何通过知识蒸馏、领域模型训练、推理优化等技术手段,以10倍低成本实现AI落地。针对大模型推理成本高、生成速度慢、部署门槛高等痛点,提出了一套包含数据采集、蒸馏训练、Agent平台和AI RTC部署的完整技术闭环方案。通过将70B+大模型能力迁移至0.5B~14B小模型,结合vLLM等推理优化技术,实现消费级GPU部署,推理速度提升至150~500 Tokens/s。同时构建音视频领域专用模型和Agent平台,打通从数据处理到应用落地的全流程,最终在AI会议助手等场景实现高效、低成本的AI
2026-06-08 05:58:53
261
原创 Agent 经典范式构建之 ReAct (Reasoning and Acting): 一种将“思考”和“行动”紧密结合的范式,让智能体边想边做,动态调整
摘要 ReAct是一种智能体经典范式,将推理(Reasoning)与行动(Acting)紧密结合,形成"思考-行动-观察"循环。该范式通过特殊提示工程引导模型,使每一步输出遵循固定轨迹:思考当前情况→采取具体行动→观察反馈结果,直至获得最终答案。ReAct特别适合需要外部知识、精确计算或API交互的任务。文章介绍了ReAct的工作流程、系统提示词模板,并提供了Python代码实现框架,展示如何构建具备外部工具调用能力的智能体,解决大语言模型无法直接回答的问题。
2026-01-28 20:50:31
891
原创 2026年AI资深工程师/架构师规划路线
我使用google的gamma3 , 帮我规划学习大模型底层, 从工程路线,学习Transformer、到大模型、多模态, 分析业界哪些框架可以帮我从底层学习路线 综合分析并给出结论。然后对gamma3给出的结论, 放到gpt中让gpt结合业界分析这个结论怎么样啊 帮我分析一下 给出流程和结论,并给打分 不及格是低于60分, 及格是60 ,良好是75到85 分, 优秀 85到95分 , 满分100分。
2026-01-09 06:27:22
859
原创 Transformer之前馈神经网络(FFN全连接层)
本文深入解析了Transformer架构中的前馈神经网络(FFN)模块,揭示其核心作用与实现原理。FFN位于Transformer层后半部分,采用"升维-激活-降维"的三步结构(线性变换→GELU激活→线性变换),负责深层语义理解。在Transformer中,FFN与注意力机制协同工作:注意力层捕捉词间关系,FFN则进行深度语义加工。关键优势体现在三个方面:实现非线性语义挖掘、支持高效并行计算、确保训练稳定性。代码实现展示了FFN在TransformerBlock中的完整流程,包括层归一
2026-01-06 00:49:08
1399
原创 Transformer架构及其源码实现
Transformer架构中注意力机制已经应用到各种深度学习模型当前去提高细节关注AIGC、LLM大模型项目:https://chensongpoixs.github.io/LLMSAPP/
2025-12-31 23:37:24
1226
原创 AIGC大语言模型:从词元到嵌入向量
这篇文章主要介绍了AIGC大语言模型(LLM)中的两个核心概念:词元和嵌入向量。内容分为三个部分: 分词部分:介绍了LLM的分词器工作原理,包括词级、子词级、字符级与字节级分词,并列举了OpenAI BPE、SentencePiece等主流分词器。 嵌入向量部分:解释词元嵌入向量的概念,说明它如何捕获语言模式和事实信息,并介绍了文本嵌入在处理句子和文档中的应用。 实践部分:以《红楼梦》为例,演示了从数据爬取、清洗到准备预训练数据集的完整流程,包括分词器设置和模型输出。 文章配有词元嵌入空间分布图,帮助理解这
2025-12-16 00:10:02
1075
原创 深度神经网络训练参数优化概论
zWTXbzWTXbzw1∗x1w2∗x2b神经元{z = w_1*x_1 +w_2*x_2 + ... + b(神经元)}zw1∗x1w2∗x2...b神经元AI、ML、LLM和AIGC算法应用及其探索项目地址:https://chensongpoixs.github.io/LLMSAPP/
2025-12-06 19:08:27
790
原创 AI 工程师必备之八大 LLM 开发核心技能
最近在Google 出Gemini3.0 、马斯克团队出了Grok-4.1,OpenAI连夜出ChatGPT-5。
2025-11-29 14:06:35
1245
原创 低时延迟流媒体之WebRTC协议
上面是WebRTC交互整连接交换的步骤的流程图客户端与服务端交换SDPSTUN协议的验证 Binding Request 0001 (USERNAME、GOOG-NETWORK-INFO、ICE-CONTROLLING、USE-CANDIDATE、PRIORITY、MESSAGE-INTEGRITY、FINGERPRINT)DTLS密钥协商流程发送音视频数据rtp、rtcp、application信息头后有0或多个属性每个塑性进行TLV编码: Type、Length、Value。
2025-11-14 10:55:49
977
原创 云电脑、云游戏 平台架构
最近在弄云电脑厂家的远程控制服务架构搭建上面是云电脑一个架构图、公安系统的接入没有画, 其实是在中转服务上接入的。据说整机房建设10万台的机器,目前已经建设好了一万台机器、目前云服务架构挑战还是非常大的低延迟 (100ms)基本已经决定使用中转模式(后台可以进行用户登录录像储备功能)并发量暂时支持一万台机器的转发的能力项目使用到协议部分:https://github.com/chensongpoixs/libmedia_transfer_protocol。
2025-11-05 09:44:30
999
原创 低时延迟流媒体之HTTP-FLV协议
http-flv 其实网络中发送flv文件, 也是网络格式Flash Video(简称FLV),是一种网络视频格式,也是一种流媒体格式。FLV文件由 FLV File Header + FLV File Body组成。libflv 源码地址:https://github.com/chensongpoixs/libmedia_transfer_protocol/tree/master/libflv。
2025-10-27 08:23:15
1045
原创 VLC源码模块化之Live555模块分析
在vlc-3.0.11\include\vlc_plugin.h文件中定义模块化宏定义 枚举类型/*** \filetrue)true)回调方法: Open、Close增加测试:live, livedotcom描述: RTSP/RTP access add dex增加方法:rtsp、pnm、live、livedotcom回调方法: Open、Close参数: rtsp-tcp: RTP over RTSP (TCP) 默认使用tcp参数说明默认值rtsp-tcp。
2025-08-26 20:15:06
1086
原创 PyTorch框架之图像识别模型与训练策略
传统几何变换图像领域:包括旋转、翻转、缩放、平移、裁剪等操作,通过调整图像的空间结构生成新样本。例如,随机旋转图像一定角度或沿水平方向翻转可模拟不同拍摄视角文本/音频领域:通过词序调整、添加噪声或调整语速实现数据多样性人工智能深度学习:https://github.com/chensongpoixs/cdeeplearning_pytorch。
2025-08-23 22:11:38
531
原创 深度神经网络之CNN卷积神经网络原理
图像的总尺寸 28 * 28标签的种类数训练的总循环周期一个最(批次)的大小 64张图片Conv2dReLU池化self.conv1 = nn.Sequential( # 输入大小 (1, 28, 28)# 2D卷积9nn.Conv2d(in_channels = 1, # 灰度图out_channels = 16, # 要得到几多少个特征图kernel_size = 5, # 卷积核大小stride = 1, # 步长。
2025-08-17 23:22:49
426
原创 神经网络结构
fxWWxbfxWWxbW : 权重参数是类别数量 即(10)微调Xi{X_i}Xi: 数据人工智能深度学习:https://chensongpoixs.github.io/cvideo_codec/
2025-08-01 01:48:56
700
原创 视频编码中熵编码之基于上下文的变长编码(Huffman霍夫曼编码和指数哥伦布)
视频编码中熵编码的目标是去除信源符号在信息表达上的表示冗余,也称为信息熵冗余或者编码冗余。熵编码技术是视频编码系统中的基础性关键技术之一。Huffman编码是1952年为压缩文本文件所设计的编码方法,也是目前消除视频信息冗余最常使用的方法之一对出现概率最大的符号赋以最短的码字, 概率越小表示的码字越长, 从而表示每个符号的平均比特数最小数字视频编码技术原理地址:https://chensongpoixs.github.io/cvideo_codec/4、与计算机的数据结构不匹配。
2025-07-15 23:30:56
1024
原创 视频编码中变换编码之DCT变换原理
变换被认为是图像或视频编码中最有效的技术之一,将空域信号变化到频域信号,有效地去除了信号的相关性,并使大部分能量集中到低频区域。根据变换的这一特点,有选择的编码部分显著的频域信号,掉弃不显著的频域信号,可以达到提高压缩效率的目的。数字视频编码技术原理地址:https://chensongpoixs.github.io/cvideo_codec/
2025-06-22 00:46:02
990
原创 视频编码中熵编码之熵及熵编码基本原理
视频编码中熵编码的目标是去除信源符号在信息表达上的表示冗余,也称为信息熵冗余或者编码冗余。熵编码技术是视频编码系统中的基础性关键技术之一。熵Hx{H(x)}Hx除以平均码长Lavg{L_{avg}}Lavg即表示编码效率Hx−∑j1MPj∗log2PjHx−j1∑MPj∗log2PjnHxLavgnHxLavg。
2025-06-16 01:03:28
1043
原创 CUDA与OpenGL混合编程图形渲染
从CUDA编程者角度看,OpenGL在GPU上创建并管理的通过缓冲的内存区域称为缓冲对象。CUDA Kernel将一段缓冲映射如CUDA内存空间,可实现CUDA和OpenGL的互操作。当释放该缓冲或解除映射时,其控制权重回OpenGL。因为不需要进行内存拷贝,所以映射是一种处理速度很快的低开销操作,实现OpenGL和CUDA之间的高速互操作能力。与OpenGL进行互操作,需要在所有其他Runtime调用之前用cudaGLSetGLDevice()函数来指定CUDA设备。
2025-06-02 10:40:10
1428
原创 CUDA的设备,流处理器(Streams),核,线程块(threadblock),线程,网格(gridDim),块(block)和多gpu设备同步数据概念
SIMT和SIMDCUDA执行的是SIMT架构(单指令多线程架构),SIMT和SIMD(Single Instruction, Multiple Data)类似,SIMT应该算是SIMD的升级版,更灵活,但效率略低,SIMT是NVIDIA提出的GPU新概念。二者都通过将同样的指令广播给多个执行官单元来实现并行。一个主要的不同就是,SIMD要求所有的vector element在一个统一的同步组里同步的执行,而SIMT允许线程们在一个warp中独立的执行。
2025-05-22 01:19:43
1729
原创 WebRTC的ICE之TURN协议的交互流程中继转发Relay媒体数据的turnserver的测试
TURN协议:文档RFC5766文档中TURN协议工作原理图Peer A| /| || || | || || | |+-+| | || | || | |WebRTC中走中继Relay 调用流程图WebRTC源码分析地址:https://github.com/chensongpoixs/cwebrtc。
2025-03-29 04:49:39
1706
1
原创 WebRTC中音视频服务质量QoS之FEC+NACK调用流程
WebRTC中FEC分为两个模块1. FlexfecSender类负责对发送包前向纠错发送2. FecControllerDefault类评估出现FEC的保护比率调用流程图下面是类关系图WebRTC源码分析地址:https://github.com/chensongpoixs/cwebrtc。
2025-03-27 00:22:51
1332
原创 WebRTC中音视频服务质量QoS之RTT衡量网络往返时延的加权平均RTT计算机制详解
WebRTC 提供 两种 RTT 计算模式,适应不同传输场景DLSR 表示自接收端最后一次收到发送端 Sender Report (SR) 到生成当前 Receiver Report (RR) 的时间间隔,单位为 1/65536 秒1。若接收端未收到过 SR 报文,则 DLSR 值为零1。
2025-03-15 23:55:25
1843
原创 FFMPEG中avfilter模块 调用流程
视频拼接filter的demo地址:https://github.com/chensongpoixs/cmp4_box_avi_flv/tree/master/filter。
2024-01-29 00:20:38
1274
1
原创 JWT使用HS512算法生成全局服务token原理
最近需要使用C++服务中根据用户名生成全局服务的token,然后在java服务中印证token正确性。因为java服务中使用jwt库生成全局的token, 我就对应找C++中jwt的库, github中有开源库叫jwt-cpp然后我就下载了, 我使用没有找到java中生成token好使用的接口、没有办法我只有看一下jwt生成token的步骤实现一遍。
2023-12-28 23:52:14
3742
1
原创 2022年终总结、展望2023
2022年公司上半年的主要指标和工作内容、核心需要攻下云渲染技术提示:以下是本篇文章正文内容,下面案例可供参考。
2022-12-25 23:18:58
1575
原创 WebRTC源码之RtpTransceiver添加视频轨道的AddTrack函数中桥接模式的流程分析
WebRTC是音视频行业的标杆, 如果要学习音视频, WebRTC是进入音视频行业最好方法, 里面可以有成熟方案, 例如:音频中3A 算法、网络评估、自适应码流、Simulcast、SVC等等 , 非常适合刚刚进入音视频行业小伙伴哈_我也是哦, 以后再音视频行业长期打算的小伙伴的学习项目。里面有大量知识点提示:以下是本篇文章正文内容,下面案例可供参考桥接(Bridge)是用于把抽象化与实现化解耦,使得二者可以独立变化。
2022-10-05 01:35:05
3841
原创 WebRTC之证书(certificate)生成的时机分析
WebRTC是音视频行业的标杆, 如果要学习音视频, WebRTC是进入音视频行业最好方法, 里面可以有成熟方案, 例如:音频中3A 算法、网络评估、自适应码流、Simulcast、SVC等等 , 非常适合刚刚进入音视频行业小伙伴哈_我也是哦, 以后再音视频行业长期打算的小伙伴的学习项目。里面有大量知识点提示:以下是本篇文章正文内容,下面案例可供参考WebRTC源码分析地址:https://github.com/chensongpoixs/cwebrtc。
2022-10-04 03:55:32
1381
原创 WebRTC源码之音频设备的录制流程源码分析
AEC 音频采集 硬件回音消除麦克风阵列处理噪音抑制自动增益控制语言活动检查WebRTC源码分析地址:https://github.com/chensongpoixs/cwebrtc。
2022-08-15 00:17:23
821
原创 WebRTC源码之音频设备播放流程源码分析
①、低延迟②、提高了可靠性,API从内核层移到了用户层③、安全性更高等等…WebRTC源码分析地址:https://github.com/chensongpoixs/cwebrtc。
2022-08-15 00:13:12
1486
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅