<?xml version="1.0" encoding="utf-8" ?><rss version="2.0"><channel><title><![CDATA[有的话没说出来之前，你是他的主人，一旦说出来你就成了他的奴隶||想要干好事，别太把自己当人，别把别人太不当人||认识这个人就是开了一扇窗户，就能看到不一样的东西，听到不一样的声音，能让你思考、觉悟，这已经够了]]></title><description><![CDATA[当你的才华还撑不起你的野心的时候，你就应该静下心来学习!当你的能力还驾驭不了你的目标的时候，你就应该沉下心来历练!“宁拙勿巧”、“宁朴勿华”！打你不知道你的时候你还是你，一旦你知道了你，那么你就不是你了！]]></description><link>https://blog.csdn.net/chehec2010</link><language>zh-cn</language><generator>https://blog.csdn.net/</generator><copyright><![CDATA[Copyright &copy; chehec2010]]></copyright><item><title><![CDATA[LangGraph4j实战AIagent]]></title><link>https://blog.csdn.net/chehec2010/article/details/165613724</link><guid>https://blog.csdn.net/chehec2010/article/details/165613724</guid><author>chehec2010</author><pubDate>Wed, 16 Sep 2026 15:21:00 +0800</pubDate><description><![CDATA[我的需求：我的系统有5个表，每个表存着血压、血糖、血脂、尿酸、体温数据，用户可以随意问系统关于血压、血糖、血脂、尿酸、体温数据之间的问题。（列入趋势，变化，生成报告等等）]]></description><category></category></item><item><title><![CDATA[ONNX Runtime]]></title><link>https://blog.csdn.net/chehec2010/article/details/165484368</link><guid>https://blog.csdn.net/chehec2010/article/details/165484368</guid><author>chehec2010</author><pubDate>Tue, 15 Sep 2026 16:52:28 +0800</pubDate><description><![CDATA[ONNX Runtime 是 ONNX 模型的官方级高性能推理引擎。你训练模型时用什么框架都行，只要导出成 ONNX，就可以用 ONNX Runtime 在 Java、Python、C++ 等环境中加载执行。它不负责训练，只负责把模型跑起来，并且尽量跑得快、跑得跨平台。补充：什么是边缘设备？]]></description><category></category></item><item><title><![CDATA[YOLOv8 双模型安防监控系统（含事件统计）]]></title><link>https://blog.csdn.net/chehec2010/article/details/165336605</link><guid>https://blog.csdn.net/chehec2010/article/details/165336605</guid><author>chehec2010</author><pubDate>Mon, 14 Sep 2026 17:37:09 +0800</pubDate><description><![CDATA[用 Fight-Violence-detection 数据集（把 Violence 类重命名为 fight，NonViolence 不标）已内置 Windows / Linux / macOS 的本地库，无需单独安装。，代码中已用 try-with-resources 确保释放。（intrusion、fight、abandoned_*）：同一位置网格内，可直接从 COCO 数据集提取，或用任何包含行人的监控数据集。限制堆内存，ONNX Runtime 用的是本地内存。做离散化，避免同一目标反复触发。]]></description><category></category></item><item><title><![CDATA[哨兵系统设计]]></title><link>https://blog.csdn.net/chehec2010/article/details/165326788</link><guid>https://blog.csdn.net/chehec2010/article/details/165326788</guid><author>chehec2010</author><pubDate>Mon, 14 Sep 2026 16:40:38 +0800</pubDate><description><![CDATA[边缘盒收到信号，先做初步判断：频率特征不像风、不像动物，更像有人触碰铁丝网。：Java 17 + Spring Boot 3 / Spring Cloud，或 Go + Gin。：ZLMediaKit / SRS，支持 RTSP 转 WebRTC/HLS/FLV。：即使此时断网，边缘盒依然完成了告警、录像、抓拍、本地存储。目标离开探测区，边缘盒结束事件，上传完整视频片段和轨迹。事件结束后，云端生成火灾报告，统计当月火灾次数、总时长、平均置信度。雷达探测到“低慢小”目标，速度 15 m/s，高度 50 米。]]></description><category></category></item><item><title><![CDATA[逻辑回归与线性回归的本质]]></title><link>https://blog.csdn.net/chehec2010/article/details/164866517</link><guid>https://blog.csdn.net/chehec2010/article/details/164866517</guid><author>chehec2010</author><pubDate>Thu, 10 Sep 2026 17:56:54 +0800</pubDate><description><![CDATA[先记录一个概念：什么是超平面？就是把空间一分为二的一个平面，一维空间超平面是一个点，二维空间超平面是一条线，三维空间超平面是一个面，四维空间超平面就是一个三维。。。。。。总之，n维空间的超平面就是n-1维的面。]]></description><category></category></item><item><title><![CDATA[bert的架构解析]]></title><link>https://blog.csdn.net/chehec2010/article/details/164750258</link><guid>https://blog.csdn.net/chehec2010/article/details/164750258</guid><author>chehec2010</author><pubDate>Wed, 09 Sep 2026 17:39:35 +0800</pubDate><description><![CDATA[任务输入用的向量数学操作输出形式文本分类取[CLS]的 2维向量一次线性变换 + Softmax每个类别的概率（如好评61%）命名实体识别每个词的 2维向量（独立算）每个位置独立做线性变换 + Softmax每个词对应各类别的概率抽取式问答段落中每个词的 2维向量两组线性变换（起点/终点） + Softmax，再组合最优起止位置组成的答案片段微调bert，微调就是在预训练好的顶部，接几层我们上面手算的这种“乘加（矩阵乘法）”运算。]]></description><category></category></item><item><title><![CDATA[深入sigmod和relu]]></title><link>https://blog.csdn.net/chehec2010/article/details/164747136</link><guid>https://blog.csdn.net/chehec2010/article/details/164747136</guid><author>chehec2010</author><pubDate>Wed, 09 Sep 2026 17:22:24 +0800</pubDate><description><![CDATA[正因为 Sigmoid 梯度极小且非稀疏，它在深层网络中不适合作为隐藏层的激活函数（会梯度消失），但它输出范围在 (0,1)(0,1)，完美对应概率，所以最适合作为二分类输出层的激活函数而 ReLU 梯度恒定 1、计算快，是隐藏层（尤其是深层卷积网络）的绝对主流选择，只是需要注意设置较小的学习率以防止“神经元坏死”。隐藏层优先用 ReLU（或其变体 LeakyReLU），输出层做二分类用 Sigmoid。]]></description><category></category></item><item><title><![CDATA[图像自编码器dVAE]]></title><link>https://blog.csdn.net/chehec2010/article/details/164622365</link><guid>https://blog.csdn.net/chehec2010/article/details/164622365</guid><author>chehec2010</author><pubDate>Tue, 08 Sep 2026 17:22:16 +0800</pubDate><description><![CDATA[这种转化不仅大幅压缩了数据，更重要的是，它让擅长处理离散序列（如文本）的Transformer模型也能理解和生成图像，从而为多模态AI的发展铺平了道路。（如PixelCNN或Transformer）来学习这些编码的分布，从而生成新的编码，最后由VQ-VAE的解码器将其解码为图像。它像一位“翻译官”，把机器难以直接理解的“像素语言”，翻译成了 Transformer 这类模型擅长的“离散符号语言”。：系统不仅要把图像变成“单词”（编码），还要能把这些“单词”重新组合，还原成一幅图像（解码）。]]></description><category></category></item><item><title><![CDATA[transformer掩码注意力机制和交叉注意力机制]]></title><link>https://blog.csdn.net/chehec2010/article/details/164451396</link><guid>https://blog.csdn.net/chehec2010/article/details/164451396</guid><author>chehec2010</author><pubDate>Mon, 07 Sep 2026 16:34:01 +0800</pubDate><description><![CDATA[现在我们有了最终矩阵，但我们只关心最后一个词（I的那一行向量（也就是矩阵的第1行）。线性层（Linear）：把这个2维向量乘以一个巨大的权重矩阵，映射到整个英文词典的大小（比如5万个词），得到5万个分数（Logits）。Softmax：把这5万个分数变成概率（加起来等于1）。选取结果：模型发现“love”这个词的概率最高（比如0.95），于是输出单词love。]]></description><category></category></item><item><title><![CDATA[transformer的解码器部分]]></title><link>https://blog.csdn.net/chehec2010/article/details/164334542</link><guid>https://blog.csdn.net/chehec2010/article/details/164334542</guid><author>chehec2010</author><pubDate>Fri, 04 Sep 2026 17:47:33 +0800</pubDate><description><![CDATA[一篇几千字的新闻报道。]]></description><category></category></item><item><title><![CDATA[transformer编码器部分流程]]></title><link>https://blog.csdn.net/chehec2010/article/details/164334244</link><guid>https://blog.csdn.net/chehec2010/article/details/164334244</guid><author>chehec2010</author><pubDate>Thu, 03 Sep 2026 15:42:38 +0800</pubDate><description><![CDATA[步骤 2：自注意力（Q、K、V 计算、得分、Softmax、加权求和、拼接）。这就是transformer编码器部分！步骤 3：Add & Norm（层归一化）。步骤 5：Add & Norm（层归一化）。步骤 1：嵌入 + 位置编码（简化）。，手算会算到天荒地老。步骤 4：前馈网络（FFN）。（真实是12层，过程完全重复）：“我 爱 苹果”（3个词）真实BERT的向量维度是。]]></description><category></category></item><item><title><![CDATA[transformer详细记录]]></title><link>https://blog.csdn.net/chehec2010/article/details/164288699</link><guid>https://blog.csdn.net/chehec2010/article/details/164288699</guid><author>chehec2010</author><pubDate>Wed, 02 Sep 2026 17:58:45 +0800</pubDate><description><![CDATA[解码器每生成一个英文词，都会拿着当前的“问题（Q）”去编码器储存的“记忆（K、V）”里翻找对应的中文片段，从而保证翻译的准确性。查询（Q）来自解码器上一层的输出，键（K）和值（V）来自编码器的最终输出（即源序列特征）。（如ReLU、Sigmoid）。具体到“我”这个词：它会生成 Q（查询），去匹配“叫”、“惠”、“涛”的 K（键）。经过加权求和，“我”的新向量不再只代表自己，而是融合了“叫”和“惠涛”的信息，表示。“我”对“惠”和“涛”也有权重，但“惠”和“涛”之间的权重最高（因为是完整人名）。]]></description><category></category></item><item><title><![CDATA[层归一化（Layer Normalization，简称 LN）和批归一化（Batch Norm）流程]]></title><link>https://blog.csdn.net/chehec2010/article/details/164301603</link><guid>https://blog.csdn.net/chehec2010/article/details/164301603</guid><author>chehec2010</author><pubDate>Wed, 02 Sep 2026 17:31:56 +0800</pubDate><description><![CDATA[对比维度求均值方向竖着求：对Batch中所有样本的同一个特征求平均横着求：对同一条样本的所有特征求平均手算例子对 [2.0, 1.0, 0.0] 求均值得 1.0对 [2.0, -1.0, 3.0, 0.0] 求均值得 1.0依赖Batch大小强依赖。Batch越小，估算的均值和方差越不准不依赖。每条样本独立计算训练/推理是否一致不一致。推理时必须使用预先存好的全局滑动平均值一致。推理时实时计算当前样本的均值和方差适用场景计算机视觉（CV），且Batch较大（如32以上）]]></description><category></category></item><item><title><![CDATA[残差网络的详细流程梳理]]></title><link>https://blog.csdn.net/chehec2010/article/details/164300468</link><guid>https://blog.csdn.net/chehec2010/article/details/164300468</guid><author>chehec2010</author><pubDate>Wed, 02 Sep 2026 16:47:07 +0800</pubDate><description><![CDATA[我们假设这个残差块的结构是：]]></description><category></category></item><item><title><![CDATA[ArcFace的使用]]></title><link>https://blog.csdn.net/chehec2010/article/details/164263525</link><guid>https://blog.csdn.net/chehec2010/article/details/164263525</guid><author>chehec2010</author><pubDate>Tue, 01 Sep 2026 16:58:47 +0800</pubDate><description><![CDATA[arcFace的使用场景：ArcFace的核心是一个强大的，它能够将任何输入的人脸图像，转化为一个具有强区分度的特征向量（Embedding）。基于这个特性，它的应用早已超越了“人脸识别”本身，延伸到了许多需要“区分不同个体”或“识别细微差异”的领域。]]></description><category></category></item><item><title><![CDATA[从Stylegan2到StyleGAN-V]]></title><link>https://blog.csdn.net/chehec2010/article/details/164262612</link><guid>https://blog.csdn.net/chehec2010/article/details/164262612</guid><author>chehec2010</author><pubDate>Tue, 01 Sep 2026 16:26:26 +0800</pubDate><description><![CDATA[方案核心思想优点缺点TGAN双生成器：先规划轨迹，再生成帧结构清晰，易于理解生成质量相对有限StyleGAN-V连续运动表示 + 整体判别器质量极高，可生成任意长视频实现复杂，训练成本高+ 光流损失直接约束像素运动轨迹最有效地消除闪烁，保证动作连贯需要额外的光流计算模型进阶建议使用RAFT：将中的简化光流替换为预训练的RAFT模型，效果会有质的飞跃。引入身份损失：结合ArcFace等模型，在训练时加入身份一致性损失，进一步确保“同一个人”的身份保持。]]></description><category></category></item><item><title><![CDATA[SAGAN升级为StyleGAN2（看效果）]]></title><link>https://blog.csdn.net/chehec2010/article/details/164262212</link><guid>https://blog.csdn.net/chehec2010/article/details/164262212</guid><author>chehec2010</author><pubDate>Tue, 01 Sep 2026 16:04:35 +0800</pubDate><description><![CDATA[需求1：输入随机噪声z和年龄，输出随机身份的人脸。需求2：输入自己的照片，然后控制年龄从小到老的变化。StyleGAN2完全可以控制身份，而且这是它最核心的优势之一。通过其独特的映射网络（Mapping Network） 和解耦的中间隐空间（W空间），StyleGAN2实现了对生成图像高层属性（包括身份、年龄、姿态、表情等）的独立控制。本demo使用CIFAR-10数据集模拟年龄（将10个类别视为从0到9岁的离散年龄，并归一化为连续值）。]]></description><category></category></item><item><title><![CDATA[可以做年龄编辑的gan对抗网络（SAGAN）]]></title><link>https://blog.csdn.net/chehec2010/article/details/164260921</link><guid>https://blog.csdn.net/chehec2010/article/details/164260921</guid><author>chehec2010</author><pubDate>Tue, 01 Sep 2026 15:20:28 +0800</pubDate><description><![CDATA[把这 10 张（或更多年龄段）图片按顺序拼接，用 OpenCV 或 FFmpeg 导出为 MP4，就能看到“一个人”的年龄变化过程。：模型只学了 10 个离散年龄段（0~9），直接切换标签会导致五官突然“跳变”，无法生成 18岁→18.5岁 这种细腻变化。如果连续年龄回归，会更加的丝滑，接下来我们将修改一版连续年龄回归的代码，还是在这个的基础之上进行！，比如用预训练的 ArcFace 提取人脸特征，约束不同年龄帧的特征向量尽量接近。，会生成固定噪声下不同年龄的人脸图片，实现“编辑年龄”的效果。]]></description><category></category></item><item><title><![CDATA[BLIP2的Q-Former原理介绍]]></title><link>https://blog.csdn.net/chehec2010/article/details/164253023</link><guid>https://blog.csdn.net/chehec2010/article/details/164253023</guid><author>chehec2010</author><pubDate>Tue, 01 Sep 2026 15:07:38 +0800</pubDate><description><![CDATA[Q-Former的输出会通过一个全连接层，投影到与LLM文本嵌入相同的维度，作为“软视觉提示”输入给LLM。它需要将图像编码器生成的高维特征（如257×1024），通过32个查询向量“蒸馏”压缩成低维的固定表示（32×768）。整个过程，只有Q-Former的参数被训练，而庞大的图像编码器和LLM始终保持冻结，从而实现了高效的多模态理解。（参数不参与训练）的预训练图像编码器和大型语言模型（LLM）之间搭建一座桥梁，实现跨模态的信息对齐与交互。：Q-Former的輸出被转换成LLM能理解的“软提示”。]]></description><category></category></item><item><title><![CDATA[BLIP的基本原理]]></title><link>https://blog.csdn.net/chehec2010/article/details/164250996</link><guid>https://blog.csdn.net/chehec2010/article/details/164250996</guid><author>chehec2010</author><pubDate>Tue, 01 Sep 2026 09:48:02 +0800</pubDate><description><![CDATA[BLIP实现“统一”的关键，在于其提出的架构。它的核心思想是。]]></description><category></category></item></channel></rss>