<?xml version="1.0" encoding="utf-8" ?><rss version="2.0"><channel><title><![CDATA[hellozhxy的博客]]></title><description><![CDATA[]]></description><link>https://blog.csdn.net/hellozhxy</link><language>zh-cn</language><generator>https://blog.csdn.net/</generator><copyright><![CDATA[Copyright &copy; hellozhxy]]></copyright><item><title><![CDATA[RAG的问题]]></title><link>https://blog.csdn.net/hellozhxy/article/details/158803967</link><guid>https://blog.csdn.net/hellozhxy/article/details/158803967</guid><author>hellozhxy</author><pubDate>Sun, 08 Mar 2026 10:42:45 +0800</pubDate><description><![CDATA[可以简单理解为：RAG = 检索问题 + LLM问题类别问题检索recall不准结构chunk切分推理多文档推理弱生成幻觉系统latency高维护知识更新💡业界目前的改进方向常见升级方案：1️⃣例如2️⃣Rerank模型例如：3️⃣多轮检索：query→ search4️⃣Graph RAG知识图谱增强例如：Neo4j✅一句话总结RAG解决了“模型不知道知识”的问题，但没有解决“检索、推理、结构理解”的问题。]]></description><category></category></item><item><title><![CDATA[国产 AI 框架 EasyAI：让 Java 程序员用 Java 的方式做 AI]]></title><link>https://blog.csdn.net/hellozhxy/article/details/157260142</link><guid>https://blog.csdn.net/hellozhxy/article/details/157260142</guid><author>hellozhxy</author><pubDate>Thu, 22 Jan 2026 19:24:28 +0800</pubDate><description><![CDATA[不少 Java 小伙伴私下跟我吐槽：现在 AI 这么火，咱们写 Java 的是不是注定只能在旁边看戏？说实话，以前确实挺憋屈的。主流 AI 框架全是 Python 的天下（TensorFlow、PyTorch 等），咱们想入个门，不仅要跨过语言鸿沟，还得去趟 CUDA、cuDNN 这种“环境配置地狱”。配环境的时间比写代码还长，这种生态割裂感真的让人头大 。EasyAI 的出现正是为了打破这一僵局。它是一个由 Dromara 开源社区维护的纯 Java 实现的人工智能框架，主打零依赖、开箱即用，旨在让 Ja]]></description><category></category></item><item><title><![CDATA[多模态RAG]]></title><link>https://blog.csdn.net/hellozhxy/article/details/157176831</link><guid>https://blog.csdn.net/hellozhxy/article/details/157176831</guid><author>hellozhxy</author><pubDate>Tue, 20 Jan 2026 14:37:39 +0800</pubDate><description><![CDATA[词频（TF）：关键词在文档中出现的次数越多，相关性越高逆文档频率（IDF）：在越少文档中出现的词，区分度越高文档长度归一化：避免长文档获得不公平的优势支持同时查询文本和图像Collection支持配置不同的检索参数支持结果的合并与去重与LlamaIndex的Retriever接口兼容多模态RAG技术正在快速发展，从最初的CLIP双编码器到如今的Agentic RAG，技术方案越来越丰富，能力也越来越强大。]]></description><category></category></item><item><title><![CDATA[一文详解AI大模型14个核心基础概念：Transformer、Token、MoE、RAG、Embedding、对齐、预训练、微调、Agent、MCP]]></title><link>https://blog.csdn.net/hellozhxy/article/details/157131757</link><guid>https://blog.csdn.net/hellozhxy/article/details/157131757</guid><author>hellozhxy</author><pubDate>Mon, 19 Jan 2026 11:21:01 +0800</pubDate><description><![CDATA[本文系统性地梳理了构成现代AI大模型技术栈的一系列核心基础概念。从奠定基础的Transformer架构，到数据处理的Token与Embedding；从模型生命周期的预训练与微调，到追求效率与容量的MoE；从突破知识边界的RAG，到迈向通用智能的Agent；再到确保AI有益于人类的提示工程与对齐，以及必须正视的幻觉挑战。这些概念相互关联、层层递进，共同描绘了当前大模型技术发展的全景图。理解这些基础概念，不仅是深入研究和应用大模型的必要前提，也是我们思考人工智能未来发展方向、机遇与挑战的重要基石。]]></description><category></category></item><item><title><![CDATA[多模态大模型中的Cross-attention]]></title><link>https://blog.csdn.net/hellozhxy/article/details/157131736</link><guid>https://blog.csdn.net/hellozhxy/article/details/157131736</guid><author>hellozhxy</author><pubDate>Mon, 19 Jan 2026 11:20:13 +0800</pubDate><description><![CDATA[Q-Former的设计体现了多模态大模型中的几个核心原则模态解耦：冻结单模态编码器，专注于跨模态对齐信息瓶颈：通过查询向量自适应压缩视觉信息多任务学习：ITC+ITM+ITG确保多层次对齐数学优雅性：Cross-Attention的简洁公式蕴含强大的表达能力数学基础：准确表述Cross-Attention公式几何直觉：流形、投影、压缩等概念工程思维：计算复杂度、训练成本、实际部署前沿视野：局限性和改进方向最后一句话"Q-Former不仅是一个技术模块，更是多模态学习中的设计哲学。]]></description><category></category></item><item><title><![CDATA[多种注意力机制详解]]></title><link>https://blog.csdn.net/hellozhxy/article/details/157131262</link><guid>https://blog.csdn.net/hellozhxy/article/details/157131262</guid><author>hellozhxy</author><pubDate>Mon, 19 Jan 2026 11:02:55 +0800</pubDate><description><![CDATA[通俗解释：注意力机制源自人类处理信息的方式。由于外界信息量庞大且复杂，远远超过人脑的处理能力，因此人在处理信息时会优先关注重要的部分，而忽略无关的信息。看人 --> 看脸 ：当我们观察一个人时，通常会优先关注脸部特征。看车 --> 看车标 ：看到一辆车时，车标往往是吸引我们注意力的关键。看段落 --> 看开头 ：段落的开头通常是总结或引入重点的部分。这种“选择性关注”的方式被称为注意力机制。机器视角：对于没有情感的机器来说，注意力机制可以理解为一种“赋权”操作。]]></description><category></category></item><item><title><![CDATA[再读VIT细节]]></title><link>https://blog.csdn.net/hellozhxy/article/details/157130024</link><guid>https://blog.csdn.net/hellozhxy/article/details/157130024</guid><author>hellozhxy</author><pubDate>Mon, 19 Jan 2026 10:18:55 +0800</pubDate><description><![CDATA[到此为止，关于VIT模型，我们就介绍完毕了。如果训练数据量不够多的话，看起来VIT也没比CNN好多少呀，VIT的意义是什么呢？这是个很好的问题，因为在工业界，人们的标注数据量和算力都是有限的，因此CNN可能还是首要选择。证明了一个统一框架在不同模态任务上的表现能力。在VIT之前，NLP的SOTA范式被认为是Transformer，而图像的SOTA范式依然是CNN。VIT出现后，证明了用NLP领域的SOTA模型一样能解图像领域的问题，同时在论文中通过丰富的实验，证明了VIT对CNN的替代能力。]]></description><category></category></item><item><title><![CDATA[深度学习基础]]></title><link>https://blog.csdn.net/hellozhxy/article/details/157129599</link><guid>https://blog.csdn.net/hellozhxy/article/details/157129599</guid><author>hellozhxy</author><pubDate>Mon, 19 Jan 2026 10:02:23 +0800</pubDate><description><![CDATA[（4）常用的优化器包括。]]></description><category></category></item><item><title><![CDATA[字节 AI Infra 剪映面经（实习）]]></title><link>https://blog.csdn.net/hellozhxy/article/details/157096539</link><guid>https://blog.csdn.net/hellozhxy/article/details/157096539</guid><author>hellozhxy</author><pubDate>Sun, 18 Jan 2026 12:42:51 +0800</pubDate><description><![CDATA[见的我这种菜鸡太多了？layernorm为什么这么实现（我写错了啊啊啊，忘了写scale and shift光normalize了，当时还没反应过来还狡辩了一会，面试官也没再追问就是）？什么时候用自旋锁，什么时候用非自旋锁（频繁加锁的用自旋锁，不然用非自旋锁，因为要比较系统调用和用户态空转的代价）？你中间用了einsum，介绍一下einsum，为什么你要用einsum（方便好用，所有人都应该用einsum）？什么是attention层，QKV分别是什么，为什么这么计算，为什么要除以根号d，不除可不可以？]]></description><category></category></item><item><title><![CDATA[Layernorm 原理解析]]></title><link>https://blog.csdn.net/hellozhxy/article/details/144739601</link><guid>https://blog.csdn.net/hellozhxy/article/details/144739601</guid><author>hellozhxy</author><pubDate>Thu, 26 Dec 2024 11:48:20 +0800</pubDate><description><![CDATA[这一篇文章主要讲讲 Layer Normalization。在本文里，Layer Normalization 统一都被称为 layernorm。字面意思就是层归一化，也属于数据分布归一化的一种。在里，把数据分布都做一个归一化，好处多多，可以使训练更充分，更快速，可以克服Internal Covariate Shift 问题。这个问题是需要单独摊开来讲的。这一节主要是讲一下 layernorm 是如何实施的，以及其本质。]]></description><category></category></item><item><title><![CDATA[将卷积引入transformer中VcT(Introducing Convolutions to Vision Transformers)的pytorch代码详解]]></title><link>https://blog.csdn.net/hellozhxy/article/details/141527920</link><guid>https://blog.csdn.net/hellozhxy/article/details/141527920</guid><author>hellozhxy</author><pubDate>Sun, 25 Aug 2024 12:32:09 +0800</pubDate><description><![CDATA[最开始的ViT是最先将tansformer应用在分类任务上，并取得了不错的结果，但是它的问题在于需要先在大数据集上（1000万的私有数据）先进行预训练，才能在下游的中小数据集取得不错的结果，如果在同等规模的小数据集上进行训练，实际上ViT的性能是比不上的经典的卷积神经网络（Resnet,VGG等的）。卷积的目的在于保证每个阶段都能减小特征图的尺寸，增加特征图通道数，相应的将其reshape成token后，token的数量也会减少，但是token的维度会增加。而DeiT若不使用位置编码则会掉点。]]></description><category></category></item><item><title><![CDATA[CvT:将卷积引入视觉Transformer]]></title><link>https://blog.csdn.net/hellozhxy/article/details/141527777</link><guid>https://blog.csdn.net/hellozhxy/article/details/141527777</guid><author>hellozhxy</author><pubDate>Sun, 25 Aug 2024 12:17:03 +0800</pubDate><description><![CDATA[在本文中介绍了一种称为卷积视觉Transformer（CvT）的新体系结构，该体系结构通过将卷积引入ViT中来产生两种设计结合的最佳效果，从而提高了视觉Transformer（ViT）的性能和效率。包含卷积Token嵌入的Transformer层次结构，以及利用卷积映射的卷积Transformer Block。这些变化将卷积神经网络（CNN）的特性引入到ViT架构中（即平移、缩放和旋转不变性），同时保持了Transformers的优点（即动态注意力，全局Context和更好的泛化）。]]></description><category></category></item><item><title><![CDATA[FcaNet论文解读，用频谱信息计算通道注意力]]></title><link>https://blog.csdn.net/hellozhxy/article/details/141262765</link><guid>https://blog.csdn.net/hellozhxy/article/details/141262765</guid><author>hellozhxy</author><pubDate>Fri, 16 Aug 2024 16:14:19 +0800</pubDate><description><![CDATA[注意力机制有很多种方法，空间注意力，通道注意力，自注意力等，这里我们讨论的是通道注意力。通道注意力非常简单，直接学习出对应的每个通道的权值就可以，所以非常的好用。一般来说，在计算通道注意力的时候，每个通道的会需要有个标量值来计算后面的注意力权重，这个标量的计算函数一般都是使用Global Average Pooling。但是，GAP并不是那么的完美，简单的去均值的方法会丢弃很多的信息，无法充分的获取每个通道的多样性的信息。那么，除了使用全局的平均值来计算通道注意力之外，还有其他的方法吗？后面会详细说明。]]></description><category></category></item><item><title><![CDATA[QFormer：四边形注意力的视觉Transformer]]></title><link>https://blog.csdn.net/hellozhxy/article/details/141231653</link><guid>https://blog.csdn.net/hellozhxy/article/details/141231653</guid><author>hellozhxy</author><pubDate>Thu, 15 Aug 2024 20:58:27 +0800</pubDate><description><![CDATA[然而，手工制作的窗口的设计与数据无关，限制了Transformer适应不同大小、形状和方向的对象的灵活性。本文提出一种新颖的四边形注意力(QA)方法，进而提出QFormer：一种视觉新主干，仅需少量代码修改和忽略不计的额外成本，在分类/检测/分割/姿态估计等视觉任务上性能表现出色！我们的方法采用端到端可学习四边形回归模块，该模块预测转换矩阵，将默认窗口转换为目标四边形以进行标记采样和注意力计算，使网络能够对具有不同形状和方向的各种目标进行建模并捕获丰富的上下文信息。]]></description><category></category></item><item><title><![CDATA[详解数仓分层设计架构 ODS-DWD-DWS-ADS]]></title><link>https://blog.csdn.net/hellozhxy/article/details/141065771</link><guid>https://blog.csdn.net/hellozhxy/article/details/141065771</guid><author>hellozhxy</author><pubDate>Fri, 09 Aug 2024 16:39:42 +0800</pubDate><description><![CDATA[这样对于不同层次的数据操作，创建不同层次的任务，可以放到不同层次的任务流中进行执行（大公司一个集群通常每天的定时任务有几千个等待执行，甚至上万个，所以划分不同层次的任务流，不同层次的任务放到对应的任务流中进行执行，会更加方便管理和维护）。每周的订单次数作为一行，粒度为每周。明细表用于存储ODS层原始表转换过来的明细数据，DWD 层的数据应该是一致的、准确的、干净的数据，即对源系统数据ODS层数据进行清洗（去除空值，脏数据，超过极限范围的数据，行式存储改为列存储，改压缩格式）、规范化、维度退化、脱敏等操作。]]></description><category></category></item><item><title><![CDATA[Python轴承故障诊断：连续小波变换CWT]]></title><link>https://blog.csdn.net/hellozhxy/article/details/139702413</link><guid>https://blog.csdn.net/hellozhxy/article/details/139702413</guid><author>hellozhxy</author><pubDate>Sat, 15 Jun 2024 14:44:30 +0800</pubDate><description><![CDATA[连续小波变换（Continuous Wavelet Transform，CWT）是一种用于在时域和频域上同时分析信号的方法，它通过使用不同尺度和位置的小波函数对信号进行变换，以获取信号的局部特性。本实验以某轴承故障诊断论文推荐'cgau8'小波，以及'morl'小波、'cmor1-1'小波、'cmor1.5-2'小波为实验做对比，尺度先设定为128，来对比不同小波函数的影响。小波函数（wavelet）的选择也连续小波变换中的一个重要参数，它决定了小波基函数的形状，不同的小波函数适用于不同类型的信号和应用。]]></description><category></category></item><item><title><![CDATA[非独立同分布数据]]></title><link>https://blog.csdn.net/hellozhxy/article/details/139365760</link><guid>https://blog.csdn.net/hellozhxy/article/details/139365760</guid><author>hellozhxy</author><pubDate>Sat, 01 Jun 2024 09:18:01 +0800</pubDate><description><![CDATA[虽然FedAVG的作者声称他的方法可以在一定程度上处理非独立同分布数据，但是大量的研究表明，在非独同的数据上，FL的精度下降是不可避免的。性能下降的主要原因是由于非iid导致局部模型的权值偏离。即由于局部数据分布的异质性，具有相同初始参数的局部模型会收敛到不同的模型。在FL过程中，通过对上传的局部模型进行平均得到的共享全局模型与理想模型(本地设备上的数据为IID时得到的模型)之间的分歧不断增大，导致收敛速度减慢，学习性能恶化。]]></description><category></category></item><item><title><![CDATA[结合加性个性化的联邦推荐]]></title><link>https://blog.csdn.net/hellozhxy/article/details/139263019</link><guid>https://blog.csdn.net/hellozhxy/article/details/139263019</guid><author>hellozhxy</author><pubDate>Tue, 28 May 2024 11:59:29 +0800</pubDate><description><![CDATA[推荐系统已经成为分配用户可能感兴趣的新项目的重要工具和产品，并且深刻地改变了日常生活。这些系统通常依赖中央服务器来聚合用户数据、数字活动和偏好，以便训练模型做出准确的推荐。然而，将通常包含敏感隐私信息的用户数据上传到服务器可能会使他们面临重大的隐私和安全风险。此外，最近部分关于隐私保护的法规（如GDPR）要求用户数据存储在其设备本地，而不是上传到服务器。]]></description><category></category></item><item><title><![CDATA[本地学习问题：重新思考联邦学习中的数据异质性]]></title><link>https://blog.csdn.net/hellozhxy/article/details/139262669</link><guid>https://blog.csdn.net/hellozhxy/article/details/139262669</guid><author>hellozhxy</author><pubDate>Tue, 28 May 2024 11:47:36 +0800</pubDate><description><![CDATA[联邦学习(FL)[17]使大量客户能够在不损害数据隐私的情况下对机器学习模型进行协作训练。在FL设置中，参与的客户机通常部署在各种环境中，或者由一组不同的用户拥有。因此，每个客户机本地数据的分布可能会有很大差异(即数据异构性)。因为客户端训练发生在它们自己的数据上，所以它们趋向于各自的局部最小值。然而，这个局部收敛点可能与全局模型的目标(即，通过中央服务器的聚合学习模型)不太一致。因此，客户端模型经常偏离理想的全局优化点，过度拟合其局部目标。当这种客户端漂移发生时，会阻碍中心聚合模型的性能[9,14]。]]></description><category></category></item><item><title><![CDATA[FedMoE: Data-Level Personalization with Mixture of Experts for Model-Heterogeneous Personalized Fede]]></title><link>https://blog.csdn.net/hellozhxy/article/details/139141412</link><guid>https://blog.csdn.net/hellozhxy/article/details/139141412</guid><author>hellozhxy</author><pubDate>Thu, 23 May 2024 10:43:02 +0800</pubDate><description><![CDATA[作者：青蝇吊客链接：https://www.zhihu.com/question/497705225/answer/3452046960来源：知乎著作权归作者所有。商业转载请联系作者获得授权，非商业转载请注明出处。联邦学习框架下的MoE（上）——FedMoE论文标题是《》，作者是Liping Yi, Han Yu, Chao Ren, Heng Zhang, Gang Wang, Xiaoguang Liu, 和 Xiaoxiao Li。]]></description><category></category></item></channel></rss>