<?xml version="1.0" encoding="utf-8" ?><rss version="2.0"><channel><title><![CDATA[qingjing0413的博客]]></title><description><![CDATA[]]></description><link>https://blog.csdn.net/qingjing0413</link><language>zh-cn</language><generator>https://blog.csdn.net/</generator><copyright><![CDATA[Copyright &copy; qingjing0413]]></copyright><item><title><![CDATA[MM-LLMs: Recent Advances in MultiModal Large Language Models论文解读]]></title><link>https://blog.csdn.net/qingjing0413/article/details/145736661</link><guid>https://blog.csdn.net/qingjing0413/article/details/145736661</guid><author>qingjing0413</author><pubDate>Wed, 19 Feb 2025 19:04:44 +0800</pubDate><description><![CDATA[本文综述了近年来多模态大语言模型（MM-LLMs）的发展情况，并介绍了成本效益高的训练策略。这些模型不仅保留了传统大语言模型的推理和决策能力，还能够支持多种多模态任务。作者首先概述了模型架构和训练流程的设计方案，然后对126个具有不同设计方案的MM-LLMs进行了分类总结，并分析了它们在主流基准测试中的表现。此外，文章还提供了增强MM-LLMs效果的关键训练技巧，并探讨了MM-LLMs未来的研究方向。该综述旨在促进MM-LLMs领域的进一步发展。论文方法。]]></description><category></category></item><item><title><![CDATA[AI进展小结20250214]]></title><link>https://blog.csdn.net/qingjing0413/article/details/145638022</link><guid>https://blog.csdn.net/qingjing0413/article/details/145638022</guid><author>qingjing0413</author><pubDate>Fri, 14 Feb 2025 17:34:43 +0800</pubDate><description><![CDATA[智能体分类：角色扮演、教育学习、图像生成、文案创作、职场办公、行业专家、生活助手、趣味休闲、其他。2 交互方式：对话；3 功能提供：智能体。]]></description><category></category></item><item><title><![CDATA[新论文流程记录]]></title><link>https://blog.csdn.net/qingjing0413/article/details/145377968</link><guid>https://blog.csdn.net/qingjing0413/article/details/145377968</guid><author>qingjing0413</author><pubDate>Mon, 27 Jan 2025 10:30:13 +0800</pubDate><description><![CDATA[DINO 1.5DINO-XSAMSAM-2。]]></description><category></category></item><item><title><![CDATA[YOLO系列代码]]></title><link>https://blog.csdn.net/qingjing0413/article/details/145209400</link><guid>https://blog.csdn.net/qingjing0413/article/details/145209400</guid><author>qingjing0413</author><pubDate>Fri, 17 Jan 2025 16:10:47 +0800</pubDate><description><![CDATA[Test-Time Augmentation

TTA (Test Time Augmentation)是指在test过程中进行数据增强。
	其思想非常简单，就是在评测阶段，给每个输入进行多种数据增广变换，将一个输入变成多个输入，然后再merge起来一起输出，形成一种ensemble的效果，可以用来提点。
	参考：https://zhuanlan.zhihu.com/p/131539596



]]></description><category></category></item><item><title><![CDATA[Deformable Detr回顾]]></title><link>https://blog.csdn.net/qingjing0413/article/details/145200708</link><guid>https://blog.csdn.net/qingjing0413/article/details/145200708</guid><author>qingjing0413</author><pubDate>Fri, 17 Jan 2025 11:33:14 +0800</pubDate><description><![CDATA[为解决DETR attention的计算量大导致收敛速度慢、小目标检测效果差的问题：提出了Deformable Attention，其注意力模块只关注一个query周围的少量关键采样点集，采样点的位置并非固定，而是可学习的（如左图所示，DETR的query要和其他所有的key计算相似度计算量为token的平方， 而Deformable DETR只关注周围少量的key，大大减少了计算量，提高了收敛速度），并采用了多尺度策略提高了小物体的检测性能。]]></description><category></category></item><item><title><![CDATA[Real-Time DEtection TRansformer (RT-DETR)]]></title><link>https://blog.csdn.net/qingjing0413/article/details/145199993</link><guid>https://blog.csdn.net/qingjing0413/article/details/145199993</guid><author>qingjing0413</author><pubDate>Fri, 17 Jan 2025 10:09:32 +0800</pubDate><description><![CDATA[然而，由于分类得分和位置置信度的分布不一致，一些预测框具有高分类得分，但不接近GT框，这导致选择了分类得分高、IoU得分低的框，而分类得分低、IoU分数高的框被丢弃。这会削弱探测器的性能。为了解决这个问题，作者提出了IoU-Aware查询选择，通过约束模型在训练期间为具有高IoU分数的特征产生高分类分数，并为具有低IoU得分的特征产生低分类分数。：每轮选取置信度最大的 Bounding Box ，接着关注所有剩下的 BBox 中与选取的 BBox 有着高重叠（IoU）的，它们将在这一轮被抑制。]]></description><category></category></item><item><title><![CDATA[SWIN模型回顾]]></title><link>https://blog.csdn.net/qingjing0413/article/details/145190213</link><guid>https://blog.csdn.net/qingjing0413/article/details/145190213</guid><author>qingjing0413</author><pubDate>Thu, 16 Jan 2025 19:50:24 +0800</pubDate><description><![CDATA[其中Φ(x)表示高斯分布的累积概率分布。公式为：GELU(x)=x∗Φ(x)扩展：swish激活函数。]]></description><category></category></item><item><title><![CDATA[DETRs with Collaborative Hybrid Assignments Training论文阅读与代码]]></title><link>https://blog.csdn.net/qingjing0413/article/details/145182700</link><guid>https://blog.csdn.net/qingjing0413/article/details/145182700</guid><author>qingjing0413</author><pubDate>Thu, 16 Jan 2025 15:50:04 +0800</pubDate><description><![CDATA[在这篇论文中，作者观察到在DETR中将过少的 Query 分配为正样本，采用一对一的集合匹配，会导致对编码器输出的监督稀疏，严重损害编码器的区分特征学习，反之亦然，也会影响解码器中的注意力学习。为了缓解这个问题，作者提出了一种新颖的协同混合分配训练方案，名为Co-DETR，以从多样的标签分配方式中学习更高效、更有效的基于DETR的检测器。这种新的训练方案可以通过训练多个并行辅助 Head ，以一对多的标签分配方式（如ATSS和Faster RCNN）进行监督，轻松增强端到端检测器中编码器的学习能力。]]></description><category></category></item><item><title><![CDATA[ChatGPTs和各类Copilot]]></title><link>https://blog.csdn.net/qingjing0413/article/details/144752280</link><guid>https://blog.csdn.net/qingjing0413/article/details/144752280</guid><author>qingjing0413</author><pubDate>Thu, 26 Dec 2024 20:48:10 +0800</pubDate><description><![CDATA[文心一言：百度出品的 AI 对话产品，定位为智能伙伴，能写文案、想点子，陪聊天、答疑解惑，与。通义千问：由阿里云开发的聊天机器人，能够与人交互、回答问题及协作创作，与钉钉有结合应用。抖音豆包：字节旗下产品，字节在 AI 领域有较大投入和决心，如推出多种相关产品和应用。腾讯混元：相对较为低调，公司文化特点及目前尚未有明确亮点可能是其受到关注较少的原因。需要注意的是，这些 AI 工具的性能和擅长领域可能会随着不断的更新和优化而发生变化。”，可以一口气读完二十万字的小说，还会上网冲浪。]]></description><category></category></item><item><title><![CDATA[Pytorch 并行训练]]></title><link>https://blog.csdn.net/qingjing0413/article/details/144744009</link><guid>https://blog.csdn.net/qingjing0413/article/details/144744009</guid><author>qingjing0413</author><pubDate>Thu, 26 Dec 2024 14:39:20 +0800</pubDate><description><![CDATA[master_addr：master节点的ip地址，也就是0号主机的IP地址，该参数是为了让 其他节点 知道0号节点的位，来将自己训练的参数传送过去处理。-master_port：master节点的port号，在不同的节点上master_addr和master_port的设置是一样的，用来进行通信。LOCAL_RANK：os.environ[“LOCAL_RANK”]每张显卡在自己主机中的序号，从0开始。nnodes：节点的数量，通常一个节点对应一个主机，方便记忆，直接表述为主机。]]></description><category></category></item><item><title><![CDATA[大模型基础知识--关于微调]]></title><link>https://blog.csdn.net/qingjing0413/article/details/144677120</link><guid>https://blog.csdn.net/qingjing0413/article/details/144677120</guid><author>qingjing0413</author><pubDate>Tue, 24 Dec 2024 16:03:50 +0800</pubDate><description><![CDATA[它仅更新模型中的部分参数，显著降低训练时间和成本，适用于计算资源有限的情况。PEFT技术包括Prefix Tuning、Prompt Tuning、Adapter Tuning等多种方法，可根据任务和模型需求灵活选择。：一种利用人类反馈作为奖励信号来训练强化学习模型的方法，旨在提升模型生成文本等内容的质量，使其更符合人类偏好。我们以前常见的如下图的微调方式，是instructGPT的微调过程，其在GPT-3基础上微调。类似，即使用标注过的数据来调整预训练模型的参数，使其更好地适应特定任务或领域。]]></description><category></category></item><item><title><![CDATA[GLIP算法]]></title><link>https://blog.csdn.net/qingjing0413/article/details/144111268</link><guid>https://blog.csdn.net/qingjing0413/article/details/144111268</guid><author>qingjing0413</author><pubDate>Thu, 28 Nov 2024 15:17:10 +0800</pubDate><description><![CDATA[起来，通过实验证明了没有额外提示的grounding任务和detection任务其实是一样的，从而使模型可以学习两者的数据，训练出了更好的grounding模型（也可以说是detection模型）。第二，GLIP采用了一种自学习方法，即通过教师模型标注信息，再让学生模型进行学习，这样不仅可以利用大量信息而无需手工标注，还可以让学生模型学习到大量语义丰富的信息，超越教师模型的表现。总结一下GLIP的贡献：第一，GLIP将grounding任务和detection任务。网路整理，文末见参考。]]></description><category></category></item><item><title><![CDATA[算法思路记录]]></title><link>https://blog.csdn.net/qingjing0413/article/details/141998220</link><guid>https://blog.csdn.net/qingjing0413/article/details/141998220</guid><author>qingjing0413</author><pubDate>Sat, 07 Sep 2024 16:35:02 +0800</pubDate><description><![CDATA[因为python中没有使用push而是使用直接+的方式，天然避免了pop。深度优先的函数入口参数为 当前index 当前状态（多个）不同的方案写的细节：关于push/pop。参考组合总数I、组合总数II等题目。]]></description><category></category></item><item><title><![CDATA[算法问题整理（十）]]></title><link>https://blog.csdn.net/qingjing0413/article/details/141869422</link><guid>https://blog.csdn.net/qingjing0413/article/details/141869422</guid><author>qingjing0413</author><pubDate>Tue, 03 Sep 2024 19:10:46 +0800</pubDate><description><![CDATA[网络资料整理，若侵则删。]]></description><category></category></item><item><title><![CDATA[算法问题整理（九）]]></title><link>https://blog.csdn.net/qingjing0413/article/details/141333922</link><guid>https://blog.csdn.net/qingjing0413/article/details/141333922</guid><author>qingjing0413</author><pubDate>Mon, 19 Aug 2024 20:33:24 +0800</pubDate><description><![CDATA[（若侵则删）]]></description><category></category></item><item><title><![CDATA[算法问题整理（八）]]></title><link>https://blog.csdn.net/qingjing0413/article/details/141323785</link><guid>https://blog.csdn.net/qingjing0413/article/details/141323785</guid><author>qingjing0413</author><pubDate>Mon, 19 Aug 2024 14:00:48 +0800</pubDate><description><![CDATA[（若侵则删）]]></description><category></category></item><item><title><![CDATA[算法问题整理（七）]]></title><link>https://blog.csdn.net/qingjing0413/article/details/141269205</link><guid>https://blog.csdn.net/qingjing0413/article/details/141269205</guid><author>qingjing0413</author><pubDate>Fri, 16 Aug 2024 20:36:32 +0800</pubDate><description><![CDATA[参考：]]></description><category></category></item><item><title><![CDATA[算法问题整理（六）]]></title><link>https://blog.csdn.net/qingjing0413/article/details/141268755</link><guid>https://blog.csdn.net/qingjing0413/article/details/141268755</guid><author>qingjing0413</author><pubDate>Fri, 16 Aug 2024 20:15:16 +0800</pubDate><description><![CDATA[网络资料整理个人学习，感谢各位大神！（若侵则删）]]></description><category></category></item><item><title><![CDATA[算法问题整理（五）]]></title><link>https://blog.csdn.net/qingjing0413/article/details/140905442</link><guid>https://blog.csdn.net/qingjing0413/article/details/140905442</guid><author>qingjing0413</author><pubDate>Sun, 04 Aug 2024 13:51:31 +0800</pubDate><description><![CDATA[（若侵则删）机器学习，参考。]]></description><category></category></item><item><title><![CDATA[算法问题整理（四）]]></title><link>https://blog.csdn.net/qingjing0413/article/details/140859227</link><guid>https://blog.csdn.net/qingjing0413/article/details/140859227</guid><author>qingjing0413</author><pubDate>Thu, 01 Aug 2024 23:54:21 +0800</pubDate><description><![CDATA[外推性是指大模型在训练时和预测时的输入长度不一致，导致模型的泛化能力下降的问题。例如，如果一个模型在训练时只使用了512个 token 的文本，那么在预测时如果输入超过512个 token，模型可能无法正确处理。这就限制了大模型在处理长文本或多轮对话等任务时的效果。简单来说 RoPE 的 self-attention 操作的流程是1.对于 token 序列中的每个词嵌入向量，首先计算其对应的 query 和 key 向量2.然后对每个 token 位置都计算对应的旋转位置编码。]]></description><category></category></item></channel></rss>