文献阅读
文章平均质量分 93
Marlowee
这个作者很懒,什么都没留下…
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
【论文解读】为什么自蒸馏(Self-Distillation)有时会降低 LLM 的推理能力?
模型在推理过程中显式表达自身不确定性的行为。强推理模型(如 DeepSeek-R1)频繁使用如 “Wait”、“Hmm”、“Let me reconsider” 等自我纠正性短语这些表达表面上看起来不直接推进推理,但实际上携带了重要信息:它们标记了推理可能出错的位置自蒸馏会移除对有效推理至关重要的 epistemic verbalization,有时导致性能退化小覆盖度 → 自蒸馏鼓励简洁推理,加速性能提升;大覆盖度 → 不确定性被压制,阻碍全分布学习,OOD 性能退化。原创 2026-03-26 21:22:24 · 647 阅读 · 0 评论 -
MAI-UI论文解读
MAI-UI论文针对GUI Agent在真实场景落地面临的四个核心挑战提出创新解决方案:(1)通过扩展ask_user动作实现双向交互,解决模糊指令处理问题;(2)集成MCP工具调用突破纯UI操作限制;(3)设计端云协同架构,赋予端侧模型轨迹监控能力;(4)采用在线强化学习应对动态环境。论文构建了自进化的三阶段数据流水线,通过种子任务扩展、双管道轨迹生成和质量控制机制持续产生高质量训练数据。实验表明,该系统在端侧性能提升33%的同时减少40%云端调用,为GUI Agent的实际应用提供了可行路径。原创 2026-03-26 14:33:09 · 532 阅读 · 0 评论 -
GUI Grounding 实践指南总结
对 Gemini-3-Pro、Claude-Sonnet-4.5、Seed1.8、Kimi-K2.5 和自研 MAI-UI 进行了系统评测,使用 OSWorld-G (Refined)(桌面端 Grounding 基准,指令明确无歧义)和 ScreenSpot-Pro(高分辨率密集布局基准,考验空间精度)两个 benchmark,目标包括:标准化评测范式对比、逆向工程复现各模型的报告数字、深入探测模型的边界能力。实际意义:在高分辨率屏幕上部署 GUI 自动化,不加 Zoom-In 步骤就是在浪费模型能力。原创 2026-03-24 21:57:27 · 617 阅读 · 0 评论 -
VAE通俗理解及公式推导
变分自编码器(Variational Autoencoder, VAE)是一种特殊的神经网络架构,它结合了传统的自动编码器(Autoencoder)思想和概率图模型的概念。通俗来说,VAE尝试学习数据的压缩表示(我们称之为“编码”),同时确保这些编码符合某种概率分布(通常是高斯分布)。这样做有两个好处:一是可以防止过拟合,二是使得我们可以从这个分布中随机采样来生成新的、类似的数据。原创 2025-01-09 21:46:31 · 3040 阅读 · 0 评论 -
【GMNER】Grounded Multimodal Named Entity Recognition on Social Media
目前的MNER任务主要把视觉特征作为额外的线索来帮助提升纯文本任务的性能,但是这有三点问题:一是MNER任务只提取实体-类型对,忽略了他们对应的目标框;二是提取的内容仅仅对构建纯文本的知识图谱有用,但是去无法建立多模态知识图谱;三十只识别实体类型对难以有效的进行试题消歧原创 2024-09-21 22:50:01 · 1763 阅读 · 0 评论 -
【多模态对比学习】我遇到的坑
本文是对过去几个月来利用对比学习的思想来优化多模态学习任务的思路的总结,主要包含以下几个方面:为什么要用对比学习、跨模态中对比学习怎么用、对比的过程中负样本是不是越多越好、要不要推远所有的负样本、样本之间的语义碰撞如何缓解、什么是负样本的“逃票”现象以及最重要的问题:如何学到一个高效的表征空间?原创 2024-03-30 12:45:19 · 6156 阅读 · 2 评论 -
【代码实现】DETR原文解读及代码实现细节
宏观上来说,DETR主要包含三部分:以卷积神经网络为主的骨干网(CNN Backbone)、以TRM(Transformer)为主的特征抽取及交互器以及以FFN为主的分类和回归头,如DETR中build()函数所示。DETR最出彩的地方在于,它摒弃了非端到端的处理过程,如NMS、anchor generation等,以来端到端建模目标检测过程,并且将Transformer引入到目标检测中,打开新领域的大门)。原创 2023-09-04 21:12:47 · 3735 阅读 · 1 评论 -
【多模态论文解读】Align before Fuse: Vision and Language Representation Learning with Momentum Distillation
本文介绍了一种名为ALBEF的高效视觉语言模型,采用了对比学习预训练的方式,能够学习到图像和文本之间的丰富关系,为视觉问答、图像分类、图像生成等下游任务提供更好的表征。ALBEF主要由三部分组成:image encoder、text encoder&multimodal encoder、momentum model。它的预训练目标主要包括对比损失、掩码语言重建任务和图像文本匹配任务的损失函数。此外,作者还提出了一种Momentum Distillation的方法,用于从动量模型生成的伪目标中学习,以便有效学原创 2023-04-13 21:22:53 · 4999 阅读 · 1 评论 -
CVPR 2022 | HorNet:递归门控卷积的高效高阶空间相互作用
HorNet文献笔记原创 2022-10-04 22:05:26 · 5126 阅读 · 2 评论 -
【CVPR2022】QueryDet论文精读
QueryDet论文精读原创 2022-06-03 22:47:12 · 3685 阅读 · 8 评论 -
【注意力机制集锦2】BAM&SGE&DAN原文、结构、源码详解
视觉注意力机制领域BAM及DAN的原文、结构、源码解读原创 2022-05-14 21:58:30 · 7521 阅读 · 2 评论 -
【视觉注意力机制集锦】引言
视觉注意力机制集锦之引言1 注意力机制1.1 注意力机制简介卷积神经网络具有很强的拟合数据的能力,但是由于优化算法和计算能力的限制,在实践中,卷积网络很难达到通用近似的能力。特别是在处理规模较大的输入数据,实现复杂任务时,计算能力仍可能成为模型的瓶颈。卷积网络中的局部连接的卷积结构、池化层等设计本身可以用来简化网络结构、缓解模型复杂度和表达能力的矛盾。针对网络模型的任务,我们需要进行进一步的操作,可以在不过多增加模型复杂度的同时提高模型的表达能力。神经网络中,可以存储的信息量称为网络容量,显然,网络原创 2022-05-05 09:18:36 · 1115 阅读 · 0 评论 -
【Transformer开山之作】Attention is all you need原文解读
Attention Is All You NeedTransformer原文解读与细节复现在Transformer出现以前,深度学习的基础主流模型可分为卷积神经网络CNN、循环神经网络RNN、图对抗神经网络GAN。而Transformer的横空出世,吸引了越来越多的研究者的关注:Transformer不仅在NLP领域取得了耀眼的成绩,近年来甚至一度屠榜CV领域的各大比赛,热度超前。所以,基于之前对Transformer的研究与理解,更基于对新技术的好奇与渴求,接下来的几篇文章我会从最经典的Tra原创 2022-05-01 15:49:49 · 28404 阅读 · 0 评论 -
YOLOF精读【CVPR2021】
YOLOF精读原创 2022-01-04 22:40:25 · 2536 阅读 · 0 评论
分享