Multimodal
文章平均质量分 80
主要是跟踪多模态大模型的相关文章,作简要介绍和归纳整理。
UnknownBody
AI博士,最近一直follow大模型相关论文,每日会更新学术界论文的进展。
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
DeepSport: A Multimodal Large Language Model for Comprehensive Sports Video Reasoning via Agentic...
体育视频理解面临独特挑战,要求模型具备高速动态感知能力、复杂规则理解能力以及长时序上下文推理能力。尽管多模态大语言模型(MLLM)在通用领域已展现出潜力,但当前体育领域的研究仍存在显著局限:现有方法要么聚焦单一运动项目、局限于特定任务,要么依赖无训练范式,缺乏稳健的学习型推理过程。为填补这一空白,我们提出DeepSport——首个专为多任务、多运动项目视频理解设计的端到端训练MLLM框架。原创 2026-07-27 10:30:00 · 211 阅读 · 0 评论 -
Spatial Reasoning in Multimodal Large Language Models: A Survey of Tasks, Benchmarks and Methods
空间推理需要感知和操纵3D世界中空间关系的能力,是人类智能的核心组成部分,但对多模态大语言模型(MLLMs)而言仍是一项持续的挑战。现有综述常基于输入模态(如文本、图像、视频或3D)对近期进展进行分类,但本文认为空间能力并非仅由输入格式决定。相反,本综述提出一种分类体系,从认知层面组织空间智能,并根据推理复杂度划分任务,将其与多种认知功能关联。我们将文本仅输入、视觉-语言及具身场景下的现有基准数据集映射到该分类体系中,并综述评估空间推理能力的指标与方法。原创 2026-07-23 07:30:00 · 15 阅读 · 0 评论 -
OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models
随着多模态大语言模型(MLLMs)日益融入日常工具和智能代理,其可能输出不安全内容的问题引发了越来越多的关注——这些不安全内容包括有毒语言、偏见图像、隐私侵犯以及有害虚假信息等。现有安全基准在模态覆盖范围和性能评估方面仍存在很大局限,往往忽视了内容安全的广阔领域。在本研究中,我们提出了OutSafe-Bench,这是首个为多模态时代设计的最全面的内容安全评估套件。原创 2026-07-19 10:30:00 · 18 阅读 · 0 评论 -
PruneHal: Reducing Hallucinations in Multi-modal Large Language Models through Adaptive KV Cache ...
该研究聚焦多模态大语言模型(MLLMs)的幻觉问题,核心发现视觉令牌注意力不足与冗余是导致幻觉的关键原因:冗余视觉令牌分散模型注意力,使关键视觉信息被忽视,进而引发生成内容与图像输入不一致的现象。为解决此问题,研究提出PruneHal框架,通过自适应KV缓存修剪策略,在推理阶段动态保留注意力分数最高的关键视觉令牌,同时避免过度修剪导致的视觉信息丢失。该方法无需额外训练,几乎不增加推理开销,且具有模型无关性,可与现有幻觉缓解解码策略(如DoLa、DeCo等)无缝集成。原创 2026-07-12 12:30:00 · 22 阅读 · 0 评论 -
M3-SLU: Evaluating Speaker-Attributed Reasoning in Multimodal Large Language Models
本文针对现有多模态大语言模型(MLLMs)在多说话者、多轮对话场景中难以准确识别“谁在何时说了什么”的问题,提出了M3-SLU基准测试集(Multi-Speaker, Multi-Turn, Multi-Modal Spoken Language Understanding),用于评估模型的说话者归因推理能力。基准测试集构建数据源:基于4个公开多说话者语料库(CHiME-6、MELD、MultiDialog、AMI),涵盖嘈杂环境对话、情感对话、多主题对话、商务会议等多样化场景。原创 2026-07-13 13:30:00 · 420 阅读 · 0 评论 -
Detecting Latin in Historical Books with Large Language Models: A Multimodal Benchmark
本文提出了一项新任务——从版式多样的多语言历史文献中提取拉丁语片段。我们基于包含724页标注数据的多模态数据集,对大型基础模型的性能进行了基准测试与评估。结果表明,利用当代模型实现可靠的拉丁语检测是可行的。本研究首次全面分析了这些模型在该任务中的能力与局限性。原创 2026-07-14 11:30:00 · 18 阅读 · 0 评论 -
Reasoning Like Experts: Leveraging Multimodal Large Language Models for Drawing-based Psychoanalysis
多模态大型语言模型(MLLMs)在各类客观多模态感知任务中展现出卓越性能,但在心理分析等主观、情感细腻的领域,其应用仍有待深入探索。本文提出PICK框架,即通过层级化分析和知识注入实现心理图像理解的多步骤框架,该框架专门针对临床实践中广泛使用的心理评估工具——房-树-人(HTP)测试。首先,我们将包含多个物体的绘画分解为具有语义意义的子图,构建涵盖三个层级的层级化表示:单物体层级、多物体层级和整体层级,以捕捉空间结构和内容信息。其次,我们对每个层级的子图进行针对性分析,从视觉线索中提取心理或情感洞察。原创 2026-07-12 11:30:00 · 14 阅读 · 0 评论 -
Proactive Reasoning-with-Retrieval Framework for Medical Multimodal Large Language Models
本文针对医疗多模态大语言模型(MLLMs)在推理过程中依赖内部知识导致的幻觉推理、事实不准确等问题,提出了首个多模态医疗推理-检索框架MED-RWR。该框架模拟临床医生诊断逻辑,在推理过程中主动检索外部医疗知识,结合视觉诊断结果与文本临床信息提升诊断可靠性与泛化能力。环境构建:通过“聚类-重构-分层”(Cluster-Reconstruct-Stratify)流程构建多模态训练数据集(约6500个不同难度的问答对)和专用知识库,为推理-检索提供支撑;两阶段强化学习(RL)策略。原创 2026-07-10 10:30:00 · 16 阅读 · 0 评论 -
Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied ...
本文提出RoboBench,一个用于评估多模态大语言模型(MLLMs)作为“具身大脑”的综合基准,聚焦机器人操作任务中的高层认知能力。核心内容围绕五大评估维度展开,通过真实数据构建和创新评估框架,揭示当前MLLMs的具身推理短板,为机器人智能发展提供指导。构建能在动态、非结构化环境中感知、推理和行动的机器人仍是核心挑战。近期具身系统常采用双系统范式,其中系统2负责高层推理,系统1执行底层控制。本文将系统2称为“具身大脑”,强调其在操作任务中作为推理和决策认知核心的作用。原创 2026-07-10 08:30:00 · 17 阅读 · 0 评论 -
Proactive Reasoning-with-Retrieval Framework for Medical Multimodal Large Language Models
激励多模态大语言模型(MLLMs)的推理能力对于医疗应用至关重要,这有助于透明地分析医学影像并提供可靠诊断。然而,现有医疗MLLMs在推理过程中仅依赖内部知识,在遇到超出训练范围的病例时会产生幻觉推理和事实不准确问题。尽管近期的智能体检索增强生成(Agentic RAG)方法能激发医疗模型在推理过程中的主动检索能力,但这些方法局限于单模态LLMs,忽视了推理和检索过程中关键的视觉信息。原创 2026-07-09 10:30:00 · 15 阅读 · 0 评论 -
The Impact of Image Resolution on Biomedical Multimodal Large Language Models
成像技术是生物医学研究和现代医学的基础,需要对多种模态的高分辨率图像进行分析。尽管多模态大型语言模型(MLLMs)在生物医学图像分析中展现出潜力,但大多数模型是为通用数据集的低分辨率图像设计的,存在关键信息丢失的风险。本研究探究了图像分辨率对生物医学应用中MLLM性能的影响,并证实:(1)原生分辨率训练与推理能显著提升多任务性能;(2)训练与推理分辨率的不匹配会严重降低性能;(3)混合分辨率训练可有效缓解分辨率失配问题,并平衡计算约束与性能需求。原创 2026-07-09 09:30:00 · 18 阅读 · 0 评论 -
Enhanced Motion Forecasting with Plug-and-Play Multimodal Large Language Models
本文针对自动驾驶系统中运动预测模型在复杂真实场景下泛化能力不足的问题,提出了一种名为的即插即用方法。问题背景:传统自动驾驶模块化系统(感知、预测、规划等)在训练数据之外的长尾场景(如紧急车辆出现、特殊天气)中性能受限,而持续收集数据与重训模型的成本过高。MLLMs具备跨模态推理和泛化能力,可弥补这一缺陷。核心框架视觉语义分析器(VSA):通过多模态提示(图像+文本)从MLLM提取智能体(车辆、行人)级语义信息(如车辆类型、信号灯状态、行为意图、是否横穿马路等),输出结构化文本并转换为可学习嵌入;原创 2026-07-05 07:30:00 · 23 阅读 · 0 评论 -
Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied ...
构建能够在动态、非结构化环境中感知、推理和行动的机器人仍是一项核心挑战。近年来的具身系统常采用双系统范式,其中系统2负责高层推理,系统1执行低层控制。在本研究中,我们将系统2称为“具身大脑”,强调其在操纵任务中作为推理与决策认知核心的作用。鉴于这一角色,对具身大脑的系统性评估对于推进机器人智能至关重要。然而,现有基准要么侧重于执行成功率,要么在针对高层推理时存在维度覆盖不完整、任务真实性有限的问题,仅能部分反映认知能力。原创 2026-07-03 11:30:00 · 25 阅读 · 0 评论 -
Enhanced Motion Forecasting with Plug-and-Play Multimodal Large Language Models
本文针对自动驾驶系统中运动预测模型在复杂真实场景下泛化能力不足的问题,提出了一种名为的即插即用方法。问题背景:传统模块化自动驾驶系统依赖特定训练数据,在长尾罕见场景(如紧急车辆出现、极端天气)中泛化能力有限,且持续收集数据与模型迭代成本高昂。核心思路:利用自然语言对复杂场景的高效描述能力,通过提示工程从MLLMs中提取结构化的场景理解信息(包括智能体级语义与场景级特征),将其转化为可学习的嵌入向量,作为补充输入融入现有运动预测模型。核心组件视觉语义分析器(VSA)原创 2026-07-03 08:30:00 · 16 阅读 · 0 评论 -
ELMM: Efficient Lightweight Multimodal Large Language Models for Multimodal Knowledge Graph Compl...
本文聚焦多模态知识图谱补全(MKGC)任务,针对现有方法存在的图像令牌冗余导致语义噪声与模态冲突、多模态大语言模型(MLLMs)计算成本过高等问题,提出了高效轻量多模态大语言模型(ELMM)。核心思路包括三部分:1)设计基于多头注意力机制的多视图视觉令牌压缩器(MVTC),从文本和视觉双视角自适应压缩图像令牌,保留关键信息并避免模态冲突;2)提出注意力剪枝策略,移除MLLMs中冗余的注意力层,同时通过线性投影补偿剪枝带来的性能损失;3)替换传统头部层为多模态知识推理补全层,优化候选实体概率分布预测。原创 2026-07-01 09:30:00 · 104 阅读 · 0 评论 -
Res-Bench: Benchmarking the Robustness of Multimodal Large Language Models to Dynamic Resolution ...
本文聚焦多模态大语言模型(MLLMs)的分辨率鲁棒性问题,即模型在不同输入分辨率下的性能稳定性。现有评估范式多关注语义层面表现,忽略了分辨率变化对模型性能的影响。为此,作者提出了Res-Bench基准测试集,包含14400个样本、12个分辨率等级和6个核心能力维度,搭配准确率、斯皮尔曼相关系数、绝对连续误差(ACE)、相对连续误差(RCE)四种评估指标。原创 2026-06-30 12:30:00 · 17 阅读 · 0 评论 -
Sequential Comics for Jailbreaking Multimodal Large Language Models via Structured Visual Storyte...
多模态大型语言模型(MLLMs)展现出卓越的能力,但仍易受利用跨模态漏洞的越狱攻击影响。本文提出一种新型方法,利用序列漫画风格的视觉叙事来规避最先进MLLMs中的安全对齐机制。该方法通过辅助LLM将恶意查询分解为视觉上无害的叙事元素,借助扩散模型生成相应的图像序列,并利用模型对叙事连贯性的依赖来诱导有害输出。基于已建立的安全基准数据集,对有害文本查询的大量实验表明,该方法平均攻击成功率达83.5%,较现有最优方法提升46个百分点。与现有视觉越狱方法相比,该序列叙事策略在各类有害内容上均表现出更优的有效性。原创 2026-06-27 08:30:00 · 19 阅读 · 0 评论 -
IAD-GPT: Advancing Visual Knowledge in Multimodal Large Language Model for Industrial Anomaly Det...
多模态大语言模型(MLLMs)强大的因果推理能力为工业异常检测(IAD)中缺陷目标的识别提供了潜力。然而,大多数传统IAD方法无法支持多轮人机对话,也难以提供异常目标的颜色、形状、具体类型等细节描述;同时,基于预训练大模型的方法尚未充分激活大模型在异常检测任务中的能力。本文探索了丰富文本语义与图像的图像级、像素级信息的融合,提出了一种基于MLLMs的新型IAD框架IAD-GPT。原创 2026-06-19 13:30:00 · 32 阅读 · 0 评论 -
Risk-adaptive Activation Steering for Safe Multimodal Large Language Models
现代人工智能模型的核心挑战之一是确保其对良性查询提供有用响应,同时拒绝恶意查询。但这些模型往往容易受到图像中嵌入恶意意图的多模态查询的攻击。安全对齐的一种方法是使用大规模安全数据集进行训练,但这在数据集构建和训练过程中都会产生高昂成本。推理时对齐方法虽能降低这些成本,却存在两个缺陷:误分类良性查询导致的过度拒绝,以及迭代输出调整带来的推理速度下降。为克服这些局限,我们提出对查询进行重构,以强化模型对安全关键图像区域的跨模态注意力,从而实现查询级别的准确风险评估。原创 2026-06-22 12:30:00 · 121 阅读 · 0 评论 -
Vision-Centric Activation and Coordination for Multimodal Large Language Models
多模态大语言模型(MLLMs)将视觉编码器的图像特征与大语言模型(LLMs)相结合,展现出先进的理解能力。然而,主流MLLMs仅受文本令牌的下一个令牌预测监督,忽视了对分析能力至关重要的视觉中心信息。为解决这一问题,我们提出VaCo方法,通过来自多个视觉基础模型(VFMs)的视觉中心激活(Vision-Centric Activation)与协调(Coordination)优化MLLM的表征。原创 2026-06-19 09:30:00 · 18 阅读 · 0 评论 -
2025_NIPS_Generating Images with Multimodal Language Models
我们提出了一种将冻结的纯文本大型语言模型(LLM)与预训练图像编码器和解码器模型融合的方法,通过在它们的嵌入空间之间建立映射实现这一目标。该模型展现出广泛的多模态能力:图像检索、新图像生成和多模态对话。我们的方法是首个能够基于任意交错的图像和文本输入,生成连贯图像(和文本)输出的方案。为了在图像生成任务上实现优异性能,我们设计了一个高效的映射网络,将LLM与现成的文本到图像生成模型关联起来。该映射网络将文本的隐藏表示转换为视觉模型的嵌入空间,使我们能够利用LLM强大的文本表示能力实现视觉输出。原创 2026-05-31 12:30:00 · 24 阅读 · 0 评论 -
2025_NIPS_See&Trek: Training-Free Spatial Prompting for Multimodal Large Language Model
我们提出SEE&TREK,这是首个专为提升纯视觉约束下多模态大语言模型(MLLMs)空间理解能力设计的无训练提示框架。尽管已有研究通过整合深度图或点云等模态来改善空间推理,但纯视觉空间理解仍未得到充分探索。SEE&TREK通过聚焦两大核心原则来填补这一空白:增加视觉多样性和运动重建。在视觉多样性方面,我们采用最大语义丰富度采样,利用现成的感知模型提取能够捕捉场景结构的语义丰富关键帧。在运动重建方面,我们模拟视觉轨迹,并将相对空间位置编码到关键帧中,以同时保留空间关系和时间连贯性。原创 2026-04-28 10:30:00 · 27 阅读 · 0 评论 -
2025_NIPS_Visual Anchors Are Strong Information Aggregators For Multimodal Large Language Model
在多模态大语言模型(MLLMs)领域,视觉-语言连接器扮演着至关重要的角色,负责衔接预训练视觉编码器与大语言模型(LLMs)。尽管其意义重大,但相关研究仍相对匮乏。本研究旨在提出一种高性能的视觉-语言连接器,使MLLMs在保持低计算成本的同时实现高准确率。我们首先揭示了视觉Transformer中视觉锚点的存在,并提出一种成本效益高的搜索算法来提取这些锚点。原创 2026-04-24 12:30:00 · 44 阅读 · 0 评论 -
2025_NIPS_ForgerySleuth: Empowering Multimodal Large Language Models for Image Manipulation Detectio
多模态大语言模型为各类多模态任务开辟了新可能,但它们在图像篡改检测中的潜力尚未得到挖掘。当直接应用于图像篡改检测(IMD)任务时,多模态大语言模型生成的推理文本常存在幻觉现象和过度思考问题。为解决这一问题,我们提出ForgerySleuth框架,利用多模态大语言模型进行全面的线索融合,并生成指示具体篡改区域的分割结果。此外,我们通过Chain-of-Clues提示词构建了ForgeryAnalysis数据集,该数据集包含分析与推理文本,实现了图像篡改检测任务的升级。原创 2026-04-22 10:30:00 · 272 阅读 · 0 评论 -
2025_NIPS_Unleashing the Potential of Multimodal LLMs for Zero-Shot Spatio-Temporal Video Grounding
时空视频定位(STVG)旨在根据输入文本查询定位视频中的时空管(spatio-temporal tube)。本文利用多模态大语言模型(MLLMs)探索STVG的零样本解决方案,并揭示了关于MLLMs的两个关键洞察:(1)MLLMs会动态分配特殊令牌(称为接地令牌)以对接文本查询;(2)由于无法充分整合文本查询中的线索(如属性、动作)进行推理,MLLMs的定位性能往往不够理想。原创 2026-04-11 12:30:00 · 32 阅读 · 0 评论 -
2025_NIPS_Unleashing the Potential of Multimodal LLMs for Zero-Shot Spatio-Temporal Video Grounding
时空视频定位(STVG)旨在根据输入文本查询定位视频中的时空管(spatio-temporal tube)。本文利用多模态大语言模型(MLLMs)探索STVG的零样本解决方案,并揭示了关于MLLMs的两个关键洞察:(1)MLLMs会动态分配特殊令牌(称为接地令牌)以对接文本查询;(2)由于无法充分整合文本查询中的线索(如属性、动作)进行推理,MLLMs的定位性能往往不够理想。原创 2026-04-11 11:30:00 · 31 阅读 · 0 评论 -
2025_NIPS_MLLM-For3D: Adapting Multimodal Large Language Model for 3D Reasoning Segmentation
推理分割旨在基于人类意图和空间推理分割复杂场景中的目标物体。尽管近年来多模态大语言模型(MLLMs)在2D图像推理分割中展现出令人瞩目的性能,但将这些能力迁移至3D场景的研究仍有待深入。本文提出MLLM-For3D,一种简洁且高效的框架,用于将2D MLLMs的知识迁移至3D场景理解。具体而言,我们利用MLLMs生成多视图伪分割掩码及对应的文本嵌入,随后将2D掩码反投影至3D空间并与文本嵌入对齐。原创 2026-04-09 11:30:00 · 31 阅读 · 0 评论 -
2025_NIPS_Can Large Language Models Help Multimodal Language Analysis? MMLA: A Comprehensive Benchma
多模态语言分析是一个快速发展的领域,它利用多种模态来增强对人类对话话语背后高层语义的理解。尽管其意义重大,但鲜有研究探讨多模态大型语言模型(MLLM)理解认知层面语义的能力。本文中,我们提出了MMLA——一个专门设计用于填补这一空白的综合基准。MMLA包含超过61K条来自模拟场景和真实世界场景的多模态话语,覆盖多模态语义的六个核心维度:意图、情感、对话行为、情绪、说话风格和沟通行为。我们采用三种方法(零样本推理、监督微调、指令微调)评估了八个主流分支的LLM和MLLM。原创 2026-04-07 07:30:00 · 41 阅读 · 0 评论 -
2025_NIPS_SafePTR : Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanis
内容警告:本文包含少量有害图像和文本!多模态大型语言模型(MLLMs)通过整合视觉输入,将大型语言模型(LLMs)的能力扩展到视觉推理领域。然而,这种整合也引入了新的漏洞,使得MLLMs易受多模态越狱攻击,阻碍了其安全部署。现有防御方法(包括图像转文本翻译、安全提示工程和多模态安全调优)试图通过将多模态输入与LLMs的内置安全机制对齐来解决该问题,但它们未能揭示多模态漏洞的根本原因,尤其是有害多模态令牌如何触发MLLMs的越狱行为?原创 2026-04-01 10:30:00 · 130 阅读 · 0 评论 -
2025_NIPS_JavisGPT: A Unified Multi-modal LLM for Sounding-Video Comprehension and Generation
本文提出 JavisGPT,这是首个用于联合音视频(JAV)理解与生成的统一多模态大语言模型(MLLM)。该模型采用简洁的编码器-LLM-解码器架构,核心包含 SyncFusion 模块(用于音视频时空融合)和同步感知的可学习查询(用于衔接预训练 JAV-DiT 生成器)。此设计支持从多模态指令中实现时间连贯的音视频理解与生成。我们设计了高效的三阶段训练流程,包括多模态预训练、音视频微调与大规模指令调优,基于现有视觉-语言模型逐步构建多模态理解与生成能力。原创 2026-04-05 07:30:00 · 35 阅读 · 0 评论 -
2025_NIPS_MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO
近期的文本到图像系统在处理多模态输入和复杂推理任务时面临局限。本文提出统一多模态大语言模型MindOmni,通过强化学习融入推理生成能力以应对这些挑战。MindOmni采用三阶段训练策略:1)设计含解码器式扩散模块的统一视觉语言模型;2)使用思维链(CoT)指令数据进行有监督微调;3)提出推理生成策略优化(RGPO)算法,利用多模态反馈有效引导策略更新。实验结果表明,MindOmni在理解和生成基准测试中均优于现有模型,展现出先进的细粒度推理生成能力,尤其在数学推理指令任务中表现突出。所有代码将开源于。原创 2026-03-31 12:30:00 · 37 阅读 · 0 评论 -
2025_NIPS_HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models
该研究针对多模态大型语言模型(MLLMs)训练中存在的计算资源消耗巨大、视觉与文本模态多粒度对齐不足的问题,提出了一种基于双曲空间的高效训练范式HyperET。核心背景是现有MLLMs依赖CLIP、SAM等视觉编码器,这些编码器仅能在单一粒度(如像素级或对象级)与语言对齐,导致跨模态对齐效率低下,需海量GPU资源支撑训练。而双曲空间天然具备层级建模能力,可通过双曲半径量化粒度(原点附近为低粒度视觉特征,边界附近为高粒度语义特征),为解决粒度不匹配问题提供了理论基础。原创 2026-03-31 11:30:00 · 45 阅读 · 0 评论 -
2025_NIPS_ModuLM: Enabling Modular and Multimodal Molecular Relational Learning with Large Language
本文针对分子关系学习(MRL)中现有大语言模型(LLM)框架缺乏多模态输入支持和灵活架构的问题,提出模块化框架ModuLM。该框架支持1D、2D、3D分子输入格式,整合多种编码器、交互层和LLM骨干网络,可动态构建超50,000种模型配置,适用于药物-药物相互作用(DDI)、溶质-溶剂相互作用(SSI)等任务,通过增量预训练、模态对齐和灵活微调提升模型性能。分子关系学习(MRL)旨在理解分子对之间的相互作用,在推动生化研究方面发挥着关键作用。原创 2026-03-29 10:30:00 · 30 阅读 · 0 评论 -
2025_NIPS_STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Au
本文针对自动驾驶领域多模态大语言模型(VLMs)的时空推理能力评估缺口,提出了STSBench——一个基于场景的基准测试框架,并在nuScenes数据集上实例化得到STSnu基准。我们提出STSBench,一个基于场景的基准测试框架,用于评估自动驾驶领域视觉语言模型(VLMs)的整体理解能力。该框架利用真值标注从任意数据集自动挖掘预设交通场景,提供直观的用户界面以实现高效人工验证,并生成选择题用于模型评估。原创 2026-03-22 10:30:00 · 46 阅读 · 0 评论 -
2025_NIPS_Learning to Steer: Input-dependent Steering for Multimodal LLMs
该研究聚焦多模态大语言模型(MLLMs)的后验引导问题,针对现有静态引导方法(如均值引导)仅使用单一固定引导向量、无法适配输入依赖型目标行为的局限,提出了输入依赖型引导方案。提出Prompt-to-Steer(P2S)方法,通过输入特异性对比提示生成专属引导向量,但该方法因测试时需已知对比提示而难以落地;设计Learn-to-Steer(L2S)框架,利用轻量辅助网络学习从输入潜在表示映射到P2S引导向量,实现低计算开销的输入依赖型引导;原创 2026-03-22 08:30:00 · 137 阅读 · 0 评论 -
2025_NIPS_Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and Empirical
本文聚焦多模态大语言模型(MLLMs)的视觉冗余问题,通过分析注意力行为发现其推理过程存在三个核心阶段:早期融合、模态内建模、多模态推理。研究揭示,视觉 tokens 在文本 tokens 获取足够视觉信息后便不再对推理有实质贡献。基于此,提出动态视觉 token 退出方法(DyVTE),通过轻量级超网络感知文本 token 状态,自动决策视觉 tokens 的退出时机,在不损失性能的前提下降低计算开销。原创 2026-03-21 11:15:00 · 43 阅读 · 0 评论 -
2025_NIPS_Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence
本文提出,一种仅基于2D视频输入就能增强多模态大语言模型(MLLMs)视觉空间智能的框架。现有MLLMs在2D任务上表现出色,但3D空间推理能力有限,且多数3D MLLMs依赖额外3D/2.5D数据(如点云、深度图),限制了实际应用场景。Spatial-MLLM通过双编码器架构、空间感知帧采样策略和专属训练流程,在纯2D输入下实现了先进的空间理解与推理性能,在VSI-Bench、ScanQA等多个基准测试中表现突出。原创 2026-03-20 10:30:00 · 37 阅读 · 0 评论 -
2025_NIPS_MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
该研究针对现有多模态大语言模型(MLLMs)评估基准局限于单视频理解、无法满足现实场景中多视频分析需求的问题,提出了首个全面的多视频理解评估基准MVU-Eval。多模态大语言模型(MLLMs)的出现将人工智能能力拓展到了视觉模态,但现有评估基准仍局限于单视频理解,忽视了现实场景(如体育分析、自动驾驶)中对多视频理解的关键需求。为填补这一重要空白,我们提出了MVU-Eval——首个用于评估MLLMs多视频理解能力的综合基准。原创 2026-03-15 08:30:00 · 89 阅读 · 0 评论 -
Helios: Real Real-Time Long Video Generation Model
我们提出Helios,这是首个14B参数的视频生成模型,在单张NVIDIA H100 GPU上运行速度可达19.5 FPS,支持分钟级视频生成,同时质量与强基线模型相当。我们在三个关键维度取得突破:(1)无需自强制、误差库或关键帧采样等常用抗漂移启发式方法,仍能保持长视频生成的稳定性;(2)无需KV缓存、稀疏/线性注意力或量化等标准加速技术,实现实时生成;(3)无需并行或分片框架即可完成训练,支持图像扩散级别的批量大小,且80GB GPU内存可同时容纳4个14B模型。原创 2026-03-14 11:30:00 · 67 阅读 · 0 评论 -
2025_NIPS_Unlabeled Data Improves Fine-Grained Image Zero-shot Classification with Multimodal LLMs
尽管多模态大型语言模型(MLLMs)在通用零样本图像分类任务中展现出良好效果,但细粒度图像分类仍然具有挑战性。该任务要求精准关注细微的视觉细节以区分视觉相似的子类——而如果没有明确引导,MLLMs很容易忽略这些细节。为解决这一问题,我们提出了AutoSEP,这是一种迭代式自监督提示学习框架,旨在以完全无监督的方式增强MLLMs的细粒度分类能力。我们的核心思想是利用无标签数据学习描述提示词,引导MLLMs识别图像中关键的判别特征,从而提升分类准确率。原创 2026-03-09 11:30:00 · 36 阅读 · 0 评论
分享