LLM MultiModal
文章平均质量分 82
UnknownBody
AI博士,最近一直follow大模型相关论文,每日会更新学术界论文的进展。
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
Quantifying Language Disparities in Multilingual Large Language Models
大型多语言评估中报告的结果往往具有碎片化特征,且受目标语言、实验设置差异、模型选择等因素干扰。本文提出一套框架,可分离这些混淆变量,并引入三个可解释的指标——性能实现比(performance realisation ratio)、性能实现比的变异系数(its coefficient of variation)与语言潜力(language potential),从而更精细、更深入地量化(i)模型间与(ii)语言间的实际性能差异。原创 2026-09-15 07:30:00 · 107 阅读 · 0 评论 -
Towards Recommending Usability Improvements with Multimodal Large Language Models
可用性是描述用户界面(UI)关键质量属性的集合,这类属性直接影响人机交互效果。常见的可用性评估方法(如可用性测试、专家审查)虽有效,但资源消耗大且依赖专业人员参与,这使得小型组织难以采用。近年来,多模态大型语言模型(Multimodal LLMs)的发展为部分自动化可用性评估流程提供了可行路径——这类模型可分析软件界面的文本、视觉及结构特征。为验证该可能性,本文将可用性评估构建为“推荐任务”:多模态LLMs按严重程度对可用性问题进行排序。原创 2026-09-06 10:30:00 · 11 阅读 · 0 评论 -
CyPortQA: Benchmarking Multimodal Large Language Models for Cyclone Preparedness in Port Operation
随着热带气旋强度加剧且路径预报不确定性日益增加,美国港口在极端天气条件下面临更高的供应链风险。当热带气旋逼近时,港口运营者需快速将各类多模态预报产品(如概率风速图、路径圆锥图、官方公告)整合为清晰、可执行的指导方案。多模态大语言模型(MLLMs)为整合这些异质数据源与更广泛的背景知识提供了强大手段,但其在港口热带气旋防灾准备这一特定场景下的准确性与可靠性尚未得到严格验证。为填补这一空白,本文提出CyPortQA——首个针对热带气旋威胁下港口运营的多模态基准数据集。原创 2026-09-02 12:30:00 · 12 阅读 · 0 评论 -
MLLMRec: Exploring the Potential of Multimodal Large Language Models in Recommender Systems
多模态推荐通常将用户行为数据与物品的模态特征相结合,以揭示用户偏好,相比传统推荐展现出更优的性能。然而,现有方法仍存在两个关键问题:(1)用户多模态表示的初始化方法要么未感知用户行为,要么存在噪声污染;(2)基于K近邻(KNN)构建的物品-物品图包含低相似度的噪声边,且缺乏受众共现关系。为解决这些问题,本文提出MLLMRec——一种新型的MLLM驱动多模态推荐框架,该框架包含两种物品-物品图优化策略。一方面,首先利用MLLM将物品图像转换为高质量语义描述,再将其与物品的文本元数据融合;原创 2026-08-31 11:30:00 · 80 阅读 · 0 评论 -
Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation
多模态大型语言模型(MLLMs)通过无缝融合视觉与语言理解能力,在众多应用中取得了显著进展。然而,其可信度仍备受关注,存在幻觉、对抗脆弱性、隐私泄露及偏见行为等风险。现有评估与缓解方法往往聚焦于单一维度,且忽略了多模态特性引入的风险。为应对这些挑战,本文提出MultiTrust-X——一个用于评估、分析和缓解MLLMs可信度问题的全面基准测试体系。原创 2026-08-27 08:30:00 · 8 阅读 · 0 评论 -
Multimodal Large Language Models with Adaptive Preference Optimization for Sequential Recommendation
大语言模型(LLMs)的最新进展为序列推荐开辟了新途径,其能够对用户行为序列进行自然语言推理。一种常见方法将推荐任务构建为语言建模任务:将交互历史转换为提示词,并通过有监督微调(SFT)学习用户偏好。然而,这些方法仅在文本模态下运作,往往会忽略用户的细粒度兴趣——尤其是当这些兴趣由产品图像、电影海报等丰富视觉信号塑造时。多模态大语言模型(MLLMs)通过在共享语义空间中对齐文本和视觉信息,提供了一种极具潜力的替代方案。原创 2026-08-20 13:30:00 · 105 阅读 · 0 评论 -
FastMMoE: Accelerating Multimodal Large Language Models through Dynamic Expert Activation and Rou...
多模态大语言模型(MLLMs)已取得令人瞩目的性能,但高分辨率视觉输入会产生长序列视觉 tokens,导致显著的推理延迟。在保持性能的同时减少冗余视觉 tokens,对于减轻计算/内存负担、推动 MLLM 在资源受限或延迟敏感场景中的部署至关重要。现有视觉 token 剪枝方法主要依赖基于注意力的冗余分析,且专为密集架构设计。本文提出 Fast 多模态混合专家(FastMMoE),一种面向混合专家(MoE)型 MLLMs 的无训练加速框架,其设计源于路由分析视角。原创 2026-08-10 14:30:00 · 13 阅读 · 0 评论 -
FastMMoE: Accelerating Multimodal Large Language Models through Dynamic Expert Activation and Rou...
多模态大语言模型(MLLMs)已取得令人瞩目的性能,但高分辨率视觉输入会产生长序列视觉 tokens,导致显著的推理延迟。在保持性能的同时减少冗余视觉 tokens,对于减轻计算/内存负担、推动 MLLM 在资源受限或延迟敏感场景中的部署至关重要。现有视觉 token 剪枝方法主要依赖基于注意力的冗余分析,且专为密集架构设计。本文提出 Fast 多模态混合专家(FastMMoE),一种面向混合专家(MoE)型 MLLMs 的无训练加速框架,其设计源于路由分析视角。原创 2026-08-13 09:30:00 · 9 阅读 · 0 评论 -
Comparison of Text-Based and Image-Based Retrieval in Multimodal Retrieval Augmented Generation L...
检索增强生成(RAG)的最新进展已使大型语言模型(LLMs)能够访问包含文本和视觉信息(如财务文档中的图表、示意图和表格)的多模态知识库。然而,现有多模态RAG系统在预处理阶段依赖基于LLM的总结将图像转换为文本,仅在向量数据库中存储文本表示,这导致下游检索和问答任务关键的上下文信息与视觉细节丢失。为解决这一局限,本文对多模态RAG系统的两种检索方法进行了全面对比分析,包括文本基片段检索(图像在嵌入前先总结为文本)和直接多模态嵌入检索(图像以原生形式存储在向量空间中,并在生成过程中传递给视觉LLM)。原创 2026-08-07 14:30:00 · 13 阅读 · 0 评论 -
ChemVTS-Bench: Evaluating Visual-Textual-Symbolic Reasoning of Multimodal Large Language Models i...
本文针对现有化学领域多模态大语言模型(MLLMs)评估基准的不足,提出了——一个专注于评估MLLMs化学领域视觉-文本-符号(VTS)推理能力的领域真实基准。现有基准的局限性:现有化学相关基准多依赖简单图文对,化学语义有限,未覆盖视觉、文本、SMILES(简化分子输入行项系统)等核心模态,且难以评估模型跨模态整合能力,存在对模型推理能力的高估问题。ChemVTS-Bench的核心设计。原创 2026-08-12 14:30:00 · 14 阅读 · 0 评论 -
Evaluating Multimodal Large Language Models on Vertically Written Japanese Text
多模态大语言模型(MLLMs)近年来发展迅速,现已应用于视觉文档理解任务。这些模型需处理包括日语在内的多种语言的文档图像,而日语文档中部分采用竖排书写,因此对竖排文本的支持至关重要。然而,专门针对竖排日语文本的研究仍较为有限。本研究评估了现有MLLMs对竖排日语文本的识别能力:首先,通过将日语文本渲染为图像生成合成日语OCR数据集,用于模型微调和评估(该数据集包含横排与竖排两种书写形式);其次,构建了源自真实文档图像的竖排日语文本评估数据集。原创 2026-08-11 09:30:00 · 121 阅读 · 0 评论 -
MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping
本文针对MoE(混合专家)架构的多模态大语言模型(MLLM)推理效率低的问题,提出了训练无关的专家跳过框架MoDES。核心发现是现有单模态LLM的专家跳过方法未考虑MoE层间专家贡献异质性和模态特异性,导致MLLM性能大幅下降。MoDES通过全局调制局部门控(GMLG)、双模态阈值化(DMT)和前沿搜索算法,在13个基准测试中实现高效推理:最高可跳过88%专家,保留95%以上原始性能,预填充速度提升2.16倍,解码速度提升1.26倍,显著优于NAEE、MC-MoE等现有方法。原创 2026-08-09 11:30:00 · 11 阅读 · 0 评论 -
Q-MLLM: Vector Quantization for Robust Multimodal Large Language Model Security
多模态大语言模型(MLLMs)在跨模态理解方面展现出令人瞩目的能力,但尽管具备稳健的文本安全机制,仍易受通过视觉输入发起的对抗攻击。这些漏洞源于两个核心缺陷:视觉表征的连续性(为梯度-based攻击提供了可能),以及基于文本的安全机制难以充分迁移到视觉内容。本文提出Q-MLLM,一种新颖的架构,其整合了两级向量量化以构建离散瓶颈来抵御对抗攻击,同时保留多模态推理能力。通过在像素块级和语义级对视觉表征进行离散化,Q-MLLM阻断了攻击路径,并弥合了跨模态安全对齐差距。原创 2026-08-09 10:30:00 · 13 阅读 · 0 评论 -
From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
随着多模态大型语言模型(MLLMs)在感知任务中取得显著成功,增强其复杂推理能力已成为关键研究焦点。现有模型仍面临推理路径不透明、泛化能力不足等挑战。思维链(CoT)推理在语言模型中已展现出提升推理透明度和输出可解释性的显著成效,将其扩展到多模态领域有望改善模型推理能力。本文围绕“多模态思维链(MCoT)”展开系统性综述:首先从技术演进和任务需求视角分析其诞生的背景与理论动机;然后从思维链范式、训练后阶段、推理阶段三个方面介绍主流MCoT方法,并解析其底层机制;原创 2026-08-03 13:30:00 · 9 阅读 · 0 评论 -
Multi-Agent Multimodal Large Language Model Framework for Automated Interpretation of Fuel Effici...
提升公共交通的燃油效率需要将复杂的多模态数据整合为可解释、与决策相关的洞见。然而,传统的分析和可视化方法往往产生碎片化的输出,需要大量人工解读,限制了可扩展性和一致性。本研究提出了一个多智能体框架,利用多模态大语言模型(LLM)实现数据叙事自动化和能源洞见生成。该框架协调三个专业化智能体(包括数据叙事智能体、LLM评估智能体和可选的人工介入评估器),将分析成果迭代转化为连贯的、面向利益相关者的报告。原创 2026-07-31 11:30:00 · 90 阅读 · 0 评论 -
MM-Telco: Benchmarks and Multimodal Large Language Models for Telecom Applications
大语言模型(LLMs)已成为自动化复杂推理和决策任务的强大工具。在电信领域,它们有望实现网络优化转型、自动化故障排查、提升客户支持质量并确保合规性。然而,由于电信领域存在特定挑战,需要专用适配方案,LLMs的部署受到阻碍。为克服这些挑战并加速LLMs在电信领域的适配,我们提出MM-Telco——一套全面的多模态基准测试套件与模型,专为电信领域量身定制。该基准包含多种文本和图像类任务,覆盖网络运维、网络管理、文档质量提升、文本与图像检索等实际应用场景。原创 2026-07-24 11:30:00 · 19 阅读 · 0 评论 -
VP-Bench: A Comprehensive Benchmark for Visual Prompting in Multimodal Large Language Models
VP-Bench 是一个针对多模态大语言模型(MLLM)视觉提示(VP)理解能力的两阶段综合基准测试框架。第一阶段聚焦模型对视觉提示的感知能力,覆盖8种VP形状、355种属性组合,基于30K+可视化提示构建问答对,核心评估存在性、计数、定位、指代四大任务;第二阶段探究VP对下游任务的影响,选取医疗图像分析、3D物体识别、面部情绪识别等6类实际场景任务,评估模型整合视觉提示与文本语境的能力。原创 2026-07-19 07:30:00 · 13 阅读 · 0 评论 -
AUVIC: Adversarial Unlearning of Visual Concepts for Multi-modal Large Language Models
多模态大型语言模型(MLLMs)在海量数据集上优化后可实现卓越性能,但此类数据集往往包含敏感或受版权保护的内容,引发严重的数据隐私担忧。强制要求“被遗忘权”的监管框架推动了机器遗忘技术的需求——该技术能够在无需耗费大量资源重新训练的情况下移除目标数据。然而,尽管文本模态的机器遗忘已得到充分研究,MLLMs中的视觉概念遗忘仍未被深入探索。核心挑战在于精准移除目标视觉概念的同时,不破坏模型对相关实体的性能表现。为解决这一问题,我们提出AUVIC,一种面向MLLMs的新型视觉概念遗忘框架。原创 2026-07-17 12:30:00 · 14 阅读 · 0 评论 -
Benchmarking Multimodal Large Language Models for Face Recognition
多模态大型语言模型(MLLMs)在各类视觉-语言任务中取得了显著性能。然而,它们在人脸识别领域的潜力尚未得到充分探索。特别是开源MLLMs的性能,需要在采用相似协议的标准基准上与现有人脸识别模型进行评估和对比。本文在多个人脸识别数据集(包括LFW、CALFW、CPLFW、CFP、AgeDB和RFW)上,对最先进的MLLMs进行了系统的人脸识别基准测试。实验结果表明,尽管MLLMs能捕捉对人脸相关任务有用的丰富语义线索,但在零样本应用的高精度识别场景中,它们仍落后于专用模型。原创 2026-06-13 09:30:00 · 19 阅读 · 0 评论 -
Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation
本文提出,一款面向视觉理解、文生图与指令引导图像编辑的统一多模态基础模型。JoyAI-Image将空间增强的多模态大语言模型(MLLM)与多模态扩散Transformer(MMDiT)相结合,使感知与生成通过共享多模态接口实现交互。围绕该架构,我们构建了可扩展的训练方案,融合统一指令微调、长文本渲染监督、空间对齐数据,以及通用与空间编辑信号。该设计赋予模型广泛的多模态能力,同时强化几何感知推理与可控视觉合成。原创 2026-06-03 07:30:00 · 35 阅读 · 0 评论 -
2025_NIPS_Training Transitive and Commutative Multimodal Transformers with LoReTTa
多模态基础模型的训练具有挑战性,原因在于多模态数据集的可获取性有限。尽管许多公开数据集将图像与文本配对,但很少有数据集能将图像与音频或文本与音频结合,而同时对齐三种模态的数据集则更为罕见。医疗、基础设施或交通等关键领域尤其受模态缺失问题的影响,这使得难以将所有模态整合到一个大型预训练神经网络中,该网络本应能直接使用或针对不同下游任务进行微调。为此,我们提出了LoReTTa(一种利用传递性和交换性预训练策略链接模态的方法),以解决这一研究不足的问题。原创 2026-05-29 09:30:00 · 88 阅读 · 0 评论 -
LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model
本文提出LLaDA2.0-Uni,一种统一离散扩散大语言模型(dLLM),在原生一体化框架中同时支持多模态理解与生成任务。模型架构融合全语义离散分词器、基于混合专家(MoE)的dLLM主干与扩散解码器。通过SigLIP‑VQ将连续视觉输入离散化,主干对文本与视觉输入统一执行块级掩码扩散建模,解码器将视觉token重建为高保真图像。除并行解码外,模型通过主干前缀感知优化与解码器少步蒸馏进一步提升推理效率。原创 2026-05-10 07:30:00 · 190 阅读 · 0 评论 -
2025_NIPS_OpenHOI: Open-World Hand-Object Interaction Synthesis with Multimodal Large Language Model
理解并合成真实的3D手-物交互(HOI)对于从沉浸式增强现实/虚拟现实(AR/VR)到灵巧机器人等应用至关重要。现有方法在泛化性方面存在局限——在闭集物体和预定义任务上表现良好,但无法处理未见物体或开放词汇指令。本文提出OpenHOI,首个面向开放世界的HOI合成框架,能够在自由形式语言指令的引导下,为新颖物体生成长时程操作序列。原创 2026-04-28 07:30:00 · 349 阅读 · 0 评论 -
2025_NIPS_Can Multi-Modal LLMs Provide Live Step-by-Step Task Guidance?
多模态大型语言模型(Multi-modal LLM)已具备先进的对话能力,但在提供实时、交互式分步指导方面仍存在不足——这是未来AI助手的关键能力之一。有效的指导不仅需要传递指令,还需检测指令的成功执行情况,识别并提醒用户的错误,且所有这些都必须实时完成。这要求模型不再是基于回合制,而是能够异步响应视频流,同时需要包含用户执行任务(包括错误及修正过程)的视频数据。原创 2026-04-07 11:30:00 · 112 阅读 · 0 评论 -
2025_NIPS_Scientists’ First Exam: Probing Cognitive Abilities of MLLM via Perception, Understanding,
本文来自上海人工智能实验室PrismaX团队,针对现有科学领域多模态大语言模型(MLLMs)基准测试仅侧重知识理解、忽视感知与推理能力评估的缺陷,提出了Scientists’ First Exam(SFE)基准测试。该基准旨在从三个认知层面全面评估MLLMs的科学认知能力:科学信号感知(L1,识别科学原始数据可视化中的关键组件)、科学属性理解(L2,解读领域专家知识)、科学比较推理(L3,通过多科学视觉源的结构化比较推导现象洞察)。SFE涵盖5个高价值学科(天文学、化学、地球科学、生命科学、材料科学)、原创 2026-04-02 07:30:00 · 46 阅读 · 0 评论
分享