自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(1472)
  • 资源 (4)
  • 收藏
  • 关注

原创 【LLM】多模态LLM综述MultiModal Large Language Models

note(一)现有的 MM-LLM 的趋势:(1)从专门强调 MM 理解对特定模态的生成的进展,并进一步演变为任何到任何模态的转换(例如,MiniGPT-4 → MiniGPT-5 → NExT-GPT);(2) 从 MM PT 提升到 SFT,然后到 RLHF,训练管道进行连续细化,努力更好地与人类意图对齐并提高模型的会话交互能力(例如,BLIP-2 → InstructBLIP →DRESS);(3) 实施多样化模态扩展(例如,BLIP-2 → X-LLM 和 InstructBLIP→X-In

2024-06-02 13:05:46 5556 8

原创 【VLM】DiCoBench:多图细粒度感知Benchmark

一、DiCoBench论文:DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual CuesECCV 2026 :DiCoBench动机:现有很多 VQA benchmark 的问题提示太明显,比如直接问“桌上的杯子是什么颜色”,模型知道该看哪里;但真实场景往往要求模型自己在多张图里找关键视觉线索。DiCoBench 就故意把这种提示减弱,测试模型真正

2026-09-01 11:39:30 200

原创 【Agent】Towards Long‑Horizon Agents: A Survey

VideoSeek Benchmark:Tool-augmented active perception in long video多模态理解侧重于如何在较长的时间跨度内定位有用信息,包括决定检查哪些片段以及调用哪些感知工具。Understanding​ → 主要吃 C1(H1)和 C2(H2)的亏,靠 Context/Memory 外化解决;多模态生成侧重于如何理解用户意图并进行多轮规划、生成与优化,这一过程依赖于外部证据、验证机制和持久记忆。Generation​ → 叠加不可逆副作用,靠 Pl

2026-08-31 00:09:24 357

原创 【LLM】GLM-5.3-Flash模型

GLM-5.3-Flash模型:320B总参数,19B激活参数。在编码和智能体评估方面,GLM-5.3-Flash 的表现接近 Claude Opus 4.8 的水平。基准上 MVBench 约 77.8,MMVU 约 80.5,属 Flash 级多模态视频理解可用水平,但不支持音频输入GLM-5.3-Flash 在多个方面进行了架构改进。首次引入了混合式架构,结合了稀疏注意力机制和线性注意力机制,从而显著降低了长上下文服务的成本,同时保留了精确的长上下文处理能力。此外,采用了 Manifold-Con

2026-08-30 23:14:49 50

原创 【VLM】多模态MoE模型Qwen3.8-Flash(125B总参数,激活6B,外挂51B N-gram Embedding)

多模态 MoE 模型,主模型参数量为125B,额外配备 51B 的 N-gram Embedding,每 token 激活 6B 参数。 它原生支持 262,144 token 上下文,并可通过 YaRN 扩展至 1M token。Attention:采用 GDN + QSA Hybrid 架构。Gated DeltaNet(GDN)高效压缩历史信息;Qwen Sparse Attention(QSA) 通过压缩式轻量 Indexer 在 micro-block 粒度上筛选重要上下文,显著降低长序列 At

2026-08-30 16:01:46 356

原创 【VLM】多模态情感分类-蒸馏小模型Light-MER

任务:生成式多模态情感识别(MER)——输入视频/人脸+语音+字幕,模型用自然语言说出情绪状态(如 “nervous, concerned” 或 “neutral”)。输出的结果比如The character's emotional state is nervous, concerned.。Light-MER 的蒸馏:从 logits 移到 hidden states(最后一层)、从 KL/MSE 换成 Sliced Wasserstein Distance(SWD)工作:用一个 0.6B 的多模态小模

2026-08-30 15:30:29 182

原创 【CLIP】Modality Alignment across Trees on Heterogeneous Hyperbolic Manifolds

这篇论文的本质贡献是:把“图像=一个点”这个 CLIP 时代隐含假设打破,用 ViT 中间层+文本 cross-attention 让图像也长成一棵层级树,再把图文两棵树分别放进不同曲率的双曲空间,通过可证明唯一的最优中间双曲流形完成几何对齐,从而在分类学开集任务上把层级一致准确率(HCA)拉高近 29 个点。构建视觉树核心是利用 ViT 不同层的 CLS token 作为“多粒度视觉候选特征”,再通过文本层级引导的 Cross-Attention,把它们融合成一组 coarse-to-fine 的视觉

2026-08-29 22:35:26 320

原创 【NeurIPS 2025】Beyond the Seen: Bounded Distribution Estimation for Open-Vocabulary Learning

用生成模型主动补齐“没见过的数据分布”:先“猜”未来可能出现的 unseen class → 用扩散模型生成这些类别的伪图片 → 再让这些 synthetic unseen data 参与 CLIP Prompt Learning。它本质上是一个“LLM/VLM + Diffusion 合成 unseen 数据 → 提升 CLIP 开放词汇泛化”的工作,而不是一个新的大模型架构这篇论文的增量不在"用扩散模型造数据"本身,而在先把’OVL 分布估计误差不可界’这件事写成定理,再反推’生成什么数据、怎么对齐

2026-08-29 18:58:26 13

原创 【ICML2026】Video-DeepResearch

Video-DeepResearch(arXiv:2608.03979)把“Deep Research”从文本/静态图推到连续视频流 + 开放网页检索的场景,核心不是堆参数,而是用训练范式和评测设计逼模型先“看视频”、再“搜网页”。这篇的价值不在 SOTA 数字,而在把“视频里的 deep research”定义成先时序 grounding 再网页验证的强制闭环,并给出可复现的数据-训练-评测三件套。30B 打平 Claude-4.5 这点,基本宣告视频 agent 方向“训法 > 参数量”的范式切换。

2026-08-29 18:08:46 25

原创 【VLM-Agent】DeepSeek-V4-Flash-Vision-Exp

DeepSeek-V4-Flash + 原生“看图”能力 + Tool Calling,重点面向多模态 Agentex:图片/截图 → V4 Flash Vision → 视觉理解 + Reasoning → Function Call → 搜索/Crop/浏览器/代码等工具 → 最终回答多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 上线 DeepSeek API 平台model=‘deepseek-v4-flash-vision-exp’文章目录note一、De

2026-08-26 15:09:24 44

原创 【MLLM Agent】多模态理解Agent研究进展

方案选型:做图片输入 + function call 通用多模态 Agent → 优先看DeepSeek‑Harness + MTA‑Agent;做图片多轮检索求证 → DR‑MMSearchAgent;做长文档图文问答 → MDocAgent;做成本优化、工具调用节流 → ToolGate;做GUI 屏幕自动化 Agent → UI‑TARS / Agent‑TARS。文章目录note一、2026多模态Agent研究热点二、相关项目1、框架类2、多模态深搜三、选型总结一、2026

2026-08-23 21:30:10 207 1

原创 【VLM】GRASP:通过RL强化bbox能力后SAM分割

GRASP 不是把分割做得更准(ID 上没碾压 SFT),而是用 RL+稀疏奖励把 OOD 鲁棒性和标注成本这两个遥感落地瓶颈一起砸下去——这是它相对 SegEarth-R1/GeoPix 的真正增量。GRASP = 级联架构 + PRIME + BoP-RewardsGRASP中的SAM/分割模型本身没有参与优化,GRASP 主要优化的是前面的 VLM 定位能力;VLM 先预测 bounding box / point,然后利用已有的分割模型得到最终 mask。SAM 是 promptable se

2026-08-23 17:42:45 175

原创 【VLM】Training-Free Ultra-HR Remote Sensing VQA via Adaptive Zoom Search

note不是新主干、不是新预训练,而是给"现有 VLM 怎么吃下 2–20K 遥感图"提供了一个即插即用的前置显微镜 + 画布拼接器,在 LRS-VQA / MME-RealWorld-RS 上把基线抬到 SOTA,且更快。输入图片 →(Python 树搜索 + 外部 CLIP 打分 + VLM 只做 Yes/No 置信)→ 拼画布 → 单次 VLM 回答ZoomSearch不是Agent 式 crop/zoom tool call范式,所以灵活性还是欠缺维度 ZoomSearch Agent 式

2026-08-23 16:59:38 319

原创 【Agent】DeepSeek Harness:一切皆插件

Model + Harness = AgentDeepSeek Harness 采取“一切皆插件”的设计思路。采用插件式开放架构来构建 Agent Harness:模型、工具、技能、会话、沙箱、存储、循环、调度、UI 等所有 Agent 能力均由插件组合而成,可自由替换、灵活重组。文章目录note一、一切皆插件二、多种运行模式三、DeepSeek Harness和Kimi Code CLI区别四、值得看的地方Reference一、一切皆插件DeepSeek Harness 基于具有时空可

2026-08-17 00:33:46 315

原创 【VLM】SenseNova-MARS:既搜又裁地thinking-with-images​

把“搜”和“看”焊进同一条多轮 RL 轨迹​:突破以往 VLM agent 要么只文/图搜、要么只 crop 的割裂设定,统一 text search + image search + image crop​ 三工具,要求模型在 think→act 循环里自主决定“何时搜、搜啥、何时裁、裁哪”,覆盖高分辨率图中 <5% 面积小目标 + 外部知识联合推理。BN-GSPO:给多工具 RL 训练降噪的优化器​:在 GSPO 组间标准化优势上再叠一层 minibatch 级标准化,消掉不同 prompt 轨迹长度

2026-08-12 15:07:47 370

原创 【Voice】国内高校语音AI团队盘点

上交 X-LANCE(俞凯/陈谐)SLAM-LLM、WavCube、X-Voice、X-Translator复旦 OpenMOSS(邱锡鹏)MOSS-Speech、MOSS-Audio、MOSS-TTS-Nano台大 李宏毅组TASTE、Full-Duplex-Bench系列、ASPIRin清华 张超组SALMONN系列、OmniMem清华 欧智坚组(SAT Lab)多语种ASR、医疗语音西工大 ASLP(谢磊)FlashTTS、MeanVC2、SoulX系列港中深 武执

2026-08-09 17:21:29 219

原创 【Agent】Tencent WorkBuddy Bench:面向真实工作的Benchmark

Tencent WorkBuddy Bench 的核心贡献不是提出新 Agent 模型,而是提出了一套更接近真实工作的 Agent Benchmark。抗污染任务构造:从真实 Commit/PR/业务场景反向构造 Prompt,而不是直接复制公开问题。Outcome-based Evaluation:评测 Agent 最终修改后的 Workspace 和 Artifact,而不是聊天答案。Model × Harness 联合评测:证明 Agent Harness 本身会显著影响模型最终表现。Work

2026-08-08 12:41:04 381

原创 【全模态】音视频理解模型Audio-Visual Flamingo

给出了一套比较完整的 长视频 Omni 模型训练 recipe:AV-Skills 数据 → Short → Long → Timestamp CoT → GRPOAV-Flamingo 是一个面向长视频 Audio-Visual 理解的开源 7B 模型,核心贡献不是新 Backbone,而是 AV-Skills 大规模音视频数据、Short→Long 课程训练,以及带时间戳的 TAVIT CoT + GRPO,让模型能够在长视频中进行跨时间、跨音视频模态推理。Audio-Visual 联合训练:不是简

2026-08-08 12:00:01 502

原创 【VLM-Agent】MTA-Agent: Multimodal Deep Search Agents

note - 自动数据生成流水线:基于现有VQA数据集,用ReAct循环+文搜/识图等4工具,自动构造2–4跳图文样本,多层校验去脏,产出21K数据集MTA-Vision-DeepSearch。- 训出来的 MTA-DeepSearch Agent 在 ReAct 循环里能用的变成 7 个:Web text search、Web image search(文→图描述)、Web URL reader、Reverse image search(Google Lens)、OCR(抽图上所有可见文字)、Pyth

2026-08-04 17:46:12 227

原创 【Voice】Qwen3-ASR模型

三个模型:Qwen3-ASR-1.7B:主打高精度Qwen3-ASR-0.6B:主打轻量、高吞吐Qwen3-ForcedAligner-0.6B:把已有文本和语音精确对齐,输出字词时间戳。适合字幕打轴、语音数据标注、歌词对齐。比如得到What's [time] your [time] name [time]的结果支持 30 种语言、22 种中文方言,同时具备语言识别、流式/离线识别、长语音、噪声语音和歌曲识别能力AuT 会把 100Hz 的 FBank 特征做 8 倍降采样,变成约 12.5Hz

2026-08-04 14:38:16 639

原创 【VQA】VideoChat3长视频理解模型

VideoChat3 通过 I3D-ViT 早期时空压缩 + 自适应分辨率 + 大规模重标注/合成视频指令数据 + 四阶段训练,在完全开源的前提下,用 4B 参数实现了在通用、长视频、流式视频理解上优于同/更大规模开源模型的性能,并显著提升长视频推理效率和主动流式交互能力。通用长视频多模态大模型,针对现有视频MLLM痛点:普遍将视频拆分为独立图片序列编码,丢失帧间时序运动信息;长视频输入易出现Token爆炸、推理成本高昂;多数模型仅半开源,难以完整复现。该模型原生仅支持视频+文本输入,无内置音频编码通路。

2026-08-03 00:21:17 460

原创 【VLM-RL】TAPO优化强化学习中的奖励分配问题

多模态搜索里的工具(比如图搜、截图放大)有个特殊性质:只要你给的参数一样,拿到的信息就一定一样,跟前面怎么推理的没关系。既然同一个动作在成功轨迹里是好用的,那它在失败轨迹里就不该被一棍子打死,TAPO 就是专门纠正这种“冤枉好人”的优化算法。TAPO 敏锐捕捉到 GRPO 在多步工具调用场景下“一刀切”赋值的弊端,利用工具参数的确定性在批次内做低成本反事实推理与优势补偿,在几乎无额外开销的前提下,通用且稳定地提升了多模态搜索智能体的训练效率与最终表现,同时缓解了熵崩塌与工具回避行为。文章目录note

2026-08-02 14:39:34 76 1

原创 【VLM-Agent】IMAgent缓解推理过程中的视觉遗忘

工具调用统计:在多图像任务中,lookback_reuse(反思)调用比例升至30%,证明模型学会了主动回看防遗忘。低分辨率鲁棒性:即使限制输入像素(MaxPixels从12M降到1M),IMAgent凭借动态工具缩放,性能下降幅度远小于基线模型。文章目录note一、研究动机视觉工具在推理中究竟发挥了什么作用二、IMAgent架构三、实验结果四、分析一、研究动机IMAgent通过视觉工具调用机制缓解推理过程中的视觉遗忘,在单图和多图任务中达到SOTA;论文链接:IMAgent: htt

2026-08-02 12:12:16 529

原创 【VLM】VistaHop:视觉深搜benchmark

VistaHop: Benchmarking Long-Horizon Visual DeepSearchVistaHop整体构建流程依次为:从公开高质量图像中抽取实体 → 知识增强与种子筛选 → 构造多跳证据链(平均7.43跳)→ 生成文本问答 → VQA生成与反泄漏验证(Solver-Judge-Rewrite 循环)→ 多链融合 → 人工复核。要想在 VistaHop 这种地狱级视觉推理考试中拿高分,光给模型“搜索框”没用,必须给它配上一副“放大镜(Crop)”;但即便如此,现在的AI离人类的看图

2026-08-02 11:00:06 202

原创 【LLM】Kimi K3: Open Frontier Intelligence

Kimi K3 基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)构建。这两项架构更新,都是为了让信息在更长序列和更深模型中流动得更顺畅。进一步扩大了 Mixture of Experts(MoE)的稀疏度:结合 Stable LatentMoE 框架后,模型可以在 896 个专家中高效激活 16 个。再加上训练方法和数据配方的优化,这些结构性改进让 Kimi K3 相比 K2 的整体扩展效率提升约 2.5 倍,能更有效地把算力转化为能力。

2026-07-26 21:02:58 339

原创 【Video】VideoMAE:Tube Masking与极高掩码率下的视频自监督预训练

针对视频时间冗余和信息泄漏问题,VideoMAE首创时序贯通的Tube Masking,把掩码率拉到90%-95%,逼模型学全局时空语义而非靠邻近帧“走捷径”。采用时空立方体嵌入+非对称编解码架构,仅把10%未掩码token喂给编码器,大幅降低计算成本的同时完成像素级重建预训练。这套设计让vanilla ViT无需任何额外图像/标签数据,仅靠几千条视频就能训出SOTA性能,验证了“数据质量比数量更重要”的SSVP核心规律。文章目录note一、研究动机二、论文核心三、实验结果和分析总结一、研

2026-07-20 00:11:20 397

原创 【DWT】计算两不等序列相似度:DWT

DTW(DP-matching)用于计算两个不等长、但变化趋势相关的序列的相似度。论文给出了最优的对齐规则:对称权重 + 斜率约束P=1,让对齐更准,识别错误率降到了原来的2/3针对两个时长不同、采样点数量不一致的语音特征序列,用动态时间规整(DTW)找最优非线性对齐路径,消除语速波动带来的时间轴偏差。创新引入斜率约束(P=1),禁止路径过陡/过缓,避免短语音段错误匹配长语音段,同时采用对称权重设计,确保两个序列的所有特征都被纳入计算,对齐更合理。实验验证该优化后的DTW算法在孤立词识别任务上错误率仅

2026-07-19 21:42:31 368

原创 【CLAP】音频界的CLIP:Learning Audio Concepts From Natural Language Supervision

架构设计:采用双编码器(Dual-Encoder)结构,分别用 CNN14 处理音频(Log Mel Spectrogram)和 BERT 处理文本,通过可学习线性投影将二者映射到统一的 1024 维多模态空间。训练目标:基于 CLIP 式的对比学习(Contrastive Learning),在 Batch 内计算音频-文本相似度矩阵并施加对称 InfoNCE 损失,迫使匹配的音频与文本嵌入在空间中靠近,不匹配的远离。推理机制:利用自然语言 Prompt(如 This is a sound of [l

2026-07-19 16:21:08 416

原创 【VR】结合音频特征的VR: Audio-based Near-Duplicate Video Retrieval with Audio Similarity Learning

AuSiL:视频A → X个2秒音频 embedding;视频B → Y个2秒音频 embedding → 得到 X×Y 相似度矩阵→ CNN识别矩阵中的连续斜线、偏移、伸缩等时序模式→ Chamfer聚合成最终分数这个相似度矩阵 CNN才是论文真正的核心(CNN 看相似度矩阵:识别斜线、连续块和时间对齐轨迹)。重复片段在矩阵里通常形成连续高亮轨迹:原速复制:接近斜对角线;截取或时间偏移:斜线出现在矩阵局部;加速/减速:斜线斜率发生变化;部分重复:只出现一小段连续高亮区域。它使用 Audi

2026-07-19 14:16:09 327 1

原创 【MAE】音频自监督训练Masked Autoencoders that Listen

声音 → 频谱图: 把声音变成一张"热力图",横轴是时间,纵轴是频率这个Audio-MAE工作创新点:频谱图跟图片不一样——它局部相关性特别强。图片里一个猫耳朵在左上角、尾巴在右下角,关系不大;但频谱图里,低频和高频的谐波是绑在一起的,时间上相邻的音素也是连续的。所以作者给解码器加了"局部窗口注意力"——不让它一眼看全图,而是像戴了"隧道镜"一样,每次只看一小块区域再拼接。这样重构出来的声音细节更好,分类准确率也更高。文章目录note一、研究动机二、论文核心(Audio-MAE方法)三、实验

2026-07-19 01:05:15 413

原创 【Audio表征】BEATs: Audio Pre-Training with Acoustic Tokenizers

BEATs: Audio Pre-Training with Acoustic Tokenizers(ICML 2023),目标是做通用音频表征预训练,也就是让模型能理解各种声音:人声、音乐、环境声、动物声、车辆声、事件声等。BEATs 把音频也变成“离散 token”,然后做类似 BERT 的 mask token prediction。但音频不像文本天然有词,所以 BEATs 用迭代训练:第 1 轮:用随机投影生成粗糙 acoustic token → 训练 audio SSL model第 2

2026-07-18 18:49:56 654

原创 【Audio】Audio encoder相关Benchmark

Audio encoder相关BenchmarkBenchmark 评估什么 适合你们用来判断什么HEAR Benchmark 通用音频表征,覆盖 speech、environmental sound、music 等多个领域 判断一个 audio embedding 是否泛化好AudioSet 大规模音频事件分类,常用 mAP 判断模型对环境声、音乐、事件声的理解能力ESC-50 环境声音分类 判断对常见环境声是否强MAEB 新的大规模音频 embedding benchmark,覆盖 speec

2026-07-18 18:39:23 198

原创 【VR】Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retri

Partially Relevant Video Retrieval任务描述:文本只描述长视频中的一小段内容,但系统要把整条未剪辑视频召回出来。DreamPRVR 用轻量扩散模型先“想象”出整条视频的全局语义,再用它约束局部片段匹配,避免只因某几个相似画面就召回错误视频。思路:“先看全局,再看局部”:先生成全局 Register:从整条视频特征出发;用轻量扩散模型反复去噪、提纯;得到少量代表整条视频整体语义的 global registers。再增强局部帧/片段特征:将 global registe

2026-07-18 17:54:48 401

原创 【VR】 A CLIP-Hitchhiker’s Guide to Long Video Retrieval

本文提出了一种基于帧相关性加权的均值聚合(Weighted-Mean Pooling)方案,核心思路是对CLIP提取的每一帧特征分配权重,再加权求和得到视频级表征,而非均匀平均。即不训练复杂视频编码器,而是让文本 Query 从长视频中挑出相关帧,再加权聚合 CLIP 帧特征完成文本搜视频。文本 Query 决定长视频里哪些帧更重要,再用这些关键帧组成视频表示。它比较了三种帧打分方式:Query-scoring:直接用文本和每帧的 CLIP 相似度打分,不新增可学习参数。Self-attention

2026-07-18 17:06:49 363

原创 【VR】Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings

一、研究动机二、Embed-RL嵌入器引导的强化学习(EG-RL)框架可追溯思维链(T-CoT)高效训练与数据构建三、实验结果MMEB-V2 综合表现UVRB 视频检索表现消融实验验证必要性四、分析与讨论一、研究动机Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal EmbeddingsECCV 2026这篇论文《Embed-RL: Reinforcement Learning for Reasonin

2026-07-16 10:19:45 459 1

原创 【Emb】Qwen3-VL-Embedding&Qwen3-VL-Reranker

Qwen3-VL-Embedding/Reranker 通过 统一架构、多阶段训练、高质量合成数据、效率优化 实现了 SOTA 的多模态检索性能,并在纯文本任务上保持竞争力,为多模态搜索、RAG、内容理解等应用提供了强有力基础模型。三阶段训练的必要性:弱监督预训练保证泛化,高质量微调提升任务特异性,蒸馏与融合解决任务冲突,形成正向迭代Reranker 模型:把 Query 和候选内容同时送入模型,通过跨注意力做细粒度交互,最后比较生成 “yes” 和 “no” 的概率,得到相关性分数。文章目录not

2026-07-15 15:46:01 144 1

原创 【VR】CoVR-R:Reason-Aware Composed Video Retrieval

任务:参考视频 + 修改文本 → 召回修改后的目标视频。先推理后检索(Reason-then-Retrieve)框架:参考视频 + 修改要求 → 推断修改后的视觉后果 → 构造目标视频向量 → 向量检索文章目录note一、研究动机二、CoVR-R 方法1. 先推理后检索(Reason-then-Retrieve)框架2. CoVR-R 推理基准三、实验结果与性能分析1. 核心性能表现2. 消融实验洞察四、定性分析与失败边界五、总结一、研究动机CoVR-R:Reason-Aware

2026-07-13 17:06:33 332

原创 【VR】LoVR: A Benchmark for Long Video Retrieval in Multimodal

这篇论文提出了一个名为 LoVR(Long Video Retrieval) 的新型基准数据集,专门针对长视频与文本之间的跨模态检索任务,包括文本到视频/片段(text-to-video/clip)以及视频/片段到文本(video/clip-to-text)。文章目录note一、 研究动机与核心问题二、 论文核心:LoVR 数据集与构建方法1. 数据集规模与特色2. 高质量标注流水线3. 人工质量验证三、 实验结果与分析1. 当前模型的性能上限2. 模型架构的局限性3. 关键发现:增加

2026-07-13 16:13:47 362

原创 【VR】视频检索V-Agent: An Interactive Video Search System Using Vision-Language Models

训练一个视频表征模型,用于query文本检索召回视频。文本、视频画面、ASR 文本处于同一个向量空间中的跨模态表征。因为GME模型没有经过图像/视频训练,所以这里的对比中GME是对帧图emb进行mean pooling处理multi-agent:Routing Agent:判断该聊天还是搜索。Search Agent:调用检索模型召回 Top-10,再调用 LLM 重排。Chat Agent:基于检索结果生成摘要,并支持用户选择多个视频继续提问。文章目录note一、研究动机二、V-Agen

2026-07-13 15:39:53 458

原创 【VR】Aligning Moments in Time using Video Queries

任务:给一段查询视频,再给一段较长目标视频,模型要找出目标视频里与查询视频语义相同的那一段,并输出开始、结束时间。模型有两个预测头:前景/背景分类头:判断目标视频中每个时间点是否属于匹配动作。边界预测头:预测该片段距离开始、结束边界的偏移。使用 Soft-DTW 做两次序列对齐:Pre-fusion alignment:在 Transformer 融合前,对原始查询帧和目标帧进行对齐。作用是先找到:哪些目标帧在视觉和动作语义上可能对应查询视频。Post-fusion alignment:经过 T

2026-07-13 14:50:11 297

4-消息传递图神经网络.pdf

4-消息传递图神经网络.pdf

2021-06-19

常用算法总结C&C++.pdf

常用算法总结C&C++.pdf

2021-01-14

EdgeRec边缘计算在推荐系统的应用

EdgeRec边缘计算在推荐系统的应用

2022-02-24

基于高阶和时序特征的图神经网络社会推荐研究

基于高阶和时序特征的图神经网络社会推荐研究

2023-04-02

Python思维导图.rar

python思维导图,助力学习python知识体系,包含基础知识、列表元组、面向对象模块、数据类型、文件对象、字符串、字典集合等等python知识思维导图

2020-05-10

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除