- 博客(1449)
- 资源 (4)
- 收藏
- 关注
原创 【LLM】多模态LLM综述MultiModal Large Language Models
note(一)现有的 MM-LLM 的趋势:(1)从专门强调 MM 理解对特定模态的生成的进展,并进一步演变为任何到任何模态的转换(例如,MiniGPT-4 → MiniGPT-5 → NExT-GPT);(2) 从 MM PT 提升到 SFT,然后到 RLHF,训练管道进行连续细化,努力更好地与人类意图对齐并提高模型的会话交互能力(例如,BLIP-2 → InstructBLIP →DRESS);(3) 实施多样化模态扩展(例如,BLIP-2 → X-LLM 和 InstructBLIP→X-In
2024-06-02 13:05:46
5432
8
原创 【Video】VideoMAE:Tube Masking与极高掩码率下的视频自监督预训练
针对视频时间冗余和信息泄漏问题,VideoMAE首创时序贯通的Tube Masking,把掩码率拉到90%-95%,逼模型学全局时空语义而非靠邻近帧“走捷径”。采用时空立方体嵌入+非对称编解码架构,仅把10%未掩码token喂给编码器,大幅降低计算成本的同时完成像素级重建预训练。这套设计让vanilla ViT无需任何额外图像/标签数据,仅靠几千条视频就能训出SOTA性能,验证了“数据质量比数量更重要”的SSVP核心规律。文章目录note一、研究动机二、论文核心三、实验结果和分析总结一、研
2026-07-20 00:11:20
324
原创 【DWT】计算两不等序列相似度:DWT
DTW(DP-matching)用于计算两个不等长、但变化趋势相关的序列的相似度。论文给出了最优的对齐规则:对称权重 + 斜率约束P=1,让对齐更准,识别错误率降到了原来的2/3针对两个时长不同、采样点数量不一致的语音特征序列,用动态时间规整(DTW)找最优非线性对齐路径,消除语速波动带来的时间轴偏差。创新引入斜率约束(P=1),禁止路径过陡/过缓,避免短语音段错误匹配长语音段,同时采用对称权重设计,确保两个序列的所有特征都被纳入计算,对齐更合理。实验验证该优化后的DTW算法在孤立词识别任务上错误率仅
2026-07-19 21:42:31
323
原创 【CLAP】音频界的CLIP:Learning Audio Concepts From Natural Language Supervision
架构设计:采用双编码器(Dual-Encoder)结构,分别用 CNN14 处理音频(Log Mel Spectrogram)和 BERT 处理文本,通过可学习线性投影将二者映射到统一的 1024 维多模态空间。训练目标:基于 CLIP 式的对比学习(Contrastive Learning),在 Batch 内计算音频-文本相似度矩阵并施加对称 InfoNCE 损失,迫使匹配的音频与文本嵌入在空间中靠近,不匹配的远离。推理机制:利用自然语言 Prompt(如 This is a sound of [l
2026-07-19 16:21:08
345
原创 【VR】结合音频特征的VR: Audio-based Near-Duplicate Video Retrieval with Audio Similarity Learning
AuSiL:视频A → X个2秒音频 embedding;视频B → Y个2秒音频 embedding → 得到 X×Y 相似度矩阵→ CNN识别矩阵中的连续斜线、偏移、伸缩等时序模式→ Chamfer聚合成最终分数这个相似度矩阵 CNN才是论文真正的核心(CNN 看相似度矩阵:识别斜线、连续块和时间对齐轨迹)。重复片段在矩阵里通常形成连续高亮轨迹:原速复制:接近斜对角线;截取或时间偏移:斜线出现在矩阵局部;加速/减速:斜线斜率发生变化;部分重复:只出现一小段连续高亮区域。它使用 Audi
2026-07-19 14:16:09
278
1
原创 【MAE】音频自监督训练Masked Autoencoders that Listen
声音 → 频谱图: 把声音变成一张"热力图",横轴是时间,纵轴是频率这个Audio-MAE工作创新点:频谱图跟图片不一样——它局部相关性特别强。图片里一个猫耳朵在左上角、尾巴在右下角,关系不大;但频谱图里,低频和高频的谐波是绑在一起的,时间上相邻的音素也是连续的。所以作者给解码器加了"局部窗口注意力"——不让它一眼看全图,而是像戴了"隧道镜"一样,每次只看一小块区域再拼接。这样重构出来的声音细节更好,分类准确率也更高。文章目录note一、研究动机二、论文核心(Audio-MAE方法)三、实验
2026-07-19 01:05:15
361
原创 【Audio表征】BEATs: Audio Pre-Training with Acoustic Tokenizers
BEATs: Audio Pre-Training with Acoustic Tokenizers(ICML 2023),目标是做通用音频表征预训练,也就是让模型能理解各种声音:人声、音乐、环境声、动物声、车辆声、事件声等。BEATs 把音频也变成“离散 token”,然后做类似 BERT 的 mask token prediction。但音频不像文本天然有词,所以 BEATs 用迭代训练:第 1 轮:用随机投影生成粗糙 acoustic token → 训练 audio SSL model第 2
2026-07-18 18:49:56
601
原创 【Audio】Audio encoder相关Benchmark
Audio encoder相关BenchmarkBenchmark 评估什么 适合你们用来判断什么HEAR Benchmark 通用音频表征,覆盖 speech、environmental sound、music 等多个领域 判断一个 audio embedding 是否泛化好AudioSet 大规模音频事件分类,常用 mAP 判断模型对环境声、音乐、事件声的理解能力ESC-50 环境声音分类 判断对常见环境声是否强MAEB 新的大规模音频 embedding benchmark,覆盖 speec
2026-07-18 18:39:23
181
原创 【VR】Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retri
Partially Relevant Video Retrieval任务描述:文本只描述长视频中的一小段内容,但系统要把整条未剪辑视频召回出来。DreamPRVR 用轻量扩散模型先“想象”出整条视频的全局语义,再用它约束局部片段匹配,避免只因某几个相似画面就召回错误视频。思路:“先看全局,再看局部”:先生成全局 Register:从整条视频特征出发;用轻量扩散模型反复去噪、提纯;得到少量代表整条视频整体语义的 global registers。再增强局部帧/片段特征:将 global registe
2026-07-18 17:54:48
383
原创 【VR】 A CLIP-Hitchhiker’s Guide to Long Video Retrieval
本文提出了一种基于帧相关性加权的均值聚合(Weighted-Mean Pooling)方案,核心思路是对CLIP提取的每一帧特征分配权重,再加权求和得到视频级表征,而非均匀平均。即不训练复杂视频编码器,而是让文本 Query 从长视频中挑出相关帧,再加权聚合 CLIP 帧特征完成文本搜视频。文本 Query 决定长视频里哪些帧更重要,再用这些关键帧组成视频表示。它比较了三种帧打分方式:Query-scoring:直接用文本和每帧的 CLIP 相似度打分,不新增可学习参数。Self-attention
2026-07-18 17:06:49
325
原创 【VR】Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings
一、研究动机二、Embed-RL嵌入器引导的强化学习(EG-RL)框架可追溯思维链(T-CoT)高效训练与数据构建三、实验结果MMEB-V2 综合表现UVRB 视频检索表现消融实验验证必要性四、分析与讨论一、研究动机Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal EmbeddingsECCV 2026这篇论文《Embed-RL: Reinforcement Learning for Reasonin
2026-07-16 10:19:45
422
原创 【Emb】Qwen3-VL-Embedding&Qwen3-VL-Reranker
Qwen3-VL-Embedding/Reranker 通过 统一架构、多阶段训练、高质量合成数据、效率优化 实现了 SOTA 的多模态检索性能,并在纯文本任务上保持竞争力,为多模态搜索、RAG、内容理解等应用提供了强有力基础模型。三阶段训练的必要性:弱监督预训练保证泛化,高质量微调提升任务特异性,蒸馏与融合解决任务冲突,形成正向迭代Reranker 模型:把 Query 和候选内容同时送入模型,通过跨注意力做细粒度交互,最后比较生成 “yes” 和 “no” 的概率,得到相关性分数。文章目录not
2026-07-15 15:46:01
87
1
原创 【VR】CoVR-R:Reason-Aware Composed Video Retrieval
任务:参考视频 + 修改文本 → 召回修改后的目标视频。先推理后检索(Reason-then-Retrieve)框架:参考视频 + 修改要求 → 推断修改后的视觉后果 → 构造目标视频向量 → 向量检索文章目录note一、研究动机二、CoVR-R 方法1. 先推理后检索(Reason-then-Retrieve)框架2. CoVR-R 推理基准三、实验结果与性能分析1. 核心性能表现2. 消融实验洞察四、定性分析与失败边界五、总结一、研究动机CoVR-R:Reason-Aware
2026-07-13 17:06:33
311
原创 【VR】LoVR: A Benchmark for Long Video Retrieval in Multimodal
这篇论文提出了一个名为 LoVR(Long Video Retrieval) 的新型基准数据集,专门针对长视频与文本之间的跨模态检索任务,包括文本到视频/片段(text-to-video/clip)以及视频/片段到文本(video/clip-to-text)。文章目录note一、 研究动机与核心问题二、 论文核心:LoVR 数据集与构建方法1. 数据集规模与特色2. 高质量标注流水线3. 人工质量验证三、 实验结果与分析1. 当前模型的性能上限2. 模型架构的局限性3. 关键发现:增加
2026-07-13 16:13:47
339
原创 【VR】视频检索V-Agent: An Interactive Video Search System Using Vision-Language Models
训练一个视频表征模型,用于query文本检索召回视频。文本、视频画面、ASR 文本处于同一个向量空间中的跨模态表征。因为GME模型没有经过图像/视频训练,所以这里的对比中GME是对帧图emb进行mean pooling处理multi-agent:Routing Agent:判断该聊天还是搜索。Search Agent:调用检索模型召回 Top-10,再调用 LLM 重排。Chat Agent:基于检索结果生成摘要,并支持用户选择多个视频继续提问。文章目录note一、研究动机二、V-Agen
2026-07-13 15:39:53
418
原创 【VR】Aligning Moments in Time using Video Queries
任务:给一段查询视频,再给一段较长目标视频,模型要找出目标视频里与查询视频语义相同的那一段,并输出开始、结束时间。模型有两个预测头:前景/背景分类头:判断目标视频中每个时间点是否属于匹配动作。边界预测头:预测该片段距离开始、结束边界的偏移。使用 Soft-DTW 做两次序列对齐:Pre-fusion alignment:在 Transformer 融合前,对原始查询帧和目标帧进行对齐。作用是先找到:哪些目标帧在视觉和动作语义上可能对应查询视频。Post-fusion alignment:经过 T
2026-07-13 14:50:11
280
原创 【VR】GVE视频表征:Generalizing Video Embedding via Synthesized Multimodal Pyramid Curriculum
一、研究动机二、GVE1. 诊断性评测基准 (UVRB)2. 大规模合成数据流程 (V-SynFlow)3. 模态金字塔课程学习 (Modality Pyramid)三、模型训练四、实验结果与模型性能Reference一、研究动机Towards Universal Video Retrieval: Generalizing Video Embedding via Synthesized Multimodal Pyramid Curriculum模型:https://huggingface
2026-07-13 11:49:37
197
原创 【KDD2026】MLT-Dedup:通过多阶段表征和时空匹配进行视频去重
MLT-Dedup 用“稀疏 Clip 特征做大规模召回、细粒度 Frame 特征做精确复核”,再通过静态特征和帧间差分特征定位重复片段,实现了兼顾召回率、准确率和工程成本的视频去重系统。面向大规模在线短视频平台,提出了一个结合多级视频表示与时空匹配的高效去重框架MLT-Dedup。该框架采用“粗筛精判”的两阶段流水线:首先利用多级视频编码器(ML-VE)同时提取稀疏的片段级嵌入用于 HNSW 快速候选检索,以及细粒度的帧级嵌入用于下游精判;随后引入差分特征增强的时空匹配模块(DiF-SiM),对候选
2026-07-12 23:40:17
401
原创 【VLA】task1:Embodied基础之MuJoCo机械臂交互
MuJoCo 专用的世界描述语言(MJCF),定义了世界(重力、地板、灯光)、机械臂本体、夹爪与物体等机械臂核心类:负责计算机械臂该怎么动。逆运动学(IK - solve_ik_pose):这是机器人学最经典的问题。你告诉机械臂“手要去桌面上坐标 (0.4, 0.1, 0.03) 的位置抓东西”,代码会通过雅可比矩阵数学计算,反推算出它的 6个关节电机分别需要转动多少度 才能正好把手伸到那里。动作平滑(轨迹规划 - plan_trajectory):如果让电机直接转到目标角度,机械臂会瞬间“瞬移”并鬼
2026-07-12 15:22:27
218
原创 【VCD】A Fast Partial Video Copy Detection Using KNN and Global Feature Database
通过巧妙的系统工程优化(KNN 索引 + Transformer 特征增强 + 约束化网络流),成功解决了深度学习特征在大规模视频拷贝检索中“算得慢、存不下”的落地难题。局限与启发:尽管性能大幅提升,但系统高度依赖抽帧频率(FPS),较低的频率虽然能提升速度,但不可避免地会损失时间维度的定位分辨率;此外,对于画面内容窗口极小或经过极度严重形变的视频,检测依然可能失败。未来的研究可以尝试将底层的 CNN 特征替换为当前更强大的 Video Swin Transformer 或 CLIP 视觉特征,以进一步
2026-07-11 23:26:33
363
原创 【VLM】MiniCPM-o 4.5:全双工实时交互
作者巧妙地将语音token生成委托给轻量级Llama语音token解码器(0.3B),利用主干网络的隐藏状态(经MLP reshape)来指导韵律和风格。音频采用Whisper Medium编码器(0.3B)以分块流方式处理,每秒生成50个特征token,再经MLP投影器5倍时间压缩为每秒10个音频token。语音解码器包括:自回归生成离散S3语音token的交错语音token解码器,以及将语音token转换为波形的流式流匹配解码器。所有组件在token级可微分连接,支持端到端梯度传播。
2026-07-05 18:55:41
324
2
原创 【AAAI 2026】VQAThinker:通过RL进行可解释VQA训练
本文提出了VQAThinker,一种基于推理的VQA框架,通过结合大型多模态模型和强化学习,实现了可泛化和可解释的视频质量评估。它把视频质量评估从“直接回归一个分数”,升级成“先像人一样分析视频有哪些质量问题,再给出分数”,并用 GRPO 强化学习只靠 MOS 分数监督,就训练出既能打分、又能解释的视频质量评估模型。VQAThinker引入了三种VQA特定奖励函数,分别用于细粒度的得分预测、相对质量判别和时间失真建模。广泛的实验表明,VQAThinker在领域内和领域外的基准测试中均取得了最先进的性能,
2026-07-05 18:31:44
212
原创 【ACMMM 2025】VQA²: Visual Question Answering for Video Quality Assessment
核心:把传统的视频->质量分,升级为视频->问多个质量问题->得到多维质量理解->输出质量分视频质量评估不只是回归一个分数,而可以变成多模态问答任务。构建 VQA² Instruction Dataset。它是面向视频质量评估的视觉问答指令数据集,包含约 15.8 万条视频质量相关问答数据,覆盖 UGC 视频、流媒体视频、AIGC 视频等类型练 VQA² 系列模型。模型不是只抽几帧看图,而是把 视觉 token 和 运动 token 结合起来【】文章目录note一、研究背景二、VQA²sta
2026-07-05 17:55:39
280
原创 【VLM】视频理解LLaVA-OneVision-2(Codec-stream)
LLaVA-OneVision-2(LLaVA-OV-2) 是 LLaVA-OneVision 系列的下一代开源多模态大模型,定位是一个 8B 级统一视觉语言模型:同一个模型同时处理 图像、长视频、空间定位、时间定位、目标跟踪、操作轨迹理解 等任务。官方项目页强调它是 “fully-open recipe”,模型、数据、训练流程、日志都开放;论文摘要也说它是目前 OneVision 系列里能力最强的版本Codec-stream Tokenization:先看 codec 里的运动/残差信息 → 选择关键
2026-07-04 22:40:16
265
原创 【VTG】 VTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal Ground
VTG-LLM 通过巧妙的时间嵌入设计、特殊时间 token 和轻量级槽位压缩,成功将时间戳知识注入视频 LLM,在多个 VTG 任务上设立了新的零样本标杆。其配套的高质量数据集也为该领域的进一步研究提供了宝贵资源。这项工作为构建真正具备细粒度时空理解能力的通用视频助手迈出了坚实的一步。问题:问题一:关于时间嵌入的零初始化策略问题二:关于时间Token与Caption质量的权衡问题三:关于槽位压缩的实际收益文章目录note一、研究动机二、论文核心1. 序列时间嵌入(Sequence-Ti
2026-07-03 03:54:38
359
原创 【VTG】T2SGrid: Temporal-to-Spatial Gridification for VTG
T2SGrid 的最大贡献在于范式创新:它没有直接设计复杂的时间模块,而是巧妙地借用了视觉大模型原生的空间注意力机制,将时间流转化为空间网格。这种方法不仅解决了现有时间编码的缺陷,还让静态图像模型具备了强大的视频时序理解能力,为视频大模型的发展提供了一个简洁而高效的新思路。文章目录note一、 研究动机:为什么需要 T2SGrid?二、 T2SGrid1. 滑动窗口时空网格化(Sliding-Window Spatiotemporal Gridification)2. 双重时间建模机制(1)
2026-07-03 03:40:13
342
原创 【VHD】SummDiff: 将Diffusion用于Video Summarization任务
新问题定义:首次将视频摘要从回归问题重新定义为条件生成问题,允许一个视频对应多个合理摘要,契合任务的主观本质新方法:首次将扩散模型引入视频摘要,设计了基于 Transformer 交叉注意力的评分去噪器,能够从随机噪声生成多样化的高质量摘要新评估工具:从背包优化理论出发,提出了 CIS、WIR、WSE 三个新指标,更准确地衡量预测评分对最终摘要质量的贡献文章目录note一、研究动机1. 视频摘要的天然主观性2. 传统方法的根本性矛盾3. 核心洞察:从回归到生成4. 为什么选扩散模型二、论
2026-07-03 03:21:13
323
原创 【VHD】AHA - Predicting What Matters Next: Online Highlight Detection Without Looking Ahead 流视频场景HD
AHA首次实现了严格因果约束下的在线视频高亮检测,通过轻量解耦头、任务聚焦的动态记忆和抗干扰训练,在零样本和全监督设置下均超越离线方法,为机器人、无人机等实时智能体提供了“边看边懂”的新范式。文章目录note一、研究动机现实需求现有方法的致命缺陷二、AHA框架:核心设计思想1. 三大预测头 —— 各司其职2. 动态SinkCache —— 恒定内存的秘诀3. 不确定性感知评分函数4. 抗退化训练(Video Quality Dropout)三、数据集贡献:HIHD四、实验结果1.
2026-07-03 02:40:37
329
原创 【VHD】TVHighlights和LTV-HD高光检测
提出 TVHighlights 数据集和 LTV-HD 训练框架。前者利用真实用户的二次创作行为作为“隐式投票”来筛选高光,后者通过“弱监督预训练 + LLM与轻量模型迭代协作”实现免人工训练。文章目录note一、核心痛点与解决方案二、TVHighlights1、TVHighlights 数据集构建2、LTV-HD 框架机制三、实验结果与结论Reference一、核心痛点与解决方案论文:TVHighlights- LLM-Guided Human-Free Collaborative
2026-07-03 01:55:14
318
原创 【Vid-llm】Video Quality Assessment研究进展
Video Quality Assessment,视频质量评估。常见输出:质量分数 + 质量问题原因,比如模糊、噪声、压缩块、抖动、曝光差、运动不稳定、构图差等。VQA近几年的发展路线:1、参考论文:FAST-VQA → DOVER → MD-VQA → MaxVQA → LMM-VQA → VQA² → VQAThinker → MDS-VQA2、路线演变:高效打分模型 → 多维质量建模 → 可解释评估 → 大模型/VQA化 → RL增强 → 数据选择优化。文章目录note一、Video Qu
2026-06-28 18:36:03
251
原创 【VLM】Seed2.1模型
面向视觉理解场景,Seed2.1 Pro 在 CharXiv-RQ、MeasureBench 等多个基准上取得最高分,体现出模型在复杂文档理解、图表读取、数值识别和视觉细节判断上的进一步提升。这类能力可以帮助模型在处理 PDF、报告、图表和多页材料时减少误读,增强对非结构化信息的感知。面向视觉理解场景,Seed2.1 Pro 在 CharXiv-RQ、MeasureBench 等多个基准上取得最高分,体现出模型在复杂文档理解、图表读取、数值识别和视觉细节判断上的进一步提升。这类能力可以帮助模型在处理 PD
2026-06-28 17:03:57
201
原创 【Vid-Agent】长视频理解VideoTemp-o3框架
论文核心:让视频大模型学会“先找关键时间段,再放大看这段视频,最后回答问题”的长视频 Agent 模型。它不是简单均匀抽帧看完整视频(以往这样如果漏抽对应帧就会遗漏信息),而是走 localize → clip → answer 流程:localize:temporal grounding,定位视频时间范围crop:从原视频里截取这个时间段的视频 clip,并更密集抽帧给模型看。注意这里不是对视频帧进行图片裁剪。QA这篇论文提出了一种统一的主动思维视频框架VideoTemp-o3,通过按需视频裁剪和
2026-06-28 16:02:44
283
原创 【CVPR-2026】MDS-VQA: Model-Informed Data Selection for Video Quality Assessment
1、文主实验用的 base VQA model 是 VisualQuality-R1,一个 VLM/视觉语言模型式的视频质量评估模型;微调方式是 LoRA + reinforcement-learning-to-rank,不是简单的“视频 → MOS 分数”的 MSE 回归。2、他们在主实验中采用 VisualQuality-R1 作为 base VQA model,因为它是强的 VLM setting;failure predictor 也是在这个 base model 上加 LoRA,并用固定 pro
2026-06-27 01:13:53
460
原创 【VLM】视频理解benchmark:Video-MME v1和v2
基准内置12种独立任务题型,覆盖基础视觉→时序动态→高阶综合推理全维度:时序行为、运动模式、多目标跨帧追踪、时序先后推理、事件因果推导、长视频摘要、跨模态信息融合、多语言视频理解、细节定位、空间关系推理、抽象剧情理解、多线索综合问答文章目录note一、Video-MME二、Video MME 12类任务体系三、Video MME关键实验结果Reference一、Video-MME论文:Video-MME: The First-Ever Comprehensive Evaluation Be
2026-06-21 17:40:08
326
原创 【CV】自监督DINOv3算法
路线对比:CLIP路线:图片 + 文本→ 学语义DINO路线:只有图片→ 学视觉世界本身模型越大,分类能力越强,但容易出现Dense Feature Collapse(稠密特征退化)问题,局部patch特征开始混。比如CLIP、SigLIP等模型擅长图片xx是什么,但可能不擅长它长什么样、和旁边的像不像等;再比如五官边界模糊等,后者更靠dense featureDINOv3是目前最强的一批纯视觉 Foundation Model,它试图证明:不用文本监督(CLIP),光靠图片自监督学习,也能学出世界
2026-06-20 23:54:13
770
原创 【Vid llm】VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding
提出的VideoLLaMA 3通过以视觉为中心的训练范式和框架设计,显著提高了图像和视频理解的性能。该模型在大多数图像和视频理解基准测试中表现出色,特别是在图表理解和数学问题上。Any-resolution Vision Tokenization (AVT):采用AVT技术,动态处理不同分辨率的图像和视频,保留了更多细节痛点:视频数据质量太差,但作者认为视频等于一系列的图片,所以可以先学看图再看视频视觉token太多:作者使用Differential Frame Pruner(DiffFP)保留相互
2026-06-20 21:58:45
258
原创 【Vid llm】E-VAds: An E-commerce Short Videos Understanding Benchmark
一、E-VAds: An E-commerce Short Videos Understanding Benchmark for MLLMsE-VAds: An E-commerce Short Videos Understanding Benchmark for MLLMs链接:https://arxiv.org/abs/2602.08355开源:https://github.com/TaobaoTmall-AlgorithmProducts/E-VAds_Benchmark电商视频现有MLLM
2026-06-19 23:17:30
283
原创 【VLM】多模态理解之人脸特征识别(FaceLLM、FaceXBench)
传统人脸识别模型如ArcFace、AdaFace、FaceNet、IResNet50等,是输入两张人脸图片,输出一个相似度分数,比如大于0.5说明两张图片的人脸是同个人- FaceXBench:研究当前 GPT-4o、Qwen2-VL、InternVL 等多模态大模型到底具备多强的人脸理解能力。作者构建了首个综合性人脸评测基准 FaceXBench,覆盖人脸识别、明星识别、年龄性别预测、表情分析、活体检测、Deepfake 检测等 14 项任务,共 5000 道测试题。- Benchmarking ML
2026-06-19 16:42:17
280
原创 【VLM】JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence
JoyAI,实时视频 Agent(Streaming Video Agent):Video Understanding + Agent Policy Learning输入:连续的视频流(每秒若干帧)+ 用户上下文;输出:每秒做一个动作决策——说话(response)、沉默(silence)或者委托后台 Agent(delegate)。文章目录note一、研究背景二、JoyAI-VL-Interaction三、实验设计四、结果分析五、论文评价1、优点与创新2、不足与反思六、关键问题问
2026-06-17 01:14:10
475
原创 【OPD】Black-Box On-Policy Distillation of Large Language Models
判别器作为on-policy奖励模型,在训练过程中不断适应学生的行为,提供了稳定且动态的监督信号。对应的loss为Bradley-Terry loss,具体公式为-loss log σ(D(y_t)-D(y_s))生成器根据给定的提示生成响应,判别器则评估这些响应的质量,区分教师和学生的输出。生成器的目标是生成判别器无法区分的响应,而判别器的目标是区分教师和学生的响应GAD框架有效地解决了黑箱LLM蒸馏的关键挑战,通过在最小最大博弈中训练学生模型和适应性判别器,无需任何logits级别的监督实验结果表
2026-06-16 16:02:29
503
Python思维导图.rar
2020-05-10
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅