- 博客(318)
- 问答 (1)
- 收藏
- 关注
原创 【ICLR 2025】ECALP:高效上下文感知标签传播,零/少样本免训练视觉语言模型自适应|从免训练VLM适配视角
ECALP(ICLR 2025)论文解读:免训练标签传播实现VLM零/少样本自适应,11个细粒度基准平均精度64.00%(RN50)/70.54%(ViT-B/16),固定超参、30倍加速,可即插即用于CLIP/BLIP/ALBEF。
2026-08-17 21:06:33
25
原创 【ICLR 2025】BGE-ICL 论文解读:让文本嵌入模型学会少样本学习|从稠密检索与 RAG 工程视角
【ICLR 2025】bge-en-icl 在查询侧拼接少样本示例激活 LLM 上下文学习能力,零架构改动拿下 MTEB 56 任务平均 71.67 与 AIR-Bench QA 54.36 双 SOTA,验证 simplicity is best。
2026-08-17 20:45:09
17
原创 【ICLR 2025】InvICL:重新思考上下文学习中的不变性|从LLM上下文学习理论视角
ICLR 2025 论文解读:InvICL 通过留一法预编码首次同时满足置换不变性、信息无泄漏与上下文相互依赖;全任务平均 42.4、未见领域平均 48.4,置换敏感度降至 0.00。
2026-08-17 20:23:57
19
原创 【ICLR 2026】IC-Custom:基于上下文学习的多样化图像定制统一框架|从扩散模型统一范式视角
【ICLR 2026】IC-Custom 论文解读:用上下文学习把位置感知(掩码填充)与位置自由(文生图)两类图像定制统一进一个 DiT 框架,仅训 0.4% 参数即获 +73% 人类偏好,附 12K 真实优先数据集与 ICMA 机制详解。
2026-08-17 20:09:45
155
原创 【CVPR 2025】InstaManip:从示例中瞬时学会图像编辑,自回归模型的小样本图像操作|从多模态生成与上下文学习视角
【CVPR 2025】InstaManip 论文解读:自回归模型用分组自注意力两阶段上下文学习实现小样本图像编辑,CLIP-Dir 19.81、人类评估领先≥19%,分布内外全面 SOTA。
2026-08-17 19:41:23
37
原创 【WACV 2026】DSV-LFS:少样本分割的语义+视觉双提示统一框架|从多模态知识注入视角
DSV-LFS 融合 LLM 语义提示与 4D 稠密匹配视觉提示,单阶段端到端刷新少样本分割 SOTA:COCO-20ⁱ 一shot 71.33 mIoU(+17.43)、跨域 COCO→Pascal 80.67 mIoU(+1.07)。
2026-08-17 19:20:38
62
原创 【ICCV 2025】PAHNet:保守与激进的平衡,小样本分割的原型-亲和混合网络|从少样本视觉理解视角
ICCV 2025 PAHNet 论文解读:原型-亲和混合网络平衡保守与激进预测,PASCAL 1-shot 达 71.6 mIoU(+4.8),COCO 5-shot 59.2 mIoU,双骨干即插即用
2026-08-17 19:00:02
45
原创 【ICLR 2025】Vector-ICL:向量即上下文,连续向量表示上的上下文学习|从多模态输入接口视角
Vector-ICL(ICLR 2025)用轻量投影器把任意编码器的连续向量接入 LLM 上下文:仅 next-token 预训练即可激活,任务微调后 5 个情感分类数据集平均 90.2%,全面超越 few-shot ICL(79.9%)与 soft prompt(87.4%)。
2026-08-17 10:52:07
205
原创 【CVPR 2025】3D VLM 稠密知识 × 少样本精准校准:广义少样本三维点云分割框架 GFS-VL|从三维场景理解视角
【CVPR 2025】GFS-VL 论文解读:用精准 few-shot 原型校准 3D VLM 稠密伪标签,ScanNet200 5-shot HM 43.12(+28.57pp),贡献 45+18 新类基准。
2026-08-17 08:29:37
161
原创 【CVPR 2025】A3:不可学习样本的少样本提示学习,跨模态对抗特征对齐|从数据保护与AI安全视角
【CVPR 2025】A3 论文解读:不可学习样本(UE)在少样本提示学习下是否仍有效?自适应 UE 攻击 vs 跨模态对抗特征对齐防御,Caltech-101 精度从 75.53 恢复到 94.28,α_h 最高提升 33%。
2026-08-16 10:51:29
54
原创 【CVPR 2025】A3:不可学习样本的少样本提示学习,跨模态对抗特征对齐|从数据保护与AI安全视角
【CVPR 2025】A3 论文解读:不可学习样本(UE)在少样本提示学习下是否仍有效?自适应 UE 攻击 vs 跨模态对抗特征对齐防御,Caltech-101 精度从 75.53 恢复到 94.28,α_h 最高提升 33%。
2026-08-16 10:50:31
78
原创 【CVPR 2025】UNEM:展开广义EM,让少样本推理超参数自动学习|从少样本学习算法设计视角
CVPR 2025 论文 UNEM 解读:把广义EM迭代展开成 10 层网络(仅 21 个参数),在验证集上自动学习类别平衡与温度超参数;纯视觉最高 +10%,CLIP 11 数据集平均 +4.2pt。
2026-08-16 09:36:36
149
原创 【CVPR 2025】MMRL:多模态表示学习,让 CLIP 少样本适配不再过拟合|从少样本视觉识别专家视角
CVPR 2025 论文 MMRL:用共享可学习表示空间桥接图文双模态,仅 16-shot 就在 11 个数据集上把调和平均做到 81.20,少样本适配与泛化兼得。
2026-08-16 09:14:34
130
原创 【CVPR 2025】ImagineFSL 论文解读:想象基集上的自监督预训练,VLM 少样本学习新范式|从少样本学习专家视角
CVPR 2025 Highlight 论文 ImagineFSL:把文生图生成的合成图像当作独立知识仓库 iBase,用 HoM-DINO 自监督预训练 + 微调,11 个数据集全面刷新 SOTA,少样本 79.9%、16-shot 84.4%。
2026-08-16 08:58:24
155
原创 【CVPR 2025】面向医学视觉语言模型的提示学习框架 BiomedCoOp|从医学影像AI提示学习视角
【CVPR 2025】BiomedCoOp 用 GPT-4 生成多样医学提示 + MAD 统计离群剔除,冻结 BiomedCLIP 只学 4 个上下文 token,在 11 个医学影像数据集上 16-shot 平均准确率 72.42%,Base-to-Novel 调和平均 75.07。
2026-08-16 08:57:09
215
原创 【CVPR 2025】SWAT:少样本识别,阶段式检索增强微调|从数据效率视角
【CVPR 2025】SWAT 论文解读:先混合检索数据与少样本数据微调视觉编码器,再仅用少样本重训分类器,9 个基准平均准确率 78.2%,超越此前最强方法超过 6 个百分点。
2026-08-16 08:33:13
216
原创 【CVPR 2025】2SFS:重新思考视觉语言模型的少样本适配,两阶段方案|从少样本泛化视角
【CVPR 2025】2SFS 论文解读:重新思考视觉语言模型少样本适配的两阶段方案——LayerNorm 微调 + 线性分类器,固定超参数下 base-to-novel 平均 HM 80.20,超越 CoOp/MaPLe/CLIP-LoRA/MMA 等全部 prompt/adapter 方法。
2026-08-16 08:16:27
173
原创 【ACL 2024】LLM in a flash 论文解读:闪存驻留的大模型高效推理|从端侧部署专家视角
【ACL 2024】LLM in a flash 论文解读:利用激活稀疏性与 flash 顺序读特性,滑动窗口 + 行列捆绑实现按需取权,一半 DRAM 运行 2 倍模型,I/O 延迟 2196ms→87ms,CPU 4-5x、GPU 20-25x 加速,5 模型 3 后端验证。
2026-08-15 09:08:36
16
原创 【ICML 2023】FlexGen:单 GPU 上的大语言模型高吞吐生成推理|从大模型推理系统优化视角
【ICML 2023】FlexGen:单 GPU 上的大语言模型高吞吐生成推理,OPT-175B 在 16GB 显卡上首次达到 1 token/s 生成吞吐,较 DeepSpeed 提升 112 倍
2026-08-15 08:51:13
78
原创 【SOSP 2024】PowerInfer:消费级 GPU 上的高速大模型推理引擎|从消费级GPU推理加速视角
【SOSP 2024】PowerInfer 论文解读:利用神经元激活幂律分布,热点神经元放 GPU、冷点放 CPU,单张 RTX 4090 跑 OPT-175B,最高 11.69× 加速、精度无损。
2026-08-15 08:32:10
64
原创 【SOSP 2023】PagedAttention 论文解读:vLLM 如何用分页内存把 LLM 服务吞吐提升 2-4 倍|从LLM推理系统优化视角
SOSP 2023 经典论文 PagedAttention 与 vLLM 深度解读:KV cache 内存碎片化使有效内存低至 20.4%,分页式块级管理实现近零浪费,吞吐较 FasterTransformer/Orca 提升 2-4 倍。
2026-08-15 08:12:27
55
原创 【arXiv 2024】LLM推理加速硬件综述:生成式大模型推理加速,硬件视角全景综述|从芯片能效与平台选型视角
【arXiv 2024】LLM推理加速硬件综述:5大平台×6类方法,用tokens/s与tokens/J统一横评;ASIC吞吐最高2700 tokens/s、PIM能效最高46.66 tokens/J,端侧差距1-2个量级
2026-08-15 08:00:32
141
原创 【COLM 2025】AIOS:LLM 智能体操作系统,内核化资源管理与调度|从智能体系统架构视角
解读 COLM 2025 论文 AIOS(LLM Agent Operating System):三层架构把 LLM 与工具资源隔离进内核,调度器管理系统调用,并发 250→2000 智能体近似线性扩展,吞吐最高提升 2.1 倍。
2026-08-15 07:55:10
168
原创 【NeurIPS 2023】H2O:重型命中者预言机——大模型高效生成式推理的 KV Cache 驱逐策略|从大模型推理系统优化视角
H2O (NeurIPS 2023) 发现注意力中少数「重型命中者」token 贡献绝大部分价值,用 20% KV Cache 预算实现 5-10 倍内存缩减、最高 29 倍吞吐提升,并把 KV 驱逐形式化为动态子模问题给出理论保证。
2026-08-15 00:06:34
152
原创 【EMNLP 2023】LLMLingua:面向大语言模型推理加速的提示词压缩|从高效LLM推理加速视角
LLMLingua(EMNLP 2023)用小型LM的困惑度做粗到细提示词压缩,最高20倍压缩率仅掉1.52个点,1-shot反超full-shot,成为提示词压缩开山范式
2026-08-15 00:06:32
205
原创 【arXiv 2025】脑启发式大语言模型 BriLLM|从脑启发AI范式视角
BriLLM 脑启发式大语言模型解读:SiFu 非表征学习范式取代表征学习,1-2B 参数达 GPT-1 生成水平,全节点可解释,O(L) 线性复杂度,稀疏训练压缩 90% 参数。
2026-08-15 00:03:38
186
原创 【ICLR 2023】GPTQ:大语言模型的精确后训练量化|从大模型压缩部署视角
GPTQ (ICLR 2023) 论文解读:用近似二阶信息把 175B 大模型后训练量化到 3-4 bit,4-bit 困惑度损失仅 0.03,OPT-175B 首次实现单卡 A100 推理,端到端加速 3.25x/4.5x。
2026-08-15 00:00:03
175
原创 【MLSys 2024】AWQ:激活感知权重量化——把大模型装进边缘设备|从端侧大模型部署视角
【MLSys 2024】AWQ 论文解读:激活感知权重量化,仅保护 1% 显著权重通道即可实现 4-bit 无损压缩,TinyChat 实测 3.2-3.3× 加速,70B 模型部署到 Jetson Orin。
2026-08-14 17:00:43
6
原创 【ICML 2024】Medusa:多解码头驱动的 LLM 推理加速框架|从LLM推理系统优化视角
【ICML 2024】Medusa 论文解读:用多个解码头 + 树注意力并行预测并验证候选 token,无需草稿模型即可无损加速 LLM 推理 2.3-2.8 倍(MT-Bench 质量基本持平),已被 TensorRT-LLM 与 HuggingFace TGI 采纳。
2026-08-14 16:45:40
62
原创 【ICML 2023】Speculative Decoding 投机解码论文解读:草稿模型并行采样 + 大模型无损验收,推理加速 2X-3X|从大模型推理加速视角
投机解码 ICML 2023 Oral:小模型草稿并行采样 + 大模型批量验收,T5-XXL 推理加速 2X-3X(最高 3.4X),输出分布逐 token 不变,无需重训练。
2026-08-14 16:27:33
58
原创 【ICML 2026】Sink-MoE 论文解读:注意力 Sink 锻造原生 MoE,Sink 感知训练解决头部坍缩|从注意力机制设计视角
注意力 Sink 是隐式路由器:ICML 2026 论文证明 Vanilla/Sink/Gated 三种注意力统一为注意力层原生 MoE,头部坍缩即专家坍缩;Sink 感知负载均衡损失在 0.6B-2B 全配置一致提升(最高 +1.40pp),微调 LongBench 最高 +4.71pp,训练开销 <2%。
2026-08-14 16:11:19
59
原创 【ACL 2024】DeepSeekMoE:混合专家语言模型中的极致专家特化|从大模型稀疏架构专家视角
【ACL 2024】DeepSeekMoE 论文解读:细粒度专家切分 + 共享专家隔离两大策略,16B 模型仅用 40% 计算量匹敌 LLaMA2 7B,推理加速 2.5 倍,单卡 40GB 可部署。
2026-08-14 16:08:56
199
原创 【arXiv 2024】DeepSeek-V2 论文解读:经济训练与高效推理的 MoE 大语言模型|从稀疏架构降本增效视角
【arXiv 2024】DeepSeek-V2 论文解读:236B 总参数、21B 激活的 MoE 大语言模型,MLA 将 KV 缓存减少 93.3%,训练成本节省 42.5%,生成吞吐提升 5.76 倍,MMLU 78.5 达开源顶级水平。
2026-08-14 15:43:53
163
原创 【arXiv 2025】Titans 论文解读:测试时记忆学习的神经长期记忆架构|从神经网络记忆机制视角
【arXiv 2025】Titans 神经长期记忆架构论文解读:把 Transformer 短程注意力与测试时在线更新的神经记忆结合,760M 规模 Wiki 困惑度 18.61,有效上下文超 200 万 token,BABILong 上超越 GPT-4。
2026-08-14 15:26:10
221
原创 【COLM 2024】Mamba:线性时间序列建模的选择性状态空间|从高效序列架构演进视角
【COLM 2024 杰出论文】Mamba:线性时间序列建模的选择性状态空间——首个匹配 Transformer 质量的无注意力线性时间序列模型,推理吞吐 5 倍、训练线性扩展,语言/音频/基因组三模态 SOTA,上下文可至 1M。
2026-08-14 15:07:16
164
原创 【NeurIPS 2022】FlashAttention:IO 感知的快速内存高效精确注意力|从高效Transformer内核视角
【NeurIPS 2022】FlashAttention 论文解读:IO 感知精确注意力,Tiling 分块 + 反向重计算,HBM 访问减少 9 倍,GPT-2 训练加速 3 倍,首个在 Path-X(16K 序列)超越随机水平的 Transformer(61.4%)。
2026-08-14 14:48:45
157
原创 【TMLR 2024】Efficient LLM:高效大语言模型综述,模型、数据与框架三重视角|从大模型系统优化视角
本文解读 TMLR 2024 综述《Efficient Large Language Models: A Survey》:379 篇文献、三重视角(模型/数据/框架)系统梳理量化、剪枝、MoE 与推理优化,4-bit 量化近乎无损,附持续维护的 GitHub 仓库。
2026-08-14 14:34:42
220
原创 【arXiv 2025】Wan-Animate 论文解读:统一角色动画与替换的框架|从AI视频生成技术视角
【arXiv 2025】Wan-Animate 论文解读:统一角色动画与角色替换,全身动画 SSIM 0.813、肖像组 FVD 94.65 全面第一,20 人用户研究击败 Runway Act-two 与 DreamActor-M1 等闭源 SOTA。
2026-08-13 08:47:40
240
原创 【arXiv 2025】音频驱动电影级视频生成 —— Wan-S2V 论文解读|从AI数字人内容创作视角
Wan-S2V 论文解读:阿里通义 Wan 系列音频驱动电影级视频生成模型,文本管全局运镜、音频管表情局部动作;EMTD 基准 FID 15.66、PSNR 20.49、CSIM 0.677 全面领先。
2026-08-13 08:30:16
186
原创 【ICCV 2025】VACE:统一视频创作与编辑的全能框架|从视频生成统一范式视角
【ICCV 2025】VACE 论文解读:用一个视频 DiT 模型统一创作与编辑。VCU 把文本/图像/视频/掩码折叠进同一接口,单模型覆盖 12 类任务,VACE-Benchmark 上 I2V 归一化平均 74.38%,全面超越开源专用模型。
2026-08-13 08:11:24
222
空空如也
如何分割出音频中的每一个字?
2021-09-11
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅