大模型
文章平均质量分 94
研究各种aigc相关大模型的理论部分
万里鹏程转瞬至
一名热爱深度学习算法实践的算法工程师,工作日长期活动在线,有项目研发技术问题均可私聊。
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
论文阅读:jina-embeddings-v5-text: Task-Targeted Embedding Distillation
开源时间:2026年4月28日机构:Elastic旗下Jina团队文本嵌入模型广泛应用于语义相似度任务,包括信息检索、聚类与文本分类。。本文提出一套。实验表明,该方案相比纯对比训练、纯蒸馏训练两种范式,在小模型训练上效果更优。基于该方法得到两款模型:jina-embeddings-v5-text-small、jina-embeddings-v5-text-nano,在同等参数量模型中基准评测得分达到或超越当前SOTA水平。原创 2026-08-08 21:24:59 · 396 阅读 · 0 评论 -
论文简读:Embarrassingly Simple Self-Distillation Improves Code Generation
发表时间:2026.4.1论文地址:https://arxiv.org/html/2604.01193v1测试代码:https://github.com/apple/ml-ssd/tree/main。原创 2026-04-12 22:58:46 · 582 阅读 · 0 评论 -
论文简读 | MiniCPM-V 4.5论文内容总结
多模态大语言模型是AI发展前沿,但训练和推理效率成为其落地与规模化的核心瓶颈。为此,论文提出8B参数的MiniCPM-V 4.5,核心改进包含三方面:**统一3D-Resampler架构** 实现图像和视频的高紧凑编码、**文档知识与文本识别的统一学习范式** 摆脱繁重的数据工程、**混合强化学习策略** 兼顾短/长推理模式的性能。OpenCompass评测显示,该模型超越GPT-4o-latest等闭源模型和Qwen2.5-VL 72B等大参数量开源模型,且效率突出——如在VideoMME基准上,仅用Qw原创 2026-02-20 10:30:00 · 2320 阅读 · 0 评论 -
论文阅读 | MiniCPM-o | RLAIF-V开源AI反馈助力模型可信度超越GPT-4V
解决现有多模态大语言模型的幻觉问题,突破传统RLHF依赖人工标注、现有RLAIF依赖专有模型的局限,通过全开源范式构建高质量反馈,实现模型可信度与人类偏好的对齐。核心创新去混淆响应生成:相同条件下多轮采样解码,消除文本风格干扰,凸显可信度真实差异;分而治之反馈标注:将响应拆解为原子声明,转换为极性问题评估,降低开源模型标注难度;迭代反馈学习:动态更新反馈分布,解决DPO训练中的分布偏移问题;推理自反馈机制:利用DPO对齐模型的奖励分数,结合长度归一化策略,优化推理阶段性能。关键结果原创 2026-02-20 02:30:00 · 2049 阅读 · 0 评论 -
论文简读:Kwai Keye-VL-1.5 技术报告总结简版
Keye-VL-1.5,通过三项关键创新解决视频理解的根本挑战。首先,引入了一种新的慢速-快速视频编码策略,基于帧间相似性动态分配计算资源,在更高分辨率下处理具有显著视觉变化的关键帧(慢速路径),同时在较低分辨率下处理相对静态但时间覆盖范围更大的帧(快速路径)。其次,我们实施了渐进式四阶段预训练方法,系统地将模型的上下文长度从8K字扩展到128K字,从而支持更长视频和更复杂的视觉内容处理。第三,我们开发了全面的培训后流程,重点关注推理增强和人类偏好对齐,包含五步思维链数据构建流程、基于GSPO的迭代强化学习原创 2025-12-28 22:41:41 · 1009 阅读 · 0 评论 -
论文简读:Kwai Keye-VL Technical Report
核心痛点:多模态大语言模型(MLLMs)静态图像处理能力强,但难以应对动态、信息密集的短视频理解需求。模型定位:80亿参数多模态基础模型,主打短视频理解尖端性能,同时兼顾通用视觉语言能力。研发核心:数据支撑:超6000亿标记的高质量海量数据集,重点聚焦视频内容。训练方案:四阶段预训练(实现稳健视觉语言对齐)+ 两阶段后训练(第一阶段强化指令遵循等基础能力,第二阶段激发高级推理能力)。关键创新:第二阶段后训练采用五模态“冷启动”数据混合方案(含“思考”“非思考”“自动思考”“图像辅助思考”及高质量视原创 2025-12-28 22:39:15 · 1289 阅读 · 0 评论 -
论文简读:Qwen3-VL Technical Report | Qwen3VL技术报告
demo:模型:或github:是Qwen系列中能力最强的,在多模态基准测试中表现优异。该模型,无缝整合文本、图像和视频。(2B/4B/8B/32B)和(30B-A3B/235B-A22B),以适应不同延迟-质量权衡。Qwen3-VL交付三大核心支柱:(i),在某些场景超越同类纯文本骨干模型;(ii),原生支持256K标记窗口,适用于文本和交错多模态输入,能忠实保留、检索及跨长文档/视频交叉引用;(iii)原创 2025-12-21 22:05:18 · 3391 阅读 · 0 评论 -
论文简读 InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
InternVL3.5,一个新型开源多模态模型系列,在泛化性、推理能力和效率方面显著优于前代。核心创新包括:级联强化学习(Cascade RL):结合离线RL(用于稳定训练)和在线RL(用于精细对齐),提升推理能力。视觉分辨率路由器(ViR):动态调整视觉标记分辨率,以可忽略的性能损失降低计算成本。解耦视觉-语言部署(DvD):将视觉编码器与语言模型分置于不同GPU,优化计算负载。这些技术使模型在整体性能上实现 +16.0% 的提升,推理速度达 4.05× 加速。最大模型 InternVL3.5-原创 2025-12-21 21:04:26 · 1571 阅读 · 0 评论 -
论文简读:Qwen2.5-VL Technical Report
Qwen2.5-VL是Qwen视觉语言系列的旗舰模型,在基础能力与创新功能上均有显著提升。该模型具备增强的视觉识别、精确目标定位(支持边界框/点)、稳健的文档解析及长视频理解能力。核心技术创新包括:引入动态分辨率处理与绝对时间编码,支持原生感知空间尺度与时间动态,可处理任意尺寸图像和长达数小时的视频,并实现秒级事件定位。采用从头训练的原生动态分辨率ViT与窗口注意力(Window Attention),在保持原生分辨率的同时显著降低计算开销。关键性能表现:Qwen2.5-VL-72B在原创 2025-12-21 18:14:01 · 1550 阅读 · 0 评论 -
论文简读:InternVL3| Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models
介绍InternVL3(InternVL系列重大升级):实现原生多模态预训练(预训练阶段同步习得语言与多模态能力,规避传统后训练复杂优化难题)。核心技术:引入可变视觉位置编码(支持更长多模态上下文)、结合有监督微调与混合偏好优化等先进后训练策略、采用测试阶段缩放方案。性能表现:全品类多模态任务树立开源模型新标杆,保留强大语言能力;InternVL3-78B在MMMU基准测试中72.2,超越现有开源多模态大语言模型,显著缩小与闭源旗舰模型的性能差距。原创 2025-12-21 13:29:46 · 1638 阅读 · 0 评论 -
InternVL2.5相比与InternVL2性能提升的关键工作分析
InternVL2.5是第一个在 MMMU 基准上达到 70% 以上的开源 MLLM, 其以InternVL2的研究工作为基础,在模型结构上没有过多调整,但在数据处理逻辑、模型训练策略、训练数据增广方式进行优化,从而实现了有效的整体涨点。原创 2025-03-10 00:15:00 · 2451 阅读 · 0 评论 -
InternVL2: Better than the Best—Expanding Performance Boundaries of Open-Source Multimodal Models
基于对InternVL2的分析,可以得到以下经验:1、对于将预训练好的VIT与LLM模型组装成mllm模型时,可以只训练MLP部分,实现快速的模态对齐2、llm部分的升级可以大幅度提升mllm模型的效果,尤其是在非标准格式问答中3、数据分布域的改变,导致在标准格式输出,如grounding任务中,模型性能的下降(这表明模型能力的提升不一定是全面的)原创 2025-03-09 03:30:00 · 1703 阅读 · 0 评论 -
论文快过:Root Mean Square Layer Normalization
RMSNorm假设LayerNorm中的重新定心不变性是可或缺的,RMSNorm根据均方根(RMS)对一层神经元的求和输入进行正则化,给出了模型的重新缩放不变性和隐式学习率适应能力。RMSNorm在计算上更简单,因此比LayerNorm更有效。我们还提出了部分RMSNorm,或pRMSNorm,其中RMS是从求和输入的p%估计的,而不破坏上述属性。在使用不同网络架构的几个任务上进行的大量实验表明,RMSNorm实现了与LayerNorm相当的性能,但在差异上减少了7%的∼64%原创 2024-11-23 08:45:52 · 1304 阅读 · 0 评论 -
论文阅读:Qwen2-VL: Enhancing Vision-Language Model’s Perception of the World at Any Resolution
公开时间:2024年10月3日Qwen2-VL是对之前的Qwen-VL模型的高级升级,重新定义了视觉处理中传统的预定分辨率方法。。这种方法允许模型生成更有效和更准确的视觉表征,与人类的感知过程密切一致。。我们,Qwen2-VL研究了大型视觉语言模型(LVLMs)的缩放定律。通过扩展模型的大小-2B、8B和72B参数的版本和训练数据的量,Qwen2-VL系列实现了具有高度竞争力的性能。原创 2024-10-07 22:08:06 · 4950 阅读 · 0 评论 -
论文阅读:LLaVA-OneVision: Easy Visual Task Transfer
LLaVA-OneVision是一个开放的大型多模态模型(LMMs),它是通过整合在LLaVA-NeXT博客系列中的数据、模型和可视化表示的见解而开发的。实验结果表明,LLaVA-OneVision是第一个能够在三个重要的计算机视觉场景:单图像、多图像和视频场景的单一模型。论文的核心是分享了一个OneVision的架构设计,以统一对单图、多图及视频任务的训练框架(token编码规则),将单图训练的能力迁移到多图与视频中。同时分享了一种动态分辨率设计规则,以提供更好的视觉表示(兼容图像视频);最后介绍了训练数原创 2024-10-07 00:12:13 · 4567 阅读 · 0 评论 -
论文阅读:InternVL v1.5| How Far Are We to GPT-4V? 通过开源模型缩小与商业多模式模型的差距
基于强视觉编码器 、动态高分辨率、高质量双语数据集,InternVL v1.5显示了具有和专有的商业模型相竞争的性能,在18个多模态基准中的8个中取得了最先进的结果。InternVL1.5,是一个开源的多模态大型语言模型(MLLM),可以在多模态理解中弥合开源和专有商业模型之间的能力差距。我们介绍了三个简单的改进: (1)强视觉编码器:我们探索了大规模视觉基础模型的持续学习策略InternViT-6b,提高其视觉理解能力,并使其可以在不同的llm中转移和重用。(2)动态高分辨率。原创 2024-10-06 11:20:33 · 2683 阅读 · 5 评论 -
论文阅读:ORYX MLLM: ON-DEMAND SPATIAL-TEMPORAL UNDERSTANDING AT ARBITRARY RESOLUTION
1、在本论文中展示分辨率对于不同任务的影响,可以发现对于MMBench、TextVQA分辨率对效果影响不大,而MMMU、DovVQA、OCRBench则要求更高的分辨率输入。2、ORYX-7b模型在图像领域,OCRBench、TextVQA val DocVQA test上效果不如2~3个月开源的MiniCPM-Llama-V 2.5、InternVL2-8B、MiniCPM-V 2.6 8b等模型;在视频领域,video-mme基准上也不如MiniCPM-V 2.6 8b、Qwen2-VL 7b等模型;原创 2024-10-06 10:30:00 · 1501 阅读 · 0 评论 -
论文阅读:InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
1、计了一个大规模的视觉-语言基础模型(InternVL),该模型将视觉基础模型扩展到60亿个参数(InternVIT),并使用来自不同来源的网络规模的图像-文本数据逐步将其与LLM对齐;2、所实现的InternVIT在ViT-22B规模下可以作为最佳选择,在图像级或像素级识别,视觉语言任务,如zero-shot图像/视频分类,zero-shot图像/视频文本检索,均取得良好效果;3、论文的核心思想在于扩展VLLM的VIT部分,以使得视觉部分与LLM部分参数量对齐;并提出渐进式训练VLLM模型的具体步骤原创 2024-10-03 21:53:46 · 3042 阅读 · 0 评论 -
CLIP论文中关键信息记录
由于clip论文过长,一直无法完整的阅读该论文,故而抽取论文中的关键信息进行记录。主要记录clip是如何实现的的(提出背景、训练数据、设计模式、训练超参数、prompt的作用),clip的能力(clip的模型版本、clip的泛化能力)。原创 2024-09-16 23:05:10 · 2088 阅读 · 0 评论 -
论文阅读: SigLit | SigLip |Sigmoid Loss for Language Image Pre-Training
论文地址:https://arxiv.org/pdf/2303.15343项目地址:https://github.com/google-research/big_vision发表时间:2023年3月27日我们提出了一种用于语言图像预训练(SigLIP)的简单成对 Sigmoid 损失。与使用 softmax 归一化的标准对比学习不同,sigmoid 损失仅对图像-文本对进行操作,并且不需要对归一化的成对相似性进行全局视图。原创 2024-09-17 22:35:40 · 4629 阅读 · 0 评论 -
论文阅读:RAM++ | Open-Set Image Tagging with Multi-Grained Text Supervision
发表时间:2023年11月16论文地址:https://arxiv.org/pdf/2310.15200项目地址:https://github.com/xinyu1205/recognize-anythingRecognize Anything Plus Model(RAM++),这是一种有效利用多粒度文本监督的开放集图像标记模型。以前的方法(例如,CLIP)主要利用与图像配对的全局文本监督,导致在识别多个单独的语义标签方面的次优性能。相比之下,RAM++无缝地集成了单个标签监督(tag。原创 2024-06-16 22:06:07 · 1987 阅读 · 0 评论 -
论文简读 LORA: LOW-RANK ADAPTATION OF LARGE LANGUAGE MODELS
LORA是什么?LORA是一个解决大模型finetune的技术。现行的大模型(如GPT3,参数量175B)的训练微调成本比较高,一次训练需要几个月才能完成,这提高了nlp大模型的准入门槛。大模型finetune的目的是为了将通用领域的大模型能力迁移到专业领域(下游应用环境), 因为直接在专业领域训练nlp模型存在难以收敛的风险(nlp的专业领域应用需要通用领域的词汇嵌入支持`提供初级词汇理解能力`,在通用领域的大数据规模下训练后可以增强词汇嵌入能力,再进行专业领域训练。通俗来说,LORA技术就像一个化原创 2023-09-08 21:32:57 · 2318 阅读 · 1 评论
分享