论文陪读
文章平均质量分 85
论文陪读,看论文不无聊了
小怪兽会微笑
华师大,上海创智学院在读计算机博士,研究大模型方向。
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
Generalized On-Policy Distillation, G-OPD
这篇文章主要提出了一个名为广义同策略蒸馏(Generalized On-Policy Distillation, G-OPD)奖励外推(Reward Extrapolation, ExOPD)方法。原创 2026-05-16 12:54:45 · 581 阅读 · 0 评论 -
RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
RT-2 把动作极其细化了。它让每一次末端执行器的移动、每一次夹爪的收缩,都直接受到拥有数百亿参数的互联网常识模型的控制。这就解释了为什么 RT-2 能展现出惊人的泛化能力——因为它不是在机械地记忆动作,而是在用“大脑的常识”直接指挥“手指的微操”。原创 2026-05-07 17:13:06 · 398 阅读 · 0 评论 -
CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
如果不用 VAE,直接处理。原创 2026-05-06 20:31:08 · 638 阅读 · 0 评论 -
世界模型Genie 论文解读
分词器将你的草图编码为初始的 Tokenz1z_1z1。你输入的离散动作a1a_1a1(比如“向右”)通过查表转化为潜在动作嵌入a1a1。动力学模型接收z1z_1z1和a1a1,预测出下一帧的 Tokenz2z_2z2。最后,分词器的解码器将z2z_2z2解码为真实的图像像素显示在屏幕上。这套架构优雅地将无监督动作发现与高效的大规模视频生成结合在了一起。在这个物理维度上:由于的卷积操作,HHH和WWW。原创 2026-04-30 16:52:24 · 552 阅读 · 0 评论 -
Sora技术简单过一遍
原文链接原创 2026-04-28 10:22:04 · 442 阅读 · 0 评论 -
DeepSeek V4的 OPD 的训练问题
传统的离策略蒸馏 (Off-Policy Distillation / SFT)做法:让强大的 Teacher 模型(如 DeepSeek-V4-Pro-Max)生成海量高质量回答,Student 模型直接拿着这些数据做有监督微调(Behavior Cloning)。致命缺陷 (Exposure Bias):Student 一直在被动模仿 Teacher 的轨迹。原创 2026-04-27 20:45:11 · 1777 阅读 · 0 评论 -
MoM (Mixture-of-Memories)新型线性序列建模架构
在推理时,通过加权求和(Weighted Sum)混合这些记忆产生的输出,使得推理复杂度保持在 (常数级内存),没有 Transformer 那样随着序列增长而无限膨胀的 KV Cache。(如 Mamba, RWKV, RetNet)虽然训练快()、推理省内存(),但它们通常将整个输入序列压缩进**一个固定大小的记忆状态(Memory State)**中。,根据输入内容的重要性,将不同的 Token 导向不同的记忆单元进行存储。效果好,但推理成本高(KV Cache 显存占用大),复杂度是。原创 2025-12-24 20:05:07 · 1546 阅读 · 0 评论 -
Every Token Counts: Generalizing 16M Ultra-Long Context in Large Language Models(超长文本模型论文HSA)
论文旨在解决 LLM 如何实现“无限”记忆的问题。稀疏性(不能全关注)、随机访问灵活性(能精准检索过去的信息)和长度外推性(从短训练推广到长推理)。现有的方法(如 Mamba、线性注意力、NSA)在检索精度或长距离外推上存在短板。HSA-UltraLong 通过结合滑动窗口注意力(SWA)和HSA,模仿了“混合专家模型(MoE)”的思路,实现了高效且精准的超长文本检索与生成。原创 2025-12-21 16:31:53 · 1196 阅读 · 0 评论 -
Olmo3论文精读
整个管线极度依赖高质量数据工程(olmOCR、合成数据、微退火筛选)。将训练拆解为 Pretrain -> Midtrain -> LongContext -> SFT -> DPO -> RL,每个阶段都有明确的目标和特定的数据配比。大规模应用基于规则验证(如代码执行、数学答案匹配)的强化学习(RLVR),这是提升推理能力的关键。提供了复现上述所有步骤所需的工具链(Olmo-core, OlmoRL, Dolma3, Dolci)。Olmo 3 预训练详解在 Olmo 3 的。原创 2025-12-14 13:31:39 · 1371 阅读 · 0 评论 -
多模态数学推理数据集:MATH-V和MATHVISTA
这里选取了两篇多模态数学推理数据集的代表工作MATH-V和MATHVISTA,均是今年2024年发表的工作。前者是港中大的工作,后者是加利福尼亚大学洛杉矶分校的工作。原创 2024-05-18 12:26:39 · 3855 阅读 · 0 评论 -
垂直领域大模型搭建训练指南,ChemLLM论文介绍
论文是上海人工智能实验室的工作,想训练一个化学垂直领域的对话大模型,然而现有的化学数据往往是结构性的,所以这里论文提出了一套垂直领域数据制作和训练方法,为社区制作专有领域模型提供参考。ChemLLM在化学的三个主要任务上都超过了GPT-3.5,并且超过了GPT-3.5,在其中两个任务上都超过了GPT-4。值得注意的是,ChemLLM对相关的数学和物理任务也显示出了特殊的适应性,尽管它主要接受了以化学为中心的语料库的训练。原化学的表达是SMILES,不适合自然语言处理。原创 2024-02-27 16:46:36 · 3974 阅读 · 3 评论 -
大模型:高质量对话数据生成,Enhancing Chat Language Models by Scaling High-quality Instructional Conversations
指令微调的有效性已经被多个工作验证,ChatGPT更是是其中的代表。这个工作旨在提高开源模型的性能上限,提供了一个系统设计的、多样化的、信息丰富的、大规模的教学对话数据集UltraChat。UltraChat包含150万个高质量的多轮对话,并涵盖了广泛的主题和指令。UltraChat的统计分析揭示了其在尺度、平均长度、多样性、一致性等各种关键指标上的优势,巩固了其作为领先的开源数据集的地位。这篇文章认为在训练过程中使用的数据的质量和多样性,对进一步提高聊天语言模型的性能起着至关重要的作用。原创 2023-12-10 22:07:35 · 2447 阅读 · 0 评论 -
大模型LLM论文目录
持续更新中ing!!!原创 2023-11-05 11:28:55 · 964 阅读 · 0 评论 -
带记忆的Transformer模块
Transformer缺乏长期记忆的能力。以往的方式是通过训练,利用模型的参数来存储长期记忆,但这种方式需要大量的训练。因此,作者提出将上一次模型中的一部分键和值(这里要看懂,需要了解Transformer结构中的Q,K,V)进行存储,再后面使用时,再利用一个被广泛应用的信息检索的方式–近似K近邻查找KNN来检索这个信息。最后,利用这个检索得到的信息和现有的信息得到结果。相比以往的,作者认为有两个不同。KNN直接找原本文,而不是对原文本进行归纳总结。反向传播的梯度不会更新外部内存。原创 2023-07-15 21:51:06 · 2722 阅读 · 0 评论 -
大型语言模型综述,非常详细,格局打开!A Survey of Large Language Models
从图灵测试开始讲起,人类一直在探索用机器掌握语言智能的方法。在过去20年,语言模型得到了广泛研究。从统计语言模型到了基于神经网络的语言模型(LSTM等)。最近这些年,通过在大规模语料库(数据集)上对Transformer模型的预训练,提出了预训练语言模型(PLMs),在解决各种自然语言处理(NLP)任务方面显示出了很强的能力。原创 2023-04-18 18:05:06 · 9898 阅读 · 0 评论 -
一个开源的大型语言模型LLaMA论文简单解读,LLaMA: Open and Efficient Foundation Language Models
大型语言模型存在一个问题是并非越大的模型具备越优的性能,所以可能存在的情况是一个更小的模型使用更多的数据训练能得到更好的性能。作者发现一个7B的模型在1T的tokens上性能仍然在提升。因此,LLaMA的工作是使用更小的模型得到更优的性能。另外,在LLaMA中,训练数据全部来自网上公开的数据,作者在论文中介绍了模型及其训练细节。原创 2023-04-11 23:32:11 · 3760 阅读 · 0 评论 -
GPT-4原论文详细解读(GPT-4 Technical Report)
GPT-4是一个多模态的大模型。它的基础结构仍然是Transformer+预测下一个词的目标函数。GPT-4在摘要中的说法是给出了一个预测模型性能的方法,使得只需要0.1%的训练计算资源,就可以预测模型的性能了。不需要训练到最后才得到模型性能,这有助于早期就调整好模型,减少不必要的训练成本。GPT-4这篇工作目的是增强理解生成文本的能力,尤其在复杂且存在细微差异的场景。GPT-4使用了很多人类的考试(例如,律师资格考试)和传统的NLP任务作为测试案例。原创 2023-03-28 10:58:51 · 9889 阅读 · 0 评论 -
各种SCI,CCF,EI,北大核心等刊物大致含金量,用奖学金加分看出!
各种SCI,CCF,EI,北大核心等刊物大致含金量,用奖学金加分看出!原创 2022-11-30 00:09:29 · 3933 阅读 · 0 评论 -
Artificial General Intelligence: Concept, State of the Art, and Future Prospects
如标题所示,本文主要回顾了强人工智能的定义,前沿技术和未来展望。虽然,这篇论文来自2014年,但依然对我们现在了解认知AGI很有价值。AGI具备能够在各种不同的环境和环境中处理实现各种目标和执行各种任务的能力。AGI具备能够处理创造者(研究者,程序员)意料之外问题的能力AGI能够总结获得的知识,并将该知识应用到其他问题AGI在当前条件下不可能实现现实生活中如果实现了AGI容易偏向于具体的某项任务,GPT3?人的智能大于现有AI的智能,更大于其他动物的智能AGI有望超过人的智能。原创 2022-11-24 15:11:07 · 1809 阅读 · 0 评论 -
如何撰写一篇好的英文论文(感谢导师的指导,学到很多)
如何撰写英文论文1.写作前的准备写作前需要第一个需要准备的是:学习经典论文,顶刊、顶会论文的写作!!!,包括:为什么这样组织全文?换了我该如何组织你之前不知道的词汇和地道表达!令你拍案叫绝的句子此时的你可以下载10+篇论文,然后把上述两点当成研究问题,展开研究。第二个需要准备的是:心态。很多好的论文都是需要长时间的打磨的,不能抱着我这几天就把论文写完的态度来写论文。写的时候需要不断地:推敲!琢磨!斟酌!悟!2.科技论文的结构论文题目摘要+关键词引言(Introduction)方法原创 2022-05-31 10:22:51 · 1809 阅读 · 0 评论 -
各类优化算法入门优秀论文总结目录
最适合新手入门演化计算,优化领域的论文目录原创 2021-12-10 20:44:40 · 2771 阅读 · 0 评论 -
文化基因算法(Memetic Algorithm)研究进展(文化基因算法新手入门)
文化基因算法(Memetic Algorithm)研究进展(文化基因算法新手入门)1.摘要文化基因算法(memetic algorithm)是 Pablo Moscato 提出的建立在模拟文化进化基础上的优化算法,它实质上是一种基于种群的全局搜索和基于个体的局部启发式搜索的结合体。文化基因算法的概念被提出后,已被越来越多的研究人员接受和采纳。本文主要介绍了文化基因算法的起源、实现过程,以及在各类优化问题中的应用情况。2.介绍Pablo Moscato 于 1989 年首次提出 memetic al原创 2021-12-10 20:43:44 · 7274 阅读 · 0 评论 -
贝叶斯优化优秀论文总结目录
持续更新中,论文均来自该领域的优秀会议或期刊,涉及的领域主要是贝叶斯优化,离散贝叶斯优化。本人才疏学浅,若读者发现有不对的地方,欢迎留言评论指正。 Bayesian optimization标题发表时间作者期刊引用量对比算法对比指标对比函数机器学习中的高斯过程(一篇引用超20000的论文)2003Carl Edward RasmussenSpringer-Verlag(一个德国出版社)20997无无无高斯随机场元模型辅助的单目标和多目标进化优化200原创 2021-09-29 19:16:47 · 5154 阅读 · 0 评论 -
利用图笛卡斯积的组合贝叶斯优化
Combinatorial Bayesian Optimization using the Graph Cartesian Product1.摘要通常来说,在贝叶斯优化中的改进有三方面:1.代理模型(高斯过程,神经网络集) 2.获取函数 3.获取函数的优化(尤其是在离散问题中)。本文的创新的地方在第1步。本文主要研究了由有序变量或分类变量组成的组合搜索空间上的目标的贝叶斯优化(BO)。介绍了一种新的使用高斯过程(GP)的贝叶斯优化COMBO。它利用组合图来量化组合搜索空间上的目标函数的“平滑性”。组原创 2021-09-27 09:32:15 · 757 阅读 · 0 评论 -
使用Mercer特征的组合贝叶斯优化
Combinatorial Bayesian Optimization using the Graph Cartesian Product1.摘要本文主要研究了在组合搜索空间上的目标的贝叶斯优化(BO),包括有序变量和分类变量.本文提出了COMBO2.介绍5.总结返回受约束的多目标优化问题优秀论文及总结目录...原创 2021-09-26 16:28:13 · 611 阅读 · 0 评论 -
Simple and Scalable Predictive Uncertainty Estimation using Deep Ensembles
使用深度神经网络集合预测点的分布1.摘要深度神经网络是一个在处理黑盒优化问题时的很好的预测器。然而量化神经网络的不确定性的问题仍然具有挑战且有待解决。贝叶斯神经网络是目前最先进的估计预测不确定性的方法,然而这些方法都需要对训练过程进行重大修改,与标准(非贝叶斯)神经网络相比计算昂贵。我们提出了一种贝叶斯神经网络的替代方案,它易于实现,易于并行,并产生高质量的预测不确定性估计。通过分类的一系列回归基准实验,我们证明了我们的方法产生了良好校准的不确定性估计,这些估计与近似贝叶斯神经网络一样好或更好。最原创 2021-07-24 19:34:13 · 2353 阅读 · 1 评论 -
蚁群算法简单总结
蚁群算法简单总结1.算法框架2.算法参数蚂蚁数量M:M过大导致每条路径被走过的可能都增大,导致信息素差不多,收敛速度慢;过小可能导致有很多路径没被发现,导致局部收敛信息素常量Q:Q过大导致路径的搜索范围减小,导致局部收敛;过小导致路径上信息素区别不大,进入混沌状态最大迭代次数N:过小可能陷入局部最优信息素因子α\alphaα:α\alphaα过大会使得蚂蚁更关心信息素,更可能走以前走过的路径,容易陷入局部最优;过小会导致算法不收敛。启发函数因子β\betaβ:β\betaβ参数和α\alp原创 2021-06-21 10:54:49 · 2655 阅读 · 0 评论 -
Protein Ising Model Problem
Protein Ising Model Problem1.预备知识蛋白质都是由20种不同的L型α氨基酸连接形成的多聚体,在形成蛋白质后,这些氨基酸又被称为残基。蛋白质的分子结构可划分为四级,以描述其不同的方面:蛋白质一级结构:组成蛋白质多肽链的线性氨基酸序列。蛋白质二级结构:依靠不同氨基酸之间的C=O和N-H基团间的氢键形成的稳定结构,主要为α螺旋和β折叠。蛋白质三级结构:通过多个二级结构元素在三维空间的排列所形成的一个蛋白质分子的三维结构。蛋白质四级结构:用于描述由不同多肽链(亚基)间相原创 2021-05-09 15:37:54 · 745 阅读 · 0 评论 -
(顶会)在字符串空间上的贝叶斯优化BOSS
BOSS: Bayesian Optimization over String Spaces1.摘要本文提出了一种直接作用于原始字符串的贝叶斯优化方法,提出了BO循环中的遗传算法。近些年,贝叶斯在字符串上的优化经常被一个问题所阻碍,那就是我们需要把字符串映射到一个光滑的不受约束的拉丁空间上。我们这样做常常会导致大量的技术和需要大量的数据。所以本文基于字符串核建立了一个高斯过程代理模型,它不受长度限制,且可以在带语法约束的空间上对获取函数最大化。2.介绍本文这里对近些年在BO和字符串类优化问题上的文原创 2021-04-12 19:18:12 · 671 阅读 · 0 评论 -
离散空间上的贝叶斯优化获取函数最大化
Amortized Bayesian Optimization over Discrete Spaces1.摘要贝叶斯优化在每次迭代时都需要考虑一个问题,即获取函数最大化。这是一个内部优化问题,这将决定我们下次采样在哪里。本文的观点是,我们可以训练一个带参数的策略去最大化获取函数。这会比无参的搜索方法更快,因为我们分摊了优化成本(参数可以用到下一次迭代中)。作者称这种方法为Amortized Bayesian Optimization。2.介绍传统的进化算法在内循环中最大化获取函数常常找到次优解,且原创 2021-04-11 16:01:43 · 2677 阅读 · 0 评论 -
超多目标演化算法及应用研究
超多目标演化算法及应用研究1.摘要本文是2017年中科大的计算机应用技术专业的李丙栋的博士学位论文,虽然不在顶刊上发表,但我从这篇论文上学到的远大于一般顶刊上论文。首先,本文对超多目标演化算法进行了一个综诉(讲的非常好),还提出了一个算法,该算法是对一篇顶刊上的论文:Two-Archive Evolutionary Algorithm for Constrained Multiobjective Optimization的改进版本。另外,本文提出了一个平衡不同性能指标影响的技术。最后,本文还提出了原创 2021-04-08 14:25:53 · 2826 阅读 · 0 评论 -
(顶刊)分布算法混合多目标贝叶斯估计概率图模型探讨
Exploring the Probabilistic Graphic Model of a Hybrid Multi-objective Bayesian Estimation of Distribution Algorithm1.摘要分布算法的混合多目标贝叶斯估计(HMOBEDA)在许多(many)目标优化问题中具有很强的竞争力。HMOBEDA的概率图形模型(PGM)扩展了探索的可能性,因为它提供了嵌入式局部搜索的决策变量、目标和配置参数的联合概率。本研究了HMOBEDA的不同采样机制,将所考虑的方原创 2021-04-06 09:59:33 · 1207 阅读 · 0 评论 -
到底如何看出一篇论文的期刊或会议等级?如何评价论文影响力?(你不会看到比此篇讲得更透彻的)
到底如何看出一篇论文的期刊或会议等级?如何评价论文影响力?按照问题的难度,本文依此回答以下问题:问题1.如何看一篇论文是什么期刊或会议?问题2.如何看一篇论文的引用数?问题3.如何看一篇论文发表期刊的等级?问题4.如何看一篇论文发表会议的层次?问题5.其他常见问题?问题1.如何看一篇论文是什么期刊或会议?该问题最简单,直接看论文的封面就可解决95%的该问题。如下图:你可以在论文封面的上面,下面,左边,右边看到这样的东西。上图便是一篇会议论文,会议名为加蓝区域。如下图便是一篇期刊上论文原创 2021-04-04 13:36:20 · 64022 阅读 · 5 评论 -
(顶刊)基于目标与变量联合建模的分布算法的多目标估计
Multi-objective Estimation of Distribution Algorithm Based on Joint Modeling of Objectives and Variables1.摘要提出了一种基于目标和变量联合建模的多目标估计算法。该EDA使用多维贝叶斯网络作为其概率模型。这样,它就可以捕获目标、变量和目标之间的依赖关系,以及在其他基于贝叶斯网络的EDA中学习到的变量之间的依赖关系。该模型导致了问题分解,帮助该算法找到多目标问题的权衡解决方案。除了帕累托集近似外,该算法原创 2021-04-04 10:02:06 · 1643 阅读 · 0 评论 -
解决全局优化和离散问题的二进制多宇宙算法
Binary multi‑verse optimization algorithm for global optimization and discrete problems1.摘要多宇宙算法已经被证明在解决一些困难问题的时候也有很好的性能。原始版本的多宇宙算法能够解决连续变量的问题,本文将其扩展到离散问题上。转换的方法是设计了一个 V-shaped转换函数。最后与其他二进制优化算法,如二进制蝙蝠算法,二进制粒子群优化,二进制龙算法,和二进制灰狼优化器进行了比较。2.介绍MVO的灵感来自于物理学中的原创 2021-04-02 16:29:37 · 1764 阅读 · 0 评论 -
基于贝叶斯优化的离散组合序列问题调研
基于贝叶斯优化的离散组合序列问题调研标题发表时间作者期刊引用量问题摘要心得体会Applying Bayesian Approach to Combinatorial Problem in Chemistry2017Yasuharu OkamotoAmerican Chemical Society(一区,化学,顶刊)16Li−GIC的稳定结构本文将贝叶斯优化算法引入在一个化学的组合问题上,结合密度泛函理论的计算,该算法搜索了整个搜索空间的4−6%,有效地识别了第一原创 2021-03-30 17:56:02 · 1119 阅读 · 0 评论 -
语法变量自动编码器
Grammar Variational Autoencoder1.摘要深度生成模型在学习连续数据(如自然图像、艺术品和音频)的相干潜在表示方面取得了巨大成功。 然而,离散数据的生成建模,如算术表达式和分子结构,仍然面临着重大的挑战。 本文做了关键的观察,离散数据经常可以表示为上下文无关语法中的解析树。本文提出了一种变分自动编码器,它直接对这些解析树进行编码和解码,确保生成的输出始终在语法上有效。 令人惊讶的是,我们发现,不仅我们的模型更经常地生成有效的输出,它还学习到一个更相干的潜在空间,其中附近的点解原创 2021-03-29 09:57:58 · 1141 阅读 · 0 评论 -
机器学习中的高斯过程(一篇引用超20000的论文)
Gaussian Processes in Machine Learning1.摘要本文没啥创新,但给出了高斯过程回归模型的基本介绍。以及如何理解随机过程的作用,如何使用它来定义函数上的分布。提出了合并训练数据的简单方程,并研究了如何使用边际似然来学习超参数。我们解释了高斯过程的实际优势,并以结论和回顾GP工作的当前趋势。现在看来算是入门基于高斯模型的贝叶斯优化的科普文吧。2.高斯过程定义:高斯过程是随机变量的集合,任何有限的变量都符合联合高斯分布。高斯过程由平均函数u(x)u(x)u(x)和协原创 2021-03-28 14:31:55 · 3617 阅读 · 0 评论 -
AM作业调度问题
AM作业调度问题该问题是个np问题。我们可以利用启发式算法、禁忌搜索和进化算法解决AM调度问题。然而,这些基于实例的算法的效率受到了仿真成本(即真实评估成本)的限制,我们也会使用基于模型的算法来解决这个序列问题。AM调度流程如下图:图中共有J1−J8J1-J8J1−J8共8个调度作业。我们用一个序列表示工作顺序,如图中的工作的排列顺序为[1,3,4,2,6,5,7,8]。接着,根据构建平台的顺序和大小,可以看到图中,我们同时将工作分成了B1−B3B_1-B_3B1−B3共3组,最后每个解都是一个原创 2021-03-27 20:37:13 · 445 阅读 · 0 评论 -
基于序列的组合问题的贝叶斯离散优化算法
A Bayesian Discrete Optimization Algorithm for Permutation Based Combinatorial Problems1.摘要本文提出了新的基于位置信息的核函数,该核函数使用稀疏高斯过程模型,具体创新点如下:使用模拟退火算法帮助降维(解决高斯模型高维诅咒)基于降维后的维度计算新的协方差矩阵协方差矩阵里的距离函数定义了先验知识2.介绍分析了处理离散组合优化问题时,基于模型的方法的优劣。3.处理离散问题的贝叶斯优化介绍了使用基于模型优原创 2021-03-27 20:36:43 · 1925 阅读 · 0 评论
分享