- 博客(121)
- 资源 (5)
- 收藏
- 关注
原创 [全网首发中文版]LLM4Decompile: Decompiling Binary Code with Large Language Models
反编译是将已编译的机器代码或字节码转换回高级编程语言的过程。当源代码无法访问时,通常会这样做来分析软件的工作原理 Brumley 等人 (2013);Katz 等人 (2018);胡赛尼和多兰-加维特 (2022);徐等人 (2023);Armengol-Estapé 等人 (2023);江等人 (2023);黄等人(2023)。目前已经开发了许多反编译工具,例如 Ghidra Ghidra (2024) 和 IDA Pro Hex-Rays (2024)。
2024-03-18 15:01:05
2597
原创 [全网首发中文版]TextMonkey: An OCRFree Large Multimodal Model for Understanding Document
我们推出了 TextMonkey,这是一种专为以文本为中心的任务而定制的大型多模态模型 (LMM),包括文档问答 (DocVQA) 和场景文本分析。我们的方法引入了跨多个维度的增强:通过采用零初始化的转移窗口注意力,我们在更高的输入分辨率下实现了跨窗口连接并稳定了早期训练;我们假设图像可能包含冗余标记,通过使用相似性过滤掉重要标记,我们不仅可以简化词符长度,还可以提高模型的性能。此外,通过扩展模型的功能以涵盖文本识别和基础,并将位置信息纳入响应中,我们增强了可解释性并最大限度地减少幻觉。
2024-03-08 11:44:22
2323
1
原创 Qwen3.8-Max 开源了:该不该从 Claude 切过去?
阿里云推出开源旗舰大模型Qwen3.8-Max,具备2.4万亿参数、95B激活、1M上下文窗口及原生多模态能力,支持看图看视频,并首次开源Max系列权重。该模型在自主编码和多模态任务表现出色,但标准编码基准仍落后于Claude Fable 5。开发者社区反响两极,有人退订Anthropic转投Qwen,也有人批评其表现不稳定。官方展示了模型自主开发工具和复现论文的能力,但部分基准对比存在争议。Qwen3.8-Max的亮点在于"旗舰级+开源"组合,为开发者提供更多自主权,但实际应用需根据场景权衡。
2026-08-04 18:00:45
84
原创 做文档解析的人该看看 Infinity-Parser2:一个模型把版面、表格、公式、图表全端了
Infinity-Parser2提出了一种端到端的文档解析大模型,通过"可控数据合成+多任务联合强化学习"方法,统一处理文档解析中的OCR、版面分析、表格识别等任务。该研究开源了500万双语训练数据和两个模型变体,在多个基准测试中表现优异。其核心创新在于:1)采用DOM-based文档合成引擎生成精准标注数据;2)使用GRPO算法进行多任务联合强化学习;3)实现了单一模型替代传统多模型流水线。该方法特别适用于中文文档处理场景,为RAG和文档智能应用提供了新的技术方案,但也存在自测结果需验证、真实场景泛化性待
2026-08-04 13:46:22
272
原创 阅读笔记:ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction
本文提出了ExtractBench,一个面向企业文档结构化抽取的综合评测基准。该基准包含370篇真实/合成文档(4869页,覆盖8大领域67种文档类型),并沿任务挑战、感知挑战、表格结构、长度和领域五个维度进行标注。研究评估了14个前沿系统,发现不同技术路线在质量-成本权衡上表现迥异:通用视觉语言模型成本低(≤1.0美分/页)但F1低于80%,编码代理鲁棒性高但成本超15美分/页,而专用API(如LlamaExtract)以95.6% F1和8.1美分/页达到最优。研究还揭示了现有系统在溯源能力上的不足(最
2026-08-03 12:04:38
284
原创 阅读笔记:DocOCR-Eval: A Correction-Based Framework for OCR Tool Selection Without Ground Truth
本文提出DocOCR-Eval框架,通过MLLM校正OCR输出的方式实现免人工标注的OCR引擎自动选择。核心方法是对每个OCR引擎的输出进行三阶段诊断(字符/分词/语义错误),条件触发纯文本或视觉重识别校正器,用校正后ANLS分数排序引擎。在FUNSD等数据集上,该方法与人工标注排名的NDCG对齐度达0.97左右。主要亮点是创新性地将MLLM作为校正器来近似评估OCR质量,但验证尚不充分(仅4个引擎、3/9数据集结果),且未讨论MLLM自身误差对排名的影响。这项工作为OCR选型提供了低成本解决方案,但作为方
2026-08-02 01:39:31
164
原创 阅读笔记:Ocean-OCR:Towards General OCR Application via a Vision-Language Model
这篇论文用配合大规模高质量 OCR 数据,把一个 3B 的多模态大模型(MLLM)训练到在 DocVQA / TextVQA / ChartQA / OCRBench 等基准上达到同规模最优,并号称"首个超越专业 OCR 工具(TextIn / PaddleOCR)的 MLLM"。核心证据是与真实场景(文档抽取 / 场景文字 / 手写)多指标领先同规模乃至 7B–8B 模型。——优势无法干净归因到架构,复现性低。
2026-07-31 17:04:43
254
原创 HPD-Parsing: Hierarchical Parallel Document Parsing
本文提出了一种名为HPD-Parsing的分层并行解码框架,用于提升视觉语言模型在文档解析任务中的推理效率。该方法将传统的整页自回归生成重构为"主版面分支串行协调+内容分支并行解码"的层次化结构,并通过P-MTP推测解码进一步加速。实验表明,1B参数的HPD-Parsing模型在OmniDocBench v1.6基准测试中达到4,752 TPS的吞吐量,比现有最快文档解析模型快2.62倍,同时保持94.91的综合准确率(端到端unified模型中的SOTA)。该方法有效缓解了长文档解码时的序列瓶颈问题,最长
2026-07-31 10:42:00
377
原创 OvisOCR2 Technical Report
这篇论文用解决——单一模型一次前向即输出含文本、公式、表格、视觉区域的自然阅读顺序 Markdown。核心结论是(OmniDocBench v1.6 overall 96.58,比前最佳端到端 +1.84)。关键证据是——这抓住了端到端相对 pipeline 的结构性优势。,"全面 SOTA"的表述部分依赖把 Real 拉平的 Avg3 聚合指标与一份不可公开验证的 in-house benchmark。
2026-07-29 18:15:57
308
原创 ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes
研究构思模式挖掘与自动化评估工具开发 摘要 本研究从1947篇ICLR/ICML/NeurIPS会议论文(2021-2025)中提取创新模式,开发了自动化研究构思工具IdeaSpark。通过两阶段创新签名提取和聚类分析,归纳出15个可复用构思模式,并构建了包含成功条件和故障模式的对比卡片。在100个ICLR-2026种子评估中,IdeaSpark生成的想法质量显著优于基线(3.87/4分,88%胜率),同时保持了竞争性新颖性。研究验证了从会议成果中提取结构化构思模式的有效性,为研究自动化领域提供了新的中间层
2026-07-23 21:06:55
309
原创 ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog
文章摘要 本文提出了ResearchStudio-Reel系统,通过5个可组合的agent技能,将学术论文PDF自动转化为三种传播形式——会议海报、演讲视频和双语博客,并保持输出文件的原生可编辑性。系统核心创新在于实现"最后一公里"研究传播的两个关键约束:产出可编辑性(native editability)和多产物统一导航(experience-level convergence)。在Paper2Poster基准测试中,系统生成的海报美学评分超过作者自制海报约17.5%,并在视觉评估中显著优于基线方法。研究
2026-07-22 09:33:04
308
原创 Resource2Skill: Distilling Executable Skills from Human-Created Resources for Software Agents
摘要(149字) 论文提出Resource2Skill框架,从教学视频、代码库等多模态人类资源中自动蒸馏可执行技能,构建层级化多模态Skill Wiki,提升软件agent的任务表现。实验表明:装备技能库的agent在7个创作软件任务上平均比无技能agent提升11.9个百分点,且视频资源贡献关键增益(消融后性能下降9.5%)。核心创新包括统一离线-在线技能蒸馏流水线、跨域层级组织及视觉-代码-文本多模态技能表示。局限性在于评估依赖同源LLM判官,且对比基线未完全覆盖SOTA系统。
2026-07-21 17:38:15
335
原创 阅读笔记:RT-DocLayout: Real-Time End-to-End Document Layout Analysis with Reading Order in the Wild
论文摘要 RT-DocLayout 是一个基于 RT-DETR 的轻量级文档版面分析框架,通过 33M 参数的单一视觉模型实现端到端的文档元素分类、边界框检测、像素级掩码分割和阅读顺序预测。该研究针对现有级联管道误差传播和大模型算力昂贵的问题,提出以 mask-centric 的统一多任务处理替代传统轴对齐边界框方法,在物理空间感知数据增强的辅助下,显著提升了模型在弯曲、倾斜等真实畸变文档上的解析能力。实验表明,该方法在 OmniDocBench v1.5 基准测试中达到 94.50 综合评分和 132.1
2026-07-17 15:24:23
365
原创 CVPR 2026 论文索引站上线 [特殊字符]✨
【CVPR 2026论文索引站上线】开发者整理5163篇会议论文(主会+Findings),推出交互式检索工具,支持多维筛选(84个研究方向/论文等级/资源标签)、全文搜索及中英双语切换。该纯静态页面无需注册,开箱即用,已开源GitHub。提供在线体验与开源仓库链接,欢迎反馈建议。#计算机视觉 #AI工具
2026-07-07 18:03:18
207
2
原创 省钱又提效!大模型Token优化与减少使用技巧全指南
本文系统介绍了大模型Token优化的实用技巧,从Prompt工程、上下文管理到模型路由与缓存策略。核心方法包括:精简系统提示词(可节省60% Token)、使用Few-Shot示例替代长指令、实施上下文压缩(成本降低高达91%)、按需加载工具和文档、建立智能记忆系统。同时提出模型路由策略,根据任务复杂度选择合适模型,并推荐级联调用和缓存技术(可降低90%成本)。这些方法在保证输出质量的前提下,能显著降低Token消耗与AI应用成本,适用于各类大规模AI应用场景。
2026-05-26 17:28:24
572
原创 1元撬动72倍人力:我们拆解了15款产品,发现一人公司的完整武器库
2026年,一人公司(OPC)已成为商业新范式,36.3%的新公司由单人创办。核心在于AI Agent协作而非个人全能,通过OpenClaw等协议实现“人类决策+AI执行”的架构。多Agent平台(如AgentMore、CrewAI)支持群聊协作与角色编排,Vibe Coding工具(Cursor、Replit)让非技术者用自然语言开发产品。技术门槛崩塌后,竞争转向产品判断力,1元AI成本可撬动72倍人力杠杆。一人公司武器库已完备,关键在于工具组合与协议应用。
2026-05-19 16:04:58
484
原创 《200+技能、36个数据库接口:AI Agent的科研技能图谱,正在重写“做科研“的定义》
当200+Skill覆盖从单细胞测序到量子计算、从学术搜索到基金申请的完整光谱,当36个数据库接口让Agent“看见”而非“搜索”,当self-improvement让Agent学会“学会”——我们面对的已不是“科研助手”,而是正在进化中的“科研智能体”。
2026-05-19 14:44:17
882
原创 ChatGLM:A Family of Large Language Models from GLM-130B to GLM-4 All Tools
本文介绍了ChatGLM,这是一个不断发展的大型语言模型系列,我们一直在开发中。本报告主要关注GLM-4语言系列,包括GLM-4、GLM-4-Air和GLM-4-9B。这些代表了我们训练的最先进的模型,它们结合了之前三代ChatGLM的所有见解和经验教训。迄今为止,GLM-4模型主要在中文和英文上进行了预训练,使用了大约一万亿个token,以及来自24种语言的一小部分语料库,并主要针对中文和英文使用进行了优化。通过多阶段后训练过程,包括有监督的微调和从人类反馈中学习,实现了高质量的对齐。
2024-06-19 15:56:03
1738
原创 DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence
我们介绍了DeepSeek-Coder-V2,这是一个开源的混合专家(MoE)代码语言模型,其性能与GPT4-Turbo在代码特定任务中相当。具体来说,DeepSeek-Coder-V2是从DeepSeek-V2的中间检查点进一步预训练而来,额外使用了6万亿个token。通过这种持续的预训练,DeepSeek-Coder-V2在编码和数学推理能力上大幅度增强了DeepSeek-V2的能力,同时在一般语言任务中保持了相当的性能。
2024-06-19 15:42:37
2308
原创 MDPO:Conditional Preference Optimization for Multimodal Large Language Models
直接偏好优化(DPO)已被证明是大型语言模型(LLM)对齐的有效方法。近期的研究尝试将DPO应用于多模态场景,但发现难以实现一致的改进。通过比较实验,我们确定了多模态偏好优化中的无条件偏好问题,即模型在优化过程中忽略了图像条件。为了解决这个问题,我们提出了MDPO,这是一个多模态DPO目标,它通过同时优化图像偏好来防止过度优先考虑仅基于语言的偏好。此外,我们引入了一个奖励锚点,强制奖励对于选定的响应为正,从而避免了它们的似然度降低——这是相对偏好优化的一个内在问题。
2024-06-18 17:24:40
1448
原创 ChartMimic: Evaluating LMM’s Cross-Modal Reasoning Capability via Chart-to-Code Generation
本文介绍了一个新的基准测试ChartMimic,旨在评估大型多模态模型(LMMs)的视觉基础代码生成能力。ChartMimic使用信息密集型的视觉图表和文本指令作为输入,要求LMMs生成相应的图表渲染代码。ChartMimic包含1000个人工策划的(图表,指令,代码)三元组,代表了在各个领域(如物理、计算机科学、经济学等)科学论文中发现的真实图表使用案例。这些图表涵盖了18种常规类型和4种高级类型,细分为191个子类别。此外,我们提出了多级评估指标,以自动全面评估输出代码和渲染图表。
2024-06-17 17:36:28
1303
原创 Xmodel-VLM: A Simple Baseline for Multimodal Vision Language Model
我们介绍了Xmodel-VLM,这是一个尖端的多模态视觉语言模型。它旨在高效地部署在消费级GPU服务器上。我们的工作直接面对一个关键的行业问题,即通过解决阻碍大规模多模态系统广泛采用的高昂服务成本问题。通过严格的训练,我们从头开始开发了一个10亿规模的语言模型,采用LLaVA范式进行模态对齐。我们称之为Xmodel-VLM的结果是轻量级但功能强大的多模态视觉语言模型。在众多经典多模态基准测试中的广泛测试表明,尽管其体积更小、执行速度更快,但Xmodel-VLM的性能可与更大的模型相媲美。
2024-05-16 15:22:35
762
原创 Introducing Meta Llama 3: The most capable openly available LLM to date
我们希望解决开发人员的反馈,以提高 Llama 3 的整体实用性,并在这样做的同时继续在负责任地使用和部署 LLMs.我们正在接受尽早发布的开源精神,并经常发布,以使社区能够在这些模型仍在开发中时访问它们。在不久的将来,我们的目标是使 Llama 3 成为多语言和多模态的,具有更长的上下文,并继续提高推理和编码等核心LLM功能的整体性能。我们新的 8B 和 70B 参数 Llama 3 模型是 Llama 2 的重大飞跃,并为LLM这些规模的模型建立了新的最先进的技术。
2024-04-22 11:36:56
1867
原创 MeshLRM: Large Reconstruction Model for High-Quality Meshes
MeshLRM是一种新颖的基于LRM(Large Reconstruction Models)的方法,能够仅使用四张输入图像在不到一秒钟的时间内重建出高质量的网格。与以往侧重于基于NeRF重建的LRM不同,MeshLRM将可微分的网格提取和渲染集成到LRM框架中。这允许通过微调预训练的NeRF LRM与网格渲染来实现端到端的网格重建。此外,我们通过简化以前LRM中的几个复杂设计来改进LRM架构。MeshLRM的NeRF初始化是使用低分辨率和高分辨率图像顺序训练的;
2024-04-21 11:09:11
1558
原创 Reka Core, Flash, and Edge: A Series of Powerful Multimodal Language Models
我们介绍了 Reka Core、Flash 和 Edge,这是一系列由 Reka 从头开始训练的强大多模态语言模型。Reka 模型能够处理和推理文本、图像、视频和音频输入。这份技术报告讨论了这些模型的一些训练细节,并提供了全面的评估结果。我们展示了 Reka Edge 和 Reka Flash 不仅是各自计算类别中的最新技术,而且还超过了许多更大的模型,为各自的计算类别提供了巨大的价值。同时,我们最有能力且最大的模型 Reka Core,在自动评估和盲人评估中接近最佳前沿模型(OpenAI, 2023;
2024-04-19 16:57:24
1445
原创 Dynamic Typography: Bringing Text to Life via Video Diffusion Prior
文本动画是一种表达媒介,通过将文字注入动态来转变静态的沟通方式,以此激发情感、强调含义并构建引人入胜的叙事。制作语义感知的动画面临重大挑战,需要图形设计和动画方面的专业知识。我们提出了一种自动化的文本动画方案,称为“动态排版”,它结合了两个具有挑战性的任务:将字母变形以传达语义意义,并根据用户提示赋予它们生动的运动。我们的技术利用矢量图形表示和一个端到端的基于优化的框架。该框架采用神经位移场将字母转换为基础形状,并应用每帧运动,鼓励与预期文本概念的一致性。
2024-04-19 16:53:29
1432
原创 LONG-FORM MUSIC GENERATION WITH LATENT DIFFUSION
音频生成模型在音乐领域取得了显著进展,但迄今为止尚未能够产生具有连贯音乐结构的完整长度音乐曲目。我们展示了通过在长时间上下文上训练生成模型,可以产生最长达到4分45秒的长篇音乐。我们的模型由一个扩散变换器组成,该变换器操作在高度下采样的连续潜在表示上(潜在率为21.5赫兹)。根据音频质量和提示对齐的指标,它获得了最先进的生成结果,主观测试表明它产生了具有连贯结构的完整长度音乐。
2024-04-18 11:01:53
973
原创 Learn Your Reference Model for Real Good Alignment
本文提出了一种新的方法Trust Region DPO (TR-DPO),用于改进大型语言模型(LLMs)的对齐问题。现有的对齐方法存在不稳定性的问题,研究者们不断发明各种技巧来解决这一缺陷。例如,在语言模型对齐的基本技术RLHF中,除了最大化奖励外,还会最小化可训练策略和SFT策略之间的Kullback-Leibler散度。这种添加可以防止模型过度拟合奖励模型(RM)并生成对RM来说领域外的文本。DPO方法重新定义了RLHF的优化任务,并在隐式中保持策略接近SFT策略的要求。
2024-04-17 09:07:36
1275
原创 TransformerFAM: Feedback attention is working memory
TransformerFAM是一种新型的Transformer架构,它通过引入反馈循环机制,使得网络能够关注自身的潜在表示。这种设计促进了Transformer内部工作记忆的出现,使其能够处理无限长的序列。TransformerFAM不需要额外的权重,能够与预训练模型无缝集成。实验表明,TransformerFAM在处理长上下文任务时显著提高了不同模型大小(1B、8B和24B)的性能,展示了赋能大型语言模型(LLMs)处理无限长度序列序列的潜力。
2024-04-17 09:04:29
1490
原创 Social Skill Training with Large Language Models
本文探讨了如何利用大型语言模型(LLMs)进行社交技能训练。社交技能如冲突解决对于有效沟通和在工作和生活中取得成功至关重要。然而,大多数人难以获得实践社交技能的环境。我们提出了一个通用框架,通过AI伙伴和AI导师(APAM)结合体验学习和现实练习以及量身定制的反馈来进行社交技能训练。本工作最终呼吁跨学科创新,以解决劳动力发展和社会平等的更广泛影响。
2024-04-08 17:11:53
1029
原创 Chinese Tiny LLM: Pretraining a Chinese-Centric Large Language Model
本研究介绍了CT-LLM(Chinese Tiny Large Language Model),这是一个2B参数的大型语言模型(LLM),它标志着在开发LLMs时优先考虑中文的重大转变。CT-LLM的独特之处在于,它从头开始,主要通过包含1200亿个token的广泛语料库进行预训练,其中包括800亿个中文token、300亿个英文token和100亿个代码token。这种战略性组成通过比对技术增强了模型在理解和处理中文方面的卓越能力。
2024-04-08 17:09:16
1427
原创 Advancing LLM Reasoning Generalists with Preference Trees
我们介绍了Eurus,一系列针对推理任务优化的大型语言模型(LLM)。Eurus模型基于Mistral-7B和CodeLlama-70B进行微调,实现了在多个涵盖数学、代码生成和逻辑推理问题的基准测试中的最先进性能。值得注意的是,Eurus-70B在12个测试覆盖五个任务的全面基准测试中击败了GPT-3.5 Turbo,并在LeetCode和TheoremQA这两个具有挑战性的基准测试中分别达到了33.3%的pass@1准确率和32.6%,显著优于现有的开源模型,性能提升超过13.3%。
2024-04-03 11:50:51
1282
原创 Long-context LLMs Struggle with Long In-context Learning
大型语言模型(LLMs)在处理超过32K个token的长序列方面取得了显著进展。然而,它们的性能评估主要局限于诸如困惑度和合成任务等指标,这些指标可能无法充分捕捉它们在更微妙、现实世界场景中的能力。本研究引入了一个专门的基准测试(LongICLBench),专注于极端标签分类领域内的长上下文学习。我们精心选择了六个数据集,标签范围从28到174个类别,涵盖了从2K到50K个token的不同输入(少量示例演示)长度。我们的基准测试要求LLMs理解整个输入,以识别庞大的标签空间,从而做出正确的预测。
2024-04-03 11:46:24
1055
原创 Jamba: A Hybrid Transformer-Mamba Language Model
我们介绍了Jamba,一种新的基于新颖混合Transformer-Mamba混合专家(MoE)架构的基础大型语言模型。具体来说,Jamba交错了Transformer和Mamba层的块,享受两个模型家族的好处。在这些层中的一些层添加了MoE,以增加模型容量,同时保持活跃参数使用量可控。这种灵活的架构允许针对资源和目标的特定配置。在我们实现的特定配置中,我们得到了一个强大的模型,适合在单个80GB GPU中运行。
2024-04-02 16:49:17
1525
原创 Transformer-Lite: High-efficiency Deployment of Large Language Models on Mobile Phone GPUs
大型语言模型(LLM)在智能手机上的应用越来越广泛,如智能助手、文本摘要、翻译和多模态任务等。然而,当前的设备上LLM部署方法推理速度慢,导致用户体验不佳。为了在设备GPU上高效部署LLM,我们提出了四种优化技术:(a)基于符号表达式的方法支持动态形状模型推理;(b)算子优化和执行优先级设置以提高推理速度并减少手机延迟;(c)一种称为M0E4的FP4量化方法减少了反量化开销;(d)基于子张量的技术消除了LLM推理后对KV缓存进行复制的需求。
2024-04-02 16:44:15
1713
原创 Multi-font Multi-size Kannada Numeral Recognition Based on Structural Features
本文提出了一种快速新颖的多字体多尺寸卡纳达数字识别方法,该方法无需细化且不需要尺寸标准化。使用不同的结构特征进行数字识别,包括四个方向的像素方向密度、水库原理、最大轮廓距离和填充孔洞密度。使用欧几里得最小距离准则来找到最小距离,并使用K最近邻分类器对卡纳达数字进行分类,数字图像的尺寸从16到50不等,涵盖了来自NUDI和BARAHA流行文字处理卡纳达软件的20种不同字体样式。测试了总共1150个数字图像,分类的整体准确率达到了100%。该方法平均耗时0.1476秒。
2024-03-29 17:39:56
608
原创 KOSMOS-2.5: A Multimodal Literate Model
我们介绍了KOSMOS-2.5,这是一个用于机器阅读文本密集型图像的多模态文学模型。KOSMOS-2.5在大规模文本密集型图像上进行预训练,擅长两个不同但相互合作的转录任务:(1) 生成空间感知的文本块,每个文本块在图像中分配其空间坐标;(2) 生产结构化文本输出,以markdown格式捕捉样式和结构。通过共享的Transformer架构、特定任务的提示和灵活的文本表示,实现了这种统一的多模态文学能力。我们在端到端的文档级文本识别和图像到markdown文本生成上评估了KOSMOS-2.5。
2024-03-29 17:16:51
1672
原创 Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models
在这项工作中,我们介绍了Mini-Gemini,这是一个简单而有效的框架,用于增强多模态视觉语言模型(VLMs)。尽管VLMs在促进基本视觉对话和推理方面取得了进展,但与先进的模型如GPT-4和Gemini相比,性能差距仍然存在。我们试图通过挖掘VLMs的潜力,以实现更好的性能和任何到任何的工作流程,从三个方面缩小这一差距,即高分辨率视觉令牌、高质量数据和VLM引导的生成。为了增强视觉令牌,我们提出使用额外的视觉编码器进行高分辨率细化,而不增加视觉令牌计数。
2024-03-28 18:09:57
2231
原创 ViTAR: Vision Transformer with Any Resolution
本文解决了视觉Transformer(ViTs)面临的一个重大挑战:在不同图像分辨率下的可扩展性受限。通常,ViTs在处理训练时未见过的分辨率时,性能会下降。我们的工作引入了两个关键创新来解决这个问题。首先,我们提出了一个动态分辨率调整的新颖模块,设计了一个单一的Transformer块,专门用于实现高效的增量令牌整合。其次,我们在视觉Transformer中引入了模糊位置编码,以在多个分辨率下提供一致的位置感知,从而防止对任何单一训练分辨率的过拟合。
2024-03-28 18:05:16
2097
原创 RoDLA: Benchmarking the Robustness of Document Layout Analysis Models
在现实世界的应用中开发文档布局分析(DLA)模型之前,进行全面的鲁棒性测试是必不可少的。然而,DLA模型的鲁棒性在文献中尚未被充分探索。为了解决这个问题,我们首次引入一个DLA模型的鲁棒性基准测试,它包括三个数据集的450K文档图像。为了涵盖现实中的文档损坏情况,我们提出了一个包含36种常见文档损坏的扰动分类法,灵感来源于现实世界的文档处理。此外,为了更好地理解文档扰动的影响,我们提出了两个新的度量方法,分别是平均扰动效应(mPE)和平均鲁棒性降级(mRD)。
2024-03-26 14:26:00
643
paddlepaddle-gpu 适配Spark DGX GB10服务器 python包
2026-01-05
Dataset - TSR数据集 同花顺文档图片表格结构识别算法-数据集
2024-12-03
python的柱状图,绘制漂亮
2024-02-29
手写化学式数据集,企业级数据集、可应用实际生产环境
2024-02-28
深度学习 OCR 弯曲/圆形文本数据集
2022-05-25
深度学习多类别电表读数OCR数据集
2022-05-25
自标注老鼠数据集内含2000+图片
2022-03-23
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅