- 博客(158)
- 收藏
- 关注
原创 云端部署 OpenClaw:打造 24 小时“数字生命”助手
谁还在被AI“画大饼”?写邮件要自己点发送,列待办要自己去执行,看似智能实则只是 “嘴炮工具”,根本落不了地。但 2026 年初这款现象级 AI 产品的出现,彻底改变了这一现状 —— 它就是被网友亲切称为「那只龙虾」🦞的,一款真正能 “动手办事” 的。从Clawdbot到Moltbot,再到如今的OpenClaw,这款开源AI智能体框架在短短一个月内,,朋友圈、开发者社区全是它的身影,TechCrunch、Forbes等外媒争相报道,成为2026年初最现象级的AI产品。
2026-02-11 18:01:39
2409
原创 LlamaFactory春节特供:AI 精准拿捏对联格律,告别对仗翻车
如今大语言模型早已能写文、答惑、创作,可面对对联这种讲究格律、对仗、意境的传统文体,通用大模型却屡屡 “水土不服”。问题的核心,在于模型缺少足量优质的对联专业样本,没能真正吃透中文对仗的规则。而微调(Fine-tuning)恰好能补上这一课:无需从零打造新模型,只需让现有大模型基于高质量对联数据 “拜师学艺”,就能掌握格律与意境的创作要领。借助LlamaFactory微调工具,大模型也能精准拿捏对联的对仗之美、平仄之韵,写出既有文化底蕴又贴合新春氛围的合格对联,让 AI 也能为传统年俗添上一笔新意。
2026-02-11 14:01:40
1754
原创 奔赴AGI,算力同行|Lab4AI亮相2026中国生成式AI大会
2026年4月21-22日,2026中国生成式AI大会(GenAICon 2026) 在北京富力万丽酒店盛大启幕!
2026-04-23 10:49:20
403
原创 RSRCC:基于检索增强 Best-of-N 排序构建的遥感区域变化理解基准数据集
本研究构建的RSRCC是首个面向遥感局部细粒度变化推理的问答基准,通过分层半自动化流水线实现了高质量、规模化的数据生成。
2026-04-23 10:10:27
486
原创 HSG: Hyperbolic Scene Graph
HSG通过双曲几何学习场景图嵌入,有效捕获场所-物体层级蕴含关系,在保持检索性能的同时大幅提升场景图结构质量,验证了双曲表示在结构化视觉推理中的有效性。
2026-04-22 10:14:20
595
原创 Aligning Agents via Planning: A Benchmark for Trajectory-Level Reward
本研究提出Plan-RewardBench轨迹级奖励建模基准,填补了工具型智能体长时序轨迹奖励模型评估的空白,通过严谨的数据集构建与统一测评,证实现有奖励模型在轨迹级判别上存在显著缺陷,长时序规划、动态约束跟踪、安全拒绝等能力亟待提升,为智能体对齐研究提供了关键测评与数据支撑。
2026-04-21 11:26:23
578
原创 算力赋能三维视觉创新,Lab4AI亮相 China3DV 2026
2026年 4 月 17—19 日,第五届中国三维视觉大会(China3DV 2026)在杭州国际博览中心召开,作为国内该领域最高规格学术盛会,聚焦三维重建、具身智能等人前沿方向;大模型实验室(lab4ai.cn)作为重要生态伙伴,不仅提供 H800 等高端 GPU 算力支撑,还通过开箱即用的开发环境、OpenClaw 科研专家 Agent 等全流程工具破解科研痛点,同时推出 AI 课程、权威竞赛合作等福利助力青年学者成长,助力三维视觉产学研深度融合与技术落地。
2026-04-20 13:41:31
731
原创 GAViD: A Large-Scale Multimodal Dataset for Context-Aware Group Affect Recognition from Videos
本研究构建了当前规模最大、标注最完备的**多模态上下文感知群体情感视频数据集GAViD**,并提出CAGNet模型实现视觉、音频、上下文信息的有效融合,在效价分类与离散情感识别任务上取得领先性能,填补了领域内数据与模型的双重缺口,为自然场景下群体情感计算研究提供了关键支撑。
2026-04-20 10:12:36
630
原创 大模型训练全流程实战指南工具篇(十一)—— 大模型训练参数调优实战:从小白到调参高手
大模型训练全流程实战指南工具篇(十一)—— 大模型训练参数调优实战:从小白到调参高手
2026-04-17 18:38:12
801
原创 KNOWLEDGE IS NOT STATIC: ORDER-AWARE HYPERGRAPH RAG FOR LANGUAGE MODELS(论文解读)
本研究推翻了RAG领域“检索证据可视为无序集合”的核心假设,提出OKH-RAG框架,将顺序作为核心结构属性融入超图RAG,实现高阶知识交互与时序关系的统一建模。实验证明,在顺序敏感的领域推理任务中,证据的组织顺序与内容本身同等重要,顺序感知轨迹检索可显著提升大模型的推理准确性与事实一致性。
2026-04-17 10:29:47
616
原创 ICLR 2026|上海交通提出 π³,突破参考视图束缚,提升 3D 几何重建鲁棒性
π³通过全排列等变设计彻底消除固定参考视图的归纳偏置,构建了鲁棒、高效、可扩展的前馈式视觉几何重建模型,在多项核心任务上刷新 SOTA。该研究存在局限性:无法处理透明物体,重建几何细节精度不及扩散类方法,点云生成易产生网格状伪影。未来可围绕透明物体建模优化、几何细节精度提升、点云生成伪影消除等方向展开拓展研究。
2026-04-16 17:18:27
668
原创 Lab4AI 大模型实验室参展首届中国「AI + 新材料」大会
2026年4月9—12日,首届中国「AI+新材料」大会在广州南沙隆重举行。Lab4AI大模型实验室作为AI算力生态社区携核心成果参展大会,展示AI赋能材料科研的一站式解决方案,与参会嘉宾、科研团队、企业代表深度交流,共同探讨技术融合与创新生态。
2026-04-16 10:30:57
544
原创 MAG-3D: Multi-Agent Grounded Reasoning for 3D Understanding
MAG-3D提出无需训练的多智能体三维具身推理框架,通过规划、定位、编码三智能体动态协同,结合开放词汇三维定位与可执行几何验证,在Beacon3D、MSQA基准上实现零样本最优性能,同时大幅提升定位与问答的一致性,有效解决现有方法依赖微调、流程僵化、易产生幻觉的问题,为开放世界三维可靠推理提供实用方案。
2026-04-15 10:25:17
609
原创 StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video Understanding
本文提出的StreamMeCo是首个面向工业级流式视频智能体的长期记忆压缩框架,通过双分支结构压缩与时间衰减检索,在大幅缩减记忆图规模的同时,提升检索效率与模型精度,有效解决了流式视频理解中智能体记忆膨胀的核心痛点,为实时视频理解系统提供了高效记忆管理方案。
2026-04-14 10:21:48
679
原创 HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents
本文提出的HY-Embodied-0.5模型家族,通过创新的MoT架构、亿级具身专项数据、迭代自进化训练与在线策略蒸馏方案,有效解决了通用VLM在具身智能场景的感知与推理短板,实现了边缘高效版与大型高性能版的协同设计,在多项基准测试与真实机器人任务中验证了技术有效性,为现实世界具身智能体提供了强大的基础模型支撑。
2026-04-13 10:37:54
597
原创 Stop Fixating on Prompts: Reasoning Hijacking and Constraint Tightening for Red-Teaming LLM Agents
本文提出的JailAgent框架,通过不修改用户提示词的隐式攻击方式,实现了对LLM智能体推理轨迹与记忆检索的高效劫持,兼具高攻击成功率、强泛化性、高隐蔽性与低计算开销,为LLM智能体的红队测试与安全评估提供了全新范式。
2026-04-10 11:05:26
496
原创 EvolveRouter: Co-Evolving Routing and Prompt for Multi-Agent Question Answering(论文解读)
本文提出了 EvolveRouter,一个通过闭环协同进化联合优化路由与智能体配置的创新框架,有效解决了多智能体问答中智能体质量静态化和协作规模僵化的两大核心问题。实验结果充分验证了其相对于现有 SOTA 方法的优越性。
2026-04-09 10:22:24
480
原创 STREAMING AUTOREGRESSIVE VIDEO GENERATION VIA DIAGONAL DISTILLATION(论文解读)
本文提出的对角蒸馏框架首次同时建模时序与降噪步维度,解决了自回归视频蒸馏的曝光偏差与运动失真问题,实现了高质量、低延迟、长稳定的实时流式视频生成,为游戏仿真、机器人学习、实时内容创作提供可行方案。
2026-04-08 10:18:25
711
原创 Mirage: The Illusion of Visual Understanding
本研究证实当前多模态AI的高基准测试成绩,很大程度上是 **“幻影效应”** 带来的视觉理解假象,模型并非依靠真实视觉感知,而是利用文本线索、数据模式、先验知识完成任务。幻影效应在主流模型中普遍存在,医疗场景下的病理偏向会引发严重安全风险,现有评估范式无法区分真实视觉理解与文本推理。研究提出的B-Clean框架,可有效净化现有基准,实现多模态模型真实视觉能力的公平评估。
2026-04-07 13:41:20
585
原创 LongCat-Next: Lexicalizing Modalities as Discrete Tokens
本研究通过LongCat-Next探索了语言风格离散自回归建模自然扩展到视觉和音频的可能性。结果表明,通过精心设计的分词器和训练策略,连续感知信号可以被有效离散化,同时保持强大的能力。作为迈向原生多模态的一步,该工作为构建真正统一的多模态基础模型提供了新的视角。局限性在于当前版本的视觉分词器主要关注语义解码一致性而非像素保真度,且评估主要集中在图像到文本和文本到图像方向。未来工作将致力于优化分词器以更好地满足下一代版本目标,并扩展到任意到任意生成和交错多模态推理,探索数据规模与表征学习的协同效应。
2026-04-02 16:38:09
557
原创 大模型训练全流程实战指南工具篇(十)—— 小白也能懂的大模型训练参数万字详解
这部分用于指定“基础模型”和“要合并的适配器”。这是基础模型的本地路径。合并操作会把 LoRA 适配器中学到的权重变化,注入到这个基础模型的对应层中。这里使用的是 Qwen2.5 0.5B 版本。这是LoRA 适配器的路径。使用 LLaMA Factory 进行微调后,保存的并不是一个完整的全量模型,而是一个很小的“补丁”文件包,通常包含和等文件。这个参数就是告诉工具:请把这个“补丁”合并到基础模型上。指定对话模板。
2026-04-02 10:28:44
1643
原创 大模型训练全流程实战指南工具篇(九)——LLamaFactory大模型训练工具使用指南
本期分享以 LLaMAFactory 大模型训练框架 为例,从环境搭建到模型下载、数据准备、微调训练、权重合并及部署测试,完整演示了 Qwen2.5-0.5B 的实战流程,充分展现了 LLaMAFactory 极简操作与广泛模型兼容的核心优势。通过本文大家可快速上手大模型微调,并掌握从训练到部署的全链路方法。下一期笔者将深入解析训练配置文件中的各项参数,帮助大家真正成为调参高手,敬请期待!
2026-04-01 14:08:03
809
原创 大模型训练全流程实战指南工具篇(八)——EasyDataset问答数据集生成流程
本篇内容以EasyDataset工具为例,系统介绍了问答对数据集的完整生成流程:从问题生成(支持单条/批量、三种算法)、答案生成(含思维链、多轮对话),到采用“自动化初筛+人工抽检+迭代优化”策略进行质量评估,最后导出Alpaca或ShareGPT标准格式,为模型微调提供高质量数据。到此数据集构建的基本工具指南笔者就介绍完全,下一篇文章开始将正式介绍大模型训练相关工具,大家敬请期待~
2026-04-01 13:48:53
1506
原创 《Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders》论文解读
本文提出Penguin-VL,一种紧凑型视觉语言模型,突破传统依赖大规模对比预训练视觉编码器的范式。通过从纯文本LLM初始化视觉编码器(Penguin-Encoder),结合混合监督预训练和统一训练策略,在2B/8B规模下实现了与大型VLM相当的性能。实验表明,该方法在文档理解、视觉知识和视频任务中表现优异,尤其在保留细粒度视觉线索方面显著优于对比预训练编码器。研究为参数高效的VLM发展提供了新思路,证明改进视觉表示而非模型扩展是性能提升的关键。
2026-04-01 10:29:39
411
原创 《Taming OpenClaw: Security Analysis and Mitigation of Autonomous LLM Agent Threats》论文简析
本文系统分析了OpenClaw自主AI代理的安全威胁,提出了五层生命周期导向的安全框架(初始化、输入、推理、决策、执行),揭示了跨阶段复合风险。研究通过案例验证了技能中毒、记忆中毒等威胁的实际影响,指出现有单点防御的局限性,并提出纵深防御架构设计原则。该研究为构建安全可靠的自主AI系统提供了重要参考,未来可探索硬件辅助安全原语和动态自适应防御策略。
2026-03-31 10:46:52
555
原创 Paperclip:让AI像“真实公司”协同运转,解锁AI团队全自动化新范式
2026年3月,一款名为Paperclip的开源项目在GitHub悄然崛起,它不是简单的AI工具集成平台,而是一款AI公司编排框架——核心定位是“将多个AI Agent组织成一家有序运转的‘AI公司’”,让AI员工像人类团队一样分工协作、按章办事,真正实现AI团队的全自动化、标准化、可控化运作。
2026-03-30 11:44:13
693
原创 Why AI systems don’t learn and what to do about it
本文提出了构建自主学习系统的路线图,强调了超越现有刚性、人工设计的训练范式的必要性。虽然面临构建逼真且快速的模拟器、设计新的评估基准(单元测试与集成测试)、扩展双层优化的计算规模以及解决伦理问题(如可控性与适应性的权衡、对齐攻击、道德地位)等挑战,但提出的 A-B-M 架构为未来跨学科研究提供了统一的概念框架,旨在启发能够像生物体一样自主、开放学习的智能体的发展。
2026-03-30 11:04:51
366
原创 LlamaFactory 微调实测|Qwen3-4B现代诗风格微调
本次实验使用中文现代诗数据集(链接:https://huggingface.co/datasets/Iess/chinese_modern_poetry),规模约为 24> 万条样本。该数据集将现代诗写作整理为“给定意象,生成诗歌”的训练形式,较适合用于现代诗风格微调。
2026-03-27 10:49:11
587
原创 Demystifing Video Reasoning 论文简析
本研究系统性地揭示了扩散视频模型中推理能力的内在机制,将其定义为“思维步”过程,并识别了伴随其产生的涌现行为。研究发现,推理并非沿时间维度展开,而是发生在去噪轨迹上,且模型具备类似LLM的工作记忆和自我修正能力。通过层级分析,进一步阐明了模型内部的功能分化。基于这些发现,研究提出的免训练集成方法展示了无需额外训练即可提升性能的潜力。总体而言,这项工作为理解视频推理提供了系统性的视角,将视频定位为机器智能的下一代有前途的基座,为未来研究如何更好地利用视频模型的内在推理动力学奠定了基础。
2026-03-25 17:23:10
451
原创 一文讲透:大模型、Skills与OpenClaw“龙虾”关系
很多人最近被“养龙虾”“AI技能”刷屏,却搞不清它们到底是什么、怎么用,甚至担心踩坑。今天就用最通俗的话,把大模型、Skills、OpenClaw(龙虾)、Agent的关系讲透,再附上技能获取渠道和安全避坑指南,新手也能轻松上手~
2026-03-20 16:22:47
1441
原创 OpenClaw爆火,装对 Skill 才是真・效率神器
如果说工具是 AI 的「手脚」,那 Skill 就是 AI 的「大脑决策逻辑」——它本质上是一份固化了“做事经验”的执行说明,告诉 AI:遇到什么任务、该用什么工具、按什么顺序做、输出要符合什么规范、要避开哪些坑。不用复杂技术,大多是 Markdown 格式的说明 + 简单的 YAML 配置文件,却能让 AI 的执行效果翻倍。举个最常见的例子:处理工作邮件工具:邮件客户端、日历、待办清单。
2026-03-17 11:30:14
642
原创 Lab4AI上线一键部署OpenClaw,附2分钟云养虾指南
OpenClaw 已适配大模型实验室Lab4AI环境,支持无缝部署。通过高度可定制的脚本配置引擎,你可以:✅ 灵活定义数据流与控制逻辑✅ 与各类第三方应用深度集成✅ 构建高效的大模型研发闭环5 分钟,云养一只虾,现在开始吧!
2026-03-13 16:35:09
501
原创 大模型训练全流程实战指南工具篇(七)——EasyDataset文档处理流程
本文详细介绍了EasyDataset工具在大模型训练数据预处理中的应用。作为专为领域数据集构建设计的工具,EasyDataset实现了从文献解析到数据集构造的全流程闭环,具备智能文献处理、领域标签体系、智能数据生成等核心功能。 文章重点讲解了: 安装配置流程,支持Windows/macOS/Linux系统 文本处理核心步骤: 支持Markdown/PDF/DOCX/TXT格式 提供多种智能分块策略(固定长度/递归/Markdown结构/代码分块)
2026-02-27 15:21:04
1132
原创 大模型训练全流程实战指南工具篇(六)—OCR工具实战指南(以DeepSeek-OCR-2为例)
本文以DeepSeek-OCR-2为例,详解其核心特性、本地部署及vLLM推理实战。并延伸后处理策略,涵盖数据清洗、RAG优化到多模态检索,打通从“读出来”到“用起来”的全链路,为高质量数据集构建提供实战指南。有了OCR工具等统一格式后,接下来数据处理流程的重要工作就是构建数据集了,下篇内容笔者将分享当前通用的数据处理工具EasyDataset, 大家敬请期待~
2026-02-27 15:10:32
1223
原创 通用4D世界模型NeoVerse面世:单目视频秒变4D大片,推理提速8倍
来自中科院自动化所(CASIA)与CreateAI的研究团队联合发布了最新的通用4D世界模型——NeoVerse。该模型彻底打破了以往4D建模对专业多视角数据或复杂位姿预处理的依赖,通过学习互联网上100万条“野外”单目视频,实现了从视频重建到高保真生成的跨越式进化。
2026-02-15 09:00:00
1120
原创 GDPO:多目标强化学习高效优化新路径
论文聚焦多奖励强化学习中的优化方法问题,指出现有 GRPO 算法在多奖励场景下会导致奖励信号坍缩、训练信号丢失,进而引发收敛次优或训练失败。为此,提出 GDPO 算法,通过对单个奖励分别进行组归一化并结合批次优势归一化,保留跨奖励差异并维持数值稳定性。在工具调用、数学推理、代码推理三大任务的实验验证中,GDPO 在正确性、约束遵守度等指标上均持续优于 GRPO 及其实验变体,同时提供了通过奖励权重调整与条件化奖励函数应对目标难度差异的优先级建模方案,为语言模型契合多样化人类偏好提供了更稳定、高效的优化框架。
2026-02-14 12:00:00
1577
原创 DataFlow:用自然语言自动准备LLM数据
该论文提出LLM驱动的统一数据准备框架DataFlow,旨在解决当前LLM数据准备碎片化、标准化缺失的问题。框架含近200个可复用算子与6类领域通用流水线,采用类PyTorch编程接口,支持模块化、可调试的数据处理。通过DataFlow-Agent,可将自然语言指令自动转化为可执行流水线。实验表明,其在文本、数学推理、代码等任务上表现优异,Text-to-SQL执行准确率提升3%,代码基准平均提升7%,10K样本数据集性能超越1M规模数据集,为数据中心型AI发展提供系统级基础。
2026-02-13 07:00:00
758
原创 兰大&港科大团队揭秘视频推理瓶颈
该论文聚焦于开放网络环境下的视频深度推理任务,针对现有多模态评估中视频推理能力薄弱、深度研究基准多以文本为核心、缺乏对视频线索与开放网络证据联合推理评估的研究缺口,提出了首个视频深度研究基准VideoDR。
2026-02-12 08:00:00
445
原创 复旦等提出突破视频生成长度极限新模型
该论文提出了 LongVie 2,一款多模态可控超长视频世界模型,旨在解决现有视频生成模型在长时生成中存在的可控性不足、视觉质量退化与时间一致性差的核心问题。模型采用三阶段渐进式训练策略:通过融合稠密(深度图)与稀疏(关键点)控制信号提升语义级可控性;引入退化感知训练弥合训练与长时推理的领域差距;借助历史上下文引导及多频率损失函数保障跨片段时间连贯性。同时,构建了包含 100 个一分钟以上高分辨率视频的 LongVGenBench 基准数据集,为超长可控视频生成提供标准化评估工具。
2026-02-11 14:46:39
659
原创 浙大开源datamind搞定数据分析
Why Do Open-Source LLMs Struggle with Data Analysis? A Systematic Empirical Study
2026-02-11 14:26:43
820
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅