- 博客(245)
- 问答 (1)
- 收藏
- 关注
原创 【CVPR 2026】Motus:一个模型贯通理解、预测与控制|从统一世界模型架构视角
【CVPR 2026】Motus 统一潜在动作世界模型论文解读:三专家 Mixture-of-Transformers 一个网络统一 VLA、WM、IDM、VGM 与联合视频动作预测五种模式,光流潜在动作将 90% 无标签具身视频转为运动监督;RoboTwin 平均成功率 88.66/87.02,真实平台 AC-One 63.22、Aloha-2 59.30。
2026-08-06 00:05:53
34
原创 【arXiv 2026】INTACT — 潜在意图直达动作 — 约300×加速无搜索控制|从世界模型控制接口视角
INTACT 用共享条件动作算子统一真实后继与部署目标意图,Direct 零候选达到 95.33% 宏平均成功率,Guarded A 仅 384 序列达 96.86%,规划延迟 2.9–5.5 毫秒,相对 CEM 约快 300 倍。
2026-08-05 11:57:53
2
原创 【arXiv 2026】世界行动模型即零样本策略|从视频扩散世界模型视角
【arXiv 2026】DreamZero 论文解读:14B 世界行动模型(WAM)零样本泛化 2 倍超越最先进 VLA(AgiBot unseen 39.5% vs 16.3%),10-20 分钟视频跨本体迁移 +42% 相对提升,38× 推理加速实现 7Hz 实时闭环控制。
2026-08-05 11:52:58
62
原创 【arXiv 2025】开源视频生成大模型 Wan 2.1|从视频生成开源基座视角
【arXiv 2025】Wan: Open and Advanced Large-Scale Video Generative Models 论文解读:开源 DiT + Flow Matching 视频基座,双规模 14B / 1.3B(8.19GB 显存)覆盖 8 大生成任务;VBench 总分 86.22% 登顶超越 Sora(84.28%),首个支持视频内中英双语文字生成,代码、权重、数据管线与评测全栈开源。
2026-08-05 11:49:22
29
原创 【arXiv 2025】[PC] Vidar — 视频扩散先验驱动的数据高效双臂操作 — 仅需20分钟演示|从视频先验跨具身迁移视角
【论文分享】Vidar:Embodied Video Diffusion Model for Generalist Manipulation(arXiv 2025,清华 TSAIL×生数科技)。解耦视频生成与动作预测:750K 多平台视频预训练+统一观测空间+MIDM 隐式掩码,仅需 20 分钟演示(典型数据量 1%)即超越 SOTA 基线 40–58%,RoboTwin 多任务 65.8%。
2026-08-05 11:27:41
63
原创 【arXiv 技术报告 2025】NVIDIA Nemotron 3:高效与开放智能|从大模型高效推理架构视角
【arXiv 技术报告 2025】NVIDIA Nemotron 3:高效与开放智能
2026-08-05 11:14:58
134
原创 【arXiv 2025】LIBERO-PRO:超越记忆化的鲁棒公平 VLA 评测基准|从VLA鲁棒评测视角
【论文分享】LIBERO-PRO(arXiv 2025):四维扰动评测基准揭示 VLA 记忆化陷阱——标准 LIBERO 上成功率超过 90% 的 OpenVLA / Pi0 / Pi0.5,在位置与任务扰动下崩塌至 0.0%,证明高分源于训练布局记忆而非真实任务理解。
2026-08-05 11:10:04
149
原创 【arXiv 2024】DeepSeekMath — DeepSeekMath:突破开放语言模型的数学推理极限 — 首次提出GRPO算法,7B模型MATH...|从强化学习算法演进视角
迭代式fastText管道从Common Crawl挖掘120B高质量数学tokens
2026-08-05 10:18:26
154
原创 【RSS 2025】统一世界模型:耦合视频与动作扩散的机器人预训练|从扩散时间步设计视角
【RSS 2025】统一世界模型(UWM)论文解读:独立扩散时间步耦合视频与动作扩散,一个 DiT 同时实现策略/前向动力学/逆动力学/视频预测;真机 5 任务超越 Diffusion Policy 20%+,LIBERO-100 平均成功率 79% 达 SOTA。
2026-08-05 09:38:39
208
原创 【arXiv 2026】ResearchStudio-Idea 论文解读:基于ML顶会结果的证据驱动研究创新技能套件
从 1,947 篇 ICLR/ICML/NeurIPS 顶会论文(Oral/高引/拒稿)归纳 15 种创新模式,构建 Paper-Search + Scoop-Check + IdeaSpark 证据驱动研究创意技能套件,创意质量在全部 21 个 ICLR 领域超越 GPT-5.5 与 Opus-4.8 基线
2026-08-05 09:23:31
107
原创 【RSS 2026】[特殊字符]SuperMap:时空语义SLAM,为视觉语言导航构建可查询的4D场景图
【RSS 2026】SuperMap 论文解读:实时×开放词汇×实例级的时空语义 SLAM,把高频几何 SLAM 与异步开放词汇感知统一为一致性驱动的 4D 场景图;ScanNet 类级 Acc 55.48%,实例级 Chair mAP50 63.76(14×),变化检测召回 1.000。
2026-08-05 09:11:51
145
原创 【ICML 2026 (Oral)】JitRL 论文解读:无梯度更新的 LLM Agent 持续强化学习,98 美元替代 3500 美元 GPU 训练
JitRL 提出训练时零梯度更新的 LLM Agent 持续强化学习框架:动态非参数记忆存储轨迹,Jaccard 检索 + k-NN 估计优势,再以闭式公式 z'=z+β 直接调制 logit——被证明是 KL 约束 RL 的精确闭式解。WebArena Avg 46.98% / Jericho Zork1 Final 69 双 SOTA,成本 98 美元 vs WebRL 3500+ 美元(30 倍降低)。
2026-08-04 23:31:12
146
原创 【ICML 2026 (Oral)】RoboMME 论文解读:首个大规模具身记忆评测基准,系统评估 VLA 长程记忆
RoboMME 是首个大规模标准化具身记忆评测基准:16 项非马尔可夫操控任务 × 4 种认知记忆维度(时序/空间/对象/程序)× 14 种 MME-VLA 变体。感知记忆 + Modulator 集成以 44.51% 成功率夺冠,远超无记忆基线 π0.5(17.93%)。
2026-08-04 22:34:38
187
原创 UIST2023 生成式智能体:人类行为的交互式模拟
《生成式智能体:人类行为的交互式模拟》论文解读 本文介绍了UIST 2023会议上一篇关于生成式智能体的研究。该研究创新性地结合大语言模型、记忆系统和基于反思的规划机制,构建出能模拟人类行为的智能体系统。其核心贡献在于提出一个动态框架,使智能体能在交互环境中产生上下文敏感且随时间演化的连贯行为。虽然工程实现上存在不足(如缺乏现代向量数据库和函数调用功能),但其架构设计为多智能体系统中的语言表征涌现研究提供了重要参考。特别是记忆、反思和动态决策机制,对理解群体智能的通信需求和行为演化具有启发意义。
2026-08-04 19:09:41
204
原创 【01:15】在逻辑之外,探索随机:AI 时代的数学新思维
——当这样的“惊尧”问题浮现,我们才猛然意识到,数学不仅仅是条条框框的逻辑游戏,它也关系到对混沌、对随机以及对未知的描述。这时候,若我们不再死守“逻辑框架必须完善一切”的传统思维,而是坦然接受“对随机或未知的非逻辑建模”,也许正能为数学的未来打开新的大门。他们会说,数学已经经历了数千年的发展,从古希腊的几何,到牛顿和莱布尼茨的微积分,再到现代的泛函分析、代数几何,每一步都在不断完善。依托于逻辑的持续修正,数学的“大厦”也许偶尔有点小偏差,但终究不会彻底倒塌,它会被“缝缝补补”,再度挺立。
2025-01-22 15:29:49
3533
原创 使用statsmodels解锁Python中的统计分析力量
对任何需要进行严格统计测试和建模的人都是必不可少的。提供了一个强大的统计分析平台,使其成为统计学家、经济学家和数据科学家的必备工具。集成,用户可以利用强大的统计技术和优越的数据管理能力。博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。中的每个模型都配备了广泛的诊断功能,以验证模型假设并有效解释变量关系。提供了专门设计的工具,用于深入的统计推断,提供数据的内在机制洞察。提升您的分析技能,将原始数据转化为有意义的洞察。如何无缝协作,简化了拟合模型和解释结果的过程。
2024-10-04 01:41:39
790
1
原创 使用Conda管理python环境的指南
打开你的终端(或 Windows 上的 Anaconda 提示符)并导航到你的。博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。这个文件通常包括环境的依赖和配置设置。文件,你可以分享或用它在其他地方重建环境。确保你有一个定义了 Conda 环境的。文件设置和管理 Conda 环境。这会创建一个包含当前环境配置的。按照这些步骤,你可以轻松地使用。:你可以从现有环境创建一个。,请替换为相应的文件名。(活跃于知识区和动画区)
2024-10-04 01:40:08
1123
原创 理解NumPy中的数组切片:实用指南
在使用 Python 进行数据处理的世界中,NumPy 是最常用的库之一,因为它的高效性和强大的数组操作功能。在这篇博文中,我们将深入探讨 NumPy 中的切片操作,了解其工作原理以及为什么理解其行为对避免潜在的代码错误至关重要。当你在 NumPy 中进行切片操作时,它不会创建一个新的独立数组。这是 NumPy 设计中的一个重要方面,它使得数组操作更加内存高效,但也可能导致原始数组和切片之间的联动产生混淆。这个简单的示例说明了 NumPy 在数据处理中的强大和高效,同时也强调了理解其内部机制的重要性。
2024-10-04 01:38:11
726
原创 使用NumPy进行线性代数的快速指南
NumPy 使执行各种线性代数操作变得简单,这对于科学和工程领域的许多应用都是必不可少的。无论你是在执行简单的元素级操作还是复杂的矩阵乘法,NumPy 都提供了快速且有效的功能。在本指南中,我们将探讨 NumPy 中可用的一些基本线性代数操作,展示如何通过运算符重载和内置函数执行这些操作。这些操作是数据科学和工程任务中更复杂数学计算的构建块。NumPy 还提供了执行更复杂的矩阵操作的函数,如矩阵求逆、行列式计算和矩阵转置。除了基本的算术运算外,NumPy 还支持各种矩阵操作,包括点积、矩阵乘法等。
2024-10-04 01:37:01
1187
原创 使用 classification_report 评估 scikit-learn 中的分类模型
在机器学习领域,评估分类模型的性能至关重要。scikit-learn 是一个功能强大的 Python 机器学习工具,提供了多种模型评估工具。无论你是在处理简单的二分类任务,还是更复杂的多分类问题,函数生成一份报告,显示每个类别的主要分类指标。这使得理解模型在不同类别中的表现变得更加容易,提供了关于模型如何识别各个类别的深入见解。在这篇文章中,我们将探讨如何使用该函数有效地评估模型性能。博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。之前,你需要一个已训练的模型和一个测试数据集。
2024-10-04 01:34:34
1380
1
原创 理解Matplotlib构图组成
这些轴包含刻度、刻度位置、标签等,构成了图表的框架。Matplotlib 图表的每个元素都有其特定的用途,了解这些元素如何协同工作可以让你更好地控制图表的外观和行为。无论你是数据科学家、工程师,还是需要处理数据图形表示的任何人,理解如何操作和定制 Matplotlib 中的图表可以极大地提升你传达数据洞察的能力。在这篇文章中,我们将探讨 Matplotlib 图像的结构,分解其组成部分,并解释每个部分在创建可视化图表中所起的作用。这些是控制图表范围、刻度(轴上的标记)以及刻度标签的对象。
2024-10-04 01:32:34
816
原创 使用Scikit-image进行图像处理入门
在数据科学的广阔领域中,图像处理占据了重要的一席之地,为分析和处理视觉数据提供了各种工具和技术。无论你是希望理解图像数据基础的新手,还是从事复杂图像分析项目的高级用户,scikit-image 都提供了实现这些任务所需的功能和简洁性。在这篇文章中,我们将探索如何使用 scikit-image 将图像读取到 NumPy 数组并使用 Matplotlib 进行可视化,通过一个简单的例子来说明基本原理。这个代码段加载了 scikit-image 的示例图像集中的一个宇航员图像,并使用 Matplotlib 的。
2024-10-04 01:28:39
868
原创 扩展可持续性概念:太空移民、持久产品与人类未来
如果地球的资源是有限的,而环境威胁如气候变化日益严重,那么向外太空扩展可能为人类生存提供一个新的前沿。一个重要的方面就是制造能够长久使用的产品。当产品设计得更为耐用时,原材料的需求减少了,制造过程中消耗的能源减少了,废弃物的产生也大幅缩减。它关乎如何在满足当前需求的同时,保障未来的生存,无论是通过空间探索还是制造减少浪费的耐用产品。随着我们不断开发新的技术和系统,我们必须扩大对可持续性的定义,涵盖人类生存的各个方面。两者共同代表了一种前瞻性的方法,超越了短期的修补,直面了人类长期生存的真正需求。
2024-10-04 01:18:30
1051
原创 多模态系统中专家混合(MoE)复杂性的解读
LangChain提供了一个强大的框架,用于实现多模态MoE系统。其模块化架构允许开发人员创建和管理专门的工具或代理——每个工具或代理作为特定模态的专家。通过简化这些专家的整合,LangChain使在统一系统内高效处理多样化数据类型成为可能。
2024-10-04 01:08:50
2178
原创 【模板】Hexo Docker Nginx 个人博客服务器部署
本指南提供了在服务器上设置Git仓库、将本地Hexo页面推送到服务器仓库、在服务器上创建Nginx配置文件以及在服务器上运行Nginx容器的方法。Hello米娜桑,这里是英国留学中的杨丝儿。我的博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。请确保用适当的值替换所有占位符。(活跃于知识区和动画区)
2023-04-24 23:39:44
973
原创 MOB LEC5 神经网络入门
Hello米娜桑,这里是英国留学中的杨丝儿。我的博客的关键词集中在编程、算法、机器人、人工智能、数学等等,点个关注吧,持续高质量输出中。
2022-10-24 23:53:47
1203
原创 MOB LEC4 图像特征匹配
Hello米娜桑,这里是英国留学中的杨丝儿。我的博客的关键词集中在编程、算法、机器人、人工智能、数学等等,点个关注吧,持续高质量输出中。
2022-10-24 23:52:16
352
原创 MOB LEC3 相机与图像
Hello米娜桑,这里是英国留学中的杨丝儿。我的博客的关键词集中在编程、算法、机器人、人工智能、数学等等,点个关注吧,持续高质量输出中。
2022-10-24 23:49:32
382
原创 【课程】SP Module1-4 声学知识点补充
Hello米娜桑,这里是英国留学中的杨丝儿。我的博客的关键词集中在编程、算法、机器人、人工智能、数学等等,点个关注吧,持续高质量输出中。
2022-10-20 17:30:17
790
原创 【课程】SP Module4 音频滤波器
Hello米娜桑,这里是英国留学中的杨丝儿。我的博客的关键词集中在编程、算法、机器人、人工智能、数学等等,点个关注吧,持续高质量输出中。
2022-10-20 17:26:08
526
原创 【课程】SP Module3 数字语音信号
外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传(img-47OGRvgd-1666257398345)(https://image.discover304.top/blog-img/s11082210022022.png?imageView2/2/h/300)]Hello米娜桑,这里是英国留学中的杨丝儿。我的博客的关键词集中在编程、算法、机器人、人工智能、数学等等,点个关注吧,持续高质量输出中。
2022-10-20 17:18:28
460
原创 【课程】SP Module2 辅音和元音的声学
Hello米娜桑,这里是英国留学中的杨丝儿。我的博客的关键词集中在编程、算法、机器人、人工智能、数学等等,点个关注吧,持续高质量输出中。
2022-10-20 17:16:18
557
空空如也
如何分割出音频中的每一个字?
2021-09-11
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅