- 博客(899)
- 收藏
- 关注
原创 美团智播——数字人直播技术创新与实践
美团智播,是面向本地生活场景的AI数字人直播解决方案,融合大模型、数字人与多模态交互技术,提供丰富的行业专属数字人形象,支持真人1:1复刻与门店实景定制,30秒生成直播素材,3分钟完成开播配置,7×24小时稳定上播。过去一年,依托生成式AI技术,数字人直播月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍,充分验证了AI数字人直播在本地生活商业闭环中的实际价值。
2026-09-03 13:38:51
355
原创 GeoRA: 为RLVR设计的LoRA——ACL 2026杰出论文解析
本文介绍了一种专为 RLVR 设计的低秩训练方法,以及它在业务 Agentic RL 中的落地经验。
2026-08-27 14:20:48
264
原创 美团搜索3.0:LLM 语义表征在排序模型的探索与应用
美团搜索团队正依托团垂融合新架构与生成式大模型新技术,全面重构本地生活搜索底座。本系列技术博客将持续介绍美团搜索 3.0 的技术探索,本文聚焦 LLM 语义表征在服务零售排序场景上的三期实践——从单点特征验证到系统性表征体系构建,再到跨场景迁移复用,探索语义匹配信号在搜索排序中的应用路径。
2026-08-20 14:11:25
481
原创 KDD‘26 美团学术论文精选及KDD Cup‘26 DataAgents赛道冠军思路解读
本文精选了美团技术团队被 KDD 2026 收录的 8 篇论文进行分享,这些论文覆盖了推荐大模型、生成与奖励建模框架、智能体搜索、Transformer 框架、元泛化框架等技术领域。
2026-08-13 16:23:25
557
原创 Agent评测漫谈 —— 由浅入深讲解Agent评测
本篇博客是一篇科普文章,由浅入深的介绍Agent评测。其中前两章系统介绍了评测是什么,以及如何建立评测体系;其中第二章是美团图灵Agent评测团队深入美团各业务团队BP总结出的实践经验,是我们在两年实践过程中逐步打磨出来的认知。第三章重点介绍了龙虾/爱马仕这类长程Agent框架的出现对评测带来的变化。
2026-08-07 09:54:54
650
原创 美团正式发布 CatPaw:全场景 AI Agent,从个人提效到企业智能化
搭载 LongCat 2.0 的美团全场景 AI Agent 平台 CatPaw 正式上线,将模型能力从“跑得动”推向“用得好”。CatPaw 提供开箱即用的 AI 智能工作台与企业级 Agent 开发托管能力。
2026-07-28 13:58:54
634
原创 让AI离开温室,走向动态世界:MineExplorer揭示顶级多模态大模型被忽视的能力断层
美团 LongCat 团队构建了MineExplorer——首个在开放世界中做到分钟级长程任务的评测基准,系统性地评测多模态大模型在需要长程规划、并包含隐藏前置条件的任务中的真实能力。
2026-07-24 15:32:51
630
原创 下一代搜索智能体评测基准!美团开源LoHoSearch,用知识图谱校准AI能力认知
过去一年,我们见证了 Search Agent 能力的显著演进。在 BrowseComp 等评测上,顶尖模型准确率从最初的30%区间迅速攀升至90%以上。然而,当基准迅速饱和,其区分模型能力的价值也随之递减。
2026-07-24 15:31:44
732
原创 直播回放·含 ACL‘26 杰出论文 | 美团 AI 顶会论文 32 篇精讲
2026 年,美团技术团队数十篇论文被 ACL、SIGIR、ICML、KDD 等顶会收录。我们精选 32 篇,进行了 5 大专场直播。
2026-07-13 10:08:40
749
原创 正式开源!美团 LongCat-2.0 同步开放国产卡推理代码
美团 LongCat-2.0 总参数 1.6T,平均激活约 48B,为真实的 Agentic Coding 任务而生,架构上创新性引入 LongCat 稀疏注意力和 N-gram Embedding,提升长上下文处理效率与 Token 级表示能力的同时,结合动态激活进一步强化了代码理解、生成以及执行的表现。
2026-07-13 09:29:40
768
原创 美团 LongCat-2.0 正式发布:在国产算力集群上完成全流程训练与推理的万亿参数模型
6月30日,美团正式发布新一代万亿参数大模型 LongCat-2.0,并将对外开源。
2026-07-01 14:21:00
1110
原创 LongCat 开源 VitaBench 2.0:长期动态智能体基准新标杆
VitaBench 2.0 是首个真实生活场景下面向长期动态用户建模的智能体评测基准,它系统性地评测大语言模型在长期、真实、动态的用户互动中个性化与主动性的能力
2026-06-29 16:33:20
1057
原创 ICML 2026 | 美团技术团队学术论文精选
ICML(International Conference on Machine Learning,国际机器学习大会)是机器学习领域最具影响力的国际顶级学术会议之一。
2026-06-29 16:05:44
757
原创 美团海报生成 AIGC 技术创新与实践
美团智能创作团队围绕海报生成 AIGC 构建了完整技术体系,打造「生成-编辑-评判」技术闭环,目前已在美团外卖、品牌 IP 等场景落地,已全部开源。
2026-06-18 14:16:48
1999
原创 从月球漫步到赛博都市,WBench 测出了世界模型的边界
美团 LongCat 团队提出了 WBench,它是首个面向交互式视频世界模型的系统性多轮评测基准。它就像一台“CT扫描仪”,能精准定位当前世界模型在从“被动观看”到“主动交互”的过程中,到底卡在了哪里。
2026-06-12 14:23:26
1184
原创 报名|ACL‘26 美团中稿精选:从能力评测到推理优化,构建生成新范式
本文分享了美团技术团队被 ACL 顶会收录的其中 6 篇论文,技术方向覆盖大模型评测、复杂流程推理、竞赛级数学思维优化、强化学习优化、生成式推荐等领域。
2026-06-05 15:06:17
1468
原创 从高拟真到真可用,LongCat-Video-Avatar 1.5 正式开源
LongCat-Video-Avatar 1.5 即便在复杂商业场景里,也能稳定、自然地输出高质量内容,让数字人视频生成从彩排室的完美演练,走向千人千面的真实舞台。
2026-05-25 09:46:55
1525
1
原创 美团跑腿 Skill:一句话,骑手来帮忙
美团跑腿 Skill 支持所有 Claw 客户端,包括 OpenClaw 本地版、火山引擎等云部署版、QClaw 等第三方客户端。
2026-05-22 15:11:21
1772
原创 美团 LongCat 开源 General 365:树立推理评测新标尺
General 365 将推理评测从专业知识依赖中剥离出来,让我们直观地看到了大模型在真实世界的通用推理任务上的短板。
2026-05-15 15:37:12
2028
原创 用Agent评测思路管理AI Coding —— 31万行代码AI重构的实践
当团队 90% 以上的代码由 AI 生成,31 万行的复杂业务系统还在高速膨胀,你会发现一个反直觉的事实:AI Coding 不会自动收敛复杂度 —— 没有统一规范的约束,不同人用 AI 写出的代码风格各异,系统反而会加速腐化。本文记录了我们如何在不停止业务交付的前提下,完成这场重构。
2026-05-08 14:19:15
2334
原创 LARYBench 发布:定义具身动作表征 ImageNet,首次度量从人类视频学习的泛化表征
LARYBench (Latent Action Representation Yielding Benchmark),一个指引从大规模的视觉数据学习到通用的隐式动作表征的系统化评测基准。实验结果表明:在动作泛化和控制精度上,通用视觉模型的表现均显著优于专门为具身智能设计的动作专家模型,具身动作表征可以从大规模人类视频数据中涌现。
2026-04-27 10:33:05
2177
原创 突破零样本TTS音色克隆上限:LongCat-AudioDiT 的声音克隆艺术
能不能让 AI 直接学会声音本身的规律,跳过中间环节?为破解这一技术瓶颈,美团 LongCat 团队正式发布 LongCat-AudioDiT。在该模型中,我们彻底抛弃梅尔谱等中间表示,直接在波形潜空间进行基于扩散模型的文本转语音(Text-to-Speech, TTS),从根源阻断数据转换的级联误差。
2026-04-20 09:08:10
1564
原创 LongCat-Flash-Prover:AI 攻克数学定理证明,不仅要“算得对”,更要“证得严”
如何让 AI 从“猜答案”走向“严谨证明”,成为复杂推理具有挑战的课题。我们开源了专门用于数学形式化与定理证明的模型 —— LongCat-Flash-Prover。
2026-04-08 09:28:02
1775
原创 美团发布原生多模态 LongCat-Next:当视觉和语音成为AI的母语
LongCat-Next 是我们在通往物理世界 AI 道路上的一次探索。我们把研究思路的核心——LongCat-Next 模型和它的离散分词器全部开源,希望更多开发者能基于它,构建真正能感知、理解并作用于真实世界的AI。
2026-04-03 15:03:10
2111
原创 美团 BI 在指标平台和分析引擎上的探索和实践
美团数据平台构建了以指标平台为核心的新一代 BI 架构,通过自动语义和增强计算两种核心能力的建设,部分解决了传统 BI 平台在个性化数据集驱动下产生的数据口径混乱、查询性能差等问题。
2026-03-20 14:06:33
2042
原创 重塑站外体验:大众点评 M 站基于 Qwik.js 的重构实践
为突破传统 Web 框架的性能瓶颈,大众点评增长团队引入 Qwik.js 重构 M 站核心页面架构,解决了重构前页面加载慢、维护成本高的难题。
2026-03-16 09:43:06
2058
原创 LongCat 为 OpenClaw 装上效率引擎:你的自动化任务还能再快 30%
ongCat 团队提供稳定合规的官方免费 API,开发者可通过官方渠道直接接入,在确保账号安全的前提下构建自动化工作流,自动化任务还能再快 30%。LongCat API 开放平台:https://longcat.chat/platform/usage,欢迎大家体验~~
2026-03-06 16:02:34
2374
原创 美团发布基于 N-gram 全新模型:嵌入扩展新范式,实现轻量化 MoE 高效进化
LongCat-Flash-Lite 的实践,为大模型的高效扩展提供了一种新的可能性:通过 N-gram 嵌入 与 系统级优化 的协同设计,我们得以用29亿~45亿的动态激活参数,在智能体与编码等关键任务上,实现与更大模型比肩的竞争力。
2026-02-10 15:04:28
6318
3
原创 多维创新打造强泛化智能体模型,LongCat-Flash-Thinking-2601技术报告发布
该模型创新性地打造了 “重思考模式” ,通过并行推理与深度总结,实现推理宽度与深度的协同扩展,显著提升复杂交互与多步规划任务中的表现。
2026-02-02 14:09:30
3134
原创 美团EvoCUA刷新开源SOTA,会用电脑还会持续进化的智能体!
EvoCUA,一个基于经验进化范式的原生 Computer Use Agent。通过可验证的合成引擎、可扩展的交互基建和可进化的经验学习算法,我们探索出一条提升Computer Use能力的通用方法。在 OSWorld 基准测试中,EvoCUA 以56.7%的成功率刷新了开源模型的 SOTA,证明了这条路径的有效性。高信噪比数据是关键: 成功轨迹是低噪声但低信息量的,失败轨迹是高噪声但高信息量的。如何处理好数据,保证较高的信噪比是模型能力持续提升的关键。先验 Pattern 重于数据量。
2026-01-26 10:29:18
6023
4
原创 美团 LongCat-Flash-Thinking-2601 发布,工具调用能力登顶开源 SOTA!
近日,美团 LongCat 团队正式对外发布并开源 LongCat-Flash-Thinking-2601。作为已发布的 LongCat-Flash-Thinking 模型的升级版,LongCat-Flash-Thinking-2601 在 Agentic Search(智能体搜索)、Agentic Tool Use(智能体工具调用)、TIR(工具交互推理)等核心评测基准上,均达到开源模型 SOTA 水平。
2026-01-20 09:37:28
4461
2
原创 AAAI 2026 | 美团技术团队学术论文精选
AAAI 是人工智能领域顶级的国际学术会议,本文精选了【美团技术团队】被收录的8篇学术论文(附下载链接),覆盖大模型推理、 退火策略、过程奖励模型、强化学习、视觉文本渲染等多个技术领域,欢迎一起交流学习~
2026-01-13 15:10:02
3092
原创 KuiTest:基于大模型通识的UI交互遍历测试
美团质效技术部联合复旦大学周扬帆教授团队推出KuiTest——零规则UI功能性异常测试工具。KuiTest通过将“人类预期”直接用作Test Oracle,解决了长期以来UI测试Oracle泛化性差的自动化痛点。实验表明,KuiTest异常召回率达86%,误报率仅1.2%,已在执行21万+测试用例,发现百余例有效缺陷,大幅降低人工成本并提升测试覆盖率。
2026-01-13 13:41:18
3220
原创 2025 美团技术团队热门技术文章汇总
提前祝大家新年快乐,感谢这一路上,每一位伙伴的并肩前行与坚定支持。今年,我们精选了18篇具有代表性的技术文章,内容涵盖大模型开源、研发技能、产品服务三大方向。愿大家在新年里,奔赴更高、更远的山海~
2025-12-29 10:59:02
7325
1
原创 美团 LongCat-Video-Avatar 正式发布,实现开源SOTA级拟真表现
LongCat 团队针对实际场景中的核心痛点持续优化,正式发布并开源 SOTA 级虚拟人视频生成模型 ——LongCat-Video-Avatar。该模型基于 LongCat-Video 基座打造,延续 “一个模型支持多任务” 的核心设计,原生支持 Audio-Text-to-Video(AT2V)、Audio-Text-Image-to-Video(ATI2V)及视频续写等核心功能,同时在底层架构上全面升级,实现动作拟真度、长视频稳定性与身份一致性三大维度的显著突破,为开发者提供更稳定、高效、实用的创作解
2025-12-23 14:32:08
3742
原创 大模型剪枝新范式:先浓缩,再剪枝——DenoiseRotator技术解读
美团智能交互团队联合上海交通大学听觉认知与计算声学实验室,以及香港科技大学的研究者,共同完成了大模型剪枝方法的创新研究,提出了名为DenoiseRotator的新技术。通过首先对参数矩阵进行变换,“将知识和推理能力浓缩到由少量参数组成的子网络内”,“再裁剪掉子网络外的参数”,实现了大模型剪枝的新范式。
2025-12-19 15:01:03
2912
原创 美团发布 LongCat-Image 图像生成模型,编辑能力登顶开源SOTA
美团 LongCat 团队正式发布并开源 LongCat-Image 模型,通过高性能模型架构设计、系统性的训练策略和数据工程,以6B参数规模,成功在文生图和图像编辑的核心能力维度上逼近更大尺寸模型效果,为开发者社区与产业界提供了 “高性能、低门槛、全开放” 的全新选择。
2025-12-09 15:05:50
2603
原创 AI Coding与单元测试的协同进化:从验证到驱动
AI生成代码质量难以把控!本文分享来自美团的技术实践,三大策略破解AI编程痛点。单测快速验证逻辑正确性,安全网保护存量代码演进,TDD模式精准传递需求。告别「看起来没问题」的错觉,构建AI时代的代码质量保障体系。
2025-12-05 13:52:51
2790
转载 复旦 NLP&美团 LongCat 联合提出长程推理能力评测与增强新框架
基于此方法,我们构建了R-HORIZON Benchmark用于系统性评估 LRMs 的多步推理能力,同时生成了长链推理训练数据,通过强化学习(RLVR)提升模型性能。所有模型随问题数量增加均出现明显性能下降。这些真实场景要求模型具备跨任务的长链推理能力——不仅要解决单个子问题,更要在多个关联任务间保持推理—致性、合理分配计算资源、实现跨步骤的反思与纠错。R-HORIZON 提出了问题组合(Query Composition)方法,通过构建问题间的依赖关系,将孤立任务转化为复杂的多步骤推理链。
2025-11-27 19:59:08
1925
转载 LongCat 发布 AMO-Bench:重新定义 LLM 数学上限
参照国际数学竞赛官方竞赛大纲,题目被划分为五大类:代数方程与不等式(11 题,占比 22%)、函数与数列(13 题,占比 26%)、几何(5 题,占比 10%)、数论(9 题,占比 18%)、组合数学(12 题,占比 24%),覆盖数学奥赛核心知识点,考察模型在不同领域是否存在能力短板。表现最优的 GPT-5-Thinking(High)正确率仅 52.4%,且大部分模型表现低于 40%,即便头部闭源模型,也未突破 “及格线”,凸显 IMO 级难度的原创题对当前 AI 的挑战性;
2025-11-27 19:59:08
1930
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅