- 博客(1280)
- 收藏
- 关注
原创 Vivix 发布流式多模态模型 Vivix-W1:边生成边用语音、触控实时改写;OpenAI 更新 Codex Voice,编码线程可随时切语音继续聊丨日报
今年从对话式 AI 一路聊到实时智能,现场有 15+ 论坛、100+ 场深度演讲,汇聚 150+ 全球技术领袖和行业专家,全双工+交互式模型、实时互动世界模型、AI 硬件、AI Coding 工具等方向都会集中开聊。文本、语音、图像、视频、触控和相机运动等输入都可以在生成过程中继续加入,并从当前世界状态直接改变后续内容,无需重新开始生成。Vivix-W1 不再把视频生成、音频生成和交互理解拆成独立模块,而是联合处理场景状态、动作、声音、参考素材和实时控制信号,并原生同步生成画面、对白、环境声和空间音效。
2026-09-08 21:17:18
179
原创 Thinking Machines Lab 洽谈 10 亿美元融资,估值 400 亿美元;微软发布 MAI-Transcribe-2,1 小时音频 10 秒转完丨日报
用户无需下载独立 App,只需像给联系人发消息一样与 Caddy 对话,它会持续学习用户的工作方式和关注事项,并连接 Gmail、Google Calendar、Slack、Linear、Todoist 等工具完成后续操作。,重点提升电脑操作、软件工程、浏览器使用和复杂专业任务执行能力。SolarWM 对 143 万段视频统一整理视觉画面、相机几何参数、文本描述、质量信息和数据来源等字段,把原本格式、镜头参数和标注方式不同的数据转换成同一套逐帧对齐格式,使不同视频骨干可以复用同一套数据处理和训练流程。
2026-09-05 22:31:53
176
原创 定档!从对话式 AI 到实时智能,Voice Agent Builder 的年度春晚 iRTE2026 来了丨10 月23-24 日,北京见!
更有丰富的 Side Event 与 RTE+AI 展区。iRTE2026 实时智能大会定档。15+论坛、100+场深度演讲。
2026-09-03 23:20:07
17
原创 MiniMax H3 MAX 的 AI 直播火了:背后这家估值 45 亿美元的推理独角兽却鲜为人知丨Voice Agent 学习笔记
最关键的市场判断是:语言模型赛道已经有 OpenAI 这样强势的玩家,而且它们能提供最好的模型和可规模化的 API,对我们这种小团队来说很难正面竞争。这给了我们放弃旧产品的证据。这个产品后来迭代了一阵,但到了 2021、2022 年,行业进入了「现代数据栈」非常火的阶段——Databricks、Snowflake 之后,大家都在谈数据转换、数据管道和大数据,那时候甚至还没有 ChatGPT,AI 也不是行业焦点。几个月后,我在公司完成种子轮融资前正式加入,并一直工作到现在,我做过很多基础设施方面的工作。
2026-09-02 21:51:20
329
原创 Runway 发布「界面世界模型」Solaris ,不生成代码、实时渲染可交互 App;Sesame 开源 TurnBench,14 套轮次系统无一做到又快又准丨日报
工具会把每次评测使用的声音、合成配置、原始音频、ASR 转写、文本规范化方式、阈值和逐样本结果保存在同一目录,让开发者可以从最终分数一路追溯到具体哪条语音出了问题,而不是只得到一个无法复现的平均值。低工资、低经验的年轻人受到的冲击更大,有经验的中高职位需求则相对稳定。推出可穿戴 AI 日志设备 Mori,用户佩戴后无需每次手动开启录音,设备检测到说话即可自动开始记录,再由 AI 完成转写、分类和总结,把工作交流、朋友聊天、旅行感想和临时想法整理成一段段可回顾的记录,并在每天晚上进一步汇总成个人日志。
2026-09-02 21:09:28
225
原创 从 WebRTC 创造者到 OpenAI Realtime AI 负责人:Justin Uberti 谈人机实时语音的架构重构丨Voice Agent 学习笔记
前几代的架构通常是这样:它给人一种实时的感觉,但实际上发生的是,系统会在你说话时缓冲你的音频,等待轮次检测器判断"哦,他们说完了」,然后一次性把所有音频喂给模型,说:去转写、生成、把文本给我。NLP 是一把挺重的锤子,在双讲场景(double‑talk scenario,AI 和用户同时说话)中,AEC(回声消除,Acoustic Echo Canceller)为了不让系统听到自己的回声,会用「重锤」削掉残余回声,但也会把用户语音削坏。当它需要更多信息时,可以咨询前沿模型,进行更深入的推理、思考、搜索等。
2026-09-01 23:28:12
320
原创 炸裂!我用 Gemini 新模型给英雄联盟解说做实时字幕,语速再快也没翻车!(附开源代码)
目前 Gemini 3.5 Transcribe 已经在 Google 自己的多个产品中上线,包括 Gboard 上的 Rambler 语音输入、macOS 版 Gemini 应用的 Speak to Window 功能,以及 Chrome 浏览器的语音输入中。电竞解说实时转写向来是业内难啃的「硬骨头」——超快语速、高密度的黑话和选手 ID,叠加激烈的游戏背景音,对模型的识别能力和延迟解决方案是全方位的极限考验。需要注意的是,SMART 模式和词级时间戳、说话人分离互斥,不能同时开启。
2026-08-29 00:05:09
345
原创 Google 发布 Gemini 3.5 Transcribe 实时转写模型,流式 WER 4.0%;XR 语音助手 AgentHands 支持手势与语音精准同步丨日报
相比此前的 Chirp 3,新模型不只做逐字 ASR,而是直接把原始语音整理成可用文本:能处理自我纠正、去除「嗯」「啊」等口头填充词、自动排版,并结合自定义词汇提升专业术语和订单号、邮编等实体的识别准确率。相比此前主要面向浏览器操作的 n1/n1.5,n2 将执行范围扩展到 Linux、macOS 和 Windows 完整桌面环境,并不再限定 Agent 只能「像人一样点击界面」,而是让模型根据任务主动选择 GUI、命令行、工具调用或代码执行,以更少步骤完成长流程任务。自己推荐的信源、项目、话题、活动等;
2026-08-28 23:44:21
353
原创 语音 AI 公司 BreezeBlue 获 600 万美元种子轮融资,押注交互式语音智能;实时 AI 游戏队友 Varkos 支持《上古卷轴》边听边行动丨日报
与传统榜单只比较模型能力不同,Pipette 将一次端侧部署视为「模型 + 量化方式 + 运行时 + 设备」的完整系统,同时测量质量、首 Token 延迟、吞吐、端到端延迟和内存占用,让开发者直接判断某个模型在目标硬件上是否真正可用。Hume AI 发布 ASR 基准优化研究,对 11 个常用开源 ASR 模型进行三组测试后发现,一些公开基准上的高分模型会根据音频中的数据集特征,输出测试集「预期的参考答案」,而不是严格按照实际听到的内容转录。另一方面,应扩大个人使用 AI 的能力。
2026-08-26 23:57:47
339
原创 清华桌面机器人团队 CyboPal 融资数亿元;Wispr Flow B 轮融资估值 20 亿美元,将发布自研语音识别模型丨日报
英伟达 CEO 黄仁勋在署名文章中表示,公司与 Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs 和 KKR 建立合作关系,创建独立融资平台,计划逐步调动超过 5000 亿美元的第三方资本建设 AI 基础设施。自己推荐的信源、项目、话题、活动等;CyboPal 由 90 后清华博士彭天放带队,核心成员来自机器人、自动驾驶、大厂 AI、供应链和生产体系,具备从硬件终端、交互模型到 Agent OS 的一体化研发与量产交付能力。
2026-08-21 00:35:56
240
原创 西工大 ASLP 开源中文多方言 ASR 模型,缓解方言微调后的普通话能力退化;Fish Audio 推出多模态创作平台 Fish Creative丨日报
几何阶段负责结构一致性和相机轨迹遵循,外观阶段则侧重视觉细节和画面保真度。
2026-08-19 23:42:45
152
原创 Noiz AI 发布实时可交互音视频世界模型 HelixWorld,支持 48kHz 立体声;FireRedTeam 开源 FireRedTTS3,支持语义与声学编辑丨日报
已接入 TTS、Voice Cloning、Voice Conversion、ASR、Forced Alignment、VAD、Speaker Diarization、Audio Codec、Source Separation、Music/SFX Generation 等任务。FireRedTTS3-Base 支持英语、中文、日语、韩语、法语、西班牙语等 24 种语言,并覆盖四川、上海、闽南、温州、吴语等 21 种中文方言的 Zero-shot Voice Cloning。技术报告目前尚未发布。
2026-08-17 22:49:08
266
原创 小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座;ElevenLabs 上线 Sounds 免费 AI 音效与 Loop 库丨日报
Soniox TTS v2 带来了卓越的语音质量、通过音频标签实现的丰富表情控制、极高的精准度、高保真度的语音克隆功能、超过 60 种语言支持、自然语言混音功能,以及低延迟的流媒体播放能力。别着喇叭的哑巴不愿拿喇叭换提着獭犸的喇嘛的獭犸。据《商业内幕》报道,加拿大裔美国创投家、Y Combinator CEO Garry Tan 在昨日发布的一档播客节目中建议,初创公司创始人不应过度担心 AI Token 的消耗成本,而应采取「Tokenmaxxing」策略,通过重金投入 AI 智能体来获取竞争优势。
2026-08-15 01:30:37
181
原创 Deepgram 推出 Flux TTS 支持跨轮次上下文与打断;Anthropic 计划 60 亿美元收购实时生成 AI 公司 Decart AI丨日报
指标分为 Agentic Capability、Conversational Dynamics 和 Naturalness 三组,包括 Pass@1、Goal State、Turn-Taking、Conversation Progression、Selectivity、Faithfulness、DNSMOS、UTMOS、NISQA 等,官方明确不将它们合并成一个总分。现代 TTS 已能表现温暖、犹豫、笑声和停顿,但需要明确的表达指令,且不同 Provider 使用不同的标记语法。
2026-08-14 01:15:44
205
原创 哔哩哔哩开源 IndexTTS-2.5,支持 5 语种情感复刻;西湖心辰完成数亿元 B+ 轮融资,持续布局语音 AI 与原生多模态实时互动丨日报
西湖心辰完成数亿元人民币 B+ 轮融资,由广发信德领投,西湖创新投、武汉江豚基金、容亿投资、南通投管等机构跟投,58 产业基金等产业资本参与,蚂蚁集团、汤姆猫等老股东继续支持。新版本支持中文、英语、日语、西班牙语和阿拉伯语,并保留跨语种与音色情感解耦能力,同时新增语速控制和更细粒度的发音控制。数据包含 Acholi、Kiswahili、Luganda、Akan、Ewe、Shona、Fula、Lingala、Hausa、Igbo 和 Yoruba 等语言,不同语言分别提供 ASR、TTS 或两类数据。
2026-08-12 23:30:39
201
原创 活动报名|凤凰学院 × RTE 开发者社区:从前沿技术到 IP 增长,探索 AI 潮玩新范式
如果你正在关注 Conversation AI、Physical AI,或正在寻找 AI 技术落地到消费硬件与新交互产品的可能性,欢迎来现场一起交流、碰撞。,邀请来自 AI 潮玩、智能硬件、Voice AI 与创业一线的嘉宾,从技术实现、产品创新到 IP 孵化与商业增长,共同拆解 AI × 潮玩的新机会。当 AI 从屏幕走向真实世界,潮玩、硬件与实时交互正在成为新的创新试验场。作者提示: 个人观点,仅供参考。
2026-08-12 22:48:22
183
原创 OpenAI 首款 AI 硬件曝光:甜甜圈形状无屏智能音箱 300–400 美元;OpenAI 与 Pion 合作构建 Go 语言 Opus 解码器丨日报
所谓「蒸馏」,通常指利用更先进模型的输出结果训练另一个模型,以较低成本获得接近前沿模型的能力。:UNITH 平台提供数字人创建、API 集成和工作流接入能力,可将数字人嵌入网站、应用和企业业务流程,用于客服、培训、销售和内部协作场景。:DEVA-1 不仅驱动嘴部动作和语音同步,而是实时生成完整面部状态,包括表情变化、微动作和情绪表达,用于增强数字人的自然交互能力。张一鸣的判断背后,是对 AI 长期竞争逻辑的另一种理解:真正的领先优势,不只是获得当前最强模型的能力,而是持续创造下一代模型的能力。
2026-08-08 22:33:20
183
原创 一边语音聊天,一边让 Agent 干活:最火爆的 7 个 Voice Coding Agent 大盘点丨Voice Agent 学习笔记
桌面上的 SKI、Qwen-Audio-Agent、Zoku 还假设人至少在电脑附近,拥有 4G 网络的 Disbrief 则把同样的问题带到了走路、通勤和离开屏幕之后:多个 Agent 继续在后台工作,人通过语音保持联系。前台的对话不断流动,后台的任务也在持续推进,两者同时发生,却互不阻塞。,做法很直接:不自己做 Coding Agent,而是连接 Claude Code、Codex、Cursor、Gemini CLI、OpenClaw 等已经存在的工具,在它们上面增加一层双向语音。
2026-08-08 22:08:08
261
原创 AI 语音访谈平台 Listen Labs 拟融资 1.25 亿美元,估值15 亿美元;开源框架 Hermes Agent 更新实时语音模式丨日报
该模型基于 Self-Flow 方法构建,目标是学习现实世界中的物体、运动和声音之间的关联,并支持视频生成、编辑以及动作预测等能力。自己推荐的信源、项目、话题、活动等;Gemini 依托 Google 的多模态模型能力,提供更强的上下文理解和生成式交互能力,Google 此前已开始将 Gemini 能力逐步整合到 Assistant 体验中。FLUX 3 Video 支持文本生成视频、图像生成视频、视频到视频编辑、关键帧过渡、视频音频续写等能力,单次生成最长可生成 20 秒视频,并支持原生音频生成。
2026-08-08 00:19:37
198
原创 FFmpeg 9.0 新版本代号「Lei」:纪念中国音视频开发者雷霄骅;吴恩达推出 Voice Agent 教程:低改造成本让已有 Agent 接入语音丨日报
Vocci 推出 AI 智能戒指 Vocci Ring,通过戒指内置麦克风采集会议、对话和语音笔记,并将内容转换为文本、摘要和可检索的 AI 上下文。Anthropic 长期将安全、对齐和负责任开发 AI 作为公司核心叙事,但与此同时,它也必须通过高薪、股权和更有竞争力的待遇,与 OpenAI、Meta 等公司争夺顶尖研究员和工程师。2026 年是雷霄骅离世十周年,FFmpeg 社区将该版本命名为「Lei」,纪念雷霄骅在 FFmpeg 源码分析、音视频编解码、格式封装和流媒体协议等领域的技术分享。
2026-08-07 00:37:06
16
原创 Agent-VUI 设计:写在语音智能体的「ChatGPT 时刻」前夜|Voice Agent 学习笔记
OpenAI 的 GPT-Realtime/GPT-Live、Google 的 Gemini Live,以及 Thinking Machines Lab 的 Interaction Models,均围绕实时语音与多模态交互,构建全双工、端到端体系,提升推理、工具调用与响应速度。语音则是一条单通道、强占用的交互媒介。一方面,Front-desk VUI 需要将用户在多轮对话中逐步形成的目标、约束和 context,整理为 Background Agent 可以执行的 task,而不是简单转发某一句原始输入。
2026-08-06 23:32:42
364
原创 OpenAI 揭秘 GPT-Live 全双工流式架构,WARP 显著降低 WebRTC 启动延迟;腾讯混元 Hy ASR 3.0 发布:支持上下文纠错与方言识别丨日报
R1 集成摄像头、语音 AI 和视觉识别能力,针对跑步、骑行和户外活动设计,支持第一视角记录与免手操作交互。Disclosure、Audit Log 成为基础组件,企业部署语音智能体时,需要在实时语音链路中加入 AI 身份提示、交互记录和合成音频标记能力,使透明度要求成为运行时能力,而非上线后的人工流程。:TaoMate 在生成过程中保留不可变的视觉锚点,同时将已生成的视频和音频片段压缩为固定容量的动态状态,通过残差注意力机制检索历史信息,避免随着上下文增长导致计算成本增加。
2026-08-05 23:18:10
233
原创 全网首拆 ChatGPT Voice for Codex 安装包:当语音成为 Coding Agent 的下一代实时交互入口丨Voice Agent 学习笔记
实时语音模型不是自己在干所有活。它是持久 Agent 系统里的协调者:听、理解意图、分配任务、引导对话;Worker Thread 拿对应的工具和权限执行具体任务;只有需要用户知道的事件才会用语音反馈。语音开始成为异步工作的控制平台。不只是发 Prompt 的另一种方式。
2026-08-04 23:34:36
321
原创 Friend 发布第二代 AI 陪伴项链:限制用户修改 AI 名字和音色,随机分配人格;Qwen-Audio-3.0-ASR-Flash 发布:长音频上下文记忆 丨日报
模型面向人形机器人交互场景,将视觉、音频、语言、动作和表情统一建模,通过 Thinker–Talker–Actor 架构实现从环境理解、交互决策到语音和动作输出的一体化生成。:Qwen-Audio-3.0-ASR-Flash 覆盖中文、英语、日语、韩语、泰语、越南语、印尼语、马来语、印地语、阿拉伯语等 30 种语言;:模型将文本、视觉、音频和音视频输入映射至统一表示空间,由 Thinker 负责多模态推理与交互决策,Talker 流式生成语音,Actor 输出机器人动作和表情,使动作与语音成为同等级输出。
2026-08-02 14:30:25
201
原创 冲到 OpenAI 社区榜二,我做了个让 C 罗解说梅西比赛的 AI 解说员丨开源项目分享
这些对看得见的人是废话,对看不见的人却是全部。但解说这事儿,硬是把语音从"念稿机"逼成了"现场嘴替":它得先看懂场上发生了啥,再用对的情绪、对的人设,在对的那一秒开口。视频里发生的事,说白了就一句话:给一路真实的直播流,配一个会看画面、会实时开口的 AI 解说员。整体的技术设计中,最吃功夫的其实是"实时"这两个字:画面要实时进来,AI 生成的语音还得低延迟送回直播间。这场比赛是美国对阵比利时,解说员是"特朗普":个人特色非常鲜明,夸人有自己的一套,还有自己的专属口头禅,总能将话题引到自己身上。
2026-07-16 23:47:37
206
原创 TCP/IP 协议之父 Vint Cerf 宣布退休并预测:智能体之间需要新交互协议;个人智能可穿戴硬件 Looki 完成数亿元 A1 轮融资丨日报
他表示,开发者能够通过模型、工具调用、记忆系统、安全防护和运行环境等组成部分持续优化 AI 系统,因此应将其视为可理解、可改进的计算工具。在动物实验中,植入团队研发的仿生听觉神经接口后,失聪兔不仅重新建立了声音感知能力,还能够识别不同语音指令,并完成「打字」「踢球」等对应行为任务,实现了从「听见声音」到「理解语义」,再到「完成动作」的完整人造听觉神经信息处理链路。生态方面,STEPX 已与携程、支付宝、滴滴、美团、WPS、剪映、百度、京东等平台展开合作,覆盖出行、本地生活、办公和内容创作等场景。
2026-07-15 18:14:10
217
原创 Thinking Machines 披露未来技术路线:押注内核级原生实时多模态;AI 潮玩硬件厂商珞博智能完成亿元级 Pre-A 轮融资丨日报
Thinking Machines 提出,真正重要的是各组织自己衡量:AI 是否帮助其「更好做判断、生成新知识、达成目标」,这会导致一套与「纯自动化」路径截然不同的优化目标与训练数据选择。Thinking Machines 承认「模型可被深度修改」同样带来安全风险,并引用冯·诺依曼「狮子与羔羊难以分离」的比喻,认为真正的安全来自持续的判断过程,而不是一次性封装。他以自己的四个孩子为例,指出这一代生长于网络环境的年轻人能瞬间识别并看透 AI 内容的本质:他们对 AI 垃圾的判断是即时且严厉的。
2026-07-15 00:19:53
216
原创 无声语音识别新突破,基于超声波舌部成像实现;Kyutai 联合 Epic 推出多人实时交互世界模型丨日报
在 50 小时的专用数据集训练下,系统跨说话人验证集的字错率降至 15.6%(从 1.5 万样本时的 102% 降至 5 万样本时的 15.6%),表现逼近基于 100 万小时数据集训练的唇读技术(12.5% 字错率),大幅超越同类超声波基准(TaL 数据集上的 83.8% 字错率)。自己推荐的信源、项目、话题、活动等;评估时,通过游戏状态探针直接从模型激活值中逆向读取车辆与球的位置、速度,并结合基于逆动力学模型的动作可恢复率和 FID 指标,量化评估模型的物理保真度与操作控制率。
2026-07-09 22:11:37
373
原创 Agora Agents SDK:十行代码、15 分钟构建语音智能体;Seeed Studio 发布可穿戴 AI 录音器,双麦克风阵列+自定义 API 接入丨日报
完全兼容现有的底层 REST API,支持开发者自由选择并配置自有的 STT、LLM、TTS 供应商(如 OpenAI、Google Gemini、Deepgram、阿里云、MiniMax 等)API 密钥,亦可无缝切换至 Agora 托管的第三方模型服务。with_tts() 进行链式调用,实现语音转文本、大语言模型、文本转语音等模块的模块化组装,并在 IDE 中提供完整的自动补全与类型检查支持。:VAST 将 3D 资产解构为视觉效果(皮)、拓扑结构(肉)、绑定与动画(骨)、交互逻辑(脑)四层。
2026-07-04 14:15:03
219
原创 阿里发布实时交互模型 Wan-Streamer:边听边看边思考边说话,实时生成视频回应;语音硬件 SpeakON 转向硬件买断制,AI 功能全免费丨日报
当带有特定英语口音(如印度、法国口音)的说话者朗读关于其他国家(如意大利、日本)的文本时,除 Qwen3.5 Omni Plus 能部分还原真实口音外,其余模型均受文本干扰,直接将文本提及的国家判定为说话者的口音来源。:构建了专属宠物行为模型与场景识别体系,交叉比对画面抖动频率、IMU 动作幅度、麦克风声学特征及 GPS 轨迹,量化判定宠物的活动偏好、同伴社交、分离焦虑等状态,避免无依据的叫声语义翻译。支持在输出音视频的同时,持续接收、理解用户的视觉与听觉反馈,并可根据中途干扰动态调整后续回应。
2026-07-01 00:44:20
266
原创 活动报名:来 Agentopia,对话 AI,也对话彼此 丨RTE 社区将参加亚马逊云科技中国峰会,6 月 23-24 日
无论是最近刚学到的新技术、正在琢磨的新产品,还是开发过程中遇到的一些好玩的坑,我们都很想听。这次,RTE 开发者社区也会在现场,我们会在一个充满探索感的开发者冒险空间——「Agentopia」等大家!为了这次见面,我们还特意准备了专属的「建造卡片」和「成长卡片」。不管你正在搭建什么,这两套卡片都能帮你记录下当下的状态和想法,陪伴你更好地 build and grow。带上你的好奇心,来找我们聊聊吧!记得来领取你的「Build 卡片」和「Grow 卡片」,还有我们准备的专属小礼物。
2026-06-18 00:35:53
214
原创 Zyphra 开源 8B MoE 实时语音合成模型,600 万小时训练;MuteVox 消音口罩:AI+物理双降噪,耳语级语音识别丨日报
在训练和推理中,模型不使用自身的历史预测作为输入,仅引入噪声,且在单次并行前向传播中生成完整序列,避免了传统教师强制训练方法在面对非预期输入时的混淆。:系统在 时刻接收演奏输入时,利用时刻的历史数据预测并生成 时刻的伴奏。:采用基于 MoE++ 的稀疏混合专家架构,通过移除对无分类器指导的依赖,在总参数量从 1.6B 提升至 8B 的情况下,将实时吞吐量提高了 4 倍。采用全新的三阶段训练策略(宽泛过滤预训练、收紧转写一致性的中期训练、引入控制变量的退火训练),在保留数据多样性的同时大幅减少语音幻觉。
2026-06-17 15:51:33
220
原创 音频评估模型 Tyto:前置环境感知和拦截低质量音频;ASLP 开源 2100 小时中文全双工语音对话数据集丨日报
涵盖:Noise(环境噪声)、Speaker Reverb(区分近场干声与远场混响)、Speaker Loudness(响度电平,作为中性参考)、Interfering Speech(他人干扰)、Background Media(电视手机等媒体音)以及 Packet Loss(丢包或 CPU 过载导致的音频中断)。自己推荐的信源、项目、话题、活动等;:提供原生接口与 API,支持与 Salesforce、HubSpot 等主流 CRM 系统无缝对接,实现通话触发、线索状态变更与预约日程的自动双向同步。
2026-06-13 10:08:36
197
原创 智谱进军教育硬件市场,发布 AI 拍学机与学问卡;NVIDIA 开源物理 AI 基模 Cosmos 3 丨日报
自己推荐的信源、项目、话题、活动等;,集成 CosyVoice 3 的单码本 FSQ 分词器(25Hz)及基于 DiT(Diffusion Transformer)的条件流匹配(CFM)解码器,规避了多码本残差量化等高复杂度设计。:在单侧仅 2g 出头的体积内,集成了心率、心率变异性 (HRV)、呼吸频率/深度、体温、心肺耦合(CPC)及睡眠姿势等 12 种生物信号监测能力。,提供万物识别、AI 讲故事、中英双语对话等能力,并支持「涂鸦生图」(草图自动上色)和「创意滤镜」等 AIGC 图像功能。
2026-06-03 11:09:16
294
原创 6 月 3 日晚,和 RTE 社区一起加入 AGI Bar@上海开业季聚会!
去年夏天,RTE 社区的开发者和创业者们在 AGI Bar@北京,用手写卡牌和瓜子 Token 完成了《Talk With》的首次原型试玩。这里与创智学院、港科大上海中心为邻,旁边还坐落着米哈游等许多新锐的科技与内容企业,距离西岸也非常近。围绕「语音 AI & 多模态 AI」,《Talk With》AI 主题桌游重返 AGI Bar。今年夏天,正式发布后的《Talk With》来到 AGI Bar@上海,期待与你一起继续演进。坐标:上海市徐汇区北杨小镇,红杉中国创新加速器(上海北杨)一层,AGI Bar。
2026-06-03 10:37:34
263
原创 OpenAI 创始人力推!语音智能体 HeyClicky:语音驱动+任务执行;下一代视频编码标准 AV2 发布:压缩率提升 30%,优化屏幕内容编码丨日报
除传统视频编解码能力外,AV2 在设计阶段即引入了针对增强现实(AR)、虚拟现实(VR)、分屏传输以及屏幕内容(Screen Content)的特定编码工具,以应对高分辨率、超低延迟和非自然纹理的压缩需求。提供低、中、高(15+ 部件)三档颗粒度控制,并引入 2D 预拆分预览机制,适配 3D 打印与游戏工业管线。免配置的随时光标悬浮交互:HeyClicky 常驻于用户系统光标旁,无需复杂的控制台或环境配置,支持纯语音指令(Voice-activated)交互,降低了多模态交互的调用路径。
2026-06-02 19:29:52
390
原创 AI 仿生毛绒宠物 Walulu 完成数千万元融资;网易有道开源 Confucius4-TTS:零样本生成无口音跨语种语音丨日报
为解决机器人从实验室到现实环境的泛化难题,Neocambrian AI 利用印度境内的大量非标准、非结构化物理环境(如高动态范围的工厂、小作坊、尘土覆盖的维修站、密集仓库等)进行数据采集,将现实物理环境中的噪声和无序状态转化为机器人模型训练的强鲁泛化信号。自己推荐的信源、项目、话题、活动等;:Twilio 自身不研发底层大语言模型(LLM),而是通过接入 Deepgram 等第三方模型,提供用于协调、追踪和分析多渠道客户互动的软件控制层,帮助企业简化定制化智能体的设计与合规管理。
2026-05-28 00:25:49
396
原创 活动报名:你的下一个队友,会是一台 AI 硬件吗?丨 Physical AI Camp 深圳站
AI 交互正在从「你问我答」,走向「持续感知、主动协作」。从语音到执行、从端侧模型到实时全模态全双工,再到 Agent 之间的协作网络,下一代 AI 不再只是聊天对象,而是开始理解场景、调度工具、连接软硬件。,Physical AI Camp 深圳站,RTE 开发者社区邀请四位正在一线探索下一代 AI 交互的嘉宾,一起聊聊交互变革的下一步。
2026-05-21 21:50:40
465
原创 咖啡一杯,Token 无限,Real-Time Cafe 深圳站来了!新增「硬件晒晒桌」与「AI 桌游试玩桌」
带上你的 AI 硬件——无论是最近人手一台的 Vibe Coding 电子宠物、随身硬件,还是「赛博核桃」、「美丽废物」或高效神器,都欢迎带到现场交流。咖啡一杯,Token 无限——「Real-Time Cafe」是一个让开发者聚在一起实时 coding、实时 debug、实时互动的咖啡馆快闪计划。这是一场没有技术指导的工作坊,人人都是 coder,人人都可以教别人,大家在互助的 vibe 下 coding。——带上你的电子宠物、赛博核桃,或是单纯带上你的好奇心,来这里喝杯咖啡,实时互动,实时创造。
2026-05-21 21:14:39
327
原创 OpenAI 正为 Codex 内测实时语音模式,前台连麦与后台写代码分离;谷歌 I/O 2026 倒计时:20 日凌晨 1 点开幕丨日报
用户通过语音下达复杂编程任务后,前台会调用代号为 gpt-realtime-1.5 的语音模型,通过 WebRTC 实时与用户沟通进度,而真正的文件修改、代码生成和测试则交由后台另一套更大的模型静默完成。用户体验上,它更像**「视频版的对话式工作流」**:你录一次,就能自动得到视频和文档,再通过聊天式编辑精细调整,让修改体验接近在写文档而不是在剪辑视频。:支持上下装分离替换及整套服装更换,在保持 23.8 FPS 高帧率的同时,确保角色身份(ID)一致性与运动过程中的服装保真度,无明显掉帧或伪影。
2026-05-20 18:42:54
442
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅