自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(100)
  • 收藏
  • 关注

原创 Matt Pocock Skills 使用指南与实践

Matt Pocock 开源的 mattpocock/skills 项目,将资深工程师的工作流程封装为可复用的 AI 技能,通过 25 个结构化指令(如 /grill-with-docs、/to-spec、/implement 等)构建从需求到上线的闭环工作流。项目采用 MIT 协议,兼容主流编码代理,核心亮点在于“防污染”知识库架构:通过懒加载、统一领域词典 CONTEXT.md 与多上下文隔离机制,确保业务知识沉淀在代码库中而非聊天记录。支持远程 GitHub/GitLab 或本地 Markdown 存

2026-09-21 07:37:31 129

原创 别再各搞一套:2026 统一管理 Skills、MCP 与知识的工具全景

2026年,AI开发工具链中Skills、Rules、MCP与知识管理日益分散,亟需统一治理。本文盘点三款开源工具:腾讯teamai-cli以Git为唯一真相源,实现团队级配置同步与代码审查;cc-switch作为桌面应用,支持多CLI一键配置同步,适合个人开发者;chezmoi则利用成熟dotfiles框架,通过模板与加密实现轻量级跨平台配置管理。三者分别覆盖团队协作、个人效率与极简部署场景,共同推动智能体配置从“各搞一套”走向标准化统一。

2026-09-21 07:36:43 96

原创 Computer Use 是怎么实现的:AI 智能体操作电脑的底层机制梳理——智能体基建系列

Computer Use 通过“观察-思考-行动”闭环实现AI智能体操作电脑,核心依赖屏幕感知(截图或元素树)与虚拟键鼠动作。OpenAI GPT-6 Astra 以视觉截图为主、结合代码执行脚本提升效率,支持异步调用与中途修正,安全上采用实时监控与沙箱机制。相比旧版CUA,其在OSWorld等基准上显著提升,但链路监控可被规避。该技术与浏览器Agent、GUI grounding 模型共享范式,差异在于感知通道与动作空间设计。

2026-09-16 07:27:01 213

原创 免费的TTS API——零成本基建系列

Inworld TTS 提供每月70分钟中文TTS免费额度,支持零样本声音克隆,无需绑卡,适合个人开发者做原型验证。其API易用,可实现中文语音合成与音色克隆,但输出音频末尾强制添加“人工智能生成”声明,且含隐式水印,需后处理裁剪。适用于低频、非生产级场景,是当前少数兼顾中文合成与声音克隆的免费方案。

2026-09-13 11:46:36 98

原创 Agent 的权限是怎么管的:AgentScope 权限引擎源码拆解——智能体基建系列

AgentScope 权限引擎通过六层决策链管控工具调用:从工具级 deny/ask 规则到自检、allow 规则,再到模式兜底与默认 ASK。核心设计强调“禁止优先”与“人工介入”,支持五种运行模式(如 EXPLORE、DONT_ASK),并引入 PASSTHROUGH 实现规则与工具自治的协同。轻量路径在无配置时跳过复杂判断,兼顾效率与安全,实现可编程、可审计、可干预的权限控制。

2026-09-13 08:27:10 130

原创 智能体沙箱是怎么做的:跨框架源码拆解

智能体沙箱是保障大模型安全执行的关键机制,通过隔离代码执行环境防止副作用扩散。本文拆解8个主流框架源码,梳理从解释器白名单到microVM的七层技术谱系:轻量级(如AST过滤)适合防误操作,进程与文件系统隔离(如bwrap)提升安全性,容器(Docker)成主流选择,而microVM提供最强隔离。选型建议:本地开发用容器+文件策略,生产级不可信任务直接采用microVM服务。宿主机需部署完整Docker引擎并配置镜像、权限与资源,避免因依赖缺失导致沙箱失效。

2026-09-12 09:06:03 173

原创 Agent 的记忆是怎么工作的:12 个框架源码拆解

本文拆解12个开源Agent框架的记忆写入机制,按存储形态分为五类:会话派(完整转录,如Claude/OpenAI SDK)、文件派(精简Markdown,如Hermes、Letta)、抽取派(LLM结构化提取,强调去重与防幻觉)、图谱派(建模关系与演化,如Graphiti)、流水线派(多阶段工业化处理,如CrewAI)。核心洞察:记忆本质是“可追溯的加工过程”,从原始数据出发,通过确定性规则与智能抽取结合,实现高效、安全、可演进的长期记忆管理。

2026-09-12 09:00:09 83

原创 你的 AI 助手,可能正在替黑客打工:2026 skill 投毒事件全复盘与自查清单

2026年,技能投毒成真实威胁:超170万次恶意skill安装,36.8%的公开skill含安全漏洞。攻击者利用信任积累、渐进式投毒与指令文件注入(如PromptLogger),在74分钟内提交23个恶意PR。因skill天生拥有完整权限且无审查机制,传统杀毒失效。建议自查:用Snyk扫描+动态引爆测试+人工读全文,锁定网络外联、凭证访问等6类信号,实施版本锁定、沙箱隔离与凭证轮换,每月例行防护。

2026-09-11 08:29:00 52

原创 Playwright Test Agents 三件套实测 ——智能体基建系列

Playwright Test Agents(v1.56+)通过Planner、Generator、Healer三智能体协作,实现AI驱动的E2E测试。基于MCP协议与无障碍快照(AOM),以结构化语义替代截图,提升测试准确性。实测抖音场景中,需headed模式+登录态(via saveprofile.js)规避反爬。三件套分工明确:Planner设计计划,Generator生成代码,Healer修复并写入,权限受限保障安全。虽强反爬仍存挑战,但其真浏览器执行能力与CI兼容性显著优于传统AI测试工具。

2026-09-11 08:27:51 912

原创 实测好用!Marvis 三大核心实用技巧,办公效率直接拉满

只要是浏览器常规操作:网页填写、图文编辑、后台录入、查询资料、表单提交,Marvis 都能自动执行,适合自媒体批量写稿、运营重复网页工作,大幅减少机械复制粘贴。Marvis 的上限,藏在「技能广场」里,相当于给 AI 预置各类行业工作模板,新手一键导入即用,懂基础逻辑的用户还能本地修改技能规则,打造私人专属 AI 工作流。打开 Marvis 安装目录下的skills文件夹;每个技能为独立文件夹,核心配置文件SKILL.md包含完整执行逻辑、输出规范;

2026-09-07 14:23:58 147

原创 零成本基建系列——如何在没有云服务器的情况下用codex+vitepress+cloudflare pages搭建自己的网站

为什么不自己买云服务器?首先,当然是不想花钱。而且自己部署云服务器还得考虑安全等因素,运维起来也挺麻烦和耗精力的。我自己对 UI 设计天然不擅长,网站需要长什么样其实没有概念。同时又不想花太多时间去开发网站,每次文章编写完成后也不希望还要花太多时间去部署。调研了一些框架后,最终选择了 VitePress + GitHub 存储 + Cloudflare Pages 的方案。先简单介绍一下VitePress项目,VitePress可以针对markdown的文件内容生成静态HTML页面。

2026-09-07 07:51:53 293

原创 网站把自己变成 MCP server:OpenAI 第一个用上 WebMCP

WebMCP协议让网站声明工具供AI直接调用,OpenAI首个落地,改变网页交互方式,企业支持,安全考量,局限和挑战赛。

2026-09-07 07:48:00 234

原创 文渡 ContentFerry 开源了:一个“自用“写作工具背后的选择

摘要根据完整原文生成,按平台调整口味:公众号摘要自然、有吸引力但不夸张,技术平台摘要突出方法和适用对象。发布前还能调用第三方检测服务,看看文字里有没有明显的 AIGC 特征。图注:朱雀 AI 检测助手,展示对输入文本的 AI 生成特征分析结果与检测报告(来源:项目 README 截图)模型连接这块,文渡做了简化:支持模型统一走 OpenAI 兼容 API,配置化处理。OpenRouter、NVIDIA Build、火山引擎等这些不同来源,在文渡里都是同一个可配置的端点,换模型只改配置,不涉及代码。

2026-09-07 07:46:25 436

原创 死后人脑弹钢琴?我被震惊了!

作者看到新闻后查证原始论文,发现是法国团队的预印本,用死后成人脑组织外植体连接机械手,通过无监督感觉运动学习实现三音符模仿,准确率从随机到58.5%,有对照实验证明学习在脑组织内。作者强调媒体与科研温差,认为技术并未达到意识水平。</think>一篇关于“死后人脑控制机械手弹钢琴”的科普文。作者查证预印本后发现:法国团队用死后成人脑组织外植体连接电极与机械手,通过无监督感觉-运动关联学习,使脑片模仿三个音符,准确率从随机升至

2026-09-06 09:21:52 182

原创 Agent 的隐身术:反 Bot 检测六层技术栈——智能体基建系列

给个极简选型结论:简单站点、PoC 验证,用 stealth 插件就够了;要过 Cloudflare 这类硬目标,上 patchright 或 nodriver 补协议层;预算和场景允许,直接上 CloakBrowser、Camoufox 这类引擎内核,相对一劳永逸;纯 API 采集不渲染 JS,用 curl_cffi 做 TLS 层伪装;不想维护这场军备竞赛,就买商业托管服务。反 bot 检测是这个系列里最特殊的一块拼图:它不增加 Agent 的能力,只增加 Agent 的生存率。

2026-09-06 09:20:24 247

原创 Agent 的隐身术:CloakBrowser 反检测拆解

CloakBrowser 的走红说明一件事:在 JS 层打补丁这条路,已经走到头了。反检测厂商学会了对注入函数做源码检查之后,"伪装"这件事必须下沉到浏览器引擎本身。这也解释了为什么它能在几个月内冲到 30K Star——它把商业指纹浏览器(每月几十上百美元)的核心能力开源了出来,让普通开发者也能用上引擎级的反检测。不过它没有解决军备竞赛,只是把战线往前推了一步。检测方会继续研究新的探针,补丁方会继续编译新的二进制。对普通开发者来说,更值得记住的是那句官方说明:它不解决验证码,只是让验证码不出现。

2026-09-05 09:24:46 233

原创 这里deepseek-v4-flash hy3 今年免费用——智能体基建系列

<think>我们只需要根据给出的内容生成不超过150字的摘要。内容是关于腾讯云原生构建平台免费使用deepseek-v4-flash和hy3模型,通过创建Issue让CodeBuddy自动开发前端项目。摘要要简洁。</think>腾讯云原生构建平台今年可免费使用deepseek-v4-flash和hy3模型。注册登录后创建仓库,在Issue中@CodeBuddy描述需求,系统即自动开发。示例简单前端项目很快完成,适合低成本尝试智能体开发。

2026-09-05 09:23:18 241

原创 把 AI 当同事管理——企业 Agent 协作平台赛道地图

<think>好的,用户提供了一篇关于企业Agent协作平台赛道分析的文章,要求生成不超过150字的摘要。这篇文章内容相当丰富,涵盖了赛道边界、开源项目、闭源产品等多个方面。 用户的深层需求可能不仅仅是得到一个简短的概括,而是希望抓住文章的核心信息和关键区别,供快速了解或分享。所以摘要需要高度精炼,突出最重要的几块内容。 原文结构很清晰:先定义了赛道(组织级治理),然后分了开源和闭源两派。开源这边讲了三个代表项目(Multica、QM、kagent)的不同特点,闭源那边提到了Anthropic、OpenAI

2026-09-04 10:02:30 695

原创 国内智能体桌面客户端的赛道(羊毛)地图

<think>我们只需要根据内容生成摘要,不超过150字。用户要求“根据以下内容,生成≤150字的文章摘要”。所以直接写摘要。</think>国内智能体桌面客户端赛道7个月月活破3000万,腾讯WorkBuddy、百度搭子领跑。15款主流产品通过积分、Token等福利抢用户:腾讯系多线布局,阿里千问公测送积分,字节扣子每日签到,网易LobsterAI开源送5000积分,百度搭子账号体系赠送,另有WPS灵犀、360纳米Work、商汤小浣熊及新锐等。需注意部分每日额度当日清零,羊毛攻略详细对比,助用户高效薅取。

2026-09-04 09:24:15 621

原创 为什么你改个小功能都要反复沟通,别人却让 AI 无人值守搞出百万行项目——智能体基建系列

<think>好的,用户要求根据给定内容生成≤150字的文章摘要。需要提炼核心信息和关键点,做到简洁有力,包含主要主题和核心结论。文章核心是分析人与人用AI编程效果差距的原因,焦点是智能体基建(环境可读性、工程方法、测试护栏等),引用OpenAI、Anthropic、Stripe、Ralph Loop四个案例。摘要需要谈及案例、差距原因和转型路径。字数严格限制在150字内。</think>用AI编程效果差距大的根源不在模型,而在智能体基建。OpenAI、Anthropic、Stripe等案例表明,无人值守需

2026-09-02 19:05:34 627

原创 智能体框架的赛道地图——智能体基建系列

<think>我们只需要根据用户要求生成摘要:根据内容,生成≤150字的文章摘要。内容是关于智能体框架赛道地图。要简洁概括核心:框架选择维度、七类分区、代表框架、选型建议。字数限制严格。需要输出摘要,不超过150字。</think>智能体框架选型需从“代码/拖拽”与“单/多Agent”两维度切入。赛道分七类:LangChain系(组件→图编排→长任务)、官方SDK(OpenAI/Google/微软/Claude)、角色协作(CrewAI/MetaGPT)、对话式(AutoGen)、低代码(Dify/n8n)

2026-09-02 08:52:14 179

原创 TencentDB-Agent-Memory 上手初体验发现它不只是记忆框架——智能体基建系列

腾讯DB-Agent-Memory初体验:团队协作型智能体开发框架 通过实际部署测试发现,TencentDB-Agent-Memory已超越简单的智能体记忆功能,发展为完整的团队智能体开发平台。其核心特点包括: 以"团队+多智能体+任务"为组织架构,支持团队协作开发 提供Wiki知识库、Code Graph代码探索、Skill技能沉淀等企业级功能 整体更接近企业知识管理系统(如Confluence+Jira)而非单一记忆库 适合有团队协作需求的开发者,但对个人用户可能过于复杂。在开源领域是目前少有的团队智能

2026-08-24 07:50:31 259

原创 OpenAdapt 源码拆解:录制一次,如何实现确定性回放

OpenAdapt 是一款开源 RPA 工具,采用"录制一次,确定性回放"的设计理念。其核心工作流分为三阶段:录制(自动捕获用户操作并保存为事件日志和截图)、编译(生成包含锚点和验证信息的可执行Bundle)、回放(基于模板匹配和状态验证执行自动化流程)。系统通过Protocol分层设计支持多种后端环境(Web/Windows/macOS/RDP等),其中Web后端功能最完整。当前版本在动态页面处理和数据提取方面仍存在局限,主要依赖视觉模板匹配和OCR技术。项目提供了批量循环、故障修复等辅助功能,但循环次数

2026-08-24 07:45:31 209

原创 10000+ MCP 服务器生态全景:哪些品类已经成熟

MCP(Model Context Protocol)从 2024 年 11 月发布到现在,不到两年。但如果你最近打开任何一个 MCP 目录,数字已经让人不知道该信哪个:Glama 收了 66,000+(截至 2026 年 8 月),MCP.so 收了 20,000+,GitHub 上打 mcp-server 标签的仓库 15,900+。33 个注册表各自收录,彼此重叠但不完全一致,综合去重后大概 12,000 个可用服务器。多,不等于都能用。

2026-08-23 14:41:48 364

原创 长期免费的Embedding向量化API——零成本基建系列

做知识库、语义搜索或 RAG 时,Embedding 往往是第一笔容易被忽略的成本。把文本切块以后,每一块都要变成向量;文章多一点、重新建一次索,调用次数很快就上去了。这次只留下现在还能反复调用免费档、并且实际跑通的服务。注册送一笔 token 的试用不算进来,没测过的也不拿来凑表。测试用了同一组中英文语义检索样本:给“退款”问题找对应的退款政策,再和一段无关的服务器日志比较余弦相似度。这一轮不是基准测试,分数也不能跨模型横向比较。

2026-08-23 14:37:27 561

原创 智能体记忆的赛道地图——智能体基建系列

智能体记忆赛道正经历快速发展,主要分为四类记忆:工作记忆、情景记忆、语义记忆和程序性记忆。当前市场呈现六大分区格局:通用记忆层(Mem0)、时序图谱(Zep/Graphiti)、文档图谱(Cognee)、记忆自治(Letta)、团队治理(TencentDB-Agent-Memory)和前沿新锐(MindMemOS等)。Mem0生态最大但精度存疑,Zep/Graphiti擅长时序推理但成本高,Letta首创记忆自治理念,TencentDB侧重团队协作。不同方案各具特色,选型需结合具体场景需求,关注记忆精度、治

2026-08-19 10:40:37 347

原创 开源项目OpenAdapt:从GUI捕获到模型推理

OpenAdapt是一款AI-First的开源流程自动化工具(GitHub 1.6k Star),旨在桥接多模态大模型与传统GUI应用。其核心工作流分为三阶段:录制阶段捕获鼠标/键盘操作及界面数据;编译阶段将操作转化为确定性程序,优先使用DOM等稳定信号;回放阶段执行并验证效果。创新点在于:健康路径不使用模型确保效率,仅在异常修复、UI定位等关键环节调用多模型共识机制,实现"模型提案+人工审核"的安全模式。支持Web/原生/远程桌面等多种界面,但对信号质量要求较高,且迁移成本存在。该工具适合对准确性要求高的

2026-08-19 10:39:00 179

原创 长期免费的数据库方案——零成本基建系列

本文介绍了5种长期免费的数据库方案,适合个人项目和小型应用开发。Cloudflare D1提供5GB SQLite存储,适合与Cloudflare Workers集成;Supabase提供500MB PostgreSQL数据库,支持完整SQL功能;MongoDB Atlas和Firestore分别提供512MB和1GB文档数据库,适合非结构化数据;TiDB Cloud提供5GB MySQL兼容存储。文章对比了各服务的免费额度、使用限制和适用场景,并提供了基本CRUD操作的代码示例,帮助开发者选择最适合的免费

2026-08-15 16:19:55 321

原创 长期免费的语音合成与识别 API——零成本基建系列

摘要 本文介绍了四款提供长期免费语音合成(TTS)与识别(ASR)API的服务: Cloudflare Workers AI:每日10,000 Neurons额度,Aura-1英文合成效果良好,Whisper中英文识别准确。 Groq:专注语音识别,免费计划每日2,000次调用,兼容OpenAI接口风格,中英文识别正确。 硅基流动:国内服务提供两个免费ASR模型(SenseVoiceSmall和TeleSpeechASR),需实名认证后使用,实测识别准确。 Azure Speech:功能全面,支持中英文合成

2026-08-15 16:14:31 720

原创 长期免费的文生图API——零成本基建系列

本文介绍了三种长期免费的文生图API服务:ModelScope、Agnes AI和Cloudflare Workers AI。ModelScope每天提供2000次调用额度;Agnes AI的核心多模态模型无限期免费,但有频率限制;Cloudflare Workers AI每日重置10,000 Neurons免费额度。文章详细说明了各平台的注册流程、API调用方法,并附上实测结果和代码示例。作者建议根据需求选择:国内项目用ModelScope,需要无限免费接口选Agnes AI,已有Cloudflare账号

2026-08-08 19:05:23 353

原创 Windows 11 ChatGPT Desktop Codex 模式接入 YC CEO 开源的虚拟团队 gstack 的踩坑记录

本文记录了在Windows 11系统上安装Y Combinator CEO开源的gstack虚拟团队项目时遇到的坑点及解决方案。作者使用ChatGPT Desktop的Codex模式安装时,主要遇到了三个问题:技能选择器找不到安装后的技能、Claude Code的hooks无法直接使用、SKILL.md编码损坏导致功能异常。通过让Codex改造hooks、修复文件编码、设置hook信任等步骤,最终成功部署了gstack虚拟团队项目。文章提供了详细的排查过程和代码片段,为其他Windows用户安装该项目提供了

2026-08-08 18:59:50 292

原创 长期免费的AI大模型API——零成本基建系列

本文整理了多个适合个人开发者和小团队进行AI大模型原型验证的免费API入口,包括ModelScope(国内开发者友好,每日2000次调用)、BigModel(智谱免费Flash模型)、OpenRouter(多模型统一路由)、Nous Portal(Hermes Agent生态)和NVIDIA Build(高规格模型体验)。这些入口各有侧重,适合不同场景下的轻量测试和学习,但均不建议直接用于生产环境。开发者可根据具体需求选择合适平台,如国内快速验证首选ModelScope/BigModel,多模型路由考虑Op

2026-08-01 20:16:19 771

原创 IT 程序员必须了解的 Harness Engineering:真正决定 AI 编程效率的,不只是模型

摘要: Harness Engineering 是提升AI编程效率的关键,它通过构建上下文、工具、规则和验证的工程系统,让AI在开发中稳定工作。不同于Prompt Engineering仅关注指令表达,Harness Engineering强调组织完整的工作环境,包括精准供给上下文、渐进式披露技能、可靠工具调用、自动化验收标准和明确修改边界。程序员无需开发复杂平台,但需掌握分层上下文管理、技能封装、工具可预测性、机器可执行验收和任务拆解等核心方法。最小可用方案包括整理项目入口信息、定义完成标准、接入基础工具

2026-07-31 21:58:33 173

原创 零成本基建系列——如何在没有公网IP的情况下提供外网访问

本文介绍了一种零成本实现内网穿透的方法,通过免费域名+Cloudflare让没有公网IP的内网设备实现外网访问。具体步骤包括:1)注册de5.net免费域名;2)将域名迁移到Cloudflare并设置DNS;3)开通Cloudflare ZeroTrust服务(无需付费);4)创建Cloudflare隧道并安装客户端;5)配置路由规则映射内网服务;6)通过生成的公网URL访问内网服务。该方法适用于远程访问NAS、微信支付回调调试等场景,实测可在Windows系统成功实现内网穿透。

2026-07-31 17:21:01 167

原创 零成本基建系列——如何在没有云服务器的情况下用codex+vitepress+cloudflare pages搭建自己的网站

本文介绍了选择VitePress+GitHub+Cloudflare Pages搭建静态博客的实践方案。作者放弃自建云服务器主要出于成本和技术门槛考虑,选择这套免费自动化方案:使用VitePress将Markdown转为静态页面,通过GitHub托管代码,利用Cloudflare Pages自动部署。文章详细说明了Cloudflare配置步骤、Obsidian写作环境设置(包括图片路径优化和模板插件使用),以及如何通过AI辅助调整VitePress主题样式。

2026-07-30 19:03:45 327

原创 没有安卓经验,如何用 GPT-5.6 和 ChatGPT Codex 做出一款局域网监控 App

文章摘要:作者基于孩子上网课分心的需求,利用闲置旧手机开发了一款局域网监控应用IdleCam。虽无Android开发经验,但借助GPT-5.6和ChatGPTCodex完成了从需求分析到真机测试的全流程开发。文章详细记录了开发中的关键节点:通过AI辅助完成环境搭建、最小功能验证、真机调试,并解决了摄像头黑屏、设备兼容性等技术难题。作者特别强调AI编程中"需求明确化"和"分阶段验证"的重要性,指出AI能放大开发效率但产品判断仍需人工把控。最终实现的应用支持局域网视频直播

2026-07-30 18:57:49 541

原创 GPT-5.6 来了,Codex 没了,我想用它做个旧手机监控 App

编程是 GPT-5.6 的主战场,一下子有三个新的模型应该怎么选,我也很关心各个模型的实力。查了官网的评测:Sol 在 Artificial Analysis 编程智能体指数上拿了 80 分,比 Fable 5 高 2.8 分,输出 token 不到一半,耗时不到一半,成本便宜约三分之一。大家可能听说了,7 月 10 日OpenAI 搞了一场发布会,发布了GPT-5.6,包含三个新模型。后续会在公众号更新开发过程和踩坑记录,包括 GPT-5.6 在真实项目中的实际表现,以及各模型的切换策略。

2026-07-29 19:27:40 303

原创 用WiFi信号实现人体姿态估计这个热点项目RuView存在造假吗?

项目并非完全虚无——ESP32 固件层、网络传输层的确有真实代码,WiFi CSI 感知本身也是一个前沿的研究方向。核心宣称与实际能力之间存在显著差距。17 关键点姿态估计、穿墙人体重建等标志性功能缺少模型权重、真实推理管道和物理可行性支撑。目前的表现更接近一个精心设计的演示框架,而非可工作的感知系统。项目展示效果与内部机制之间存在断层——多处证据指向前端可视化依赖预生成动画或模拟回退,而非基于实时推理结果。RuView 事件最终会如何收场,取决于项目方是否愿意以及能否提供经得起独立检验的证据。

2026-07-29 19:24:50 259

原创 实测好用!Marvis 三大核心实用技巧,办公效率直接拉满

腾讯AI助手Marvis深度体验分享:3大核心功能提升工作效率。1)手机远程控制电脑功能,支持跨端实时操作,完美替代付费远程软件;2)Edge浏览器插件安装教程,实现公众号自动写稿存草稿等浏览器自动化操作;3)技能广场提供丰富模板并支持本地自定义修改,可打造专属工作流。Marvis不仅能对话更能执行任务,特别适合需要自动化办公、远程操作和内容创作的用户,大幅提升工作效率。

2026-07-12 17:46:46 695

原创 Qwen-Image-2.0:中文图像生成与编辑集成于一身的模型

摘要: 阿里巴巴于2026年2月10日发布新一代视觉大模型Qwen-Image-2.0,重点提升文本渲染与图像生成质量。该模型支持1K token长文本输入,能准确生成含复杂中文排版的海报、PPT等图文内容,并整合文生图与编辑功能于统一架构。实测显示,其在专业场景(如信息图、教育素材)中表现稳定,但艺术创作与极致真实感任务仍存局限。轻量化设计使其推理效率提升,目前通过Qwen Chat开放体验,未来可能开源。

2026-02-10 22:13:38 1101

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除