AI
文章平均质量分 88
Love丶伊卡洛斯
万事皆有可能
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
从Demo到生产:AI Agent开发经验搜集分享
系统梳理AI Agent核心架构、ReAct模式、记忆系统、多Agent协作、失败处理、长任务管理等生产级落地经验,从"能跑"到"能扛"。原创 2026-07-15 09:13:22 · 402 阅读 · 0 评论 -
HuMo框架浅析
《HuMo:多模态协同的人类中心视频生成框架》摘要 该论文提出HuMo框架,通过文本、图像和音频三种模态协同生成高质量可控的人类视频,解决了现有方法在多模态协同控制上的不足。针对数据稀缺问题,HuMo构建三阶段数据处理管道,从大规模视频中自动提取配对的多模态数据。采用渐进式训练策略:第一阶段专注身份保持,第二阶段强化音画同步,通过面部区域预测器提升唇形对齐精度。创新性地提出时间自适应无分类器引导,动态调整各模态权重。实验表明,HuMo在文本一致性、身份保持和音画同步等方面全面超越现有方法,支持多身份控制和文原创 2025-09-17 11:20:44 · 1286 阅读 · 0 评论 -
AnchorCrafter算法简析
AnchorCrafter是一款创新AI视频生成系统,能根据单张人物图和多视角产品图生成自然的人-物交互视频。其核心技术包括:1)双分支注意力机制实现人-物外观分离;2)基于3D手部和物体深度信息的动作协调控制;3)交互区域加权损失优化细节。相比传统方法,在物体保留度、定位精度和动作自然度上均有显著提升,特别适用于电商产品展示场景。目前对透明和非刚性物体支持有限,但对常规商品展示效果出色,为虚拟主播和数字营销提供了新的技术解决方案。原创 2025-09-15 10:30:04 · 1565 阅读 · 0 评论 -
Chat With RTX 安装、使用问题记录
修改参考 “F:\ChatWithRTX\RAG\trt-llm-rag-windows-main\ui\user_interface.py”重装了cuda、cudnn,配置了环境变量,还是报错,重装了chat With RTX,顺带把模型勾上装了次,居然不报错了,有点东西。webui正常启动了,但qwen无法使用,默认模型可以。科学上网,可以单独装Chat With RTX 先,模型之后手动装。参考:3.安装TensorRT-LLM。进行一个配置文件的修改。根据文档提示进行构建。原创 2024-02-23 20:29:12 · 2005 阅读 · 2 评论 -
AI语音合成 VITS Fast Fine-tuning,半小时合成专属模型,部署训练使用讲解
功能,或者自建内网穿透。原创 2023-07-27 10:03:39 · 10656 阅读 · 5 评论 -
【开源项目】AI Vtuber 一个由多LLM驱动的虚拟主播,可以在Bilibili/抖音等 直播中与观众实时互动或本地聊天。使用多种TTS技术并可进行AI变声。通过特定指令协同SD绘图。并有循环文案
AI Vtuber是一个由 ChatterBot/GPT/Claude/langchain本地or云端/chatglm/text-generation-webui 做为"大脑"驱动的虚拟主播(Live2D),可以在 Bilibili/抖音/快手 直播中与观众实时互动 或者 直接在本地和您进行聊天。它使用自然语言处理和文本转语音技术(Edge-TTS/VITS-Fast/elevenlabs)生成对观众问题的回答并可以通过so-vits-svc/DDSP-SVC变声;另外还可以通过特定指令协同Stable原创 2023-07-25 10:25:53 · 7546 阅读 · 4 评论 -
记录一次Linux下ChatGLM部署过程
本地化的GPT就是香,就是有点费钱。原创 2023-05-04 22:03:23 · 4237 阅读 · 6 评论
分享