- 博客(3057)
- 资源 (54)
- 问答 (4)
- 收藏
- 关注
原创 V100显卡使用中出现掉卡现象解决解决_显卡驱动无法加载_英伟达显卡驱动卸载安装_qwenpaw技能依赖python库安装---AI大模型系统从零开始0043
英伟达V100显卡驱动安装注意事项:1. 4张32G显存V100启动需等待3分钟,确保驱动完全加载;2. 通过设备管理器确认4张显卡均正常识别;3. 使用nvidia-smi检查显卡状态后再启动ollama;4. 出现CPU满载需更换小模型;5. 遇到掉卡时,先用DDU彻底卸载驱动,再从英伟达官网下载最新驱动重新安装(官网地址已提供)。老旧显卡需特别注意完整启动和驱动兼容性问题。
2026-07-28 11:52:35
28
原创 Sapiens_人体姿态识别_分割_深度_发线模型_meta的实践和成果_Sapiens-1B训练过程---AI大模型系统从零开始0042
本文介绍了Meta公司开发的Sapiens模型,这是一个基于视觉Transformer架构的大规模人体图像分析系统。该模型在3亿张标注图像(Human-300M dataset)上进行预训练,采用MAE(掩码自编码器)方法,能够处理75%遮挡图像的恢复。Sapiens具备四大核心功能:1) 人体姿态估计(308个关键点标注,包括243个面部关键点);2) 像素级人体分割(28个精细部位分类);3) 深度估计;4) 表面法线计算。实验表明,其20亿参数版本(Sapiens-2B)在各项任务上均超越现有算法,特
2026-07-17 11:34:35
51
原创 Sapiens_人体姿态识别_人体关键部位分割_人体深度识别_身体发线识别_VAE_AE_MAE---AI大模型系统从零开始0041
Meta(Facebook)在2024年推出了基于视觉识别的MAE(带掩码自编码器)模型,专注于人体姿态分析。该模型具备四大核心功能:姿态识别(Pose)、图像分割(Seg)、深度感知(Depth)和法线计算(Normal),能实现精准的实时3D建模。技术亮点包括:1)采用75%高遮蔽率训练,证明图像信息高度冗余;2)非对称编解码结构提升算力效率;3)通过"信息压力训练"增强编码器泛化能力,有效防止过拟合。模型采用VisionTransformer架构,参数量控制在0.3-2亿,兼具性能
2026-07-17 11:31:20
38
原创 自用_英伟达Tesla V100 4张卡_每张卡32G显存共128G显存_使用ollama部署_并且使用Python编程代理程序实现_4卡并行_多出来的自动排队---AI大模型系统从零开始0040
设备:4 张 V100 32G 显卡,因显卡老旧不兼容新版 vLLM,放弃原生大并发推理;方案核心:一卡单独启动一个独立 Ollama 进程,独占单卡显存、互不抢占,再用 Python 编写统一代理网关做负载均衡转发,实现 4 卡硬件级真并行,规避单 Ollama 多并发容易显存溢出、自动降级串行的问题。
2026-07-14 18:25:09
173
原创 sora视频模型训练原理_ImagenVideo模型原理_视频训练数据切分_视频patch切分_视频精细描述---AI大模型系统从零开始0039
论文摘要:视频生成模型的技术演进与创新 本文系统梳理了视频生成领域的技术发展,重点分析了Sora、ImagenVideo等代表性模型的架构创新。Sora采用Transformer架构,通过时空关联建模实现高质量视频生成,其关键突破在于原生比例训练保障构图合理性,以及重标注技术提升文本-视频对齐。ImagenVideo则提出级联扩散方案,通过7个专用子模型分阶段处理分辨率、帧率等维度,实现高效高清生成。研究对比了不同技术路线的优劣:Transformer架构擅长时空一致性,扩散模型更适合模块化部署。文章还探讨
2026-07-10 18:55:42
82
原创 sora视频生成原理_Video Diffusion Models视频扩散模型_DIT用Transformer来做视频扩散_视频切分方式_4种理解视频的方法---AI大模型系统从零开始0038
✅ 相比 Model1:算力砍到十几分之一,可工程落地 ✅ 相比 Model2:不压缩聚合特征,画面细节不会丢失,生成画质与逻辑连贯性更强 这就是 Sora 论文里正式选用的核心 Transformer 注意力范式。让我们来看第三种做法。第三种做法其实是对 Transformer 做了一个更改。可以看到,它同样使用了 Transformer 里面的自注意力机制,但是这个自注意力机制有两层:第一层是属于空间上的自注意力机制,第二层是属于时间维度上的自注意力机制。
2026-07-10 18:51:11
54
原创 Sora模型训练原理_VIT_VIVIT原理_VGG_视频训练patch切分---AI大模型系统从零开始0037
文章摘要: 本文深入解析了Sora模型如何借鉴大语言模型和ViT的设计思路,通过时空Patch分块技术实现通用视频生成。Sora将视频视为3D时空数据,先压缩至潜空间再切分为时空Patch,作为Transformer的Token处理,从而支持任意分辨率、时长和画幅的视频生成。模型采用扩散Transformer(DiT)架构,通过去噪Patch序列生成连贯视频,突破了传统CNN在长距离依赖和尺寸灵活性上的局限。相比Stable Diffusion的卷积UNet,Sora的Transformer架构展现出更强的
2026-07-10 18:45:41
77
原创 大小适中_5GB到30GB_支持RAG与龙虾智能体_ollama总结常用可用模型对比认识和分析_granite4_ifm2.5ornith_GPTOSS---AI大模型系统从零开始0036
Ornith是由DeepReinforce团队推出的开源大模型家族,专注于智能体编程场景,具备自主构建执行框架(自适应脚手架)和循环修复能力,提供9B到397B不同规模的模型选择,支持多模态输入并展现优异的日文处理能力。同时,OpenAI推出的GPT-OSS开源模型家族包含120B和20B两款,具备原生智能体能力和可配置推理力度,以Apache 2.0协议开放商用。两者均为轻量级、可本地部署的开源模型,显著降低了AI应用门槛。
2026-07-10 10:34:03
52
原创 文生图原理_Latent Diffusion Model 潜扩散模型_LDM扩散模型---AI大模型系统从零开始0035
潜扩散模型(Latent Diffusion Model, LDM)是Stable Diffusion的核心技术,通过将图像压缩到低维潜空间进行扩散计算,大幅降低了显存需求和计算成本。其核心架构包含VAE编码器(图像压缩/还原)、UNet去噪网络(潜空间扩散)和CLIP文本编码器(文本引导生成)。相比直接在像素空间操作的DDPM模型,LDM通过潜空间计算使512×512图像的处理效率提升64倍,使得消费级显卡(如1660/3060)也能运行AI绘图。该模型通过交叉注意力机制实现文本到图像的精准控制:将文本向
2026-07-08 16:43:42
44
原创 DM扩散模型_DDPM Denoising Diffusion Probabilistic Model去噪扩散概率模型_DALL模型_Clip模型---AI大模型系统从零开始0034
本文系统梳理了扩散模型的发展历程与技术原理。2015年提出的扩散模型最初未受重视,其核心是通过U-Net架构逐步去噪还原图像。关键突破在于DDPM团队将预测目标从像素转为高斯噪声,大幅提升效果。2021年扩散模型超越GAN,结合分类器引导实现可控生成。OpenAI的DALL-E2创新性地融合CLIP文本编码与扩散模型,通过prior模型将文本向量转化为图像向量,再经解码器生成图片。文章详细解析了训练阶段的加噪-去噪机制、U-Net的结构优势,以及文生图应用中扩散模型如何通过迭代去噪在文本引导下生成目标图像,
2026-07-08 16:39:51
32
原创 GAN对抗网络_ AE Auto encoder自编码器_VAE 变分自编码器---AI大模型系统从零开始0033
本文探讨了DALL-E和Stable Diffusion等图像生成模型的原理与发展。早期GAN模型能生成逼真图像但缺乏多样性和指令可控性;自编码器(AE)通过编码-解码结构提取关键特征,但仍受限于样本多样性;变分自编码器(VAE)创新性地将特征映射为高斯分布,通过在潜在空间中随机采样实现图像生成的多样性,能创造不存在于训练数据中的新图像。这些技术进步为后续DALL-E和Stable Diffusion等能平衡多样性与可控性的模型奠定了基础,推动了AI图像生成从模仿到创造的发展。
2026-07-08 16:34:15
70
1
原创 Tesla v100 4张显卡组装机安装vllm和ollama在Ubuntu系统上的安装---AI大模型系统从零开始0032
本文提供Ubuntu22.04系统下vLLM的完整安装指南,适配4×32G Tesla显卡的单机4卡张量并行部署。教程包含:1)硬件要求(Ubuntu22.04、NVIDIA驱动≥535、CUDA12.1+);2)NVIDIA驱动自动安装方法;3)Python3.10虚拟环境配置;4)vLLM官方预编译包一键安装;5)单机4卡启动Qwen3.6-27B模型的完整参数说明(含FP8量化、多进程并行等关键配置)。文末附分布式部署的Ray集群方案参考链接,适用于多机8卡场景。
2026-07-08 08:56:18
36
原创 两台32G * 4 Tesla V100显卡_单机128G_两台256G显存显存如何部署大模型_使用vllm部署大模型和使用ollama部署大模型的区别---AI大模型系统从零开始0030
文章摘要: vLLM与Ollama在张量并行(TP)方案上差异显著:vLLM通过层内权重切分实现多卡线性加速,支持全局KV缓存共享和高并发,适合生产环境;Ollama采用层分片策略,显存利用率低且仅限单机使用。vLLM原生兼容OpenAI API,支持多卡TP/PP分布式扩展,4卡并行性能远超Ollama;CPU模式下两者差距较小,但GPU仍为首选。部署建议优先使用Ubuntu系统结合Ray+NCCL集群,实现8卡分布式推理,充分发挥硬件性能。vLLM在长文本、高并发及工具调用场景表现更优。
2026-07-06 10:27:58
86
原创 ubuntu系统安装mattermost过程_设置分区挂载永久生效---Linux工作笔记0075
本文摘要:介绍了在Ubuntu系统上挂载第二块500G硬盘的完整步骤,包括分区创建(使用fdisk工具)、格式化为ext4文件系统、创建挂载点并临时挂载。同时说明了如何通过编辑/etc/fstab实现永久挂载(建议使用UUID方式)。此外还包含了为Mattermost应用创建PostgreSQL数据库及用户的操作流程:创建名为mattermostdb的数据库并指定所属用户,通过psql命令行修改用户密码。最后提示安装完成后可直接创建管理员账户使用。全文提供了从磁盘挂载到数据库配置的一站式操作指南。
2026-06-30 10:09:43
178
原创 液态神经网络(LNN):打破AI“静态快照”的连续动力学革命---AI大模型系统从零开始0029
MIT研究团队受秀丽隐杆线虫神经系统的启发,开发出革命性的液态神经网络(LNN)。该技术通过连续微分方程建模神经元动态,实现输入响应速度的自适应调节,解决了传统AI模型静态化、高能耗和低解释性的痛点。LNN具有三大突破性优势:仅需少量神经元(如20个)即可完成复杂任务;能处理非均匀时序数据;在自动驾驶、医疗监测等领域展现出卓越的适应性和鲁棒性。这项将生物智能与数学建模完美融合的技术,有望成为下一代AI的核心架构,目前已在无人机导航等场景验证了其高效性,被预测为2026年最具潜力的AI突破方向。
2026-06-29 11:09:57
231
原创 U-NET模型原理_应用领域_训练过程_原理详细说明_人脸、精密零件、无人驾驶的智能识别面纱---AI大模型系统从零开始0028
UNET模型是一种广泛应用于图像分割的深度学习模型,尤其在医疗影像和自动驾驶领域表现突出。其核心结构呈U型,通过下采样(卷积和池化)压缩图像尺寸并提取高层特征,再通过上采样(反卷积)恢复尺寸并融合底层细节特征,实现精准的像素级分割。相比YOLO等目标检测模型,UNET的计算量更大,但对细节的识别更精准,适用于需要高精度分割的场景。然而,UNET模型复用性较差,不同应用场景需要重新训练和标注数据。目前视觉领域仍以专用模型为主,缺乏通用解决方案,但未来可能出现颠覆性的通用视觉模型,大幅降低应用成本。
2026-06-29 10:48:58
46
原创 YOLO模型工作原理_总误差计算_上采样融合_人脸、精密零件、无人驾驶的智能识别面纱---AI大模型系统从零开始0027
本文详细解析了YOLO(You Only Look Once)目标检测模型的核心算法原理。文章首先介绍了YOLO的损失函数构成,该函数由五个误差项组成,分别计算中心点坐标、长宽尺寸、置信度(包含/不包含物体)和类别概率的误差,通过超参数调节各项权重。模型将图像划分为7×7网格,每个网格预测2个边界框,通过置信度筛选有效预测区域。针对YOLO在检测远距离小物体时的不足,文章阐述了其采用的多尺度检测方法:通过特征金字塔结构融合不同层次的特征图(13×13、26×26、52×52),实现对近、中、远距离物体的分层
2026-06-29 10:46:44
48
原创 YOLO模型工作原理_训练过程_任务规划_数据采集_训练_揭开文字、人脸、精密零件、无人驾驶的智能识别面纱---AI大模型系统从零开始0026
【摘要】本文系统介绍了视觉大模型在多个领域的应用及关键技术。在安防、工业检测、医疗影像和自动驾驶领域,视觉模型主要通过图像分类、目标检测和分割实现功能,如YOLO模型用于实时目标识别,U-Net用于医疗图像分割。文章详细解析了YOLO系列模型(特别是V1版本)的7×7网格划分、置信度计算等核心机制,以及ResNet通过残差连接解决深度网络信息丢失的原理。同时强调实际应用中需固定场景参数(如摄像头分辨率、检测距离),并规范数据标注流程(标注框参数+概率分布)。最后指出模型优化的核心在于通过对比预测输出与标注数
2026-06-25 21:02:43
91
原创 视觉模型原理_场景_卷积_池化_分类头_多模态领域的Transformer_创意生成的基座原理---AI大模型系统从零开始0025
本文系统梳理了多模态Transformer在视觉任务中的发展历程与应用。首先介绍了传统视觉任务(分类、检测、分割)及CNN的核心机制——卷积核的多角度特征提取原理。随后重点分析了Vision Transformer(ViT)的创新:将图像分块处理并引入位置编码,通过多层编码器聚合全局信息。微软提出的Swin Transformer进一步优化了ViT,采用分层窗口注意力机制,实现了局部特征提取与全局理解的平衡。OpenAI的CLIP模型则突破性地统一了文本和图像的向量空间,通过对比学习建立了跨模态关联。文章还
2026-06-25 19:12:44
133
原创 Transformer架构_解码器后续处理线性处理_归一化计算_残差连接_层归一化---AI大模型系统从零开始0024
本文详细解析了大语言模型中编码器-解码器架构预测文本的完整流程。以"人类简"预测"史"字为例,首先进行token化和12288维向量化,添加位置编码后输入96头注意力机制。每个注意力头通过Wq、Wk、Wv三个神经网络从不同角度提取128维特征,计算词元间相关性后经Wo矩阵还原维度。接着前馈神经网络对特征进行4倍扩维再压缩,强化关键特征。最后通过线性变换和Softmax得到概率分布,选择最高概率字输出。整个过程涉及多头并行计算、残差连接和层归一化等技术,通过海量数据迭代
2026-06-24 11:16:42
151
原创 Transformer架构_多头注意力机制的原理_计算过程推理---AI大模型系统从零开始0022
本文详细解析了多头注意力机制的工作原理及其在大语言模型中的应用。首先介绍了自注意力机制的基本计算流程,包括Q、K、V向量的生成和相关度系数的计算。随后重点阐述了多头注意力机制的设计思想:将高维向量分解为多个低维子空间,通过96组(以GPT-3.5为例)神经网络从不同角度并行提取特征,最后通过WO矩阵融合结果。文中还对比了编码器和解码器的区别,特别说明了解码器中带掩码的自注意力机制的特点。此外,还介绍了前馈神经网络的作用,即通过放大-缩小操作过滤干扰信息。最后描述了语言模型从输入到输出的完整推理过程,包括to
2026-06-24 11:12:32
50
原创 使用AI编写的截图工具_类似微信截图工具_自用方便_提供源码---AI大模型系统从零开始0023
这是一个微信风格截图工具的代码实现,主要功能包括: 基础功能: 通过Alt+A快捷键启动截图 支持选区截图、尺寸显示、工具栏操作 截图后可复制到剪贴板或保存到桌面 特色功能: 长截图模式:支持滚动捕获多页面内容自动拼接 智能防抖:防止误触和重复捕获 高DPI屏幕适配 双击快速确认截图 技术实现: 使用tkinter构建界面 通过mss库高效截屏 支持两种剪贴板写入方式(win32clipboard/ctypes) 异步监听鼠标键盘事件 该工具模仿微信截图操作逻辑,提供了简洁直观的用户体验,特别适合需要截取长
2026-06-23 17:01:04
56
原创 Transformer_循环神经网络_注意力机制_自注意力机制_多头注意力机制原理---AI大模型系统从零开始0021
本文介绍了Transformer模型中的注意力机制及其改进版本。首先分析了RNN的局限性(信息丢失、无法并行计算),引出注意力机制的必要性。注意力机制通过计算Q(查询)、K(键)、V(值)之间的相关性系数实现信息聚合,支持并行计算。自注意力机制进一步让Q、K、V三者相同,通过多层神经网络提取特征,使每个向量都能聚合语义相关的信息。文章详细说明了计算过程(包含相关度矩阵的构建和Softmax归一化),指出计算复杂度随上下文长度平方增长的特点。最后解释了多头注意力机制通过不同神经网络提取多元化特征的优势,以及自
2026-06-22 21:22:51
502
1
原创 Linear生成下一个字的权重分布和Softmax_归一化_将权重分布转换为概率分布_大模型训练过程---AI大模型系统从零开始0020
本文概述了大语言模型的训练流程:1)输入文本经过token化转为数字ID;2)通过embedding层映射为高维向量(如GPT-3的12288维);3)加入位置编码信息;4)经过多层transformer解码器进行语义聚合;5)通过linear层计算与词表所有token的相似度;6)softmax归一化为概率分布。模型通过反向传播调整1750亿参数(主要分布在解码器),经过多轮epoch训练逐步降低预测误差。文中特别区分了模型内部的embedding步骤与RAG技术中的独立embedding模型,并简要提及
2026-06-22 21:14:50
79
原创 Transformer架构_编码器信息聚合_解码器原理_解码器大模型_编码器大模型_自回归---AI大模型系统从零开始0019
本文阐述了编码器(Encoder)与解码器(Decoder)在自然语言处理中的工作原理。编码器通过多轮迭代聚合,将输入文本的token逐步组合成包含语义的短语向量;解码器则基于编码器输出和自身历史输出逐步生成文本,直至终止符出现。文章还指出,现代大模型多采用仅解码器架构(Decoder-only),因其通过自回归方式生成文本更高效。此外,模型维度决定了上下文窗口大小,高维度向量能容纳更多信息,最终通过迭代聚合将所有内容浓缩至单一输出向量。当前主流模型的聚合轮数通常在96-120轮之间。
2026-06-22 21:09:32
270
原创 Transformer架构_token化_向量化_编码器_解码器_工作原理从零开始---AI大模型系统从零开始0018
这篇文章探讨了大型神经网络模型(如GPT)的工作原理及其局限性。作者指出,这类模型本质上是基于概率预测下一个词(token),缺乏真正的逻辑和思考能力。文章详细解析了模型处理文本的流程:从输入文字的token化(不同公司拆分规则不同)、embedding向量化(将文字映射到高维数学空间)、加入位置信息,到通过encoder分析语义和decoder生成内容。重点强调了embedding技术如何实现多语言文字在高维空间的语义关联,以及encoder/decoder在不同任务(分析/生成)中的分工。最后指出模型理
2026-06-22 21:05:19
146
原创 LLM大语言模型运行模式_机器学习_总误差影响因素---AI大模型系统从零开始0017
摘要:本文讨论了机器学习模型误差计算与参数调整的关键概念。通过概率分析(如0.91正确率对应0.0943误差)指出需关注预测置信度而不仅是准确率。重点阐释了总误差计算方法(6万张图片误差累加)及梯度下降原理,包括如何通过ln函数优化误差计算、15万字符的多语言输出场景处理,以及1.8万亿参数模型的超大规模梯度下降实现。同时解释了非线性变换(如将像素值二值化)对模型拟合能力的提升作用,强调每个训练步骤都需全局调整所有参数,体现现代大模型训练的核心机制。(149字)
2026-06-22 20:57:52
219
原创 多层神经网络_深度神经网络_机器学习_大模型由来_设计大模型_损失_梯度下降---AI大模型系统从零开始0016
摘要:神经网络通过多层结构逐层提取特征,最终输出归一化概率。深度神经网络通过增加层数提取更复杂特征,但需防止过拟合。模型训练关键在于参数优化:随机初始化参数后,通过计算误差并梯度下降迭代调整参数。误差函数的设计至关重要,直接影响模型性能。训练过程需要大量计算,逐步减小误差直至收敛。实际应用中需根据误差变化动态调整步长,以获得最优模型。整个训练过程体现了机器学习从数据中自动学习规律的核心思想。(149字)
2026-06-22 20:53:55
281
原创 探索神经网络的原理_起源_人脑类比_边缘检测_特征提取---AI大模型系统从零开始0015
本文摘要:神经网络通过模拟人脑神经元连接来处理复杂问题。对于手写数字识别(1-10),网络会输出10个概率值总和为100%。输入可以是图片像素(如28x28=784个点)或汉字序列(预测下一个字的3000种可能)。网络通过权重(w)调整连接强度,层间传递数据时进行特征提取和抽象化(如从784维压缩到28维)。以蛇和鳄鱼分类为例,线性公式区分两类,而复杂问题需多层非线性处理。训练过程即优化权重,如GPT-3有1750亿参数。特征提取通过逐层计算(如边缘检测:x1-x0)实现,最终对比向量相似度输出概率。权重设
2026-06-22 20:47:19
127
原创 ClaudeCode_使用cc连接DeepSeek_Qwen等模型_Codex_ai编程疫情实时监控大屏_AI量化交易系统---AI大模型系统从零开始0014
文章摘要:本文介绍了使用Claude和DeepSeek-v4进行数据分析和可视化的过程,包括安装Claudecode、切换模型、处理多列数据、可视化呈现(如使用ECharts和Flask)、地图数据展示以及ARIMA算法预测。作者强调掌握更多工具和深入研究算法的重要性,并指出预测不确定性事件的价值和挑战。最后展示了讲师的实际案例效果,呼吁多进行测试和交流。
2026-06-22 20:42:22
201
原创 AI大模型原理与API使用_AI编程工具优缺点_AI编程全局提示词与项目提示词---AI大模型系统从零开始0013
本文主要探讨AI编程工具的实际应用与优化策略。文章对比了Ops4.8、trae卡、灵码、Cursor等主流AI编程工具的性能特点(如人均23万token处理能力),指出大模型质量是核心差异。重点介绍了Cursor工具的使用技巧:通过设置全局规则(如禁止重复造轮子、添加fallback机制)和项目规则来提升AI输出质量,建议对复杂任务采用agent模式分阶段处理(先文档规划再编码)。文章以Excel文件合并为例,演示了分步骤提示AI操作的最佳实践,强调拆解任务、验证中间结果的重要性,避免AI"幻觉&
2026-06-22 20:34:23
72
原创 ChatGPT如何训练出来的_长尾效应_RLHF人类反馈强化学习_RM奖励模型_PPO强化学习_Actor生成模型_古法编程---AI大模型系统从零开始0012
如果这个温度设置的越高,那么,他有可能不去选择,概率最高的60,那个字,而是选择概率低一点的,比如70的那个字,让概率低一点的词也能被选到,让回答的内容,更灵活一点。当然是首先把很多的互联网的知识,要给ChatGPT,然后他来自己推理出答案4个,比如4个答案,然后由人类,判断给他排序,哪个答案最好。只要是通过不同的标记员可以判断,他们都认为,句子A比句子B回答的好,就够了,ChatGPT就知道,原来我按照句子A回答,会更好,这样就越来越聪明。然后可以看到,在调用大模型的时候,有一个参数叫做 tools。
2026-06-22 19:54:14
35
原创 通过ai工具结合agent_操作WindowsUI实现工作_工具思路收集_测试winright_midscene随时更新---AI大模型应用探索0042
文章摘要:讨论了两种自动化操作方案:WinRight通过识别Windows UI组件录制流程,但对复杂界面支持有限;MidScene+QwenPaw采用视觉识别,速度较慢但能自动纠错。改进方案是将常规点击操作坐标存入JSON文件由程序快速执行,仅在需要AI判断时调用AI,兼顾效率与准确性。这种混合方法效果良好。
2026-06-11 11:16:33
51
原创 AI电商视频生成_Flux模特生成_模特试衣CatVTON_局部重绘_换装_回流数据自进化---AI大模型系统从零开始0011
本文探讨了AI视频生成技术在电商领域的应用与挑战。文章首先对比了文字生视频和图生视频的技术进展,指出后者在一致性和真实性方面已有显著提升。重点分析了虚拟试衣技术(如catVTON模型)的实际应用问题,包括服装变形、局部重绘不完整等技术瓶颈,提出通过人工标注、建立商品-模特匹配规则等解决方案。文章还介绍了视频素材的多源生成方式(AI生成、模板素材等)以及基于数据回流的自优化系统。最后讨论了AI+人力协作的商业模式,指出企业正通过将基础工作下沉至三线城市配合AI技术来优化成本结构,这种模式在跨境服务中已显现竞争
2026-06-10 18:56:38
85
原创 AI电商视频生成_详细处理制作过程_应用场景说明_渐进式披露---AI大模型系统从零开始0010
电商AI视频生成技术正快速迭代,通过智能切片、结构化标签和渐进式筛选大幅降低制作成本。筷子科技等企业采用60+AI模型组合方案,实现商品视频的智能化生产:1)将长视频切割为结构化片段并打标;2)结合换装模型(如CatVTON)与渐进式筛选逻辑,从海量素材中精准匹配需求;3)通过数据回流实现效果自优化。当前技术虽在服装变形等细节仍需人工干预(如局部重绘),但随着多模态模型进步,AI生成视频的真实度已显著提升。该模式通过"AI+三线人力"的混合部署,正在重塑视频制作产业生态,使商家能以1/1
2026-06-10 18:53:11
137
原创 多模态从Agent构建到视频AIGC_视觉转译_融合推理_多模态应用场景_传统视觉模型和多模态模型对比_yolo_unet对比---AI大模型系统从零开始0009
多模态模型,视频转译,融合推理
2026-06-10 15:46:56
68
原创 工作流智能体_推理型智能体ReAct Agent_Agent平台---AI大模型系统从零开始0008
企业级AI平台正成为新趋势,法律领域的HarveyAI(估值92亿美元)专注于合同审查等法律服务,具有低错误率和数据隔离特性;Glean(估值72亿美元)则整合企业内各类数据系统,构建知识图谱提供智能搜索和自动化流程。两者都通过AI解决信息壁垒问题,如客服快速获取技术问题答案等场景,体现了AI在企业信息管理和服务中的高效应用。
2026-06-09 18:13:23
76
原创 ReAct Agent_使用coze实现autogpt_使用Trae模拟react agent工作过程_思维链思想---AI大模型系统从零开始0007
首先下面这部分,是用来给提供的文件,起一个别名,做对应起来,比如你提供300个文件,每个都是1,2,3命名的,这样,他再去找,就很麻烦,不能都读取一遍,所以就先做了这样一个数据预处理,相当于这样的过程。给他提供了哪些工具,希望他自主性干嘛。他们的调用格式是什么样的,api接口是什么,但是实际上,接口调用方式都在12,这个工具中可以查询到。大模型没有能力记住,上次的经验,但是agent可以,但是也有问题,后来,提示词不断变多,这里就是执行,先去推理,然后再去执行,然后再去 推理,再去执行,这种反馈循环。
2026-06-09 17:35:53
369
原创 Agent从可控性到自主反思_ReAct Agent_推理 行动 反馈 循环机制构建的龙虾体系---AI大模型系统从零开始0006
本文介绍了构建通用智能体(如Manus、OpenClaw)的核心方法——React机制,适用于无法预先规划步骤的任务。通过案例演示了AI如何通过"推理-执行-反馈"循环处理问题:用户查询"9月销售额不达标的供应商"时,AI需自主完成多轮操作:1)列出文件;2)识别有效信息(排除干扰文件);3)从管理文件中提取达标标准(3万元);4)编写代码计算Excel中的销售额;5)筛选不合格供应商。整个过程依赖精心设计的提示词框架,包含三大模块:思考引导、工具调用规范和单次决策限
2026-06-09 17:20:04
209
原创 Agent从可控性到自主反思_workflow agent_详细使用方法_子agent调用---AI大模型系统从零开始0005
摘要:本文介绍了如何利用Agent工作流解决大语言模型(LLM)的幻觉问题。通过构建包含意图识别、工具调用和流程控制的Agent系统,将知识库检索、地图查询、代码计算等工具整合到工作流中。具体以骑手招聘助手为例,展示了当用户查询站点位置时,系统自动调用百度地图API获取经纬度,再通过Python代码计算最近站点,最终生成完整回答的过程。这种基于LLM的Function Call能力的Agent架构,通过严格的工作流程和工具限制,有效提升了回答的准确性和完整性。
2026-06-09 15:54:29
60
NIFI大数据处理-PostgresqlToMySql指定表多表-CDC增量数据实时同步.zip
2023-06-12
2023自己实操-验证过的-通达信公式-胜率很高-神技-趋势+底部钝化+底部结构+选股+风口-一整套-.zip
2023-04-28
K线理论-付费课程-实战经验-总结学习手册-2023-05-29.zip
2023-05-29
NIFI大数据模板-MySqlToPostGresql数据分页实时采集-带分页.zip
2023-05-25
NIFI大数据模板-HbaseToMysqlByPhoenix-实时数据同步带分页.zip
2023-05-25
NIFI模板PostGreSqlToHbaseByPhoenix-数据从PostGresql实时同步到Hbase-带分页.zip
2023-05-25
NIFI大数据模板-PostgresqlToHbase数据实时采集-带分页.zip
2023-05-22
大数据Nifi处理-MySqlToSqlServer数据分页实时同步.zip
2023-05-19
MySqlToHbase数据分页导入到Hbase.zip
2023-05-16
大数据处理NIFI模板-MySqlToMySql增量数据实时同步-利用Binlog实时同步数据.zip
2023-05-06
Nifi模板-PostGreSqlToMySql数据分页实时采集-带分页.zip
2023-05-06
2023-04-28最新-自己封装整理-可直接使用-亲测可用-多模态AI合集-ChatGPT4-ChatGpt3.5.zip
2023-04-28
整理了好久-2023最新Java面试题-如果你在找工作-希望能帮到你了
2023-04-28
大数据Nifi模板-Mysql数据分页同步-实现了分页功能-MySqlToMySql数据分页实时采集-带分页功能.zip
2023-04-24
大数据nifi模板,用来实时从mysql数据中读取数据到另一个mysql的数据库中
2023-04-24
文心一言解读-及应用方向解读2023-04-19PDF.zip
2023-04-19
ChatGpt2023年研究框架-2023-04-19.zip
2023-04-19
nacos-server-1.1.4 这个下载以后可以直接使用
2023-03-16
xsync 脚本将文件同步到大数据集群中的所有机器
2023-02-23
利用MybatisPlus来实现对表的水平分表,全自动,可以首先判断表是否存在,不存在创建表
2022-08-22
apireader-excelreader-打包好的-直接放入到安装后的datax的-plugins文件夹中就可以使用.zip
2024-12-04
对datax进行了插件扩展-以支持对http接口数据的采集-jsonreader-v1.1.1.zip
2024-12-04
基于datax源码修改-添加对瀚高-对excel文件-对api接口的支持-dataxCode-v1.1.1.zip
2024-12-04
nifi-web-ui.zip nifi开源项目源码修改后的版本1.26.0的版本 数据清洗中心
2024-10-25
瀚高数据库连接开发工具-2024-hgdbdeveloper.zip
2024-06-29
datax插件-瀚高数据库支持插件-highgowriter.zip
2024-06-29
datax插件-瀚高数据库同步支持插件-highgoreader.zip
2024-06-29
瀚高数据库迁移工具2024版.zip
2024-06-12
MSVCR120.dll缺失-瀚高数据迁移工具修复DLL.zip
2024-06-12
Semantic-Kernel-MyPlugins.zip
2024-04-10
highgowriter-highgoreader-dataxcode.zip
2024-04-07
docker-compose-linux-x86-64-v2.26.0.zip
2024-03-29
docker-compose离线版.zip
2024-03-29
ChatGLM-6b-int4基础模型文件.zip-这个是除了比较大的文件的其他文件-其他大的模型文件可以在清华云下载
2024-02-29
nifi-p12-store.zip 这个文件就是nifi-1.23.2今年最新8月份出的最新版需要的加密文件
2023-10-08
瀚高DB企业版最新6.0.4官方安装教程.zip
2023-07-21
瀚高DB企业版最新版连接操作工具2023.zip
2023-07-21
NIFI-MySqlToMySql增量同步数据实时采集-实现了日期类型-以及空值处理-插入已存在变更新-更新未存在变插入.zip
2023-06-20
NIFI1.21.0-大数据同步处理模板-MysqlToMysql增量同步-单表-处理日期-空值数据.zip
2023-06-20
NIFI1.21.0-Mysql和Postgresql到MysqlHbase-全量指定库和表同步到Mysql和Hbase.zip
2023-06-20
Quartz动态创建Job,Job中含有初始化参数,执行job的时候报错,怎么解决
2022-06-17
一个软考高级,信息项目管理师的问题,想不明白..希望大家来解惑
2022-04-08
android中intent传值的问题,数据都串了,很奇怪
2021-06-16
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅