自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+

大师兄

代码改变世界

  • 博客(227)
  • 收藏
  • 关注

原创 OpenDataLoader 开源 PDF 解析工具 懒人整合包

是一个面向 AI 文档处理的开源 PDF 解析工具(由 Hancom 相关团队开源维护)。它的核心使命是将 PDF 等非结构化文档,精准地转换为最适合大语言模型(LLM)和 RAG(检索增强生成)系统读取的结构化数据(如 Markdown、JSON、HTML)。核心定位PDF→→→→RAG 知识库 / AI Agent 输入。

2026-07-14 20:10:48 251

原创 FLUX.2 [klein] 4B 轻量级 AI 图像生成 懒人整合包

FLUX.2 [klein] 4B 是 Black Forest Labs 面向速度、本地部署和商业应用推出的轻量级图像生成模型。它以40 亿参数实现了文生图与图像编辑的统一,在消费级 GPU 上即可运行,并采用Apache 2.0开源许可证,兼顾了生成质量、推理速度和部署成本。对于希望在普通硬件上构建 AI 绘图应用、ComfyUI 工作流或商业服务的开发者而言,FLUX.2 [klein] 4B 是当前兼顾性能与实用性的选择之一。

2026-07-12 21:56:43 233

原创 GFPGAN:开源人脸修复与增强 懒人整合包

传统超分辨率(CNN 架构)低清图片⟶CNN 模型⟶高清图片\text{低清图片} \longrightarrow \text{CNN 模型} \longrightarrow \text{高清图片}低清图片⟶CNN模型⟶高清图片痛点:如果原图丢失了核心面部信息(如瞳孔、睫毛细节),模型只能靠算法硬猜,容易导致放大后依然模糊或面部扭曲。GFPGAN 架构(生成式人脸先验 - Generative Facial Prior)

2026-07-11 00:08:17 494

原创 Real-ESRGAN:经典开源 AI 图像与视频超分辨率 懒人整合包

是一个基于深度学习的,旨在将低分辨率、模糊、有噪声的图片提升至高清品质。作为经典模型 ESRGAN 的升级版本,它最大的创新在于(而非仅在线性降采样的理想实验环境中有效),是目前开源 AI 图像增强生态里的「核心基础组件」。

2026-07-11 00:07:52 351

原创 Marker:高质量 PDF 转 Markdown 懒人整合包

是一个开源的文档转换工具,旨在将 PDF 文件转换为 Markdown、JSON 或 HTML 等结构化格式。它对现代文档进行了极致优化,尤其擅长处理包含的 PDF。相比传统只能“看懂文字”的 OCR 工具,Marker 能够,将其还原为极度适合二次编辑、博客发布或 AI 训练的数据流。

2026-07-10 21:29:39 548

原创 Tesseract OCR:经典开源离线文字识别引擎 懒人整合包

完全免费且无网络限制。极为适合文档数字化(如纸质文件转为可搜索 PDF)、办公自动化(发票/合同文字提取)以及在树莓派(Raspberry Pi)、NAS 等边缘设备上运行后台批量任务。

2026-07-10 19:18:59 380

原创 RapidOCR cpu可用 懒人整合包

是由 RapidAI 社区维护的开源 OCR(光学字符识别)工具库。它旨在将现代深度学习 OCR 模型工程化、轻量化,摆脱对大型深度学习框架和 GPU 的依赖,实现。

2026-07-10 18:23:59 344

原创 MOSS-TTS-Nano ONNX:轻量级离线语音合成 懒人整合包

是由 MOSI.AI 与 OpenMOSS 团队推出的开源轻量级 TTS(文本转语音)模型。主打,无需 GPU,仅靠普通 CPU 即可完成语音合成。通过 ONNX Runtime 实现推理,,更适合桌面软件、边缘设备及离线应用集成。

2026-07-09 17:30:56 501

原创 Vosk:开源离线语音识别 懒人整合包

Vosk 的核心价值在于完全离线 + CPU 友好 + 实时流式输出。对于预算有限、硬件低配、或是对隐私有极致要求的本地化 AI 项目,它依然是目前最实用的基石之一。

2026-07-09 15:02:11 344

原创 Piper TTS 离线语音合成 懒人整合包

piperpiper1-gplPiper1-gpl是一个快速、离线、且支持本地运行的神经网络文本转语音(TTS)引擎。它无需依赖任何云端 API,能够直接将文字转换为自然的语音,非常适合本地语音助手、嵌入式设备以及桌面应用等场景。

2026-07-09 12:41:10 464

原创 边缘端语音全能王 sherpa-onnx 懒人整合包

Sherpa-ONNX:全栈离线语音AI解决方案 Sherpa-ONNX是基于ONNX Runtime的高性能离线语音推理框架,由Next-gen Kaldi团队开发,支持语音识别(ASR)、语音合成(TTS)、语音唤醒(KWS)和说话人识别(Speaker ID)。其核心优势在于完全脱离云端依赖,可在CPU或低功耗ARM设备(如树莓派)上高效运行,支持多平台(Windows/Linux/macOS/Android/iOS)和轻量化部署。 功能亮点 ASR:支持Zipformer、Whisper等模型,适用

2026-07-09 04:32:07 374

原创 Duix-Avatar开源ai数字人,离线视频生成 懒人整合包

4.Duix-Avatar的docker镜像需要1000GB左右,数据D盘需要预留30GB左右,也就是剩余磁盘空间建议150GB及以上。3.推荐配置英伟达显卡4070(本文只适配3060 N卡,理论上40系也可以用,但是50系可能要单独适配)(其他I卡,A卡,不兼容)在C盘新建一个文件夹用于Duix-Avatar,名称随意,本文的文件夹是C:\dsx2016\Duix-Avatar。加载完成后,在当前docker-compose.yml的目录终端执行命令来启动项目。等待几秒后,你会看到多了一个D盘。

2026-06-16 14:30:30 226

原创 Qwen3 ASR 流式转写 Docker 懒人整合包

本文是第二个docker懒人包,依旧是win兼容问题,不得不用docker这个懒人包有40GB左右,在docker容器里,环境依赖和模型都在,界面为官方的流式demo同样的,要么在linux上使用(x86),要么在win上使用wsl2和docker桌面版,目前不支持mac arm。

2026-04-15 11:05:20 444

原创 sam3 提示词 图片分割和视频分割 docker 懒人整合包

因为win兼容性问题,改为docker懒人包第一次把镜像打包了,一些第三方依赖不在,依旧报错第二次才把带环境的容器打包,这样一个极简的可以正常的工作的docker懒人包就制作完成在win上使用这个懒人包,默认是安装了wsl2和docker桌面,以及可以docker正常使用win的gpu也默认用户是了解使用docker的基本命令,比如docker compose启动和停止。

2026-04-14 22:43:20 332

原创 SAM3 提示词 视频分割 ComfyUI 懒人整合包

上期记录了SAM3 提示词 图片分割本文更新SAM3 提示词 视频分割但是在视频分割遇到一些兼容性问题报错 easy sam3VideoSegmentation returned non-zero exit status 1.ai提示Triton和cuda131的驱动不兼容在反复安装Triton,禁用Triton,和调试Triton之后,我还是放弃了,即便把这个电脑兼容处理好,分发后还是会遇到一些其他奇奇怪怪的问题所以打算转为win docker(wsl2),仍旧是comfyui。

2026-04-14 14:41:19 92

原创 SAM3 提示词 图片分割 ComfyUI 懒人整合包

Meta AI 开源的SAM 3(Segment Anything Model 3)是一个用于图像与视频分割的最新视觉基础模型,来自 facebookresearch 团队。该模型在前代 SAM / SAM 2 的基础上做了较大升级。

2026-04-13 23:36:43 487

原创 Qwen3-ASR 多语言语音音乐歌曲识别 懒人整合包 重新安装

从之前的fastapi转gradio界面,已经重新打包了3个左右的懒人包核心是为了把编程api转为可视化操作交互网页,更加方便,同时也是为了重新优化项目结构,方便后续更改和优化,比如添加python依赖和添加其他界面功能如果不重新制作懒人包结构,那么后面要做改动,会花费10倍的时间也达不到一个预期的效果,重新制作后,可能几分钟半小时就能大改版现在fastapi的界面几乎没了,开始第二阶段,就是把之前网上整合的别人的懒人包,自己重新做,尤其是项目里面可能带有api的。

2026-04-12 12:15:13 241

原创 PaddleOCR-VL-1.5 PDF转MD 懒人整合包 界面微调

本期依旧是把fastapi的界面改为gradio界面原来的fastapi适合api调用,现在的gradio适合界面交互操作本期的更新为只保留PDF转MD和图片转MD的功能,其他如json,html,excel都去掉了只保留GPU版本,无CPU版本,因为VL1.5比较占显存,CPU耗时太长下图是两个版本对比。

2026-04-10 23:48:18 421

原创 paddleocr PP-StructureV3 pdf转md 懒人整合包 gpu可用

上一期内容记录了paddleocr PP-StructureV3 pdf转md 懒人整合包 cpu可用本文主要是记录把paddleocr PP-StructureV3 pdf转md 懒人包改为gpu可用毕竟cpu用来体验效果还行,但是批量或者重度用户,最求速度还是优先考虑使用gpu,不能让gpu闲置其他的功能并没有更新承接上一期内容,发布了基于 PaddleOCR PP-StructureV3 的 PDF 转 MD 懒人整合包 CPU 版。

2026-04-09 21:38:33 592 1

原创 paddleocr PP-StructureV3 pdf转md 懒人整合包 cpu可用 交互界面调整

本文依旧是懒人包的优化更新之前最大的问题就是使用fastapi这种偏向编程交互的操作方式适合api调用,不太适合gui界面可视化操作,现在统一把fastapi改为gradio可视化交互关于懒人包,目前最多的系列是ocr,其中pdf转md也最为常用。

2026-04-07 23:42:50 328

原创 Rembg 图片去背景工具 懒人整合包 优化可视化界面和添加模型 cpu可用 gpu可用

这个Rembg去除背景懒人包是我自己制作的第一个懒人包当时为了制作youtube带有真人头像的封面,需要保留人像,去除背景,然后搜索到这个好用的ai开源项目也是为数不多的可以使用cpu也能流畅操作的项目,效果很不错,关键还是开源免费作为一个高频使用的工具,也是我电脑没有3060显卡的时候,可以制作的懒人包下图是实际测试效果。

2026-04-07 06:01:34 525

原创 FireRed-Image-Edit 一键衣物提取 懒人整合包

是当前最强的开源“图像编辑型大模型”之一。一句话改图、高身份一致性、以及强大的多图融合能力。

2026-04-02 10:49:01 341

原创 Qwen3-ASR 1.7B 音频转字幕 懒人整合包

Qwen3-ASR提供0.6B和1.7B两个语音识别模型版本。0.6B版本主打高效低延迟,适合边缘设备和实时场景,具有极快推理速度(~92ms首字响应)和低显存需求。1.7B版本则在准确率上达到SOTA水平,尤其在噪声环境、方言和长语音处理方面表现优异,但需要更强算力支持。两者均支持52种语言识别,开发者可根据业务需求选择:效率优先选0.6B,精度优先选1.7B。使用懒人包可快速体验,但需注意3060 12GB显卡的特定兼容性要求。

2026-04-01 21:10:06 613

原创 whisperx 语音转字幕 懒人整合包

优点缺点时间戳极其准确(词级)Pipeline 复杂,组件较多支持说话人分离部署依赖较重(强烈建议 GPU)速度极快对齐步骤需要额外加载模型开源、可本地部署WhisperX 是目前做“高精度字幕 + 多人语音转写”的最佳开源方案之一。

2026-03-31 20:57:57 220 4

原创 flux-2-Klein-BFS-换头换脸工作流 懒人整合包

FLUX.2 Klein BFS = “为实际应用优化的轻量级高质量图像生成模型”

2026-03-31 20:57:00 303

原创 Qwen_ImageEdit_2511 图片多角度 分镜 懒人整合包

Qwen-Image-Edit-2511 是阿里通义千问团队推出的一个开源图像编辑模型,属于 Qwen-Image 系列中的“编辑(Image Editing)”版本。它的核心定位非常明确:专注于基于文本指令修改图片。简单理解:它 = “比 Stable Diffusion 更擅长改图、而不是单纯生成图”的模型。Qwen-Image-Edit-2511 = 当前开源里“最强调一致性和可控编辑”的图像编辑模型之一。相比传统扩散模型,它更像一个:“可理解指令的 Photoshop AI"。

2026-03-31 20:56:21 246

原创 MatAnyone2 视频去除背景 懒人整合包

MatAnyone2 = 一个用“自评估 + 大数据 + 长程建模”提升的视频抠图 SOTA 模型。懒人包使用双击start_offline.bat等待终端启动完成打开网址,选择视频,添加遮罩,获取绿幕和透明通道结果。

2026-03-31 20:55:29 290

原创 fashn-vton-1.5 一键换装 懒人整合包

选top替换上半身,选择bottom替换下半身,选择one替换全身(比如连衣裙等)当我们只想测试衣物原本的效果时,不需要改变颜色,不需要改变细节,就可以使用这个效果。其他的模型优点在于可以无中生有,在原本的服装上修改颜色和样式等,但也同时是缺点。上面选择目标人物,下面选择要换的衣物(或者参考衣物的人像)建议换装时,优先使用全身照片,正面照片,这样模型效果更好。类别 (上衣 / 下装 / 连衣裙),旨在提供生产级的高质量生成方案。HuggingFace 权重。终端启动后,访问红框中的网址。

2026-03-31 20:54:41 236

原创 小红书FireRed-OCR 2B 图片和PDF转md 懒人整合包

FireRed-OCR是一个系统化的框架,旨在将通用的大型视觉语言模型 () 专门化为高性能、像素级精确的结构化文档解析专家。通用虚拟语言模型在处理复杂文档时经常会遇到“”(例如,行排列紊乱、出现虚构公式)。FireRed-OCR 通过将文本生成范式从“印象式”转变为“结构工程”来解决这个问题主要特点。

2026-03-31 20:52:30 128

原创 PaddleOCR-VL-1.5 懒人整合包 支持PDF转MD 比PP-StructureV3更精准

设计,是一款资源高效且达到最先进水平的模型。它在文档解析任务中,涵盖六大主要场景:正常、倾斜、变形、扫描、多光照和屏幕拍摄,均展现出全面领先优势。该模型引入了领先的文本识别和印章识别功能,增强了对复杂元素(如文本、表格、公式和图表)的解析能力,并将语言支持扩展至111种语言——所有这些都保持了极低的资源消耗。

2026-03-31 20:51:36 872

原创 paddleOcr 懒人整合包 添加pdf和图片转markdown 添加GPU支持

能够智能地将复杂的PDF和文档图像转换为。在公开基准测试中,本文在上一个懒人包的前提下,加了一个PDF转MD的API功能参考之前的文章演示用的pdf。

2026-03-31 20:50:47 404

原创 Wan2.2-Animate动作迁移 图片同步视频姿态 懒人整合包

本文使用3060 12Gb显卡测试,内存为64GB ddr4,测试过程中,本项目先使用cpu处理,然后内存爆满到60Gb,最后使用显卡峰值大约为8.2GB。整个视频处理时间大致为10分钟,不同的分辨率处理的时间各不相同,配置好的可以尝试1080p等高清分辨率,具体使用细节可以查看界面的参数自行调整。Wan2.2 是一个开源的 AI视频生成模型框架,主要用于 文本→视频、图片→视频、音频→视频生成。建议模仿中间视频时,图片的人物最好和视频的人物一致,比如都是全身像,这样效果更好一些。

2026-03-31 20:49:50 552

原创 IOPaint 开源ai去水印 去除背景 懒人整合包

和图像内容删除/替换。它允许用户在图片上涂抹要修改的区域,然后利用 AI 自动补全或生成新的内容。cpu也可以运行,gpu也可以运行,主要用来图片去除水印,也可以用来去除背景。双击start.bat,等待终端启动,会自动打开一个网页。“用 AI 修复或修改图片局部内容的工具”与编辑工具,主要用于 AI 局部重绘(选择图片或者拖拽图片,点击去除背景。IOPaint 是一个 开源的。,人脸修复等可以自行探索。使用笔刷可以去除水印。

2026-03-31 20:48:48 227

原创 LTX2.3更新 文生视频 GGUF工作流 懒人整合包 低显存12G也可用

LTX 2.3 是一个 开源的 AI 视频生成模型,可以根据文字描述或图片输入自动生成短视频,并支持音频同步与高分辨率输出。本文懒人包为。

2026-03-31 20:47:55 2715

原创 LatentSync 开源数字人视频对口型 懒人整合包

‌ 是开源唇形同步(Lip Sync)框架,基于 ‌‌,实现从音频到高分辨率视频唇部运动的端到端生成。它无需依赖中间运动表示(如 2D 特征点或 3D 人脸模型),直接在潜在空间中建模音频与视觉的跨模态关联,显著提升生成质量与效率。

2026-03-31 20:46:37 330

原创 qwen3-tts 文字转语音 懒人整合包

Qwen3-TTS是团队开发的开源语音合成模型系列,支持多音色、多语种与多方言的语音生成懒人包界面注意,建议显存8GB以上下载并解压懒人包,点击一键启动WebUi.bat等待终端执行执行成功后会自动打开网页网页为https,因为证书问题,需要点击高级,运行,才能正常访问界面本文只演示声音设计比如声音描述为甜美的萝莉音或者可爱的小孩音,都行,声音会按描述的内容生成生成后可以点击试听或者下载目前语音克隆和自定义音色请自行测试。

2026-03-31 20:45:47 226 1

原创 SoulX-FlashHead 实时图片数字人生成器 8GB显存可用 一键懒人整合包下载

Model_Pro Released可以在单个 RTX4090 上生成 10.8 FPS 的高质量视频,或者在两个。这是一个有soul推出的开源的图片数字人AI,可以实时图片数字人,低显存也可以流畅使用,比如8GB。模型选择lite最快,但是效果较差,选择pro较慢,效果只是相对可以,但是还是不太真实。目前我只测试了它的数字人视频生成,没有测试它的实时效果,暂时用不到实时的功能。然后下载网盘的一键懒人整合包,大致16GB,解压。选择一个图片,正方式,脸部居中,上半身。建议12.8版本及以上。

2026-03-31 20:43:35 409

原创 PaddleOCR CPU 懒人包 轻松识别中文图片文字

实际场景可以使用获取到的json数据,里面有识别的文字,置信度,和坐标等。目前仍然是一键懒人包,使用falstapi网页api文档的方式使用。一个轻量的可以解析pdf和图像识别文字的ocr,支持100种语言。目前仅cpu可用,速度较慢,后期酌情添加gpu懒人包。左侧为带背景标注,右侧为空白背景标注。截至到今日,本文使用的懒人包版本为。一个是返回json数据,一个是返回。详情参考使用说明.txt。接口,里面有两个api。

2026-03-31 20:41:49 93

原创 开源免费人像抠图神器!CPU也能跑的RMBG去背景(懒人一键搞定版)

它是一款用于去除图片背景的工具,比如保留人像,去除背景,也就是人像抠图,也可以是动物,物品等。可以使用cpu,也可以gpu,可以命令行使用也可以http,还可以。点击start.bat,开始运行,具体操作查看使用说明.txt。可以看到背景被清除,人物的毛发和衣物都保留下来,边缘也很平滑。目前懒人包仅支持cpu和window环境。后续酌情添加gpu懒人包或者其他功能细节。截至到目前,22.1k star。

2026-03-31 20:40:48 224

原创 faster-whisper 音频转字幕 懒人整合包

Faster-Whisper是Whisper语音识别的高性能工业级推理引擎,通过CTranslate2框架优化,在保持精度的同时显著提升速度(最高4倍)并降低资源消耗。它支持CPU/GPU运行、INT8量化、批量处理,兼容所有标准Whisper模型,输出格式与原版一致。相比官方Whisper和其他实现方案,Faster-Whisper在速度、资源占用和部署便利性上表现更优,适合生产环境使用。不过当前版本仅支持单语字幕生成,暂不具备双语字幕或语言转译功能。

2026-03-30 16:22:09 570

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除