- 博客(302)
- 资源 (3)
- 收藏
- 关注
原创 阿里开源Qwen3模型实战:Qwen3-RAG轻量级系统
1. 配置模块 (config.py)2. 文档处理模块 (document_processor.py)3. 向量检索模块 (vector_retriever.py)4. 重排序模块 (reranker.py)5. 答案生成模块 (answer_generator.py)6. 主应用程序 (main.py)7. 测试脚本 (test_rag.py)8. API服务 (api_server.py)9. 配置文件requirements.txt.env 文件10. 使用
2025-12-31 09:15:00
1243
原创 Deepseek本地部署全攻略:Ollama到知识库的完整实践
本文详解Deepseek本地化部署全流程,从Ollama框架搭建到个人知识库应用开发,提供分步技术指导与代码示例,助力开发者构建私有化AI知识管理系统。Windows系统(WSL2)1.3 Docker环境配置二、Ollama框架安装与配置2.1 Ollama安装2.2 Deepseek模型下载与配置创建模型配置文件下载和运行模型2.3 模型验证脚本创建测试脚本 :三、知识库应用完整开发代码3.1 项目结构3.2 后端FastAPI应用后端依赖文件 主应用文件
2025-12-31 09:15:00
1032
原创 Ollama+FAISS+Embedding+Rerank+LLM 详细部署指南
下载安装Ollama双击运行安装程序安装完成后会自动启动服务修改默认安装路径(避免C盘爆满)或使用PowerShell:验证安装Linux系统部署:(二)准备模型1. 拉取Embedding模型2. 拉取LLM模型注意:原文中提到的可能需要从自定义仓库拉取:3. 下载Rerank模型(三)安装依赖库创建项目目录和虚拟环境:二、主要功能实现项目结构(一)配置文件(config/config.yaml)(二)文本分块策略实现创建 :(三)文档读取
2025-12-30 00:35:19
1504
原创 AI一键生成游戏程序架构详解
自定义游戏资源下载MCPreturn [Tool(description="下载游戏精灵图",# 从开放资源库下载素材低成本:利用免费工具和少量API调用高效率:自动化完成80%的重复编码工作易扩展:通过MCP协议轻松添加新工具学习友好:实时展示代码生成过程,适合初学者通过DeepSeek+Cline+MCP的协同工作,真正实现了“一句话生成完整游戏程序”的目标,为AI辅助开发提供了可复制的成功范例。这种架构不仅适用于游戏开发,还可以扩展到Web开发、数据分析、自动化脚本等多个领域。
2025-12-28 19:22:39
1268
原创 VS Code + Cline + Continue + DeepSeek-V3 实现 Cursor 和 Windsurf 平替
/ 多模型配置示例},"qwen": {"name": "通义千问",},// 自定义Cline工具示例description: '执行数据库查询操作',// 安全检查return { error: '危险操作需要额外确认' };// 执行查询},// 参数验证if (!params.query) return '查询语句不能为空';if (!params.connectionString) return '数据库连接字符串不能为空';});成本控制策略。
2025-12-28 19:07:56
1316
原创 Playwright MCP实现UI自动化测试
想象一下,只需用自然语言告诉 AI:“测试网站的登录功能”,它就能自动操作浏览器,完成整个测试流程并生成报告——这就是 Playwright MCP 带来的变革。在快速迭代的现代软件开发中,UI 自动化测试已成为保障产品质量的关键环节。然而,传统自动化测试方法高度依赖测试工程师手动编写和维护脚本,不仅耗时巨大,且脚本脆弱性高——页面结构的细微变化就可能导致测试失败。随着大语言模型(LLM)和 AI 智能体技术的快速发展,一种全新的测试范式正在形成。Playwright 与 Model Context Pro
2025-12-28 17:09:27
2256
原创 快速构建MCP Server应用指南
Cline 是一个专注于 AI 开发的命令行工具,但构建 MCP(Model Context Protocol)Server 应用更直接的方式是使用官方的 SDK。
2025-12-28 16:34:18
597
原创 GLM-4.7颠覆性应用:AI智能体一键生成企业级n8n工作流全解
n8n AI Agent 工作流设计专家技能## 技能标识- **名称**: n8n-workflow-architect- **版本**: 2.0.0- **模型要求**: GLM-4.7-coding-preview 或更高- **上下文长度**: 128K tokens## 能力范围### 1. 输入处理能力- 自然语言需求解析- 多模态输入支持(文本、数据格式描述、API文档)- 约束条件识别(时间、成本、合规性)### 2. 架构设计能力#### 2.1 节点选择策略。
2025-12-28 10:53:20
1607
原创 基于Python Flask的Web3应用开发
3. 关键技术栈Flask: 轻量级Web框架web3.py: Python的以太坊交互库Infura/Alchemy: 区块链节点服务进阶开发建议1. 安全注意事项2. 智能合约交互示例3. 添加更多功能4. 项目结构优化5. 部署注意事项安全性:性能优化:错误处理增强:6. 测试建议学习路径建议基础掌握:进阶学习:项目实践:这个示例项目虽然简单,但为你展示了Web3开发的核心流程。随着Web3生态的发展,Python在区块链数据分析、后端服务和自
2025-12-28 00:21:13
1156
原创 Amazon S3 Bucket Policy:仅允许特定用户访问
这个配置确保了只有指定的IAM用户可以访问您的S3桶,同时提供了不同级别的权限控制选项。
2025-12-27 23:43:25
321
原创 Windows下Pytorch3d安装与使用全攻略
版本控制:严格遵循官方推荐的版本组合环境隔离:使用conda虚拟环境管理依赖逐步验证:每步安装后进行验证测试备份恢复:创建环境快照,便于恢复。
2025-12-22 04:02:02
2000
原创 Windows 11 系统安装 Detectron2 详细指南与实战应用
Detectron2 是 Facebook AI Research (FAIR) 开发的一款开源目标检测与图像分割框架,作为 Detectron 和 maskrcnn-benchmark 的继任者,它提供了更加灵活、高效和可扩展的代码库。该框架支持 Facebook 内部的众多计算机视觉研究项目和生产应用,已经成为工业界和学术界广泛采用的标杆工具。4.3.1 准备自定义数据# 注册自定义数据集# 获取数据集元数据print(f"类别数量:len。
2025-12-22 03:51:12
2172
原创 Windows11安装PyTorch 2.x完整指南
虚拟环境是必须的:避免包冲突,便于项目管理CUDA版本要匹配:PyTorch、CUDA Toolkit、显卡驱动需版本兼容镜像源加速:国内用户使用清华/阿里镜像源提高下载速度。
2025-12-21 21:24:50
1172
原创 Windows 11 安装 TensorFlow 2.x 完整指南
✅ Anaconda 环境配置✅ CUDA 和 cuDNN 安装✅ TensorFlow GPU 支持配置✅ 完整测试代码✅ 问题排查方案✅ 应用场景分析关键要点TensorFlow 2.10.0 是最后一个官方支持 Windows GPU 的版本需要匹配的 CUDA 11.2 和 cuDNN 8.1 版本建议使用 Anaconda 管理环境以避免依赖冲突实际应用中应根据具体需求选择合适的 TensorFlow 版本和架构。
2025-12-21 20:12:06
1427
原创 Win11 + NVIDIA驱动 + CUDA + cuDNN + Anaconda + TensorFlow-GPU + PyTorch GPU环境搭建详细指南 ~ 2026最新版
本指南详细介绍了在Windows 11上搭建完整深度学习GPU环境的步骤。虽然TensorFlow在Windows上的原生GPU支持有限,但通过WSL2或Docker方案可以解决。PyTorch对Windows GPU支持良好,是当前推荐的选择。优先使用PyTorch进行深度学习开发考虑使用WSL2获得更好的TensorFlow支持定期检查NVIDIA官网获取最新驱动和CUDA版本关注PyTorch和TensorFlow官方文档的版本兼容性说明。
2025-12-21 19:02:33
1958
原创 AutoGLM-Phone的介绍
部署的核心是将 AutoGLM-Phone-9B 模型在拥有高性能GPU的服务器上运行起来,并提供API服务。无论采用上述哪种方案部署好模型服务,后续在本地电脑上连接手机进行测试的步骤是相同的。
2025-12-18 09:27:14
1131
原创 智能问数系统:基于大模型的零配置数据决策解决方案
智能问数系统是一款革新性的数据决策工具,旨在通过大模型技术彻底消除传统数据分析的技术壁垒与冗长流程。无需配置复杂的工作流,用户仅需通过自然语言对话,即可在几分钟内完成从数据提问到可视化洞察的全过程,实现真正的ChatBI与DataAgent体验。该系统将数据分析从“专业技能”转变为“基础工具”,为一线业务人员、中层管理者及高层决策者提供统一、高效、智能的数据交互入口。智能问数系统通过将先进的大语言模型技术与传统数据分析流程深度融合,成功构建了一个“零配置、对话式、智能化”的数据决策新范式。
2025-12-18 00:44:05
1244
原创 TensorRT实战:基于C++的YOLOv11目标检测
模型优化充分使用TensorRT的FP16/INT8量化实现动态形状支持优化预处理/后处理流水线内存管理严谨使用智能指针管理TensorRT对象实现GPU内存池避免内存泄漏和碎片化错误处理完善检查所有CUDA API返回值实现异常安全设计提供详细的日志信息。
2025-12-18 00:36:20
726
原创 基于Unreal与Omniverse的数字孪生工厂解决方案
阐述的五大模块,构成了一套从数据到资产、从同步到交互、从优化到演进的完整、闭环、可扩展的数字孪生工厂解决方案。它不仅仅是技术的堆砌,更是以USD为数据基石、以Kafka为神经脉络、以UE5为表现窗口、以Omniverse为协同中枢的有机体系。该方案已通过自动化装配线等案例验证,具备从概念验证快速走向规模化工程落地的能力,为企业迈向工业元宇宙与智能制造提供了坚实的技术路径。
2025-12-18 00:08:49
1145
原创 Omniverse Replicator 实战指南
Omniverse Replicator是一个用于生成物理准确的3D合成数据的框架,旨在提升AI感知网络的训练和性能。它提供了一套完整的工具和工作流程,帮助用户创建自定义数据集和精准注释,从而支持深度学习模型的训练。
2025-12-18 00:00:12
649
原创 NVIDIA高性能多GPU通信库NCCL实战指南
始终使用最新版本:NCCL不断优化和修复问题,保持更新系统配置一致:确保所有节点的软硬件配置一致启用调试信息:遇到问题时启用NCCL_DEBUG获取更多信息隔离测试:使用nccl-tests工具隔离测试NCCL功能检查网络配置:大多数问题与网络配置相关记录环境变量:记录有效的环境变量配置,便于复现和调试通过遵循这些故障排除指南,您应该能够解决大多数NCCL相关问题,并确保您的多GPU系统高效运行。
2025-12-17 23:58:41
1545
原创 NVIDIA Project DIGITS:技术架构解析与行业解决方案全景
FP4量化的200B模型虽有其精度局限,但在精心设计的业务场景中,其"80%的质量+100%的隐私+实时响应+成本可控"的组合,恰恰是许多行业应用的最优解。随着软件栈的成熟和开发者社区的投入,Project DIGITS有望成为继GPU加速计算之后,NVIDIA推动的又一次计算范式革命。,消除了传统架构中数据在系统内存和显存之间的复制开销。对于企业用户,DIGITS提供了从"云API消费者"到"AI能力拥有者"的转型路径;,实现CPU与GPU之间的内存一致性,让数据在两大处理器间流动如同在单一芯片内部。
2025-12-17 16:08:05
770
1
原创 使用NVIDIA和Run:ai实现“一次训练,随处部署”的AI混合云方案
NVIDIA与Run:ai的联合方案构建了一个跨云、一致、高效且易管理技术解耦与标准化:通过NVIDIA VMI和GPU Operator标准化了底层基础设施,实现了应用与底层硬件的解耦。资源最大化利用:Run:ai的GPU分片和智能调度,使昂贵的GPU算力得以充分利用,直接提升投资回报率。企业级敏捷与管控:结合了NVIDIA的企业级支持与Run:ai的多租户、配额和优先级管理,使企业能在保持管控力的同时,提升AI研发的敏捷性。总而言之,该方案将NVIDIA在GPU计算领域的标准化能力与。
2025-12-16 06:35:22
763
原创 Triton安装测试及实战指南
性能接近CUDA,开发复杂度显著降低自动化内存访问和并行优化与PyTorch生态系统无缝集成降低高性能GPU编程门槛自定义后端允许将业务逻辑集成到推理流程中,特别适合多模型流水线场景。目录结构├── custom_model/ # 自定义模型目录│ ├── 1/ # 版本目录│ │ └── model.py # Python模型逻辑│ └── config.pbtxt # 配置文件└── fc_model_pt/ # 原有PyTorch模型├── 1/自定义模型代码。
2025-12-15 21:50:24
1312
原创 大语言模型推理极致优化:TensorRT-LLM高性能推理实践指南
TensorRT-LLM 是 NVIDIA 推出的 LLM 推理优化框架,通过 Python API 定义模型,并利用最新优化技术将模型转换为高效的。对比项原始模型TensorRT-LLM(INT8量化)提升显存峰值较高降低 43.8%显著推理时延较长降低 61.1%显著吞吐量较低提高明显(具体数据见 benchmark)显著TensorRT-LLM 通过量化、连续批处理、注意力优化、图重写等关键技术,显著提升了 LLM 推理效率。
2025-12-15 21:03:54
882
原创 NVIDIA NIM 推理微服务介绍
NIM 是 **GPU 加速的推理微服务套件**,核心架构为“预优化容器 + 标准化接口 + 多环境适配”容器化封装:每个 NIM 对应一个 Docker 容器,内置模型文件 + 推理引擎(TensorRT-LLM/VLLM/SGLang) + 运行时依赖,支持 Llama 3.1、GPT-4o 等主流模型;标准化 API:提供与 OpenAI 兼容的等接口,同时支持 NVIDIA 扩展功能(如工具调用、多 LoRA 加载);GPU 优化层。
2025-12-15 20:11:33
1547
原创 NVIDIA NIM 开发并部署 AI Agent(智能体)实战
NIM 是GPU 加速的推理微服务套件,核心架构为“预优化容器 + 标准化接口 + 多环境适配”容器化封装:每个 NIM 对应一个 Docker 容器,内置模型文件 + 推理引擎(TensorRT-LLM/VLLM/SGLang) + 运行时依赖,支持 Llama 3.1、GPT-4o 等主流模型;标准化 API:提供与 OpenAI 兼容的等接口,同时支持 NVIDIA 扩展功能(如工具调用、多 LoRA 加载);GPU 优化层:基于 NVIDIA CUDA/Triton 推理服务器,实现。
2025-12-15 19:45:50
1632
原创 NVIDIA多模态AI能力全景分析:高效生态系统、训练优化与落地实践
通过Scale-Then-Compress实现架构级效率通过DeltaLoss+FP8实现训练级效率通过NIM+蓝图实现部署级效率底层:芯片到框架的全栈优化中层:开源模型与训练方案上层:行业解决方案与部署平台实际价值主张:企业级就绪:从研究到生产的平滑过渡成本可控:数据效率、训练效率、部署效率三重优化场景适配:工业、医疗、媒体等多领域验证未来安全:持续演进的技术路线与生态支持NVIDIA通过VILA模型家族高效训练体系NIM部署平台和行业蓝图。
2025-12-15 19:19:04
1281
原创 将NeMo模型转换为Triton兼容格式
核心转换逻辑:NeMo模型先通过工具转为TRT-LLM引擎(这是Triton兼容的核心格式),需指定LoRA权重、精度、并行数等关键参数;Triton适配关键:按Triton要求的目录结构(模型名/版本号/)存放文件,并编写配置文件,定义输入输出、GPU实例、推理参数;易用性优化:可选构建“预处理+推理+后处理”的集成模型,让Triton直接支持文本输入/输出,无需手动处理token转换。
2025-12-14 13:39:11
990
原创 NVIDIA NeMo训练一个具备推理能力的LLM
48小时内完成推理模型的训练单张GPU即可实现(建议H100或A100)显著提升模型的推理能力灵活控制推理模式的开启/关闭关键成功因素精选高质量训练数据恰当的课程学习策略合理的LoRA配置合适的超参数设置现在您可以开始训练自己的推理模型了!
2025-12-14 13:37:13
847
原创 Triton推理服务器部署微调后的模型及测试
保存为triton_adapter.py"""计算对数似然(用于选择题评分)"""raise NotImplementedError("可根据需求实现,MMLU/GPQA主要用generate_until")"""生成回复直到停止符(适配基准测试)"""# 调用Triton生成回复"""封装Triton调用逻辑"""data = {],else:return ""@property@property@property# 注册自定义模型Triton部署核心。
2025-12-14 13:33:45
965
原创 使用NeMo框架微调Llama 3.1 8B Instruct推理模型
数据准备核心:通过NeMo Curator筛选chat/math子集,严格过滤语言/长度,应用Llama 3.1官方聊天模板,按“推理类型+长度”的课程学习策略排序,保证数据质量和训练效率;训练核心:基于NeMo框架配置LoRA(rank=64),通过梯度累积实现256的总批量大小,训练2000步,采用bf16混合精度降低显存占用,同时保存完整模型和仅LoRA权重;评估核心:将模型转换为Triton兼容格式部署,通过lm-eval。
2025-12-14 13:30:56
833
原创 NVIDIA Llama Nemotro 推理模型构建企业级 AI 智能体
参考:https://developer.nvidia.cn/blog/build-enterprise-ai-agents-with-advanced-open-nvidia-llama-nemotron-reasoning-models/领域进入了一个新的竞争阶段,为企业构建下一代自主、智能的AI解决方案提供了一个强大而务实的基础选项。的模型,使企业能够构建能处理复杂、开放式任务的智能体系统,从而提升生产力和运营效率。该系列的核心目标是解决企业级 AI 智能体对。该模型的发布,标志着开源大模型在。
2025-12-14 13:17:57
709
原创 NVIDIA NeMo Agent应用场景和创建智能体实践
新员工Alex不清楚公司的着装规范、如何查询工资单细节以及今年的带薪休假(PTO)余额。: “Alex 问:‘我下周有个客户会议,着装有什么要求?另外,我想看看我上个月的工资明细,还有今年我还有多少天PTO?:通过 NVIDIA NeMo Agent Toolkit,开发者无需从头构建复杂的智能体逻辑和调度系统。它旨在成为一个“粘合剂”层,让开发者能够统一地组合、管理和部署基于不同框架构建的AI智能体与工具。:构建一个智能体,让Alex只需用自然语言提问一次,即可获得所有相关信息。的步骤和内部运作流程。
2025-12-14 13:04:00
1142
原创 由AI驱动的3D机器人感知与地图构建技术栈
NVIDIA如何构建一个。其核心目标是让机器人具备在复杂、未知环境中进行所必需的“空间智能”。为了帮助您快速掌握并将其付诸实践,以下是对该技术栈的解读、应用指南与关键总结。
2025-12-14 12:55:34
680
网站压力测试webct
2010-08-31
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅