- 博客(1587)
- 收藏
- 关注
原创 MindSpore Transformers LLM 数据预处理:支持多源数据集混合
本文基于MindSpore-Transformers实现多源数据集混合预处理,解决格式不一、权重配比、分布式训练等问题。通过适配器统一字段为prompt-response格式,支持加权采样与全局打乱,结合Tokenizer完成SFT分词,并在昇腾NPU上实现分布式分片与缓存加速。框架可灵活接入指令、对话、领域数据,提升微调数据质量,保障训练稳定性与效率。
2026-09-29 14:29:18
12
原创 昇思 MindSpore 大模型:数据变换预处理
本文基于昇思MindSpore与MindFormers,构建适配昇腾NPU的大模型指令微调(SFT)数据预处理流水线。通过离线清洗与在线Token化分离,实现文本清洗、模板封装、动态截断、损失掩码(Label Masking)等关键变换,保障训练稳定性与收敛性。结合多进程并行与MindRecord格式优化,提升数据加载效率。代码完整可复用,支持多轮对话与多语种场景,为大模型高效微调提供工业级解决方案。
2026-09-29 14:24:42
83
原创 昇思 MindSpore 计算机视觉:最大学习率 max_lr 实践
本文基于昇腾NPU与MindSpore,针对图像分类任务系统阐述了max_lr在学习率调度中的核心作用。通过实现OneCycleLR与余弦退火策略,结合LRRangeTest自动搜索最优max_lr,构建了从环境初始化、超参搜索到端到端训练的完整流程。实验表明,合理设置max_lr可显著提升收敛速度与模型精度,尤其适用于ResNet50等大模型。文中总结了模型规模、batch_size缩放及微调场景下的调优经验,为计算机视觉任务提供高效、可复用的自动化训练方案。
2026-09-29 14:21:06
62
原创 昇思 MindSpore 大模型单卡微调推理:自助搭建流程
本文基于昇思MindSpore与昇腾NPU单卡(310P/910B),实现Decoder-only大模型的轻量化LoRA微调与本地推理全流程。通过环境初始化、JSON指令数据集构建、LoRA低秩适配微调、权重合并及推理,完成从训练到部署的闭环。采用图模式、梯度检查点与小批量策略优化显存,支持快速原型验证与行业模型二次开发,具备高可移植性与工程实用性。
2026-09-29 14:17:29
59
原创 MindSpore Transformers 大模型训练迁移:获取 GPT Layer 本地加速
本文基于MindSpore2.4与昇腾910B环境,提出通过get_gpt_layer_local_spec实现GPT大模型从PyTorch向MindSpore分布式训练的高效迁移。该接口精准划分各Rank的层范围,支持层粒度并行与权重分片加载,解决跨框架权重错位、内存溢出及初始化不一致问题。结合本地分片模型构建与映射加载策略,实现仅加载本卡所需权重,显著降低内存开销,打通PyTorch→MindSpore迁移链路,为大模型在昇腾集群的训练迁移提供标准范式。
2026-09-29 14:12:47
189
原创 MindSpore Transformers LLM 推理:MLP 模块实现与推理优化
本文基于MindSpore实现工业级SwiGLU-MLP模块,完成独立推理、Decoder集成、MindIR导出及昇腾Ascend 910B优化。通过静态图编译、图内核融合、自动混合精度与权重拼接等技术,显著降低矩阵乘算子访存开销,提升推理效率。代码可直接部署于昇腾集群,支持离线推理与分布式扩展,为大模型高效推理提供完整解决方案。
2026-09-29 11:24:14
129
原创 MindSpore Transformers 训练在线监控:config.monitor_config 部署实践
MindSporeTransformers(MindFormers)通过monitor_config实现大模型训练的非侵入式实时监控,支持超长时预训练与分布式微调。该配置模块可统一采集loss、学习率、梯度、显存/昇腾NPU内存等指标,自动输出至TensorBoard、JSON日志或控制台,并支持异常告警与自定义回调扩展。适用于单机及昇腾910B集群场景,提供完整YAML配置、启动代码、可视化对接与离线分析方案,显著提升训练可观测性与工程化水平。
2026-09-29 11:18:46
285
原创 昇思 MindSpore 大模型:属性过滤
本文基于MindSpore 2.3,系统阐述了大模型训练、微调与推理中的属性过滤技术。通过网络Cell自定义属性、Parameter标签、数据集样本标记及Checkpoint字典筛选,实现分层冻结、按需加载权重、清洗无效样本等场景。代码涵盖参数过滤、权重条件加载、SFT数据清洗三大核心应用,并提供统一工具类封装与工程优化建议,显著提升微调效率,降低显存占用,增强可维护性,适用于LLaMA、Qwen等主流大模型的轻量化与领域适配训练。
2026-09-29 11:04:49
128
原创 昇腾 AI 集群服务器架构:多维混合并行
本文基于昇腾910B集群与MindSpore框架,构建多维混合并行训练底座,融合数据(DP)、张量(TP)、流水线(PP)、专家(EP)并行,解决显存不足、通信瓶颈与算力利用率低问题。通过HCCL跨机通信与RoCEv2网络,结合msrun启动脚本与HCCL调试工具,实现高效分布式训练。代码提供并行配置、初始化接口及拓扑优化策略,强调TP单机内部署、合理匹配WorldSize等实践规范,确保千亿级大模型训练的稳定性与性能最优。
2026-09-29 11:01:05
274
原创 面向动态张量计算的字节码虚拟机实时编译
本文提出MindSporeDVM,一种基于字节码虚拟机的实时编译方案,应对大语言模型中动态张量计算的挑战。通过将算子编码为tile级字节码并在NPU侧解释执行,DVM避免了传统编译的重开销,实现微秒级编译、11.77倍的LayerNorm加速及Qwen3-14B微调性能提升1.07~1.21倍,编译时间最高提速5个数量级。该方案已开源,显著提升了动态场景下的服务效率与响应能力。
2026-09-29 10:56:08
179
原创 基于 MindSpore 与鲲鹏硬件的语音识别系统案例
本项目基于国产化软硬件栈(鲲鹏920、昇腾910B、openEuler、MindSpore),构建全链路信创语音识别平台,采用Conformer+CTC架构,实现客服录音批量转写与300路并发流式识别,支持热词优化、小样本微调与INT8量化,达CER≤6.5%、RTF<0.45。通过MindSpore原生适配,训练效率提升显著,推理性能稳定,三年TCO降低40%以上,实现从训练到部署的自主可控闭环,具备高扩展性与信创合规优势。
2026-09-23 11:29:55
27
原创 昇思 MindSpore 大模型:基于 mindspore.dataset 的数据变换与预处理全方案
mindspore.dataset是专为大模型设计的高性能数据处理引擎,支持文本、图像、多模态数据的全流程预处理。其基于C++后端加速、多线程并行与流水线调度,实现数据加载、清洗、分词、编码、截断、填充、掩码生成等操作的高效并行执行,显著提升训练吞吐。通过链式变换、分布式分片、数据下沉等机制,有效解决“算力空转”问题,适配昇腾AI芯片与鲲鹏服务器。本文结合完整代码实战,系统讲解LLM与多模态预处理流程,涵盖性能调优与工程化落地最佳实践,助力大模型训练高效稳定运行。
2026-09-23 11:25:31
86
原创 MindSpore Transformers 大模型训练迁移:transformer_config 配置解析、迁移方案
本文系统阐述了将主流开源Transformer大模型(如LLaMA、BERT、GPT、Qwen)从Hugging Face/PyTorch迁移至昇思MindSpore Transformers的全流程方案。核心围绕transformer_config展开,解析其架构设计、跨框架参数映射规则及配置分层机制,重点说明基础拓扑、模块参数与硬件优化参数的对齐方法。结合LLaMA-2 7B迁移案例,提供从配置转换、模型初始化到训练启动的完整代码实现,并针对显存溢出、精度丢失等典型问题提出调优策略,涵盖重计算、混合精度
2026-09-23 11:21:05
107
原创 昇思 MindSpore 大模型训练:评估体系与性能优化实践
本文基于昇思MindSpore与昇腾NPU,构建了覆盖模型收敛、任务精度、训练性能与硬件指标的全周期评估体系,实现Loss、PPL、单步耗时等核心指标的实时监控与早停控制。结合昇腾硬件特性,提出分层优化策略:通过混合精度、重计算降低显存占用;利用图模式融合、数据下沉提升算力利用率;采用分布式通信优化与梯度累积支持多机训练。配套提供可落地的工程代码,形成“评估—诊断—优化”闭环,有效解决大模型训练中的过拟合、显存溢出、算力瓶颈等问题,助力国产化AI研发高效迭代。
2026-09-23 11:15:07
71
原创 MindSpore Transformers LLM 预训练模型:高效训练
MindSpore Transformers为昇腾NPU提供原生大模型预训练方案,通过静态图编译、自动并行、混合精度与重计算技术,实现7B~13B模型高效训练。支持单机多卡及多机扩展,显存降低60%以上,训练速度提升2~4倍。结合异步数据流水线与优化配置,显著提升吞吐与稳定性,无需复杂改造即可开箱即用,全面释放昇腾硬件性能。
2026-09-23 11:11:25
77
原创 MindSpore 大模型预训练:数据质量过滤方案
本文系统阐述了基于昇腾硬件与MindSpore框架的大模型预训练数据质量过滤体系。针对噪声、重复、低质等常见问题,提出规则粗过滤、统计特征过滤、相似度去重、模型打分四层递进式过滤架构,结合MindSpore的分布式数据流水线能力,实现TB/PB级语料高效清洗。通过完整代码示例与工程优化建议,构建端到端、可扩展、高可靠的过滤链路,从源头保障大模型训练数据质量,提升模型性能与安全性。
2026-09-23 11:09:00
64
原创 MindSpore Transformers 大模型训练迁移:Huggingface Tokenizer 适配与实战
本文介绍Huggingface Tokenizer在MindSpore平台的迁移方法,强调其核心价值在于复用原生词汇表与分词逻辑,实现编码结果完全一致。通过AutoTokenizer一键加载Huggingface格式文件,支持主流LLM(如Qwen、Llama、ChatGLM等)无缝迁移,全流程兼容分词、截断、填充规则,并验证与Huggingface分词一致性。关键点包括:指定return_tensors="ms"、启用trust_remote_code=True、不重新训练词汇表。最终
2026-09-23 11:01:25
39
原创 MindSpore Transformers 训练在线监控:配置监控参数、实现与实战
MindSpore通过Callback+日志收集+MindInsight可视化构建了大模型训练的在线监控体系,支持每步采集loss、lr、梯度、权重及NPU资源使用情况,自动保存最优模型并异常中断。MindSpore Transformers封装开箱即用组件,结合昇腾NPU适配,实现训练过程实时监控与可视化分析,显著提升训练稳定性与效率。
2026-09-23 10:58:14
168
原创 昇腾平台 RAG SDK 检索前优化技术原理与实战:索引结构优化
昇腾RAG SDK通过智能语义分块、多表征索引、分层架构与NPU原生加速,实现检索精度提升30%、构建速度提升8倍、存储成本降低60%。其四层优化架构深度融合算法与硬件,支持百万级文档毫秒级检索,显著解决大模型幻觉、知识滞后等落地难题,为行业提供高效、低成本的知识增强方案。
2026-09-23 10:54:57
183
原创 MindSpore Transformers 大语言模型高效预训练与微调实战:分布式并行与显存优化
本文介绍MindSpore Transformers如何解决大语言模型(LLM)训练中的算力与显存瓶颈。通过自动并行、3D并行策略及混合精度、重计算等显存优化技术,实现千亿参数模型高效分布式训练。框架提供统一接口,支持预训练与微调无缝切换,并基于昇腾AI处理器实现单卡训练13B模型、8卡线性加速比达0.97,显著提升训练效率与稳定性。
2026-09-23 10:49:28
357
原创 MindSpore 大模型预训练文本数据清洗全流程
本文系统阐述了面向MindSpore大模型预训练的文本数据清洗关键流程,涵盖编码标准化、噪声过滤、语言识别、去重、质量评估与敏感内容屏蔽等核心环节。基于分层流水线架构,提出一套可扩展的工业级清洗方案,支持并行与分布式处理,最终输出适配MindSpore的MindRecord格式数据。实证表明,该流程可提升模型收敛速度50%、生成质量30%,有效保障训练效率与合规性,为大模型高质量预训练提供坚实数据基础。
2026-09-20 14:42:13
11
原创 昇腾计算软硬件体系之 MindSpore 应用使能架构
MindSpore应用使能架构作为昇腾全栈体系的核心枢纽,通过四层分层设计(应用接入、框架功能、昇腾适配、CANN抽象),实现从算法代码到昇腾NPU的高效部署。依托计算图下沉、算子分层适配、HCCL封装与多框架迁移能力,屏蔽硬件差异,支持云边端统一开发,显著降低适配成本,提升算力利用率,助力AI应用在视觉、大模型等场景快速国产化落地。
2026-09-20 14:39:50
79
原创 昇思大模型 msModelSlim 量化工具:降低模型加载时间
msModelSlim是昇思(MindSpore)推出的专为大模型设计的一站式轻量化工具,通过INT8/INT4量化、紧凑存储与mmap内存映射加载,实现模型体积缩小50%~75%,加载速度提升3~8倍,显存占用降低50%~75%,支持秒级启动。其核心优势在于低比特量化+硬件原生解析+预计算参数,显著优化冷启动、多模型调度、边缘部署等场景下的性能瓶颈,是昇腾生态大模型工程化落地的必备利器。
2026-09-20 14:36:11
75
原创 MindSpore Transformers 断点续训:修改模型分布式并行策略
MindSpore Transformers 提供大模型训练中断点续训与动态并行策略切换的原生支持,可实现从单卡到 TP/DP/PP 任意组合的灵活调整。通过自动权重切分/合并、优化器状态适配与策略热切换,无需重训或手动转换格式,保障训练连续性与精度一致。支持全系列主流模型,显著提升集群资源利用率与生产环境弹性调度能力。
2026-09-20 14:33:16
27
原创 MindSpore Transformers 训练在线监控:回调函数设计
本文基于MindSpore Transformers框架,设计并实现一套无侵入、轻量化的训练监控回调套件,涵盖实时loss与学习率追踪、梯度异常检测、NPU/CPU资源监控、可视化日志输出及自动止损功能。通过自定义Callback机制,实现大模型训练过程的全维度在线监控,显著提升调试效率与训练稳定性,适用于昇腾NPU/GPU环境,有效解决大模型训练“黑盒”问题,助力高效、安全、无人值守训练。
2026-09-20 14:30:32
131
原创 昇腾平台 RAG 实现:Advanced RAG 索引全流程优化
昇腾平台Advanced RAG通过索引前、后全链路优化,实现知识库高效落地。索引前优化提升文档质量,语义分块与去重保障向量准确性;索引构建依托昇腾NPU加速,结合HNSW索引与量化压缩,检索速度提升50%以上;索引后优化融合多路召回、重排序与上下文压缩,准确率提升30%,幻觉显著降低。全流程国产化部署,实现高精度、低延迟、低资源消耗的智能问答系统。
2026-09-20 14:27:34
157
原创 MindSpore Transformers LLM 预训练模型挑战:超大规模训练实现方案
本文介绍基于MindSpore Transformers的超大规模LLM预训练技术方案,针对显存瓶颈、分布式调度、数据吞吐等五大挑战,提出全自动并行、ZeRO-3分片、FlashAttention、异构内存等核心技术,实现百亿至千亿参数模型在昇腾NPU集群上的高效稳定训练。通过标准化配置文件与可运行脚本,支持Llama、Qwen等主流架构,单卡显存降至20GB以内,32卡集群达15,000 tokens/sec吞吐,性能较PyTorch提升40%,具备断点续训、故障自愈能力,为国产化大模型训练提供开箱即用的
2026-09-20 14:24:57
155
原创 MindSpore 大模型预训练:提升任务解决能力
MindSpore依托昇腾NPU,通过因果语言建模、高质量多域语料、长上下文支持(FlashAttention/NTK-RoPE)、混合精度训练与分布式并行,高效完成7B~70B大模型预训练。结合SwiGLU激活、Pre-Norm结构等架构优化,显著提升模型的逻辑推理、知识记忆与任务泛化能力,实现从“语法通顺”到“能思考、会解题”的跃迁,为零样本、少样本任务提供强大基础。
2026-09-20 14:22:10
60
原创 昇思 MindSpore:tools 二进制工具
MindSpore tools是昇思框架自带的轻量级二进制工具集,无需Python环境,直接在openEuler+昇腾NPU上运行,支持模型转换、精度调试、性能剖析、离线推理、权重管理与加密等全流程操作。核心工具如converter_lite.bin、benchmark.bin、checkpoint.bin等基于C++实现,调用AscendCL/MindRT,性能比Python脚本高5~20倍,适用于生产环境自动化部署。其低开销、高性能、可脚本化特性,构成MLOps标准上线链路,是模型从训练到部署的关键桥梁
2026-09-20 14:19:36
355
原创 昇思 MindSpore 自动微分:Jacobian(雅克比)原理
本文系统讲解了雅克比矩阵在昇思MindSpore框架中的原理与实战应用。从雅克比矩阵定义出发,结合MindSpore的自动微分机制,详细阐述其在神经网络、科学计算等场景下的实现方法。通过基础、进阶与批量数据三类代码示例,展示了如何利用mindspore.jacobian高效计算向量函数梯度,并突出其在昇腾NPU上的硬件加速优势。文章强调了静态图优化、内存高效与端到端支持等核心特性,助力开发者掌握高阶导数计算能力,提升模型可解释性与算法性能。
2026-09-20 14:15:52
148
原创 昇思大模型 msModelSlim 量化工具:参数压缩原理
msModelSlim是华为昇思生态下专为大模型轻量化设计的一站式压缩工具,集成量化(INT4/INT8)、剪枝、蒸馏与参数压缩技术,可将7B/13B模型体积压缩4-8倍,显存降低60%-80%,推理速度提升2-5倍,完美适配昇腾NPU端侧部署。支持一键INT4压缩,无需修改模型结构,自动权重重排,精度无损,兼容LLaMA、Qwen等主流模型及昇腾910B/310P硬件,显著降低部署成本,助力大模型国产化落地。
2026-09-17 15:16:36
27
原创 MindSpore Transformers 断点续训:手动指定权重续训
MindSpore Transformers 提供灵活高效的断点续训能力,支持全参数与LoRA微调场景下手动指定ckpt权重恢复训练。通过精准加载模型、优化器状态及训练步数,实现训练中断后1分钟内快速续训,保障收敛一致性。核心配置仅需开启resume_training=True并指定权重路径,兼容多阶段、分布式训练,显著降低算力浪费,是大模型工业化训练的核心支撑。
2026-09-17 15:13:29
23
原创 MindSpore Transformers LLM 训练迁移:base_models 原理
MindSpore Transformers的base_models模块实现大语言模型训练迁移的标准化,通过统一模型架构、自动跨框架权重转换与轻量化微调(如LoRA),支持Llama、Qwen等主流模型高效迁移。其一体化训练推理能力、全参数及高效微调模式,显著降低算力成本95%,缩短收敛周期90%,助力大模型在金融、医疗等领域快速落地,是国产生态下LLM训练迁移的最优方案。
2026-09-17 15:11:07
23
原创 MindSpore Transformers 训练在线监控:TensorBoard 效果
MindSpore Transformers集成TensorBoard实现昇腾NPU上LLM训练的实时监控,无需代码改造即可可视化损失、学习率、精度、梯度、权重及计算图等关键指标。通过SummaryCollector自动采集,支持分布式多卡、低开销实时刷新,结合浏览器访问实现跨平台可观测性。适用于预训练、微调全流程,助力快速排错、优化超参与模型复现,是企业级高效训练的标准方案。
2026-09-17 15:02:53
40
原创 MindSpore Transformers:safetensors 高性能张量存储格式
safetensors是由Hugging Face推出的新型安全张量存储格式,取代传统不安全的bin/ckpt/pth文件。其核心优势包括:无代码执行风险、加载速度提升300%~1000%、支持内存映射与分片读取、跨框架通用。在MindSpore Transformers昇思生态中,safetensors实现原生支持,全面适配昇腾NPU,支持极速加载、零拷贝传输与大模型分片部署。从预训练加载、微调保存到推理部署,全流程推荐使用,已成为大模型安全高效分发的标准方案。
2026-09-17 14:56:17
119
原创 MindSpore Transformers LLM 预训练模型:微调后模型使用
MindSpore Transformers是昇思生态支持大语言模型的官方开发套件,全面兼容Qwen、LLaMA等主流模型,提供从微调到部署的全流程能力。微调后模型支持LoRA适配器(轻量、快速迭代)与合并后完整模型(生产部署),具备领域知识、指令遵循及昇腾NPU加速能力。通过统一接口实现增量推理、批量预测、MindIR导出,适用于金融、医疗等垂域场景,显著降低国产化大模型落地门槛,助力AI应用工业化。
2026-09-17 14:52:51
91
原创 昇思 MindSpore:script 驱动安装部署脚本
昇思MindSpore驱动部署脚本实现昇腾NPU环境下一键自动化安装,支持openEuler/Ubuntu、ARM64/x86_64及CANN多版本,自动检测系统环境、安装依赖、配置变量并验证可用性,全流程零人工干预。脚本具备高兼容性、错误回滚与日志追踪能力,将部署时间从30分钟缩短至3分钟,显著提升生产交付效率,是AI训练与推理场景中标准化、可复用的核心工具。
2026-09-17 14:48:47
150
原创 昇思大模型转换工具:基于 AscendIR 的单算子描述文件
昇思(MindSpore)大模型转换工具基于AscendIR统一中间表示,通过手写或生成JSON/INI格式的单算子描述文件,实现PyTorch、TensorFlow等框架模型向昇腾NPU可执行格式的高效转换。该技术解决了大模型中自定义算子不支持、计算图断裂、精度损失等问题,支持LLaMA、Qwen等主流大模型全图贯通部署,转换成功率提升至100%,精度损失低于0.5%,显著缩短适配时间,是昇腾生态实现多框架模型统一部署的核心能力。
2026-09-17 14:44:56
232
原创 昇思大模型 msModelSlim 量化工具:显存优化
msModelSlim是昇腾生态专为大模型设计的一站式量化压缩工具,支持INT4/INT8等多精度量化与混合策略,可将千亿级模型显存占用降低50%-75%,精度损失控制在1%以内。其核心优势包括逐通道量化、SmoothQuant激活优化、敏感层回退及离群值抑制,适配LLaMA2、Qwen3、DeepSeek等主流模型,显著提升推理效率与部署可行性,是昇腾NPU上大模型轻量化部署的核心利器。
2026-09-17 14:27:42
245
原创 昇腾 + PyTorch 环境构建:环境检查与依赖校验
在昇腾NPU上部署PyTorch环境需严格匹配CANN驱动、Python版本、系统库及昇腾适配包,任一组件异常均导致NPU不可用。建议遵循“检查→安装→验证”流程,使用一键检查脚本自动校验NPU状态、环境变量、PyTorch连通性与模型推理功能,确保环境稳定。常见问题如torchnpu缺失、环境未加载、版本不匹配等,可通过重装昇腾源包、source环境脚本、统一版本等快速修复。
2026-09-17 14:23:16
241
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅