- 博客(333)
- 收藏
- 关注
原创 MindSpore开发之路(十六):训练可视化:使用MindInsight洞察模型行为
可视化是现代深度学习开发中不可或缺的一环。MindInsight为MindSpore用户提供了一个功能强大且易于使用的解决方案,将复杂的训练过程以直观的图表形式呈现出来。MindInsight的重要性:它能帮助我们深入洞察模型行为,从而高效地进行调试和优化。MindInsight的核心使用流程:通过在代码中添加回调来记录数据,然后通过命令启动Web服务来查看数据。MindInsight的主要功能:包括计算图、标量曲线、参数分布等多种可视化视图。
2026-01-31 16:54:43
701
原创 昇腾AI创新大赛-昇思模型开发挑战赛(S1赛季)-MultiModal赛道铜奖方案
本文档详细记录了针对 Qwen2-VL 和 janus_pro 模型的关键性能优化点,并附带了相应的核心代码实现。
2026-01-31 16:43:29
1059
原创 昇腾平台MindSpore模型训练优化心得体会
MindSpore作为昇腾AI生态的核心深度学习框架,凭借自动微分、动静结合、端边云全场景部署等特性,成为昇腾平台上模型开发的首选工具。在实际模型训练过程中,开发者常面临训练速度慢、显存占用高、资源利用率低等问题。本文结合MindSpore框架特性与昇腾硬件优势,从数据预处理、网络结构优化、训练策略调整、显存优化四个核心维度,分享模型训练的优化思路与实战方法,助力开发者在昇腾平台上高效完成模型训练任务。
2026-01-31 16:41:24
1020
原创 MindSpore全场景协同的AI框架核心技术与生态实践
MindSpore以“端-边-云”全场景统一为核心定位,通过创新的四层架构设计与关键技术特性,破解了传统AI框架在开发效率、性能优化、场景适配等方面的痛点,实现了“易开发、高效执行、全场景部署”的核心目标。其动静统一的编程体验、精准的自动微分、透明的分布式并行与全场景协同能力,让AI技术从算法研究到产业落地的链路更加顺畅,为千行万业的数字化转型提供了强大的技术支撑。
2026-01-31 16:14:47
630
原创 MindSpore框架的核心技术要点与实战建议
开发者应优先掌握其动静态图切换、函数式梯度计算及昇腾专属优化(如图算融合与混合精度),从而在复杂项目中平衡开发效率与性能需求。- 静态图模式:通过图编译优化(如算子融合、内存复用)大幅提升性能,尤其适合昇腾(Ascend)硬件。3. 数据下沉(Data Sink):减少Host-Device数据拷贝,提升大规模训练吞吐量。- 梯度累积与AllReduce切分:通过分割梯度同步阶段,隐藏通信耗时,优化多机训练效率。- 动态图模式:适合调试,支持实时打印中间结果,类似PyTorch的即时执行方式。
2026-01-31 15:53:47
330
原创 从入门到落地:MindSpore实战指南与经验总结
import cv2学习心法:循序渐进,实战为王。按“环境搭建→核心流程→项目落地→优化”推进。MindSpore核心价值:简化开发、全场景适配。希望本文助力开发者快速掌握、落地项目。
2026-01-31 15:46:56
701
原创 mindspore.numpy.unique() 不支持 0 shape tensor
硬件环境(Ascend/GPU/CPU): Ascend/GPU/CPUMindSpore版本: 2.0.0执行模式(PyNative/ Graph): PyNative模式Python版本: 3.9.15操作系统平台: Linux 18.04。
2025-09-09 15:54:25
515
原创 Ascend print数据落盘使用
mindspore的Print算子有两种模式,一种是直接打屏,还有一种是数据落盘,保存到二进制文件中默认打印在屏幕上。也可以保存在文件中,通过context设置参数。一旦设置,输出将保存在指定文件中。通过函数可以重新加载数据。而且print_file_path只在Ascend上设置生效。
2025-09-09 14:56:56
207
原创 Construct内报错和定位解决
硬件环境(Ascend/GPU/CPU): CPUMindSpore版本: 1.9执行模式: 静态图Python版本: 3.7.5操作系统平台: linux。
2025-09-09 14:54:34
304
原创 GRAPH_MODE下运行ms_tensor = mint.ones_like(input_tensor, dtype=dtype)报错The pointer[device_address] is n
使用Graph模式需要设置ms.set_context(mode=ms.GRAPH_MODE),使用Cell类并且在construct函数中编写执行代码,此时construct函数的代码将会被编译成静态计算图。原测试代码如果要测试mint.ones_like在图模式下,就需要定义在网络中,这样的话就是图模式下运行该算子。测试代码虽然设置了图模式,但是并没有定义网络,所以相关算子还是运行在pynative模式下。但是即使代码写成如此,也不应该报错。应该是内部实现有问题,导致静态切换动态的时候出问题了。
2025-09-09 14:51:56
267
原创 MindSpore报RuntimeError:Primitive ScatterAdd's bprop not defined
1、找到报错的用户代码行:;2、 根据日志报错信息中的关键字,缩小分析问题的范围:;3、根据该报错信息,可在MindSpore社区提问或提问题单,转由开发人员定位问题根因,并找到解决方案。
2025-09-09 14:47:39
642
原创 MindSpore报错RuntimeError: Thread ID 140706176251712 Unexpected error.
1.可根据报错信息的提示进行问题定位,此案例为CPU核数问题,可在官网教程与开源的MindSpore文档中搜寻设置CPU核数的方法。2.目前MindSpore提供了一种自动数据调优的工具——Dataset AutoTune,用于在训练过程中根据环境资源的情况自动调整数据处理管道的并行度,此过程中会自动检测硬件中CPU的核数进行自适应配置。3.MindSpore中config模块能够设置或获取数据处理的全局配置参数。
2025-09-09 14:44:30
411
原创 【MindSpore报错解决地图】常见报错问题和解决方案(持续更新)
1.1 MindSpore数据集加载-调试小工具 py-spy1.2 【MindData】如何将自有数据高效的生成MindRecord格式数据集,并且防止爆内存1.3 【MindSpore Dataset】在使用Dataset处理数据过程中内存占用高,怎么优化?1.4 如何处理数据集加载多进程(multiprocessing)错误1.5 MindRecord-Windows下中文路径问题Unexpected error. Failed to open file1.6 MindRecord数据集格式-Wind
2025-02-26 11:14:15
1512
原创 MindSpore报错ImportError cannot import name “build dataset loader‘ from ‘mindformers.dataset. dataload
报错表示无法加载build_dataset_loader函数。从报错信息给定的位置查找发现__init__.py文件中没有添加这个函数。只需在__init__.py文件中添加build_dataset_loader函数即可。硬件环境(Ascend/GPU/CPU): Ascend。执行模式(PyNative/ Graph): 不限。MindSpore版本: 2.1。
2024-05-22 03:16:18
548
1
原创 MindSpore开启profile,使用并行策略报错ValueError: When dıstrıbuted loads are slıced we1ghts, sınk mode must be
硬件环境(Ascend/GPU/CPU): Ascend/GPU/CPU。分析配置文件可知,此时开启了profile功能,当前不支持两者同时使用。执行模式(PyNative/ Graph): 不限。MindSpore版本: 2.1。不同时使用这两个功能。
2024-05-22 03:15:12
338
原创 Ascend上构建MindSpore报has no member named ‘update output desc dpse‘ ;did you mean ‘update_output_desc_d
需要将对应CANN包的latest/opp/built-in/op_proto/inc/experiment_ops.h文件复制并覆盖mindspore目录下的graphengine/910b/third_party/fwkacllib/inc/ops/experiment_ops.h,不需要清缓存,直接重新执行构建命令即可。硬件环境(Ascend/GPU/CPU): Ascend。执行模式(PyNative/ Graph): 不限。MindSpore和CANN包版本不匹配。
2024-05-22 03:14:12
474
原创 MindSpore和tbe版本不匹配问题及解决
执行完上面命令后,屏幕错误信息中显示类似"CPU"和"tbe"字眼。可以通过执行如下命令自检MindSpore和tbe版本是否匹配。大多数是因为当前虚拟环境的te版本和MindSpore、CANN包不匹配。尝试卸载相关whl包,重装对应CANN路径下的whl包。
2024-05-22 03:12:49
567
原创 MindSpore开启MS_DISABLE_REF_MODE导致报错The device address type is wrong:type name in address:CPU,type nam
分析发现是开启“MS_DISABLE_REF_MODE”环境变量所导致。硬件环境(Ascend/GPU/CPU): Ascend。执行模式(PyNative/ Graph): 不限。unset此环境变量后即可正常跑通。MindSpore版本: 2.2。
2024-05-22 03:11:56
581
1
原创 MindSpore模型权重功能无法保存更新后的权重
根据上述信息发现最终保存的模型权重还是和初始化权重一样,表示并没有保存到训练之后的权重。升级版本到MindSpore 2.2之后,模型保存可以正常工作。硬件环境(Ascend/GPU/CPU): Ascend。执行模式(PyNative/ Graph): 不限。MindSpore版本: 2.1.1。
2024-05-22 03:10:52
314
原创 MindSpore在yaml文件的callbacks中配置SummaryMonitor后,开启summary功能失效
的base_trainer.py文件中阴影部分的代码会导致SummaryMonitor失效,所以需要将其注释掉。最好的方法是将mindformers更新到最新版本。硬件环境(Ascend/GPU/CPU): Ascend。执行模式(PyNative/ Graph): 不限。MindSpore版本: 2.1。
2024-05-22 03:09:41
245
原创 MindSpore开启summary报错ValueError: not enough values to unpack (expected 4, got 0)
硬件环境(Ascend/GPU/CPU): Ascend。解决办法是把上面报错提示中的“_, _, _”去掉。执行模式(PyNative/ Graph): 不限。MindSpore版本: 2.1.1。应该和两机网络通信有关。
2024-05-22 03:08:55
369
原创 MindSpore开启profiler功能报错IndexError:list index out of range
原因是Ascend环境启动profiler需要配置一些环境命令。硬件环境(Ascend/GPU/CPU): Ascend。执行模式(PyNative/ Graph): 不限。MindSpore版本: 2.1。
2024-05-22 03:07:49
304
原创 MindSpore保存模型提示:need to checkwhether you is batch size and so on in the ‘net‘ and ‘parameter dict‘ a
2) 设置export MS_ENABLE_REF_MODE=1,上述代码则不需要注释。注意:有些环境中设置MS_ENABLE_REF_MODE=1可能会报错,可能是CANN版本等原因,这需要在适合的环境中使用。保存模型需要使用到callback.py中的_save_ckpt()功能,但是在使用Ascend上使用时,会走进如下代码的第一个if判断代码部分,从而导致报错。硬件环境(Ascend/GPU/CPU): Ascend。1) 注释掉上面if判断的代码,问题可以解决。MindSpore版本: 2.1。
2024-05-22 03:07:02
294
原创 MindSpore2.2.10使用Flash attention特性报错AttributeError: module ‘mindspore.nn‘has no attribute ‘FlashAt
低版本MindSpore不支持flash attention(如MindSpore2.0beta、MindSpore2.1),需要升级高版本才能支持这个特性。硬件环境(Ascend/GPU/CPU): Ascend。执行模式(PyNative/ Graph): 不限。MindSpore版本: 2.1。
2024-05-22 03:05:42
407
原创 报错:调用MindSpore内部函数时的语法错误
硬件环境(Ascend/GPU/CPU): Ascend/GPU/CPUMindSpore版本: 不限执行模式(动态图):不限Python版本: Python=3.7.5操作系统平台: 不限。
2024-05-22 03:03:05
353
原创 MindSpore论坛报错活动第四期---在静态图模式下使用try语法报错RuntimeError: Unsupported statement ‘Try‘.
硬件环境(Ascend/GPU/CPU): CPUMindSpore版本: 1.9.0执行模式(动态图/静态图): 静态图Python版本: 3.7操作系统平台:linux。
2024-05-22 03:01:52
479
原创 MindSpoer报错:The strategy is ((6, 4), (4,6)), the value of stategy must be the power of 2, but get 6.
该报错原因就是当前并行不支持非2的幂次方的并行切分,6*4显然不是2的幂次方。因此我们只需要根据实际情况选择16,32或其它符合要求的并行度即可。我们把算子的shard切分度改为符合要求的即可。3. rank_table_8p.json参考如下。将下述的bash脚本另存为 run.sh。将下述的脚本命名为run.py。
2024-05-22 03:00:11
304
原创 MindSpore并行模式配置报错解决:Parallel mode dose not support **
如下图所示,明显的报错信息说明当前的并行模式中不支持。的可选项有如下几种,正确配置即可。在合理配置并行模式之后(如配置成。将以下python脚本保存为。将以下shell脚本保存为。将下面json文件保存为。
2024-05-22 02:58:33
551
原创 叮!请查收昇思人工智能框架峰会2024邀请函
昇思MindSpore人工智能框架峰会,北京国家会议中心,2024年3月21闭门会议,3月22日主论坛和开发者嘉年华,人工智能产学研用专家齐聚,诚邀各位开发者参加~~
2024-03-12 15:31:20
717
转载 RWKV解读:在Transformer的时代的新RNN
最开始自然语言使用RNN来建模,它是一种基于循环层的特征提取网络结构,循环层可以将前一个时间步的隐藏状态传递到下一个时间步,从而实现对自然语言的建模。RNN由于存在循环结构(如下图所示),每个时间步的计算都要依赖上一个时间步的隐藏状态,导致计算复杂度较高,而且容易出现梯度消失或梯度爆炸的问题,导致训练效率低下,因此RNN网络扩展性不好。RNN结构Transformer在2017年由谷歌提出,是一种基于自注意力机制的特征提取网络结构,主要用于自然语言处理领域。
2023-09-15 14:40:38
2408
原创 张量运算失败报错RuntimeError:Malloc for kernel output failed, Memory isn’t enough
硬件环境(Ascend/GPU/CPU): GPUMindSpore版本: mindspore=1.10.1执行模式(PyNative/ Graph):PyNativePython版本: Python=3.7.5操作系统平台: linux。
2023-08-18 09:44:55
492
原创 在NPU上的切片操作x=x[:,::-1,:,:]不生效的分析解决
硬件环境(Ascend/GPU/CPU): Ascend&GPUMindSpore版本: 1.9.0执行模式(PyNative/ Graph): 不限Python版本: 3.7.5操作系统平台:Linux。
2023-08-18 09:44:11
299
原创 MindSpore:TopK算子返回的全零的Tensor的解决
硬件环境(Ascend/GPU/CPU): GPUMindSpore版本: mindspore=1.10.1执行模式(PyNative/ Graph):GraphPython版本: Python=3.9.16操作系统平台: Linux Ubuntu 20.04。
2023-08-18 09:43:30
325
原创 MindSpore报refer to Ascend Error Message错误
该报错是mindspore拦截CANN的报错抛出的通用性报错。通常来说可能是环境配置有误,参数有误,但不排除底层架构实现/算子级别的实现导致的。获取报错码后,可在CANN手册里查询对应原因以及解决方案。若查询不到,或者解决方案未能解决,可联系华为工程师寻求算子层面的帮助。有先尝试使用配套兼容版本。如果更换版本后不能解决或者特殊原因不能更换版本,需要提取底层CANN包日志。在配置完成后,重新启动训练,复现问题。并获取日志中的ERROR信息,提取其中报错码和报错信息进行进一步定位和解决。
2023-08-18 09:42:33
923
原创 MindFormers大模型套件llama 训练&微调&评估&推理 一步到位奶爸级教程
基于MindFormers大模型套件中llama readme跑通的训练、评估、微调、推理整理的文档,适合初次接触大模型套件的童鞋入坑学习。
2023-08-18 09:41:35
971
原创 损失函数小结MindSporeAI
mindspore.nn.SampledSoftmaxLoss(num_sampled, num_classes, num_true=1, sampled_values=None, remove_accidental_hits=True, seed=0, reduction="none"):在类别数较多的情况下,加速训练。mindspore.nn.FocalLoss(weight=None, gamma=2.0, reduction="mean"):通常用于目标检测,解决了类别不平衡问题。
2023-08-18 09:34:46
234
原创 对比pytorch的优化器实现及使用方法MindSporeAI
MindSpore和pytorch都支持参数分组且使用方法相似,在使用时都是给优化器传入一个字典的列表,每个字典对应一个参数组,其中key为参数名,value为对应的设置值。Mindspore中的混合精度场景下,如果使用FixedLossScaleManager进行溢出检测,且drop_overflow_update为False时,优化器需设置loss_scale的值,且loss_scale值与FixedLossScaleManager的相同,详细使用方法可以参考优化器的混合精度配置。
2023-08-18 09:34:03
1242
原创 经典论文复现(Adam),基于MindSpore2.0
在本文中,我们将展示如何使用 MindSpore 2.0 构建自己的 Adam 优化器。Adam 是一种广泛使用的优化器,它结合了 Momentum 和 RMSProp 的优点,通常在许多深度学习任务中表现良好。
2023-08-18 09:33:05
430
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅