- 博客(212)
- 收藏
- 关注
原创 【Datawhale学习笔记】使用AMD GPU15分钟部署&运行Gemma4大模型
等效 batch size 为 16.使用 adamw_torch,避免 AMD ROCm 下 bitsandbytes 优化器兼容问题bf16=BF16,fp16=FP16,seed=SEED,
2026-06-13 19:06:22
269
原创 【Datawhale学习笔记】使用AMD GPU15分钟部署&运行Gemma4大模型
拉敲了一堆东西,那么我们到底这一节做了什么事情了,总结为以下四步:第一步:先检查显卡能不能用。第二步:把模型下载到本地。第三步:用 vLLM 把模型启动成一个服务。第四步:另开一个终端连上去对话。
2026-06-11 10:08:14
266
原创 【Datawhale学习笔记】模型量化实战
LLM Compressor 6 是一个易于使用的库,目标是优化大语言模型以便使用 vLLM 进行部署。它能够实现高达 5 倍的推理速度提升,并显著降低成本。作为一个综合性的工具包,我们在前面已经通过 QLoRA、PEFT、RLHF 等技术,体验了在单机单卡甚至消费级显卡上完成大模型微调的可能性。但如果目标从“微调一个 7B 模型”升级为从零预训练、全量微调甚至训练万亿参数模型,仅靠量化与 LoRA 显然还不够,此时就需要引入微软开源的 PyTorch 分布式训练与推理优化库 DeepSpeed。
2026-01-28 11:53:28
647
原创 【Datawhale学习笔记】RLHF微调技术及实践
在 RLHF 框架中,将 Token 生成过程建模为 “片段的(Episodic)马尔可夫决策过程(MDP)” 是连接 NLP 与 RL 的核心桥梁。这个“片段”特指“从接收用户提示到生成完整输出”的单次生成任务。状态 (State,sts_tst):当前已生成的上下文,包括用户提示xxx和已生成的 Token 序列yty_{<t}yt。即stxy1yt−1stxy1...yt−1。动作 (Action,ata_tat。
2026-01-25 10:07:14
1085
原创 【Datawhale学习笔记】参数高效微调
定义 LoRA 配置r=16,# 应用配置,获得 PEFT 模型输出信息# 推荐操作:关闭缓存可提高训练效率# 定义训练参数fp16=True, # 启用混合精度训练# 数据整理器,用于处理批量数据# 实例化 Trainer# 开始训练关键的训练参数per_device_train_batch_size & gradient_accumulation_steps:这两个参数共同决定了有效批量大小(effective batch size)。
2026-01-22 11:40:53
1021
原创 【Datawhale学习笔记】深入大模型架构
Llama2 遵循了 GPT 系列开创的 Decoder-Only 架构。这意味着它完全由 Transformer 解码器层堆叠而成,天然适用于自回归的文本生成任务。
2026-01-18 15:48:19
1023
原创 【Datawhale学习笔记】预训练模型实战
模型在推理阶段,不需要更新任何权重(即不需要微调),仅凭输入提示中给出的少量示例(Demonstrations),就能理解并完成新任务。
2026-01-17 15:11:01
658
原创 【Datawhale学习笔记】注意力机制及Transform代码实践
在解码器生成每一个词元时,不再依赖一个固定的上下文向量,而是允许它“回头看”一遍完整的输入序列,并根据当前解码的需求,自主地为输入序列的每个部分分配不同的注意力权重,然后基于这些权重将输入信息加权求和,生成一个动态的、专属当前时间步的上下文向量。
2026-01-17 15:08:12
716
原创 【Datawhale学习笔记】seq2seq代码实现
RNN 和 LSTM 处理序列数据。这些模型在三类任务中表现出色多对一(Many-to-One):将整个序列信息压缩成一个特征向量,用于文本分类、情感分析等任务。多对多(Many-to-Many, Aligned):为输入序列的每一个词元(Token)都生成一个对应的输出,如词性标注、命名实体识别等。一对多(One-to-Many):从一个固定的输入(如一张图片、一个类别标签)生成一个可变长度的序列,例如图像描述生成、音乐生成等。
2026-01-17 15:07:06
964
原创 【Datawhale学习笔记】动手学RNN及LSTM
httanhUxtWht−1其中,ht是当前时刻的隐藏状态,xt是当前输入,ht−1是上一时刻的隐藏状态,U和W是共享的权重矩阵。
2026-01-17 15:06:33
664
原创 【Datawhale学习笔记】基于Gensim的词向量实战
Gensim (Generate Similar) 是一个功能强大且高效的Python库,专门用于处理原始的、非结构化的纯文本文档。它内置了多种主流的词向量和主题模型算法,如 Word2Vec、TF-IDF、LSA、LDA 等。
2026-01-17 15:05:59
1158
原创 【Datawhale学习笔记】Word2Vec
为了学习到这个查询表,Word2Vec设计了一个巧妙的"伪任务"——根据上下文预测中心词(或反之),并在这个过程中,将词向量查询表作为模型参数进行训练和优化。不会使用它的输出,真正需要和保留的,只有作为其内部参数的那个 词向量查询表。神经网络结构本身只是获取词向量的一种方式,并非模型的最终目的。尽管Word2Vec是里程碑式的算法,但存在一个根本性的局限性——它产生的是静态词向量。由于One-Hot向量只有一个位置是1,这个矩阵乘法的结果,等效于直接从矩阵。, 矩阵的每一行就是对应单词的稠密向量。
2026-01-17 15:05:26
984
原创 【Datawhale学习笔记】词向量表示
机器学习和深度学习模型,无论结构多么复杂,其处理的输入都必须是数值形式——具体来说,是由数字组成的特征向量或矩阵。因此,在分词之后,必须将这些词元转换为模型可以"消化"的数字形式。这个过程称为词向量表示 (Word Representation)。通常特指通过神经网络学习得到的稠密向量表示,是词向量表示的一个重要子集。
2026-01-17 15:04:54
902
原创 【Datawhale学习笔记】NLP初级分词技术
是把连续的文本序列切分成具有独立语义的基本单元(即“词”或“词元”)。在传统的 NLP 处理流程中,分词是后续所有任务的基础。其处理方式通常是将分词作为一个独立且“硬性”的预处理步骤,这就导致一个微小的分词错误就可能造成语义信息的丢失。这种错误会在后续的处理链条中被不断放大,产生“差之毫厘,谬以千里”的级联效应(Cascading Effect)。例如,在传统的搜索引擎里,一旦“南京市长江大桥”被错分为,系统就很难再从这三个错误的词块中还原出原始的、正确的地理位置含义,导致搜索结果完全跑偏。
2026-01-17 15:04:13
845
原创 【Datawhale学习笔记】NLP 概述
自然语言处理(Natural Language Processing, NLP) 是人工智能(AI)领域的重要组成部分,它赋予计算机 理解、解释、生成人类语言 的能力,并基于这些能力对文本数据进行决策 1。NLP 旨在弥合人类交流的模糊性、情境性和复杂性与计算机精确、形式化的指令系统之间的鸿沟。例如,计算机需要理解"我今天很蓝",这里的"蓝"并非颜色,而是情绪的表达——这对于机器来说是个挑战。
2026-01-17 15:03:19
941
原创 【CANN训练营】基于CANN8.0.0.alpha003学习Ascend C上Add算子基于自定义算子工程的算子开发
"ND"],"type": ["fp16"},"ND"],"type": ["fp16"],"ND"],"type": ["fp16"使用msopgen生成工程项目文件-i:算子原型定义文件add_custom.json所在路径。代表算子在AI Core上执行,<soc_version>*为昇腾AI处理器的型号。<soc_version>可以通过命令查看昇腾AI处理器的型号AddCustom├── build.sh // 编译入口脚本。
2026-01-06 10:34:28
789
原创 【CANN训练营】基于CANN8.0.0.alpha003学习Ascend C上Add算子基于Kernel直调工程的算子开发
核函数实现文件:add_custom.cpp调用算子的应用程序:main.cpp。输入数据和真值数据生成脚本文件:gen_data.py。验证输出数据和真值数据是否一致的验证脚本:verify_result.py。编译cpu侧或npu侧运行的算子的编译工程文件:CMakeLists.txt。编译运行算子的脚本:run.sh。
2026-01-05 09:14:36
904
原创 【CANN训练营】一文了解上手毕昇编译器简单操作
毕昇编译器是一款专为昇腾AI处理器设计的编译器,支持异构编程扩展,可以将用户编写的昇腾算子代码编译成二进制可执行文件和动态库等形式。毕昇编译器的可执行程序命名为bisheng,支持x86、aarch64等主机系统,并且原生支持设备侧AI Core架构指令集编译。通过使用毕昇编译器,用户可以更加高效地进行针对昇腾AI处理器的编程和开发工作。
2026-01-04 13:23:04
504
原创 【CANN训练营】在CANN8.5上体验Hello World开启Ascend C学习
Ascend C是CANN针对算子开发场景推出的编程语言,原生支持C和C++标准规范,兼具开发效率和运行性能。基于Ascend C编写的算子程序,通过编译器编译和运行时调度,运行在昇腾AI处理器上。使用Ascend C,开发者可以基于昇腾AI硬件,高效的实现自定义的创新算法。您可以通过了解更详细的内容。Ascend C提供多层级API,满足多维场景算子开发诉求。
2026-01-04 10:14:18
579
原创 【CANN训练营】使用华为云开发者空间体验Sample仓实例体验
参数解释:–soc:${soc_version}表示NPU型号。Atlas A2 训练系列产品/Atlas A2 推理系列产品使用"ascend910b"(默认),Atlas A3 训练系列产品/Atlas A3 推理系列产品使用"ascend910_93",Ascend 950PR/Ascend 950DT产品使用"ascend950"。
2026-01-04 08:02:46
499
原创 【Datawhale组队学习-动手学大模型应用全栈开发】大模型微调实战
MAX_LENGTH = 384 # Llama分词器会将一个中文字切分为多个token,因此需要放开一些最大长度,保证数据的完整性def process_func(example) : MAX_LENGTH = 384 # Llama分词器会将一个中文字切分为多个token,因此需要放开一些最大长度,保证数据的完整性 instruction = tokenizer(f" {
2025-12-18 16:58:57
539
原创 【Datawhale组队学习-动手学大模型应用全栈开发】大模型开发基础知识
为了对人类语言的内在规律进行建模,研究者们提出使用语言模型(language model)来准确预测词序列中 下一个词 或者 缺失的词 的概率。
2025-12-12 16:13:37
659
原创 【MindSpore社区活动】在对抗中增强网络实践
MNIST手写数字数据集是NIST数据集的子集,共有70000张手写数字图片,包含60000张训练样本和10000张测试样本。数字图片为二进制文件,图片大小为28*28,单通道。图片已经预先进行了尺寸归一化和中心化处理。本案例将使用MNIST手写数字数据集来训练一个生成式对抗网络,使用该网络模拟生成手写数字图片。
2025-12-04 16:05:30
319
原创 【2024CANN训练营第二季】Kernel直调算子开发
算子分析:分析算子的数学表达式,输入、输出以及计算逻辑的实现,明确需要调用的Ascend C接口核函数定义:定义Ascend C算子入口函数根据编程范式实现算子类:完成核函数的内部实现编写算子的应用程序:完成调用核函数main.cpp代码其他脚本:数据生成脚本,数据比对脚本。
2024-10-21 12:03:23
1081
原创 【2024CANN训练营第二季】使用华为云体验AscendC_Sample仓算子运行
进入文件夹执行编译算子部署算子aclnn调用算子成功运行的截图进入文件夹执行CPU调试执行NPU调试。
2024-10-21 08:27:16
1370
原创 【2024CANN训练营第二季】尝试启智社区OpenI体验AscendC算子运行
进入文件夹算子工程编译./build.sh部署算子包调用执行算子。
2024-10-18 18:52:02
781
原创 【2024CANN训练营第二季】Ascend C API接口
Ascend C算子采用标准C++语法和一组类库API进行编程,开发者根据自己的需求选择合适的API。Ascend C API的操作数据类型:Tensor类型类库API高阶API基础API普通数据搬运2级接口:适用于连续数据搬运普通数据搬运0级接口:适用于连续和不连续搬运。
2024-10-18 13:21:59
1120
原创 【2024CANN训练营第二季】Ascend介绍
使用Ascend C编程语言开发的算子运行的AI Core上,AI Core是昇腾AI处理器中的计算核心,一个AI处理器内部有多个AI Core,AI Core中包含计算单元、存储单元、搬运单元等核心组件。负责在Gloabl Memory和Local Memory之间搬运数据,包含搬运单元MTE2(Memory Transfer Engine:数据搬入单元),MTE3(数据搬出单元)AI Core是昇腾AI处理器的计算核心,采用华为自研的达芬奇架构,通常也被叫做DaVinci Core。
2024-10-18 10:25:26
814
原创 【2024CANN训练营第二季】Ascend C编程范式
Ascend C编程范式把算子内部的处理程序,分成多个流水任务(Stage),以张量(Tensor)为数据载体,以队列(Queue)进行任务之间的通信与同步,以内存管理模块(Pipe)管理任务间的通信内存。
2024-10-18 10:16:56
1094
原创 【2024CANN训练营第二季】Ascend C算子编程快速入门
核函数是Ascend C算子设备侧的入口。Ascend C允许用户使用核函数这种C/C++函数的语法扩展来管理设备侧的运行代码,用户在核函数中实现算子逻辑的编写,例如自定义算子类及其成员函数以实现该算子的所有功能。核函数是主机侧和设备侧连接的桥梁。核函数是直接在设备侧执行的代码,在核函数中,需要为在一个核上执行的代码规定要进行的数据访问和计算操作,SPMD编程模型允许核函数调用时,多个核并行地执行同一个计算任务。
2024-10-18 10:14:23
1001
原创 【2024CANN训练营第二季】算子及Ascend C概述
Ascend C算子是CANN针对算子开发场景推出的编程语言,通过多层接口抽象、自动并行计算、孪生调试等关键技术,极大提高算子开发效率,助力AI开发者低成本完成算子开发和模型调优部署。使用Ascend C编程语言开发的算子称之为Ascend C算子。C/C++原始编程,最大化匹配用户的开发习惯编程模型屏蔽硬件差异,编程范式提高开发效率多层级API封装,从简单到灵活,兼顾易用与高效孪生调试,CPU侧模拟NPU侧的行为,可优化在CPU侧调试。
2024-10-17 14:12:31
1189
原创 【昇思学习打卡营打卡-第二十八天】MindNLP ChatGLM-6B StreamChat
本案例基于MindNLP和ChatGLM-6B实现一个聊天应用。可以修改下列参数和prompt体验模型。下载权重大约需要10分钟。
2024-07-16 19:25:36
365
原创 【昇思学习打卡营打卡-第二十七天】文本解码原理-以MindNLP为例
Beam search通过在每个时间步保留最可能的 num_beams 个词,并从中最终选择出概率最高的序列来降低丢失潜在的高概率序列的风险。按照贪心搜索输出序列(“The”,“nice”,“woman”) 的条件概率为:0.5 x 0.4 = 0.2。设置no_repeat_ngram_size=2 ,任意 2-gram 不会出现两次。缺点: 错过了隐藏在低概率词后面的高概率词,如:dog=0.5, has=0.9。增加高概率单词的似然并降低低概率单词的似然。将出现过的候选词的概率设置为 0。
2024-07-15 19:22:11
420
原创 【昇思学习打卡营打卡-第二十六天】基于MindSpore通过GPT实现情感分类
【代码】【昇思学习打卡营打卡-第二十六天】基于MindSpore通过GPT实现情感分类。
2024-07-14 17:12:03
351
原创 【昇思25天学习打卡营打卡指南-第二十五天】基于MindSpore的GPT2文本摘要
本次实验使用的是nlpcc2017摘要数据,内容为新闻正文及其摘要,总计50000个样本。因GPT2无中文的tokenizer,我们使用BertTokenizer替代。数据处理,将向量数据变为中文数据。
2024-07-13 13:01:05
416
原创 【昇思25天学习打卡营打卡指南-第二十四天】基于 MindSpore 实现 BERT 对话情绪识别
自己输入推理数据,展示模型的泛化能力。predict("家人们咱就是说一整个无语住了 绝绝子叠buff")
2024-07-12 14:01:33
1005
原创 【昇思25天学习打卡营打卡指南-第二十三天】Pix2Pix实现图像转换
Pix2Pix是基于条件生成对抗网络(cGAN, Condition Generative Adversarial Networks )实现的一种深度学习图像转换模型,该模型是由Phillip Isola等作者在2017年CVPR上提出的,可以实现语义/标签到真实图片、灰度图到彩色图、航空图到地图、白天到黑夜、线稿图到实物图的转换。Pix2Pix是将cGAN应用于有监督的图像到图像翻译的经典之作,其包括两个模型:生成器和判别器。传统上,尽管此类任务的目标都是相同的从像素预测像素,但每项都是用单独的专用机器来
2024-07-11 11:54:09
979
原创 【昇思25天学习打卡营打卡指南-第二十二天】GAN图像生成
MNIST手写数字数据集是NIST数据集的子集,共有70000张手写数字图片,包含60000张训练样本和10000张测试样本,数字图片为二进制文件,图片大小为28*28,单通道。图片已经预先进行了尺寸归一化和中心化处理。本案例将使用MNIST手写数字数据集来训练一个生成式对抗网络,使用该网络模拟生成手写数字图片。
2024-07-10 13:02:45
743
原创 【昇思25天学习打卡营打卡指南-第二十一天】Diffusion扩散模型
Diffusion扩散模型本文基于Hugging Face:The Annotated Diffusion Model一文翻译迁移而来,同时参考了由浅入深了解Diffusion Model一文。关于扩散模型(Diffusion Models)有很多种理解,本文的介绍是基于denoising diffusion probabilistic model (DDPM),DDPM已经在(无)条件图像/音频/视频生成领域取得了较多显著的成果,现有的比较受欢迎的的例子包括由OpenAI主导的GLIDE和DALL-E
2024-07-09 11:36:57
1316
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅