- 博客(8)
- 收藏
- 关注
原创 AI安全:大模型“提示词注入攻击”(Prompt Injection):分类、原理与技术解析
提示词注入攻击正从简单的文字话术博弈向跨模态语义劫持、底层数学攻击(梯度优化)以及 AIGC 对抗篡改演进。在未来的安全攻防战中,传统的单一文本过滤将全面失效,现有公司正在积极构建包含多模态鲁棒对齐、输入层对抗净化等多层级的防御体系。
2026-03-05 15:12:57
2826
原创 基于梯度优化的对抗攻击算法 | PGD极简代码
本文展示了一个极简的PGD(投影梯度下降)对抗攻击实现,可将狗图片误识别为猫。代码使用ResNet18模型,通过20次迭代优化,在保持扰动幅度(eps=8/255)的同时,将目标类别强制设为埃及猫(类别285)。关键改动是将梯度下降方向调整为减小目标类别损失,最终成功使模型将狗误判为猫。代码包含完整的图片下载、预处理、攻击执行和结果验证流程,可直接复制使用,适合快速理解PGD攻击的底层逻辑。
2026-03-04 15:34:12
62
原创 AI安全:大模型全链路安全审核机制讲解
输出侧合规校验,是核心大模型生成回复后、内容最终展示给用户前的最后一道安全闸门,也是全链路防护的兜底环节。其核心目标是解决输入侧拦截与模型对齐未能覆盖的残留风险,包括模型幻觉生成的有害内容、多轮复杂对话中防线失守导致的违规输出、训练数据泄露、个人隐私与商业秘密泄露等问题,同时确保最终输出内容完全符合监管合规要求,避免有害内容触达用户。大模型的安全合规,从来不是单点技术的突破,而是全链路、体系化的工程化建设。
2026-03-04 15:18:13
527
原创 AI安全:视觉提示词注入攻击代码/实战教学| 针对Hugging Face开源大模型Stable Diffusion Model
本文提出一种针对图生图大模型的视觉提示词注入攻击方法。通过PGD对抗攻击算法对输入图像进行像素级微调,使生成的违规图像能够绕过开源模型的NSFW安全检测机制。研究基于Stable Diffusion inpainting模型,在输入图像中注入微小扰动,同时配合敏感文本提示词,成功误导模型输出违规内容。实验验证了该方法能有效突破Hugging Face官方Safety Checker的安全防线,为视觉提示词安全研究提供了新思路。完整代码已开源,包含环境配置、核心攻击流程及对抗样本生成等关键实现。
2026-03-02 13:43:40
4242
原创 Python记录 tensor求梯度时为None的错误
发现是requires_grad位置不对,应该是tensor放入cuda后,requires_grad默认改成False。今天学习对抗样本,需要对tensor求梯度,
2022-07-15 11:11:10
1298
原创 Python shutil copy(),copyfile() 和 copytree()函数
最近在处理数据集,经常会使用shutil相关函数处理文件,今天专门观察了下copy(),copyfile() 和 copytree() 之间的差别。移动具体文件source只能是文件,destination可以是文件,也可以是目录,目录必须已经创建,所以在复制文件前需要shutil.copyfile()移动具体文件source和destination都只能是文件把某一文件夹(source)内所有文件复制到另外一个文件夹中(destination),或者说移动的是文件夹和它的内容,目标路径相当于给文
2022-07-13 10:58:05
12889
1
原创 Python 多分类求MAP ValueError: multiclass format is not supported
训练多分类模型时,为了观察训练的效果,使用average_precision_score()函数求准确度MAP时报错:raise ValueError(“{0} format is not supported”.format(y_type))ValueError: multiclass format is not supported原因分析:之前的二分类任务使用该函数没有问题,想到这次的任务是多分类,该函数应该只可以处理二分类问题,也可以把多分类转变成二分类问题,输出的标签正确与否设置为0和1。..
2022-07-11 17:42:54
2178
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅