自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(8)
  • 收藏
  • 关注

原创 AI安全:大模型“提示词注入攻击”(Prompt Injection):分类、原理与技术解析

提示词注入攻击正从简单的文字话术博弈向跨模态语义劫持、底层数学攻击(梯度优化)以及 AIGC 对抗篡改演进。在未来的安全攻防战中,传统的单一文本过滤将全面失效,现有公司正在积极构建包含多模态鲁棒对齐、输入层对抗净化等多层级的防御体系。

2026-03-05 15:12:57 2826

原创 基于梯度优化的对抗攻击算法 | PGD极简代码

本文展示了一个极简的PGD(投影梯度下降)对抗攻击实现,可将狗图片误识别为猫。代码使用ResNet18模型,通过20次迭代优化,在保持扰动幅度(eps=8/255)的同时,将目标类别强制设为埃及猫(类别285)。关键改动是将梯度下降方向调整为减小目标类别损失,最终成功使模型将狗误判为猫。代码包含完整的图片下载、预处理、攻击执行和结果验证流程,可直接复制使用,适合快速理解PGD攻击的底层逻辑。

2026-03-04 15:34:12 62

原创 AI安全:大模型全链路安全审核机制讲解

输出侧合规校验,是核心大模型生成回复后、内容最终展示给用户前的最后一道安全闸门,也是全链路防护的兜底环节。其核心目标是解决输入侧拦截与模型对齐未能覆盖的残留风险,包括模型幻觉生成的有害内容、多轮复杂对话中防线失守导致的违规输出、训练数据泄露、个人隐私与商业秘密泄露等问题,同时确保最终输出内容完全符合监管合规要求,避免有害内容触达用户。大模型的安全合规,从来不是单点技术的突破,而是全链路、体系化的工程化建设。

2026-03-04 15:18:13 527

原创 AI安全:视觉提示词注入攻击代码/实战教学| 针对Hugging Face开源大模型Stable Diffusion Model

本文提出一种针对图生图大模型的视觉提示词注入攻击方法。通过PGD对抗攻击算法对输入图像进行像素级微调,使生成的违规图像能够绕过开源模型的NSFW安全检测机制。研究基于Stable Diffusion inpainting模型,在输入图像中注入微小扰动,同时配合敏感文本提示词,成功误导模型输出违规内容。实验验证了该方法能有效突破Hugging Face官方Safety Checker的安全防线,为视觉提示词安全研究提供了新思路。完整代码已开源,包含环境配置、核心攻击流程及对抗样本生成等关键实现。

2026-03-02 13:43:40 4242

原创 Python记录 tensor求梯度时为None的错误

发现是requires_grad位置不对,应该是tensor放入cuda后,requires_grad默认改成False。今天学习对抗样本,需要对tensor求梯度,

2022-07-15 11:11:10 1298

原创 Python shutil copy(),copyfile() 和 copytree()函数

最近在处理数据集,经常会使用shutil相关函数处理文件,今天专门观察了下copy(),copyfile() 和 copytree() 之间的差别。移动具体文件source只能是文件,destination可以是文件,也可以是目录,目录必须已经创建,所以在复制文件前需要shutil.copyfile()移动具体文件source和destination都只能是文件把某一文件夹(source)内所有文件复制到另外一个文件夹中(destination),或者说移动的是文件夹和它的内容,目标路径相当于给文

2022-07-13 10:58:05 12889 1

原创 Python 多分类求MAP ValueError: multiclass format is not supported

训练多分类模型时,为了观察训练的效果,使用average_precision_score()函数求准确度MAP时报错:raise ValueError(“{0} format is not supported”.format(y_type))ValueError: multiclass format is not supported原因分析:之前的二分类任务使用该函数没有问题,想到这次的任务是多分类,该函数应该只可以处理二分类问题,也可以把多分类转变成二分类问题,输出的标签正确与否设置为0和1。..

2022-07-11 17:42:54 2178

原创 分类网络搭建思路

记录一下搭建模型的思路

2022-07-11 15:24:40 221

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除