自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(147)
  • 收藏
  • 关注

原创 json检测网站 很合理

JSONLint - The JSON Validator

2026-07-09 00:43:28 180

原创 Gige协议-TransferControMode相关—MVS

第二部分:开始连拍设置。

2026-06-23 13:58:36 179

原创 多相机协同拍照原理底层刨析

前台work把图像推入批次队列BatchBuffer::pushFrame(...),再将 图像放入FrameStack 内存队列,之后Batchreader去读FrameStack内部的图像,FrameSaver::writeFrame写入硬盘。下面是Work中继续拍照,其中为防止相机在UDP->ACK的过程中接收控制性指令,导致命令被T掉,进行入队式处理。该章针对支持Gige协议的相机进行多相机控制分析,例如海康,康耐视等相机的高速拍照控制。注册回调,打开流,设置软件触发。下发指令:电脑端->相机端。

2026-04-08 10:01:07 444

原创 Gige多相机高速拍照模式补充

开启软件触发前台调用m_nErrCode = m_cam->SetSoftwareTrigger(true, m_szErrMsg);在程序中调用m_nErrCode = m_cam->ExecuteSoftwareTrigger(m_szErrMsg);区别在于 ExecuteSoftwareTrigger流启动后,无需触发,可以根据指令触发拍照。之后相机会自己拍照,我们只需要读他拍照后反馈的流就可以。

2026-03-18 09:40:17 467

原创 Libtorchd封装

【代码】Libtorchd封装。

2026-01-27 09:13:44 57

原创 Libtorch文本嵌入版动态库封装

以上就是Libtorech的动态库封装需要的相关配置。

2026-01-27 09:11:53 57

原创 Vlm-ClipQT环境搭建C++

打印 GPU 基本信息(名称、计算能力、显存),方便调试环境问题(比如确认是否识别到正确的 GPU)。调用预处理函数,生成 GPU 张量,并打印张量信息(方便调试尺寸 / 设备是否正确)。需要注意:C++版本,pytorch版本。同时需要转换模型格式,脚本如下。适配我版本的下载地址。

2026-01-23 09:25:56 570

原创 Vlm-ClipJsonl代码

【代码】Vlm-ClipJsonl代码。

2026-01-22 11:10:52 54

原创 Vlm-Clip的python部署流程及逻辑代码

推理时要同时加载:CLIP 预训练权重 + text_adapter.pth + image_adapter_20.pth,三者结合才能实现缺陷检测 + 热力图。

2026-01-22 10:52:24 75

原创 Vlm-Clip的数据集代码

【代码】Vlm-Clip的数据集代码。

2026-01-22 10:38:29 62

原创 VLM-多模态概述-Clip

5. 提取训练 / 测试集特征。

2026-01-19 17:47:10 638

原创 Vlm-RT-DETR网络模型部署推理

5. 核心推理函数(redetr_infer_demo)2. 图像格式适配函数(format_yolov8)

2026-01-19 09:41:37 629

原创 Vlm-Swim Transformer迁移学习

加载 OpenVINO 并编译 ONNX 格式的 Swin Tiny 模型(针对 ant/bee 二分类);对输入图像执行符合 Swin 模型要求的预处理(尺寸、归一化、维度调整);运行模型推理,取 Top-1 预测结果;将预测类别标注在原图上并显示。import cv2# 加载ONNX格式的SWIN Tiny模型# 获取输入和输出层# 定义图像预处理函数# 打开图像# 调整图像大小为224x224# 转换为RGB格式# 归一化图像# 调整维度为[1, C, H, W]

2026-01-17 00:18:53 857

原创 Vlm-Diet模型与知识蒸馏

1. 核心背景与解决的问题。

2026-01-16 23:50:55 546

原创 Vlm-vit模型

图像单词"(image tokens)二、ViT 完整架构详解P×P。

2026-01-16 23:27:49 555

原创 Vlm-GPT代码

代码的核心是:加载预训练的 GPT2 模型和分词器,对多个英文提示文本(prompt)进行标准化编码,利用 GPT2 模型生成符合提示语义的续写文本,最后将原始提示和生成的文本一一对应打印出来。

2026-01-16 16:45:52 563 2

原创 Vlm-GPT简介

GPT。

2026-01-16 15:00:12 159

原创 Vlm-TensorRT重新部署

C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.6\lib\x64没有要在官网下可以查一下。之后就是补充一点zlibwapi是通用的,用之前的版本就可以位置在。CUDA的更新 之前的tensorrt部署也要更新。

2026-01-16 14:26:19 71

原创 Pycharm修改环境

第一个是当前的系统的环境,记住路径。

2026-01-13 23:04:01 213

原创 Vlm-BERT环境搭建和代码演示

Transformer代码库(此Transformer非之前的,而是包含了当前四大主流的模块)四个领域我的电脑已经配置好了环境,cuda_11.6,torch 1.13.0+cu116,transformers 4.56.1但是我要的是torch2.5.0 transformers4.51.3nvidia-smi官网下载有点慢,总是最后200就下不去了,改成用迅雷下安装。

2026-01-13 22:52:42 479

原创 Vlm-BERT简介

这个图的核心是体现 BERT 的 “预训练 - 微调” 优势:先在海量无标注数据上练出 “通用语言理解能力”(预训练),再用少量标注数据适配各种具体任务(微调)—— 这也是 BERT 能让 NLP 任务精度暴涨的关键逻辑。

2026-01-13 14:05:08 648

原创 Vlm-Trasformer结构

2026-01-13 13:50:27 57

原创 Vlm-Transformer_demo

【代码】Vlm-Transformer_demo。

2026-01-13 01:19:06 66

原创 VLM-Transformer网络六大元素

Encoder 的核心任务是:把 “源序列(输入文本)” 编码成包含完整上下文信息的语义向量,供 Decoder 使用。

2026-01-12 00:21:54 577

原创 VLM-交叉注意力机制

每一个分词看成一个taken,每一个taken转化为embedding vector。每一个分词wq,wk,wv来获取每个分词的权重。(区别于自注意力的 Q/K/V 都来自同一序列)交叉注意力的应用场景。

2026-01-12 00:15:06 197

原创 VLM-掩码注意力机制

这个权重矩阵是用随机初始化的 Q/K/V 权重计算出来的(没经过训练),它的数值和 “真实语义关联” 毫无关系 —— 只是随机矩阵运算的结果,不是模型 “理解句子” 后得到的合理权重。2. 词嵌入:把离散索引转成连续的语义向量。

2026-01-11 23:41:15 506

原创 SLM-多头注意力机制

(多个 “头”),从不同角度捕捉词与词的语义关联,最后把结果拼接,得到更全面的上下文信息。一、单头自注意力的局限(为什么需要多头?

2026-01-11 23:08:06 351

原创 VLM-单头自注意力机制核心逻辑

自注意力的本质是「通过词与词之间的相似度(Q-K 匹配),给每个词分配不同权重,再对价值向量(V)加权求和」,最终让每个词都融合全局信息。Q 是 [6,2],K.T 是 [2,6](K 转置后,列数 = 原 K 的行数 = 6),矩阵乘法结果是 [6,6] 的。查询(Q)就像是在问 “我要找什么信息”,键(K)是提供信息的 “标签”,值(V)就是实际的信息内容。的列对应 “所有词”,V 的行也对应 “所有词”,矩阵乘法的本质是:对于输出的第。(嵌入后的句子),输出为每个词的上下文向量。做 Softmax(

2026-01-11 22:29:05 607

原创 VLM—Transformer

这个公式承担了自注意力机制中最关键的权重分配任务,分为两步执行,每一步都有明确的数学和工程意义。举例例如 C E F是三个四条信息的输入端 3x4 那么。Wq要求假设是输出2的那就结果是3x2的。Wk要求假设是输出2的那就结果是3x2的。Wq要求假设是输出4的那就结果是3x4的。,对于整句话每一个单词对不同维度的影响。但是3就是输入的词条。

2026-01-09 11:41:30 515

原创 CNNMNIST

通常指out_channels的输出通道数是16,就意味着要有16个卷积和。

2026-01-09 09:53:33 707

原创 VLM_一维离散卷积与二维离散卷积(还是复习感觉还行)

然后再乘以 1/9(本质上就是 “邻域和 ÷ 9”),得到的结果就是滤波后该位置的像素值。是 OpenCV 封装好的。首先是简单的一维离散卷积。均值滤波的计算就是:先把。

2026-01-08 17:36:03 203

原创 MNIST

【代码】MNIST。

2026-01-08 15:41:22 269

原创 pycharm操作

建立隔离的文件夹。

2026-01-08 14:58:38 407

原创 VLM多模态大数据开发—感知器与MLP基础(我感觉还行主要复习)

感知器:最简单的人工神经网络单元,模拟生物神经元的工作方式,是所有复杂神经网络(包括 VLM、YOLO)的底层基础。把感知器想象成一个「做决策的大脑细胞」:MLP基础: MLP(也叫「全连接神经网络」)是把多个感知器分层组合起来的网络,突破了单个感知器的线性限制,能处理非线性问题,是 VLM、YOLO 等复杂模型的核心基础模块。首先是前向传播完整的神经网络训练闭环 其中解析一下解析函数 Sigmoid中答:如果没有偏置 b1​,当所有输

2026-01-08 13:57:38 477

原创 漆面检测-取图映射逻辑思想

第一步:定义 “相机取图区域” 与 “车身物理区域” 的对应关系,

2026-01-06 17:50:09 870

原创 漆面检测-数据库连接通信逻辑

/当调用 m_dbWriterThread->finished(),m_dbWriter->deleteLater。//当调用 m_dbWriterThread->start(),m_dbWriter->start。// - 线程结束 -> 释放写入器(避免内存泄漏)// - 线程启动 -> 写入器开始工作。// 1) 触发拍照。3.写入器分配至子线程。

2026-01-04 13:05:25 350

原创 服务器传输推送

终端主动拉取:服务器整理好数据后仅存储,终端按需 / 定时发起请求(如 “获取批次 XXX 的问题图像”),服务器响应并传输数据。

2025-12-09 09:46:33 609

原创 色差检测实验测试

通过多光谱,灰度相机根据不同波长实现对不通汽车漆面的色差检测。之后就可以将后续的图像与这个阈值进行对比来测试是否为合格漆面。对于向量进行两方面处理用于进行阈值的设定。那么就可以组成一个(1,6)的向量。对于一张图RGB来说,具有六个值。

2025-11-28 17:57:26 197

原创 数据库建立库-Qt

数据库连接后进行建立库的操作库的建立需要预先声明库的库名和选择字符集以及库内的排序顺序代码部分逻辑。

2025-09-12 14:25:35 487

原创 数据库的连接_qt

句柄,后续可通过该句柄执行 SQL 语句(如。数据库的连接形式可以通过cmd查看。2.初始化 MySQL 连接句柄。1.获取 UI 输入的连接参数。3. 建立数据库连接。连接成功:返回有效的。

2025-09-12 11:11:52 397

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除