- 博客(147)
- 收藏
- 关注
原创 多相机协同拍照原理底层刨析
前台work把图像推入批次队列BatchBuffer::pushFrame(...),再将 图像放入FrameStack 内存队列,之后Batchreader去读FrameStack内部的图像,FrameSaver::writeFrame写入硬盘。下面是Work中继续拍照,其中为防止相机在UDP->ACK的过程中接收控制性指令,导致命令被T掉,进行入队式处理。该章针对支持Gige协议的相机进行多相机控制分析,例如海康,康耐视等相机的高速拍照控制。注册回调,打开流,设置软件触发。下发指令:电脑端->相机端。
2026-04-08 10:01:07
444
原创 Gige多相机高速拍照模式补充
开启软件触发前台调用m_nErrCode = m_cam->SetSoftwareTrigger(true, m_szErrMsg);在程序中调用m_nErrCode = m_cam->ExecuteSoftwareTrigger(m_szErrMsg);区别在于 ExecuteSoftwareTrigger流启动后,无需触发,可以根据指令触发拍照。之后相机会自己拍照,我们只需要读他拍照后反馈的流就可以。
2026-03-18 09:40:17
467
原创 Vlm-ClipQT环境搭建C++
打印 GPU 基本信息(名称、计算能力、显存),方便调试环境问题(比如确认是否识别到正确的 GPU)。调用预处理函数,生成 GPU 张量,并打印张量信息(方便调试尺寸 / 设备是否正确)。需要注意:C++版本,pytorch版本。同时需要转换模型格式,脚本如下。适配我版本的下载地址。
2026-01-23 09:25:56
570
原创 Vlm-Clip的python部署流程及逻辑代码
推理时要同时加载:CLIP 预训练权重 + text_adapter.pth + image_adapter_20.pth,三者结合才能实现缺陷检测 + 热力图。
2026-01-22 10:52:24
75
原创 Vlm-RT-DETR网络模型部署推理
5. 核心推理函数(redetr_infer_demo)2. 图像格式适配函数(format_yolov8)
2026-01-19 09:41:37
629
原创 Vlm-Swim Transformer迁移学习
加载 OpenVINO 并编译 ONNX 格式的 Swin Tiny 模型(针对 ant/bee 二分类);对输入图像执行符合 Swin 模型要求的预处理(尺寸、归一化、维度调整);运行模型推理,取 Top-1 预测结果;将预测类别标注在原图上并显示。import cv2# 加载ONNX格式的SWIN Tiny模型# 获取输入和输出层# 定义图像预处理函数# 打开图像# 调整图像大小为224x224# 转换为RGB格式# 归一化图像# 调整维度为[1, C, H, W]
2026-01-17 00:18:53
857
原创 Vlm-GPT代码
代码的核心是:加载预训练的 GPT2 模型和分词器,对多个英文提示文本(prompt)进行标准化编码,利用 GPT2 模型生成符合提示语义的续写文本,最后将原始提示和生成的文本一一对应打印出来。
2026-01-16 16:45:52
563
2
原创 Vlm-TensorRT重新部署
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.6\lib\x64没有要在官网下可以查一下。之后就是补充一点zlibwapi是通用的,用之前的版本就可以位置在。CUDA的更新 之前的tensorrt部署也要更新。
2026-01-16 14:26:19
71
原创 Vlm-BERT环境搭建和代码演示
Transformer代码库(此Transformer非之前的,而是包含了当前四大主流的模块)四个领域我的电脑已经配置好了环境,cuda_11.6,torch 1.13.0+cu116,transformers 4.56.1但是我要的是torch2.5.0 transformers4.51.3nvidia-smi官网下载有点慢,总是最后200就下不去了,改成用迅雷下安装。
2026-01-13 22:52:42
479
原创 Vlm-BERT简介
这个图的核心是体现 BERT 的 “预训练 - 微调” 优势:先在海量无标注数据上练出 “通用语言理解能力”(预训练),再用少量标注数据适配各种具体任务(微调)—— 这也是 BERT 能让 NLP 任务精度暴涨的关键逻辑。
2026-01-13 14:05:08
648
原创 VLM-Transformer网络六大元素
Encoder 的核心任务是:把 “源序列(输入文本)” 编码成包含完整上下文信息的语义向量,供 Decoder 使用。
2026-01-12 00:21:54
577
原创 VLM-交叉注意力机制
每一个分词看成一个taken,每一个taken转化为embedding vector。每一个分词wq,wk,wv来获取每个分词的权重。(区别于自注意力的 Q/K/V 都来自同一序列)交叉注意力的应用场景。
2026-01-12 00:15:06
197
原创 VLM-掩码注意力机制
这个权重矩阵是用随机初始化的 Q/K/V 权重计算出来的(没经过训练),它的数值和 “真实语义关联” 毫无关系 —— 只是随机矩阵运算的结果,不是模型 “理解句子” 后得到的合理权重。2. 词嵌入:把离散索引转成连续的语义向量。
2026-01-11 23:41:15
506
原创 SLM-多头注意力机制
(多个 “头”),从不同角度捕捉词与词的语义关联,最后把结果拼接,得到更全面的上下文信息。一、单头自注意力的局限(为什么需要多头?
2026-01-11 23:08:06
351
原创 VLM-单头自注意力机制核心逻辑
自注意力的本质是「通过词与词之间的相似度(Q-K 匹配),给每个词分配不同权重,再对价值向量(V)加权求和」,最终让每个词都融合全局信息。Q 是 [6,2],K.T 是 [2,6](K 转置后,列数 = 原 K 的行数 = 6),矩阵乘法结果是 [6,6] 的。查询(Q)就像是在问 “我要找什么信息”,键(K)是提供信息的 “标签”,值(V)就是实际的信息内容。的列对应 “所有词”,V 的行也对应 “所有词”,矩阵乘法的本质是:对于输出的第。(嵌入后的句子),输出为每个词的上下文向量。做 Softmax(
2026-01-11 22:29:05
607
原创 VLM—Transformer
这个公式承担了自注意力机制中最关键的权重分配任务,分为两步执行,每一步都有明确的数学和工程意义。举例例如 C E F是三个四条信息的输入端 3x4 那么。Wq要求假设是输出2的那就结果是3x2的。Wk要求假设是输出2的那就结果是3x2的。Wq要求假设是输出4的那就结果是3x4的。,对于整句话每一个单词对不同维度的影响。但是3就是输入的词条。
2026-01-09 11:41:30
515
原创 VLM_一维离散卷积与二维离散卷积(还是复习感觉还行)
然后再乘以 1/9(本质上就是 “邻域和 ÷ 9”),得到的结果就是滤波后该位置的像素值。是 OpenCV 封装好的。首先是简单的一维离散卷积。均值滤波的计算就是:先把。
2026-01-08 17:36:03
203
原创 VLM多模态大数据开发—感知器与MLP基础(我感觉还行主要复习)
感知器:最简单的人工神经网络单元,模拟生物神经元的工作方式,是所有复杂神经网络(包括 VLM、YOLO)的底层基础。把感知器想象成一个「做决策的大脑细胞」:MLP基础: MLP(也叫「全连接神经网络」)是把多个感知器分层组合起来的网络,突破了单个感知器的线性限制,能处理非线性问题,是 VLM、YOLO 等复杂模型的核心基础模块。首先是前向传播完整的神经网络训练闭环 其中解析一下解析函数 Sigmoid中答:如果没有偏置 b1,当所有输
2026-01-08 13:57:38
477
原创 漆面检测-数据库连接通信逻辑
/当调用 m_dbWriterThread->finished(),m_dbWriter->deleteLater。//当调用 m_dbWriterThread->start(),m_dbWriter->start。// - 线程结束 -> 释放写入器(避免内存泄漏)// - 线程启动 -> 写入器开始工作。// 1) 触发拍照。3.写入器分配至子线程。
2026-01-04 13:05:25
350
原创 服务器传输推送
终端主动拉取:服务器整理好数据后仅存储,终端按需 / 定时发起请求(如 “获取批次 XXX 的问题图像”),服务器响应并传输数据。
2025-12-09 09:46:33
609
原创 色差检测实验测试
通过多光谱,灰度相机根据不同波长实现对不通汽车漆面的色差检测。之后就可以将后续的图像与这个阈值进行对比来测试是否为合格漆面。对于向量进行两方面处理用于进行阈值的设定。那么就可以组成一个(1,6)的向量。对于一张图RGB来说,具有六个值。
2025-11-28 17:57:26
197
原创 数据库的连接_qt
句柄,后续可通过该句柄执行 SQL 语句(如。数据库的连接形式可以通过cmd查看。2.初始化 MySQL 连接句柄。1.获取 UI 输入的连接参数。3. 建立数据库连接。连接成功:返回有效的。
2025-09-12 11:11:52
397
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅