- 博客(155)
- 资源 (1)
- 收藏
- 关注
原创 草台班子?实测大厂剪映数字人审核的三层漏洞 —— 深度解析
大厂剪映数字人漏洞,一起看看吧cv君开始做视频了~请直接在抖音搜索 cv君 DeepAI,关注一下吧~ 视频号有联系方式和交流群~视频号创作非常不易,跪谢支持!
2026-06-22 17:42:02
403
原创 《全网首发》用AI让李白写高考作文,你给AI打多少分?
《全网首发》用AI让李白写高考作文,你给AI打多少分?cv君开始做视频了~请直接在抖音搜索 cv君 DeepAI,关注一下吧~ 视频号有联系方式和交流群~视频号创作非常不易,跪谢支持!
2026-06-07 16:51:46
681
原创 AI科幻短剧《人类的过去和未来》第一章 · 神经网络的起源篇【抖音搜索:cv君 看完整视频】新人起号感谢支持
AI科幻短剧《人类的过去和未来》第一章 · 神经网络的起源篇穿越回AI的起点,寻找让AI从6.5跃升到9.0的秘密。
2026-06-06 16:21:26
432
原创 【失踪人口回归】cv君花了5天、烧了8亿token 实测Gemini Omni:首个全模态大模型,AI自己造视频的时代来了
我花了5天、烧了8亿token,一篇文章带你吃透 Google 刚发布的两大王炸模型。一句话总结:有夯有拉!Google发布两大AI模型:全模态的Gemini Omni和高效的Gemini 3.5 Flash。Omni支持全模态编辑,能自动完成视频换装转场等复杂操作,但在物理运动模拟上仍有不足。3.5 Flash速度比前代Pro版快4倍,支持Agent自主任务拆解,但价格更高。这两款模型标志着AI正从工具转变为创作者,将重塑视频制作、游戏开发等行业。虽然技术前景广阔,但高昂的使用成本仍需谨慎评估。
2026-05-24 18:54:40
756
原创 【精品实战项目】深度学习预测、深度强化学习优化、附源码数据手把手教学
【精品实战项目】深度学习预测、深度强化学习优化芯片、附源码数据手把手教hello, 大家好,我是cv君,今天给大家带来很久之前的实战项目,这个项目稍微庞大、完整一些,附带源码、原数据、手把手教学,大家跟着我走完,既可以学到神经网络预测任务,也可以学到强化学习等算法的应用,这个做好了,什么本科毕设、研究生大论文都可以搞定。这个项目附带了大量的专业知识,领域很垂直,附带了数据,大家可以简单学习各个模块,非常有用,可以学会神经网络与深度学习是如何预测数据的,还可以怎么优化结果,还有DDPG强化学习源码与优化算法。
2024-08-22 21:13:15
16789
原创 【YOLOv8十万长文优化】独家魔改优化技巧+附20余个源码手把手教程
【YOLOv8十万长文全解】v8 v9通用。独家魔改优化技巧+附20余个源码手把手教程; Hello,大家好,我是cv君,最近开始在空闲之余,经常更新文章啦!除目标检测、分类、分隔、姿态估计等任务外,还会涵盖图像增强领域,如超分辨率、画质增强、降噪、夜视增强、去雾去雨、ISP、海思高通成像ISP等、AI-ISP、还会有多模态、文本nlp领域、视觉语言大模型、lora、chatgpt等理论与实践文章更新,更新将变成一周2-3更,一个月争取10篇,重回创作巅峰
2024-08-01 21:07:10
29587
7
原创 【一文全解图像超分】附数十个算法及独家源码+手把手教学及优化攻略!
【一文全解图像超分】附数十个算法及独家源码+手把手教学及优化攻略!超分有图像超分、视频超分,两者有一定区别,主要在多帧对齐上,后续我们介绍;有盲超分和已知退化超分;根据自己的实际任务来选择如何优化算法。最近经常更新文章啦
2024-06-21 15:49:50
27438
4
原创 「AI模型瘦身术」——知识蒸馏技术综述+手把手教学蒸馏
回顾近年来,知识蒸馏(Knowledge Distillation)方法在深度学习领域中备受关注,它是一种模型压缩技术,旨在将一个复杂的模型(通常被称为教师模型)的知识转移到一个简化的模型(通常被称为学生模型)中,从而使学生模型能够在保持性能的同时具有更小的模型尺寸和计算成本。: 最常见的知识蒸馏方法之一是使用教师模型和学生模型之间的监督信号。教师模型通常是一个大型、复杂的模型,而学生模型则是一个较小、简化的模型。
2024-05-16 11:38:49
27636
1
原创 【含泪提速!】一文全解相似度算法、跟踪算法在各个AI场景的应用(附代码)
大家是否为深度学习算法速度感到困扰?本次cv君倾力分享一个优秀的方法,通过相似度+跟踪方案优化速度问题,并提高了检测、分割算法稳定性,附带代码,一起肝起来吧~
2022-08-31 18:15:00
19284
3
原创 【反内卷】开创全新AI多模态任务一视听分割:附原理、代码实践、优化教程(一)
最新顶会开源,有趣度满分!视听分割是本周ECCV定会提出的全新任务,旨在:找出画面中哪个位置正在发出声音,这是一份多模态工作,结合了视觉和语音。
2022-08-09 20:30:42
22972
原创 实时 摔倒识别 /运动分析/打架等异常行为识别/控制手势识别等所有行为识别全家桶 原理 + 代码 + 数据+ 模型 开源!
文章目录一、 基本过程和思想二 、视频理解还有哪些优秀框架三、效果体验~使用手势:python run_gesture_recognition.py健身_跟踪器:卡路里计算三、训练自己数据集步骤然后,打开这个网址:点击一下start new project但是官方的制作方法是有着严重bug的~我们该怎么做呢!原代码解读大家好,我是cv君,很多大创,比赛,项目,工程,科研,学术的炼丹术士问我上述这些识别,该怎么做,怎么选择框架,今天可以和大家分析一下一些方案:用单帧目标检测做的话,前后语义相关性很差(也有
2021-03-02 15:28:37
63776
313
原创 【项目实战】YOLOV5 +实时吸烟目标检测+手把手教学+开源全部
本原创项目长期更新,旨在完成校园异常行为实时精检测,做到集成+N次开发+优化(不止局限于调包)为止,近期将不断更新以下模型+数据+标注文件+教程。关注博主,Star 一下github,一起开始美妙的目标检测之路吧~~文章目录本原创项目长期更新,旨在完成校园异常行为实时精检测,做到集成+N次开发+优化(不止局限于调包)为止,近期将不断更新以下模型+数据+标注文件+教程。关注博主,Star 一下github,一起开始美妙的目标检测之路吧~~一、项目展示二、项目资源共享1:训练图片:香烟图片+吸烟手势+烟雾三、
2020-07-14 12:00:17
132231
238
原创 智传网获最高AI奖:为什么它能在断网灾区,用一丝信号传出高清画面?
【摘要】中国电信TeleAI研发的"智传网"技术获2026世界AI大会最高奖,其创新性在于将生成式AI与传统通信结合,实现极端弱网环境下的高效信息传输。核心技术突破包括:1)语义级词元压缩,将画面提炼为少量特征Token;2)接收端通过生成式AI重建高清内容;3)多模型协同的智能涌现机制。实测显示仅需110kbps即可传输720p视频,较传统通信效率提升显著。该技术特别适用于灾区断网等应急场景,通过"传智能而非传数据"的范式革新,成为国家级AI基础设施的重要突破,展现了AI在救生领域的实际价值。
2026-08-02 16:00:00
162
原创 WAIC 具身智能盘点:意念控制机器人、能驮 4 人的机械狗,和 90 秒抓药的机器人
WAIC 2026具身智能亮点盘点:从科幻走向现实的突破 本届大会呈现了具身智能领域多项突破性进展:强脑科技全球首发意念控制机器人,通过脑机接口实现纯脑电波指挥机器人倒水;全尺寸人形机器人创下连续自主作业超一年的世界纪录,已应用于宁德时代等产线;形态创新包括能驮4人的机械狗、半人马机器人和全编制机器人乐队。阿里"智慧药房"机器人实现90秒完成问诊抓药,展现商业化落地能力。大会强调技术发展需兼顾创新与可控性,标志着具身智能已从实验室演示转向实际应用阶段,核心指标转变为持续工作能力和商业价值。
2026-08-01 15:00:00
215
原创 WAIC 现场教你一眼辨别“真假“人形机器人:有的展台在拿真人穿皮套演戏
2026世界人工智能大会上,人形机器人展区存在"真人穿机甲皮套"现象。作者提出4个辨别真伪的技术细节:颈部转动(机器人自由度有限)、皮肤皱纹(仿生硅胶不自然)、手部动作(机器人较僵硬)和姿态流畅度(太流畅反而可疑)。这些难点源于技术限制:颈部/手部自由度不足、仿生皮肤动态效果欠佳、运动控制算法不完善。文章指出,真正前沿技术(如首形科技的仿生脸)经得起细节检验,而营销作秀终将露馅,建议观众通过"转脖子、看皱纹、盯手部"辨别真伪,理性看待技术进展。文末附作者视频账号推广信息。
2026-07-31 18:23:55
367
原创 我用 AI 一分钟做出《功夫女足》4K 电影海报:从星爷海报里扒出的高级感公式
《AI 1分钟生成电影级海报的4个关键技巧》 本文揭秘如何用AI快速制作高级感4K电影海报,总结四大核心要素: 色彩控制:主色+撞色(如红黑/蓝橙)提升视觉冲击; 光影设计:轮廓光+明暗对比强化戏剧感; 构图法则:定格爆发瞬间+留白+低角度仰拍; 张力营造:通过动态元素让画面"活起来"。 实操技巧:先批量生成多风格草稿筛选,再针对性输出高清图;提示词需包含电影级质感关键词,并避免AI生成中文字体。作者强调,成功关键在于将专业审美规律转化为AI指令,而非盲目抽卡。文末附视频教程入口。
2026-07-31 18:03:21
177
原创 Stroke-based Cyclic Amplifier (SbCA方法):实现图像任意尺度超清放大
在卫星遥感方面,SbCA可对低分辨率卫星图像进行超清晰重建,提升图像质量,为地理研究和环境监测提供更准确的数据支持。最后,这项技术的意义还在于它展示了一种全新的思路——将图像的矢量表示与深度学习相结合,为计算机视觉领域开辟了新的可能性。但这需要训练多个模型,存储和计算成本高,且缺乏灵活性。上述数据表明,完整模型的LPIPS比仅用DCM提升7.3%,MUSIQ提升88.4%,充分证明了联合设计的必要性。而SbCA的笔画表示形成了一个稳定的中间空间,就像在长途旅行中设置了多个"驿站",确保不会偏离正确路线。
2025-06-19 15:47:10
307
原创 基于强化学习的图像质量评估模型 Q-Insight
研究团队发现,仅以评分作为引导无法充分实现良好的画质理解,因此引入了多任务 GRPO 优化,设计了评分奖励、退化分类奖励和强度感知奖励,联合训练评分回归与退化感知任务。在图像质量评分任务上,Q-Insight 在多个公开数据集上的表现超过当前最先进的方法,尤其在域外数据上的泛化能力突出。在零样本图像比较推理任务上,Q-Insight 无需额外监督微调即可准确分析和比较图像质量,展现出强大的泛化推理能力。例如,在噪声退化类型的识别中,Q-Insight 的准确率达到了 1.0000,远高于其他方法。
2025-04-17 13:25:26
474
原创 热红外图像去雾与盲图像质量评估指标FADE
论文作者提出了一种在热红外光谱中生成合成雾霾的方法,并分析了无参考图像质量评估指标“雾感知密度评估器”(FADE)在热红外光谱中的适用性。通过对比去雾前后图像的FADE值差异(∆FADE),发现FADE在可见光和热红外光谱中均能有效区分雾霾图像和清晰图像。而在热红外光谱中,经过微调的DehazeFormer在所有指标上均显著优于其他方法,尤其是在严重雾霾条件下表现出优异的鲁棒性。FADE在热红外光谱中的有效性验证了其跨光谱的泛化能力,为无参考图像质量评估提供了新的工具。因此,为其创建生成了合成雾。
2025-04-17 12:46:17
688
原创 抑郁症检测:基于交叉注意力的多模态特征融合方法
它通过使用名为MacBERT的预训练模型提取文本中的词汇特征,并结合额外的Transformer模块优化特定任务的上下文理解,有效地捕获和整合了多模态数据中这些互补的信息,进一步提升了模型对目标任务的适应能力。借助整合多维度的信息,该模型实现了更为精准的评估,这种能力充分凸显了我们模型的稳健性,使其能够在社交媒体文本数据的复杂性与多变性中,始终保持较高的准确性来识别抑郁倾向。:提取了六个统计特征,包括负面情感微博的比例、原创微博的比例、深夜发帖的比例、每周发帖频率、发帖时间的标准差和包含图片的微博比例。
2025-02-22 14:31:22
1016
原创 DEMF模型赋能多模态图像融合,助力肺癌高效分类
维度创新点描述评估结果理论创新提出了一种新的多模态图像融合机制(PCAE),有效整合了PET和CT图像的特征。高度创新,为多模态影像融合提供了新的理论基础。方法创新开发了一种基于深度集成学习的分类器(DEMF),通过多数投票进行决策。高度创新,显著提高了分类的稳定性和准确性。应用创新该方法在有限样本的情况下表现出色,具有潜在的临床应用价值。高度创新,可扩展到其他疾病的检测和诊断中。可视化知识图谱。
2025-02-21 12:25:31
497
原创 多模态医学图像融合:照亮医学诊断的未来之路
多模态医学图像融合,简单来说,就是把不同类型的医学图像(比如MRI、CT、PET等)结合起来,生成一张更全面、更清晰的图像,帮助医生更好地诊断疾病。指的是多种不同的成像技术。:擅长显示软组织的细节,比如大脑、肌肉等。:能清晰地显示骨骼和血管结构。:可以显示身体的代谢活动,帮助发现肿瘤等病变。就是这些成像技术生成的图像,医生通过这些融合后的图像来观察和分析病人的身体状况。假设一个病人做了 MRI 和 PET 扫描。MRI 显示了一个肿瘤的形态和位置,PET 显示了肿瘤的代谢活动。
2025-02-11 11:21:15
531
原创 cv君独家视角|AI内幕系列二十八:杭州六小龙的独特魅力
AI 领域的技术迭代迅速,DeepSeek 需要不断创新以保持其大模型的领先地位;脑机接口技术涉及到复杂的生物学、医学与工程技术,强脑科技在产品研发与临床应用方面可能面临诸多技术难题与伦理问题;机器人行业面临着激烈的市场竞争与技术更新换代的压力,宇树科技和云深处科技需要持续投入研发以提升产品性能与竞争力,否则可能会被市场淘汰。这些企业的发展不仅依赖于自身的努力,还与外部环境密切相关。政策的支持、市场需求的变化、行业竞争格局的演变等都会对其产生重大影响。
2025-02-06 14:23:41
484
原创 cv君独家视角 | AI内幕系列二十七:最新Mamba神经网络架构:从零构建与实战教学
Mamba 作为一种创新的序列建模框架,通过选择性状态空间和线性时间复杂性的设计,为长序列任务提供了一种高效且灵活的解决方案。本文通过详细的代码实现和理论分析,展示了 Mamba 的核心思想和技术细节。
2025-02-06 10:17:33
2437
原创 cv君独家视角 | AI内幕系列十七:视觉状态空间模型(VMamba)的解读
在计算机视觉领域,设计计算高效的网络架构一直是研究的热点。今天,我想和大家分享一篇发表在 NIPS 2024 上的论文——VMamba:Visual State Space Model,这篇论文提出了一种新的视觉骨干网络,具有线性时间复杂度,展现了在多种视觉感知任务中的出色表现。
2025-02-02 21:31:13
2447
原创 cv君独家视角 | AI内幕系列十六:一文读懂 NeurIPS 条件卷积模块 CondConv:让模型涨点的秘密武器(附源码实践)
在深度学习的浪潮中,卷积神经网络(CNN)一直是图像处理领域的中流砥柱。然而,传统的卷积操作采用静态共享的卷积核,对不同输入样本“一视同仁”,这显然无法满足复杂多变的实际需求。今天,就带大家深入了解一种打破这一局限的创新技术 —— 条件卷积模块 CondConv,看看它是如何让模型性能实现飞跃的。
2025-02-02 19:40:25
2240
原创 cv君独家视角 | AI内幕系列十五:全新的病理图像多类分割方法:PathMamba
论文提出了一种新颖的弱监督学习方法,仅使用图像级别的标签,通过多实例多标签学(MIML)和对比度掩码块(CMB)来探索组织病理学图像的像素级和区域级标准特征。该方法能够自适应地捕捉图像中的像素级特征,并利用深度对比学习损失更好地利用未标注的信息。实验结果表明,该框架在临床应用中具有有效的注释病理图像的潜力。
2025-01-06 19:15:18
2341
原创 cv君独家视角 | AI内幕系列十三:图像超分辨率技术新进展:混合注意力聚合变换器HAAT
在计算机视觉领域,单图像超分辨率(SISR)技术的目标是从一个低分辨率的图像中重建出高分辨率的图像。特别是,SwinIR利用Swin Transformer取得了显著的改进,而混合注意力变换器(HAT)通过结合重叠的交叉注意力模块、基于窗口的自注意力和通道注意力,也产生了最先进的结果。HAAT模型的提出是为了解决现有基于Transformer的方法在图像恢复问题上的局限性,尤其是当前基于窗口的Transformer网络将自注意力计算限制在集中区域,导致感受野受限并且无法充分利用原始图像的特征信息。
2024-12-07 12:54:55
2272
原创 cv君独家视角 | AI内幕系列十二:利用raw图像实现真实场景的超分辨率的技术
总之,该方法提出了一种新的数据生成流程和双CNN架构,通过模拟数字相机成像过程和利用raw图像的辐射信息,有效地提高了真实场景下图像超分辨率的性能,并展示了raw数据在图像处理中的优越性。
2024-12-06 12:08:58
2121
原创 cv君独家视角 | AI内幕系列十一:DP双像素sensor相关的AI算法全集:深度估计、图像去模糊去雨去雾恢复、图像重建、自动对焦
双像素是成像系统的感光元器件中单帧同时生成的图像:通过双像素可以实现:深度估计、图像去模糊去雨去雾恢复、图像重建成像原理来源如上,也有遮罩等方式的pd生成,如图双像素视图可以看到光圈的不同一半,这提供了一个深度提示。然而,由于基本的模糊性,如果相机的焦距(或光圈大小或焦距)发生变化,不同的场景可能会产生相同的双像素图像。在(a)中,具有焦距g1的相机在距离Z1处成像聚焦的蓝色点和离焦的橙色点。通过光圈左半部分折射的光(深蓝色和橙色光线)到达每个双像素的右半部分,反之亦然。这导致了一个双像素图像,其中失焦橙
2024-11-21 11:48:53
3114
原创 cv君独家视角 | AI内幕系列十:PlainUSR框架:加速卷积网络的高效SR方法
图像超分辨率(SR)旨在从大量的低分辨率退化中恢复高分辨率图像的方法。随着深度学习技术的发展,基于卷积神经网络(ConvNet)的SR方法取得了显著的进展。然而,这些方法在提高图像质量的同时,往往伴随着计算成本的增加,这限制了它们在实时应用中的实用性。最近,一篇名为《PlainUSR: Chasing Faster ConvNet for EfficientSuper-Resolution》的论文,提出了一种新的框架,旨在提高SR的速度和效率,同时保持图像质量。
2024-11-20 18:38:26
2437
原创 cv君独家视角 | AI内幕系列九:视频修复技术和实时在线处理
视频修复技术的目标是填补视频中的缺失部分,使视频内容连贯合理。这项技术在对象移除、视频修复和视频补全等领域有着广泛的应用。传统方法通常需要处理整个视频,导致处理速度慢,难以满足实时处理的需求。实验使用了三种基于Transformer的视频修复模型,并在两个广泛使用的视频修复数据集上进行。结果显示,新框架在保持实时处理速度的同时,减少了质量损失。此外,通过消融实验评估了模型中各个组件的重要性,结果表明双模型协作和记忆机制对提高帧率和质量都有积极作用。
2024-11-20 17:22:49
3108
原创 cv君独家视角 | AI内幕系列八:NeRD-Rain(双向多尺度的Transformer模型)新方法实现图像去雨
目前大多数基于Transformer的方法都只关注单一尺度的雨迹特征,而要成功去除图像中的雨滴,理解雨线在不同尺度上的表现非常关键。,因此论文作者提出了一种全新的多尺度Transformer模型,它能同时捕捉到不同尺度下有助于图像恢复的特征。这种方法有助于重建出更高质量的无雨图像。为了深入挖掘雨线在空间上的变化并找到它们的共同特征,论文作者在模型设计中融合了基于像素位置的隐式神经表征,这有助于模型学习如何去除雨水并提高在复杂环境下的稳定性。
2024-10-24 18:30:55
2744
1
原创 cv君独家视角 | AI内幕系列七:EfficientViT模型:基于多尺度线性注意力模块,实现高效的高分辨率密集预测
在头部设计方面,它使用了P2、P3和P4,它们分别代表第二、第三和第四阶段的输出结果,形成了一个特征图的金字塔结构。简而言之,EfficientViT的骨架结构是按常规设计的,通过逐渐减小特征图尺寸和增加通道数来构建,而在头部设计中,它通过构建特征金字塔并融合不同阶段的特征图,以及使用简单的MBConv块和输出层来完成预测和上采样。总的来说,EfficientViT模型通过这些精心设计的技术,能够在保持计算效率的同时,有效地处理高分辨率图像,捕捉到图像的全局和局部信息,从而在各种密集预测任务中表现出色。
2024-10-24 16:33:06
2223
【脑机接口预测实战】颠覆回归预测极限:TSLANet时序预测与独家原创优化秘籍+原理与源码+数据 原理与csdn见cv君首页同名
2024-09-09
Smoke-Detect-by-yolov5-v2.rar
2022-01-11
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅