自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(24)
  • 收藏
  • 关注

原创 nnUNet规范

【代码】nnUNet规范。

2026-08-06 11:21:02 212

原创 Pseudo-Label : The Simple and Efficient Semi-Supervised LearningMethod for Deep Neural Networks 阅读笔记

简单来说,伪标签就是:对于无标签数据,用网络预测的概率最高的类别作为它的标签。这等同于熵正则化。它有利于类间低密度分离(这是一种常用的半监督学习假设)============= 解释时间 =============※ 熵正则化:个人理解,正则化是一种“先验知识”/“假设”的注入方式,这种注入有各种目的,常见的比如“避免过拟合(如模型参数的L2正则)”、“无监督训练(如低光图像增强的Retinex模型)”。熵的定义是:,离散情况下:(这里用符号y而不是x,是因为x一般表示数据的观测原始值。

2026-08-05 22:57:47 171

原创 nnUNet and its customization

(未完,26/8/5)

2026-08-05 17:21:53 225

原创 IOMatch: Open-Set Semi-Supervised Learning with Joint Inliers and Outliers Utilization 笔记

SSL分为两种:闭集和开集,这取决于无标签数据的实际标签是否都在有标签数据里出现过,是对应闭集,否对应开集。把无标签数据的标签集记作Lu,而有标签数据的标签集记作Ls。对于开集SSL【缩写OSSL】,目前主要是“检测标签在集合{Lu \ Ls}里的样本【这里称作outlier,异常点】并把它们直接删掉”,但这个做法依赖于outlier检测器的准确性,如果准确性差,反而可能降低模型性能。因此,与其将开集未标注样本分配到不同的学习分支(例如,将内点用于伪标签,而将异常点丢弃),不如在统一的范式下处理它们。

2025-10-16 19:16:31 250

原创 Flare7K: A Phenomenological Nighttime Flare Removal Dataset 阅读笔记

在这篇文章之前,只有白天的大规模flare数据集,但白天的flare主要是阳光,而夜间的flare主要是人工光源,它们有很多区别(亮度、光谱、图案、退化等),因此用于白天的方法在夜间效果不佳。本文创建了第一个夜间大规模flare数据集,它基于对真实世界夜间镜头光晕的观察和统计生成,包含5000张scattering flare图像和2000张reflective flare图像【注意,这些图像里只包含flare图案,背景是一片黑的】,涵盖了25种scattering和10种reflective。

2025-09-26 16:52:16 909

原创 NAFNet (Simple Baselines for Image Restoration) 阅读笔记

图像恢复SOTA方法的系统复杂性在增加,这可能会阻碍方法的便捷分析和比较。本文提出了一种简单的基线,其性能超过了SOTA,并且在计算上效率高。为了进一步简化基线,我们揭示非线性激活函数不是必要的:它们可以被乘法替代或删除。因此,我们从基线推导出了一个无非线性激活的网络,即NAFNet。在各类挑战基准测试中,我们实现了SOTA结果,例如在GoPro(用于图像去模糊)上获得33.69 dB的PSNR,超过了之前的SOTA 0.38 dB,仅以8.4%的计算成本;

2025-09-26 16:47:43 1195

原创 在CV中常用Normalization的计算方法、PyTorch API和手动实现对比总结

# 前言:常用Norm的计算公式基本都是相同的:各种常用Norm的差别主要在于:参与norm的维度、可学习仿射变换参数γ和β的维度因此,下文不再提及上述计算公式,只对差异进行说明。

2025-09-26 16:07:20 1024

原创 MIPI 2024 Challenge on Nighttime Flare Removal: Methods and Results

耀光(Flare)可以分为三种主要类型:散射耀光(scattering)、反射耀光(reflective)和镜头光球(len orbs),他们提出了一个包含基于物理的合成耀光图片以及在暗室里拍摄的真实耀光图片的数据集,但这和真实夜间耀光图片差别很大。Flare7K及其++版本专门为夜间场景设计。还有一些别的研究:多光源场景的耀光去除、智能手机反射耀光去除等然而,在小领域的深度学习中常见的一个大问题是:数据集覆盖面不够,out-of-distribution严重(但本文/本次比赛似乎不管这个问题)。

2025-09-17 22:29:19 847

原创 Pix2Pix阅读笔记

本文研究将条件对抗网络(即条件GAN)作为img2img translation的通用方案。这类网络不仅学习图像间的映射,还学习训练这个映射的损失函数。这使得使用通用方案去解决传统上需要非常不同的损失函数的问题成为可能。本文表明这个方案是有效的,可以在诸如从边缘图、语义分割图等生成RGB图像的任务中取得不错的效果,而不需要设计任务特定的损失许多图像处理问题都可以算作img2img translation,更进一步,就是从像素中预测像素。

2025-08-23 17:55:37 823

原创 CycleGAN阅读笔记

本文提出一种可以用非配对图像进行学习的图像到图像翻译(img2img translation)方法。只使用对抗损失进行训练的GAN学到的转换映射G: X->Y是无限制(under-constrained)的,本文引入另一个反向映射F: Y->X,并使用循环一致性损失来使F(G(X)) ≈ X(相应的,G(F(Y)) ≈ Y)。本文的方法在无配对数据上的实验表明了本文方法的强大。图像到图像翻译从概率分布的角度看,是。

2025-08-23 12:04:10 460

原创 Global Image Retouching-Conditional Sequential Modulation-CSRNet阅读笔记

所提出的网络具有非常简单的架构,总共只包含六个普通卷积层,没有任何复杂的构建块。我们还对各种设置进行了广泛的消融研究,包括尝试不同的手工制作的全局先验(全局亮度/通道强度/直方图)、网络结构(扩大基础网络卷积核大小/层数)和特征调制策略(条件拼接/条件图)。基于上述观察,我们提出了一种极其轻量级的网络——条件顺序润色网络(CSRNet)——用于快速全局照片润色。基于这一分析,我们提出了一种极其轻量级的框架——条件顺序润饰网络(CSRNet),用于高效的全局图像润饰。,并且可以灵活地调整到不同的润饰风格。

2025-08-14 12:12:44 782

原创 VQGAN阅读笔记

本文展示了如何将 CNNs 归纳偏置的有效性与 Transformer 的表达能力相结合,使它们能够对高分辨率图像进行建模并进而合成。展示了如何(i)使用 CNNs 学习富含上下文的“图像部件”(image constituents)词汇表,进而(ii)利用 Transformer 在高分辨率图像中高效地对这些部件的组合进行建模。与CNN不同,Transformer在交互的局部性方面没有内置的归纳先验,因此能够自由地学习其输入之间的复杂关系。然而,这种通用性也意味着它必须学习所有关系。

2025-08-10 20:51:15 840

原创 DiT-SR阅读笔记

在SR领域里,基于卷积的Diffusion有不少,但基于Transformer的很少。本文设计了一个高效的DiT,它达到了prior-based方法的视觉效果,但是从头训练的(本文将Diffusion在SR领域里的方法分为“从头训练”和“prior-based”两种,前者就是从头练一个模型,后者利用已有的模型作为prior,后者的性能往往比前者强)。DiT-SR使用,并采用“各向同性”的模块设计(不同分辨率的块使用相同的特征维数)

2025-08-10 12:30:24 1020

原创 ResShift: Efficient Diffusion Model for SR by Residual Shifting阅读笔记

Diffusion要迭代上千步,太慢,现有加速采样技术牺牲性能。本文提出的模型通过在高分辨率图和低分辨率图之间shift残差,大大提高了效率。此外,本文还制定了详细的噪声schedule,以灵活地控制shift速度和噪声强度。本文只用15个采样步就能得到SOTA或接近SOTA的性能用于图像生成的Diffusion模型以Gaussian分布为采样先验分布,但这在SR里不一定是最优的,因为SR优LR图像可用。本文认为,SR的采样先验分布应该是基于LR图像的,从而能从LR图像而不是高斯白噪声中迭代回复HR图像。

2025-08-09 23:51:34 1147

原创 DiT阅读笔记

另外,如果使用Classifer-free Guidance,则命名为DiT-ModelSize/PatchSize-G,例如DiT-XL/2-G。这两张图中,StyleGAN-XL的许多指标比DiT-XL/2-G (cfg=1.50)还要强,GAN这么强?Diffusion超参数与ADM一致:T=1000,线性schedule,β从1e-4到2e-2。相似的GFLOPS下,不同参数量的模型性能相似(如DiT-S/2和DiT-B/4)常量学习率1e-4,无权重衰减,batch-size 256。

2025-08-07 23:13:15 844

原创 StyleGAN阅读笔记

借鉴风格转换文献,提出了一种用于GAN的生成器架构。新的架构实现了对合成的直观、特定规模的控制,带来了明显更好的插值特性,也更好地解缠(disentangle)了潜在的变化因素。生成器继续作为黑匣子运行,尽管最近做出了努力,但仍然缺乏对图像合成过程各个方面的理解,例如随机特征的起源(the origin of stochastic features)。潜在空间的性质也知之甚少,潜在空间插值没有提供定量的方法来比较不同的生成器。

2025-08-06 21:15:51 589

原创 杂项学习笔记

关键在于代码中的hard判断,hard是这个函数的关键参数,默认为True,此时它的返回值设计非常有技巧:在前向传递时,后两项相互抵消只留下y_hard,也就是采样的离散变量(比如类别);反向传播时,前两项没有梯度,因此梯度只从y_soft传递,也就是softmax概率。不去管为什么这么算就可以,上面的步骤很显然,通过概率值p反向传播时,梯度链是:p->v'->v->网络参数,而G没有梯度,因此和一般的softmax的梯度传播是一致的。反向传播没问题了,那前向的采样怎么办?,采用的技术之一就是。

2025-07-05 20:38:09 355

原创 Robust Image Denoising through Adversarial Frequency Mixup阅读笔记

结果: 好得很哪,在多个OOD(分布外)数据集上平均给DnCNN涨点0.7dB和0.007SSIM,CBDNet涨点0.3dB和0.003SSIM,等等,并超过Restormer、Uformer 0.4dB和0.003SSIM。前言:监督方法泛化性不行,本文想要提升它们的泛化性,提出了对抗频率混合(AFM),这是一种与模型无关的训练框架(更准确地,一种数据增强策略),可以提高去噪网络对真实噪声分布变化的泛化性。

2025-06-27 23:06:18 238

原创 A Review of an Old Dilemma: Demosaicking First, or Denoising First?阅读笔记

,且噪声水平(方差)是原始白噪声方差的大约1.5倍,这么大是因为DM后的RGB通道噪声有强通道相关性,而Y=(R+G+B)/sqrt(3),当完全相关时,即R=G=B=I时,Y=sqrt(3)*I≈1.7I;前言:直觉上讲,先去噪再去马赛克(记作DN&DM)更好,因为RAW图像的噪声是空间独立的Gaussian-Poisson噪声,可以用Variance Stabilizing Transform(VST)变为近似AWGN,而这种噪声容易合成和研究;而去马赛克后的噪声会变成空间相关的,不易合成和研究。

2025-06-27 18:05:58 178

原创 FBCNN: Towards Flexible Blind JPEG Artifacts Removal阅读笔记

JPEG的压缩方法:将图像无重叠地切分成一系列块,每个块的大小为8x8,对每个块应用DCT,然后对DCT系数进行量化(形成量化表)。量化是JPEG压缩过程中唯一的有损操作。通常用“质量因子(QF)”表示压缩质量,取值范围是0~100的整数为每个QF学一个模型。为解决这个问题,有人就为一个范围内的QF学一个模型,但这些方法对一张图只能有确定的输出,忽略了用户偏好(把QF做输入)基于DCT的方法需要DCT系数或量化表做输入,这些内容只存储在JPEG格式中。

2025-06-26 19:42:32 356

原创 LG-BPN: Local and Global Blind-Patch Network阅读笔记

暂时不想记录这篇文章了,因为其中一些叙述没给出逻辑,比如他认为直接用训练时用的掩码卷积不是最优的,理由是:推理阶段需要相比训练阶段更多的细节。其次,这玩意儿还用了类似deformable卷积的东西等等,使得模型参数量是AP-BSN的几倍(71/16>4倍),并且推理很慢(github有人提)。我浪费了点时间看他的代码实现,至少我不觉得他真的有做论文里提到的“通过空洞卷积减少运算量”。动机:AP-BSN将PD和BSN结合,但作者认为这是次优的,会损害局部细节、带来伪影,如锯齿伪影。

2025-06-24 22:39:03 167

原创 PD-Denoising阅读笔记

ε估计噪声标准差图【更准确地说,会设置一个可应对范围,然后把它归一化】,R根据ε和输入图预测噪声图,输入图 - 噪声图 => 输出图。三个损失:ε估计损失、真实ε下R预测损失【用真实的噪声标准差图】、估计ε下R预测损失【用估计的噪声标准差图】,均为MSELoss,损失加权和即为最终的loss。动机:自监督去噪很吸引人,但过去的方法依赖于“噪声是空间独立的”这一假设,而这与真实噪声的性质不符,因此性能不行。(实际上它还加了所谓“随机值脉冲噪声RVIN”,添加方法是在噪声位置处随机设一个值。

2025-06-22 18:31:23 349

原创 DeepSeek-V2 学习笔记

先上图:性能接近LLaMA 3 70B,激活参数仅为其30%左右;与DeepSeek 67B相比,DeepSeek-V2节省了42.5%的训练成本,将KV缓存减少了93.3%,并将最大生成吞吐量提高到5.76倍。

2025-05-18 15:54:10 768

原创 Pyramid Diffusion for Low-Light Image Enhancement (LLIE) 学习笔记

测试配置:LOLv1和v2(是的,他们训练没用到v2),DDIM,4次迭代(原文的说法是:Combined with DDIM, PyDiff requires only 4 iterations to obtain results comparable to other SOTA methods. 这说法弯弯绕绕的)【但他们没有做local corrector,估计在LLIE中,这种差别主要出现在global的属性(整体颜色),而不在local的属性(边缘和纹理)】较大时使用,这篇文章使用的阈值。

2025-04-17 20:57:35 662

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除