NLP预训练模型分层学习率衰减

最新推荐文章于 2024-06-14 09:37:08 发布

JY HUA

最新推荐文章于 2024-06-14 09:37:08 发布

阅读量697

点赞数 1

分类专栏：人工智能 nlp

本文链接：https://blog.csdn.net/CallMeYunzi/article/details/119891390

版权

nlp 同时被 2 个专栏收录

11 篇文章 0 订阅

订阅专栏

人工智能

5 篇文章 0 订阅

订阅专栏

# ref: <How to Fine-Tune BERT for Text Classification? >
    from transformers import AdamW
    # 分层学习率衰减
    # 基础学习率
    lr_base = 5e-6
    lr_classifier = 5e-5
    # 衰减系数
    xi = 0.95

    lr = dict()
    lr[23] = lr_base
    for k in range(23,0,-1):
        lr[k-1] = 0.95*lr[k]
    print('lr_decay: ', lr)

    adamw_lr = [{"params": model.roberta.encoder.layer[i].parameters(), "lr": lr[i]} for i in range(24)]
    adamw_lr.append({"params": model.classifier.parameters(),"lr": lr_classifier})
    print(adamw_lr)
    optimizer = AdamW(
        adamw_lr,
        lr=lr_classifier
    )
    # 在finetune时使用这个optimizer

根据论文<How to Fine-Tune BERT for Text Classification? >

为基础leaning rate，

ξ<1越低层有越低的学习率

decay factor=1时为默认方式

论文中的结论是对于bert模型 base lr=2e-5， decay factor=0.95效果最好

确定要放弃本次机会？

福利倒计时

: :

立减 ¥

普通VIP年卡可用

立即使用

JY HUA

关注关注

1
点赞
踩
4

收藏

觉得还不错? 一键收藏
0
评论
NLP预训练模型分层学习率衰减

# ref: <How to Fine-Tune BERT for Text Classification? > # 分层学习率衰减 # 基础学习率 lr_base = 5e-6 lr_classifier = 5e-5 # 衰减系数 xi = 0.95 lr = dict() lr[23] = lr_base for k in range(23,0,-1): lr[k-1] = 0.95*lr[k] .
复制链接

扫一扫