NLP文本分析(文本分类与句子评分)

在线课堂质量评估文本分析

文本分析的任务是对一堂在线课的师生对话进行分析,得到问答、讲堂和纠错三个方面的定性评估。


更新

Apr 28, 2020

  • 当前版本: 0.1.0, 初始版本。

目录

章节内容
简介项目简介
工作流程文本分析整体工作流程
快速开始举例展示模型用法
模型效果在样本数据集上模型效果展示
已知问题尚未解决的问题

简介

在线课堂质量评估这个项目分成2块,分别是语音分析和图文分析,语音分析目前是最优先需求。

语音分析的任务是对一堂在线课的师生对话进行分析,得到问答、讲堂和纠错三个方面的定性评估。这里第一步是语音转文本,这一步我们暂时不管,我们的研究对象就是转换后的文本。以问答为例,首先识别文本中是问答类型的文本段,并判断该文本段中学生回答的好坏,学生回答问题的积极性如何。

工作流程

  • Stage 1 : 项目开始前的准备工作:

    1. 获取数据
    2. 原始数据预处理
  • Stage 2 : 使用BERT预测问答句:

    1. 训练BERT分类模型
    2. 调用模型预测问答结果(其中只有老师的话会被判断是否为问句,学生的话全不为问句)
  • Stage 3 : 对学生回答进行评分:

    1. 提供两种评分模型接口:
    • tf-idf计算句子评分
    • Rake计算句子评分
  • Stage 4 : 将学生回答评分转换为一节课堂的得分

    1. 将第二步中得到的问答句组合成一个对话片段
    2. 通过正则模板匹配将问句分为问答、讲题、纠错三类
    3. 对这个对话片段进行评分avgscore(学生回答总分score/学生回答句子数avg)

快速开始

用两个简单示例展示用法。

  1. 原始未处理csv数据(慢)
elaboration_scores, elaboration_res, error_correction_scores, error_correction_res, qna_scores, qna_res = pipeline('example.csv')
  1. 已经做好分类的csv数据(快)
data = pd.read_csv('example.csv', encoding="utf-8", header=None)
elaboration_scores, elaboration_res, error_correction_scores, error_correction_res, qna_scores, qna_res = scr_mod(data)

模型效果

我们以部分问答qna的结果为例展示模型效果。

qna_scores结果
序号课程id得分等级
027459091.5212952454
127911660.9574941662
228370901.6961917744
328371890.8960777562
428390002.2246817254
528555981.2399048983
628623111.4106247633
728875991.2455478863
828876271.5069273544
qna_res结果
序号课程id文本内容总得分平均得分起始位置结束位置等级
02745909你不知道啊,那是你自己动脑筋多呢,还是呃妈妈会姐姐只考的比较多。16.391.021313
12745909嗯,是的故事呀,叙事的非常完整,你看啊,横轴的故事里边,我们知道了。7.410.6231712
22745909可以呀,这就是速度快来刻画有点忘记这些加起来是不是?14.710.74711172
32745909嗯,那咱们看它就会扣太拿什么啦。44.501.271171793
42745909嗯,你是不是嗓子有点痒了,要不要喝一点点水啊。25.321.491792103
52745909而且再来想一想饱和的时候那中间是不是一定会有一条绳子红色的线条啊或者说红色的绳子把他绑起来然后这里会有一个人都可以把它?15.570.922102552
62745909是出来的内容啊。14.050.942552982
72745909我们整个上课的过程是不是啊?16.440.912983412
82745909不是很清楚,那我们再来看看这里吧。22.541.193413843

已知问题

  • 对话语音取自两个音频,尚未做时间上的对齐(可以在转文本阶段处理,或在文本分析前处理)。
  • 文本分析前的语音转文本,ASR准确率并不太高,影响后续分析效果。
  • 用BERT做分类速度太慢了,需要做模型蒸馏。蒸馏模型已经实现)
  • 评分模型目前只是不同形式的统计模型,后续加入语义分析能提高评分准确性。

其他

代码已经挂在我的Github上HoyTta0,欢迎Star,需要BERT预训练文件和训练好的ckpt可以留下邮箱地址,数据只给了一堂课,有需要可以自己根据数据格式构造。
其中,BERT代码参考了大佬的代码,稍微做了一些修改,改了一下网络结构以及修复了几个小bug,后续可能还会对数据输入部分做一些改进。

  • 5
    点赞
  • 30
    收藏
    觉得还不错? 一键收藏
  • 3
    评论
机器学习是一种人工智能(AI)的子领域,致力于研究如何利用数据和算法让计算机系统具备学习能力,从而能够自动地完成特定任务或者改进自身性能。机器学习的核心思想是让计算机系统通过学习数据中的模式和规律来实现目标,而不需要显式地编程。 机器学习应用非常广泛,包括但不限于以下领域: 图像识别和计算机视觉: 机器学习在图像识别、目标检测、人脸识别、图像分割等方面有着广泛的应用。例如,通过深度学习技术,可以训练神经网络来识别图像中的对象、人脸或者场景,用于智能监控、自动驾驶、医学影像分析等领域。 自然语言处理: 机器学习在自然语言处理领域有着重要的应用,包括文本分类、情感分析、机器翻译、语音识别等。例如,通过深度学习模型,可以训练神经网络来理解和生成自然语言,用于智能客服、智能助手、机器翻译等场景。 推荐系统: 推荐系统利用机器学习算法分析用户的行为和偏好,为用户推荐个性化的产品或服务。例如,电商网站可以利用机器学习算法分析用户的购买历史和浏览行为,向用户推荐感兴趣的商品。 预测和预测分析: 机器学习可以用于预测未来事件的发生概率或者趋势。例如,金融领域可以利用机器学习算法进行股票价格预测、信用评分、欺诈检测等。 医疗诊断和生物信息学: 机器学习在医疗诊断、药物研发、基因组学等领域有着重要的应用。例如,可以利用机器学习算法分析医学影像数据进行疾病诊断,或者利用机器学习算法分析基因数据进行疾病风险预测。 智能交通和物联网: 机器学习可以应用于智能交通系统、智能城市管理和物联网等领域。例如,可以利用机器学习算法分析交通数据优化交通流量,或者利用机器学习算法分析传感器数据监测设备状态。 以上仅是机器学习应用的一部分,随着机器学习技术的不断发展和应用场景的不断拓展,机器学习在各个领域都有着重要的应用价值,并且正在改变我们的生活和工作方式。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 3
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值