自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+

一休哥的专栏

关注前沿,努力积累

  • 博客(81)
  • 资源 (6)
  • 收藏
  • 关注

原创 计算机专业之我见

计算机算法为解决问题提供了系统的步骤和方法。无论是开发软件应用、优化搜索引擎、处理大数据,还是进行人工智能的训练,算法都起着至关重要的作用。:表示算法执行所需的时间,通常用“大O”符号表示,如O(n)、O(log n)、O(n^2)等。算法分析主要关注算法的效率和资源使用,通常通过时间复杂度和空间复杂度来衡量。算法是解决问题的一系列明确指令或步骤。计算机专业的应用领域非常广泛,几乎涵盖了所有行业。:表示算法执行所需的内存空间,同样用“大O”符号表示。方向二:专业与个人的匹配度判断。方向三:专业前景分析。

2024-06-13 09:38:27 239

原创 pytorch中的zero_grad()函数的含义和使用

在反向传播计算时,梯度的计算是累加,但是每个batch处理时不需要和其它batch混合起来累加计算,所以对每个batch调用zero_grad将参数梯度置0。#如果不是每个batch清理依次梯度,而是两次或者多次清理,相当于提高了batch批次大小。optimizer.step()#更新参数,梯度被反向计算之后,调用函数进行所有参数更新。optimizer.zero_grad() ,用于将模型的参数梯度初始化为0。optimizer.zero_grad()#将模型参数梯度置为0;

2024-06-07 11:00:00 211

原创 Excel表格转markdown格式

markdown格式的数据可以存入大模型的知识库中,使用大模型进行excel表格内容的检索温度。3.查找标题部分,有些标题包含合并单元格,将其进行拆解;拆解后转为markdown格式;4.处理body部分,从标题往下,转markdown结构。2.有些表格开头是表格内容描述,将其查找出来;1.通过pandas读取excel文件;

2024-06-04 15:25:24 281

原创 Linux 使用crontab定时执行shell 脚本

1.编写脚本,并设置脚本为可执行权限chmod a+x 脚本名称。2.设置crontab定时任务,执行。

2024-05-13 09:47:43 119

原创 conll-2012-formatted-ontonotes-5.0中文数据格式说明

CoNLL-2012 数据格式是用于自然语言处理任务的一种常见格式,特别是在命名实体识别、词性标注、句法分析和语义角色标注等领域。这种格式在 CoNLL-2012 共享任务中被广泛使用,该任务主要集中在语义角色标注上。CoNLL-2012 数据格式通常包括多列,每列包含不同类型的语言学信息。这个示例中同一共指簇的信息为 [82, 9, 9], [82, 6, 7],表示第9个词“其”和第6和第7“卡通形象”,指代相同。第二列是文档片段iid,大部分是0。其中,共指标记中,相同数字的表示同一指代簇。

2024-05-08 17:29:57 827

原创 指代消解类方法梳理

MLM:带遮罩的语言模型NSP:单句预测,任务包括两个输入序列SBO:分词边界目标。

2024-05-06 15:47:00 887

原创 corefBERT论文阅读

corefBERT语言表示模型,可以更好的捕获和表示共引用信息。corefBERT引入一种新的预训练任务MRP(mention refenrece prediction),MRP利用重复出现的提及获得丰富的共指关系。MRP使用掩码方法遮盖一个或者多个提及,模型预测被遮盖住的整个提及。根据上图,词的损失由MRP提及参考预测和MLM遮盖语言建模损失两部分构成。

2024-05-06 13:38:18 817 1

原创 指代消解原理

指代,在下文采用简称或者代称来代替上文已经出现的某一词语,语言学中把这种现象叫做指代现象。指代,是语言学中的一种语言现象,使用指代词来代替文本中已经出现的某个语言单元的表达方式。将代表同一实体的不同表述划分到一个等价集合的过程称为指代消解。指代消解在信息抽取、智能问答等任务中,具有十分重要的作用。

2024-04-30 18:07:23 561

原创 optim.lr_scheduler.StepLR学习

2.定义优化器: 创建一个优化器(如 SGD 或 Adam)并将模型的参数传递给它,近年来Adam使用较多。在训练循环中使用: 在每个训练迭代(或每个 epoch)结束时,调用学习率调度器的 step()方法。在 PyTorch 中,学习率调度器一般与优化器一起使用,实现在训练过程中动态调整学习率。3.定义学习率调度器StepLR: 创建一个学习率调度器,并将其与优化器关联。是 PyTorch 中的一个学习率调整器,按照一定的步长调整学习率。1.构建模型: 构建神经网络模型。

2024-04-24 10:50:55 351

原创 torch.nn.Embedding学习

padding_idx (python:int, optional) – 填充id,比如,输入长度为100,但是每次的句子长度并不一样,后面就需要用统一的数字填充,而这里就是指定这个数字,这样,网络在遇到填充id时,就不会计算其与其它符号的相关性。3.产出计算结果,送入网络的维度是[seq_len, batch_size],产出结果维度是[seq_len, batch_size,embedding_size],最后一个维度为词向量。1.随机初始化词向量层,构建二维表,存储语料中每个词的词向量;

2024-04-24 10:04:03 186

原创 SpanBert学习

根据集合分布,随机选择一段span的长度,之后根据均匀分布随机选择这一段的起始位置,然后按照长度进行遮盖。使用几何分布取p=0.2,最大长度为10,通过采样,平均遮盖长度为3.8个词的长度。2.SBO span boundary objective ,希望被遮盖span边界的词向量,能学习到span的内容。再训练时,取span前后边界的两个词,用这两个词向量加上span中被遮盖词的位置向量,预测原词。最后预测span中原值时计算新损失,即SBO目标的损失。将词向量和位置向量拼接起来,加两层全连接。

2024-04-23 17:17:46 805 1

原创 GELU激活函数

假设输入为X, mask为m,则m服从一个伯努利分布(Φ ( x ) \Phi(x)Φ(x), Φ ( x ) = P ( X < = x ) , X 服 从 标 准 正 太 分 布 \Phi(x)=P(X

2024-04-23 11:34:47 373

原创 常用的np操作

给定一组 (xi, yi),其中 i = 1, 2, ..., n,而且 xi 是有序的,称为「标准点」。两个函数名称都是以 spl 开头,全称 spline (样条),可以理解这两个函数都和样条有关。1)输入:x为特征,y为目标变量. 2)输出:r: 相关系数 [-1,1]之间,p-value: p值。注: p值越小,表示相关系数越显著,一般p值在500个样本以上时有较高的可靠性。rep:representation 的缩写,那么 splrep 其实生成的是一个「表示样条的对象」「风险平价」模型权重。

2024-04-19 15:04:44 322

原创 Relu激活函数

激活函数,relu的整体效果较好

2024-04-19 09:16:51 957

原创 机器学习实战-k近邻分类

k-近邻算法(KNN),工作原理

2024-04-15 17:04:42 393 2

原创 机器学习实战-决策树

决策树(Decision Tree)是在已知各种情况发生概率的基础上,通过构成决策树来求取净现值的期望值大于等于零的概率,评价项目风险,判断其可行性的决策分析方法,是直观运用概率分析的一种图解法。由于这种决策分支画成图形很像一棵树的枝干,故称决策树。在机器学习中,决策树是一个预测模型,他代表的是对象属性与对象值之间的一种映射关系。

2024-04-15 13:55:55 382 1

原创 时间序列预测负荷、客流量等

时间序列可以进行电力负荷预测、客流量预测等。时间序列使用双向网络的效果优于单项网络,LSTM、GRU网络等可以根据自己的数据进行测试,选择符合自己场景的网络模型。

2024-04-15 13:48:15 505

原创 GPlink进行关系抽取流程梳理

1)读取输入的文本内容,对其进行tokenizer计算,产出计算特征;2)对语料进行shuffle3)计算label4)计算schema5)定义网络定义GlobalPointer,创建实体网络、关系头网络、关系尾网络;6)稀疏交叉熵计算损失值使用BertAdam进行优化。

2024-02-20 11:32:08 429

原创 推荐系统-概述

推荐系统、系统过滤,旨在为用户提供个性化的信息服务和内容推荐,以满足用户的特定需求和喜好。

2024-02-06 13:17:14 841 1

原创 大模型综述

模型是指人工智能预训练大模型,具有海量参数和复杂架构,用于深度学习任务的模型,拥有强大的处理能力和表征能力,以数据+算力为支撑,借助数据管理、模型训练、评估优化、服务平台、插件等辅助工具,开发基础大模型或行业大模型,再延伸至工业、金融、医疗、交通等下游场景应用。

2024-02-06 10:45:14 1710

原创 推荐系统学习总结

2.1用户行为数据 用户行为数据在网站上最简单的存在形式就是日志。网站运行中产生原始日志,并存在文件系统。1.用户行为在个性化推荐中分为两种:显示反馈和隐形反馈(浏览)。各网站例子:(1)视频网站:显性:用户对视频评分;隐性:用户观看视频日志/浏览视频页面的日志(2)电子商务网站:显性:用户对商品评分;隐形:购买日志,浏览日志

2024-02-06 10:38:00 800 1

原创 JAVA json转xml

首先要去官方下载json-lib工具包https://mvnrepository.com/artifact/net.sf.json-lib/json-lib/2.4目前最新的是2.4的版本,json-lib还需要以下依赖包:通过mvn库可以直接去下载。jakartacommons-lang 2.5jakartacommons-beanutils 1.8.0jakartaco

2024-02-06 10:37:28 842 1

原创 python yield含义

python下的yield含义

2022-11-03 11:33:02 277 1

原创 java 写excel文件

java将抽取的结构化数据存入excel中

2022-09-22 10:23:26 2020

原创 Java Maven项目打jar包方法

java maven项目打jar包

2022-09-22 10:07:38 1172

原创 英文词性标注PTB标准

词性 名称 英文解释 中文解释 例子及注解 CC 并列连词 Coordinating conjunction 并列连接词 and,but CD 基数词 Cardinal number 基数 one,4000 DT 限定词 Determiner 限定词 the, a EX 副词 Existential"there" 存在型there there FW 外来词 .

2022-04-11 16:08:13 618

转载 自然语言表示简史(BERT/ELMO/Word2vec/LDA/Bow/Ohehot,词向量、句向量、优缺点、应用与解决的问题)

本文链接:https://blog.csdn.net/rensihui/article/details/103284986收起一、自然语言表征与计算机表示自然语言是指一种人类社会中自然地随文化演化的语言,聪明的人类经过万年的积累,并通过后天良久的学习才能理解语言的魅力和含义,机械的计算机当然不能如此容易地表达出来。要了解自然语言的计算机表示,我们首先从发展、工业落地更加成熟的图像领域说起,图像使用非负数的矩阵表示像素点,是低层次的,连续的数据和特征。图像的任务,如分类...

2021-05-15 10:31:45 868

原创 图片集合

2019-03-26 14:44:14 1241

原创 基于cnn和rnn的文本分类实践

本文主要介绍在文本分类中,使用CNN网络和RNN网络的实践,其中CNN又分为maxPool和k-maxpool。可以直接在juputer执行。代码已经上传githubhttps://github.com/yixiu00001/text-classify-cnn-rnn/blob/master/README.md1.CNN+maxPooltext-classification-cnn-maxpool...

2018-04-28 16:28:17 1744 1

原创 斯坦福 stanford coreNLP 中的PCFG parser-lexparser

PCFG模型训练Java -Xmx7g edu.stanford.nlp.parser.lexparser.LexicalizedParser -tLPP edu.stanford.nlp.parser.lexparser.ChineseTreebankParserParams -train data/source/dataCTBZh//bracketed -saveToSerializ...

2017-07-13 18:05:04 3060 5

原创 斯坦福大学Stanford coreNLP 宾州树库依存句法标注体系

斯坦福大学Stanford coreNLP 依存句法标注体系

2017-07-13 18:02:21 5925

原创 斯坦福stanford coreNLP 宾州树库汉语短语类别表23个

短语分类

2017-07-13 17:58:54 3558 2

原创 斯坦福Stanford coreNLP宾州树库的词性标注规范

宾州树库的词性标注规范

2017-07-13 17:57:01 6921

原创 stanford coreNLP CRFClassifier 模型加载和序列化

源代码位置:ie.crf.CRFClassifier模型加载loadClassifier(String loadPath, Properties props)/** * Loads a classifier from the file, classpath resource, or URL specified by loadPath. If loadPath ends in * .gz, us

2017-07-05 09:52:16 1641

原创 stanford CoreNLP 命名实体识别NER学习笔记

简介 识别文本的命名实体,如人名和机构名称等。每种语言识别出的实体是相互独立的,英文的识别集合比其他语言更为丰富。再NERClassifierCombiner中,会执行多个命名实体识别,然后将结果组合起来。识别类别       在英文中,命名实体识别能识别的名字包括:人名、地名、机构名、MISC;数字:钱、数字、序号、百分比;时间:日期,时间、持续序列、集合等实体。命名实体的识别使用组

2017-07-05 09:39:35 14484 4

原创 JAVA json转xml

https://mvnrepository.com/artifact/net.sf.json-lib/json-lib/2.4 目前最新的是2.4的版本,json-lib还需要以下依赖包: 通过mvn库可以直接去下载。 jakartacommons-lang 2.5 jakartacommons-beanutils 1.8.0 jakartacom

2017-05-24 17:17:17 4676

原创 推荐系统学习总结

推荐系统,用户行为数据,特征构建

2017-04-01 17:40:33 2638 1

原创 spark pipeline原理学习和记录

概念MLlib提供标准的机器学习算法API,能够方便的将不同的算法组合成一个独立的管道,或者叫工作流。 • DataFrame:ML API使用Sark SQL中的DataFrme作为机器学习数据集,可容纳各种类型的数据,如DataFrame可能是存储文本的不同列,特征向量,真正的标签或者预测。       • 转换器:Transformer是一种算法,可以将一个DataFrame转换成

2017-03-24 13:29:11 11863 1

转载 知识图谱研究进展

本文首先简要回顾知识图谱的历史,探讨知识图谱研究的意义。其次,介绍知识图谱构建的关键技术,包括实体关系识别技术、知识融合技术、实体链接技术和知识推理技术等。然后,给出现有开放的知识图谱数据集的介绍。最后,给出知识图谱在情报分析中的应用案例。— 漆桂林、高桓、吴天星 东南大学计算机科学与工程学院本文节选自《情报工程》2017 年第 1 期,知识图谱专题稿件。1 知识图谱构建技术本节首先给出知识图谱的

2017-03-22 13:29:06 6876

原创 Introducing the Knowledge Graph: things, not strings【阅读翻译】

ntroducing the Knowledge Graph: things, not strings【阅读翻译】

2017-03-22 10:34:10 6816

指代消解的语料,ontonotes数据,已经处理好

指代消解的语料,ontonotes数据,已经处理好

2024-06-13

pku98-人民日报分词语料1998年1月份

人民日报分词语料1998年1月份,包含训练和两份语料和汇总语料,可以自行训练和验证模型使用。

2020-11-09

g2pv.json测试数据源文件

g2pv.json数据可以用于展现前端词云,2.经过一番百度谷歌终于找到G2, 参照官网的例子 https://antv.alipay.com/g2/doc/tutorial/advance/draw-word-cloud.html 3.G2可以根据给定图形生成词云,所以就能够生成自己想要的词云,注意给定的模板图片一定要轮廓分明,最好是外围都是白色

2019-03-26

八爪鱼安装包

八爪鱼安装包,可定制,使用方便,门槛低。

2018-11-30

汉字编码一级字库

一级汉字库

2016-06-14

2014年第33次中国互联网络发展状况统计

2014年第33次中国互联网络发展状况统计

2014-08-12

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除