自然语言处理
luoganttcc
这个作者很懒,什么都没留下…
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
transformer 中 位置 embeding
Transformer模型通过位置嵌入解决自注意力机制的"顺序无关性"问题。原论文采用正弦余弦位置嵌入,利用三角函数周期性捕捉相对位置关系,具有无需训练、泛化性强的特点。位置嵌入与词嵌入直接相加后输入模型。后续研究还提出了可学习的位置嵌入等变体,能更好适应特定任务需求。位置嵌入是Transformer理解序列顺序的关键设计。原创 2025-09-13 11:09:00 · 440 阅读 · 0 评论 -
在新发布的AI论文中 pytorch 和tensorflow 的使用比例
2025年学术研究领域呈现PyTorch主导趋势,其在顶级会议(NeurIPS、CVPR等)使用率超80%,主要得益于动态图设计、丰富生态工具及高效硬件适配。TensorFlow占比持续下降至10%左右,但仍凭借部署优势占据部分工业场景。新兴框架(如JAX)市场份额不足5%。数据显示PyTorch在arXiv论文提及量达65%,工业新项目占比68%,预计2026年学术使用率将突破85%。PyTorch 2.0的性能升级料将进一步巩固其主导地位。原创 2025-09-08 11:42:56 · 1774 阅读 · 0 评论 -
Embedding 层(tf.keras.layers.Embedding)文档翻译
摘要:TensorFlow的Embedding层将正整数索引转换为固定大小的稠密向量,适用于NLP等任务。该层接受固定范围的正整数输入,支持tf.Tensor和tf.RaggedTensor类型。主要参数包括词汇表大小(input_dim)、嵌入维度(output_dim)、初始化方式及掩码选项(mask_zero)等。输入为2D张量(batch_size, input_length),输出为3D张量(batch_size, input_length, output_dim)。默认情况下嵌入矩阵会放置在GP原创 2025-09-08 11:37:08 · 656 阅读 · 0 评论 -
pytorch 中是如何实现embeding 的
嵌入层(Embedding)是一种存储固定大小嵌入向量的查找表,主要用于存储词嵌入并通过索引检索。其核心参数包括嵌入字典大小(num_embeddings)、向量维度(embedding_dim)和可选的填充索引(padding_idx)等。该层的权重初始化为标准正态分布,输入为任意形状的索引张量,输出为对应嵌入向量。需注意:1)仅部分优化器支持稀疏梯度;2)启用max_norm时会原地修改权重张量,需先克隆权重才能进行可微操作。示例展示了如何创建嵌入层并处理批量索引输入。原创 2025-09-08 11:19:27 · 844 阅读 · 0 评论 -
PyTorch 中nn.Embedding
PyTorch的nn.Embedding模块用于将离散索引映射为稠密向量。其主要参数包括num_embeddings(词汇表大小)和embedding_dim(向量维度),可选padding_idx可指定填充索引。输入是整数索引张量(形状为[batch_size, seq_len]),输出为对应的嵌入向量(形状为[batch_size, seq_len, embedding_dim])。示例展示了如何创建嵌入层(10个类别,3维向量),并将2x3的输入索引转换为2x3x3的嵌入向量输出,同时输出了可训练的参原创 2025-09-08 10:54:46 · 383 阅读 · 0 评论 -
大模型的 Embedding 层和独立的 Embedding 模型有什么区别
独立Embedding模型(如Word2Vec)与LLM中的Embedding层存在本质差异。前者是静态的"字典",为每个词生成固定向量,不考虑上下文;后者则是Transformer结构的"秘书",动态生成词向量以适配后续模型层。独立模型是通用预训练产品,而LLM的Embedding层是专门为特定模型定制的,其效果取决于是否有助于整个模型完成预测任务。两者的设计理念和适用场景完全不同。原创 2025-09-07 19:40:21 · 1030 阅读 · 0 评论 -
注意力机制到底在做什么,Q/K/V怎么来的?一文读懂Attention注意力机制
《如何高效学习?知乎高赞回答精要》这篇文章总结了知乎上关于高效学习的实用方法。核心观点包括:明确学习目标、采用主动学习法、运用间隔重复记忆技巧、建立知识体系框架。文章特别推荐了费曼技巧——通过向他人讲解来检验理解程度,以及番茄工作法来保持专注。作者强调,学习效果的关键在于将知识转化为实际行动,而非单纯追求学习时长。这些方法适用于各类学习场景,能帮助读者提升学习效率和知识留存率。原创 2025-09-07 13:31:02 · 323 阅读 · 0 评论 -
ubuntu打包成iso镜像
https://zhuanlan.zhihu.com/p/349586567https://github.com/wenet-e2e/wenethttps://github.com/alphacep/vosk-apihttps://alphacephei.com/vosk/原创 2023-05-17 19:12:18 · 918 阅读 · 0 评论 -
语音识别项目
https://zhuanlan.zhihu.com/p/349586567https://github.com/wenet-e2e/wenethttps://github.com/alphacep/vosk-apihttps://alphacephei.com/vosk/原创 2023-04-27 17:04:29 · 417 阅读 · 0 评论 -
【Python】最全中文停用词表整理(1893个)(转载)
!"#$%&'()*+,---................................/.一.数.日///0123456789:://::;<=>>>?@ALex[\]^_`expsubsup|}~~~~~·××××ΔΨγμφφ.В——————‘’’‘“””,…………………………………………………………③′转载 2021-07-29 18:35:20 · 2091 阅读 · 0 评论 -
numpy.tile 阵列
b = np.array([[1, 2], [3, 4]])np.tile(b, 2)array([[1, 2, 1, 2, 1, 2], [3, 4, 3, 4, 3, 4], [1, 2, 1, 2, 1, 2], [3, 4, 3, 4, 3, 4]])原创 2020-07-30 17:24:01 · 327 阅读 · 0 评论 -
keras 文本分类模型
#!/usr/bin/env python3# -*- coding: utf-8 -*-"""Created on Wed Jul 29 20:21:28 2020@author: lg"""from __future__ import print_functionimport osimport sysimport numpy as npfrom keras.preprocessing.text import Tokenizerfrom keras.preprocessing.s转载 2020-07-30 14:26:18 · 521 阅读 · 0 评论 -
keras pad_sequences
pad_sequences 大白话的意思就是:空位补零import kerasfrom keras.preprocessing.text import Tokenizertokenizer = Tokenizer()# texttext = ["今天 北京 下 雨 了", "我 今天 加班"]# fit_on_texts 方法tokenizer.fit_on_texts(text)print(tokenizer.word_index)#{'今天': 1, '了': 2,原创 2020-07-30 13:53:54 · 1155 阅读 · 0 评论 -
Keras 文本预处理 text sequence
预处理句子分割、ohe-hot:from keras.preprocessing import textfrom keras.preprocessing.text import Tokenizertokenizer = Tokenizer(num_words=4) #num_words:None或整数,个人理解就是对统计单词出现数量后选择次数多的前n个单词,后面的单词都不做处理。tokenizer.fit_on_texts(texts)print( tokenizer.word_index)转载 2020-07-30 12:20:10 · 480 阅读 · 0 评论 -
python find
Python find() 方法从字符串中找出某个子字符串第一个匹配项的索引位置,该方法与 index() 方法一样,只不过如果子字符串不在字符串中不会报异常,而是返回-1。find() 方法语法:S.find(sub[,start=0[,end=len(S)]])参数sub – 指定检索的子字符串S – 父字符串start – 可选参数,开始索引,默认为0。(可单独指定)end – 可选参数,结束索引,默认为字符串的长度。(不能单独指定)#!/usr/bin/python3 S1原创 2020-07-30 11:30:03 · 304 阅读 · 0 评论 -
keras 简单的文本分类
from keras.preprocessing.sequence import pad_sequencesfrom keras.models import Sequentialfrom keras.layers import Densefrom keras.layers import Flattenfrom keras.layers.embeddings import Embedding...转载 2020-03-11 15:35:50 · 402 阅读 · 0 评论 -
nltk 文本预处理
分词from nltk import word_tokenizesentence = """3w.ναdΜāιι.com Provide you with a professional platform for the sale and purchase of virtual products for games. Welcome to settle in 3w.ναdΜāιι.com ...原创 2019-09-16 13:33:32 · 1415 阅读 · 0 评论 -
使用不同的方法计算TF-IDF值
添加链接描述原创 2019-09-16 21:31:58 · 211 阅读 · 0 评论 -
python提取字符串中的 中文 日文 韩文
import impimp.reload(sys) s=""" en: Regular expression is a powerful tool for manipulating text. zh: 汉语是世界上最优美的语言,正则表达式是一个很有用的工具 jp: 正規表現は非常に役に立つツールテキストを操作することです。 jp-char: あアいイうウえエおオ kr:정...原创 2019-09-17 15:11:43 · 5970 阅读 · 0 评论 -
python 正则之提取字符串中的汉字,数字,字母
#过滤字符串中的英文与符号,保留汉字import rest = &amp;amp;quot;hello,world!!%[545]你好234世界。。。&amp;amp;quot;ste = re.sub(&amp;amp;quot;[A-Za-z0-9\!\%\[\]\,\。]&amp;amp;quot;, &amp;amp;quot;&amp;amp;quot;, str)print(ste)原创 2018-07-06 20:58:39 · 38208 阅读 · 2 评论 -
python自然语言处理(五)chatterbot 搭建自动聊天机器人
#!/usr/bin/env python3# -*- coding: utf-8 -*-"""Created on Tue Apr 10 22:27:56 2018@author: luogan"""# -*- coding: utf-8 -*-from chatterbot import ChatBotbot = ChatBot( "Math & Tim...转载 2018-04-10 22:35:56 · 2417 阅读 · 0 评论 -
Python 中re.split()方法
import reline = 'aaa bbb ccc;ddd eee,fff'#单字符切割re.split(r';',line)['aaa bbb ccc', 'ddd eee,fff']#两个字符以上切割需要放在 [ ] 中re.split(r'[;,]',line)['aaa bbb ccc', 'ddd eee', 'fff']其实你需要记住的只是这...转载 2019-09-14 20:50:28 · 23962 阅读 · 0 评论 -
python 切割字符串
切割字符串,用split放法,分割符号为 ; , .import reline="3w.ναdΜāιι.com Provide you with a professional,platform for the sale and purchase of virtual products for games. Welcome to settle in 3w.ναdΜāιι.com"line_li...原创 2019-09-14 20:26:08 · 1106 阅读 · 0 评论 -
python 读取txt
f=open("foo.txt")for line in f: print (line)f = open("data.txt","r") #设置文件对象st= f.read() #将txt文件的所有内容读入到字符串str中f.close() #将文件关闭参考链接1参考链接2...原创 2018-08-01 15:05:08 · 512 阅读 · 0 评论 -
python word2vector (一)
from gensim.test.utils import common_texts, get_tmpfilefrom gensim.models import Word2Vecpath = get_tmpfile("word2vec.model")model = Word2Vec(common_texts, size=100, window=5, min_count=1, worker...原创 2018-07-31 22:58:04 · 914 阅读 · 0 评论 -
python TF-IDF
TF-IDF转载 2018-07-10 22:32:26 · 520 阅读 · 0 评论 -
python 自然语言处理 (六) 采用deepQA搭建自动聊天机器人
deepQA是基于tensorflow 实现的开源项目,采用神经网络实现的自动化聊天机器人,在目前,网上的公开中文语料库比较少,采用训练的语料一般都是英文的 第一步: 到github上下载项目 deepQA下载 第二步: 进入目录下运行python main.pyGPU下训练一...原创 2018-04-13 18:30:59 · 3717 阅读 · 0 评论 -
红楼梦的后四十回是不是曹雪芹所作--Python 自然语言处理(四)
对于红楼梦后四十回是否是曹雪芹所作,各有各的说法,我一直以为,人会说谎,但数据不会.我分别统计 第一回到四十回, 第四十一回到第八十回, 第八十一回到第一百二十回, 的词频: 1~40回, 与41~80回,有4个词等位相同,分别是第 0,2,7,14行的’宝玉’,’一个’,’贾母’,’出来’ 1~40回, 与81~120回,,有2个词等位相同,分别是第 0,3行的’宝玉’,’夫人’ ...原创 2018-04-02 23:34:13 · 2934 阅读 · 0 评论 -
python 自然语言处理(三)获取词性
获取词性import jieba.posseg as psgs ='我想和女朋友一起去北京故宫博物院参观和闲逛。'print ([(x.word,x.flag) for x in psg.cut(s)])#print ([(x.word,x.flag) for x in psg.cut(s) if x.flag.startswith('n')])[('我', 'r'), ('想'...转载 2018-04-02 22:09:44 · 6823 阅读 · 1 评论 -
python 自然语言处理(二) jieba 分词
import jiebas ='我想和女朋友一起去北京故宫博物院参观和闲逛。'#精确模式cut = jieba.cut(s)print (','.join(cut))我,想,和,女朋友,一起,去,北京故宫博物院,参观,和,闲逛,。 #全模式print ( ','.join(jieba.cut(s,cut_all = True)))我,想,和,女朋友,朋友,一起,去...转载 2018-04-02 22:01:35 · 663 阅读 · 0 评论 -
Python 自然语言处理(一)字频统计
import jiebatxt = open("红楼梦.txt", "r", encoding="gb18030").read()import collectionstxt1 = txttxt1 = txt1.replace('\n', '') # 删掉换行符txt1 = txt1.replace(',', '') # 删掉逗号txt1 = txt1.replace('。', ...原创 2018-04-02 17:59:44 · 3622 阅读 · 0 评论 -
python word2vector (三)
三体链接下载三体文件,将其从命名为santi.txt 将其放在程序的统一目录下#!/usr/bin/env python3# -*- coding: utf-8 -*-"""Created on Wed Aug 1 10:13:28 2018@author: luogan"""#!/bin/bash# -*-coding=utf-8-*-import jiebaim..原创 2018-08-01 15:34:07 · 416 阅读 · 0 评论 -
python 文本聚类算法
三体下载 将下载的文件重命名为santi.txt,放在文件的目录下import jiebaimport refrom gensim.models import word2vecimport multiprocessingimport gensimimport numpy as npimport pandas as pddef segment_text(source_cor...原创 2020-07-10 21:07:29 · 3816 阅读 · 2 评论 -
python 字符串去除中文
去除中文#去除中文import rep1='帮会建了徽信群 没在群里的加下徽信:[30109552300],晚上群里有活动通知大家,(抢资源),争地盘,谢谢配合。i love you 'linee=re.sub('[\u4e00-\u9fa5]', '', p1)print(linee) :[30109552300],,(),,。i love you 去除标点simple_...原创 2019-09-14 20:20:19 · 14968 阅读 · 0 评论 -
python 提取字符串中的中文字符
仅仅提取汉字字符p1='帮会建了徽信群 没在群里的加下徽信:[30109552300],晚上群里有活动通知大家,(抢资源),争地盘,谢谢配合。i love you 'pre = re.compile(u'[\u4e00-\u9fa5]')res = re.findall(pre, p1)res1=''.join(res)print(res1)'帮会建了徽信群没在群里的加下徽信晚上群里...原创 2019-09-14 20:11:00 · 5933 阅读 · 2 评论 -
python 字符串与列表的相互转化
str1 = "hi hello world"st2=str1.split(" ")print(st2)['hi', 'hello', 'world']l = ["hi","hello","world"]l1=" ".join(l)print(l1) 'hi hello world'原创 2019-09-14 20:02:14 · 201 阅读 · 0 评论 -
python 正则 去除字符串中异常字符
import resimple_punctuation = '[’!"#$%&\'()*+,-/:;<=>?@[\\]^_`{|}~,。,]'p1='帮会建了徽信群 没在群里的加下徽信:[30109552300],晚上群里有活动通知大家,(抢资源),争地盘,谢谢配合。i love you 'line = re.sub(simple_punctuation, '', p1...原创 2019-09-14 19:37:53 · 703 阅读 · 0 评论 -
正则表达式-匹配中英文、字母和数字
在做项目的过程中,使用正则表达式来匹配一段文本中的特定种类字符,是比较常用的一种方式,下面是对常用的正则匹配做了一个归纳整理。匹配中文:[\u4e00-\u9fa5]英文字母:[a-zA-Z]数字:[0-9]匹配中文,英文字母和数字及_:^[\u4e00-\u9fa5_a-zA-Z0-9]+$同时判断输入长度:[\u4e00-\u9fa5_a-zA-Z0-9_]{4,10}...原创 2019-09-11 15:01:46 · 1843 阅读 · 0 评论 -
word2vect负采样
添加链接描述原创 2019-05-05 17:50:49 · 694 阅读 · 0 评论 -
word2vec刘建平
添加链接描述原创 2019-05-05 17:18:20 · 670 阅读 · 0 评论
分享