read_table()参数sep与delimiter之细微差别

最新推荐文章于 2023-09-27 16:37:50 发布

SuperBetterMan

最新推荐文章于 2023-09-27 16:37:50 发布

阅读量6.5k

点赞数 1

分类专栏：那些年踩过的坑知识图谱

本文链接：https://blog.csdn.net/SuperBetterMan/article/details/104753358

版权

那些年踩过的坑同时被 2 个专栏收录

41 篇文章 1 订阅

订阅专栏

知识图谱

9 篇文章 20 订阅

订阅专栏

当我读取三元组文件的时候，通过pd.read_table()函数，跑完之后，遇到了一些奇奇怪怪的结果，我将问题锁定在这个函数上。
在这里插入图片描述
这是我的三元组文件

h_r_t_name = [":START_ID", "role", ":END_ID"]
h_r_t = pd.read_table("redata.txt",delimiter=',', names=h_r_t_name)#delimiter
print(h_r_t.info())
print(h_r_t.head())

原先我是这样写的，它就把三类全部归到:START_ID上，让我很迷。
查看一下参数文档在这里插入图片描述
看到这还有一个参数sep，我打着试试看的心理，居然ok了！wtf
莫名其妙我丢
于是查看了官方的文档，是这样介绍的

read_csv(filepath_or_buffer, sep=',', delimiter=None, header='infer', names=None, index_col=None, usecols=None, squeeze=False, prefix=None, mangle_dupe_cols=True, dtype=None, engine=None, converters=None, true_values=None, false_values=None, skipinitialspace=False, skiprows=None, nrows=None, na_values=None, keep_default_na=True, na_filter=True, verbose=False, skip_blank_lines=True, parse_dates=False, infer_datetime_format=False, keep_date_col=False, date_parser=None, dayfirst=False, iterator=False, chunksize=None, compression='infer', thousands=None, decimal=b'.', lineterminator=None, quotechar='"', quoting=0, escapechar=None, comment=None, encoding=None, dialect=None, tupleize_cols=None, error_bad_lines=True, warn_bad_lines=True, skipfooter=0, doublequote=True, delim_whitespace=False, low_memory=True, memory_map=False, float_precision=None)

sep :
字符串，分割符，默认值为‘，’。如果sep为None，则C引擎无法自动检测分隔符，但Python解析引擎可以检测，这意味着将使用后者，并通过Python的内置嗅探器csves.niffer自动检测分隔符。此外，长度大于1个字符的分隔符将被解释为正则表达式,并强制使用Python解析引擎。正则表达式示例：’\r\t’
delimiter :
字符串,分割符，默认值为 none。其是相当于sep的替代品，指定delimiter，那么sep便失效。
我丢

SuperBetterMan

关注

1
点赞
踩
7

收藏

觉得还不错? 一键收藏
2
评论
read_table()参数sep与delimiter之细微差别

当我读取三元组文件的时候，通过pd.read_table()函数，跑完之后，遇到了一些奇奇怪怪的结果，我将问题锁定在这个函数上。这是我的三元组文件h_r_t_name = [":START_ID", "role", ":END_ID"]h_r_t = pd.read_table("redata.txt",delimiter=',', names=h_r_t_name)#delimiter...
复制链接

扫一扫