在拿到数据集时,需要知道数据集中标注有哪些类别才能继续向下进行。
将下述标注xml文件的地址(annotation_path)转化成自己的即可。
import xml.dom.minidom as xmldom
import os
#获取数据集中所有标签的所有类别数"
annotation_path="C:\\Users\\WW\\Desktop\\dataset\\Annotation"
#这里输入自己的xml文件地址
annotation_names=[os.path.join(annotation_path,i) for i in os.listdir(annotation_path)]
labels = list()
for names in annotation_names:
xmlfilepath = names
domobj = xmldom.parse(xmlfilepath)
# 得到元素对象
elementobj = domobj.documentElement
#获得子标签
subElementObj = elementobj.getElementsByTagName("object")
for s in subElementObj:
label=s.getElementsByTagName("name")[0].firstChild.data
#print(label)
if label not in labels:
labels.append(label)
print(labels)
参考博主:https://blog.csdn.net/qq_38441692/article/details/104183666