#-*-coding:utf8-*-
from lxml import etree
html = '''
<!DOCTYPE html><html><headlang="en"><metacharset="UTF-8"><title>测试-常规用法</title></head><body><divid="content"><ulid="useful"><li>这是第一条信息</li><li>这是第二条信息</li><li>这是第三条信息</li></ul><ulid="useless"><li>不需要的信息1</li><li>不需要的信息2</li><li>不需要的信息3</li></ul><divid="url"><ahref="http://yuanlief.com">此间少年</a><ahref="http://yuanlief.com/course/"title="似水流年">点我打开</a></div></div></body></html>
'''
selector = etree.HTML(html)
#提取文本
# content = selector.xpath('//ul[@id="useful"]/li/text()')
# for each in content:
# print each
#输出:这是第一条信息
#输出:这是第二条信息
#输出:这是第三条信息
#-------------------------------------------------------------------
#提取属性
#
# link = selector.xpath('//div[@id="url"]/a/@href')
# for each in link:
# print each
#输出http://yuanlief.com和http://yuanlief.com/course/
#-------------------------------------------------------------------
#title = selector.xpath('//a/@title')
#print title[0]#输出此间少年