python怎么使用javascript_如何使用python解析Javascript变量?

问题:我试图从中收集数据的网站使用Javascript来生成图表.我希望能够提取图中使用的数据,但我不知道从哪里开始.例如,数据可能如下:

var line1=

[["Wed, 12 Jun 2013 01:00:00 +0000",22.4916114807,"2 sold"],

["Fri, 14 Jun 2013 01:00:00 +0000",27.4950008392,"2 sold"],

["Sun, 16 Jun 2013 01:00:00 +0000",19.5499992371,"1 sold"],

["Tue, 18 Jun 2013 01:00:00 +0000",17.25,"1 sold"],

["Sun, 23 Jun 2013 01:00:00 +0000",15.5420341492,"2 sold"],

["Thu, 27 Jun 2013 01:00:00 +0000",8.79045295715,"3 sold"],

["Fri, 28 Jun 2013 01:00:00 +0000",10,"1 sold"]];

这是定价数据(日期,价格,数量).我在这里发现了另一个问题 – Parsing variable data out of a js tag using python – 这表明我使用JSON和BeautifulSoup,但我不确定如何将它应用于这个特定问题,因为格式略有不同.事实上,在这个问题中,代码看起来更像是python而不是任何类型的JSON字典格式.

我想我可以用字符串读取它,然后使用XPATH和一些时髦的字符串编辑来转换它,但这对于已经格式化为Javascript变量的东西来说似乎太多了.

那么,在使用python时,我可以在这里从这个变量中提取这种有组织的数据? (我最熟悉python和BS4)

解决方法:

如果您的格式只是一个或多个var foo = [JSON数组或对象文字];,您可以编写一个dotall正则表达式来提取它们,然后将每个格式解析为JSON.例如:

>>> j = '''var line1=

[["Wed, 12 Jun 2013 01:00:00 +0000",22.4916114807,"2 sold"],

["Fri, 14 Jun 2013 01:00:00 +0000",27.4950008392,"2 sold"],

["Sun, 16 Jun 2013 01:00:00 +0000",19.5499992371,"1 sold"],

["Tue, 18 Jun 2013 01:00:00 +0000",17.25,"1 sold"],

["Sun, 23 Jun 2013 01:00:00 +0000",15.5420341492,"2 sold"],

["Thu, 27 Jun 2013 01:00:00 +0000",8.79045295715,"3 sold"],

["Fri, 28 Jun 2013 01:00:00 +0000",10,"1 sold"]];\s*$'''

>>> values = re.findall(r'var.*?=\s*(.*?);', j, re.DOTALL | re.MULTILINE)

>>> for value in values:

... print(json.loads(value))

[[['Wed, 12 Jun 2013 01:00:00 +0000', 22.4916114807, '2 sold'],

['Fri, 14 Jun 2013 01:00:00 +0000', 27.4950008392, '2 sold'],

['Sun, 16 Jun 2013 01:00:00 +0000', 19.5499992371, '1 sold'],

['Tue, 18 Jun 2013 01:00:00 +0000', 17.25, '1 sold'],

['Sun, 23 Jun 2013 01:00:00 +0000', 15.5420341492, '2 sold'],

['Thu, 27 Jun 2013 01:00:00 +0000', 8.79045295715, '3 sold'],

['Fri, 28 Jun 2013 01:00:00 +0000', 10, '1 sold']]]

当然这会做一些假设:

>行末尾的分号必须是实际的语句分隔符,而不是字符串的中间.这应该是安全的,因为JS没有Python风格的多行字符串.

>代码实际上在每个语句的末尾都有分号,即使它们在JS中是可选的.大多数JS代码都有那些分号,但显然不能保证.

>数组和对象文字实际上是JSON兼容的.绝对不能保证;例如,JS可以使用单引号字符串,但JSON不能.但它确实适用于你的例子.

>你的格式确实很明确.例如,如果可能有类似var line2 = [[1]] line1的语句;在代码中间,它会导致问题.

请注意,如果数据可能包含并非所有有效JSON的JavaScript文字,但都是有效的Python文字(这不太可能,但也不是不可能),您可以在它们上使用ast.literal_eval而不是json .loads.但除非你知道情况如此,否则我不会这样做.

标签:javascript,python,beautifulsoup,web-scraping

来源: https://codeday.me/bug/20191007/1868314.html

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值