scrapy无法正常爬取这段html的内容？

Question

我用的是scrapy的selector（基于lxml），
用的xpath语句是：//div[1]/div/div[1]/text())[7]
在火狐的xpath checker上测试都可以定位到时间部分，但在爬取时都是\R\N等空字符，后来看到网友的办法：

sel = Selector(response, response.body_as_unicode().replace('\r','').replace('\n',''), 'html')

尝试了下，依然有问题（只是把\r\n换成了空格），想请问到底是在哪里出了问题呢

阅读 5.3k

1 个回答

得票最新

用 chrome dev 看到的是最终的页面效果。

你试试查看源代码，在里面找找。因为这段 html 可能是 javascript 处理后的。

如果确认源码里面有，可以：右键 --> Copy --> Copy XPath

//*[@id="container-lg"]/div[1]/div/div[1]

撰写回答

推荐问题

相似问题

找不到问题？创建新问题