python lxml中xpath解析sina只得到head

Question

python lxml中xpath解析sina只得到head

tdifg

211

发布于
2014-08-07

更新于
2014-08-07

新手上路，请多包涵

我在用urllib2和lxml解析sina主站点，我成功获得了页面，做了编码转换（print出来看是成功的），但是xpath解析只能得到html和head。

        html = self._Encoding(html)
        page = etree.HTML(html)
        if page == None:
            self.log.error('You got a None page,may be Encoding error, %s',page)
            return (None,None)

        x = page.xpath('/html')
        print x,type(x)
        for tmp in x:
            print tmp
            print tmp.tag
            print tmp.attrib
            print tmp.text
            for i in tmp.getchildren():
                print i.text
                print i.attrib
                print i.tag

如上，我得到：

  [<Element html at 0x2a04d08>] <type 'list'>
  <Element html at 0x2a04d08>
  html
  {}


  {}
  head

写的有点乱，全部的代码在:https://github.com/tdifg/Spidey/blob/master/spider/myspider.py
关键部分在_PageHandle函数中
-=-=-=-=-=-=-=-=-=-=-=-=-=-=-=-=-=-=-=-=-=-=-=-=-=-=-=-=-=-=-=-=-=-=-=-=-
重新编辑下，意思是这样的，如下：

        x = page.xpath('/html')
        print x[0].getchildren(),'child'

应该是输出这样的：

        [<Element head at 0x2a57188>, <Element body at 0x2a57148>]

但是结果是这样的：

        [<Element head at 0x2ac0ec8>]

python lxml python爬虫页面解析

阅读 8.6k

1 个回答

得票最新

tdifg

211

发布于
2014-08-07

新手上路，请多包涵

问题解决了，在这里记下。
问题就是我在改变了编码之后没有改变html页面的charset，而lxml根据页面做xpath解析就…所以解析不出东西。

撰写回答

你尚未登录，登录后可以

和开发者交流问题的细节
关注并接收问题和回答的更新提醒
参与内容的编辑和改进，让解决方法与时俱进

推荐问题

相似问题

找不到问题？创建新问题

python lxml中xpath解析sina只得到head

你尚未登录，登录后可以

字节的 trae AI IDE 不支持类似 vscode 的 ssh remote 远程开发怎么办？

DataCap 中验证码无法显示，后台出现 NullPointerException 错误?

如何使用 python 代码实现迅雷磁力链接资源的下载？

如何实现一个深拷贝函数？

请问，FastAPI如何获取到前端上传的二进制文件并且返回？

浏览器能请求到数据怎么换了api工具或是爬虫都没数据了呢？

Python 成员变量在多个子类实例间共享，如何避免？