python提取标签中的内容

发布于
2014-06-18

更新于
2014-06-18

抓取了一个网页，网页中一部分内容如下：
网页数据
我使用如下代码：

import codecs
#coding=utf-8
from lxml import etree
f=codecs.open("1.html","r","utf-8")
content=f.read()
f.close()
tree=etree.HTML(content)
node=tree.xpath("//div[@class='content']")[0]
print node.text.encoding('gbk')

但是只能输出：奥迪阿萨德，第一个 em标记之后的内容都不能输出，请问该如何解决？

python html lxml

阅读 26.8k

2 个回答

✓ 已被采纳

lxml 的element.text返回的是这个元素第一个节点的内容，所以会出现这样的问题。可以用getText这个辅助方法来解决：

# require lxml
# version: python2
def getText(elem):
    rc = []
    for node in elem.itertext():
        rc.append(node.strip())
    return ''.join(rc)

这里可以直接修改最后一行即可：

import codecs
#coding=utf-8
from lxml import etree

def getText(elem):
    rc = []
    for node in elem.itertext():
        rc.append(node.strip())
    return ''.join(rc)

f=codecs.open("1.html","r","utf-8")
content=f.read()
f.close()
tree=etree.HTML(content)
# 返回的是lxml.etree._Element,可以直接作为getText参数来调用。
node=tree.xpath("//div[@class='content']")[0]
print getText(node).encoding('gbk')

这里的getText只是简单的实现，比如下面的xml文本会打印abdc,应该可以达到你的要求。

<div class="content">
    a<em>b <em>d</em></em>c
</div>

社区维基

发布于
2014-06-18

更新于
2014-06-20

#!/usr/bin/env python3
from bs4 import BeautifulSoup

f = open("1.html", "r")
html = BeautifulSoup( f.read() )
node = html.select(".content")[0]
print( node.prettify() )

html.select(".content")这个可能需要更多的选择器限定一下。另外只是大概写了下BeautifulSoup如何运作的，具体需求可以查看手册：Beautiful Soup 文档

撰写回答

你尚未登录，登录后可以

和开发者交流问题的细节
关注并接收问题和回答的更新提醒
参与内容的编辑和改进，让解决方法与时俱进

推荐问题

相似问题

找不到问题？创建新问题

python提取标签中的内容

你尚未登录，登录后可以

Qt中布局是否只有5种呢？

这段代码为什么不能获取到数据？

字节的 trae AI IDE 不支持类似 vscode 的 ssh remote 远程开发怎么办？

请问一下，如何理解reduce函数呢？

如何使用Python+Selenium爬取Goodreads上万条书评而不崩溃？

如何使用 python 代码实现迅雷磁力链接资源的下载？

在PyCharm开发不同python项目，如果每个项目使用自己的venv环境，是不是每次切换项目都需要修改python interpreter？