深入使用过lxml的都会深深地喜欢上它,虽然BeautifulSoup很流行,但是深入了解lxml后,你就再也不会使用bs了
我觉得beautifulsoup不好用,速度也慢(虽然可以使用lxml作为解析器了).另外soup.find_all
这种简直就是手工时代
的操作(很多人使用find
find_all
这几个函数, 其实它们使用起来不是很愉快),手工操作的另一个特征是需要自己手写正则表达式(正则是一个小范围内的军刀,大范围用是不对的)
多使用soup.select
才是正确的选择, 多简单方便.
爬虫对html页面做的操作,大部分时候在选取东西,find_all
还要自己手工去写(比如手工写正则表达式, it's a hell).
使用XPath
以及CSS选择器
才是明智的选择,这两者,浏览器都可以帮我们自动生成,何乐不为?
另外,lxml
用起来舒服多了,速度也不错.
另外,lxml安装是一个难题,常有很多错误,令人望而生畏,这里提供两种方法
Windows平台: 使用Anaconda集成安装包,无脑解决
Ubuntu平台:
sudo apt-get install python-lxml
无脑解决
我从不觉得去自己解决lxml在这些平台的安装有什么很大价值,反而容易令人自我怀疑.(宝贵的时间为何要浪费在这种事情上面?)
下面就来一个示例:
#####################
# 获取SF首页的标题
#####################
from lxml.etree import HTML
import requests
url = 'https://segmentfault.com/'
css_selector = '.title>a' #这是利用浏览器自动获取的,我甚至都不用知道它是什么意思
text = requests.get(url).text
page = HTML(text)
titles = []
for title in page.cssselect(css_selector):
titles.append(title.text)
print titles
# 这一段程序写下来,不用动脑筋(无脑写),不消耗心智
利用浏览器获取XPath/CSS选择器的方法:
1. 推荐使用Firefox, 比Chrome强大太多
2. 右键元素-->copy XPath
**粗体** _斜体_ [链接](http://example.com) `代码` - 列表 > 引用
。你还可以使用@
来通知其他用户。