通过 urllib 将网页内容抓取下来,然后用正则表达式 re 模块将标题匹配出来,但是发现部分标题会出现问题,比如下面抓 Apple 的代码运行结果是 App
,测试发现匹配结果 m 是没有问题的,问题出现在了 strip() 这里。
# -*- coding: utf-8 -*- import urllib import re url='http://apple.com' html = urllib.urlopen(url).read() #print html m = re.search("<title>.*</title>", html) print m.group() # 这里输出结果 <title>Apple</title> print m.group().strip("</title>") #问题应该出现在这个正则
有一个简单的错误。HTML文件不能用正则表达式parse,因为他的文法比正则表达式高级,具体原因参考这里。
推荐解析这种HTML用一些第三方库,例如mechanize
我的代码如下:
输出为Apple
对于mechanize的详细使用,参考这里
安装mechanize,就easy_install一下就好。