python采集百度新闻的原理是什么?

发布于
2016-07-07

火车头有一个正文提取器,而且不少的采集软件都有这个东西,但是就是一直不知道这些东西到底是怎么实现的?

或是有高人说下实现的原理是多少?

比如步骤?

或是如何用python来实现,可以举个简单的例子

python 网页爬虫采集采集思路

阅读 5.4k

3 个回答

娃娃脾气

发布于
2016-07-07

更新于
2016-07-07

图片描述
来源地址：http://www.cnblogs.com/jasondan/p/3497757.html

KingzCheung

发布于
2016-07-07

比较针对性的，可以使用p，article这些标签来简单判断。如果需要普遍一点的，可以对采集的网页数据进行分析，比如写一个算法计算中文（非标签文字）的密集性来判断是不是正文。具体没做过，但是思路基本是这样。

发布于
2016-07-07

HTTP协议模拟,(通常用request,urllib2模块)
信息提取(由于HTML文档特殊性,一般会用xpath,beautifulsoup)

撰写回答

你尚未登录，登录后可以

和开发者交流问题的细节
关注并接收问题和回答的更新提醒
参与内容的编辑和改进，让解决方法与时俱进

推荐问题

相似问题

找不到问题？创建新问题