做爬虫的时候，怎么判断是否爬过呢

过往云烟

发布于
2017-02-07

以前没有做过爬虫，现在项目有个需求就是要爬取指定论坛的某个板块的帖子下面如果出现 “机械XXX” 等关键字就要抓取通知管理员，

但是现在有个问题，怎么判断是否爬过呢，目前这个爬虫第一版只爬帖子内容不爬回复，目前想到的思路是定时爬前20页的id 然后去数据库里对比是否有id 如果不存在此id再继续爬，不知道这个思路怎么样

但是第二版的话就要爬回复内容了这个应该怎么实现呢？各位大神有什么思路吗

python python爬虫 nodejs爬虫

阅读 5.8k

4 个回答

背萝卜的少年

发布于
2017-02-07

新手上路，请多包涵

每个html页面都是一棵dom树,你爬取的时候记录下每一个敏感词在节点中的位置,然后再数据库中对比,完活儿.

未闻花名

发布于
2017-02-08

请使用布隆过滤器

发布于
2017-02-08

记录下爬去过的id的思路很对呀，即使是回复内容，也可以这样子做，记录下回复的id、时间等标识性信息就可以了

撰写回答

你尚未登录，登录后可以

和开发者交流问题的细节
关注并接收问题和回答的更新提醒
参与内容的编辑和改进，让解决方法与时俱进

推荐问题

相似问题

找不到问题？创建新问题