怎么使用CasperJs抓取网页？

发布于
2015-09-14

在知乎上看到有个php爬虫的思路是这样写的：

pcntl_fork或者swoole_process实现多进程并发。按照每个网页抓取耗时500ms，开200个进程，可以实现每秒400个页面的抓取。

curl实现页面抓取，设置cookie可以实现模拟登录 simple_html_dom 实现页面的解析和DOM处理

如果想要模拟浏览器，可以使用casperJS。用swoole扩展封装一个服务接口给PHP层调用

在多玩网这里有一套爬虫系统就是基于上述技术方案实现的，每天会抓取几千万个页面。

第1、2点可以弄，当然我不用swoole。第3点中的casperJS不太懂，怎样用啊？

javascript php

阅读 6.3k

2 个回答

得票最新