如何爬取跳转网站的数据

目前在学习一些爬虫的知识，对于一些复杂的网站使用selenium进行爬取。
碰到一个问题，我需要爬取的工单网站（不知道密码）需要先通过登录一个鉴权系统，然后鉴权系统页面点击其中的工单系统连接，就会自动免登录跳转到工单系统网站，这种系统的数据我该如何使用爬虫进行抓取？
以下是鉴权系统selenium拿到关于工单系统的html

<a href="/link-test001" target="_blank" title="工单系统" rel="link-test001" data="1" datasrc="工单系统|||/files/link/test001.gif|||new|||/link-test001">
    <img src="/files/link/test001.gif" width="25" height="25" alt="工单系统" align="absmiddle"><span>工单系统</span>
</a>

selenium

python 网页爬虫

阅读 5.9k

2 个回答

atekul

✓ 已被采纳

用firefox的扩展selenium ide录制一遍操作。
然后导出为python文件。
改改运行就可以了。

建议你去读读虫师写的书。

XIAOXXX

751

发布于
2017-05-18

例如使用requests库作为爬虫的话，先创建session()，A登录，B是跳转的页面即可。

T=requests.session()
A=T.post(url=url,data=data)
B=T.get(url=url)

创建的T就代表存储的cookie，会一直保留

撰写回答

你尚未登录，登录后可以

和开发者交流问题的细节
关注并接收问题和回答的更新提醒
参与内容的编辑和改进，让解决方法与时俱进

推荐问题

相似问题

找不到问题？创建新问题

如何爬取跳转网站的数据

你尚未登录，登录后可以

字节的 trae AI IDE 不支持类似 vscode 的 ssh remote 远程开发怎么办？

DataCap 中验证码无法显示，后台出现 NullPointerException 错误?

如何使用 python 代码实现迅雷磁力链接资源的下载？

如何实现一个深拷贝函数？

请问，FastAPI如何获取到前端上传的二进制文件并且返回？

浏览器能请求到数据怎么换了api工具或是爬虫都没数据了呢？

Python 成员变量在多个子类实例间共享，如何避免？