【爬虫工具】下载博客转成Markdown的形式

简单的爬虫工具

下载博客，并转成Markdown的形式

为什么要写这个工具

主要是为了收集好的网上资源，每次看到一篇好的文章就像保存下来，但是保存网页的可读性太差了，如果转换成Markdown的形式就很舒服。但是网页中会有许多无聊的标签干扰，于是写个简单的工具

使用的python库

beautifulsoup4
requests
html2text

使用方法举例

import html2md

url_list = [
        'http://blog.csdn.net/qq_37482544/article/details/63720726', # csdn
        'https://www.jianshu.com/p/b6220e99df2d', # jianshu
        'https://juejin.im/post/5a68437b6fb9a01ca47aabc6', # juejin
        'https://segmentfault.com/a/1190000011929414', # segmentfault
        'http://www.voidcn.com/article/p-giqfrkhb-bbr.html', # 其他
        'https://www.cnblogs.com/zxqstrong/p/4789105.html'
    ]
for url in url_list:
    checkSite(url)

项目地址

https://github.com/No-96/Feng...

【爬虫工具】下载博客转成Markdown的形式

简单的爬虫工具

为什么要写这个工具

使用的python库

目录

使用方法举例

项目地址

电龙

引用和评论

CSS选择器引起的一些思考

怎么来爬取代理服务器ip地址？（python）

Anaconda安装教程以及Anaconda和pip配置国内镜像

如何减少跨团队交付摩擦？——基于 DevOps 与敏捷的最佳实践

Python 描述符

科学计算编程涉及到的技术栈简介

PC版-vue3.5对接deepseek构建网页版AI流式输出聊天界面