最近因为要做一个采集网页主体内容的软件,所以找了好久,最后觉得“悦读”的效果最理想。
有装了“悦读”的同学可以在C:\Users\Administrator\AppData\Local\Google\Chrome\User Data\Default\Extensions\iooicodkiihhpojmmeghjclgihfjdjhjchrome
找到源码,因本人学业不精,目前还无法看懂代码如何调用,求大神指点,急用,万分感谢。
最近因为要做一个采集网页主体内容的软件,所以找了好久,最后觉得“悦读”的效果最理想。
有装了“悦读”的同学可以在C:\Users\Administrator\AppData\Local\Google\Chrome\User Data\Default\Extensions\iooicodkiihhpojmmeghjclgihfjdjhjchrome
找到源码,因本人学业不精,目前还无法看懂代码如何调用,求大神指点,急用,万分感谢。
早期的印象的文本提取用的是这个库https://github.com/hatena/extract-content-javascript/,不过印象笔记收编了Readability的作者后,貌似换了文本提取引擎。
8 回答4.8k 阅读✓ 已解决
6 回答3.5k 阅读✓ 已解决
5 回答2.9k 阅读✓ 已解决
5 回答6.4k 阅读✓ 已解决
4 回答2.3k 阅读✓ 已解决
4 回答2.8k 阅读✓ 已解决
3 回答2.5k 阅读✓ 已解决
我觉得其实就是html的解析,这块你看看各种爬虫是怎么写的就行了