当前位置: 移动技术网 > IT编程>脚本编程>Python > 新闻类网站的通用爬虫--GNE

新闻类网站的通用爬虫--GNE

2020年01月04日  | 移动技术网IT编程  | 我要评论

邪恶力量第四季,天南星图片,多梦网络

 

gne(generalnewsextractor)是一个通用新闻网站正文抽取模块,输入一篇新闻网页的 html, 输出正文内容、标题、作者、发布时间、正文中的图片地址和正文所在的标签源代码。gne在提取今日头条、网易新闻、游民星空、 观察者网、凤凰网、腾讯新闻、readhub、新浪新闻等数百个中文新闻网站上效果非常出色,几乎能够达到100%的准确率。

使用方式非常简单:

from gne import generalnewsextractor

extractor = generalnewsextractor()
html = '网站源代码'
result = extractor.extract(html)
print(result)

  扫描公众号查看原文

如对本文有疑问,请在下面进行留言讨论,广大热心网友会与你互动!! 点击进行留言回复

相关文章:

验证码:
移动技术网