专属客�18376668806 在线咨询 留言/需求�交

如果�年�拥有这些技术,你�能比马云还�富 :网络爬虫

作者:编�之妙
链接:http://www.toutiao.com/i635276

如果�年�拥有这些技术,你�能比马云还�富 :网络爬虫-python版

  • scrapy: scrapy

Scrapy,Python开�的一个快速,高层次的�幕抓�和web抓�框架,用于抓�web站点并从页�中��结构化的数�。Scrapy用途广泛,�以用于数�挖掘�监测和自动化测试。

Scrapy�引人的地方在于它是一个框架,任何人都�以根�需求方便的修改。它也�供了多�类型爬虫的基类,如BaseSpider�sitemap爬虫等,最新版本��供了web2.0爬虫的支�。


  1. pyspider: pyspider

pyspider ��于以��的一个垂直�索引擎使用的爬虫�端。最�的需求是需�从200个站点(由于站点失效,�时有100+在跑�)采集数�,并�求在5分钟内将对方网站的更新更新到库中。

所以,�活的抓�控制是必须的。�时,由于100个站点,�天都�能会有站点失效或者改版,所以需�能够监控模�失效,以�查看抓�状�。

这个项目对于爬虫的监控和调度�求是�常高的。

特点是:

    • python 脚本控制,å�¯ä»¥ç”¨ä»»ä½•你喜欢的htmlè§£æž�包(内置 pyquery)

    • WEB 界é�¢ç¼–写调试脚本,起å�œè„šæœ¬ï¼Œç›‘æŽ§æ‰§è¡ŒçŠ¶æ€�,查看活动历å�²ï¼ŒèŽ·å�–结果产出

    • 支æŒ� MySQL, MongoDB, SQLite

    • 支æŒ�抓å�– JavaScript 的页é�¢

    • 组件å�¯æ›¿æ�¢ï¼Œæ”¯æŒ�å�•机/分布å¼�部署,支æŒ� Docker 部署

    • 强大的调度控制

portia: portia

�视化的网页内容抓�工具 Portia

html2text: html2text

html2text是一个Python模�,用�把HTML格�转�为文本(Markdown)格�。

BeautifulSoup: BeautifulSoup

Beautiful Soup 是一个�以从HTML或XML文件中��数�的Python库.它能够通过你喜欢的转�器实现惯用的文档导航,查找,修改文档的方�.Beautiful Soup会帮你节�数�时甚至数天的工作时间.

lxml: lxml

lxml是python中处�xml的一个�常强大的库,�以�常方便的解�和生�xml文件。

selenium:selenium

Selenium 是ThoughtWorks专门为Web应用程�编写的一个验收测试工具。Selenium测试直接�行在�览器中,�以模拟真实用户的行为。支�的�览器包括IE(7�8�9)�Mozilla Firefox�Mozilla Suite等。这个工具的主�功能包括:测试与�览器的兼容性——测试你的应用程�看是�能够很好地工作在���览器和�作系统之上。测试系统功能——创建回归测试检验软件功能和用户需求。

简�地说,Selenium�许你用代��作�览器,也�以执行JS脚本,这使它的应用�仅仅�于自动化测试。比如用它切�马甲登录网站,这正是笔者接触selenium的�衷。

mechanize: mechanize

希望与 Web 页�中找到的内容进行��比较��的交互时,您需�使用 mechanize 库。

PyQuery: pyquery

jQuery程�员的�气,你�需�学习更多的技能,就能熟练使用网络爬虫。

PyQuery 是 Python 仿照 jQuery 的严格实现。语法与 jQuery 几乎完全相�,所以�用�去费心去记一些奇怪的方法了。

pyquery �让你用 jQuery 的语法�对 xml 进行�作。这I和 jQuery �分类似。如果利用 lxml,pyquery 对 xml 和 html 的处�将更快。

关注“网页设计自学平��订阅�回�以下|关键字|


|dw教程|js教程|淘�案例|软件下载|��案例|网站模�


戳“阅读原文�入群�费领��端开�教程�