91超碰碰碰碰久久久久久综合_超碰av人澡人澡人澡人澡人掠_国产黄大片在线观看画质优化_txt小说免费全本

溫馨提示×

溫馨提示×

您好,登錄后才能下訂單哦!

密碼登錄×
登錄注冊×
其他方式登錄
點擊 登錄注冊 即表示同意《億速云用戶服務條款》

Spider和python分布式爬蟲的CrawlSpider存在著什么關系

發布時間:2020-11-30 14:04:08 來源:億速云 閱讀:165 作者:小新 欄目:編程語言

小編給大家分享一下Spider和python分布式爬蟲的CrawlSpider存在著什么關系,相信大部分人都還不怎么了解,因此分享這篇文章給大家參考一下,希望大家閱讀完這篇文章后大有收獲,下面讓我們一起去了解一下吧!

CrawlSpider

深度爬蟲,根據連接提取規則,會自動抓取頁面中滿足規則的連接,然后再請求解析,再抓取從而一直深入。

源碼

"""
This modules implements the CrawlSpider which is the recommended spider to use
for scraping typical web sites that requires crawling pages.
 
See documentation in docs/topics/spiders.rst
"""
 
import copy
import six
 
from scrapy.http import Request, HtmlResponse
from scrapy.utils.spider import iterate_spider_output
from scrapy.spiders import Spider
 
 
def identity(x):
    return x
 
 
class Rule(object):
 
    def __init__(self, link_extractor, callback=None, cb_kwargs=None, follow=None, process_links=None, process_request=identity):
        self.link_extractor = link_extractor
        self.callback = callback
        self.cb_kwargs = cb_kwargs or {}
        self.process_links = process_links
        self.process_request = process_request
        if follow is None:
            self.follow = False if callback else True
        else:
            self.follow = follow
 
 
class CrawlSpider(Spider):
 
    rules = ()
 
    def __init__(self, *a, **kw):
        super(CrawlSpider, self).__init__(*a, **kw)
        self._compile_rules()
 
    def parse(self, response):
        return self._parse_response(response, self.parse_start_url, cb_kwargs={}, follow=True)
 
    def parse_start_url(self, response):
        return []
 
    def process_results(self, response, results):
        return results
 
    def _build_request(self, rule, link):
        r = Request(url=link.url, callback=self._response_downloaded)
        r.meta.update(rule=rule, link_text=link.text)
        return r
 
    def _requests_to_follow(self, response):
        if not isinstance(response, HtmlResponse):
            return
        seen = set()
        for n, rule in enumerate(self._rules):
            links = [lnk for lnk in rule.link_extractor.extract_links(response)
                     if lnk not in seen]
            if links and rule.process_links:
                links = rule.process_links(links)
            for link in links:
                seen.add(link)
                r = self._build_request(n, link)
                yield rule.process_request(r)
 
    def _response_downloaded(self, response):
        rule = self._rules[response.meta['rule']]
        return self._parse_response(response, rule.callback, rule.cb_kwargs, rule.follow)
 
    def _parse_response(self, response, callback, cb_kwargs, follow=True):
        if callback:
            cb_res = callback(response, **cb_kwargs) or ()
            cb_res = self.process_results(response, cb_res)
            for requests_or_item in iterate_spider_output(cb_res):
                yield requests_or_item
 
        if follow and self._follow_links:
            for request_or_item in self._requests_to_follow(response):
                yield request_or_item
 
    def _compile_rules(self):
        def get_method(method):
            if callable(method):
                return method
            elif isinstance(method, six.string_types):
                return getattr(self, method, None)
 
        self._rules = [copy.copy(r) for r in self.rules]
        for rule in self._rules:
            rule.callback = get_method(rule.callback)
            rule.process_links = get_method(rule.process_links)
            rule.process_request = get_method(rule.process_request)
 
    @classmethod
    def from_crawler(cls, crawler, *args, **kwargs):
        spider = super(CrawlSpider, cls).from_crawler(crawler, *args, **kwargs)
        spider._follow_links = crawler.settings.getbool(
            'CRAWLSPIDER_FOLLOW_LINKS', True)
        return spider
 
    def set_crawler(self, crawler):
        super(CrawlSpider, self).set_crawler(crawler)
        self._follow_links = crawler.settings.getbool('CRAWLSPIDER_FOLLOW_LINKS', True)

CrawlSpider是繼承于Spider,也實現了其中的常用屬性和方法,新增了一個rules屬性(連接提取規則集合),但是不同的是Crawl內部實現了parse解析方法,不能在Crawl中使用該關鍵詞。

def parse(self, response):
return self._parse_response(response, self.parse_start_url, cb_kwargs={}, follow=True)

也提供了一個可復寫(overrideable)的方法:

parse_start_url(response)

當start_url的請求返回時,該方法被調用。 該方法分析最初的返回值并必須返回一個 Item對象或者 一個 Request 對象或者 一個可迭代的包含二者對象。

以上是“Spider和python分布式爬蟲的CrawlSpider存在著什么關系”這篇文章的所有內容,感謝各位的閱讀!相信大家都有了一定的了解,希望分享的內容對大家有所幫助,如果還想學習更多知識,歡迎關注億速云行業資訊頻道!

向AI問一下細節

免責聲明:本站發布的內容(圖片、視頻和文字)以原創、轉載和分享為主,文章觀點不代表本網站立場,如果涉及侵權請聯系站長郵箱:is@yisu.com進行舉報,并提供相關證據,一經查實,將立刻刪除涉嫌侵權內容。

AI

江口县| 衡阳市| 河西区| 穆棱市| 迭部县| 开远市| 神农架林区| 浠水县| 土默特右旗| 连山| 秀山| 台山市| 张家港市| 北安市| 文山县| 望奎县| 平顶山市| 卓尼县| 阿拉善右旗| 永仁县| 西贡区| 云霄县| 宁波市| 资溪县| 龙岩市| 阿拉善左旗| 晋江市| 咸丰县| 连州市| 秭归县| 峡江县| 海门市| 西青区| 米泉市| 柳州市| 沛县| 司法| 洛南县| 浙江省| 得荣县| 广灵县|