Link Extractors在python分布式爬蟲中的使用方法

發布時間：2020-11-30 13:56:19 來源：億速云閱讀：190 作者：小新欄目：編程語言

這篇文章將為大家詳細講解有關Link Extractors在python分布式爬蟲中的使用方法，小編覺得挺實用的，因此分享給大家做個參考，希望大家閱讀完這篇文章后可以有所收獲。

LinkExtractors

class scrapy.linkextractors.LinkExtractor

Link Extractors 的目的很簡單: 提取鏈接?

每個LinkExtractor有唯一的公共方法是 extract_links()，它接收一個 Response 對象，并返回一個 scrapy.link.Link 對象。

Link Extractors要實例化一次，并且 extract_links 方法會根據不同的 response 調用多次提取鏈接?

class scrapy.linkextractors.LinkExtractor(
    allow = (),
    deny = (),
    allow_domains = (),
    deny_domains = (),
    deny_extensions = None,
    restrict_xpaths = (),
    tags = ('a','area'),
    attrs = ('href'),
    canonicalize = True,
    unique = True,
    process_value = None
)

主要參數：

allow：滿足括號中“正則表達式”的值會被提取，如果為空，則全部匹配。
deny：與這個正則表達式(或正則表達式列表)不匹配的URL一定不提取。
allow_domains：會被提取的鏈接的domains。
deny_domains：一定不會被提取鏈接的domains。
restrict_xpaths：使用xpath表達式，和allow共同作用過濾鏈接。

關于Link Extractors在python分布式爬蟲中的使用方法就分享到這里了，希望以上內容可以對大家有一定的幫助，可以學到更多知識。如果覺得文章不錯，可以把它分享出去讓更多的人看到。

向AI問一下細節

91超碰碰碰碰久久久久久综合_超碰av人澡人澡人澡人澡人掠_国产黄大片在线观看画质优化_txt小说免费全本

Link Extractors在python分布式爬蟲中的使用方法

猜你喜歡

91超碰碰碰碰久久久久久综合_超碰av人澡人澡人澡人澡人掠_国产黄大片在线观看画质优化_txt小说免费全本

Link Extractors在python分布式爬蟲中的使用方法

猜你喜歡

最新資訊

相關推薦

相關標簽