91超碰碰碰碰久久久久久综合_超碰av人澡人澡人澡人澡人掠_国产黄大片在线观看画质优化_txt小说免费全本

溫馨提示×

溫馨提示×

您好,登錄后才能下訂單哦!

密碼登錄×
登錄注冊×
其他方式登錄
點擊 登錄注冊 即表示同意《億速云用戶服務條款》

怎么用scrapy框架構建python爬蟲

發布時間:2020-11-23 09:58:49 來源:億速云 閱讀:132 作者:小新 欄目:編程語言

這篇文章主要介紹了怎么用scrapy框架構建python爬蟲,具有一定借鑒價值,需要的朋友可以參考下。希望大家閱讀完這篇文章后大有收獲。下面讓小編帶著大家一起了解一下。

制作爬蟲,總體來說分為兩步:先爬再取。

也就是說,首先你要獲取整個網頁的所有內容,然后再取出其中對你有用的部分。

要建立一個Spider,你必須用scrapy.spider.BaseSpider創建一個子類,并確定三個強制的屬性:

  • name:爬蟲的識別名稱,必須是唯一的,在不同的爬蟲中你必須定義不同的名字。

  • start_urls:爬取的URL列表。爬蟲從這里開始抓取數據,所以,第一次下載的數據將會從這些urls開始。其他子URL將會從這些起始URL中繼承性生成。

  • parse():解析的方法,調用的時候傳入從每一個URL傳回的Response對象作為唯一參數,負責解析并匹配抓取的數據(解析為item),跟蹤更多的URL。

創建douban_spider.py文件,保存在douban\spiders目錄下。并導入我們需用的模塊

怎么用scrapy框架構建python爬蟲 

編寫主要模塊:

怎么用scrapy框架構建python爬蟲 

然后運行一下,

怎么用scrapy框架構建python爬蟲 

會看到有403錯誤,是因為我們爬取的時候沒加頭部導致的:

怎么用scrapy框架構建python爬蟲 

我們來偽裝一下,在settings.py里加上USER_AGENT:

USER_AGENT = 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_8_3) AppleWebKit/536.5 
(KHTML, like Gecko) Chrome/19.0.1084.54 Safari/536.5'

再次運行,即可看到正確結果。

感謝你能夠認真閱讀完這篇文章,希望小編分享怎么用scrapy框架構建python爬蟲內容對大家有幫助,同時也希望大家多多支持億速云,關注億速云行業資訊頻道,遇到問題就找億速云,詳細的解決方法等著你來學習!

向AI問一下細節

免責聲明:本站發布的內容(圖片、視頻和文字)以原創、轉載和分享為主,文章觀點不代表本網站立場,如果涉及侵權請聯系站長郵箱:is@yisu.com進行舉報,并提供相關證據,一經查實,將立刻刪除涉嫌侵權內容。

AI

东乡县| 通州区| 崇信县| 长葛市| 永川市| 育儿| 郑州市| 讷河市| 古田县| 阿克陶县| 巩留县| 随州市| 甘南县| 双桥区| 葵青区| 巢湖市| 绵阳市| 丹凤县| 南昌县| 民权县| 玛纳斯县| 蓝田县| 兴隆县| 寿阳县| 永康市| 集安市| 凉城县| 墨玉县| 东乡族自治县| 澜沧| 名山县| 浙江省| 涿州市| 隆德县| 平远县| 和林格尔县| 西乌| 临泉县| 棋牌| 三门县| 临夏市|