Python爬蟲的兩套解析方法和四種爬蟲實現

發布時間：2020-08-11 09:03:02 來源：ITPUB博客閱讀：208 作者：趙鈺瑩欄目：編程語言

【本文轉載自微信公眾號：數據科學家養成記，作者：louwill，轉載授權請聯系原作者】

對于大多數朋友而言，爬蟲絕對是學習python的最好的起手和入門方式。因為爬蟲思維模式固定，編程模式也相對簡單，一般在細節處理上積累一些經驗都可以成功入門。本文想針對某一網頁對python基礎爬蟲的兩大解析庫（BeautifulSoup和lxml）和幾種信息提取實現方法進行分析，以開python爬蟲之初見。

基礎爬蟲的固定模式

筆者這里所談的基礎爬蟲，指的是不需要處理像異步加載、驗證碼、代理等高階爬蟲技術的爬蟲方法。一般而言，基礎爬蟲的兩大請求庫urllib和requests中requests通常為大多數人所鐘愛，當然urllib也功能齊全。兩大解析庫BeautifulSoup因其強大的HTML文檔解析功能而備受青睞，另一款解析庫lxml在搭配xpath表達式的基礎上也效率提高。就基礎爬蟲來說，兩大請求庫和兩大解析庫的組合方式可以依個人偏好來選擇。

筆者喜歡用的爬蟲組合工具是：

requests+BeautifulSoup
requests+lxml

同一網頁爬蟲的四種實現方式

筆者以騰訊新聞首頁的新聞信息抓取為例。
首頁外觀如下：

Python爬蟲的兩套解析方法和四種爬蟲實現

比如說我們想抓取每個新聞的標題和鏈接，并將其組合為一個字典的結構打印出來。首先查看HTML源碼確定新聞標題信息組織形式。

Python爬蟲的兩套解析方法和四種爬蟲實現

可以目標信息存在于em標簽下a標簽內的文本和href屬性中。可直接利用requests庫構造請求，并用BeautifulSoup或者lxml進行解析。

方式一：requests+BeautifulSoup+select# select method import requests from bs4 import BeautifulSoup headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/64.0.3282.119 Safari/537.36'} url = 'http://news.qq.com/' Soup = BeautifulSoup(requests.get(url=url, headers=headers).text.encode("utf-8"), 'lxml') em = Soup.select('em[class="f14 l24"] a') for i in em: title = i.get_text() link = i['href'] print({'標題': title, '鏈接': link })

很常規的處理方式，抓取效果如下：

Python爬蟲的兩套解析方法和四種爬蟲實現

方式二：requests+BeautifulSoup+find_all進行信息提取

# find_all method import requests from bs4 import BeautifulSoup
headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/64.0.3282.119 Safari/537.36'}
url = 'http://news.qq.com/' Soup = BeautifulSoup(requests.get(url=url, headers=headers).text.encode("utf-8"), 'lxml')
em = Soup.find_all('em', attrs={'class': 'f14 l24'})for i in em:
    title = i.a.get_text()
    link = i.a['href']
    print({'標題': title,            '鏈接': link
    })

同樣是requests+BeautifulSoup的爬蟲組合，但在信息提取上采用了find_all的方式。效果如下：

Python爬蟲的兩套解析方法和四種爬蟲實現

方式三：requests+lxml/etree+xpath表達式

# lxml/etree method import requests from lxml import etree

headers = {    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/64.0.3282.119 Safari/537.36'}
url = 'http://news.qq.com/' html = requests.get(url = url, headers = headers)
con = etree.HTML(html.text)

title = con.xpath('//em[@class="f14 l24"]/a/text()')
link = con.xpath('//em[@class="f14 l24"]/a/@href') for i in zip(title, link):
    print({'標題': i[0],
           '鏈接': i[1]
    })

使用lxml庫下的etree模塊進行解析，然后使用xpath表達式進行信息提取，效率要略高于BeautifulSoup+select方法。這里對兩個列表的組合采用了zip方法。效果如下：

Python爬蟲的兩套解析方法和四種爬蟲實現

方式四：requests+lxml/html/fromstring+xpath表達式

# lxml/html/fromstring method import requests import lxml.html as HTML

headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/64.0.3282.119 Safari/537.36'}
url = 'http://news.qq.com/' con = HTML.fromstring(requests.get(url = url, headers = headers).text)
title = con.xpath('//em[@class="f14 l24"]/a/text()')
link = con.xpath('//em[@class="f14 l24"]/a/@href') for i in zip(title, link):
    print({'標題': i[0],'鏈接': i[1]
    })

跟方法三類似，只是在解析上使用了lxml庫下的html.fromstring模塊。抓取效果如下：

Python爬蟲的兩套解析方法和四種爬蟲實現

很多人覺得爬蟲有點難以掌握，因為知識點太多，需要懂前端、需要python熟練、還需要懂數據庫，更不用說正則表達式、XPath表達式這些。其實對于一個簡單網頁的數據抓取，不妨多嘗試幾種抓取方案，舉一反三，也更能對python爬蟲有較深的理解。長此以往，對于各類網頁結構都有所涉獵，自然經驗豐富，水到渠成。

向AI問一下細節

91超碰碰碰碰久久久久久综合_超碰av人澡人澡人澡人澡人掠_国产黄大片在线观看画质优化_txt小说免费全本

Python爬蟲的兩套解析方法和四種爬蟲實現

基礎爬蟲的固定模式

猜你喜歡

91超碰碰碰碰久久久久久综合_超碰av人澡人澡人澡人澡人掠_国产黄大片在线观看画质优化_txt小说免费全本

Python爬蟲的兩套解析方法和四種爬蟲實現

基礎爬蟲的固定模式

猜你喜歡

最新資訊

相關推薦

相關標簽