您好,登錄后才能下訂單哦!
這篇文章將為大家詳細講解有關怎么用Python爬取2022春節檔電影信息,小編覺得挺實用的,因此分享給大家做個參考,希望大家閱讀完這篇文章后可以有所收獲。
Python 3.x (面向對象的高級語言)
Resquest 2.14.2 (python第三方庫)
Pandas 1.1.0(python第三方庫)
Time (python標準庫)
Lxml(python第三方庫)
https://movie.douban.com/cinema/later/shenzhen/
按F12打開瀏覽器操作臺
按Ctrl+Shift+C快捷鍵
按Ctrl+F快捷鍵,控制臺出現搜索框
復制Xpath
Xpath為//*[@id=“showing-soon”]/div[1]/div/h4/a
粘貼到搜索框,驗證Xpath
查看HTML,尋找共性
發現目標元素都在一個div框里,修改Xpath
Xpath修改為//*[@id=“showing-soon”]/div/div/h4/a
其余目標元素,以此類推
最后,用Pandas保存為CSV文件
# 利用pandas保存文件 df = pd.DataFrame() df['上映日期'] = Ondate df['片名'] = name df['類型'] = movie_class df['制片國家/地區'] = area df['想看人數'] = num df['超鏈接'] = href
# -*- coding: utf-8 -*- """ Created on Tue Jan 25 10:07:11 2022 @author: TFX """ import time import requests # 請求庫 import pandas as pd from lxml import etree# 提取信息庫 # 日期 today = time.strftime('%Y{y}%m{m}%daegqsqibtmh',time.localtime()).format(y='年',m='月',d='日') # 網址 url = 'https://movie.douban.com/cinema/later/shenzhen/' # 請求頭 headers = { 'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/80.0.3987.163 Safari/537.36' } # 發送請求 response = requests.get(url=url,headers=headers) # 數據解析,xpath可以用瀏覽器檢查元素獲得 html = etree.HTML(response.text) #類型變換 # 電影詳細超鏈接 href = html.xpath('//*[@id="showing-soon"]/div/div/h4/a/@href') # 上映日期 Ondate = html.xpath('//*[@id="showing-soon"]/div/div/ul/li[1]/text()') # 片名 name = html.xpath('//*[@id="showing-soon"]/div/div/h4/a/text()') # 類型 movie_class = html.xpath('//*[@id="showing-soon"]/div/div/ul/li[2]/text()') # 制片國家 / 地區 area = html.xpath('//*[@id="showing-soon"]/div/div/ul/li[3]/text()') # 想看人數 num = html.xpath('//*[@id="showing-soon"]/div/div/ul/li[4]/span/text()') # 利用pandas保存文件 df = pd.DataFrame() df['上映日期'] = Ondate df['片名'] = name df['類型'] = movie_class df['制片國家/地區'] = area df['想看人數'] = num df['超鏈接'] = href df.to_csv('2022春節檔電影_'+today+'.csv',mode='w',index=None,encoding='gbk') print('保存完成!')
關于“怎么用Python爬取2022春節檔電影信息”這篇文章就分享到這里了,希望以上內容可以對大家有一定的幫助,使各位可以學到更多知識,如果覺得文章不錯,請把它分享出去讓更多的人看到。
免責聲明:本站發布的內容(圖片、視頻和文字)以原創、轉載和分享為主,文章觀點不代表本網站立場,如果涉及侵權請聯系站長郵箱:is@yisu.com進行舉報,并提供相關證據,一經查實,將立刻刪除涉嫌侵權內容。