用Python爬取2022春節(jié)檔電影信息

更新時(shí)間：2022年01月25日 16:36:05 作者：FriendshipT

大家好，本篇文章主要講的是用Python爬取2022春節(jié)檔電影信息，感興趣的同學(xué)趕快來看一看吧，對(duì)你有幫助的話記得收藏一下

前提條件

熟悉HTML基礎(chǔ)語句

熟悉Xpath基礎(chǔ)語句

實(shí)驗(yàn)環(huán)境

Python 3.x （面向?qū)ο蟮母呒?jí)語言）

Resquest 2.14.2 （python第三方庫）

Pandas 1.1.0（python第三方庫）

Time （python標(biāo)準(zhǔn)庫）

Lxml（python第三方庫）

具體步驟

目標(biāo)網(wǎng)站

https://movie.douban.com/cinema/later/shenzhen/

在這里插入圖片描述

分析網(wǎng)站

按F12打開瀏覽器操作臺(tái)

在這里插入圖片描述

按Ctrl+Shift+C快捷鍵

在這里插入圖片描述

按Ctrl+F快捷鍵，控制臺(tái)出現(xiàn)搜索框

在這里插入圖片描述

復(fù)制Xpath

Xpath為//*[@id=“showing-soon”]/div[1]/div/h3/a

在這里插入圖片描述

粘貼到搜索框，驗(yàn)證Xpath

在這里插入圖片描述

查看HTML，尋找共性

在這里插入圖片描述

發(fā)現(xiàn)目標(biāo)元素都在一個(gè)div框里，修改Xpath

Xpath修改為//*[@id=“showing-soon”]/div/div/h3/a

在這里插入圖片描述

其余目標(biāo)元素，以此類推

在這里插入圖片描述

最后，用Pandas保存為CSV文件

# 利用pandas保存文件
df = pd.DataFrame()
df['上映日期'] =  Ondate
df['片名'] =  name
df['類型'] =  movie_class
df['制片國(guó)家/地區(qū)'] = area
df['想看人數(shù)'] = num
df['超鏈接'] = href

在這里插入圖片描述

代碼實(shí)現(xiàn)

# -*- coding: utf-8 -*-
"""
Created on Tue Jan 25 10:07:11 2022
@author: TFX
"""
import time
import requests # 請(qǐng)求庫
import pandas as pd
from lxml import etree# 提取信息庫
# 日期
today = time.strftime('%Y{y}%m{m}%dpb7fbr7',time.localtime()).format(y='年',m='月',d='日')
# 網(wǎng)址
url = 'https://movie.douban.com/cinema/later/shenzhen/'
# 請(qǐng)求頭
headers = {
        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/80.0.3987.163 Safari/537.36'
        }
# 發(fā)送請(qǐng)求
response = requests.get(url=url,headers=headers)
# 數(shù)據(jù)解析,xpath可以用瀏覽器檢查元素獲得
html = etree.HTML(response.text) #類型變換
# 電影詳細(xì)超鏈接
href = html.xpath('//*[@id="showing-soon"]/div/div/h3/a/@href')
# 上映日期
Ondate =  html.xpath('//*[@id="showing-soon"]/div/div/ul/li[1]/text()')
# 片名
name = html.xpath('//*[@id="showing-soon"]/div/div/h3/a/text()')
# 類型
movie_class = html.xpath('//*[@id="showing-soon"]/div/div/ul/li[2]/text()')
# 制片國(guó)家 / 地區(qū)
area = html.xpath('//*[@id="showing-soon"]/div/div/ul/li[3]/text()')
# 想看人數(shù)
num = html.xpath('//*[@id="showing-soon"]/div/div/ul/li[4]/span/text()')
# 利用pandas保存文件
df = pd.DataFrame()
df['上映日期'] =  Ondate
df['片名'] =  name
df['類型'] =  movie_class
df['制片國(guó)家/地區(qū)'] = area
df['想看人數(shù)'] = num
df['超鏈接'] = href
df.to_csv('2022春節(jié)檔電影_'+today+'.csv',mode='w',index=None,encoding='gbk')
print('保存完成!')