这篇文章将为大家详细讲解有关怎么用Python爬取2022春节档电影信息,小编觉得挺实用的,因此分享给大家做个参考,希望大家阅读完这篇文章后可以有所收获。
Python 3.x (面向对象的高级语言)
Resquest 2.14.2 (python第三方库)
Pandas 1.1.0(python第三方库)
Time (python标准库)
Lxml(python第三方库)
https://movie.douban.com/cinema/later/shenzhen/
按F12打开浏览器操作台
按Ctrl+Shift+C快捷键
按Ctrl+F快捷键,控制台出现搜索框
复制Xpath
Xpath为//*[@id=“showing-soon”]/div[1]/div/h4/a
粘贴到搜索框,验证Xpath
查看HTML,寻找共性
发现目标元素都在一个div框里,修改Xpath
Xpath修改为//*[@id=“showing-soon”]/div/div/h4/a
其余目标元素,以此类推
最后,用Pandas保存为CSV文件
# 利用pandas保存文件 df = pd.DataFrame() df['上映日期'] = Ondate df['片名'] = name df['类型'] = movie_class df['制片国家/地区'] = area df['想看人数'] = num df['超链接'] = href
# -*- coding: utf-8 -*- """ Created on Tue Jan 25 10:07:11 2022 @author: TFX """ import time import requests # 请求库 import pandas as pd from lxml import etree# 提取信息库 # 日期 today = time.strftime('%Y{y}%m{m}%d{d}',time.localtime()).format(y='年',m='月',d='日') # 网址 url = 'https://movie.douban.com/cinema/later/shenzhen/' # 请求头 headers = { 'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/80.0.3987.163 Safari/537.36' } # 发送请求 response = requests.get(url=url,headers=headers) # 数据解析,xpath可以用浏览器检查元素获得 html = etree.HTML(response.text) #类型变换 # 电影详细超链接 href = html.xpath('//*[@id="showing-soon"]/div/div/h4/a/@href') # 上映日期 Ondate = html.xpath('//*[@id="showing-soon"]/div/div/ul/li[1]/text()') # 片名 name = html.xpath('//*[@id="showing-soon"]/div/div/h4/a/text()') # 类型 movie_class = html.xpath('//*[@id="showing-soon"]/div/div/ul/li[2]/text()') # 制片国家 / 地区 area = html.xpath('//*[@id="showing-soon"]/div/div/ul/li[3]/text()') # 想看人数 num = html.xpath('//*[@id="showing-soon"]/div/div/ul/li[4]/span/text()') # 利用pandas保存文件 df = pd.DataFrame() df['上映日期'] = Ondate df['片名'] = name df['类型'] = movie_class df['制片国家/地区'] = area df['想看人数'] = num df['超链接'] = href df.to_csv('2022春节档电影_'+today+'.csv',mode='w',index=None,encoding='gbk') print('保存完成!')
关于“怎么用Python爬取2022春节档电影信息”这篇文章就分享到这里了,希望以上内容可以对大家有一定的帮助,使各位可以学到更多知识,如果觉得文章不错,请把它分享出去让更多的人看到。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。