用python爬取今日說法每期數(shù)據(jù)
實驗?zāi)康?/h2>
主要是獲取2021年今日說法每期節(jié)目主要內(nèi)容及時間
今日說法的網(wǎng)址為:http://tv.cctv.com/lm/jrsf/index.shtml
當(dāng)時怎么寫的思路有點不太記得了,先把代碼貼上,后續(xù)有時間再補上。
代碼
import xlwt
import re
import requests
# url = "https://tv.cctv.com/lm/jrsf/index.shtml"
def get_data(page):
url = 'https://api.cntv.cn/NewVideo/getVideoListByColumn?id=TOPC145146466500891' \
'4&n=1000&sort=desc&p={pageNo}&mode=0&serviceId=tvcctv&cb=Callback'.format(pageNo=page)
headers = {
'user-agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 '
'(KHTML, like Gecko) Chrome/92.0.4515.131 Safari/537.36'
}
response = requests.get(url=url, headers=headers)
return response.text
# print(response.text)
if __name__ == "__main__":
headers = {
'user-agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 '
'(KHTML, like Gecko) Chrome/92.0.4515.131 Safari/537.36'
}
book = xlwt.Workbook(encoding='utf-8', style_compression=0)
sheet = book.add_sheet('今日說法', cell_overwrite_ok=True)
count = 0
for page in range(1,5):
page_content = get_data(page)
obj = re.compile(r'url":"(.*?.shtml)"', re.S)
imgUrl = re.findall(obj, page_content.replace('\\', ''))
for i in range(len(imgUrl)):
resp = requests.get(url=imgUrl[i], headers=headers)
resp.encoding = 'utf-8'
obj2 = re.compile(r'更新時間:</em>(.*?)</p>', re.S)
time = re.findall(obj2, resp.text)
obj3 = re.compile(r'視頻簡介:</em>(.*?)</p>', re.S)
jianjie = re.findall(obj3, resp.text)
content = []
content.append(time)
content.append(jianjie)
for j in range(2):
sheet.write(count, j, content[j])
count+=1
book.save("./data_5.xls")
實驗結(jié)果

總結(jié)
到此這篇關(guān)于用python爬取今日說法每期數(shù)據(jù)的文章就介紹到這了,更多相關(guān)python爬取今日說法內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
相關(guān)文章
Python數(shù)據(jù)結(jié)構(gòu)與算法中的棧詳解(3)
這篇文章主要為大家詳細(xì)介紹了Python中的棧,文中示例代碼介紹的非常詳細(xì),具有一定的參考價值,感興趣的小伙伴們可以參考一下,希望能夠給你帶來幫助2022-03-03
Matplotlib實戰(zhàn)之平行坐標(biāo)系繪制詳解
平行坐標(biāo)系是一種統(tǒng)計圖表,它包含多個垂直平行的坐標(biāo)軸,每個軸表示一個字段,并用刻度標(biāo)明范圍,下面我們就來看看如何繪制平行坐標(biāo)系吧2023-08-08
Python開發(fā)的單詞頻率統(tǒng)計工具wordsworth使用方法
wordsworth是字母,單詞和n元組頻率分析,用來分析文件中的單詞出現(xiàn)頻率的工具。2014-06-06

