Python實現(xiàn)抓取網(wǎng)頁并且解析的實例

更新時間：2014年09月20日 17:39:07 投稿：shichen2014

這篇文章主要介紹了Python實現(xiàn)抓取網(wǎng)頁并且解析的功能實例,主要以解析百度問答為例說明其原理與方法,需要的朋友可以參考下

本文以實例形式講述了Python實現(xiàn)抓取網(wǎng)頁并解析的功能。主要解析問答與百度的首頁。分享給大家供大家參考之用。

主要功能代碼如下：

#!/usr/bin/python
#coding=utf-8

import sys 
import re
import urllib2
from urllib import urlencode
from urllib import quote
import time
maxline = 2000

wenda = re.compile("href=\"http://wenda.so.com/q/.+\?src=(.+?)\"")
baidu = re.compile("<a href=\"http://www.baidu.com/link\?url=.+\".*?>更多知道相關(guān)問題.*?</a>")
f1 = open("baidupage.txt","w")
f2 = open("wendapage.txt","w")

for line in sys.stdin:
  if maxline == 0:
    break
  query = line.strip();
  time.sleep(1);
  recall_url = "http://www.so.com/s?&q=" + query;
  response = urllib2.urlopen(recall_url);
  html = response.read();                                                   
  f1.write(html)
  m = wenda.search(html);
  if m:
    if m.group(1) == "110":
      print query + "\twenda\t0";
    else:
      print query + "\twenda\t1";
  else:
    print query + "\twenda\t0";
  recall_url = "http://www.baidu.com/s?wd=" + query +"&ie=utf-8";
  response = urllib2.urlopen(recall_url);
  html = response.read();
  f2.write(html)
  m = baidu.search(html);
  if m:
    print query + "\tbaidu\t1";
  else:
    print query + "\tbaidu\t0";
  maxline = maxline - 1;
f1.close()
f2.close()

希望本文所述對大家Python程序設(shè)計的學習有所幫助。

您可能感興趣的文章:

Python

相關(guān)文章

TensorFlow獲取加載模型中的全部張量名稱代碼
今天小編就為大家分享一篇TensorFlow獲取加載模型中的全部張量名稱代碼，具有很好的參考價值，希望對大家有所幫助。一起跟隨小編過來看看吧
2020-02-02
tensorflow保持每次訓練結(jié)果一致的簡單實現(xiàn)
今天小編就為大家分享一篇tensorflow保持每次訓練結(jié)果一致的實現(xiàn)，具有很好的參考價值，希望對大家有所幫助。一起跟隨小編過來看看吧
2020-02-02
30秒輕松實現(xiàn)TensorFlow物體檢測
這篇文章主要為大家詳細介紹了30秒輕松實現(xiàn)TensorFlow物體檢測，具有一定的參考價值，感興趣的小伙伴們可以參考一下
2018-03-03
Python File readlines() 使用方法
readlines() 方法用于讀取所有行(直到結(jié)束符 EOF)并返回列表，該列表可以由 Python 的 for... in ... 結(jié)構(gòu)進行處理，如果碰到結(jié)束符 EOF 則返回空字符串,需要的朋友可以參考下
2018-03-03
python3讀取MySQL-Front的MYSQL密碼
本篇文章主要介紹了python3讀取MySQL-Front的MYSQL密碼的相關(guān)知識，具有很好的參考價值。下面跟著小編一起來看下吧
2017-05-05
用Python爬蟲破解滑動驗證碼的案例解析
今天分享個如何簡單處理滑動圖片的驗證碼的案例，主要是使用Python爬蟲破解滑動驗證碼的相關(guān)實現(xiàn)代碼，感興趣的朋友跟隨小編一起看看吧
2021-05-05
python實現(xiàn)桌面氣泡提示功能
這篇文章主要為大家詳細介紹了python實現(xiàn)桌面氣泡提示功能，具有一定的參考價值，感興趣的小伙伴們可以參考一下
2019-07-07
OpenCV讀取與寫入圖片的實現(xiàn)
這篇文章主要介紹了OpenCV讀取與寫入圖片的實現(xiàn)，文中通過示例代碼介紹的非常詳細，對大家的學習或者工作具有一定的參考學習價值，需要的朋友們下面隨著小編來一起學習學習吧
2020-10-10
python 從遠程服務(wù)器下載日志文件的程序
本文提供了一種方法，該程序可實現(xiàn)抓取服務(wù)器的日志文件到本地，根據(jù)該程序可自行擴展對日志文件的自動化分析。常用于數(shù)據(jù)挖掘、生產(chǎn)維護等
2013-02-02
Python文件操作基本流程代碼實例
這篇文章主要介紹了Python文件操作基本流程代碼實例，具有一定借鑒價值，需要的朋友可以了解下。
2017-12-12