Python爬蟲,一般用于抓取特定的内容,最近想學學,通過網絡抓取自己想要的内容,于是乎學習了一下Python,用一個小案例來紀念一下學習的成果。
案例程式主要功能:抓取我們學校校園網新聞中的圖檔
#coding=utf-8
import urllib
import re
# 定義個函數 抓取網頁内容
def getHtml(url):
webPage = urllib.urlopen(url)
html = webPage.read()
return html
# 定義一個函數 抓取網頁中的圖檔
def getNewsImgs(html):
# 正規表達式
reg = r'src="(.+?\.jpg)"'
img = re.compile(reg)
# 擷取網頁中所有符合條件的圖檔url
imglist = re.findall(img,html)
x = 0
# 根據圖檔位址下載下傳圖檔并重命名
for imgUrl in imglist:
urllib.urlretrieve("http://www.abc.edu.cn/news/"+imgUrl,'news-%s.jpg' % x)
x += 1
# 擷取網頁
html = getHtml("http://www.abc.edu.cn/news/show.aspx?id=21413&cid=5")
# 抓取圖檔
print getNewsImgs(html)
效果:成功抓取了新聞中的兩張圖檔O(∩_∩)O~
爬蟲抓圖檔.gif