Python爬蟲之初體驗

2017-06-12 23:50:00

Python爬蟲，一般用于抓取特定的内容，最近想學學，通過網絡抓取自己想要的内容，于是乎學習了一下Python，用一個小案例來紀念一下學習的成果。

案例程式主要功能：抓取我們學校校園網新聞中的圖檔

#coding=utf-8
import urllib
import re
# 定義個函數 抓取網頁内容
def getHtml(url):
    webPage = urllib.urlopen(url)
    html = webPage.read()
    return html

# 定義一個函數 抓取網頁中的圖檔
def getNewsImgs(html):
    # 正規表達式 
    reg = r'src="(.+?\.jpg)"'
    img = re.compile(reg)
    # 擷取網頁中所有符合條件的圖檔url
    imglist = re.findall(img,html)
    x = 0
    # 根據圖檔位址下載下傳圖檔并重命名
    for imgUrl in imglist:
        urllib.urlretrieve("http://www.abc.edu.cn/news/"+imgUrl,'news-%s.jpg' % x)
        x += 1

# 擷取網頁
html = getHtml("http://www.abc.edu.cn/news/show.aspx?id=21413&cid=5")
# 抓取圖檔
print getNewsImgs(html)

效果：成功抓取了新聞中的兩張圖檔O(∩_∩)O~

爬蟲抓圖檔.gif

Python爬蟲之初體驗

案例程式主要功能：抓取我們學校校園網新聞中的圖檔

效果：成功抓取了新聞中的兩張圖檔O(∩_∩)O~

繼續閱讀

來自python的【條件控制/語句循環/break/continue/else/pass】一、條件控制二、語句循環

無法解析的外部符号 wmain，該符号在函數 "void cdecl mainCRTStartupHelper(struct HINSTANCE *,unsigned short con......

TestLink導出用例轉換工具(XML2Excel)

YAML簡介和PyYAML安全操作YAML支援的類型YAML的優點：yaml的基本文法python操作

Small tricks

libsvm for python 安裝

學習軟體測試基礎測試第七天

Zeppelin 配置通路 REST APIApache Zeppelin Configuration REST API

【Torch】最簡潔logging使用指南

27. Remove Element(清單)題目代碼

Cloud Studio初體驗

使用 ctypes 進行 Python 和 C 的混合程式設計

【python】【資料處理】畫多元資料分布圖

【python】netconf協定對接管理裝置

「Python 網絡自動化」NETCONF —— Python 使用 NETCONF 管理配置 H3C 網絡裝置

在python中建立excel并寫入