天天看点

如何使用Java语言实现一个网页爬虫

 网络上有许多信息,我们如何自动的获取这些信息呢?没错,网页爬虫~!

在这篇博文中,我将会使用java语言一步一步的编写一个原型的网页爬虫,其实网页爬虫并没有它听起来那么难。紧跟我的教程,我相信你会在马上学会,一个小时应该可以搞定,之后你就可以享受你所获得的大量数据。这次所编写的是最简单的教程,可以说是网页爬虫的hello world程序, 由于仅仅是原型,之后你要花更多的时间来研究并未自己来定制特定需求的爬虫。

首先,我认为你已经掌握了下面的基础知识:

   1.基础的java编程

   2.关于sql以及mysql数据库或者oracle数据库

如果你不想使用数据库的话,你可以用一个文件来将爬到的数据存储好。

一、我们的目标

给定一个学校的URL,例如“mit.edu”,返回包括字符串“research”所有的这个学校的页面。

一个经典的爬虫程序步骤:

1.解析根网页(“mit.edu”),并从这个网页得到它所有的链接。获取每个URL并解析HTML页面,我会使用Jsoup来处理,Jsoup是一个好用而且方便的java库。

2.使用步骤1返回回来的URL,解析这些URL。