![](https://img.laitimes.com/img/9ZDMuAjOiMmIsIjOiQnIsIyZwpmLy0yMvwVMw8CX4EDMy8CXzRWYvxGc19CX05WZ052bj1Cc39CXt92Yu4Wd5JXZpJmL3d3dvw1LcpDc0RHaiojIsJye.jpg)
爬虫概念
数据获取的方式:
- 企业生产的用户数据:大型互联网公司有海量用户,所以他们积累数据有天然优势。有数据意识的中小型企业,也开始积累的数据。
- 数据管理咨询公司
- 政府/机构提供的公开数据
- 第三方数据平台购买数据
- 爬虫爬取数据
什么是爬虫
抓去网页数据的程序
如何抓去网页数据
网页三大特征:
- 每个网页都有自己的
URL
- 网页都使用
标记语言来描述页面信息HTML
-
协议来传输HTTP/HTTPS
数据HTML
爬虫的设计思路
- 确定需要爬取的网页
地址URL
- 通过
协议来获取对应的HTTP/HTTPS
页面HTML
- 提取
HTML
页面中的数据
如果是需要的数据,就保存起来
如果页面是其它
,那就继续爬取URL
原文地址https://segmentfault.com/a/1190000014981939?utm_source=index-hottest