Python_爬虫

Python_爬虫

Python_爬虫

爬虫概念

数据获取的方式:

  • 企业生产的用户数据:大型互联网公司有海量用户,所以他们积累数据有天然优势。有数据意识的中小型企业,也开始积累的数据。
  • 数据管理咨询公司
  • 政府/机构提供的公开数据
  • 第三方数据平台购买数据
  • 爬虫爬取数据

什么是爬虫

抓去网页数据的程序

如何抓去网页数据

网页三大特征:

  • 每个网页都有自己的URL
  • 网页都使用HTML标记语言来描述页面信息
  • 网页都使用HTTP/HTTPS协议来传输HTML数据

爬虫的设计思路

  1. 确定需要爬取的网页URL地址
  2. 通过HTTP/HTTPS协议来获取对应的HTML页面
  3. 提取HTML页面中的数据
    如果是需要的数据,就保存起来
    如果页面是其它URL,那就继续爬取

原文地址https://segmentfault.com/a/1190000014981939?utm_source=index-hottest