您的位置: 首页 > 文章 > Python_爬虫

Python_爬虫

分类: 文章 • 2025-04-17 09:56:16

Python_爬虫

爬虫概念

数据获取的方式：

企业生产的用户数据：大型互联网公司有海量用户，所以他们积累数据有天然优势。有数据意识的中小型企业，也开始积累的数据。
数据管理咨询公司
政府/机构提供的公开数据
第三方数据平台购买数据
爬虫爬取数据

什么是爬虫

抓去网页数据的程序

如何抓去网页数据

网页三大特征：

每个网页都有自己的URL
网页都使用HTML标记语言来描述页面信息
网页都使用HTTP/HTTPS协议来传输HTML数据

爬虫的设计思路

确定需要爬取的网页URL地址
通过HTTP/HTTPS协议来获取对应的HTML页面
提取HTML页面中的数据
如果是需要的数据，就保存起来
如果页面是其它URL，那就继续爬取

原文地址https://segmentfault.com/a/1190000014981939?utm_source=index-hottest