-
bbianji8 用户
Python 爬虫入门完全教程:用 requests + BeautifulSoup 抓取你想要的数据
面向会基础 Python 的读者。爬虫=「自动按规则抓取网页数据」。本教程用最稳的
requests(发请求)+BeautifulSoup(解析 HTML)组合,带你从抓取一个页面到批量采集,并讲清反爬应对与法律边界。学完你能抓公开信息做数据分析。
一、原理背景
浏览器看网页的流程:输入网址 → 发 HTTP 请求 → 服务器返回 HTML → 浏览器渲染。爬虫就是用代码模拟「发请求 + 读 HTML」,再把想要的内容(标题、价格、列表)提取出来。
两个核心库分工:
- requests:负责「发请求、拿响应」(相当于地址栏 + 回车)。
- BeautifulSoup(bs4):负责「解析 HTML、按标签提取」(相当于在网页里框选复制)。
技术栈对比
| 方案 | 适合 | 难度 |
|---|---|---|
| requests + bs4 | 静态页、结构清晰 | ★ 低(本教程) |
| requests + 正则 | 简单文本提取 | ★ 低 |
| Selenium / Playwright | 需要登录、JS 渲染页 | ★★ 中 |
| Scrapy | 大型分布式爬取 | ★★★ 高 |
注意:很多现代网站数据由 JS 动态加载(接口返回 JSON),这时直接抓接口(
requests调 API)比解析