Python 爬虫入门完全教程:用 requests + BeautifulSoup 抓取你想要的数据

面向会基础 Python 的读者。爬虫=「自动按规则抓取网页数据」。本教程用最稳的 requests(发请求)+ BeautifulSoup(解析 HTML)组合,带你从抓取一个页面到批量采集,并讲清反爬应对与法律边界。学完你能抓公开信息做数据分析。

一、原理背景

浏览器看网页的流程:输入网址 → 发 HTTP 请求 → 服务器返回 HTML → 浏览器渲染。爬虫就是用代码模拟「发请求 + 读 HTML」,再把想要的内容(标题、价格、列表)提取出来。

两个核心库分工:

  • requests:负责「发请求、拿响应」(相当于地址栏 + 回车)。
  • BeautifulSoup(bs4):负责「解析 HTML、按标签提取」(相当于在网页里框选复制)。

技术栈对比

方案 适合 难度
requests + bs4 静态页、结构清晰 ★ 低(本教程)
requests + 正则 简单文本提取 ★ 低
Selenium / Playwright 需要登录、JS 渲染页 ★★ 中
Scrapy 大型分布式爬取 ★★★ 高

注意:很多现代网站数据由 JS 动态加载(接口返回 JSON),这时直接抓接口(requests 调 API)比解析

🔒 付费文档

支付 5 积分后即可解锁全部内容