# douban-top250 **Repository Path**: scriptshop/douban-top250 ## Basic Information - **Project Name**: douban-top250 - **Description**: No description available - **Primary Language**: Unknown - **License**: MIT - **Default Branch**: main - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2026-09-18 - **Last Updated**: 2026-09-20 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # 豆瓣读书 Top250 采集器(douban-top250) 采集豆瓣读书 **公开榜单** Top250,经典静态分页练手项目:翻页、CSS 选择器解析、字段清洗、CSV 输出。 ## 功能特性 - 经典静态分页抓取(每页 25 本,共 10 页 250 本),支持 `--pages` 控制页数 - CSS 选择器解析:书名、作者/出版社、评分、评价人数、简介、链接 - 请求间隔 ≥1.5 秒 + 请求头伪装,降低被拦截概率 - 某页无数据自动提前结束,异常页跳过不中断 - 输出 UTF-8-BOM 编码 CSV,Excel 直接打开不乱码 ## 技术栈 Python 3.10+ · requests · BeautifulSoup4 · lxml ## 安装 ```bash pip install -r requirements.txt ``` ## 使用方法 ```bash # 抓全 250 本(10 页) python main.py --pages 10 # 快速试跑 2 页(50 本) python main.py --pages 2 --out out.csv ``` ### 参数说明 | 参数 | 说明 | 默认值 | |---|---|---| | `--pages` | 抓取页数,每页 25 本,最多 10 页 | `10` | | `--out` | 输出 CSV 路径 | `output/douban_top250.csv` | ## 输出示例(真实运行结果) ``` python main.py --pages 2 ``` | 书名 | 作者/出版社 | 评分 | 评价人数 | 简介 | 链接 | |---|---|---|---|---|---| | 红楼梦 | (清)曹雪芹 / 人民文学出版社 / 1982-3 / 59.70元 | 9.7 | 468999 | 都云作者痴,谁解其中味? | https://book.douban.com/subject/1007305/ | | 活着 | 余华 / 作家出版社 / 2012-8 / 28.00元 | 9.4 | 925273 | 生的苦难与伟大 | https://book.douban.com/subject/4913064/ | | 哈利·波特 | [英] J·K·罗琳 / 苏农 / 人民文学出版社 / 2008-12 / 498.00元 | 9.7 | 140135 | 从9¾站台开始的旅程 | https://book.douban.com/subject/24531956/ | | 1984 | [英] 乔治·奥威尔 / 刘绍铭 / 北京十月文艺出版社 / 2010-4-1 / 28.00 | 9.4 | 314947 | 栗树荫下,我出卖你,你出卖我 | https://book.douban.com/subject/4820710/ | ## 运行截图 【放 1~2 张:终端运行截图 + 输出 CSV 文件截图】 ## 项目结构 ``` douban-top250/ ├── main.py 命令行入口 ├── spider.py 抓取与解析逻辑 ├── requirements.txt └── output/ (运行后生成) └── douban_top250.csv ``` ## 合规声明 本工具仅采集豆瓣公开榜单数据,遵守目标网站 robots.txt 精神与访问频率限制;不采集、不存储任何个人信息。仅供学习与研究使用。 ## License MIT