English | 简体中文
本项目基于 Python 实现对新浪双色球走势图数据的自动化爬取与处理。
项目通过爬虫技术获取双色球历史开奖数据,并利用 HTML 解析方法提取每期开奖号码,为后续的数据分析、统计建模和机器学习实验提供数据基础。
本项目主要用于数据挖掘课程实验,完成从:
数据采集 → 数据解析 → 数据清洗 → 数据保存 → 数据分析
的完整流程。
数据来源:
新浪彩票双色球基本走势图
数据内容包括:
- 历史开奖期号
- 红球号码
- 蓝球号码
- 双色球走势图信息
- 遗漏值统计数据
使用 Python 请求新浪双色球走势图页面:
- 自动访问网页
- 获取 HTML 源代码
- 保存原始数据
使用 BeautifulSoup 对网页结构进行解析:
- 定位双色球走势图表格
- 识别开奖号码对应 HTML 标签
- 提取红球和蓝球号码
使用 Pandas 进行数据整理:
生成标准开奖数据:
| 期号 | 红1 | 红2 | 红3 | 红4 | 红5 | 红6 | 蓝球 |
|---|---|---|---|---|---|---|---|
| 2023042 | 10 | 17 | 20 | 23 | 27 | 30 | 10 |
支持保存:
- CSV 文件
- Excel 文件
ssq_spider/
├── spider.py # 双色球走势图网页爬取程序
│
├── extract_ssq.py # 开奖号码提取程序
│
├── requirements.txt # Python依赖环境
│
├── environment.yml # Conda环境配置
│
├── README.md # 项目说明文档
│
└── .gitignore # Git忽略文件配置
- Python 3.11
| 库 | 用途 |
|---|---|
| requests | 网页请求 |
| BeautifulSoup4 | HTML解析 |
| pandas | 数据处理 |
| openpyxl | Excel文件保存 |
| html5lib | HTML解析支持 |
创建环境:
conda env create -f environment.yml激活环境:
conda activate datamining安装依赖:
pip install -r requirements.txt运行:
python spider.py功能:
- 获取新浪双色球走势图 HTML
- 解析网页表格
- 保存原始走势图数据
运行:
python extract_ssq.py功能:
- 提取每一期红球号码
- 提取蓝球号码
- 生成标准开奖数据集
输出:
ssq_result.csv
数据格式:
期号,红1,红2,红3,红4,红5,红6,蓝球
2023042,10,17,20,23,27,30,10
新浪双色球走势图
|
|
v
Requests请求网页
|
|
v
获取HTML源码
|
|
v
BeautifulSoup解析
|
|
v
识别开奖号码标签
|
|
v
Pandas数据整理
|
|
v
生成CSV数据集
|
|
v
数据分析与挖掘
基于生成的数据集,可以进一步开展:
包括:
- 红球出现频率统计
- 蓝球出现频率统计
- 热号与冷号分析
- 号码分布规律分析
可以使用:
- Matplotlib
- Seaborn
实现:
- 号码频率柱状图
- 趋势变化图
- 分布统计图
可以进一步研究:
- 分类模型
- 随机森林
- XGBoost
- 时间序列分析
用于分析号码出现概率。
双色球开奖结果具有随机性。
本项目的数据分析结果仅用于:
- 数据挖掘学习
- 统计分析实验
- 算法研究
不代表能够预测实际开奖结果。
Xiebw
本项目仅用于学习和研究目的。