Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

8 Commits
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

双色球历史数据爬虫与分析项目 🎲

English | 简体中文

项目简介

本项目基于 Python 实现对新浪双色球走势图数据的自动化爬取与处理。

项目通过爬虫技术获取双色球历史开奖数据,并利用 HTML 解析方法提取每期开奖号码,为后续的数据分析、统计建模和机器学习实验提供数据基础。

本项目主要用于数据挖掘课程实验,完成从:

数据采集 → 数据解析 → 数据清洗 → 数据保存 → 数据分析

的完整流程。


数据来源

数据来源:

新浪彩票双色球基本走势图

数据内容包括:

  • 历史开奖期号
  • 红球号码
  • 蓝球号码
  • 双色球走势图信息
  • 遗漏值统计数据

项目功能

1. 双色球网页数据爬取

使用 Python 请求新浪双色球走势图页面:

  • 自动访问网页
  • 获取 HTML 源代码
  • 保存原始数据

2. HTML 数据解析

使用 BeautifulSoup 对网页结构进行解析:

  • 定位双色球走势图表格
  • 识别开奖号码对应 HTML 标签
  • 提取红球和蓝球号码

3. 数据处理

使用 Pandas 进行数据整理:

生成标准开奖数据:

期号 红1 红2 红3 红4 红5 红6 蓝球
2023042 10 17 20 23 27 30 10

4. 数据保存

支持保存:

  • CSV 文件
  • Excel 文件

项目结构

ssq_spider/

├── spider.py              # 双色球走势图网页爬取程序
│
├── extract_ssq.py         # 开奖号码提取程序
│
├── requirements.txt       # Python依赖环境
│
├── environment.yml        # Conda环境配置
│
├── README.md              # 项目说明文档
│
└── .gitignore             # Git忽略文件配置

技术栈

开发语言

  • Python 3.11

使用库

用途
requests 网页请求
BeautifulSoup4 HTML解析
pandas 数据处理
openpyxl Excel文件保存
html5lib HTML解析支持

环境配置

方法一:使用 Conda(推荐)

创建环境:

conda env create -f environment.yml

激活环境:

conda activate datamining

方法二:使用 pip

安装依赖:

pip install -r requirements.txt

使用方法

1. 爬取双色球网页数据

运行:

python spider.py

功能:

  • 获取新浪双色球走势图 HTML
  • 解析网页表格
  • 保存原始走势图数据

2. 提取开奖号码

运行:

python extract_ssq.py

功能:

  • 提取每一期红球号码
  • 提取蓝球号码
  • 生成标准开奖数据集

输出:

ssq_result.csv

数据格式:

期号,红1,红2,红3,红4,红5,红6,蓝球
2023042,10,17,20,23,27,30,10

数据处理流程

新浪双色球走势图

        |
        |
        v

Requests请求网页

        |
        |
        v

获取HTML源码

        |
        |
        v

BeautifulSoup解析

        |
        |
        v

识别开奖号码标签

        |
        |
        v

Pandas数据整理

        |
        |
        v

生成CSV数据集

        |
        |
        v

数据分析与挖掘

数据分析方向

基于生成的数据集,可以进一步开展:

1. 双色球号码统计分析

包括:

  • 红球出现频率统计
  • 蓝球出现频率统计
  • 热号与冷号分析
  • 号码分布规律分析

2. 可视化分析

可以使用:

  • Matplotlib
  • Seaborn

实现:

  • 号码频率柱状图
  • 趋势变化图
  • 分布统计图

3. 数据挖掘模型

可以进一步研究:

  • 分类模型
  • 随机森林
  • XGBoost
  • 时间序列分析

用于分析号码出现概率。


注意事项

双色球开奖结果具有随机性。

本项目的数据分析结果仅用于:

  • 数据挖掘学习
  • 统计分析实验
  • 算法研究

不代表能够预测实际开奖结果。


项目作者

Xiebw


License

本项目仅用于学习和研究目的。

About

A Python-based lottery data collection, cleaning and data mining project.

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages