> For the complete documentation index, see [llms.txt](https://advancedguideforsds.gitbook.io/advancedguide/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://advancedguideforsds.gitbook.io/advancedguide/pei-yang-fang-an-jie-xi/da-er-chun-ji-xue-qi/shu-ju-fen-xi-yu-shi-jian-zhuan-ye-he-xin.md).

# 数据分析及实践（专业核心）

Presented by Wanglulu：<wanglulu114514@mail.ustc.edu.cn>

<figure><img src="/files/LujsNVVlsGNpaUe9LHN7" alt=""><figcaption><p>课程教材</p></figcaption></figure>

## 课程简介

数据分析及实践是数据科学专业的专业核心课程，主要内容为数据从生成到处理，再到利用的各个环节以及所涉及到的算法等，内容主要包括数据采集、数据预处理、特征工程、数据统计、数据挖掘。其中数据统计包含各种统计量、参数估计方法、假设检验方法、抽样方法等；数据挖掘包含分类与预测、聚类、关联分析和异常检测等。课程知识量较大，并伴有多次实验。

## 前置知识涉及的课程

概率论与数理统计、机器学习

这门课的四个章节分别叫数据科学基础、数据入门、数据统计和数据挖掘，但是等上完这门课以后会发现这四个章节都有更好的名字：

1. 数据科学科普
2. 数据采集和处理
3. 概统
4. 机器学习

如果你在上这门课前已经上了**人工智能与机器学习基础**，你会在这门课里见到很多熟悉的面孔，尤其是第二章和第四章。

## 课堂概况

刘淇老师执教这门课多年，已经形成了自己独特的上课风格，而2026年春季程明月老师的加入无疑为课堂注入了新鲜血液，让本课程呈现出一种勃勃生机万物竞发的境界。蒸蒸日上！

本课程的排课一般为下午的8、9、10节，但是基本不会提前下课。

课堂讲解完全基于PPT，附带少量板书。这门课的内容100%包含在PPT内，备考完全可以仅依赖PPT。但是本课程的PPT从开课以来直至2026年春似乎都没有更新过，其中存在的情况包括但不限于：

* 字被图片挡住
* 中英混杂
* 部分内容过时
* 重点不突出

课程讲授的的大多数知识点都是非常有用的，属于数据科学的学科常识和基础算法。不过课程的编排方式可能使内容显得难以理解。如有需要可以进行基于大模型的学习。

课上有小测而且可能上到一半就测。

## 实验概况

本课程没有祖传实验，每年都会设计新的实验。2026年春季的实验有5个，内容如下：

1. Python 基础，在bdaa的平台上写Python题
2. 从ICLR2026的网页上爬取数据并清洗
3. 使用给定的ICLR论文信息数据集进行统计分析
4. 使用给定的ICLR论文信息数据集进行关联规则挖掘
5. 使用给定的ICLR论文信息数据集进行机器学习，预测论文能否被Accept，并尝试编写能够自动执行数据分析脚本的Agent

需要注意目前的大模型已经能够独立完成所有实验，但实验中仍然有不少细节问题是只靠大模型无法解决的，比如爬虫的访问参数、数据过脏、数据图表分析等。这里特别提一下数据过脏，课上专门强调了数据分析的80%时间都在清洗数据，可能还不止。实验涉及到的数据集大概率会存在大量的格式错误、数值缺失等问题，需要仔细处理。

除实验1以外所有实验都需要写报告，报告要求按照实验步骤写明每一步的结果和分析。同学们不要提交纯血的AI报告，可能会导致一个比较低的分数。另外，2026春的报告要求直接提交md文件，请注意如果md文件中附有图片的话需要连带图片一起打包提交。

如果实验做得好可能会被选中上台分享。

## 考试情况

没有往年题，评课社区所有的往年题都是学长靠超强记忆力弄出来的。备考除了PPT就是评课社区。可以让AI帮你看着考点出点模拟题。

2026春季的考试题型为10道定项选择，4道不定项选择，3道填空，4道简答和4道综合，整体题量较大，考察内容广泛但不超出PPT。

每个章节的考察重点如下，其中带\*的为非常重要的重点：

### 第一章

没有。

### 第二章

* 爬虫：载入、解析和存储过程，数据请求方式，反爬虫和去重
* 数据存储：结构化、半结构化、非结构化
* \*数据预处理：数据清理、集成、变换、规约（这个部分是重中之重，会有大量可以计算的指标）
* \*特征工程：特征构造、TF-IDF、特征子集评价

### 第三章

* 反映数据集中趋势的分布指标：各种平均值、分位数、众数、箱图（各种统计图表）
* 反映数据离散趋势的分布指标：方差/标准差、极差/四分位差、异众比、变异系数
* 反映数据分布形态的分布指标：偏度系数、峰度系数
* \*参数估计：矩估计、最小二乘估计、MLE、MAP、Bayes估计、无偏有效相合
* 假设检验：第一类/第二类错误
* 抽样：各种抽样方法

### 第四章

* 关联规则：项集、\*支持度、\*置信度、\*Apriori算法、FP-Growth算法、提升度、辛普森悖论
* 分类：\*Acc/Pre/Recall/F1、ROC曲线、\*决策树（信息增益、基尼指数、过拟合分析、剪枝）、Bayes分类器、感知机、KNN
* 数据集成：Bagging、Boosting、评价指标
* 时序预测：各种概念和性质、\*ARIMA算法
* 聚类：层次聚类、密度聚类（DBSCAN）、SSE/SSB

## 评分细则

实验30分，考试60分，平时10分。这门课刚开始是没有考试的，2024年开始考试占大头，上这门课的同学一定要好好准备考试。

## 其他

本课程被广大同学评价为上课、实验、考试正交，请做好大量自学的准备。

课堂上涉及数据库的内容都可以不听，因为数据库系统概论会讲。

出分非常慢，不建议急需学分的同学选修/重修。

## 老学长留下的链接

{% embed url="<https://rec.ustc.edu.cn/share/7ba6cc80-be48-11ed-baf8-29dee41a5f77>" %}
