Skip to content
PostData Analysis / Data Visualization

DV-02-Data

2025-12-30
Back to Blog

DV-02-Data

  • Data & Dataset
    • Tabular Data
    • Data Cleaning
    • OnLine Analytical Processing (OLAP)

converting tabular data into a multidimensional array.

  1. First, identify which attributes are to be the dimensions and which attribute is to be the target attribute whose values appear as entries in the multidimensional array.
  2. Second, find the value of each entry in the multidimensional array by summing the values (of the target attribute) or count of all objects that have the attribute values corresponding to that entry.

1. 可视化过程概述

  • 典型的可视化过程:从数据控制参数(视角、过滤等)映射到图像。
  • 信息可视化参考模型(Card et al.):
    1. Data transformations
    2. Visual mappings
    3. View transformations

2. 数据与数据集

  • 数据:观测或测量结果(文本、数字、多媒体)。
  • 数据集:结构化的数据集合,通常对应特定研究。
  • 属性(Attribute):对象的特性(也称变量、特征)。
  • 对象(Item):由多个属性描述的记录(也称实例、样本)。
  • 属性类型
    • Categorical(类别型)
    • Ordered(有序型:如大小序)
    • Quantitative(定量型:支持加法、比例)
  • 关键判断:属性类型取决于有意义的数学操作,而非存储格式(例如邮编虽为数字,但属于类别型)。

3. 表格数据与多维表格

  • 表格数据:行(对象)+ 列(属性)。
  • 多维表格 / 数据立方体(Data Cube)
    • 由离散维度属性构成。
    • 单元格值为目标属性的聚合(如计数、总和)。 复习要点:多维表格便于从不同维度观察数据。

4. 数据转换(Data Transformation)

常见转换方法:

  • 归一化 $$y_i \leftarrow \frac{y_i}{\sum y_i}$$ 或标准化 $$y_i \leftarrow \frac{y_i}{\sigma} $$

  • 对数:ylogy

  • 幂变换:yy1/k

  • Box-Cox 变换:

    y(λ)={yλ1λλ0 logyλ=0
  • 分箱(Binning)、分组(Grouping)

5. 数据清洗(Data Cleaning)

数据清洗是去除不属于数据集的数据,常见步骤:

  1. 删除重复或无关观测
  2. 修复结构错误(命名不一致、拼写错误)
  3. 处理异常值(可删除或保留)
  4. 处理缺失值(删除、填补、调整分析方式)
  5. 验证与 QA(数据是否合理、符合领域规则、是否有趋势)

与数据转换的区别

  • 清洗:移除不该有的数据
  • 转换:改变数据格式或结构

复习要点:数据清洗是数据科学中最耗时的部分。

6. 表连接(Join Tables)

  • 主键(Primary Key):唯一标识记录(可复合)。
  • 外键(Foreign Key):引用其他表的主键。
  • 笛卡尔积:所有可能的行组合(通常不直接使用)。
  • 常见连接:内连接(匹配键)、左/右/全外连接。

复习要点:连接是整合多源数据的核心操作。

7. 在线分析处理(OLAP)与数据立方体

  • OLAP 将关系表转换为多维数组,便于分析。
  • 数据立方体:包含所有可能的聚合。
  • 关键操作:
    • Slicing:固定一个或多个维度取切片
    • Dicing:选取维度子范围
    • Roll-up:沿层次向上聚合(如日 → 月 → 年)
    • Drill-down:向下展开细节
  • 示例:销售数据立方体(时间、产品、地点)

复习要点:OLAP 操作使多维分析变得高效直观。

8. 排列与选择(Arrangement & Selection)

  • 排列:视觉元素的布局,极大影响理解难度。
  • 选择:特征选择或降维(便于可视化),也可采样。

9. 探索性数据分析(EDA)

  • 由 John Tukey 提出,强调先探索数据再建模。

  • 目标:

    1. 最大化对数据集的洞察
    2. 发现潜在结构
    3. 提取重要变量
    4. 检测异常值
    5. 验证假设
  • 与经典统计和贝叶斯分析的对比:

    • 经典:先假设模型 → 估计参数
    • EDA:先探索数据 → 选择合适模型
    • 贝叶斯:结合先验与数据更新后验

经典警示:Anscombe's quartet(四组统计量相同但图形完全不同的数据集)——说明必须看图!

10. 4-Plot 模型验证技术

用于检查残差的四个假设(随机、固定分布、固定位置、固定变异):

  1. Run sequence plot(检查位置和变异是否固定)
  2. Lag plot(检查随机性;自相关数据会呈线性趋势,正弦数据呈椭圆)
  3. Histogram(检查是否对称/正态)
  4. Normal probability plot(线性表示近似正态)

复习要点:4-plot 是快速验证单变量模型假设的有效工具。