降维和数量缩减的区别?
data miningdatabasedata structure更新于 2026/1/5 3:07:17
降维
在降维中,数据编码或变换用于访问原始数据的简化或"压缩"描述。如果原始数据可以从压缩数据中重新生成且没有任何数据损失,则数据缩减被称为无损数据缩减。如果重建的数据只是原始数据的近似值,则数据缩减被称为有损数据缩减。
离散小波变换 (DWT) 与离散傅里叶变换 (DFT) 密切相关,后者是一种包含正弦和余弦的信号处理技术。通常,DWT 可实现更好的有损压缩。也就是说,如果给定数据向量的 DWT 和 DFT 保持相似数量的系数,则 DWT 版本将支持更精确的原始数据近似值。因此,对于等效近似,DWT 所需的面积比 DFT 更小。
数量缩减
在数量缩减中,通过选择另一种更小的数据表示形式来减少数据量。这些技术可以是参数化的,也可以是非参数化的。对于参数化方法,模型可以估计数据,因此只需保存数据参数,而无需保存实际数据,例如对数线性模型。非参数方法用于存储数据的简化表示,包括直方图、聚类和采样。
让我们看看降维和数量缩减之间的比较。
| 降维 | 数量缩减 |
|---|---|
| 在降维中,应用数据编码或变换来获得原始数据的简化或压缩表示。 | 在数量缩减中,通过选择交替的、更小的数据表示形式来减少数据量。 |
| 在降维中,离散小波变换 (DWT) 是一种线性信号处理技术,当用于数据向量 X 时,会将其转换为数值不同的小波系数向量 X'。 这两个向量的长度相同。当将此技术应用于数据缩减时,它可以将每个元组视为一个 n 维数据向量,即 X=(x1,x2,…xn) 表示从 n 个数据库属性对元组进行的 n 次测量。 | 在数量缩减中,回归和对数线性模型可用于近似给定的数据。在线性回归中,数据被建模以拟合一条直线。 例如,一个随机变量 y(称为响应变量)可以建模为另一个随机变量 x(称为预测变量)的线性函数,方程式为 y = wx+b,其中 y 的方差假定为常数。 |
| 它可用于删除不相关和冗余的属性。 | 它只是一种将原始数据表示为较小形式的技术。 |
| 在这种技术中,可能会丢失一些数据,这是不合适的。 | 在这种方法中,没有数据丢失,但整个数据以较小的形式表示。 |

