如果小波变换后的数据与原始数据长度相同,这项技术如何用于数据缩减?

data miningdatabasedata structure更新于 2026/2/3 21:52:17

其实用性在于可以限制小波变换后的数据。通过仅保存小波系数主成分的一小部分,可以保留信息的压缩近似值。例如,可以保留所有高于某个用户定义阈值的小波系数。其他一些系数则设置为 0。

由此产生的数据描述非常稀疏,因此,如果在小波空间中实现能够利用数据稀疏性的服务,其计算速度会非常快。该方法还可以消除噪声,而无需平滑数据的主要特征,从而也使其在数据清理方面非常高效。给定一组系数,可以使用与应用的离散小波变换 (DWT) 相反的方法来生成原始数据的近似值。

离散小波变换 (DWT) 通常与离散傅里叶变换 (DFT) 相关,后者是一种包含正弦和余弦的信号处理方法。一般来说,DWT 可以实现良好的有损压缩。如果给定数据向量的 DWT 和 DFT 保留相似数量的系数,则 DWT 版本将支持更高效的原始记录近似。

因此,对于相同的近似值,DWT 所需的面积比 DFT 更小。与 DFT 不同,小波完全局域化于空间,有助于局部元素的守恒。DFT 只有一种,但 DWT 却有多种族。

有一些著名的小波变换,例如 Haar-2、Daubechies-4 和 Daubechies-6 变换。使用离散小波变换的一般过程有助于实现分层金字塔算法,该算法在每次迭代时将记录减半,从而提高计算速度。方法如下 −

  • 输入数据向量的长度 L 应为 2 的幂。此条件可以通过在数据向量中填充零(L ≥ n)来实现。

  • 每次变换都涉及使用两个函数。第一个函数使用各种数据平滑处理,包括求和或加权平均值。第二个函数实现加权差分,这有助于展现数据的详细特征。

  • 这两个函数用于 X 中的数据点对,即所有数据对 (x2i,x2i+1)。这将产生两组长度为 L/2 的数据。一般来说,它们定义了输入记录的平滑版本或低频版本,并相应地定义了其中的高频内容。

  • 这两个函数以递归方式应用于先前循环中获取的数据集,直到获取的结果数据集长度为 2。

  • 可以从后续迭代中获取的数据集中选择值作为变换后数据的小波系数。


相关文章