本文旨在练习哈夫曼树的创建、遍历方法来生成码表对文字进行压缩。故读仅仅对英文.txt文本进行读取并压缩,生成文档。由于哈夫曼编码压缩是基于统计模型的编码压缩,适用于压缩静态文件流、同时希望元素重复频率高。因此该压缩算法没有推广到对于任意类型文件的压缩。
压缩思路:
英文文档中主要由26个英文字母 (区分大小写),空格、换行符、常用标点符号、阿拉伯数字组成。不妨将它们看作是标签不同的桶,以便进行大量文本的分类。这样,对于一片篇幅很大的英文文档 (如维克多-雨果的《悲惨世界》:约125万字),需要建立英文字符、空格、换行符、常用标点符号、阿拉伯数字的数组来记录数组中相应元素出现在文章中的位置。
例如:
Abracadabra.
ArrayList[] A = [0]; ArrayLish[] a = [3, 5, 7, 10]; ArrayList[] b = [1, 8];以此类推。
但是,随着长篇文章的读取,字符的位置数值会越来越大,可以考虑标记相对位置,或按照页数为进行分类标记。
数组建立后,获得数组的长度即为该数组代表的字符出现的频率,将频率进行哈夫曼编码,可根据数组的位置信息将编码填充,得到压缩后的文档。