轻量级加密保障Hadoop安全
面向大数据与云环境中MapReduce层的轻量级加密模型以保障安全
1. 引言
数据安全是许多组织和个人面临的主要问题。技术日新月异地发展,通过在线应用传输大量数据,这些应用需要大规模的存储和计算能力。社交媒体应用和电子商务应用正在产生庞大的数据库。海量数据的生成给大数据带来了诸多主要问题,包括安全、定制化、平稳性能和成本效益。这类大数据问题在Hadoop中具有其独特地位。此外,大数据中的安全与隐私在Hadoop平台上是一个具有挑战性的问题。本研究工作重点在于保护大数据的安全与隐私。
Hadoop HDFS 是大数据环境中使用的存储平台之一。用户对 Hadoop平台在数据存储和访问方面没有任何抱怨。当数据存储在 Hadoop平台中时,可以本地访问,并且数据访问仅需要互联网。Hadoop平台提供数据安全和硬件分配。Hadoop是最近的进展,是一种用于存储大量数据的模型,并且是一个开源环境。
许多研究人员关注HDFS文件的安全性,大多数方法集中在将数据存储到数据节点以及从不同数据节点传输数据时的加密机制。在 Hadoop平台中,使用加密技术来最小化安全风险和数据泄露。应用加密技术的主要缺点是文件大小增加了一半。在上传文件和下载文件时,时间复杂度也会增加。为了解决这个问题,本文提出了一个新的加密算法,称为轻量级加密模型。基于该加密机制开发了安全MapReduce层,以在指定时间内满足大数据的安全与隐私需求。本文其余部分组织如下。第2节介绍了大数据隐私和安全方面的最新进展。第3节介绍了用于在 HDFS文件系统中保持安全的轻量级加密模型。第4节讨论了所提出的算法与现有算法的实验分析。最后第5节总结了研究工作。
2. 文献综述
Hadoop平台于2008年推出,用于管理大量数据存储,但存在一些局限性。因此,此处涉及安全考虑较少[1]。为了在Hadoop中存储数据,它仅使用用户的名称。HDFS和客户端系统没有加密过程,因此更容易受到安全攻击。为了解决这个问题,雅虎在 2009[1]中引入了认证机制,但它在验证方面也存在一些问题。Hadoop具有大规模数据管理、成本效益和可扩展性的优势。它还支持隔离存储,以保护不同组织的机密信息。Hadoop中的数据以槽位形式存储,当这些槽位组合在一起进行访问时,将会出现一些安全挑战。大数据包含多种类型的安全信息,如企业数据、财务数据和个人数据。因此,在不篡改的情况下,需要对数据进行最佳安全保护 [2–6]。
在[7]中,作者为大数据开发了快速匿名化算法。该算法专注于在保护安全的同时实现匿名性,并减少信息损失。在[8]中,作者研究了针对小型数据集的随机化隐私保护算法。在此模型中,客户端保留个人信息,仅将具有统计意义的重要信息转发到服务器。客户端通过随机化算法维护数据的隐私。在[9]中,作者在Twitter数据集上开发了 k‐匿名性算法。该算法进一步结合l‐多样性算法用于微型数据集,并以防御邻近攻击。该算法仍需在降低复杂度方面进行一些改进,并应适用于更大的数据集。在[10]中,作者提出了用于大数据的属性关联算法。该算法采用扰动机制,通过对列中的数据值进行旋转来移动其位置。在[11]中,提出了MapReduce匿名化算法。该算法将文件分割,并将分块文件分发到各个节点。在映射过程中,每个分块文件与文件ID进行映射,并将这些文件ID分配给节点。归约器维护文件ID和节点的详细信息。此过程将减轻系统执行大文件时的负载。
在[12]中,作者提出了用于MapReduce框架的k‐匿名性多维算法。该算法专注于较小的数据集。在[13]中,作者提出了Map Reduce模型,为机密数据的分布式计算提供强大的数据安全和隐私保护。该模型结合了强制访问控制和差分隐私,以实现Map Reduce计算。在[14]中,作者调研了大数据中隐私与安全的不同方面,解释了在大数据生命周期各个阶段的安全实施方法。
3. 一种用于保护Hadoop环境的加密模型
Hadoop环境中的安全机制是访问控制和文件权限。在这种情况下,应用加密机制是对数据节点中的文件进行保护的最佳方法。我们可以将加密解决方案用于Hadoop平台,以提供数据机密性和完整性。通常,加密密钥分为两类:对称密钥加密和非对称密钥加密。为了解决 Hadoop平台的问题,需要一个高效的、安全的分布式环境[15–17]。
本研究工作提出了一个安全MapReduce框架,用于保护从社交网络、网络日志和流数据中收集的数据的安全。在传统大数据中,缺乏识别结构化数据和非结构化数据敏感性的机制,因此需要一些额外的机制来保护个人数据。在本研究工作中,我们重点是在传统的映射归约模型中加入额外的安全层。这一新层专注于数据的独立性以及映射归约阶段的输出,以提供安全性。提出了轻量级安全算法,以减少对大数据功能的开销。因此,数据一旦到达安全映射归约层即可得到保护。图1展示了所提出的模型的架构,其中包含来自社交网络、网络日志和实时流媒体等不同来源的数据采集。这些收集的数据随后被转发到Hadoop分布式文件系统(HDFS)。在HDFS层与MR层之间引入了安全MapReduce层。
安全MapReduce层基于加密机制开发,该机制在指定时间内满足大数据环境中的安全和隐私需求。在所提出的协议中,数据被转发到 HDFS系统,并从HDFS传输到映射归约层。所考虑的大数据包括社交媒体数据、网络日志和实时流媒体数据。提出的加密过程在映射归约层中执行。第一步,将数据转换为数字,通过对数据中的每个词进行分词处理来实现。采用键值对机制来处理每一个独立的词,并统计该词在给定数据中的重复次数。其中,键表示特定词的重复次数。此过程提供了高安全性与高效的加密过程。第二步,对已转换的数据执行随机化过程。HybrEx模型用于执行加密解密过程。加密过程在私有云中进行,而解密过程在公共云中进行。图2显示了HybrEx模型[19]用于所提出的安全 MapReduce。
在所提出的模型中执行解密,该过程是加密过程的完全逆向操作。在解密过程中,将键值对作为输入提供给HDFS,然后将HDFS的输出转发到映射归约层。解密在映射归约层中进行,包含两个步骤:一是随机化的重构,二是数据中数字转换为词语。
算法1:Map Reduce模型中的加密过程
输入
:数据文件(X)
输出
:加密数据(ED)
开始映射阶段
执行数据文件 (X) 的分区
对于 X 中的每一行 Ki 执行
读取 Ki
对 Ki 进行分词
对于每个单词 wj 执行
将单词 wj 转换为数字 sj
将sj替换为随机数ran(sj)
结束循环
结束循环
更新(ran(sj), ED);
更新(Map id,ED)
归约阶段
对映射结果执行合并操作
对 wj// count(wj) 进行计数
对 count(wj) 执行加密
End
算法1 展示了提出的安全Map Reduce模型的加密过程。第一步,将数据文件分割成等大小块,并转发到m个计算节点,在这些节点上执行Map Reduce机制。下一步,在映射阶段逐行读取从文件中获取的数据,并进行分词。随后,通过随机化过程将其转换为仲裁数。然后用加密数据更新文件,其中将随机数代替原始数字并附带索引写入。在算法 2中,使用逆向随机化过程来恢复原始数字,并保持句子中的顺序。映射器结果被转发给归约器,归约器通过维护映射器ID的顺序来保持句子中的序列。
4. 实验分析
所提出的模型在配备12GB内存和4个CPU的亚马逊EC2环境中实现。该模型在Java平台上开发,并在Hadoop平台上运行。多节点环境由4个不同的工作站支持。Twitter数据集[18]被选用于在Hadoop平台上处理大数据。为了评估所提出模型的性能,我们将结果与Map‐Reduce匿名化算法[11]和Mondrian算法[12]进行了比较。各算法的运行时间如表1所示。可以看出,与现有算法相比,所提出的算法具有更短的运行时间。图3显示了所提出模型的CPU利用率。可以看出,CPU使用率介于18%至27%之间;而在图4中,所提出模型的内存使用记录为48%(即12GB中的5.7GB)。该结果证明了所提出的模型在大数据处理方面是高效的。
信息损失 :在任何隐私模型中,由于加密过程都会发生信息损失,并且可以通过公式1来衡量。
信息损失 = $\frac{1}{m \times n} \sum_{i=1}^{m} \sum_{j=1}^{n} (up_{ij} - lw_{ij})$
其中,$ m $ 表示属性,$ n $ 表示元组,$ up_{ij} $ 表示属性的上边界,$ lw_{ij} $ 表示属性的下边界。
| 数据大小(记录) | 所用时间(毫秒×10⁶) MRA算法 [11] | 所用时间(毫秒×10⁶) Mondrian算法 [12] | 所用时间(毫秒×10⁶) 提出的算法 |
|---|---|---|---|
| 100万 | 0.78 | 0.49 | 0.67 |
| 1000万 | 5 | – | 2.07 |
| 5000万 | 26 | – | 6.45 |
| 1亿 | 54 | – | 13.24 |
表1 运行时间比较
表2 所提出的模型中的信息损失
| 执行次数 | 信息损失百分比 |
|---|---|
| 1 | 4.75 |
| 2 | 3.85 |
| 3 | 5.24 |
| 4 | 5.14 |
| 5 | 5.42 |
图5 显示,所提出的模型记录的信息损失为5%,而MRA记录的信息损失为42%。
算法2: Map Reduce模型中的解密过程
输入
:加密数据(ED)
输出
:解密数据 (DD)
映射阶段
对加密数据(ED)执行分区
对于ED中的每一行Ki执行
读取映射ID
将哈希映射(H)添加到映射ID
对 Ki 进行分词
对 sj 执行逆向随机化过程
将哈希映射(H)添加到获得的字符串 sj
归约阶段
:
读取 H
生成有序解密文件
生成解密频率
End
在算法2中,加密文件被转发到服务器,并且该文件在HDFS中被划分为m个块,每个块被分发到n个节点。每个节点逐行读取分区后的文件,并为每个映射器ID创建哈希映射。然后,进行分词过程,并通过逆向随机化执行解密。随后,将完全解密的字符串附加到相应的映射器ID上。在归约阶段,通过对句子中的数据进行排序来解密哈希映射H,并生成包含解密频率和词频统计的输出文件。
5. 结论
本文关注大数据的安全与隐私。提出的轻量级加密模型提供了为大数据提供最大安全性。HDFS中的安全Map Reduce层执行轻量级加密模型。该加密算法使用随机化来保障大数据的安全性。实验分析证明,与现有算法相比,所提出的算法的运行时间显著减少。在所提出的安全Map Reduce模型中,CPU和内存利用率得到优化,信息损失被最小化。
更多推荐
所有评论(0)