
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
SparkCore--学习笔记
SparkCore学习笔记摘要(149字) RDD是Spark的核心分布式计算模型,本质是封装方法和属性的对象,适合分布式处理。其操作分为Transfrom(转换)和Action(执行)两大类,采用惰性计算机制,只有遇到Action才会真正执行。关键运行机制包括:Shuffle过程(数据按key重分布,涉及磁盘I/O和网络传输)、血统溯源(通过记录转换步骤实现容错)、持久化缓存(避免重复计算)以及
到底了







