Spark执行Action后DataFrame会被移出内存吗?如何合理使用cache()?
Spark中cache()的缓存机制与DAG执行逻辑
- 调用
cache()后的DataFrame,在首次执行Action时会被持久化到内存(默认存储级别为MEMORY_ONLY),Action执行完成后不会立刻从内存消失。Spark会尽可能将其保留在内存中,供后续操作复用。 - DataFrame被移出内存的常见条件:
- 集群内存不足时,Spark会通过LRU(最近最少使用)策略,优先清除不常用的缓存数据(可能转存到磁盘或直接删除)。
- 主动调用
df.unpersist()方法,手动清除该DataFrame的缓存。 - Spark应用程序终止时,所有缓存的DataFrame都会被释放。
- 关于后续操作的DAG执行:如果已经对DataFrame调用了
cache(),后续对该DataFrame执行的Action或转换操作,不需要重新执行从读取到cache点的整个前置DAG环节,直接复用缓存中的数据即可。只有当缓存被清除(比如内存不足被踢出、主动unpersist),后续操作才会重新执行完整的DAG。
内容的提问来源于stack exchange,提问作者chad
相关产品推荐
相关产品推荐

