Spark Packages寻宝(一):简单易用的数据准备工具Optimus

作者:李呈祥,花名司麟 ,阿里云智能EMR团队高级技术专家,Apache Hive Committer, Apache Flink Committer,目前主要专注于EMR产品中开源计算引擎的优化工作


Spark社区在Spark Packages网站中索引了许多第三方库,这些第三方库由不同的M 5 6 R R s r J k开发者贡献,作为Spark生态圈的一部分,扩充了Spark的使用范围和使- M k J * B x用场景,其中很多对于我们日常的使用可能有帮助,我们准备e ^ G y ; h * Q E开启一个系列文章介绍Spark Packages中一些有意思的第三方库,作为系列的第一5 C k Z E {篇,本文主要介绍Optimus,一个基于PySpark的简单易用的数据8 - U Q W准备工具。

本文的部分内容源自Optimus官网和相关介绍文章,i | J原文链接参考文末引用部分。

在Spark3 [ E K K P _(Pyspark)的支e [ k持下,Optimus允许用户使用自己的或一组