Spark2.4.0 今天官网发布,这是一个大好消息。 Spark 2.4.0是2.x的第五个发型版本。官方发布消息链接如下: http://spark.apache.org/releases/spark-release-2-4-0.html 此版本继续关注可用性,稳定性和优化,浪尖在这里摘要翻译一下,主要的关注点: SparkCore 和 SQL
性能和稳定性 这个优化比较多,值得关注 这个优化主要是Parquet,orc,csv及avro等的优化升级 MLlib StructuredStreaming 使用foreachBatch(支持Python,Scala和Java)将每个微批的输出行暴露为DataFrame。 为Python API 增加了foreach 和 ForeachWriter 支持使用“kafka.isolation.level”读取使用事务的生产者生产到kafka topic的已提交消息。
Spark SQL的升级页面里也有对Spark 2.4 在 SQL 方面的调整优化,大家有兴趣也可以看看,有没有自己关注的bug被修复了。 http://spark.apache.org/docs/latest/sql-migration-guide-upgrade.html#upgrading-from-spark-sql-23-to-24 细心的同学注意到了,Spark Streaming已经稳定到不用更新了,,,还是说Spark Streaming已经凉凉了。
原文链接: https://mp.weixin.qq.com/s/wZllSPNr7z6IvGQrXmFjmg 作者:浪尖
|