Spark上的大数据平台都能做什么?

最新发布的Paxata平台将能为后端工具准备更大规模的种类更多的数据。该软件搭配无模型、内存管道处理器和基于Spark的分布式处理引擎HDFS使用。

为了提高数据准备工作的自动化能力,Paxata采用了机器学习和语义检索能力。这能帮助数据科学家和业务分析师处理数据转换等相关工作。

Paxata联合创始人、副总裁Nenshad Bardoliwalla表示,软件的任务是帮助人解决难题,对数据科学家而言,我们的软件可以帮助实现前端数据准备和大数据集成。不过Bardoliwalla也指出希望在后端的虚拟化软件有所作为,现在主要的供应商是Tableau,但产品要完善的地方还很多。

Bardoliwalla表示,Paxata的Spring 15平台支持使用RESTAPI工具集的数据提取。“如果使用可视化工具之前还要花大量时间准备数据,那也太不友好了。”

Paxata还提供机器学习界面。Bardoliwalla表示:“数据分析最困难的部分就是录入很多数据源。在这方面,Tableau采用了可视化的方式,而我们希望采用另一种新的方式进行数据准备。”