Spark上的大数据平台都能做什么?
Paxata是一家应用机器学习技术处理大数据难题的初创公司。公司致力于将数据科学家和业务分析师从数据准备工作中解放出来,使他们能够专注于数据分析工作。
最新发布的Paxata平台将能为后端工具准备更大规模的种类更多的数据。该软件搭配无模型、内存管道处理器和基于Spark的分布式处理引擎HDFS使用。
为了提高数据准备工作的自动化能力,Paxata采用了机器学习和语义检索能力。这能帮助数据科学家和业务分析师处理数据转换等相关工作 。
Paxata联合创始人、副总裁Nenshad Bardoliwalla表示,软件的任务是帮助人解决难题,对数据科学家而言,我们的软件可以帮助实现前端数据准备和大数据集成。不过Bardoliwalla也指出希望在后端的虚拟化软件有所作为,现在主要的供应商是Tableau,但产品要完善的地方还很多。
Bardoliwalla表示,Paxata的Spring 15平台支持使用RESTAPI工具集的数据提取。“如果使用可视化工具之前还要花大量时间准备数据,那也太不友好了。”
Paxata还提供机器学习界面。Bardoliwalla表示:“ 数据分析最困难的部分就是录入很多数据源。在这方面,Tableau采用了可视化的方式,而我们希望采用另一种新的方式进行数据准备 。”
Via: TechTarget中国
End.