使用 Apache Spark 进行在线潜在状态估计。
项目描述
阿坦
使用 Apache Spark 进行模型并行在线潜在状态估计。
概述
该库支持使用 Apache Spark 进行模型并行潜在状态估计,重点是与结构化流兼容的在线学习。主要为许多小规模系统的潜在变量的时间序列估计而开发,如果您正在寻找,这个库可以适合您的用例:
- 模型并行。模型并行是并行的主要模式,例如从在线测量/多个传感器训练多个相似的时间序列模型,或者具有不同先验/超参数的相同模型等。
- 在线学习。模型参数通过一次通过的测量顺序更新。算法使用的状态受限于#models 和模型参数。
- 潜在状态估计。专注于隐藏状态估计的方法,实施的方法包括过滤(卡尔曼滤波器、EKF、UKF、多模型自适应滤波器等)问题、平滑(RTS)问题、有限混合模型(多元高斯、泊松、伯努利)的解决方案, ETC,..)。
Artan 需要 Scala 2.12、Spark 3.0+ 和 Python 3,6+
下载
该项目已发布到 Maven 中央存储库。在集群上提交作业时,您可以使用
spark-submitwith--packages参数下载所有必需的依赖项,包括 python 包。
spark-submit --packages='com.github.ozancicek:artan_2.12:0.5.1'
对于 SBT:
libraryDependencies += "com.github.ozancicek" %% "artan" % "0.5.1"
对于蟒蛇:
pip install artan
请注意, pip 只会安装 python 依赖项。要提交 pyspark 作业,--packages='com.github.ozancicek:artan_2.12:0.5.1'应指定参数以下载必要的 jar。