用于 dbt 的 Databricks 适配器插件
项目描述
dbt使数据分析师和工程师能够使用与软件工程师构建应用程序相同的实践来转换他们的数据。
Databricks Lakehouse提供了一个简单的平台来统一您的所有数据、分析和 AI 工作负载。
dbt-databricks
该dbt-databricks适配器包含使 dbt 能够与 Databricks 一起使用的所有代码。该适配器基于dbt-spark中完成的惊人工作。一些关键功能包括:
- 易于设置。无需安装 ODBC 驱动程序,因为适配器使用纯 Python API。
- 默认打开。例如,它默认使用开放且高性能的Delta表格式。这有很多好处,包括让您
MERGE用作默认的增量实现策略。 - 支持统一目录。dbt-databricks>=1.1.1 支持 Unity Catalog 的 3 级命名空间(目录/模式/关系),因此您可以按照自己喜欢的方式组织和保护数据。
- 性能。适配器生成 SQL 表达式,这些表达式由本机矢量化Photon执行引擎自动加速。
在 dbt-databricks 和 dbt-spark 之间进行选择
如果您在 Databricks 上开发 dbt 项目,dbt-databricks出于上述原因,我们建议您使用。
dbt-spark是一个积极开发的适配器,可以与 Databricks 以及 Apache Spark 一起使用,例如在 AWS EMR 上托管。
入门
安装
使用 pip 安装:
pip install dbt-databricks
升级到最新版本
pip install --upgrade dbt-databricks
配置文件设置
your_profile_name:
target: dev
outputs:
dev:
type: databricks
catalog: [optional catalog name, if you are using Unity Catalog, only available in dbt-databricks>=1.1.1]
schema: [database/schema name]
host: [your.databrickshost.com]
http_path: [/sql/your/http/path]
token: [dapiXXXXXXXXXXXXXXXXXXXXXXX]
快速入门
以下这些快速入门将帮助您启动并运行dbt-databricks适配器:
- 开发您的第一个 dbt 项目
- 将 dbt Cloud 与 Databricks 结合使用 ( Azure | AWS )
- 在 Databricks 工作流上运行 dbt 生产作业
- 在 Databricks 上为 dbt CI/CD 使用 GitHub Actions
兼容性
dbt-databricks适配器已经过测试:
- 使用 Python 3.7 或更高版本。
- 反对
Databricks SQL和Databricks runtime releases 9.1 LTS后来。
项目详情
下载文件
下载适用于您平台的文件。如果您不确定要选择哪个,请了解有关安装包的更多信息。
源分布
dbt-databricks-1.2.3.tar.gz
(19.4 kB
查看哈希)
内置分布
dbt_databricks-1.2.3-py3-none-any.whl
(21.9 kB
查看哈希)
关
dbt- databricks -1.2.3.tar.gz 的哈希值
| 算法 | 哈希摘要 | |
|---|---|---|
| SHA256 | 4aaee1846f29e66c125257d4469cccf0b848176198b12aa60b3ffe1caefd2fd6 |
|
| MD5 | 1deb0b4a9c6b68dc2a30a7bf2d9042f6 |
|
| 布莱克2-256 | 40b9070f3798b680b3121f1bbc2625e6a4f035e7128401829bcd5ca180bf8fe3 |
关
dbt_databricks -1.2.3-py3-none-any.whl 的哈希值
| 算法 | 哈希摘要 | |
|---|---|---|
| SHA256 | b4edba311e7988efd15b1210e68f591bba6538e8b155fb4c0268c1782efbb085 |
|
| MD5 | c454795d81732fedb7efe595e7d4dda2 |
|
| 布莱克2-256 | 055382d3b0a6b110c78bc32654c2fd020d742691cc9111408368fd6057f97bbb |