
后端前端大数据数据分析【免费下载链接】zeppelinWeb-based notebook that enables>项目地址https://gitcode.com/gh_mirrors/zeppelin2/zeppelin点击查看免费下载Apache Zeppelin 的 Hive Interpreter 允许你在 Notebook 中通过 HiveQL 直接查询分布式存储中的大数据集。本文基于 docs/interpreter/hive.md 编写系统讲解 Hive Interpreter 的连接配置、多前缀prefix连接机制、基本使用方法与 Dynamic Form 参数化技巧并重点说明其与 JDBC Interpreter 的迁移路径。读完本文你将掌握在 Zeppelin 中配置、使用 Hive 数据源并将其平滑迁移到 JDBC Interpreter 的完整方案。重要声明Hive Interpreter 将被废弃并合并到 JDBC Interpreter。你可以使用 JDBC Interpreter 来获得与 Hive Interpreter 相同的功能配置方式与依赖见下文。概览Hive 数据仓库与 Zeppelin 的结合Apache Hive 数据仓库软件用于在分布式存储中查询和管理大型数据集。Hive 提供了一种将结构投射到数据上的机制并使用一种名为 HiveQL 的类似 SQL 的语言查询数据。同时这种语言也允许传统的 map/reduce 程序员在 HiveQL 中不方便或低效表达逻辑时插入他们自定义的 mapper 和 reducer。在 Zeppelin 中Hive Interpreter 通过 JDBC 连接 HiveServer2从而将 Hive 数据仓库的能力引入交互式 Notebook 环境。从 Hive Interpreter 迁移到 JDBC Interpreter由于 Hive Interpreter 将被废弃新用户应直接使用 JDBC Interpreter 配置 Hive 连接。迁移时需要在解释器设置页面创建一个名为hive的 JDBC 解释器并配置以下属性PropertiesPropertyValuehive.driverorg.apache.hive.jdbc.HiveDriverhive.urljdbc:hive2://localhost:10000hive.userhiveUserhive.passwordhivePasswordDependenciesArtifactExcludeorg.apache.hive:hive-jdbc:0.14.0org.apache.hadoop:hadoop-common:2.6.0由于 Zeppelin 默认只内置 PostgreSQL 驱动连接 Hive 必须额外添加上述两个依赖。从源码看jdbc/pom.xml 提供了jdbc-hiveMaven profile其中使用hive-jdbc与hadoop-common等依赖来构建支持 Hive 的 JDBC 解释器。Configuration前缀机制与多数据源支持JDBC Interpreter 的配置表如下${prefix}代表你为某个特定连接起的前缀名可用于同时连接多个数据源。PropertyDefaultDescriptiondefault.driverorg.apache.hive.jdbc.HiveDriverJDBC 驱动类路径default.urljdbc:hive2://localhost:10000连接 URLdefault.user可选连接用户名default.password可选连接密码default.xxx可选驱动使用的其他属性${prefix}.driver%hive(${prefix})的驱动类路径${prefix}.url%hive(${prefix})的 URL${prefix}.user可选%hive(${prefix})连接的用户名${prefix}.password可选%hive(${prefix})连接的密码${prefix}.xxx可选%hive(${prefix})驱动使用的其他属性该解释器通过${prefix}提供多配置支持。用户可以用此前缀设置多个连接属性并在段落中通过%hive(${prefix})使用。从源码来看JDBCInterpreter.java 中的open()方法会遍历所有解释器属性按.拆分前缀构建一个basePropretiesMap。每个前缀必须同时包含driver和url否则该前缀对应的配置将被忽略并移除。因此default前缀总是存在而自定义前缀需完整提供 driver 与 url。How to use基本用法如下%hive select * from my_table;或使用前缀指定特定连接%hive(etl) -- etl is a ${prefix} select * from my_table;默认情况下你可以一次运行最多 10 条查询更改此设置的开关尚未实现。从源码看executeSql 方法 会先按前缀读取连接配置并通过getConnection(propertyKey, interpreterContext)获取连接然后执行 SQL。若前缀不存在则返回Prefix not found.错误。Apply Zeppelin Dynamic Forms你可以在查询中利用 Zeppelin Dynamic Form。同时支持text input和select form两种参数化功能。%hive SELECT ${group_by}, count(*) as count FROM retail_demo.order_lineitems_pxf GROUP BY ${group_byproduct_id,product_id|product_name|customer_id|store_id} ORDER BY count ${orderDESC,DESC|ASC} LIMIT ${limit10};其中${limit10}是一个 text input 表单默认值为 10。${group_byproduct_id,product_id|product_name|customer_id|store_id}是一个 select 表单默认选项为product_id可选值有product_id、product_name、customer_id、store_id。${orderDESC,DESC|ASC}是另一个 select 表单默认值为DESC可选DESC或ASC。Zeppelin 会在段落下自动渲染这些表单用户修改后可直接重跑查询实现交互式数据分析。结论Hive Interpreter 已正式进入弃用流程官方推荐直接使用 JDBC Interpreter 并配置org.apache.hive.jdbc.HiveDriver驱动及对应依赖来实现同等功能。配置时只需正确设置driver、url、user、password等属性并结合%hive(${prefix})前缀机制与 Dynamic Form即可在 Zeppelin Notebook 中完成 Hive 数据源的交互式查询与分析。赞分享后端前端大数据数据分析【免费下载链接】zeppelinWeb-based notebook that enables>项目地址https://gitcode.com/gh_mirrors/zeppelin2/zeppelin点击查看免费下载相关推荐在 Apache Zeppelin 中使用 Hive从独立 Hive Interpreter 迁移到 JDBC Interpreter 的完整指南在 Apache Zeppelin 中使用 Hive从独立 Hive Interpreter 迁移到 JDBC Interpreter 的完整指南 本指南以数据分析数据可视化大数据后端前端任务调度Apache Zeppelin Hive Interpreter 使用指南已合并至 JDBC Interpreter 的完整迁移与配置实践Apache Zeppelin Hive Interpreter 使用指南已合并至 JDBC Interpreter 的完整迁移与配置实践 Apache Ze数据分析数据可视化大数据后端Apache Zeppelin SQL 支持完全指南从 JDBC 通用连接器到 Spark/Flink 与动态表单Apache Zeppelin SQL 支持完全指南从 JDBC 通用连接器到 Spark/Flink 与动态表单 Apache Zeppelin 是一个基于数据分析数据可视化大数据后端上一篇【亲测免费】 推荐开源神器xbanish - 智能隐藏鼠标专注你的键盘工作流下一篇如何用PerfView分析堆栈数据从调用树到火焰图的完整指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考