You need to enable JavaScript to run this app.
文档中心
E-MapReduce

E-MapReduce

复制全文
下载 pdf
EMR on ECS 快速入门
EMR on ECS 快速入门
复制全文
下载 pdf
EMR on ECS 快速入门

火山引擎 EMR on ECS 是将 火山引擎 E-MapReduce(EMR)的大数据计算组件(包括 Hadoop、Spark、Hive 等)部署在 ECS(云服务器)实例上的一种半托管产品形态,支持灵活的集群配置,可适应各种复杂的数据处理和分析场景。本文适合第一次接触 EMR on ECS 的用户,通过创建一个可运行的 Hadoop 集群,了解 EMR on ECS 的基本功能和使用方式。

背景信息

作业(Job):作业是一个完整的数据计算任务,当用户需要在 EMR on ECS 集群中提交一个数据计算任务时,可在 EMR 中提交作业,作业提交后,系统使用集群计算资源执行作业。

前提条件
  • 首次使用 EMR on ECS 前,请跟随准备工作指引,完成火山引擎账号注册、实名认证、及 EMR 服务开通。EMR 主账号权限较大,建议根据最小权限原则,创建子用户并授予权限。
  • 根据创建集群指引,创建一个开启了 Spark 服务的 Hadoop 集群,用于用于提交和运行 Spark 作业。推荐新用户使用快速创建功能创建集群。

提交作业

场景1:登录集群节点,通过命令行创建作业

  1. 从 EMR 控制台登录 master 节点:

    1. 登录 EMR 控制台,在左侧导航栏中,选择资源管理> on ECS ,点击创建的集群名称进入集群详情页面,​点击左侧服务列表> Spark >展开 Spark Client,点击 master 节点的 ID,跳转到 master 节点的详细信息页面。
      Image
    2. 点击 master 节点的详细信息页面右上角远程连接,在弹窗中选择立即登录 ECS Terminal,进入远程登录页面,输入用户名和密码,登录节点终端,详细操作请参见通过控制台登录Linux实例
      Image
  2. 使用命令行方式提交一个 Spark 作业。开启 Spark 服务的集群自带一个示例 Spark 作业,在命令行直接提交此作业即可。

    说明

    • 示例资源spark-examples_<Versino>.jar为集群自带,具体文件名因 Spark 版本而异。您可登录集群节点后,执行find / -name "spark-examples*.jar" 2>/dev/null命令查看当前集群中的实际 JAR 包名称和路径。Spark 更多操作请参见 Spark-快速开始
    • 若集群开启了 Kerberos,请参见使用 Kerberos 认证集群,完成用户认证,才能运行作业。

    Spark 3.5.1版本为例,在终端命令行提交:

    spark-submit --class org.apache.spark.examples.SparkPi --master yarn --num-executors 3 --driver-memory 512m --executor-memory 512m --executor-cores 1 /opt/emr/current/spark3/examples/jars/spark-examples_2.12-3.5.1.jar
    

    重要任务参数说明如下:

    参数

    样例

    备注

    class

    org.apache.spark.examples.SparkPi

    程序入口类

    master

    yarn

    程序执行模式,可选yarn,yarn-client

    num-executors

    3

    并行executor个数

    driver-memory

    512m

    driver程序使用的内容,最大不可超过该节点的总内存资源

    executor-memory

    512m

    单个executor使用的内存大小,最大不可超过该节点的总内存资源

    executor-cores

    1

    单个executor的并行数

  3. 验证作业运行结果。日志中有以下三个成功标志,说明作业运行成功。

    标志

    内容

    计算结果

    Pi is roughly 3.144275721378607

    正常退出

    SparkContext is stopping with exitCode 0

    资源清理

    ShutdownHookManager: Shutdown hook called

场景2:通过 HUE 组件服务创建作业

前提条件:创建集群时可选服务中开启了 Hue 服务。

  1. 登录 EMR 控制台。在左侧导航栏中,进入集群列表 > 集群名称详情 > 访问链接, 点击 HUE UI 访问链接进入。

    注意

    若访问链接不能点击,请检查 Hue 所在 ECS 实例是否绑定弹性公网IP,详见访问链接云服务器绑定公网 IP

  2. 在窗口输入 Hue 登录的用户名和密码。

    说明

    Hue 已默认接入了 LDAP 鉴权,用户可使用 LDAP 中已有账号进行登录。首次登录需先添加用户,详细操作请参考:用户管理

  3. 进入 Hue 界面后,您可进行后续的创建作业并运行,具体实践和示例作业详情,请参见 通过hue进行数据查询

场景3:通过 DataLeap 创建作业

一站式大数据研发治理套件(DataLeap),帮助您快速完成数据集成、数据开发、运维、治理、安全等全套数据中台建设,来帮助企业提升数据研发效率,降低运维管理成本。DataLeap 项目可通过绑定 EMR 引擎实例的方式,来创建 EMR 作业并运行。

  1. 使用租户主账号开通 DataLeap 产品,并授予云资源相应角色权限。详见充值及购买

  2. 进入 DataLeap 控制台 DataLeap 控制台。,在左侧导航栏中单击项目管理 > 创建项目,进行项目创建。在创建项目界面,完成项目基础信息、项目管控、服务绑定等配置信息。其中,在服务绑定-引擎绑定项,您需勾选 E-MapReduce 引擎服务,并在下拉框中,选择已创建的集群名称信息。其余配置信息,详见新建项目新建项目
    Image
    其中,在服务绑定-引擎绑定项,您需勾选 E-MapReduce 引擎服务,并在下拉框中,选择已创建的集群名称信息。其余配置信息,详见新建项目新建项目

    注意

    EMR 实例首次绑定 DataLeap 项目时,需打开 EMR 实例所在安全组的访问权限,方可继续选择 Yarn 队列。详见如何开放EMR实例所在安全组的访问权限?

    Image

  3. 项目创建完成后,您可以在 DataLeap 控制台上进行 EMR 作业的数据开发、任务运维监控、元数据采集等相关操作。完整详见 DataLeap on EMR 快速入门
    相关模块功能描述如下,详见各功能指导文档:

    模块

    描述

    数据开发

    您可以根据实际业务场景,选择创建合适的 EMR 节点类型进行作业开发。

    任务运维

    提供线上任务的管理运维操作,支持离线、流式的任务运维;通过配置监控规则,实现对任务运行状态的监控。

    数据质量

    提供对离线、流式数据产出表的数据质量监控。
    通过配置模板规则、自定义规则方式,来监控表数据量、数据个性化指标的波动及异常报警,数据内容探查及差异对比等能力,保证了数据在生产及使用流程中的可靠性和合理性,从而避免因为数据质量问题而导致数据失信、决策失误。

    数据地图元数据

    通过元数据采集方式可视化管理 EMR 元数据,您可以在数据地图中查看 EMR 表数据、血缘图谱等。

最近更新时间:2026.08.10 16:14:18
这个页面对您有帮助吗?
有用
有用
无用
无用