Python客户端支持在Amazon EMR上运行Hive

8

我注意到mrjob和boto都不支持Python接口以在Amazon Elastic MapReduce (EMR)上提交和运行Hive作业。有没有其他支持在EMR上运行Hive的Python客户端库?

1个回答

9
使用boto,您可以像这样做:

使用boto,您可以执行以下操作:

args1 = [u's3://us-east-1.elasticmapreduce/libs/hive/hive-script',
         u'--base-path',
         u's3://us-east-1.elasticmapreduce/libs/hive/',
         u'--install-hive',
         u'--hive-versions',
         u'0.7']
args2 = [u's3://us-east-1.elasticmapreduce/libs/hive/hive-script',
         u'--base-path',
         u's3://us-east-1.elasticmapreduce/libs/hive/',
         u'--hive-versions',
         u'0.7',
         u'--run-hive-script',
         u'--args',
         u'-f',
         s3_query_file_uri]
steps = []
for name, args in zip(('Setup Hive','Run Hive Script'),(args1,args2)):
    step = JarStep(name,
                   's3://us-east-1.elasticmapreduce/libs/script-runner/script-runner.jar',
                   step_args=args,
                   #action_on_failure="CANCEL_AND_WAIT"
                   )
    #should be inside loop
    steps.append(step)
# Kick off the job
jobid = EmrConnection().run_jobflow(name, s3_log_uri,
                                   steps=steps,
                                   master_instance_type=master_instance_type,
                                   slave_instance_type=slave_instance_type,
                                   num_instances=num_instances,
                                   hadoop_version="0.20")

我收到了 EMR 终止的 VALIDATION_ERROR 错误,有什么想法吗? - vks

网页内容由stack overflow 提供, 点击上面的
可以查看英文原文,
原文链接