O Serverless Spark oferece diversos parâmetros integrados. Este documento descreve esses parâmetros e seus casos de uso para ajudar você a configurar o ambiente de execução e otimizar a execução de jobs.
|
Parâmetro |
Descrição |
Cenário |
|
spark.emr.serverless.user.defined.jars |
Adiciona pacotes JAR enviados ao classpath do driver e dos executores do Serverless Spark.
|
Use esta propriedade para adicionar pacotes JAR personalizados do OSS ao driver e aos executores do Spark ao enviar um job Spark via spark-submit, job em lote ou Airflow Serverless Spark Operator, ou ao criar uma sessão. |
|
spark.emr.serverless.fusion |
Define se o Fusion deve ser ativado para uma sessão ou job em lote iniciado pelo Kyuubi ou Livy. Valores válidos:
|
Configure esta propriedade na Spark Configuration de um job ou sessão para ativar ou desativar o Fusion. |
|
spark.emr.serverless.environmentId |
Especifica o ID do ambiente de execução para os recursos de computação. |
Ao enviar jobs do Serverless Spark usando Airflow ou spark-submit, use esta propriedade para especificar um ambiente de execução com bibliotecas de terceiros pré-instaladas. |
|
spark.emr.serverless.network.service.name |
Define o nome de uma conexão de rede que permite a comunicação entre recursos de computação e fontes de dados em outras VPCs. |
Ao enviar um job do Serverless Spark, use uma conexão de rede para acessar fontes de dados em outras redes Virtual Private Cloud (VPC). |
|
spark.emr.serverless.excludedModules |
Remove bibliotecas integradas do Serverless Spark.
|
Para evitar conflitos com pacotes JAR personalizados, remova as bibliotecas integradas ao enviar jobs pelo console do Serverless Spark, spark-submit, job em lote, Airflow Serverless Spark Operator, Kyuubi ou Livy, ou ao criar uma sessão. |
|
spark.emr.serverless.kyuubi.engine.queue |
Especifica o nome da fila do workspace onde as aplicações Spark iniciadas pelo Kyuubi são executadas. |
Defina essa configuração no painel de configuração do Kyuubi ou especifique-a diretamente na URL de conexão JDBC. |
|
spark.emr.serverless.jr.timeout |
Define o tempo máximo de execução de um job em segundos. O sistema encerra automaticamente o job caso esse limite seja excedido. O valor padrão é vazio, indicando que não há limite de tempo. O valor deve ser um número inteiro entre -1 e 2147483647. Os valores -1 ou 0 significam que nenhum timeout foi definido. |
Use esta propriedade para definir um timeout ao enviar jobs pelo console do Serverless Spark, spark-submit, job em lote ou Airflow Serverless Spark Operator. |
|
spark.emr.serverless.fusion.enabled |
Define se o mecanismo de aceleração de dados Fusion será ativado para uma aplicação Spark. Valores válidos:
|
Use este parâmetro para controlar a aceleração do Fusion durante o envio de jobs via console do Serverless Spark, spark-submit, job em lote ou Airflow Serverless Spark Operator. |
|
spark.emr.serverless.mount.nas.enabled |
Define se um diretório NAS deve ser montado no driver do Spark. Se ativado, especifique o diretório de montagem por meio da propriedade
|
Use esta propriedade para montar um diretório de arquivos NAS gerenciado no driver do Spark ao enviar um job pelo console do Serverless Spark, spark-submit, job em lote ou Airflow Serverless Spark Operator. Após a montagem, o driver poderá ler e gravar no diretório NAS. |
|
spark.emr.serverless.mount.nas.volume |
Especifica o ID do diretório NAS gerenciado a ser montado. Versões de mecanismo compatíveis:
|
Use esta propriedade para montar o diretório de arquivos NAS gerenciado especificado ao enviar um job via console do Serverless Spark, spark-submit, job em lote ou Airflow Serverless Spark Operator. |
|
spark.emr.serverless.mount.nas.executor |
Define se o diretório NAS deve ser montado em todos os executores do Spark.
|
Use esta propriedade para montar um diretório de arquivos NAS gerenciado em todos os executores do Spark ao enviar um job pelo console do Serverless Spark, spark-submit, job em lote ou Airflow Serverless Spark Operator. Com a montagem, os executores terão acesso de leitura e escrita ao diretório NAS. |
|
spark.emr.serverless.mount.oss.enabled |
Define se um diretório OSS deve ser montado no driver do Spark. Se ativado, especifique também o diretório de montagem usando a propriedade
|
Use esta propriedade para montar um diretório de arquivos OSS gerenciado no driver do Spark ao enviar um job pelo console do Serverless Spark, spark-submit, job em lote ou Airflow Serverless Spark Operator. Após a montagem, o driver poderá ler e gravar no diretório OSS. |
|
spark.emr.serverless.mount.oss.volume |
Especifica o ID do diretório OSS gerenciado a ser montado. |
Use esta propriedade para montar o diretório de arquivos OSS gerenciado especificado ao enviar um job pelo console do Serverless Spark, spark-submit, job em lote ou Airflow Serverless Spark Operator. |
|
spark.emr.serverless.mount.oss.executor |
Define se um diretório OSS deve ser montado em todos os executores do Spark. Valores válidos:
|
Use esta propriedade para montar um diretório de arquivos OSS gerenciado em todos os executores do Spark ao enviar um job pelo console do Serverless Spark, spark-submit, job em lote ou Airflow Serverless Spark Operator. Após a montagem, os executores poderão ler e gravar no diretório OSS. |
|
spark.emr.serverless.templateId |
Define o ID do modelo de configuração padrão para uma aplicação Spark. Referenciar um modelo de workspace predefinido simplifica a configuração de parâmetros durante o envio do job. Encontre o ID do modelo na página . Exemplo: |
Esta propriedade é suportada apenas ao usar spark-submit. |
|
spark.emr.serverless.livy.config.mode |
Controla se as configurações do arquivo
|
Para personalizar totalmente a configuração de um job Spark, defina este parâmetro como |
|
spark.emr.serverless.tag.xxxx |
Adiciona uma tag a um job em lote enviado via Livy, seguindo o formato |
Depois, filtre jobs por tag no histórico de jobs. |