Todos os produtos
Search
Central de documentação

Lindorm:Configure parâmetros para jobs

Última atualização: Jun 28, 2026

O Lindorm Distributed Processing System (LDPS) executa jobs Spark em pools de recursos elásticos gerenciados pelo Kubernetes. Esta página lista todos os parâmetros configuráveis para jobs Spark do LDPS e explica como passá-los em cada método de envio.

Parâmetros do Spark

Parâmetro

Valor padrão

Descrição

kyuubi.engine.share.level

USER

Nível de compartilhamento do mecanismo Spark SQL. Níveis disponíveis:

  • CONNECTION: O mecanismo Spark SQL não é compartilhado; apenas o cliente atual o utiliza.

  • USER: Todas as sessões criadas com o nome de usuário especificado compartilham o mecanismo Spark SQL.

kyuubi.session.engine.initialize.timeout

300000 (milissegundos)

Tempo limite para iniciar o mecanismo Spark SQL em segundo plano.

kyuubi.session.engine.idle.timeout

1800000 (milissegundos)

Tempo limite de ociosidade do mecanismo Spark SQL. Se não houver acesso ao mecanismo durante esse período, ele será encerrado automaticamente.

kyuubi.session.engine.check.interval

300000 (milissegundos)

Intervalo de verificação do tempo limite do mecanismo Spark SQL. O valor mínimo é 3000 milissegundos.

kyuubi.session.idle.timeout

21600000 (milissegundos)

Tempo limite de ociosidade das sessões. Caso nenhuma sessão seja acessada nesse intervalo, ela fechará automaticamente.

kyuubi.session.check.interval

300000 (milissegundos)

Intervalo de verificação dos tempos limite de sessão. O valor mínimo é 3000 milissegundos.

kyuubi.engine.single.spark.session

false

Defina se o mecanismo Spark SQL opera no modo de sessão única. Nesse modo, todas as conexões JDBC ou ODBC compartilham visualizações temporárias, registros de funções, configurações SQL e o banco de dados atual.

  • Quando definido como true, o mecanismo Spark SQL opera no modo de sessão única.

  • Quando definido como false, o mecanismo Spark SQL não opera no modo de sessão única.

kyuubi.operation.idle.timeout

10800000 (milissegundos)

Tempo limite de ociosidade para operações. Se uma operação não for acessada durante esse período, ela fechará automaticamente.

kyuubi.operation.interrupt.on.cancel

true

Defina se todas as tarefas em execução serão interrompidas ao cancele uma consulta.

  • Quando definido como true, todas as tarefas em execução são interrompidas se uma operação de cancelamento de consulta for executada.

  • Quando definido como false, todas as tarefas em execução continuam até a conclusão, mesmo que uma operação de cancelamento de consulta seja executada.

kyuubi.operation.status.polling.timeout

5000 (milissegundos)

Tempo limite para consultar o status de instruções SQL executadas de forma assíncrona.

Parâmetros restritos

O sistema define os parâmetros a seguir, que não podem ser personalizados.

Parâmetro

Descrição

spark.master

Endpoint do sistema de gerenciamento de cluster.

spark.submit.deployMode

Modo de implantação do driver Spark.

Parâmetros de recursos

O LDPS opera em pools de recursos elásticos com faturamento baseado em pagamento conforme o uso. Por padrão, não há limite superior para os recursos que um job pode solicitar. Para defina um máximo, consulte Modifique as configurações do LDPS.

Os parâmetros de recursos aplicam-se a todos os jobs JDBC, JAR e Python enviados ao LDPS e dividem-se em parâmetros de especificação e parâmetros de capacidade.

Parâmetros de especificação

Parâmetros básicos de especificação

Parâmetro

Descrição

Padrão

spark.driver.memory

Memória heap do driver. Unidade: mebibytes.

8192m

spark.driver.memoryOverhead

Memória off-heap do driver. Unidade: mebibytes.

8192m

spark.kubernetes.driver.disk.size

Tamanho do disco local do driver. Unidade: GB.

50

spark.executor.cores

Núcleos de CPU por executor.

4

spark.executor.memory

Memória heap por executor. Unidade: mebibytes.

8192m

spark.executor.memoryOverhead

Memória off-heap por executor. Unidade: mebibytes.

8192m

spark.kubernetes.executor.disk.size

Tamanho do disco local por executor. Unidade: GB.

50

Parâmetros avançados de especificação

ParâmetroDescriçãoPadrão
spark.{driver/executor}.resourceTagConjunto predefinido de especificações de recursos. Quando definido, o LDPS aplica automaticamente os valores correspondentes de CPU, memória e disco. Valores válidos: xlarge, 2xlarge, 4xlarge, 8xlarge, 16xlarge.Nenhum
spark.kubernetes.{driver/executor}.ecsModelPreferenceModelos preferenciais de nós de computação, listados em ordem de prioridade. O LDPS tenta cada modelo sequencialmente; se todos estiverem indisponíveis, seleciona um modelo disponível que corresponda à especificação de recursos. Especifique até quatro modelos, separados por vírgulas. Exemplo: hfg6,g6.Nenhum
spark.kubernetes.{driver/executor}.annotation.k8s.aliyun.com/eci-use-specsEspecificação de GPU da Elastic Container Instance (ECI). Para tipos de instância GPU suportados, consulte Especificar tipos de instância ECS para criar pods.ecs.gn7i-c8g1.2xlarge
spark.{driver/executor}.resource.gpu.vendorFabricante da GPU. Deve corresponder à especificação de GPU definida em eci-use-specs.nvidia.com
spark.{driver/executor}.resource.gpu.amountQuantidade de GPUs. Defina como 1.1
spark.{driver/executor}.resource.gpu.discoveryScriptCaminho para o script de descoberta de GPU usado para identificar e vincular recursos de GPU na inicialização do driver ou executor. Defina como /opt/spark/examples/src/main/scripts/getGpusResources.sh./opt/spark/examples/src/main/scripts/getGpusResources.sh
spark.kubernetes.executor.annotation.k8s.aliyun.com/eci-use-specsEspecificação de instância do executor com capacidade expandida de disco local. Consulte os valores suportados abaixo.Nenhum

O parâmetro spark.kubernetes.executor.annotation.k8s.aliyun.com/eci-use-specs suporta as seguintes especificações de executor:

Valor

Núcleos de CPU

Memória

ecs.d1ne.2xlarge

8

32 GB

ecs.d1ne.4xlarge

16

64 GB

ecs.d1ne.6xlarge

24

96 GB

ecs.d1ne.8xlarge

32

128 GB

ecs.d1ne.14xlarge

56

224 GB

Importante

Ao usar spark.kubernetes.executor.annotation.k8s.aliyun.com/eci-use-specs, defina também os dois parâmetros a seguir:

  • spark.kubernetes.executor.volumes.emptyDir.spark-local-dir-1.mount.path=/var

  • spark.kubernetes.executor.volumes.emptyDir.spark-local-dir-1.options.medium=LocalRaid0 Se o tipo de instância do executor especificado estiver indisponível, entre em contato com o suporte técnico do Lindorm (ID do DingTalk: s0s3eg3).

Mapeamento de especificações resourceTag

Valor de resourceTag

**spark.{driver/executor}.cores**

**spark.{driver/executor}.memory**

**spark.{driver/executor}.memoryOverhead**

**spark.kubernetes.{driver/executor}.disk.size**

xlarge

4

8192m

8192m

50 GB

2xlarge

8

16384m

16384m

100 GB

4xlarge

16

32768m

32768m

200 GB

8xlarge

32

65536m

65536m

400 GB

16xlarge

64

131072m

131072m

400 GB

Parâmetros de capacidade

Parâmetro

Descrição

Padrão

spark.executor.instances

Número de executores alocados para o job.

2

spark.dynamicAllocation.enabled

Ativa a alocação dinâmica de recursos. Quando ativado, o LDPS solicita e libera executores automaticamente com base na carga de trabalho do job em tempo real. Valores válidos: true, false.

true

spark.dynamicAllocation.minExecutors

Número mínimo de executores quando a alocação dinâmica de recursos está ativada.

0

spark.dynamicAllocation.maxExecutors

Número máximo de executores quando a alocação dinâmica de recursos está ativada. Este valor equivale ao número de tarefas simultâneas.

Infinity

spark.dynamicAllocation.executorIdleTimeout

Tempo de retenção de um executor ocioso antes de ser liberado. Unidade: segundos.

600s

Parâmetros de execução

Parâmetro

Descrição

Padrão

spark.speculation

Ativa a execução especulativa. Quando ativado, o driver reenvia tarefas que estão sendo executadas significativamente mais devagar que outras no mesmo estágio (long tails), evitando atrasos no job. Valores válidos: true, false.

true

spark.task.maxFailures

Número máximo de falhas de tarefa permitidas antes que o job falhe.

4

spark.dfsLog.executor.enabled

Armazena logs do executor no LindormDFS. Defina como false para jobs de grande escala, reduzindo a carga do DFS gerada pelos fluxos de log. Valores válidos: true, false.

true

spark.jars

Caminho para o pacote JAR necessário para o job. Aceita caminhos OSS ou Hadoop Distributed File System (HDFS). Se você usar JDBC, defina apenas um caminho HDFS. Caso utilize um caminho OSS, configure também os parâmetros OSS abaixo.

Nenhum

spark.hadoop.fs.oss.endpoint

Endpoint do OSS. Para valores de endpoint por região, consulte Regiões e endpoints.

Nenhum

spark.hadoop.fs.oss.accessKeyId

AccessKey ID da sua conta Alibaba Cloud ou usuário RAM. Consulte Obter um par de AccessKey.

Nenhum

spark.hadoop.fs.oss.accessKeySecret

AccessKey secret da sua conta Alibaba Cloud ou usuário RAM. Consulte Obter um par de AccessKey.

Nenhum

spark.hadoop.fs.oss.impl

Classe de implementação do sistema de arquivos para OSS. Defina como org.apache.hadoop.fs.aliyun.oss.AliyunOSSFileSystem.

Nenhum

spark.default.parallelism

Paralelismo padrão para tarefas não SQL, incluindo leituras de fontes de dados e estágios de shuffle.

Nenhum

spark.sql.shuffle.partitions

Número de partições de shuffle para tarefas SQL.

200

Parâmetros de monitoramento

ParâmetroDescriçãoPadrão
spark.monitor.cmdComandos de monitoramento a serem executados em intervalos regulares. Separe múltiplos comandos com ponto e vírgula (;). Os resultados são gravados nos logs do job.
Nota

Este parâmetro não pode ser configurado ao envie jobs via Beeline ou JDBC.

Nenhum
spark.monitor.intervalIntervalo entre execuções dos comandos de monitoramento. Unidade: segundos.60
spark.monitor.timeoutTempo limite para cada comando de monitoramento. Se um comando exceder esse limite, ele é ignorado e o próximo comando é executado. Unidade: segundos.2

Exemplos de comandos de monitoramento:

# Single command
"spark.monitor.cmd": "top -b -n 1"

# Multiple commands
"spark.monitor.cmd": "top -b -n 1; vmstat; free -m; iostat -d -x -c -k; df -h; sar -n DEV 1 1; netstat"

Comandos comuns de monitoramento por categoria:

Categoria

Comandos

Status do sistema

top -b -n 1, vmstat

Memória

free -m

E/S de disco

iostat -d -x -c -k

Uso de disco

df -h

Rede

sar -n DEV 1 1, netstat

Parâmetros de log

Parâmetro

Descrição

Padrão

spark.log.level

Nível de saída de log para o job.

INFO

Valores válidos para spark.log.level, do mais detalhado ao menos detalhado:

Nível

Descrição

ALL

Toda a saída de log, incluindo as informações de depuração mais granulares.

TRACE

Mais detalhado que DEBUG; registra etapas de execução refinadas.

DEBUG

Logs de nível de depuração, incluindo status detalhado de tempo de execução.

INFO

Logs informativos gerais para eventos normais de execução.

WARN

Avisos sobre problemas potenciais que não interrompem a execução.

ERROR

Erros ocorridos durante a execução.

FATAL

Erros críticos que impedem a continuidade do programa.

OFF

Desativa toda a saída de log.

Parâmetros do Spark open-source

Para parâmetros herdados do Spark open-source, consulte Configuração do Spark.

Configure parâmetros por método de envio

O método utilizado para envie um job ao LDPS determina como os parâmetros são passados.

Beeline

Edite o arquivo conf/beeline.conf no diretório do pacote Spark onde a ferramenta de linha de comando Beeline está localizada.

# LDPS endpoint
# Format: jdbc:hive2://<host>:<port>/;?token=<token>
endpoint=jdbc:hive2://ld-bp13ez23egd123****-proxy-ldps-pub.lindorm.aliyuncs.com:10009/;?token=jfjwi2453-fe39-cmkfe-afc9-01eek2j5****

# Connection credentials (default: root/root)
user=root
password=root

# Set to false to use a dedicated Spark session for this connection
shareResource=false

# Spark parameters
spark.dynamicAllocation.enabled=true
spark.dynamicAllocation.minExecutors=3

Para a configuração completa do Beeline, consulte Primeiros passos.

JDBC

Anexe os parâmetros do Spark à string de conexão JDBC como pares chave-valor após o token.

jdbc:hive2://<host>:<port>/;?token=<token>;spark.executor.memory=8g;spark.sql.shuffle.partitions=2

Para o formato completo da URL JDBC, consulte Usar JDBC no desenvolvimento de aplicativos.

spark.jars não pode ser definido como um caminho OSS ao envie jobs via JDBC. Use um caminho HDFS em vez disso.

Jobs JAR

Configure os parâmetros no modelo de job ao envie um job Java:

Jobs Python

Configure os parâmetros no modelo de job ao envie um job Python: