Todos os produtos
Search
Central de documentação

E-MapReduce:O que é o EMR Serverless StarRocks

Última atualização: Sep 15, 2026

O E-MapReduce (EMR) Serverless StarRocks é um service StarRocks totalmente gerenciado na Alibaba Cloud. Crie instâncias do StarRocks e gerencie instâncias e dados diretamente pelo console do EMR, sem precisar configure, operar ou dimensionar clusters manualmente.

O que é o StarRocks

O StarRocks é um banco de dados analítico desenvolvido para análises multidimensionais de dados rápidas, em tempo real e eficientes. Ele utiliza uma arquitetura MPP com mecanismo de execução vetorizada, otimizador baseado em custo (CBO), visualizações materializadas inteligentes e um mecanismo de armazenamento colunar atualizável em tempo real. Como o StarRocks é compatível com o protocolo MySQL, qualquer cliente MySQL ou ferramenta comum de BI pode se conectar diretamente. Além disso, oferece dimensionamento horizontal, alta disponibilidade (HA) e alta confiabilidade.

O StarRocks carrega dados de fontes em tempo real ou de armazenamentos offline e suporta os seguintes cenários de análise de dados:

  • Data warehouses em tempo real: sincronize alterações de bancos de dados transacionais em segundos e consulte dados atualizados.

  • Processamento analítico online (OLAP): execute relatórios multidimensionais, painéis de autoatendimento e consultas ad hoc.

  • Análise de data lake: consulte dados no seu data lake sem precisar migrá-los.

Capacidades principais

As capacidades a seguir são nativas do mecanismo StarRocks.

Framework MPP

O StarRocks divide cada consulta em unidades físicas de computação que usam execução paralela entre máquinas, cada uma com CPU e memória dedicadas. Ao escalar horizontalmente o cluster, o desempenho de consultas individuais escala proporcionalmente.

Mecanismo de execução vetorizada

O mecanismo de execução vetorizada otimiza todos os operadores de execução, funções, módulos de varredura e filtragem, além dos módulos de importação e exportação no nível da CPU. Ele utiliza instruções SIMD (Single Instruction Multiple Data) para processar mais dados por ciclo de clock. Testes em conjuntos padrão demonstram uma melhoria de 3x a 10x no desempenho geral dos operadores.

Esse mecanismo também inclui a Operação em Dados Codificados, que executa operadores de join, agregação e expressão diretamente em strings codificadas, sem decodificação. Isso reduz a complexidade da execução SQL e aumenta a velocidade das consultas em mais de 2x.

Separação de computação e armazenamento

Introduzida no StarRocks 3.0, a arquitetura de separação de computação e armazenamento desacopla cada recurso de computação de cada recurso de armazenamento, permitindo que escalem independentemente e reduzam custos de armazenamento. Os nós de computação escalam em segundos, eliminando o provisionamento excessivo necessário quando computação e armazenamento precisam crescer juntos.

A camada de armazenamento utiliza vários services de armazenamento de objetos com capacidade praticamente ilimitada e é compatível com o Hadoop Distributed File System (HDFS). A arquitetura de separação mantém total paridade de recursos com a arquitetura integrada de computação e armazenamento. Atualizações de dados, análises de data lake e aceleração de visualizações materializadas funcionam exatamente da mesma forma. O desempenho de gravação de dados e consultas de dados quentes é quase idêntico nas duas arquiteturas.

Otimizador baseado em custo

Em consultas complexas com joins de múltiplas tabelas, o número de planos de execução válidos cresce exponencialmente conforme a quantidade de tabelas, tornando a seleção do plano ideal um problema NP-difícil. O CBO do StarRocks usa uma arquitetura semelhante à Cascades, personalizada para o mecanismo de execução vetorizada. Ele suporta:

  • Reutilização de subexpressões comuns e reescrita de subconsultas correlacionadas.

  • Lateral Join e reordenação de Join.

  • Seleção de política de execução distribuída de joins.

  • Otimização de codificação de dicionário para baixa cardinalidade.

O CBO suporta todas as 99 instruções SQL do TPC-DS.

Mecanismo de armazenamento colunar em tempo real

O StarRocks armazena dados em formato colunar. Isso melhora as taxas de compressão, reduz a E/S de disco e o volume de dados lidos, além de acelerar consultas que leem apenas um subconjunto de colunas — padrão comum em cargas de trabalho OLAP. O StarRocks permite carregar dados em segundos e oferece capacidades de processamento de dados quase em tempo real.

O mecanismo de armazenamento garante ACID (atomicidade, consistência, isolamento e durabilidade) para importações de dados. Importações em lote têm sucesso ou falha atômica, e transações simultâneas se beneficiam do isolamento de snapshot. O mecanismo também suporta operações de atualização parcial e upsert. Ele utiliza índices de chave primária com modo Delete-and-Insert para evitar sobrecarga de classificação e mesclagem durante leituras. Índices secundários atendem a cenários de atualização de dados com alto throughput.

Visualizações materializadas inteligentes

As visualizações materializadas no StarRocks funcionam automaticamente:

  • Sincronização automática: quando os dados de uma tabela de origem mudam, a visualização materializada correspondente detecta e aplica a atualização em tempo real, mantendo a consistência dos dados.

  • Reescrita transparente de consultas: durante o planejamento da consulta, o StarRocks detecta quando uma visualização materializada pode acelerar a consulta e realiza a reescrita automaticamente, sem exigir alterações na aplicação.

  • Gerenciamento de ciclo de vida em segundo plano: crie e exclua visualizações materializadas sem intervenção manual; o sistema executa a operação em segundo plano.

  • Substituição de ETL: use visualizações materializadas para transformar e processar dados no local, substituindo pipelines tradicionais de extração, transformação e carga (ETL) e pré-processamentos upstream.

Análise de data lake

O StarRocks analisa dados de armazenamento local com eficiência. Use catálogos externos para consultar data lakes diretamente, sem necessidade de migração de dados. O StarRocks suporta:

  • Formatos de tabela: Apache Hive, Apache Iceberg, Apache Hudi e Delta Lake.

  • Formatos de arquivo: Parquet, ORC e CSV.

  • Serviços de armazenamento: HDFS, Amazon Simple Storage Service (S3) e Object Storage Service (OSS).

Nesse modelo, os data lakes servem como source única de verdade (SSOT) para cargas de trabalho de BI, IA, consultas ad hoc e relatórios. O StarRocks cuida da computação e análise usando seu mecanismo vetorizado e CBO.

O que o Serverless StarRocks agrega

Execute o StarRocks por conta própria exige provisionar clusters, planejar atualizações de versão, configure segurança e monitorar o sistema. O EMR Serverless StarRocks elimina essa sobrecarga operacional:

  • Sem gerenciamento de cluster: elimine o dimensionamento, a configuração e os ajustes contínuos de clusters.

  • Visualização do gerenciamento de instâncias: gerencie instâncias e execute tarefas de O&M pelo console do EMR.

  • Monitoramento visualizado: painéis integrados de monitoramento e O&M.

  • Atualizações automáticas de versão: versões principais e secundárias do StarRocks são atualizadas automaticamente.

  • EMR StarRocks Manager:

    • Segurança: oferece gerenciamento de usuários e permissões.

    • Análise de diagnóstico: identifica instruções SQL lentas e analisa execuções SQL com ferramentas visuais.

    • Gerenciamento de dados: navegue por bancos de dados, tabelas, partições, shards e tarefas para simplificar o gerenciamento operacional.

  • AI+OLAP (Beta): invoque modelos de linguagem grandes com SQL no seu fluxo de trabalho de análises OLAP, conforme descrito em Capacidades de IA.

Capacidades de IA

O EMR Serverless StarRocks inclui AI Functions nativas que incorporam capacidades de modelos de linguagem grandes ao seu fluxo de trabalho de análises OLAP. As AI Functions estão em fase Beta. Processe dados, analise-os e execute inferências de IA em uma única instrução SQL, sem precisar exportar dados para um sistema externo primeiro.

Requisitos de versão

A instância deve execute a versão 3.3.20-2.1.1, 3.5.16-2.1.1 ou superior.

Principais benefícios

  • Dados permanecem no StarRocks: os dados brutos ficam sempre no StarRocks. As funções de IA criptografam e enviam ao service de modelo apenas os campos que precisam de processamento, evitando replicação de dados e transferências entre sistemas.

  • Chamada via SQL padrão: invoque AI Functions nativas usando SQL padrão, sem precisar aprender novas linguagens de programação ou ferramentas.

  • Resultados integrados diretamente às consultas: os resultados das funções de IA participam imediatamente de joins, agregações e filtros subsequentes, sem necessidade de recarregar dados.

  • Menor custo de tokens: o pushdown de predicados reduz o volume de chamadas e o cache elimina solicitações duplicadas, diminuindo o custo da mesma tarefa em 30% ou mais.

  • Limitação de taxa sem O&M: três camadas de proteção integradas mantêm suas cargas de trabalho estáveis, eliminando a necessidade de entender mecanismos de limitação de taxa como RPM e TPM.

Capacidades das funções

As AI Functions são agrupadas por tipo de capacidade:

Tipo de capacidade

Funções típicas

Descrição

Análise de texto

ai_sentiment, ai_classify, ai_extract, ai_summarize

Executa análise de sentimentos, categorização de tags, extração de entidades e resumo de conteúdo em textos.

Processamento de texto

ai_translate, ai_fix_grammar, ai_redact

Oferece tradução automática, correção gramatical e mascaramento de informações de identificação pessoal (PII).

Filtragem semântica

ai_filter, ai_similarity

Filtra dados por condições semânticas ou calcula a similaridade semântica entre dois textos.

Vetorização

ai_embed, ai_embed_multimodal

Gera embeddings de texto ou embeddings multimodais para conteúdos como imagens e vídeos, destinados a cenários de recuperação.

Agregação com IA

ai_agg, ai_agg_summary

Resume múltiplas linhas por dimensão usando IA, como resumir todas as avaliações de um product.

Modelos personalizados

ai_custom_query, ai_custom_embedding, ai_custom_multimodal_embedding

Invoca modelos personalizados registrados no AI center.

Modelos suportados

A geração de texto usa qwen3.6-plus. A vetorização de texto usa qwen3-vl-embedding ou text-embedding-v4. A geração de embeddings multimodais usa qwen3-vl-embedding ou tongyi-embedding-vision-plus. O modelo qwen3-vl-embedding possui espaço vetorial unificado, permitindo comparar embeddings de texto diretamente com embeddings de imagem e vídeo entre modalidades, ideal para recuperação cross-modal.

Cenários típicos

  • Filtragem semântica e roteamento por classificação, como filtrar reclamações em tickets de suporte e atribuí-las automaticamente.

  • Recuperação multimodal e construção de conjuntos de treinamento.

  • Resumos com IA por dimensões como cliente e product.

  • Mascaramento de dados sensíveis antes da análise.

  • Geração e tradução de conteúdo em lote.

O&M inteligente

Além das AI Functions, o EMR Serverless StarRocks oferece o EMR AI Assistant. Ele se conecta à sua instância e lê tabelas de sistema, Query Profile (detalhes de execução de consultas) e métricas de monitoramento para diagnósticos de desempenho e inspeções de integridade, conforme descrito em EMR AI Assistant.

O tópico AI Function documenta a sintaxe das funções e descrições de métricas, enquanto AI Function Best Practices apresenta um guia de uso baseado em cenários.

FAQ

Qual é o limite padrão de QPS para o bucket OSS usado pelo EMR Serverless StarRocks e como posso monitorá-lo?

O limite padrão de QPS para o bucket OSS é de 20.000, valor aumentado de 10.000. Ainda não há métricas de monitoramento dedicadas para ajustes de limitação do bucket OSS do StarRocks. Como alternativa, configure alertas de QPS no CloudMonitor.

Por que ocorre failover no nó líder FE do StarRocks? Está relacionado ao Full GC?

O failover do nó líder FE pode resultar de uma nova eleição de líder acionada pelo Full GC. Quando um nó FE executa Full GC, uma nova eleição começa e o líder FE muda. Esse é um comportamento normal do coletor de lixo G1, que usa alocação de memória heap grande de até 51 GiB e prioriza tempos de pausa. Isso não indica falha no sistema.