O Apache Kyuubi é um gateway distribuído e multilocatário que fornece serviços de consulta SQL para mecanismos de consulta de data lake, como Spark, Flink e Trino.
Recursos
Multilocação: o Kyuubi oferece suporte multilocatário de ponta a ponta para aquisição de recursos, acesso a dados e metadados por meio de uma camada unificada de autenticação e autorização.
Alta disponibilidade: o Kyuubi usa o ZooKeeper para balanceamento de carga, garantindo alta disponibilidade de nível empresarial e concorrência ilimitada de clientes.
Múltiplas cargas de trabalho: o Kyuubi gerencia diversas cargas de trabalho em uma única plataforma, com apenas uma réplica de dados e uma interface SQL unificada.
Cenários
Análise interativa: o Kyuubi viabiliza plataformas analíticas empresariais para análises visuais interativas em big data. Ele é compatível com frameworks de computação comuns e com as interfaces Java Database Connectivity (JDBC) e Open Database Connectivity (ODBC), permitindo consultas eficientes via SQL ou ferramentas de business intelligence (BI). O Kyuubi armazena em cache as instâncias do mecanismo de back-end no nível do usuário para melhorar o compartilhamento de recursos e acelerar as respostas. Além disso, processa consultas em grandes conjuntos de dados em paralelo e retorna resultados rapidamente.
Processamento de dados em lote: o Kyuubi disponibiliza uma interface SQL para tarefas comuns de processamento em lote, como grandes processos de extração, transformação e carga (ETL). Tanto o Kyuubi quanto seus mecanismos são independentes de armazenamento e compatíveis com diversas fontes de dados. O Kyuubi também isola as instâncias do mecanismo de back-end no nível da conexão, proporcionando melhor isolamento de recursos e maior estabilidade.
Comparação entre Kyuubi, Livy e Spark ThriftServer
|
Item de comparação |
Kyuubi |
Livy |
Spark ThriftServer |
|
Interfaces compatíveis |
SQL, Scala |
SQL, Scala, Python e R |
SQL |
|
Mecanismos compatíveis |
Spark, Flink, Trino |
Spark |
Spark |
|
Versão do Spark |
Spark 3.x |
Spark 2.x e Spark 3.x |
Incluído no componente Spark |
|
Suporte a protocolos |
Thrift e JDBC |
HTTP, Thrift e JDBC |
Thrift e JDBC |
|
Cliente |
Kyuubi Beeline |
HTTP Client |
Spark Beeline |
|
Alta disponibilidade |
Compatível |
Compatível |
Não compatível |
|
Isolamento de recursos |
Compatível |
Compatível |
Não compatível |
|
Autenticação LDAP |
Compatível |
Compatível |
Compatível |
|
Versão do Alibaba Cloud EMR |
|
|
Todas as versões |