0% acharam este documento útil (0 voto)
7 visualizações7 páginas

Simulado Databricks Data Engineer - 50 Questões

O documento é um simulado para a certificação de Data Engineer na plataforma Databricks, contendo 50 questões de múltipla escolha sobre tópicos como Unity Catalog, Delta Lake, e arquitetura Medallion. Cada pergunta aborda conceitos e comandos relevantes para a engenharia de dados, com um gabarito fornecido ao final. O objetivo é avaliar o conhecimento do candidato em práticas e ferramentas do Databricks.

Enviado por

Lipozo
Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PDF, TXT ou leia on-line no Scribd
0% acharam este documento útil (0 voto)
7 visualizações7 páginas

Simulado Databricks Data Engineer - 50 Questões

O documento é um simulado para a certificação de Data Engineer na plataforma Databricks, contendo 50 questões de múltipla escolha sobre tópicos como Unity Catalog, Delta Lake, e arquitetura Medallion. Cada pergunta aborda conceitos e comandos relevantes para a engenharia de dados, com um gabarito fornecido ao final. O objetivo é avaliar o conhecimento do candidato em práticas e ferramentas do Databricks.

Enviado por

Lipozo
Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PDF, TXT ou leia on-line no Scribd

Simulado Expansivo - Databricks Data Engineer (50

questões)

1. 1. Qual é o principal benefício do Unity Catalog numa plataforma Lakehouse?


A) Acelerar jobs automaticamente
B) Governança centralizada de metadados e permissões
C) Substituir Delta Lake
D) Eliminar custos de storage

2. 2. Em qual camada da arquitetura Medallion ficam os dados brutos ingeridos sem transformações?
A) Gold
B) Silver
C) Bronze
D) Warehouse

3. 3. Qual comando Delta é usado para compactar arquivos e melhorar a leitura?


A) VACUUM
B) OPTIMIZE
C) COMPACT
D) ZORDER

4. 4. O que faz o Z-Ordering em uma tabela Delta?


A) Remove duplicatas
B) Ordena fisicamente por colunas para melhorar filtros seletivos
C) Cria índices primários
D) Atualiza estatísticas de query

5. 5. Qual é a finalidade do Delta Live Tables (DLT)?


A) Gerenciar clusters manualmente
B) Construir pipelines declarativos com monitoramento e qualidade de dados
C) Servir dashboards em tempo real
D) Fazer backup automático de metadados

6. 6. Ao usar Auto Loader com format 'cloudFiles', qual opção define onde armazenar o schema inferido?
A) [Link]
B) [Link]
C) [Link]
D) checkpointLocation

7. 7. Databricks Connect permite:


A) Executar código local usando o Spark do cluster remoto
B) Substituir o Spark no cluster
C) Criar imagens Docker
D) Gerenciar Unity Catalog

8. 8. Qual tipo de cluster é mais indicado para desenvolvimento interativo?


A) Job cluster
B) All-purpose cluster
C) Serverless SQL Warehouse
D) High-concurrency cluster

9. 9. Qual recurso é usado para compartilhar dados sem copiar arquivos entre workspaces ou organizações?
A) Deep Clone
B) Delta Sharing
C) Data Copy
D) Export CSV
10. 10. Em Delta Sharing, para permitir consumidores externos, você normalmente configura:
A) Um token de compartilhamento e endpoint
B) Um cluster dedicado
C) Um notebook público
D) Um snapshot local

11. 11. Qual comando SQL no Unity Catalog concede permissão SELECT a um grupo?
A) PERMIT SELECT ...
B) GRANT SELECT ON TABLE ... TO ...
C) SHARE SELECT WITH ...
D) SET ACL SELECT ...

12. 12. O que é 'Time Travel' no Delta Lake?


A) Reverter schemas automaticamente
B) Consultar versões históricas da tabela usando timestamp ou version
C) Executar queries futuras
D) Sincronizar data entre zonas

13. 13. Qual ferramenta você usa para investigar stages, tasks e skew em um job Spark?
A) Unity Catalog
B) Spark UI
C) Databricks Repos
D) Delta Sharing UI

14. 14. Qual assertiva sobre tabelas gerenciadas no Unity Catalog é verdadeira?
A) UC não armazena os dados físicos
B) Ao dropar a tabela, os arquivos são removidos
C) Não suportam Delta
D) São somente leitura

15. 15. Em contraste, ao dropar uma tabela externa no UC:


A) Os arquivos são apagados
B) Os arquivos permanecem no storage
C) O metastore é deletado
D) O UC cria um backup automático

16. 16. O que 'AUTO OPTIMIZE' faz quando habilitado em uma tabela Delta?
A) Ajusta automaticamente esquemas de colunas
B) Compacta e coalesce pequenos arquivos durante gravações
C) Atualiza permissões
D) Gera visualizações automaticamente

17. 17. Qual é o papel do 'Metastore Admin' no Unity Catalog?


A) Criar somente tabelas
B) Administrar o metastore e gerenciar permissões globais
C) Executar somente queries
D) Gerenciar apenas clusters

18. 18. Qual é a diferença principal entre Triggered Mode e Continuous Mode em DLT?
A) Triggered roda uma vez por trigger; Continuous roda continuamente
B) Triggered é somente streaming
C) Continuous roda só em desenvolvimento
D) Não há diferença

19. 19. O que o comando MERGE INTO permite fazer em Delta?


A) Apenas inserir linhas novas
B) Mesclar upserts (inserts/updates) e deletes baseado em condições
C) Excluir a tabela
D) Compactar arquivos
20. 20. Ao analisar uma consulta lenta, qual das opções abaixo NÃO é uma causa comum evidenciada no Spark
UI?
A) Data skew
B) Shuffle pesado
C) Número ideal de partições
D) Join sem broadcast quando necessário

21. 21. Qual prática ajuda a evitar 'data skew' em joins grandes?
A) Aumentar o número de colunas
B) Re-partition por chave de join ou usar salting
C) Usar apenas collect()
D) Reduzir a memória

22. 22. Em pipelines de produção, o que é um Asset Bundle (DAB)?


A) Um pacote versão-controlado contendo jobs, notebooks, configurações e recursos para deploy
B) Um tipo de cluster
C) Um dataset
D) Um snapshot de storage

23. 23. Qual arquivo é o principal no DAB para descrever o deploy?


A) [Link]
B) [Link]
C) [Link]
D) [Link]

24. 24. O que são 'expectations' em Delta Live Tables?


A) Regras de qualidade de dados que validam registros durante o processamento
B) Métricas de performance
C) Tipos de cluster
D) Funções de usuário

25. 25. Se uma expectation for configurada com ON VIOLATION = FAIL, o que acontece?
A) As linhas inválidas são descartadas silenciosamente
B) O lote falha e a pipeline marca erro
C) As linhas são convertidas em NULL
D) Nada acontece

26. 26. Qual é a sintaxe básica para iniciar um readStream com Auto Loader?
A) [Link]('cloudFiles')
B) [Link]('csv')
C) [Link]('files')
D) [Link]('cloud')

27. 27. Ao usar Databricks Repos, qual vantagem você obtém?


A) Integração com Git para versionamento de notebooks e código
B) Armazenamento de dados
C) Otimização automática de queries
D) Compartilhamento Delta nativo

28. 28. O que o VACUUM faz numa tabela Delta?


A) Remove arquivos antigos não referenciados para liberar espaço
B) Otimiza queries
C) Atualiza permissões
D) Faz backup do Delta log

29. 29. Qual recurso permite executar queries SQL sem gerenciar clusters e com escalonamento automático?
A) All-purpose cluster
B) Serverless SQL Warehouse
C) Job Cluster
D) DLT

30. 30. Em que situação você escolheria usar um Job Cluster em vez de All-purpose cluster?
A) Desenvolvimento interativo
B) Workloads de produção agendados para reduzir custo
C) Para executar dashboards
D) Para explorar dados via Data Explorer

31. 31. Ao configurar checkpoints em writeStream, por que eles são importantes?
A) Para registrar tokens de segurança
B) Para permitir recuperação e garantir processamento exatamente-uma-vez
C) Para armazenar logs de auditoria
D) Para criar clones

32. 32. O que é 'Auto-Compaction' em Delta?


A) Compactação automática de pequenos arquivos ao escrever
B) Exclusão de dados antigos
C) Backup incremental
D) Atualização de índices

33. 33. Qual opção descreve melhor 'Lakehouse Federation'?


A) Replicar dados entre workspaces
B) Consultar fontes externas sem mover os dados usando metastore federado
C) Backup cruzado entre clouds
D) Serviço de ETL gerenciado

34. 34. Ao compartilhar dados cross-cloud via Delta Sharing, qual custo deve ser considerado?
A) Custo de autorização
B) Egress fees (taxas de saída de dados) entre clouds
C) Custo do usuário final
D) Custo de snapshots locais

35. 35. Qual é a consequência de usar muitos small files em tabelas Delta?
A) Melhor performance de leitura
B) Overhead no planejamento e leitura; pior performance
C) Redução de latência
D) Menor custo de armazenamento

36. 36. O que é 'deep clone' numa tabela Delta?


A) Uma cópia somente de metadados
B) Uma cópia completa dos dados e metadados no momento da clonagem
C) Compartilhamento sem mover dados
D) Remoção de duplicatas

37. 37. Qual comando SQL é usado para atualizar linhas existentes em uma tabela Delta?
A) INSERT INTO
B) UPDATE ... SET ... WHERE ...
C) MERGE INTO
D) CREATE OR REPLACE

38. 38. No contexto de lineage, quais objetos o Unity Catalog pode mostrar como fontes de uma tabela?
A) Apenas outras tabelas
B) Notebooks, queries SQL, jobs, DLT pipelines e tabelas
C) Apenas jobs
D) Apenas usuários

39. 39. Em um cenário de BI com dashboards que exigem consultas rápidas e previsíveis, qual é a arquitetura
recomendada?
A) Ler direto da camada Bronze
B) Alimentar um SQL Warehouse com tabelas Gold otimizadas
C) Usar Auto Loader para dashboards
D) Usar somente Repos

40. 40. Qual é a melhor prática para particionar uma tabela Delta grande para melhorar leitura?
A) Particionar por coluna com alta cardinalidade indiscriminadamente
B) Particionar por coluna com cardinalidade moderada que é frequentemente usada em filtros
C) Não particionar nunca
D) Particionar por UUID

41. 41. Ao configurar permissões no UC, qual é a ordem correta da hierarquia onde permissões podem ser
aplicadas?
A) Table Schema Catalog Metastore
B) Metastore Catalog Schema Table
C) Catalog Metastore Schema Table
D) Schema Table Catalog Metastore

42. 42. O que significa 'Managed Table' no contexto do Unity Catalog?


A) UC gerencia apenas os metadados
B) UC gerencia metadados e os arquivos físicos
C) Os dados estão sempre em S3
D) A tabela é somente leitura

43. 43. Qual é a função do 'schemaLocation' ao usar Auto Loader?


A) Armazenar checkpoints
B) Indicar onde o Auto Loader salva metadados de schema inferido
C) Localizar arquivos Delta
D) Definir o formato de saída

44. 44. Qual ferramenta você usaria para rodar testes de qualidade em pipelines DLT automaticamente?
A) Databricks Repos
B) DLT expectations e monitoramento integrado
C) Spark UI
D) Delta Sharing

45. 45. Em que situação você usaria 'MERGE INTO' em vez de INSERT/UPDATE separados?
A) Quando precisa apenas inserir linhas novas
B) Quando deseja realizar upsert (insert+update) condicionalmente
C) Para deletar a tabela
D) Para compactar arquivos

46. 46. Qual é o comportamento padrão do comando DROP TABLE para uma tabela gerenciada?
A) Remove metadados, mantém arquivos
B) Remove metadados e arquivos físicos
C) Não faz nada
D) Cria backup automático antes de remover

47. 47. Qual metadado importante fica dentro do diretório `_delta_log`?


A) Histórico de transações e logs JSON/Parquet descrevendo commits
B) Dados brutos
C) Configurações de cluster
D) Tokens de compartilhamento

48. 48. O que o 'OPTIMIZE ZORDER BY' ajuda a reduzir em queries?


A) Tempo de escrita
B) Custo de egress
C) Bytes lidos durante filtros seletivos
D) Número de colunas
49. 49. Ao usar Spark window functions, qual importação é necessária?
A) [Link]
B) [Link]
C) [Link]
D) [Link]

50. 50. Qual estratégia é recomendada para compartilhar dados de produção com parceiros que usam diferentes
nuvens?
A) Copiar dados manualmente entre clouds
B) Avaliar delta sharing e considerar custos de egress; preferir sharing dentro da mesma cloud quando possível
C) Expor credentials diretamente
D) Fornecer dumps CSV diários
Gabarito
1. B
2. C
3. B
4. B
5. B
6. B
7. A
8. B
9. B
10. A
11. B
12. B
13. B
14. B
15. B
16. B
17. B
18. A
19. B
20. C
21. B
22. A
23. A
24. A
25. B
26. A
27. A
28. A
29. B
30. B
31. B
32. A
33. B
34. B
35. B
36. B
37. B
38. B
39. B
40. B
41. B
42. B
43. B
44. B
45. B
46. B
47. A
48. C
49. A
50. B

Você também pode gostar