Simulado Expansivo - Databricks Data Engineer (50
questões)
1. 1. Qual é o principal benefício do Unity Catalog numa plataforma Lakehouse?
A) Acelerar jobs automaticamente
B) Governança centralizada de metadados e permissões
C) Substituir Delta Lake
D) Eliminar custos de storage
2. 2. Em qual camada da arquitetura Medallion ficam os dados brutos ingeridos sem transformações?
A) Gold
B) Silver
C) Bronze
D) Warehouse
3. 3. Qual comando Delta é usado para compactar arquivos e melhorar a leitura?
A) VACUUM
B) OPTIMIZE
C) COMPACT
D) ZORDER
4. 4. O que faz o Z-Ordering em uma tabela Delta?
A) Remove duplicatas
B) Ordena fisicamente por colunas para melhorar filtros seletivos
C) Cria índices primários
D) Atualiza estatísticas de query
5. 5. Qual é a finalidade do Delta Live Tables (DLT)?
A) Gerenciar clusters manualmente
B) Construir pipelines declarativos com monitoramento e qualidade de dados
C) Servir dashboards em tempo real
D) Fazer backup automático de metadados
6. 6. Ao usar Auto Loader com format 'cloudFiles', qual opção define onde armazenar o schema inferido?
A) [Link]
B) [Link]
C) [Link]
D) checkpointLocation
7. 7. Databricks Connect permite:
A) Executar código local usando o Spark do cluster remoto
B) Substituir o Spark no cluster
C) Criar imagens Docker
D) Gerenciar Unity Catalog
8. 8. Qual tipo de cluster é mais indicado para desenvolvimento interativo?
A) Job cluster
B) All-purpose cluster
C) Serverless SQL Warehouse
D) High-concurrency cluster
9. 9. Qual recurso é usado para compartilhar dados sem copiar arquivos entre workspaces ou organizações?
A) Deep Clone
B) Delta Sharing
C) Data Copy
D) Export CSV
10. 10. Em Delta Sharing, para permitir consumidores externos, você normalmente configura:
A) Um token de compartilhamento e endpoint
B) Um cluster dedicado
C) Um notebook público
D) Um snapshot local
11. 11. Qual comando SQL no Unity Catalog concede permissão SELECT a um grupo?
A) PERMIT SELECT ...
B) GRANT SELECT ON TABLE ... TO ...
C) SHARE SELECT WITH ...
D) SET ACL SELECT ...
12. 12. O que é 'Time Travel' no Delta Lake?
A) Reverter schemas automaticamente
B) Consultar versões históricas da tabela usando timestamp ou version
C) Executar queries futuras
D) Sincronizar data entre zonas
13. 13. Qual ferramenta você usa para investigar stages, tasks e skew em um job Spark?
A) Unity Catalog
B) Spark UI
C) Databricks Repos
D) Delta Sharing UI
14. 14. Qual assertiva sobre tabelas gerenciadas no Unity Catalog é verdadeira?
A) UC não armazena os dados físicos
B) Ao dropar a tabela, os arquivos são removidos
C) Não suportam Delta
D) São somente leitura
15. 15. Em contraste, ao dropar uma tabela externa no UC:
A) Os arquivos são apagados
B) Os arquivos permanecem no storage
C) O metastore é deletado
D) O UC cria um backup automático
16. 16. O que 'AUTO OPTIMIZE' faz quando habilitado em uma tabela Delta?
A) Ajusta automaticamente esquemas de colunas
B) Compacta e coalesce pequenos arquivos durante gravações
C) Atualiza permissões
D) Gera visualizações automaticamente
17. 17. Qual é o papel do 'Metastore Admin' no Unity Catalog?
A) Criar somente tabelas
B) Administrar o metastore e gerenciar permissões globais
C) Executar somente queries
D) Gerenciar apenas clusters
18. 18. Qual é a diferença principal entre Triggered Mode e Continuous Mode em DLT?
A) Triggered roda uma vez por trigger; Continuous roda continuamente
B) Triggered é somente streaming
C) Continuous roda só em desenvolvimento
D) Não há diferença
19. 19. O que o comando MERGE INTO permite fazer em Delta?
A) Apenas inserir linhas novas
B) Mesclar upserts (inserts/updates) e deletes baseado em condições
C) Excluir a tabela
D) Compactar arquivos
20. 20. Ao analisar uma consulta lenta, qual das opções abaixo NÃO é uma causa comum evidenciada no Spark
UI?
A) Data skew
B) Shuffle pesado
C) Número ideal de partições
D) Join sem broadcast quando necessário
21. 21. Qual prática ajuda a evitar 'data skew' em joins grandes?
A) Aumentar o número de colunas
B) Re-partition por chave de join ou usar salting
C) Usar apenas collect()
D) Reduzir a memória
22. 22. Em pipelines de produção, o que é um Asset Bundle (DAB)?
A) Um pacote versão-controlado contendo jobs, notebooks, configurações e recursos para deploy
B) Um tipo de cluster
C) Um dataset
D) Um snapshot de storage
23. 23. Qual arquivo é o principal no DAB para descrever o deploy?
A) [Link]
B) [Link]
C) [Link]
D) [Link]
24. 24. O que são 'expectations' em Delta Live Tables?
A) Regras de qualidade de dados que validam registros durante o processamento
B) Métricas de performance
C) Tipos de cluster
D) Funções de usuário
25. 25. Se uma expectation for configurada com ON VIOLATION = FAIL, o que acontece?
A) As linhas inválidas são descartadas silenciosamente
B) O lote falha e a pipeline marca erro
C) As linhas são convertidas em NULL
D) Nada acontece
26. 26. Qual é a sintaxe básica para iniciar um readStream com Auto Loader?
A) [Link]('cloudFiles')
B) [Link]('csv')
C) [Link]('files')
D) [Link]('cloud')
27. 27. Ao usar Databricks Repos, qual vantagem você obtém?
A) Integração com Git para versionamento de notebooks e código
B) Armazenamento de dados
C) Otimização automática de queries
D) Compartilhamento Delta nativo
28. 28. O que o VACUUM faz numa tabela Delta?
A) Remove arquivos antigos não referenciados para liberar espaço
B) Otimiza queries
C) Atualiza permissões
D) Faz backup do Delta log
29. 29. Qual recurso permite executar queries SQL sem gerenciar clusters e com escalonamento automático?
A) All-purpose cluster
B) Serverless SQL Warehouse
C) Job Cluster
D) DLT
30. 30. Em que situação você escolheria usar um Job Cluster em vez de All-purpose cluster?
A) Desenvolvimento interativo
B) Workloads de produção agendados para reduzir custo
C) Para executar dashboards
D) Para explorar dados via Data Explorer
31. 31. Ao configurar checkpoints em writeStream, por que eles são importantes?
A) Para registrar tokens de segurança
B) Para permitir recuperação e garantir processamento exatamente-uma-vez
C) Para armazenar logs de auditoria
D) Para criar clones
32. 32. O que é 'Auto-Compaction' em Delta?
A) Compactação automática de pequenos arquivos ao escrever
B) Exclusão de dados antigos
C) Backup incremental
D) Atualização de índices
33. 33. Qual opção descreve melhor 'Lakehouse Federation'?
A) Replicar dados entre workspaces
B) Consultar fontes externas sem mover os dados usando metastore federado
C) Backup cruzado entre clouds
D) Serviço de ETL gerenciado
34. 34. Ao compartilhar dados cross-cloud via Delta Sharing, qual custo deve ser considerado?
A) Custo de autorização
B) Egress fees (taxas de saída de dados) entre clouds
C) Custo do usuário final
D) Custo de snapshots locais
35. 35. Qual é a consequência de usar muitos small files em tabelas Delta?
A) Melhor performance de leitura
B) Overhead no planejamento e leitura; pior performance
C) Redução de latência
D) Menor custo de armazenamento
36. 36. O que é 'deep clone' numa tabela Delta?
A) Uma cópia somente de metadados
B) Uma cópia completa dos dados e metadados no momento da clonagem
C) Compartilhamento sem mover dados
D) Remoção de duplicatas
37. 37. Qual comando SQL é usado para atualizar linhas existentes em uma tabela Delta?
A) INSERT INTO
B) UPDATE ... SET ... WHERE ...
C) MERGE INTO
D) CREATE OR REPLACE
38. 38. No contexto de lineage, quais objetos o Unity Catalog pode mostrar como fontes de uma tabela?
A) Apenas outras tabelas
B) Notebooks, queries SQL, jobs, DLT pipelines e tabelas
C) Apenas jobs
D) Apenas usuários
39. 39. Em um cenário de BI com dashboards que exigem consultas rápidas e previsíveis, qual é a arquitetura
recomendada?
A) Ler direto da camada Bronze
B) Alimentar um SQL Warehouse com tabelas Gold otimizadas
C) Usar Auto Loader para dashboards
D) Usar somente Repos
40. 40. Qual é a melhor prática para particionar uma tabela Delta grande para melhorar leitura?
A) Particionar por coluna com alta cardinalidade indiscriminadamente
B) Particionar por coluna com cardinalidade moderada que é frequentemente usada em filtros
C) Não particionar nunca
D) Particionar por UUID
41. 41. Ao configurar permissões no UC, qual é a ordem correta da hierarquia onde permissões podem ser
aplicadas?
A) Table Schema Catalog Metastore
B) Metastore Catalog Schema Table
C) Catalog Metastore Schema Table
D) Schema Table Catalog Metastore
42. 42. O que significa 'Managed Table' no contexto do Unity Catalog?
A) UC gerencia apenas os metadados
B) UC gerencia metadados e os arquivos físicos
C) Os dados estão sempre em S3
D) A tabela é somente leitura
43. 43. Qual é a função do 'schemaLocation' ao usar Auto Loader?
A) Armazenar checkpoints
B) Indicar onde o Auto Loader salva metadados de schema inferido
C) Localizar arquivos Delta
D) Definir o formato de saída
44. 44. Qual ferramenta você usaria para rodar testes de qualidade em pipelines DLT automaticamente?
A) Databricks Repos
B) DLT expectations e monitoramento integrado
C) Spark UI
D) Delta Sharing
45. 45. Em que situação você usaria 'MERGE INTO' em vez de INSERT/UPDATE separados?
A) Quando precisa apenas inserir linhas novas
B) Quando deseja realizar upsert (insert+update) condicionalmente
C) Para deletar a tabela
D) Para compactar arquivos
46. 46. Qual é o comportamento padrão do comando DROP TABLE para uma tabela gerenciada?
A) Remove metadados, mantém arquivos
B) Remove metadados e arquivos físicos
C) Não faz nada
D) Cria backup automático antes de remover
47. 47. Qual metadado importante fica dentro do diretório `_delta_log`?
A) Histórico de transações e logs JSON/Parquet descrevendo commits
B) Dados brutos
C) Configurações de cluster
D) Tokens de compartilhamento
48. 48. O que o 'OPTIMIZE ZORDER BY' ajuda a reduzir em queries?
A) Tempo de escrita
B) Custo de egress
C) Bytes lidos durante filtros seletivos
D) Número de colunas
49. 49. Ao usar Spark window functions, qual importação é necessária?
A) [Link]
B) [Link]
C) [Link]
D) [Link]
50. 50. Qual estratégia é recomendada para compartilhar dados de produção com parceiros que usam diferentes
nuvens?
A) Copiar dados manualmente entre clouds
B) Avaliar delta sharing e considerar custos de egress; preferir sharing dentro da mesma cloud quando possível
C) Expor credentials diretamente
D) Fornecer dumps CSV diários
Gabarito
1. B
2. C
3. B
4. B
5. B
6. B
7. A
8. B
9. B
10. A
11. B
12. B
13. B
14. B
15. B
16. B
17. B
18. A
19. B
20. C
21. B
22. A
23. A
24. A
25. B
26. A
27. A
28. A
29. B
30. B
31. B
32. A
33. B
34. B
35. B
36. B
37. B
38. B
39. B
40. B
41. B
42. B
43. B
44. B
45. B
46. B
47. A
48. C
49. A
50. B