Prova data máster
Pergunta 1 de 60.
Com relação ao conceito de EXTERNAL TABLE em HIVE, selecione as opções que são
verdadeiras:
I. São armazenados dados temporários;
II. Deseja usar o HIVE para gerenciar o ciclo de vida de tabelas e dados;
III. Os dados também são usados fora do Hive.
IV. Você não está criando uma tabela com base na tabela existente
V. Os dados precisam permanecer no local subjacente mesmo depois de DROP TABLE.
a) Apenas I é verdadeira.
b) II e III são verdadeiras.
c) III, IV e I são verdadeiras.
d) III, IV e V são verdadeiras.
A alternativa correta é:
d) III, IV e V são verdadeiras.
Justificativas:
1. Afirmação I: Incorreta. As external tables em Hive não são usadas para
armazenar dados temporários. Elas são usadas para gerenciar dados que já
existem em um local fora do controle direto do Hive.
2. Afirmação II: Incorreta. Se você deseja que o Hive gerencie o ciclo de vida dos
dados e tabelas, seria mais adequado utilizar managed tables (tabelas
gerenciadas), não external tables. As external tables são usadas quando o ciclo
de vida dos dados é gerenciado externamente.
3. Afirmação III: Correta. External tables são usadas quando os dados também
precisam ser acessados fora do Hive, como por outros processos ou sistemas
externos.
4. Afirmação IV: Correta. External tables são frequentemente usadas para criar
uma tabela no Hive que se refere a dados existentes, sem copiar ou modificar a
estrutura dos dados.
5. Afirmação V: Correta. Quando você usa external tables e executa um comando
DROP TABLE, apenas a definição da tabela é removida do Hive. Os dados
subjacentes permanecem no local original, pois não são excluídos.
Por isso, a resposta correta é d) III, IV e V são verdadeiras.
Pergunta 2 de 60.
Com relação ao plano de execução das queries no Spark, podemos AFIRMAR que:
I. Toda transformação "lazy" é convertida em um plano de execução que somente será
materializado quando o usuário faça uma chamada de ação, chamada que gera um output;
II. O plano lógico é uma representação abstrata das queries que não carrega informações
sobre a execução nem sobre os algoritmos que serão utilizados para realizar as
transformações;
III. A construção do plano físico é anterior à construção do plano lógico;
IV. No plano físico, o Spark usa regras específicas para selecionar os melhores algoritmos.
Por exemplo, em cruzamentos de dataframes, o Spark avalia se os dados estão
corretamente distribuídos.
a) Apenas II
b) I, II e IV
c) I, III e IV
d) II e IV
A alternativa correta é:
b) I, II e IV
Justificativas:
1. Afirmação I: Correta. No Spark, as transformações são "lazy", o que significa
que elas não são executadas imediatamente quando definidas. Em vez disso, elas
são adicionadas a um plano de execução que será materializado apenas quando
uma ação (como count(), collect(), show(), etc.) for chamada.
2. Afirmação II: Correta. O plano lógico é uma representação abstrata das
consultas, que mostra como os dados devem ser transformados, mas sem definir
detalhes específicos de execução ou quais algoritmos serão usados.
3. Afirmação III: Incorreta. A construção do plano lógico ocorre antes da
construção do plano físico. O plano lógico é transformado em um plano físico
que é otimizado e contém detalhes específicos de execução.
4. Afirmação IV: Correta. No plano físico, o Spark aplica otimizações e escolhe
os algoritmos mais eficientes para executar as operações. Por exemplo, em
operações de join entre DataFrames, o Spark verifica a distribuição dos dados
para decidir a melhor estratégia de execução.
Por isso, a alternativa correta é b) I, II e IV.
Pergunta 3 de 60.
Sobre MapReduce, é falsa a afirmação:
a) componente Combiner ajuda a reduzir o tempo de execução de aplicações de
MapReduce.
b) MapReduce é muito criticado por sua baixa resistência a falhas. Se um nó (node) da
rede falhar na sua etapa de processamento, a consulta inteira é comprometida.
c) MapReduce tira proveito do sistema de arquivos HDFS, no qual os dados são
distribuidos em múltiplos locais.
d) MapReduce é um framework de Big Data que consiste de basicamente três etapas,
Map, Shuffle e Reduce.
A alternativa correta é:
b) MapReduce é muito criticado por sua baixa resistência a falhas. Se um nó
(node) da rede falhar na sua etapa de processamento, a consulta inteira é
comprometida.
Justificativa:
O MapReduce é, na verdade, um framework conhecido por sua alta resistência a
falhas. Se um nó falhar durante a execução, o framework é capaz de reatribuir a tarefa a
outro nó, garantindo a continuidade do processamento. O Hadoop MapReduce, em
particular, é projetado para lidar com falhas de hardware e redes de forma resiliente,
evitando que toda a consulta seja comprometida.
Análise das outras alternativas:
a) Correta. O Combiner é uma função intermediária que ajuda a reduzir o volume de
dados que precisa ser transmitido entre as etapas de Map e Reduce, otimizando o tempo
de execução.
c) Correta. O MapReduce tira proveito do sistema de arquivos distribuído HDFS, que
armazena os dados de forma distribuída em vários nós, garantindo alta disponibilidade e
escalabilidade.
d) Correta. O MapReduce é composto basicamente de três etapas principais: Map,
Shuffle (intermediária) e Reduce, que formam o fluxo de processamento de dados no
framework.
Por isso, a resposta é b) MapReduce é muito criticado por sua baixa resistência a
falhas.
Pergunta 4 de 60.
Com relação ao ElasticSearch, o framework é principalmente caracterizado como:
a) Um mecanismo de busca baseado em tabelas relacionais.
b) Um mecanismo de busca que tem uma interface web HTTP e documentos JSON.
c) Um mecanismo de busca que tem uma interface web HTTP.
d) Um mecanismo de busca de documentos apenas JSON e XML.
A alternativa correta é:
b) Um mecanismo de busca que tem uma interface web HTTP e documentos
JSON.
Justificativa:
O ElasticSearch é um mecanismo de busca e análise de dados distribuído que trabalha
com documentos JSON e utiliza uma interface RESTful baseada em HTTP. Ele é
amplamente utilizado para buscas textuais e consultas complexas, permitindo
armazenar, buscar e analisar grandes volumes de dados quase em tempo real.
Análise das outras alternativas:
a) Incorreta. ElasticSearch não é baseado em tabelas relacionais. Ele utiliza
documentos JSON, que são mais flexíveis e não seguem um esquema fixo como os
bancos de dados relacionais.
c) Incorreta. Embora o ElasticSearch tenha uma interface HTTP, isso por si só não é
uma característica completa, pois seu principal diferencial é trabalhar com documentos
JSON.
d) Incorreta. ElasticSearch trabalha principalmente com documentos JSON. O suporte
para XML é muito limitado e não é uma característica primária do framework.
Por isso, a resposta é b) Um mecanismo de busca que tem uma interface web HTTP
e documentos JSON.
Pergunta 5 de 60.
Considerando o tema big data, assinale a opção correta.
a) O sistema de arquivos distribuído Hadoop implementa o algoritmo Dijkstra modificado
para busca irrestrita de dados em árvores aglomeradas em clusters com criptografia.
b) Em big data, o sistema de arquivos HDFS é usado para armazenar arquivos muito
grandes de forma distribuída, tendo como princípio o write-many, read-once.
c) Para armazenar e recuperar grande volume de dados, o big data utiliza bancos SQL
nativos, que são bancos de dados que podem estar configurados em quatro tipos
diferentes de armazenamentos: valor chave, colunar, gráfico ou documento.
d) O MapReduce é considerado um modelo de programação que permite o processamento
de dados massivos em um algoritmo paralelo e distribuido.
A alternativa correta é:
d) O MapReduce é considerado um modelo de programação que permite o
processamento de dados massivos em um algoritmo paralelo e distribuído.
Justificativa:
O MapReduce é um modelo de programação utilizado para processar grandes volumes
de dados em um ambiente distribuído. Ele divide a computação em duas fases
principais: Map, que processa e transforma os dados, e Reduce, que agrega e combina
os resultados. Esse modelo permite que os dados sejam processados de forma paralela
em diferentes nós, facilitando o processamento de big data.
Análise das outras alternativas:
a) Incorreta. O sistema de arquivos HDFS não implementa o algoritmo Dijkstra, que é
um algoritmo de busca de caminhos mínimos em grafos. Além disso, não se refere a
"árvores aglomeradas com clusters e criptografia". O HDFS é um sistema de arquivos
distribuído com enfoque em alta disponibilidade e processamento paralelo.
b) Incorreta. O princípio do HDFS é o write-once, read-many. Isso significa que um
arquivo, uma vez escrito, não é frequentemente modificado. Em vez disso, ele é lido
muitas vezes por várias aplicações.
c) Incorreta. Os bancos de dados SQL não são os principais usados em big data para
grande volume de dados. Para esses cenários, geralmente se usa bancos NoSQL (como
chave-valor, colunar, gráfico ou orientado a documentos) que oferecem maior
flexibilidade e escalabilidade para armazenar e recuperar dados massivos.
Por isso, a alternativa correta é d) O MapReduce é considerado um modelo de
programação que permite o processamento de dados massivos em um algoritmo
paralelo e distribuído.
Pergunta 6 de 60.
Qual das seguintes é considerada uma das principais vantagens de Spark sobre o
MapReduce?
a) Spark grava dados com redundância e, por isso, é resistente a falhas de disco.
b) Spark é capaz de realizar calculos em memória, já MapReduce precisa utilizar disco
para seus cálculosc) MapReduce não suporta RDDS.
d) MapReduce não suporta computação distribuida.
A alternativa correta é:
b) Spark é capaz de realizar cálculos em memória, já MapReduce precisa utilizar
disco para seus cálculos.
Justificativa:
Uma das principais vantagens do Apache Spark em comparação com o Hadoop
MapReduce é a capacidade de realizar cálculos em memória (in-memory processing).
Spark armazena os dados intermediários na memória RAM, o que reduz
significativamente o tempo de execução de operações iterativas ou complexas, como
aquelas encontradas em machine learning e processamento de dados em série. Por outro
lado, o MapReduce utiliza o disco para armazenar os dados intermediários, o que pode
resultar em maior latência e tempo de execução mais lento.
Análise das outras alternativas:
a) Incorreta. Embora o Spark tenha mecanismos para recuperação de falhas (como a
reconstrução de partições usando o lineage das RDDs), a redundância e resistência a
falhas são características mais associadas ao HDFS no Hadoop, e não especificamente
ao Spark.
c) Incorreta. RDDs (Resilient Distributed Datasets) são uma estrutura de dados
fundamental do Spark e não estão relacionadas ao MapReduce. O MapReduce não
utiliza RDDs, mas isso não é uma desvantagem, pois são conceitos distintos.
d) Incorreta. MapReduce suporta computação distribuída; na verdade, ele é um dos
frameworks mais conhecidos para esse tipo de processamento, sendo projetado
exatamente para executar tarefas distribuídas e paralelas em grandes volumes de dados.
Por isso, a alternativa correta é b) Spark é capaz de realizar cálculos em memória, já
MapReduce precisa utilizar disco para seus cálculos.
Marcar para acompanhamento
Pergunta 7 de 60.
Dentre os seguintes qual é o modelo de programação projetado para processar grandes
volumes de dados em paralelo, dividindo o trabalho em um conjunto de tarefas
independentes:
a) HDFS
b) YARN
c) MapReduce
d) Pig
A alternativa correta é:
c) MapReduce
Justificativa:
O MapReduce é um modelo de programação projetado especificamente para processar
grandes volumes de dados de forma paralela e distribuída. Ele divide o trabalho em duas
fases principais:
1. Map: Os dados são processados e transformados em pares de chave-valor,
dividindo o trabalho em várias tarefas paralelas.
2. Reduce: As saídas das tarefas de Map são combinadas para produzir o resultado
final.
O MapReduce facilita a execução de tarefas em diferentes nós de um cluster, o que o
torna ideal para processar dados em grande escala.
Análise das outras alternativas:
a) HDFS (Hadoop Distributed File System): É um sistema de arquivos distribuído que
armazena grandes volumes de dados, mas não é um modelo de programação.
b) YARN (Yet Another Resource Negotiator): É o gerenciador de recursos do
Hadoop, responsável por alocar recursos e gerenciar as tarefas, mas não é um modelo de
programação.
d) Pig: É uma linguagem de script de alto nível construída sobre o MapReduce para
simplificar a manipulação de grandes conjuntos de dados. No entanto, o Pig não é o
modelo de programação subjacente; ele utiliza MapReduce para execução.
Por isso, a alternativa correta é c) MapReduce.
Pergunta 8 de 60.
Quanto ao framework Apache Spark, assinale a alternativa correta.
a) Suporta apenas SQL, mas não dá suporte ao HQL.
b) É amplamente utilizada como uma biblioteca para a disponibilização de APIs em razão
do seu baixo custo operacional do ponto de vista financeiro.
c) Não suporta processamento em tempo real.
d) Não possui um sistema gerenciador de arquivos próprio, dependendo de outras
plataformas para isso, como o Hadoop.
A alternativa correta é:
d) Não possui um sistema gerenciador de arquivos próprio, dependendo de outras
plataformas para isso, como o Hadoop.
Justificativa:
O Apache Spark não possui um sistema de arquivos nativo como o HDFS no Hadoop.
Ele depende de outras plataformas para armazenar e gerenciar arquivos, como HDFS,
Amazon S3, sistemas locais de arquivos, ou outras fontes de dados distribuídas. Spark é
um motor de processamento de dados em larga escala, que se conecta a diferentes
sistemas de armazenamento para realizar operações de leitura e escrita, mas não
gerencia esses dados por si próprio.
Análise das outras alternativas:
a) Incorreta. O Apache Spark suporta SQL por meio do módulo Spark SQL e também
permite consultas utilizando HQL (Hive Query Language) se estiver conectado ao Hive.
b) Incorreta. O Spark é amplamente utilizado devido ao seu desempenho e
flexibilidade, mas o custo operacional depende do ambiente e da infraestrutura. Em
comparação ao Hadoop, ele pode ser mais eficiente para algumas cargas de trabalho,
mas isso não implica necessariamente um custo financeiro mais baixo.
c) Incorreta. O Spark possui suporte a processamento em tempo real por meio do
módulo Spark Streaming, que permite o processamento de dados em micro-batches ou
com baixa latência.
Por isso, a alternativa correta é d) Não possui um sistema gerenciador de arquivos
próprio, dependendo de outras plataformas para isso, como o Hadoop.
Pergunta 9 de 60.
Um leitor gostou de um documento que tem a seguinte representação vetorial: [1445341].
Qual dos seguintes documentos você recomendaria a esse leitor, baseando-se na
similaridade de cosseno?
a) [11449008]
b) [11454442]
c) [15101514]
d) [12451016]
a ou b
chutei a
Pergunta 10 de 60.
Sobre o método da silhueta, é correto afirmar:
I - É uma métrica de validação de agrupamentos.
II - O coeficiente de silhueta tem valor entre 0 e 1.
III - Pode ser calculado com qualquer métrica de distância.
IV - Pode ser usado junto com KMeans para ajudar na escolha do valor K.
a) ll e IV
b) I, l e llI
c) l e Ill
O I, III e IV
A afirmativa correta é:
c) I e III
Analisando as afirmações:
I: Correto. O método da silhueta é uma métrica de validação de agrupamentos.
II: Incorreto. O coeficiente de silhueta varia entre -1 e 1, não entre 0 e 1.
III: Correto. O coeficiente de silhueta pode ser calculado com qualquer métrica
de distância, como distância euclidiana, Manhattan, etc.
IV: Correto. O método da silhueta pode ser usado junto com KMeans para
ajudar na escolha do valor de K.
Porém, como a afirmação II está incorreta, a resposta correta é c) I e III.
Pergunta 11 de 60.
Sobre técnicas de agrupamento, marque as afirmações abaixo com V, se verdadeiras, ou
F, se falsas:
I - Técnicas de clustering hierárquico incorrem no problema de termos que fixar o número
de grupos a priori.
II - dendrograma captura os resultados do uso de técnicas de clustering hierárquico e nos
permite visualizar os grupos formados em diferentes granularidades sem termos que
executar/rodar novamente o
algoritmo.
III - Clustering hierárquico nos permite capturar grupos em formatos mais complexos do
que K-means ou Gaussian mixtures.
IV - Há dois tipos principais de algoritmos para agrupamento hierárquico: divisível (ou top-
down) e aglomerativos (ou bottom-up).
a) F-V-V-F.
b) F-V-V-V.
c) F-F-V-V.
d) V-V-F-V.
A resposta correta é:
b) F-V-V-V
Analisando cada afirmação:
I: Falsa. Técnicas de clustering hierárquico não requerem que o número de
grupos seja fixado a priori. O número de grupos pode ser definido após a análise
do dendrograma.
II: Verdadeira. O dendrograma captura os resultados do clustering hierárquico
e permite visualizar os grupos em diferentes níveis de granularidade sem
precisar rodar o algoritmo novamente.
III: Verdadeira. Clustering hierárquico pode capturar grupos em formatos mais
complexos do que K-means ou Gaussian mixtures, pois não assume que os
grupos tenham formas esféricas ou gaussianas.
IV: Verdadeira. Existem dois tipos principais de algoritmos de agrupamento
hierárquico: divisível (top-down) e aglomerativo (bottom-up).
Pergunta 12 de 60.
Assinale a alternativa correta:
I - Uma das razões que geralmente é levantada quanto a não se aconselhar o uso do
algoritmo K-Means
para gerar grupos quando se tem uma base de dados massiva é: a sua complexidade
computacional.
Il - Sob a ótica da otimização, o K-Means pode ser visto como um minimizador da
distància intra-cluster.
III - A vantagem do algoritmo K-Means com relação aos algoritmos baseados em
densidade é sua pouca sensibilidade a inicialização. Sobre as afirmações acima:
a) Somente Il está correta.
b) l e ll estão corretas.
c) I e III estão corretas.
d) ll e III estão corretas.
A alternativa correta é:
a) Somente II está correta.
Analisando as afirmações:
I: Falsa. Embora a complexidade computacional do K-Means seja um fator, não
é o principal motivo para se evitar seu uso com bases de dados massivas. O K-
Means é, na verdade, relativamente eficiente em termos computacionais. O
problema maior é que o K-Means pode não escalar bem ou produzir resultados
imprecisos para grandes volumes de dados devido à sensibilidade aos outliers e à
necessidade de definir o número de clusters previamente.
II: Verdadeira. Sob a ótica da otimização, o K-Means minimiza a distância
intra-cluster, ou seja, busca minimizar a soma das distâncias quadráticas entre os
pontos e seus respectivos centróides.
III: Falsa. O K-Means é sensível à inicialização. A escolha inicial dos
centróides pode levar o algoritmo a convergir para mínimos locais, e por isso são
usadas técnicas como o K-Means++ para melhorar essa inicialização.
Portanto, apenas a afirmativa II está correta.
Pergunta 13 de 60.
Sobre técnicas de agrupamento, marque as afirmações abaixo com V, se verdadeiras, ou
F, se falsas:
a) Ao desenvolver um algoritmo do tipo Agglomerative Hierarchical clustering, você
geralmente se depara com três principais escolhas a serem feitas: 1) a função de
distância; 2) a função de ligação (linkage function); e 3) onde cortar o dendrograma.
b) A função de ligação chamada "complete linkage" tem a característica de formar grupos
cujos pontos podem estar distantes um dos outros se existir uma cadeia de pontos cuja
distância dois a dois é pequena.
c) A função de ligação chamada "complete linkage" pode ser mais robusta que a "single
linkage" para alguns casos de agrupamento hierárquico, mas restringe o formato dos
clusters que são encontrados.
a)V-V-F.
b)V-F-V.
c)F-F-V.
d)F-V-V.
A resposta correta é:
b) V-F-V
Analisando cada afirmação:
a): Verdadeira. Ao usar Agglomerative Hierarchical Clustering, você precisa
escolher a função de distância (para medir a proximidade entre pontos), a função
de ligação (linkage) para determinar como agrupar pontos e, finalmente, onde
cortar o dendrograma para definir o número de clusters.
b): Falsa. A função complete linkage (ligação completa) forma grupos
baseados na distância máxima entre dois pontos em clusters diferentes, ou seja,
os clusters são formados de modo que a maior distância entre dois pontos de
diferentes clusters seja minimizada. Single linkage (ligação simples) é a função
que pode formar clusters com pontos distantes entre si se houver uma cadeia de
pontos próximos, não complete linkage.
c): Verdadeira. Complete linkage é mais robusta que single linkage em muitos
casos, mas tende a formar clusters mais compactos e esféricos, restringindo o
formato dos clusters em comparação com outras funções de ligação.
Portanto, a sequência correta é V-F-V.
Pergunta 14 de 60.
Sobre os algoritmos de clusterização hierárquica, é correto afirmar:
I- Podem ser aplicados para qualquer matriz de dissimilaridade.
II-O dendrograma associado permite uma visão completa e interpretável de todos os
clusters possiveis de serem gerados pelo algoritmo
III-A clusterização hierárquica divisiva e aglomerativa gerarão o mesmo encadeamento de
clusters.
a) l e Ill
b) I e ll
c) I, Il e llI
d) Apenas II
Pergunta 15 de 60.
Qual é o número mínimo de variáveis (features) de um conjunto de dados (dataset) para
aplicarmos o K-Means?
a) 0
b) 1
c) 2
d) Depende do número de linhas
A resposta correta é:
b) 1
O algoritmo K-Means pode ser aplicado a um conjunto de dados com pelo menos 1
variável (feature). Com apenas uma variável, os dados podem ser agrupados com base
em seus valores ao longo dessa única dimensão.
Assim, o número mínimo de variáveis (features) para aplicar o K-Means é 1.
Pergunta 16 de 60.
Referente aos algoritmos de agrupamento hierárquico (hierarchical clustering), é incorreto
afirmar que:
a) É aplicável em dados que contenham variáveis categóricas e numéricas ao mesmo
tempo usando distância euclidiana, por exemplo
b) Podemos usar qualquer métrica de distância para calcular a similaridade entre
elementos.
c) o algoritmo de agrupamento hierárquico aglomerativo é iniciado com grupos de mesmo
tamanho.
d) Dois agrupamentos podem ser comparados usando a métrica Rand Index.
A alternativa incorreta é:
c) o algoritmo de agrupamento hierárquico aglomerativo é iniciado com grupos de
mesmo tamanho.
Explicação:
No agrupamento hierárquico aglomerativo, o algoritmo começa com cada
ponto de dados sendo seu próprio grupo, ou seja, cada elemento forma
inicialmente um cluster individual. Depois, os clusters são gradualmente
mesclados com base em suas similaridades até formar um único cluster que
contém todos os pontos. Portanto, os grupos não têm o mesmo tamanho no
início.
Agora, analisando as outras alternativas:
a): Correta. O agrupamento hierárquico pode ser aplicado em dados mistos
(categóricos e numéricos), mas é importante escolher uma métrica de distância
adequada para o tipo de dado. Embora a distância euclidiana funcione para
variáveis numéricas, para variáveis categóricas outras métricas, como distância
de Hamming, podem ser mais adequadas.
b): Correta. Qualquer métrica de distância pode ser usada no agrupamento
hierárquico, como distância euclidiana, Manhattan, ou até mesmo medidas
específicas para variáveis categóricas.
d): Correta. O Rand Index é uma métrica que pode ser usada para comparar a
similaridade entre dois agrupamentos (clusters), avaliando o grau de
correspondência entre eles.
Portanto, a afirmativa incorreta é a c.
Pergunta 17 de 60.
Sobre o algoritmo de clusterização hierárquica aglomerativo e o dendrograma que ele
gera, é incorreto afirmar:
a) A cada passo do algoritmo, teremos a redução de 1 cluster, até que todos os
pontos pertençam ao mesmo cluster no final.
b) A altura do dendrograma representa o grau de dissimilaridade dos 2 clusters.
c) Em casos especificos, pode apresentar ambiguidade no passo da aglomeração.
D) Ele retorna uma maneira natural de escolher o número correto de clusters.
A alternativa incorreta é:
d) Ele retorna uma maneira natural de escolher o número correto de clusters.
Explicação:
O algoritmo de clusterização hierárquica não fornece automaticamente o
número correto de clusters. O dendrograma apresenta uma hierarquia de
agrupamentos, e o ponto de corte (que define o número de clusters) deve ser
escolhido manualmente, ou seja, não há uma maneira "natural" ou automática de
determinar esse ponto exato. O número de clusters pode ser definido analisando
visualmente o dendrograma, mas essa decisão é subjetiva.
Agora, analisando as outras alternativas:
a): Correta. No algoritmo hierárquico aglomerativo, a cada passo os clusters são
fundidos, e o número de clusters é reduzido até que todos os pontos pertençam a
um único cluster no final.
b): Correta. A altura do dendrograma representa o grau de dissimilaridade no
qual dois clusters são unidos. Quanto maior a altura da fusão, mais diferentes
(dissimilares) são os clusters.
c): Correta. Em alguns casos, pode haver ambiguidade na escolha de quais
clusters unir, especialmente se houver múltiplos pares de clusters com a mesma
dissimilaridade.
Portanto, a afirmativa incorreta é a d.
questão 18
Há duas caixas, cada uma contendo duas bolas. Uma das caixas contém duas bolas
pretas e outra uma bola preta e uma branca. Em um sorteio, uma das caixas é escolhida
aleatoriamente, e da caixa sorteada é retirada uma bola na cor preta. Qual a probabilidade
da bola que restou na caixa selecionada ser da cor preta?
a) ¾
b) 2/3
c) 1/2
d) 1/4
Esse problema pode ser resolvido usando o teorema de Bayes, já que estamos lidando
com a probabilidade condicional. Queremos encontrar a probabilidade de que a caixa
escolhida contenha duas bolas pretas, dado que foi retirada uma bola preta.
Passos para a solução:
1. Definindo os eventos:
o A1A_1A1: A caixa sorteada é a que contém duas bolas pretas.
o A2A_2A2: A caixa sorteada é a que contém uma bola preta e uma bola
branca.
o BBB: A bola sorteada é preta.
2. Probabilidades iniciais:
o P(A1)=P(A2)=12P(A_1) = P(A_2) = \frac{1}{2}P(A1)=P(A2)=21 (já
que a escolha da caixa é aleatória).
oP(B∣A1)=1P(B | A_1) = 1P(B∣A1)=1 (se a caixa contém duas bolas
pretas, a bola sorteada será preta com certeza).
o P(B∣A2)=12P(B | A_2) = \frac{1}{2}P(B∣A2)=21 (se a caixa contém
uma bola preta e uma bola branca, há 50% de chance de retirar uma bola
preta).
3. Aplicando o teorema de Bayes:
Queremos encontrar P(A1∣B)P(A_1 | B)P(A1∣B), a probabilidade de que a caixa com
duas bolas pretas tenha sido sorteada, dado que a bola retirada foi preta.
P(A1∣B)=P(B∣A1)⋅P(A1)P(B∣A1)⋅P(A1)+P(B∣A2)⋅P(A2)P(A_1 | B) = \frac{P(B | A_1) \
cdot P(A_1)}{P(B | A_1) \cdot P(A_1) + P(B | A_2) \cdot P(A_2)}P(A1∣B)=P(B∣A1
)⋅P(A1)+P(B∣A2)⋅P(A2)P(B∣A1)⋅P(A1)
Substituindo os valores:
P(A1∣B)=1⋅121⋅12+12⋅12=1212+14=1234=23P(A_1 | B) = \frac{1 \cdot \frac{1}{2}}
{1 \cdot \frac{1}{2} + \frac{1}{2} \cdot \frac{1}{2}} = \frac{\frac{1}{2}}{\frac{1}
⋅211⋅21=21+4121=4321=32
{2} + \frac{1}{4}} = \frac{\frac{1}{2}}{\frac{3}{4}} = \frac{2}{3}P(A1∣B)=1⋅21+21
Portanto, a probabilidade de que a bola que restou na caixa sorteada seja preta é 2/3.
A resposta correta é b) 2/3.
Pergunta 19 de 60.
Em uma mesa temos 2 moedas: uma moeda não viciada com chances iguais de dar cara
ou coroa; e a outra moeda viciada tem as 2 faces iguais, apenas a cara. Escolhemos uma
moeda aleatoriamente e lançamos ela 5 vezes, o resultado apresentou, em todas as 5
vezes, a cara. Qual a probabilidade (aproximada) de termos pego a moeda viciada?
a) 0,97
b) 0,5
c) 0,66
d) 0,88
Teorema de byles
Portanto, a probabilidade de termos escolhido a moeda viciada é aproximadamente 0,97.
A resposta correta é a) 0,97.
Pergunta 20 de 60.
Quando retiramos os outliers dos dados, o que acontece com o intervalo de confiança?
a) Não podemos determinar o intervalo de confiança com apenas estas informações.
b) intervalo de confiança irá diminuir com a retirada dos outliers.
c) o intervalo de confiança irá aumentar com a retirada dos outliers.
d) O intervalo de confiança é robusto a outliers.
A alternativa correta é:
c) o intervalo de confiança irá aumentar com a retirada dos outliers.
Justificativa:
Quando outliers são removidos de um conjunto de dados, a variabilidade e a dispersão
dos dados tendem a diminuir. Isso, por sua vez, pode resultar em uma média e um
desvio padrão que são mais representativos da verdadeira população. O intervalo de
confiança, que é calculado com base na média e na variabilidade dos dados, tende a se
expandir (aumentar) quando os outliers são removidos, porque o cálculo do intervalo de
confiança se torna mais confiável e menos afetado por extremos.
Análise das outras alternativas:
a) Incorreta. Embora seja verdade que a determinação do intervalo de confiança
depende de mais informações, é possível calcular um intervalo de confiança mesmo na
presença de outliers.
b) Incorreta. Normalmente, ao remover outliers, a variabilidade dos dados diminui, o
que não resulta em um intervalo de confiança menor.
d) Incorreta. O intervalo de confiança não é completamente robusto a outliers. Embora
possa resistir a alguns extremos, a presença de outliers pode distorcer significativamente
a estimativa do intervalo de confiança.
Portanto, a resposta correta é c) o intervalo de confiança irá aumentar com a
retirada dos outliers.
Pergunta 21
Qual a probabilidade de jogar dois dados com lados numerados de 1 a 8 e a soma dos
seus valores ser 7? Escolha a opção que possui o valor mais próximo do correto.
a) 5%
21%
9%
16%
A probabilidade de jogar dois dados com lados numerados de 1 a 8 e a soma dos seus
valores ser 7 é 9,375% ou 0,09375.
Detalhes:
Total de combinações possíveis: 64 (8 lados para o primeiro dado e 8 lados
para o segundo dado).
Combinações que resultam em soma 7: 6.
As combinações que resultam em soma 7 são:
1. (1, 6)
2. (2, 5)
3. (3, 4)
4. (4, 3)
5. (5, 2)
6. (6, 1)
Assim, a probabilidade é de 6/64, que simplifica para 9,375%.
Pergunta 22 de 60.
Sobre sobreajuste/subajuste (overfitting/underfitting) é correto afirmar:
1- Um modelo linear com apenas uma variável (feature) não sofrerá de sobreajuste.
Il-Com uma validação cruzada podemos determinar se um modelo sofre de subajuste.
III-Quanto maior o espaço de hipótese (espaço dos modelos) maior a chance do ajuste (fit)
sofrer de sobreajuste.
a) Apenas III
b) Il e Ill
c) l e Ill
d) I, lI e lIl
Vamos analisar as afirmações sobre sobreajuste (overfitting) e subajuste (underfitting):
1- Um modelo linear com apenas uma variável (feature) não sofrerá de
sobreajuste.
Essa afirmação não é correta. Mesmo um modelo simples, como um modelo linear
com uma única variável, pode sofrer de sobreajuste, dependendo do padrão dos dados e
de como o modelo se ajusta a eles. Embora seja menos provável que ocorra sobreajuste
em um modelo simples, ainda pode acontecer se o modelo capturar ruídos específicos
do conjunto de treinamento que não generalizam bem para dados novos.
II- Com uma validação cruzada podemos determinar se um modelo sofre de
subajuste.
Essa afirmação é correta. A validação cruzada é uma técnica importante para avaliar o
desempenho do modelo em dados que ele não viu durante o treinamento. Se o erro de
validação for alto, isso pode indicar subajuste (underfitting), o que significa que o
modelo é muito simples para capturar a complexidade dos dados.
III- Quanto maior o espaço de hipótese (espaço dos modelos), maior a chance do
ajuste (fit) sofrer de sobreajuste.
Essa afirmação é correta. Um espaço de hipóteses maior, com mais complexidade e
mais parâmetros, aumenta o risco de sobreajuste, pois o modelo pode se ajustar muito
aos dados de treinamento, capturando ruídos e padrões específicos que não se
generalizam bem para novos dados.
Resposta correta:
A opção b) II e III é a correta, pois a segunda e terceira afirmações estão corretas,
enquanto a primeira está incorreta.
Pergunta 23 de 60.
O que acontece quando introduzimos mais variáveis a um modelo de regressão linear?
a) valor r^2 pode aumentar ou diminuir enquanto o r^2 ajustado vai sempre aumentar.
b) valor r^2 pode aumentar ou permanecer constante, o r ajustado pode aumentar ou
diminuir.
C) Ambos podem aumentar ou diminuir, o resultado depende das variáveis introduzidas.
D) Ambos r^2 e r^2 ajustado sempre aumentam com a introdução de novas variáveis aos
modelos.
Vamos analisar o comportamento de R2R^2R2 e R2R^2R2 ajustado ao introduzirmos
novas variáveis em um modelo de regressão linear.
R2R^2R2:
R2R^2R2 mede a proporção da variabilidade dos dados que é explicada pelo
modelo. Ele nunca diminui quando adicionamos novas variáveis ao modelo,
pois o modelo tem mais informações para tentar ajustar melhor os dados.
Mesmo que a variável não seja relevante, o R2R^2R2 vai pelo menos se manter
constante ou aumentar ligeiramente.
R2R^2R2 ajustado:
O R2R^2R2 ajustado corrige o R2R^2R2 para o número de variáveis no
modelo. Ele penaliza a inclusão de variáveis irrelevantes que não contribuem
significativamente para o modelo. Como resultado, o R2R^2R2 ajustado pode
aumentar ou diminuir dependendo da relevância das variáveis adicionadas. Se
as novas variáveis melhoram o ajuste do modelo de forma significativa, o
R2R^2R2 ajustado aumenta. Caso contrário, ele diminui.
Analisando as alternativas:
a) Incorreta: O R2R^2R2 ajustado não aumenta sempre; ele pode diminuir se
as novas variáveis não forem úteis.
b) Correta: O R2R^2R2 pode aumentar ou se manter constante, e o R2R^2R2
ajustado pode aumentar ou diminuir, dependendo da qualidade das variáveis
adicionadas.
c) Incorreta: O R2R^2R2 não diminui nunca; ele pode aumentar ou se manter
constante.
d) Incorreta: O R2R^2R2 ajustado não aumenta sempre com novas variáveis;
ele pode diminuir se as variáveis não forem relevantes.
Resposta correta:
b) valor r^2 pode aumentar ou permanecer constante, o r^2 ajustado pode
aumentar ou diminuir.
Pergunta 24 de 60.
Um modelo treinado em um conjunto de dados com 10.000 linhas, foi validado com
validação cruzada K-Fold com k = 5. A acurácia do modelo variou muito entre cada
uma das partições. Qual das seguintes alternativas não ajuda a combater este
problema?
A) Usar menos variáveis.
b) Aumentar o número de observações.
c) Aumentar a complexidade do modelo.
d) Aumentar a regularização.
Quando um modelo apresenta grande variação de acurácia entre as partições em uma
validação cruzada K-Fold, isso pode indicar instabilidade no modelo, o que geralmente
acontece devido a alta variância ou falta de generalização. Vamos analisar as
alternativas e ver qual não ajuda a combater esse problema:
a) Usar menos variáveis:
Reduzir o número de variáveis pode ajudar a combater o problema de variância
alta. Muitas variáveis irrelevantes podem fazer o modelo se ajustar aos dados de
treino, mas não generalizar bem, aumentando a variabilidade. Essa alternativa
ajuda.
b) Aumentar o número de observações:
Aumentar o número de observações (amostra maior) pode ajudar a estabilizar a
performance do modelo, fornecendo mais dados para treinamento e validação, o
que reduz a variância e melhora a generalização. Essa alternativa ajuda.
c) Aumentar a complexidade do modelo:
Aumentar a complexidade do modelo pode piorar a variabilidade entre as
partições, pois um modelo mais complexo tende a sofrer de sobreajuste
(overfitting), o que aumenta a variação entre diferentes subconjuntos dos dados.
Portanto, essa alternativa não ajuda e pode até agravar o problema.
d) Aumentar a regularização:
A regularização (como L1 ou L2) penaliza a complexidade do modelo, ajudando
a evitar sobreajuste. Isso tende a estabilizar o modelo e reduzir a variabilidade
nas partições da validação cruzada. Essa alternativa ajuda.
Resposta correta:
c) Aumentar a complexidade do modelo.
Marcar para acompanhamento
Pergunta 25 de 60.
Assinale a alternativa correta quanto ao teste Kolmogorov-Smirnov (KS):
a) Uma de suas vantagens é que muitos dos parâmetros da distribuição assumida podem
ser estimadas pelos dados.
b) Ele tende a ser mais sensível perto da cauda da distribuição do que no centro.
c) A estatistica de KS é baseada na distância máxima entre uma distribuição acumulada
empirica dos dados e uma distribuição aculumada teórica, ou entre 2 distribuições
acumuladas empíricas.
d) Quanto maior o valor da estatística de KS, maior será a chance de as amostras terem
uma mesma distribuição.
Vamos analisar as alternativas sobre o teste Kolmogorov-Smirnov (KS), que é
utilizado para comparar distribuições:
a) Uma de suas vantagens é que muitos dos parâmetros da distribuição
assumida podem ser estimadas pelos dados.
Incorreta. O teste KS compara a distribuição empírica dos dados com uma
distribuição teórica (ou entre duas distribuições empíricas), mas não estima
parâmetros diretamente. Ele assume que a distribuição teórica já é conhecida e
fornecida.
b) Ele tende a ser mais sensível perto da cauda da distribuição do que no
centro.
Incorreta. O teste KS tende a ser menos sensível nas caudas da distribuição e
mais sensível no centro, porque se baseia na distância máxima entre as
distribuições acumuladas, que é mais influenciada pelos dados centrais.
c) A estatística de KS é baseada na distância máxima entre uma
distribuição acumulada empírica dos dados e uma distribuição
acumulada teórica, ou entre duas distribuições acumuladas empíricas.
Correta. A estatística de KS mede a distância máxima entre a função de
distribuição acumulada empírica dos dados e uma função de distribuição
acumulada teórica, ou entre duas distribuições acumuladas empíricas, o que
caracteriza o teste.
d) Quanto maior o valor da estatística de KS, maior será a chance de as
amostras terem uma mesma distribuição.
Incorreta. Na verdade, quanto maior o valor da estatística de KS, maior a
divergência entre as distribuições comparadas, indicando que menos provável é
que as amostras sigam a mesma distribuição.
Resposta correta:
c) A estatística de KS é baseada na distância máxima entre uma distribuição
acumulada empírica dos dados e uma distribuição acumulada teórica, ou entre
duas distribuições acumuladas empíricas.
Questão 26
Referente ao algoritmo Random Forest, é incorreto afirmar:
a) Apesar do nome "Forest" (Floresta em português), é possível treinar o modelo com
apenas uma árvore.
b) A profundidade das árvores é um dos principais parâmetros do algoritmo e controla
a complexidade do modelo.
c) O número de quebras em cada nó das árvores é definido dinamicamente.
d) Utiliza técnicas de ensemble, combinando várias árvores para criar um modelo de
alta performance.
Vamos analisar as alternativas referentes ao algoritmo Random Forest:
a) Apesar do nome "Forest" (Floresta em português), é possível treinar o
modelo com apenas uma árvore.
Correta. Embora o conceito de Random Forest envolva várias árvores (uma
"floresta"), é tecnicamente possível configurar o modelo para treinar com apenas
uma árvore, o que equivaleria a um simples árvore de decisão.
b) A profundidade das árvores é um dos principais parâmetros do
algoritmo e controla a complexidade do modelo.
Correta. A profundidade das árvores influencia diretamente a complexidade do
modelo. Árvores mais profundas podem capturar mais detalhes e variações nos
dados, mas também podem levar ao sobreajuste (overfitting).
c) O número de quebras em cada nó das árvores é definido
dinamicamente.
Incorreta. O número de quebras em cada nó (também chamado de "divisões" ou
"splits") não é definido dinamicamente. Cada divisão em uma árvore de decisão
no Random Forest é determinada pelo critério de impureza, como Gini ou
Entropia, com base nos dados amostrados. O processo de divisão ocorre de
forma baseada nos dados em cada nó, mas não há algo como um "número de
quebras dinâmico" predeterminado.
d) Utiliza técnicas de ensemble, combinando várias árvores para criar um
modelo de alta performance.
Correta. O Random Forest é um exemplo clássico de técnicas de ensemble,
combinando os resultados de várias árvores de decisão independentes para
melhorar a precisão e reduzir o risco de sobreajuste.
Resposta correta:
c) O número de quebras em cada nó das árvores é definido dinamicamente.
Marcar para acompanhamento
Pergunta 27 de 60.
Ao comparar dois modelos de regressão linear, qual a principal vantagem de usar a
métrica MAE (Mean Absolute Error)?
a) O MAE não é sensível a erros grandes (diferença significativa entre uma predição e
seu valor real), por utilizar a média no seu cálculo.
b) O MAE não é sensível a ruidos nos dados e sempre generaliza em conjuntos
externos ao de treinamento.
c ) O erro calculado tem a mesma ordem de grandeza e escala dos dados.
d) O modelo que tiver o menor MAE é superior em todos os aspectos.
Vamos analisar as alternativas em relação à métrica MAE (Mean Absolute Error) ao
comparar dois modelos de regressão linear:
a) O MAE não é sensível a erros grandes (diferença significativa entre
uma predição e seu valor real), por utilizar a média no seu cálculo.
Incorreta. O MAE é sensível a erros grandes, mas de forma menos intensa
que o MSE (Mean Squared Error). Ele calcula a média dos valores absolutos
das diferenças entre as predições e os valores reais, o que significa que erros
maiores têm o mesmo peso que erros menores, sem amplificação, ao contrário
do MSE, que eleva ao quadrado as diferenças.
b) O MAE não é sensível a ruídos nos dados e sempre generaliza em
conjuntos externos ao de treinamento.
Incorreta. Nenhuma métrica, incluindo o MAE, garante que o modelo será
imune a ruídos nos dados ou que sempre generalizará bem. O MAE pode ainda
ser afetado por dados ruidosos, assim como outras métricas, e a capacidade de
generalização depende mais da qualidade do modelo e dos dados do que da
métrica em si.
c) O erro calculado tem a mesma ordem de grandeza e escala dos dados.
Correta. Uma das principais vantagens do MAE é que ele mantém o erro na
mesma escala dos dados originais, o que facilita a interpretação dos resultados.
Por exemplo, se estamos trabalhando com preços em uma faixa de 100 a 1000
unidades monetárias, o MAE nos dará uma medida de erro em unidades
monetárias, o que é diretamente compreensível.
d) O modelo que tiver o menor MAE é superior em todos os aspectos.
Incorreta. Embora um menor MAE indique um melhor ajuste no que diz
respeito ao erro absoluto médio, isso não garante que o modelo seja superior
em todos os aspectos. Existem outras métricas, como o MSE ou R2R^2R2, que
podem ser mais adequadas dependendo do contexto e do tipo de erro que se
deseja minimizar (por exemplo, para dados com muitos outliers, o MAE pode
não ser a melhor métrica).
Resposta correta:
c) O erro calculado tem a mesma ordem de grandeza e escala dos dados.
Pergunta 28 de 60.
Sobre os métodos de regressão linear, quais afirmativas são corretas:
I- Para LASSO e Ridge, a normalização das variáveis (features), influencia o resultado
do modelo, enquanto na regressão linear simples não faz diferença se as variáveis
foram normalizadas.
II - Uma vantagem de LASSO sobre Ridge é que LASSO permite a seleção de
variáveis, enquanto Ridge não.
III - Uma vantagem de Ridge sobre LASSO é que ela tende a ser computacionalmente
mais rápida dado que Ridge quem tem fórmula fechada e LASSO não.
a) II
b)I e ll
c) I, II e III
c) II e III
Vamos analisar cada uma das afirmativas sobre os métodos de regressão linear
(Regressão Linear Simples, LASSO e Ridge):
I - Para LASSO e Ridge, a normalização das variáveis (features)
influencia o resultado do modelo, enquanto na regressão linear simples
não faz diferença se as variáveis foram normalizadas.
Correta. Em modelos como LASSO e Ridge, que aplicam regularização, a
normalização (ou padronização) das variáveis é importante porque os
coeficientes das variáveis são penalizados proporcionalmente ao seu valor
absoluto ou quadrado. Se as variáveis estiverem em escalas muito diferentes,
isso afetará a penalização. Já na regressão linear simples, a escala das variáveis
não afeta a solução porque os coeficientes são ajustados diretamente com base
nos valores originais dos dados.
II - Uma vantagem de LASSO sobre Ridge é que LASSO permite a
seleção de variáveis, enquanto Ridge não.
Correta. O LASSO (Least Absolute Shrinkage and Selection Operator) pode
efetivamente reduzir os coeficientes de algumas variáveis a zero, fazendo uma
seleção automática de variáveis, o que é uma de suas principais vantagens. Já o
Ridge (ou Tikhonov regularization) apenas encolhe os coeficientes, mas não os
elimina completamente.
III - Uma vantagem de Ridge sobre LASSO é que ela tende a ser
computacionalmente mais rápida dado que Ridge tem fórmula fechada e
LASSO não.
Correta. O Ridge possui uma solução analítica, o que significa que é
computacionalmente mais eficiente para ser resolvido. O LASSO, por outro
lado, não tem uma fórmula fechada e precisa de métodos iterativos (como o
coordinate descent), o que o torna geralmente mais lento do que o Ridge para
grandes conjuntos de dados.
Analisando as opções:
a) II: Incompleta, pois as afirmativas I e III também estão corretas.
b) I e II: Incompleta, pois a afirmativa III também está correta.
c) I, II e III: Correta, todas as afirmativas estão corretas.
d) II e III: Incompleta, pois a afirmativa I também está correta.
Resposta correta:
c) I, II e III.
Pergunta 29 de 60.
Existem múltiplas formas de controlar sobreajuste (overfitting) em redes neurais. Algumas
delas são:
a) Normalização em lotes (batch normalization), Dropout, função de ativação, CatBoost.
b) Número de camadas, Dropout, taxa de aprendizado (learning rate).
c) Viés gaussiano (Gaussian bias), Dropout, taxa de aprendizado (learning rate).
d)Taxa de aprendizado (learning rate), número de nós, distância minima do hiperplano.
A opção a) Normalização em lotes (batch normalization), Dropout, função de
ativação, CatBoost é a que contém um item incorreto no contexto de controle de
sobreajuste em redes neurais.
Análise das opções:
a) Incorreta: Enquanto a normalização em lotes (batch normalization) e o
Dropout são técnicas de controle de sobreajuste, a "função de ativação" não é
uma técnica para isso, e "CatBoost" é um algoritmo de boosting de árvores, não
uma técnica para redes neurais.
b) Correta: O número de camadas, Dropout e taxa de aprendizado (learning
rate) são todos aspectos que podem ajudar a controlar o sobreajuste. O Dropout,
em particular, é uma técnica bastante eficaz.
c) Correta: O viés gaussiano não é uma terminologia comumente usada em
controle de sobreajuste em redes neurais, mas o Dropout e a taxa de aprendizado
são métodos que podem ajudar a evitar sobreajuste. Apesar do "viés gaussiano"
não ser relevante, os outros dois itens são válidos.
d) Correta: A taxa de aprendizado, número de nós (neurônios) e a distância
mínima do hiperplano (relacionada a SVMs, mas em um contexto mais amplo de
ajuste de modelos) podem influenciar o sobreajuste. A taxa de aprendizado é
especialmente crítica.
Portanto, a opção a é a única que contém um erro ao incluir itens que não estão
relacionados ao controle de sobreajuste em redes neurais.
Resposta b) chat 4.0
Pergunta 30 de 60.
Suponha uma regressão via mínimos quadrados com regularização (assumindo
otimização exata). O que ocorre neste caso ao aumentar o valor do parámetro de
regularização?
a) O erro no conjunto de treino nunca vai aumentar.
b) O erro no conjunto de treino nunca vai diminuir.
c) O erro no conjunto de teste nunca vai aumentar.
d) O erro no conjunto de teste nunca vai diminuir.
Vamos analisar o efeito do aumento do parâmetro de regularização em uma regressão
com regularização (como Ridge ou LASSO) no erro de treino e teste:
O que é regularização?
A regularização adiciona uma penalização à função de custo da regressão, que força os
coeficientes a serem menores. Isso ajuda a evitar o sobreajuste (overfitting) do modelo,
especialmente em situações com muitas variáveis ou com ruído nos dados.
O que ocorre quando o valor do parâmetro de regularização aumenta?
No conjunto de treino:
o Conforme o valor da regularização aumenta, a penalização sobre os
coeficientes se torna mais severa, o que reduz a capacidade do modelo
de se ajustar perfeitamente aos dados de treino. Isso geralmente leva
a um aumento do erro no conjunto de treino, pois o modelo é forçado
a ser mais simples, com menos flexibilidade para ajustar-se aos detalhes
dos dados.
No conjunto de teste:
o A regularização tem como objetivo melhorar a generalização do
modelo, ajudando a evitar o sobreajuste. No entanto, se o parâmetro de
regularização for muito alto, o modelo pode se tornar muito simples (ou
subajustado), o que pode levar a um aumento do erro no conjunto de
teste, pois o modelo pode não ser capaz de capturar a relação real entre
as variáveis.
o Isso significa que, após certo ponto, ao aumentar a regularização, o erro
no conjunto de teste pode aumentar, embora inicialmente ele possa
diminuir.
Analisando as alternativas:
a) O erro no conjunto de treino nunca vai aumentar.
o Incorreta. O erro no conjunto de treino vai aumentar à medida que a
regularização aumenta, pois o modelo se torna menos flexível.
b) O erro no conjunto de treino nunca vai diminuir.
o Correta. Com o aumento da regularização, o modelo se ajusta menos
aos dados de treino, então o erro no treino tende a não diminuir.
c) O erro no conjunto de teste nunca vai aumentar.
o Incorreta. O erro no conjunto de teste pode aumentar se o modelo se
tornar muito simples devido à alta regularização.
d) O erro no conjunto de teste nunca vai diminuir.
o Incorreta. Inicialmente, o erro no conjunto de teste pode diminuir com
o aumento da regularização, à medida que o modelo generaliza melhor.
Porém, se a regularização for muito alta, o erro pode voltar a aumentar.
Resposta correta:
b) O erro no conjunto de treino nunca vai diminuir.
Pergunta 31 de 60.
Considere uma regressão linear de equação f(x) = ax + b. Quais valores de a e b você
espera encontrar rodando o algoritmo Gradient Descent, nesse modelo para os dados
tabelados?
Tempo res
176:0
X = 8,2,0,6
Y = 4,1,0,3
a) a=1, b=0
b) a=0, b=0.5
c) a=0.5, b=0
d) a=1, b=1
Para determinar os valores de aaa e bbb na regressão linear f(x)=ax+bf(x) = ax +
bf(x)=ax+b usando os dados fornecidos, precisamos entender a relação entre os dados
de entrada (X) e saída (Y).
Os dados fornecidos são:
X=[8,2,0,6]X = [8, 2, 0, 6]X=[8,2,0,6]
Y=[4,1,0,3]Y = [4, 1, 0, 3]Y=[4,1,0,3]
Podemos calcular a inclinação aaa e a interceptação bbb utilizando o método dos
mínimos quadrados, mas como estamos buscando apenas uma expectativa de resultados,
vamos considerar a relação entre os dados.
Observando os pares de dados:
Para X=0X = 0X=0, Y≈0Y \approx 0Y≈0
Para X=2X = 2X=2, Y=1Y = 1Y=1
Para X=6X = 6X=6, Y=3Y = 3Y=3
Para X=8X = 8X=8, Y=4Y = 4Y=4
Parece que existe uma relação linear simples. Se analisarmos os valores, parece que
para cada aumento de 2 em XXX, YYY aumenta aproximadamente 1. Assim, a relação
pode ser aproximada pela fórmula:
Y≈0.5XY \approx 0.5XY≈0.5X
Dessa forma, uma boa estimativa seria:
a≈0.5a \approx 0.5a≈0.5
b≈0b \approx 0b≈0
Portanto, a alternativa correta é:
c) a=0.5a = 0.5a=0.5, b=0b = 0b=0.
Questão 32
Sobre a técnica de regressão Lasso (least absolute shrinkage and selection
operator), é correto dizer que:
a) É usada para seleção de features, filtrando variáveis cujos coeficientes são
iguais a zero.
b) Segue o mesmo principio de técnicas baesianas como o Naive Bayes, na qual a
predição é baseada em multiplicação de probabilidades.
c) Por definição não pzssui solução exata e sempre é feita uma aproximação da
resposta.
d) Exige que os dados sigam distribuições gaussianas.
Marcar
A opção correta sobre a técnica de regressão Lasso (Least Absolute Shrinkage and
Selection Operator) é:
a) É usada para seleção de features, filtrando variáveis cujos coeficientes são iguais
a zero.
Explicação das alternativas:
a) Correto. A regressão Lasso impõe uma penalização na soma dos valores
absolutos dos coeficientes, o que pode levar a alguns coeficientes a se tornarem
exatamente zero, efetivamente selecionando um subconjunto de variáveis.
b) Incorreto. Lasso não se baseia em probabilidades como o Naive Bayes. É uma
técnica de regularização em modelos de regressão.
c) Incorreto. Lasso possui solução exata para alguns problemas; no entanto, a
solução pode ser mais complexa e dependente do parâmetro de regularização.
d) Incorreto. Lasso não exige que os dados sigam distribuições gaussianas. É
uma técnica robusta que pode ser aplicada a diferentes distribuições de dados.
Pergunta 33 de 60.
Sobre modelos de regressão, é correto afirmar:
a) Os modelos de Gradient Boosting sempre tem uma performace melhor do que modelos
lineares, porém possuem menos interpretabilidade.
b) Modelos lineares são limitados pois só permitem a relação linear das variáveis com a
resposta.
c) A maneira como se faz a codificação (encode) das variáveis categóricas não influencia o
resultado do modelo.
d) Alguns modelos lineares podem ser implementados com o algoritmo do gradiente
descendente estocástico (stochastic gradient descent), o que permite um controle adicional
de sobreajuste (overfiting).
Vamos analisar cada uma das afirmações sobre modelos de regressão:
a) Os modelos de Gradient Boosting sempre têm uma performance
melhor do que modelos lineares, porém possuem menos
interpretabilidade.
Incorreto. Embora os modelos de Gradient Boosting frequentemente tenham melhor
desempenho em muitos conjuntos de dados, não é garantido que isso ocorra em todos os
casos. Além disso, eles geralmente são menos interpretáveis do que modelos lineares.
b) Modelos lineares são limitados pois só permitem a relação linear das
variáveis com a resposta.
Correto. Modelos lineares assumem que a relação entre as variáveis independentes e a
variável dependente é linear, o que pode ser uma limitação em muitos casos onde a
relação é não-linear.
c) A maneira como se faz a codificação (encode) das variáveis categóricas
não influencia o resultado do modelo.
Incorreto. A forma como as variáveis categóricas são codificadas (por exemplo, one-
hot encoding, label encoding) pode ter um grande impacto no desempenho do modelo,
especialmente em modelos lineares e em árvores de decisão.
d) Alguns modelos lineares podem ser implementados com o algoritmo do
gradiente descendente estocástico (stochastic gradient descent), o que
permite um controle adicional de sobreajuste (overfitting).
Correto. Modelos lineares podem ser ajustados usando o gradiente descendente
estocástico, e essa abordagem pode ajudar a lidar com problemas de sobreajuste,
especialmente em conjuntos de dados grandes.
Conclusão
Portanto, as afirmativas corretas são b e d. Se precisar de mais detalhes ou tiver outras
perguntas, fique à vontade!
Pergunta 34 de 60.
Pretende-se usar um modelo de regressão linear Y = a+BX+E para ajustar n pares de
valores observados
Tempo restante
175:42
(X1, Y1), (X2, Y2)....(Xn, Yn). Supõe-se que os erros & tenham média 0, sejam
normalmente distribuidos, todos com mesma variancia, e sejam não correlacionados. Se a
e b são as estimativas de minimos quadrados de a e ẞ, respectivamente, avalie as
afirmativas a seguir:
1-O coeficiente de determinação, R2, mede a porcentagem da variancia total dos valores
y's que é explicada pela regressão e, desse modo, quanto maior o valor do coeficiente de
determinação, melhor é o ajuste do modelo. II-a e b são estimadores não viesados de a e
de ẞ, respectivamente.
III-As estimativas de minimos quadrados de a e ẞ são os valores de a e b que resolvem as
equações normais.
Questão 35
Considere o código abaixo em Python:
def F(a, b, c, d, e):
e=5
for k in range(1, e):
Se os valores na iteração fossem printar o k*c, e F(1,3,2,4,7) qual seria a saída do
algoritmo:
a) 1, 2, 3, 4, 5
b) 2, 4, 6, 8, 16
c) 1, 2, 3, 4
d) 2, 4, 6, 8
1. Definição da Função:
python
Copiar código
def F(a, b, c, d, e):
e = 5
for k in range(1, e):
print(k * c)
2. Parâmetros da Função:
o a = 1
o b = 3
o c = 2
o d = 4
o e =(mas essa variável é substituída por e = 5 dentro da função)
7
3. Laço For: O laço for k in range(1, e) com e sendo 5, significa que k irá
assumir os valores de 1 a 4 (o valor 5 não é incluído).
4. Cálculo e Impressão: Durante as iterações do laço:
o Para k = 1: imprime 1 * c → 1 * 2 = 2
o Para k = 2: imprime 2 * c → 2 * 2 = 4
o Para k = 3: imprime 3 * c → 3 * 2 = 6
o Para k = 4: imprime 4 * c → 4 * 2 = 8
Saída do Algoritmo
Portanto, a saída do algoritmo, quando executado, será:
Copiar código
2
4
6
8
A resposta correta é d) 2, 4, 6, 8.
Marcar para acompanhamento
Pergunta 36 de 60.
Você tem um problema com uma lógica "if" em seu código e precisa quebrá-la em
vários casos com condições diferentes para criar diferentes caminhos de
execução. Qual comando é recomendado para realizar
esta tarefa?
a) swap
b) switch
c) task
d) instance
Para quebrar uma lógica "if" em vários casos com condições diferentes, o comando
mais recomendado é:
b) switch
Explicação:
switch: Este comando permite que você teste uma variável contra uma lista de
valores possíveis, ou "casos". Ele é útil quando você tem várias condições para
verificar e pode ser mais claro e organizado do que uma longa sequência de
declarações "if...elif".
swap: Este termo geralmente se refere à troca de valores entre variáveis, e não é
uma estrutura de controle de fluxo.
task: Este termo se refere mais a uma unidade de trabalho ou execução e não é
uma estrutura de controle.
instance: Este termo é usado em programação orientada a objetos para se referir
a um objeto criado a partir de uma classe, não é um comando para controle de
fluxo.
Pergunta 37 de 60.
Observe a função Python abaixo:
def minhafuncao(n1, n2):
while n1 != n2:
if (n1 < n2):
n2 = n2-n1
else:
n1 = n1-n2
return n1
Qual seria a chamada dessa função para n1 = 50 e n2 =5:
a) 0
b) 1
c) 5
d) 10
A função minhafuncao que você forneceu é uma implementação do algoritmo de
Euclides para encontrar o máximo divisor comum (MDC) de dois números.
Para chamar essa função com n1=50n1 = 50n1=50 e n2=5n2 = 5n2=5, você deve
escrever:
python
Copiar código
resultado = minhafuncao(50, 5)
Após a execução dessa chamada, a variável resultado conterá o valor do MDC de 50 e
5, que é 5. Se precisar de mais ajuda, é só avisar!
Pergunta 38 de 60.
Qual o resultado da saída do código Python abaixo?
def processar(n):
if n < 0:
print("NDA")
elif n == 1:
return "true"
elif n == 2:
else:
return "false"
return processar(n - 1) + processar(n-2)
A partir desses dados, é correto afirmar que a saída exibida em tela pelo código
Python quando executado para n=3 é:
a) True
b) Falsetrue
c) False
d) "nda"
O código Python fornecido tem algumas partes faltando e uma estrutura que precisa ser
corrigida para funcionar corretamente. Vamos analisar o código passo a passo para
entender o que ele deveria fazer, assumindo que as partes faltantes estejam
implementadas corretamente.
Código Analisado:
python
Copiar código
def processar(n):
if n < 0:
print("NDA")
elif n == 1:
return "true"
elif n == 2:
return "false"
else:
return processar(n - 1) + processar(n - 2)
Analisando a função:
1. Caso n < 0: imprime "NDA".
2. Caso n == 1: retorna a string "true".
3. Caso n == 2: deveria retornar "false" (o return estava ausente).
4. Caso n > 2: faz uma chamada recursiva a processar(n - 1) e processar(n -
2) e retorna a concatenação dos resultados.
Chamada da função:
Vamos agora executar a função com n=3n = 3n=3:
python
Copiar código
processar(3)
Passo a passo da execução:
Chamada inicial: processar(3)
o Não é menor que 0, não é igual a 1 e não é igual a 2.
o Chama processar(2) e processar(1).
Chamada de processar(2):
o Não é menor que 0, não é igual a 1, mas é igual a 2.
o Retorna "false".
Chamada de processar(1):
o Não é menor que 0, não é igual a 1.
o Retorna "true".
Resultado da chamada processar(3):
o Retorna a concatenação de processar(2) e processar(1):
o Retorno = "false" + "true" = "falsetrue".
Resumo:
Portanto, a saída da função processar(3) seria a string "falsetrue".
Resposta final:
A saída exibida em tela pelo código Python quando executado para n=3n = 3n=3 seria:
"falsetrue".
Pergunta 39 de 60.
Suponha que temos uma matriz chamada "mat", preenchida de zeros, com N
linhas e N colunas. O que o código a seguir faz?
for i in range(N):
for j in range(i): mat[][] = 1
a) Preenche a metade inferior da esquerda com 1's.
b) Preenche a metade superior direita da matriz com 1's.
c) Preenche as diagonais com 1's, formando um X.
d) Constrói uma matriz identidade.
Vamos analisar o código fornecido:
python
Copiar código
for i in range(N):
for j in range(i):
mat[i][j] = 1
Análise do Código
1. Estrutura do Loop:
o O primeiro loop (for i in range(N)) itera sobre cada linha da matriz.
o O segundo loop (for j in range(i)) itera de 0 até i−1i-1i−1. Isso
significa que, para cada iii, ele preenche elementos da linha iii nas
colunas de 0 até i−1i-1i−1.
2. Preenchimento da Matriz:
o Quando i=0i = 0i=0: O loop interno não executa, pois range(0) é vazio.
o Quando i=1i = 1i=1: O loop interno preenche mat[1][0] com 1.
o Quando i=2i = 2i=2: O loop interno preenche mat[2][0] e mat[2][1]
com 1.
o Quando i=3i = 3i=3: O loop interno preenche mat[3][0], mat[3][1] e
mat[3][2] com 1.
o E assim por diante.
Resultado Final
O código preenche a matriz da seguinte forma:
A linha 1 (índice 1) tem o primeiro elemento como 1.
A linha 2 (índice 2) tem os dois primeiros elementos como 1.
A linha 3 (índice 3) tem os três primeiros elementos como 1.
Portanto, a matriz resultante tem 1's preenchendo a metade inferior esquerda.
Conclusão
A resposta correta é:
a) Preenche a metade inferior da esquerda com 1's.
Pergunta 40 de 60.
Considere o código abaixo em Python:
import numpy as np
x1 = [Link]([[100,22,31].[14,15,60] [6,8,9]])
x2 = [Link]([[100,2,31],[14,1,60],[718,8,9]])
x2= [Link]([[1,2,31].[14,5,6],[7,8,9]])
x2= [Link]([[1,222,331][14,125,66] [66,8,9]])
Se temos a condição que x1 é restrito sob x2 >= 100 O array obtido será:
Nenhuma das alternativas
Questão 41
Com relação a list comprehension em Python, podemos afirmar:
I. É mais eficiente em tempo e espaço do que loops
II. Requer menos linhas de código
III. Transforma comandos iterativos em fórmula.
a) I, II e III
b) ll e Ill
c) l e ll
d) Somente III
Vamos analisar cada uma das afirmações sobre list comprehension em Python:
I. É mais eficiente em tempo e espaço do que loops
Correto. List comprehensions geralmente são mais eficientes em termos de tempo e
espaço do que loops for tradicionais, especialmente para a criação de listas. Elas
evitam o overhead de chamadas de função em loops.
II. Requer menos linhas de código
Correto. List comprehensions permitem que você escreva operações em uma única
linha, reduzindo o número de linhas de código em comparação com loops tradicionais.
III. Transforma comandos iterativos em fórmula
Correto. List comprehensions permitem que você transforme operações iterativas
(como loops) em uma sintaxe mais concisa que se assemelha a uma expressão
matemática.
Conclusão
Todas as afirmações I, II e III são verdadeiras.
Pergunta 42 de 60.
Dado o algoritmo
Para i = 1, 2,3,4,5,6,7,8,9,10, faça:
Para j =
1,2,3,4,5,6,7,8,9,10,11,12,13,14,15,16,17,18,19,20,21,22,23,24,25,26,27,28,29,30
faça:
B
informe quantas vezes serão executadas a função descrita após os laços de
repetições:
Para i = 1, 2,3,4,5,6,7,8,9,10, faça:
Para j = 1,
2,3,4,5,6,7,8,9,10,11,12,13,14,15,16,17,18,19,20,21,22,23,24,25,26,27,28,29,30
faça: B
a) 300
b) 290
c) 270
d)30
a) 300
Pergunta 43 de 60.
É correto afirmar sobre a separação das observações de modelagem entre
amostras usadas para treino, amostras usadas para teste e amostras para
validação:
a) É uma técnica bastante utilizada que impede underfitting.
b) É uma técnica muito utilizada para aumentar performance do modelo em
situações gerais.
c) Serve para avaliar capacidade de generalização de performance do modelo,
apenas em datasets não afetados por desbalanceamento
d) Serve para avaliar a capacidade de generalização de performance do modelo
em dados ainda não vistos.
Vamos analisar cada uma das afirmações sobre a separação das observações em
conjuntos de treino, teste e validação:
a) É uma técnica bastante utilizada que impede underfitting.
Incorreto. A separação em conjuntos de treino, teste e validação é mais relacionada ao
controle do overfitting do que do underfitting. Underfitting geralmente ocorre quando o
modelo é muito simples.
b) É uma técnica muito utilizada para aumentar performance do modelo
em situações gerais.
Parcialmente correto. A separação em conjuntos ajuda a avaliar e ajustar o modelo,
mas não necessariamente "aumenta" a performance diretamente. O objetivo principal é
garantir que o modelo generalize bem.
c) Serve para avaliar a capacidade de generalização de performance do
modelo, apenas em datasets não afetados por desbalanceamento.
Incorreto. A separação serve para avaliar a generalização independentemente do
desbalanceamento. O desbalanceamento pode afetar a performance, mas a técnica em si
é válida em qualquer situação.
d) Serve para avaliar a capacidade de generalização de performance do
modelo em dados ainda não vistos.
Correto. A separação dos dados é fundamental para avaliar como o modelo se
comporta em dados que não foram utilizados durante o treinamento, ajudando a
entender sua capacidade de generalização.
Conclusão
A resposta correta é:
d) Serve para avaliar a capacidade de generalização de performance do modelo em
dados ainda não vistos.
Pergunta 44 de 60.
Sobre a equação abaixo, qual afirmação é verdadeira?
J(A) = -> [log(h,(x1), y2 + (1 − h (x2)}. {1 − y*}}]
i=1
a) Função custo da regressão logística.
b) Log da verossimilhança, usada como custo de Naive Bayes.
c) Função de custo da árvore de decisão.
O d) Computação de Elastic Net.
a)
Pergunta 45 de 60.
Suponha que você tenha rodado um SVM, usando o pacote Sklearn, com
coeficiente de regularização C, e kernel polinomial com grau gamma. Obtivemos
uma fronteira conforme a linha azul.
chute
Pergunta 45 de 60.
Tempo restante 173:26
Suponha que você tenha rodado um SVM, usando o pacote Sklearn, com
coeficiente de regularização C, e kernel polinomial com grau gamma. Obtivemos
uma fronteira de decisão, com base nos dados de tremo conforme a linha azul.
09
07
ast
02
a) É razoável aumentar C e/ou diminuir gamma b) É razoável aumentar C e/ou
aumentar gamma O c) É razoável diminuir C e/ou diminuir gamma O d) É razoável
diminuir C e/ou aumentar gamma
Marcar para acompanhamento
Pergunta 46 de 60.
Para avaliar a performance preditiva de um classificador para uma amostra de
dados ainda não utilizada quais podem ser as très estratégias que podemos
utilizar?
a) Divisão de dados em conjunto de treino e conjunto de teste, validação
cruzada k-fold e validação leave-one-out.
b) Erro nadrão divisão de dados em coniunto de treino e [Link] teste
[Link]ão de testes.
c) conjunto de dados permanentes, conjunto de teste e reexecução de testes
d) troca de valores mais frequentes, validação cruzada e conjunto de teste e
treino
A)
Pergunta 47 de 60.
Função de custo em Machine Learning serve para mensurar o erro entre o valor predito
pelo modelo e o valor esperado. Neste sentido, é CORRETO afirmar:
I. Mean Squared Error (MSE), Mean Absolute Error (MAE) e Root Mean Squared Error
(RMSE) costumam ser funções de custo de algoritmos de regressão.
II. Cross-Entropy costuma ser uma função de custo de algoritmos de classificação.
III. Silhouette e Dunn Index costumam ser funções de custo de algoritmos de
agrupamento.
a) l e ll.
b) Apenas II.
c) Apenas I.
d) Apenas III.
a) I e 2
Pergunta 48 de 60.
Em Machine Learning, técnicas de embedding são muito usadas para reduzir a
dimensionalidade de dados de entrada. Dentre as técnicas a seguir, qual delas não
é usada para gerar embeddings?
A)Redes Neurais
b) T-SNE
c) Word2vec
d) Regressão Linear
e) Regressão linear
Pergunta 49 de 60.
Avalie quais das afirmações abaixo são verdadeiras:
I. Usar um conjunto de treino muito grande faz com que seja improvável que haja
overfitting do modelo aos dados de treino.
II. Ao usar um classificador logístico, devemos usar 0.5 como limiar para prever se
um exemplo positivo ou negativo.
III. Se o modelo apresenta underfitting nos dados de treino, então é provável que
obter mais dados ajude.
a) Apenas II é verdadeira
b) le ll são verdadeiras
c) Apenas I é verdadeira
d) I e III são verdadeiras
Pergunta 50 de 60.
Considere quão adequada foi a métrica escolhida para a situação abaixo, em que
realizamos um processo para otimizar os hiperparâmetros, features escolhidas e seus
tratamentos considerando ess 173:00 especifica:
Considerando a construção de uma política de aquisição de novos clientes Pessoa Física
para o banco, em que as pessoas com maior renda serão priorizadas por trazerem maior
rentabilidade estimada, a correlação de Spearman foi utilizada.
a) A métrica utilizada foi adequada dado que o mais importante é o modelo ordenar os
clientes com maior renda até a menor renda e não necessariamente conseguir acertar
exatamente qual a renda de cada cliente.
b) A métrica utilizada foi adequada dado que o mais importante é o modelo
mensurar a correlação linear entre o valor estimado de renda e os valores
de rendas observadas, não necessariamente conseguir acertar exatamente
qual a renda de cada cliente.
c) A métrica não é adequada, pois não mensura qual o erro cometido pelo
modelo entre valor estimado e valor real, como MSE ou MAE.
d) A métrica não é adequada, pois não mensura o erro cometido pelo
modelo entre valor estimado e real, assim como não é robusta aos outliers
que são esperados ao lidar com renda.
c)
Alternativa a)
Marcar para acompanhamento
Pergunta 51 de 60.
Em relação ao algoritmo para construir árvores de decisão, podemos
AFIRMAR que:
a) A única otimização possível é a maximização do information gain em cada
nodo;
b) O único critério de parada do algoritmo é quando encontrar o primeiro no
puro (pure child node);
c) Para um espaço de features estabelecido, uma árvore de decisão produz
decision boundaries que podem ser curvas.
d) Um parent-node pode ser dividido em N child-nodes, sendo N >= 2;
Marcar para acompanhamento
d) Um parent-node pode ser dividido em N child-nodes, sendo N >= 2.
Verdadeiro: Um nodo pai pode ser dividido em dois ou mais filhos (N ≥ 2),
dependendo da estrutura da árvore e das decisões tomadas em cada divisão.
Com base na análise, a única afirmação verdadeira é:
d) Um parent-node pode ser dividido em N child-nodes, sendo N >= 2.
Pergunta 52 de 60.
Sobre o modelo Naïve Bayes, podemos afirmar:
I - É um modelo mais rápido e escalável do que alguns outros modelos de
classificação, por ter fórmula fechada com tempo linear de execução.
II - Só pode ser usado para classificação binária.
III-A condição "ingenua"" a que o modelo se refere é o que permite a aplicação
do teorema de Bayes sobre a probabilidade condicional P(Classe) x), onde x
são as variáveis (features).
a) I, Il e III
b) Apenas III
c) Apenas I
d) l e lll
d) Correta d 1 e 3
Marcar para acompanhamento
Pergunta 53 de 60.
Algoritmos baseado em árvores de decisão conseguem dividir o espaço de caracteristicas
com cortes:
a) Perpendiculares e Diagonais aos eixos.
b) Perpendiculares aos eixos.
c) Seguindo o Diagrama de Voronoi.
d) A depender se a função utilizada para quebra é "information gain" ou "entropia".
Marcar para acompanhamento
Pergunta 54 de 60.
Assinale a alternativa correta:
1-O algoritmo Naive-Bayes não funciona para atributos continuos por não ser possível
calcular a tabela de frequência e, consequentemente, as probabilidades condicionais
Il-Por não necessitar de uma etapa sofisticada de treinamento, o algoritmo K-Nearest
Neighbors (KNN) é aconselhado para quando se tem uma grande quantidade de amostras
dos dados.
III- Sendo a regressão logística um modelo linear, não é possível capturar relações não-
lineares entre uma variável independente e a resposta (variável dependente). Sobre as
afirmações acima:
O Nenhuma está correta.
Sobre regressão logística, podemos afirmar:
1- Sua saida (output) é uma probabilidade, vinda da função sigmoide.
Il-Sua função de custo é a Cross-Entropy, também chamada de Log Loss.
III- Pode ser usada para problemas de multiclasse.
a) I, II e III
b)l e ll
C) ll e III
d) l e lll
Pergunta 56 de 60.
Assinale as alternativas como verdadeiras (V) ou falsas (F). Em seguida, escolha a
opção correta:
() O algoritmo Vizinhos mais Próximos (KNN) se assemelha ao K-means pelo falo
que ambos são algoritmos de clusterização tratando problemas supervisionados.
() K-means é um algoritmo de aprendizado não supervisionado, enquanto o
Vizinhos mais Próximos (KNN) é um algoritmo de aprendizado supervisionado.
() O algoritmo Vizinhos mais Próximos (KNN) tenta classificar o conjunto de dados
em k diferentes classes, observando seus k-vizinhos mais próximos.
( ) K-means e KNN são algoritmos de agrupamento e classificação,
respectivamente, que usam a distância de Manhattan e não distância euclidiana
para calcular a distância entre as features Ov-v-V-F.
OF-V-V-F.
OF-V-V-V.
OF-V-F-F.
Pergunta 58 de 60.
Selecione a afirmação incorreta sobre SVM (Support Vector Machines).
O Predições são feitas com base no sinal e distância de um hiperplano de decisão.
O É baseado na somatória de diversos modelos mais simples que, combinados, se
ajustam aos dados.
O É efetivo quando o número de variáveis (features) é relativamente grande em
relação ao tamanho da amostra.
O Utiliza hinge loss (perda de articulação) como função de erro.
Marcar para acompanhamento
Pergunta 59 de 60.
Por que o Naive Bayes é considerado "naive" (ingênuo)?
Porque sua performance geralmente é baixa.
Porque ele assume que todas as variáveis (features) são estatisticamente
independentes.
Porque ele assume que todas as variáveis (features) seguem uma distribuição
normal.
O Porque ele assume que a variável resposta é uma combinação linear das
variáveis explicativas.
Marcar para acompanhamento
Pergunta 60 de 60.
Sobre o método de Gradient Boosting para classificação, é correto afirmar:
Só pode ser usado para classificações binárias.
A redução da taxa de aprendizado (learning rate) ajuda a prevenir o sobreajuste
(overfitting).
OA função de perda (loss function) mais usada é o GINI.
Oo algoritmo cria vários aprendizes fracos (weak learners) e toma o voto
majoritário para fazer a classificação.
Marcar para acompanhamento
Q Pesquisar
Pergunta 58 de 60.
Selecione a afirmação incorreta sobre SVM (Support Vector Machines).
a) Predições são feitas com base no sinal e distância de um hiperplano de decisão.
B) É baseado na somatória de diversos modelos mais simples que, combinados,
se ajustam aos dados.
c) É efetivo quando o número de variáveis (features) é relativamente grande em
relação ao tamanho da amostra.
d) Utiliza hinge loss (perda de articulação) como função de erro.
Marcar para acompanhamento
Pergunta 59 de 60.
Por que o Naive Bayes é considerado "naive" (ingênuo)?
Porque sua performance geralmente é baixa.
Porque ele assume que todas as variáveis (features) são estatisticamente
independentes.
Porque ele assume que todas as variáveis (features) seguem uma distribuição
normal.
O Porque ele assume que a variável resposta é uma combinação linear das
variáveis explicativas.
Marcar para acompanhamento
Pergunta 60 de 60.
Sobre o método de Gradient Boosting para classificação, é correto afirmar:
Só pode ser usado para classificações binárias.
A redução da taxa de aprendizado (learning rate) ajuda a prevenir o sobreajuste
(overfitting).
OA função de perda (loss function) mais usada é o GINI.
Oo algoritmo cria vários aprendizes fracos (weak learners) e toma o voto
majoritário para fazer a classificação.
e) 54
Assinale a alternativa correta:
1-O algoritmo Naive-Bayes não funciona para atributos continuos por não ser possível
calcular a tabela de frequência e, consequentemente, as probabilidades condicionais. Il-
Por não necessitar de uma etapa sofisticada de treinamento, o algoritmo K-Nearest
Neighbors (KNN) é aconselhado para quando se tem uma grande quantidade de amostras
dos dados. III- Sendo a regressão logística um modelo linear, não é possível capturar
relações não-lineares entre uma variável independente e a resposta (variável dependente).
Sobre as afirmações acima:
a) Nenhuma está correta.
b) I e ll estão corretas.
c) I e III estão corretas.
d) ll e III estão corretas.
A resposta correta é:
d) II e III estão corretas.
Justificativas:
1. Afirmação I: Incorreta. O algoritmo Naive-Bayes pode sim ser utilizado para
atributos contínuos. Isso é feito por meio de suposições sobre a distribuição dos
dados (por exemplo, a suposição de uma distribuição normal), permitindo o
cálculo de probabilidades condicionais usando a densidade de probabilidade.
2. Afirmação II: Correta. O algoritmo K-Nearest Neighbors (KNN) não requer
uma etapa sofisticada de treinamento, pois é um método de aprendizado baseado
em instâncias. No entanto, o KNN tende a ser computacionalmente caro na etapa
de classificação (predição), especialmente com grandes volumes de dados.
3. Afirmação III: Correta. A regressão logística é um modelo linear e, por isso,
não captura relações não-lineares de forma direta. Para capturar relações não-
lineares, seria necessário usar variáveis transformadas ou outros modelos mais
complexos.
Por isso, a opção correta é d) II e III estão corretas.
Pergunta 55 de 60.
Sobre regressão logística, podemos afirmar:
1- Sua saída (output) é uma probabilidade, vinda da função sigmoide.
Il-Sua função de custo é a Cross-Entropy, também chamada de Log Loss.
III- Pode ser usada para problemas de multiclasse.
OI, II e III
Olell
Ile III
I e III