0% acharam este documento útil (0 voto)
4 visualizações26 páginas

Treinamento GCP: Fundamentos do Big Data

O documento apresenta um treinamento sobre Big Data utilizando o Google Cloud Platform (GCP), abordando conceitos como Data Lakes, ingestão, armazenamento e processamento de dados. Destaca as principais características do GCP, suas ferramentas de desenvolvimento e serviços de análise, além de práticas recomendadas e desafios na implementação. O objetivo é capacitar os participantes a construir soluções de dados eficientes na nuvem.
Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PPTX, PDF, TXT ou leia on-line no Scribd
0% acharam este documento útil (0 voto)
4 visualizações26 páginas

Treinamento GCP: Fundamentos do Big Data

O documento apresenta um treinamento sobre Big Data utilizando o Google Cloud Platform (GCP), abordando conceitos como Data Lakes, ingestão, armazenamento e processamento de dados. Destaca as principais características do GCP, suas ferramentas de desenvolvimento e serviços de análise, além de práticas recomendadas e desafios na implementação. O objetivo é capacitar os participantes a construir soluções de dados eficientes na nuvem.
Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PPTX, PDF, TXT ou leia on-line no Scribd

[Link].

group

Instruções

→ Instale as fontes Source Code Pro e → Aproveite as cores


Source Sans Pro nos detalhes, veja
sugestões de uso nos
→ Assets da marca próximos slides

Próximos slides contém exemplos de uso. Podem ser removidos se


necessário.

Não modifique este template, caso tenha alguma sugestão de melhoria,


envie ao time de marketing (Juliano Araujo ou Paola Charão)
Treinamento
GCP Big Data
Objetivo: Capacitar os participantes a compreender os fundamentos do Big Data e
como utilizar os serviços do Google Cloud Platform (GCP) para construir soluções de
dados eficientes.
Google Cloud Platform
(GCP)
1. Introdução ao Google Cloud Platform;
2. Fundamentos do Data Lake;
3. Ingestão de dados;
4. Armazenamento de dados;
5. Processamento de dados;
6. Introdução ao Google Cloud Platform;
7. Google BigQuery;
8. Google Cloud Functions;
9. Práticas recomendadas e casos de uso;
[Link] prática.
[Link]

Google Cloud Platform


Infraestrutura Global Escalável
O Google Cloud Platform oferece uma infraestrutura global escalável e
altamente confiável para executar aplicativos e serviços em nuvem.

Ferramentas de Desenvolvimento
O Google Cloud Platform oferece uma ampla variedade de ferramentas
de desenvolvimento para criar e gerenciar aplicativos em nuvem.

Serviços de Armazenamento
O Google Cloud Platform oferece serviços de armazenamento em
nuvem altamente escaláveis e acessíveis para armazenar e gerenciar
dados.

Serviços de Análise e Inteligência Artificial


O Google Cloud Platform oferece uma ampla variedade de serviços de
análise e inteligência artificial para processar e extrair insights de
grandes conjuntos de dados.
[Link]

Principais características
do GCP​
Escalabilidade sob Demanda
O GCP permite que os usuários aumentem ou diminuam a capacidade
de computação sob demanda, possibilitando escalabilidade eficiente e
econômica.

Segurança de Nível Empresarial


O GCP oferece uma ampla gama de recursos de segurança, incluindo
criptografia de dados, autenticação de usuários e ferramentas de
segurança de rede para garantir a proteção de dados.

Armazenamento de Dados Durável e Consistente


O GCP oferece armazenamento de dados altamente durável e
consistente com várias opções de armazenamento, incluindo
armazenamento de arquivos, armazenamento de objetos e bancos de
dados.

Ferramentas de Análise de Dados e Aprendizado de Máquina


O GCP oferece ferramentas avançadas de análise de dados e
aprendizado de máquina para ajudar a extrair insights significativos
dos dados.
[Link]

Fundamentos do Data Lake.


O que é um Data Lake?
Imagine um lago gigante de dados. Essa é a ideia por trás da Arquitetura
de um Data Lake: um repositório centralizado que armazena todos os
tipos de dados de uma organização, independentemente de sua estrutura,
volume ou origem (redes sociais, bancos de dados, sensores, e muitos
outros).

Repositório de dados​

Um Data Lake é um repositório de dados que permite armazenar grandes


volumes de dados em sua forma bruta, sem a necessidade de
transformá-los em um formato estruturado.​

Processamento de grandes volumes de dados​

A arquitetura de um Data Lake é composta por camadas Ingestão,


armazenamento, processamento e análise, permitindo o processamento
e análise de grandes volumes de dados em sua forma bruta.​
[Link]

Arquitetura do Data Lake


A arquitetura de Data Lake refere-se aos processos e ferramentas
usados para armazenar, transformar, acessar e proteger os
dados em um Data Lake . Embora essa arquitetura possa estar
localizada em nuvem ou no local, ela geralmente compartilha Processamento Distribuído: Utiliza processamento distribuído para lidar
vários dos seguintes componentes: com grandes volumes de dados, permitindo o processamento paralelo e
eficiente.

Camada de Armazenamento: Metadados e Governança: A arquitetura inclui o gerenciamento


O Data Lake geralmente possui camadas de armazenamento, como dados de metadados e governança, assegurando rastreabilidade,
brutos (raw data), dados curados (curated data) e dados confiáveis (trusted
segurança e conformidade dos dados.
data), garantindo a qualidade e segurança das informações.
[Link]

Fundamentos do Data Lake.


Conceitos de Data Lake​

Data Lake vs. Data Warehouse​


O Data Lake é uma alternativa ao Data Warehouse que
armazena dados brutos em sua forma nativa, em vez
de transformá-los em um formato estruturado antes
do armazenamento, proporcionando uma maior
flexibilidade na análise dos dados.​
Armazenamento de dados brutos​
Os dados brutos são armazenados em sua forma
nativa no Data Lake, o que permite uma maior
flexibilidade na análise dos dados, pois é possível Imagem
Fonte: [Link]
transformar e estruturar os dados de acordo com as [Link]
necessidades do usuário.​
[Link]

Fundamentos do Data Lake.


Importâncias do Data Lake

Armazenamento de dados escalável.

O Data Lake permite armazenar grandes volumes de dados de


forma escalável, facilitando o processamento e a análise posterior.

Integração de dados variados.

Permite a integração de dados de diferentes fontes e formatos,


possibilitando. A visão unificada e mais completa das informações.

Suporte a diferentes tipos de dados.

Capacidade de armazenar dados estruturados, semiestruturados e imagem


Fonte: [Link]
não estruturados, atendendo a diversas necessidades de [Link]

armazenamento e análise.
[Link]

Fundamentos do Data Lake.


Desafios de Melhores Práticas

Os principais desafios em relação às melhores práticas para


Data Lake envolvem a implementação rigorosa de medidas
de segurança e privacidade para proteger dados sensíveis, a Segurança e Privacidade:
gestão eficaz de dados não estruturados, que exige É crucial implementar medidas robustas para proteger dados sensíveis
armazenados no Data Lake.
métodos específicos para facilitar sua organização e
análise, e a definição de políticas robustas de governança e
conformidade para assegurar a qualidade e a confiabilidade
dos dados armazenados. Adotar essas práticas é
fundamental para manter a integridade e a segurança das
informações no Data Lake.

Gestão de Dados Não Governança e Conformidade:


Estruturados: Estabelecer políticas de
Requer abordagem específica governança e conformidade é
para organização e classificação, essencial para assegurar a
facilitando análise e extração de qualidade e confiabilidade dos
valor. dados.
[Link]

Ingestão de Dados
O Data Lake precisa de um fluxo constante de dados. A GCP oferece um conjunto poderoso de
ferramentas para capturar, integrar e processar dados de qualquer fonte, formato ou volume,
preparando-os para análise.

Soluções da GCP para Ingestão Simplificada:

Assim como um chef coleta ingredientes frescos para preparar um banquete, a ingestão de dados é o processo de coletar
dados de diversas fontes para alimentar nosso Data Lake. Essas fontes podem ser bancos de dados, sensores, redes
sociais, aplicações, entre outras. o Ferramentas como Apache Kafka, Google Cloud Pub/Sub e AWS Kinesis atuam como
dutos eficientes, transportando os dados em tempo real (streaming) ou em lotes (batch) para o Data Lake. O desafio está
em garantir a velocidade, qualidade e segurança dos dados durante a ingestão, evitando gargalos e dados corrompidos.
[Link]

Ingestão de Dados

Desafios e Melhores Práticas: Navegando com Segurança

A jornada no mundo do Big Data apresenta desafios, e a segurança é


crucial. Proteger os dados contra acessos não autorizados e garantir a
privacidade são prioridades. Implementar medidas de segurança robustas,
como criptografia de dados, controle de acesso granular (IAM) e políticas de
governança, é fundamental para proteger informações confidenciais.
Gerenciar dados não estruturados, como posts de mídia social, exige
ferramentas e técnicas específicas para organização e classificação,
tornando-os úteis para análise. A conformidade com leis de proteção de
dados, como a LGPD/GDPR, é imprescindível. Devemos garantir o uso
responsável e ético dos dados em todas as etapas do processo.
[Link]

Armazenamento de Dados:
O Google Cloud oferece diversas opções de armazenamento de dados para atender a diferentes necessidades de negócios. As principais soluções

incluem o Cloud Storage, ideal para armazenar objetos não estruturados como arquivos e backups; o BigQuery, um data warehouse altamente

escalável e rápido, ideal para análises de grandes volumes de dados; e o Cloud Spanner, um banco de dados relacional que oferece alta

disponibilidade e consistência global. Além disso, o Cloud SQL e o Cloud Firestore são opções para gerenciar dados relacionais e dados em tempo

real, respectivamente. Cada uma dessas soluções oferece recursos de segurança robustos, como criptografia e controle de acesso, além de

integrações com outras ferramentas do Google Cloud para facilitar a ingestão, processamento e análise de dados.

Imagem
Fonte: Fonte: [Link]
resize=1024%2C548&ssl=1
[Link]

Armazenamento de Dados:
Opções de armazenamento de dados: Considerações de Segurança
Existem diferentes opções de armazenamento de dados,
como armazenamento em nuvem, bancos de dados e Conformidade
NoSQL e SQL, e data Warehouse.

Segurança de Dados​

Modelagem de Dados: O Cloud Storage oferece segurança de nível empresarial para


A modelagem de dados é essencial para o seus dados, com gerenciamento de chaves de criptografia e
armazenamento eficiente e a recuperação de
dados, incluindo o uso de esquemas, índices e segurança de rede integrados.​
particionamento.
Resistência a falhas​

Considerações de segurança e conformidade: O armazenamento de objetos é altamente durável e resistente


Ao armazenar dados, é crucial considerar a segurança a falhas, com vários pontos de redundância e armazenamento
dos dados, a conformidade com regulamentos e a em diversas localidades.
privacidade dos dados dos usuários.
[Link]

Processamento de Dados
Com os dados organizados, é hora de "cozinhar" insights valiosos! O
processamento de dados transforma dados brutos em informação útil.
Duas abordagens principais:

Processamento em Lote (Batch Processing): Ideal para processar


grandes volumes de dados em momentos específicos, como
Ferramentas como Apache Spark,
durante a noite.
Google Dataflow e AWS EMR
atuam como "panelas mágicas" que
processam os dados com eficiência
e rapidez.

Processamento em Tempo Real (Stream Processing): Permite


analisar dados em movimento, com baixa latência, ideal para
detecção de fraudes e análise de comportamento do usuário.
[Link]

Google Cloud Platform


- A Cozinha do Big Data
Computação: Crie e Armazenamento:
gerencie máquinas Armazene seus dados
O Google Cloud Platform é como uma cozinha virtuais, execute com segurança,
moderna e completa, repleta de ferramentas e contêineres com escalabilidade e
serviços para preparar o banquete de dados da sua Kubernetes e muito diferentes opções de
empresa. mais. custo.

Escalabilidade, segurança, inovação e custo-benefício


são os temperos especiais desta plataforma.
Dentre os serviços, destacamos:

Big Data: Ferramentas Machine Learning:


poderosas como Crie modelos
BigQuery, Dataflow e preditivos e utilize
Dataproc para inteligência artificial
processar e analisar para extrair insights
dados em larga escala. ocultos.
[Link]

Linha do Tempo da Evolução do Google Cloud Platform


Um Olhar Histórico Sobre a Plataforma de Nuvem do Google

A Google Cloud Platform (GCP) evoluiu significativamente desde o seu lançamento, oferecendo uma vasta gama de serviços que
ajudam empresas em todo o mundo a inovar e escalar suas operações. Esta linha do tempo destaca os principais marcos na evolução
da plataforma de nuvem do Google.

Ano Evento Principais


2008 Lançamento do Google App Engine, permitindo aos desenvolvedores hospedarem aplicativos na infraestrutura do Google.
Google Storage for Developers é lançado, oferecendo uma solução de armazenamento na nuvem para desenvolvedores.
2010
Google BigQuery, um serviço de análise de dados em grande escala.
2012 Google Cloud Platform é oficialmente apresentado como uma plataforma abrangente de serviços de nuvem.
2013 Introdução do Google Compute Engine, oferecendo máquinas virtuais escaláveis sob demanda.
2014 Lançamento do Google Kubernetes Engine (GKE), facilitando a gestão e a orquestração de contêineres.
2015 Lançamento do Google Cloud Bigtable, um banco de dados NoSQL rápido e altamente escalável.
2016 Google Cloud Functions é lançado, permitindo a execução de código em resposta a eventos, sem necessidade de gerenciar servidores.
2017 Anúncio do Google Cloud Spanner, um banco de dados relacional globalmente distribuído.
2018 Introdução do Google Cloud AutoML, facilitando a criação de modelos de aprendizado de máquina personalizados.
2019 Google Anthos é lançado, permitindo a gestão de aplicações em ambientes híbridos e multi-nuvem.
2020 Google Cloud AI Platform é introduzido, oferecendo um conjunto completo de ferramentas para desenvolvimento e implantação de modelos de IA.
2021 Lançamento do Google Cloud Workflows, facilitando a criação, execução e gestão de fluxos de trabalho complexos.
2022 Google Cloud Platform continua a expandir suas ofertas com novas soluções de segurança e gestão de dados.
Google Cloud Workstations Ambientes de desenvolvimento pré-configurados, seguros e gerenciados na nuvem. As Google Cloud Workstations aumentam a produtividade de
2023
desenvolvedores e cientistas de dados.
2024 Generative Language API Construindo aplicações com IA generativa.
[Link]

Google BigQuery​
Data Warehouse Totalmente Gerenciado​
O Google BigQuery é um data warehouse
totalmente gerenciado, que permite consultas
SQL super-rápidas, sem a necessidade de
gerenciar a infraestrutura subjacente.​
Dimensionamento Automático​
O Google BigQuery suporta dimensionamento
automático, o que significa que ele pode se
adaptar automaticamente ao fluxo de dados
para fornecer desempenho consistente e
escalabilidade sob demanda.​
Segurança Integrada​
O Google BigQuery possui recursos de
segurança integrados, incluindo autenticação de
vários fatores, controles de acesso refinados e
criptografia de dados em repouso e em trânsito.​
[Link]

Google Big Query:


O Chef de Cozinha.
No coração da cozinha do GCP, encontramos o
BigQuery, um data Warehouse serverless,
altamente escalável e veloz. Ele processa
terabytes de dados em segundos!
Com o BigQuery, você pode:
Sua arquitetura "colmeia" permite armazenar e
consultar dados com alta performance e baixo  Escrever consultas SQL padrão para analisar dados.
custo.  Integrar com diversas ferramentas de visualização.
 Utilizar Machine Learning para previsões e análises avançadas.
[Link]

Mão na Massa:

 Vamos criar um dataset no BigQuery.


 Carregar dados de exemplo.
 Realizar consultas SQL e explorar os resultados.
 Visualizar os dados com o Google Data Studio.
[Link]

Google Cloud Functions e Boas Práticas:


Automatizando e Otimizando
Google Cloud Functions: Seus Chefs Virtuais

Elas permitem executar


Imagine ter assistentes
código sem servidor Com escalabilidade
virtuais que executam
(serverless), respondendo a automática e pay-per-use,
tarefas específicas de forma
eventos como uploads de você paga apenas pelo
automática e eficiente. As
arquivos, alterações em tempo de execução do seu
Google Cloud Functions são
bancos de dados ou novas código.
exatamente isso!
mensagens em filas.
[Link]
Levi Alberto De Andrade Nome
email@[Link] email@[Link]
[Link] [Link]
[Link]
[Link]

Você também pode gostar