Resumo Técnico - PySpark, R, SQL e Python (pandas e forecasting)
1. PySpark - Principais Bibliotecas e Funções
- [Link]: Manipulação de DataFrames (filter, select, groupBy, join)
- [Link]: Funções como col(), when(), lit()
- [Link]: VectorAssembler, StringIndexer, StandardScaler
- [Link]: LinearRegression, RandomForestRegressor
- [Link]: RandomForestClassifier, LogisticRegression
- [Link]: RegressionEvaluator, BinaryClassificationEvaluator
- [Link]: CrossValidator, ParamGridBuilder
- [Link]: StreamingContext (dados em tempo real)
2. R (dplyr / tidyverse) - Funções principais
- filter(), select(), mutate(), arrange(), group_by(), summarise(), left_join()
- ggplot2: Visualizações gráficas
- forecast: [Link](), forecast()
- ARDL: ardl(), bounds_f_test()
- plm: plm() (modelos de painel)
- lmtest: coeftest(), bptest(), dwtest()
- arrow: Leitura e escrita de arquivos Parquet com alta performance (funções: read_parquet(),
write_parquet(), open_dataset())
3. SQL (Spark SQL / SQL tradicional)
- SELECT, WHERE, GROUP BY, ORDER BY, JOIN, CREATE TEMP VIEW
- Window Functions: ROW_NUMBER(), RANK(), PARTITION BY
- Spark SQL: %sql SELECT * FROM view
4. Python (pandas e forecasting)
- pandas: read_csv(), head(), filter, groupby(), merge(), pivot_table(), fillna(), to_csv()
- scikit-learn: LinearRegression(), RandomForestRegressor(), train_test_split()
- statsmodels: ARIMA(), OLS(), VAR(), ARDL()
- pmdarima: auto_arima()
- prophet: Prophet(), make_future_dataframe(), predict()
- xgboost: XGBRegressor()
5. Glossário de termos (Data Lake, Databricks, Delta Lake)
- Data Lake: Repositório central de dados brutos e tratados
- Databricks: Plataforma de análise em nuvem baseada em Apache Spark
- Delta Lake: Formato de armazenamento com transações ACID e time travel
- PySpark: API Python para Spark, para manipulação distribuída de dados
- Spark SQL: Permite consultas SQL sobre DataFrames Spark
6. Exemplos de resposta para entrevista
- Experiência em manipulação de dados com R e PySpark
- Conhecimento em SQL avançado e Spark SQL
- Modelagem de séries temporais e Machine Learning em Python
- Trabalho com Data Lakes e Databricks em ambiente distribuído