Conceitos fundamentais de dados, informação e conhecimento; dados qualitativos (nominal, ordinal) e quantitativos (discretos, contínuos); tidy data; formatos de arquivos de dados comuns (txt, csv, xlsx, xml e json). dados estruturados, semiestruturados e não estruturados; Metadados: a sua importância para avaliação da qualidade de dados; linhagem de dados;
Introdução a Bases de Dados: o que são bases de dados; metadados. Sistemas Gerenciadores de Base de Dados (SGBDs): definição de SGBD; principais funções; principais tipos de SGBDs (SQL) e suas diferenças; transações e índices; controle de acesso; regras de integridade.
Modelo de entidade-relacionamento (ER);
Modelo de dados: modelo relacional: tabelas, esquemas, chaves (primária e estrangeira), consultas;
Linguagem SQL (Structured Query Language): conceitos introdutórios; comandos básicos para consultas (inserção, atualização e exclusão de dados).
SQL: análise de dados (como funções de agregação, filtros, joins, subconsultas e demais).
Introdução ao armazenamento de dados: armazenamento de arquivos; principais estruturas de armazenamento de dados analíticos (data warehouse, data mart, data lake, data lakehouse), suas diferenças conceituais e casos de uso; armazenamento na nuvem. Coleta de dados: fontes comuns de dados (internas e externas); técnicas de web scraping. Preparação de dados: técnicas de tratamento e limpeza de dados; técnicas detecção de vieses; data profiling.
Modelagem Dimensional; OLAP; [conteúdo não explícito no edital, mas ajuda a entender as aulas seguintes]
Big Data: conceito de big data; conceitos gerais sobre técnicas.
Ferramentas para lidar com grandes volumes de dados (Spark, Hadoop, Parquet, HDFS e MapReduce).
NoSQL: modelo chave-valor; modelo colunar; modelo orientado a documentos; modelo orientado a grafos.
Noções de governança de IA: conceitos e objetivos da governança de IA; gestão de riscos em IA. Principais riscos e vulnerabilidades relacionados a IA: viés algorítmico; exposição de dados sensíveis; envenenamento de dados de treinamento; ataques adversariais; ataques de manipulação de modelos; roubo de modelos; ataque de inferência; alucinações. Aplicação de IA responsável: definição; ética; transparência; justiça e equidade; responsabilização; segurança cibernética; compliance regulatório.
VIII- PROCESSAMENTO DE LINGUAGEM NATURAL (NLP): Técnicas de pré-processamento de texto: limpeza; normalização; remoção de stop words; stemming; lematização e demais. Representação de texto: N-grams; CBoW; FTD-IDF; word embeddings (Word2Vec, GloVe e demais) e document embeddings (Doc2Vec, BERT, ELMo e demais). Modelagem de tópicos: latent dirichlet allocation (LDA); non-negative matrix factorization (NMF). Modelos de linguagem: modelos de linguagem tradicionais; redes neurais recorrentes; redes neurais convolucionais; transformers. Tarefas básicas em NLP: classificação de texto; análise de sentimento; extração de informação (NER; REL); similaridade textual; sumarização de texto; rotulação de partes do discurso (POS-tagging) e tradução automática.
Metodologias de gestão de projetos de ciência de dados: CRISP-DM, Microsoft Team Data Science Process (TDSP), OSEMN; Pipeline de treinamento de modelos e suas etapas.
Problemas comuns de qualidade de dados: valores ausentes; duplicatas; outliers; desbalanceamento; erros de imputação. Pré-processamento de dados: técnicas de normalização e padronização; discretização; metodologias de codificação de variáveis categóricas (encoding). Feature engineering: processos para enriquecimento de dados, com criação e seleção de features relevantes; transformações matemáticas e estatísticas comuns em variáveis.
Divisão de dados: técnicas de amostragem; divisão entre treinamento, validação e teste; abordagens para cross-validation. Trade-off entre viés e variância; detecção de overfitting e underfitting. Validação de Modelos: Kfold cross-validation; leave-one-out cross-validation; bootstrap. Otimização de hiperparâmetros: grid search; random search; algoritmos de otimização avançados; automl; autotuning; autofeature engineering. Modelagem de IA centrada em dados (data-centric).
Redução de dimensionalidade: Principal Component Analysis (PCA); LDA; ICA; T-SNE; uso de autoencoders. Técnicas de clusterização: K-Means; agrupamento hierárquico; Gaussian Mixture Models; DBSCAN. Técnicas de classificação: Regressão logística; K-Nearest Neighbors (KNN); Suport Vector Machines (SVM); Decision Trees (CART); classificadores Naive-Bayes (Binomial-Beta, Poisson-Gama, Normal-Normal);
Métricas para avaliação e seleção de modelos: métricas para regressão (MSE; RMSE; MAE; R²; R² ajustado); métricas para classificação (accuracy, precision, recall, F1-score e ROC-AUC); análise de matriz de confusão;
Técnicas de regularização: lasso; ridge; elastic net; dropout; early stopping; batch normalization. Dados desbalanceados: técnicas para lidar com dados desbalanceados; oversampling; undersampling; dados sintéticos; ajuste de pesos.
Ensembling de modelos: Bagging; boosting (AdaBoost, Gradient Boosting, XGBoost, LightGBM e CatBoost); stacking. Florestas Aleatórias (Random Forest).
Sistemas de recomendação: Filtragem colaborativa (baseadas em usuários ou itens); filtragem baseada em conteúdo; sistemas híbridos; problemas comuns (cold start, escalabilidade, data sparsity). Modelos de séries temporais: definição; componentes (tendência, sazonalidade, ciclos e ruído); autocorrelação e autocorrelação parcial; conceito e testes de estacionaridade; cointegração; modelos AR, ARMA e ARIMA; modelos de suavização exponencial; modelos de decomposição; modelos de regressão com variáveis temporais (ARIMAX).
Redes neurais: Introdução a Redes Neurais Artificiais (arquitetura, funções de ativação, treinamento, forward pass, backpropagation, loss functions, algoritmos de otimização, épocas, batch size e demais); embeddings; redes profundas (deep learning); Redes Neurais Convolucionais (CNNs) e Recorrentes (RNNs); LSTM; GRU; GAN; modelos multimodais.
Bibliotecas Python: Pandas (manipulação; limpeza; transformação e pré-processamento de dado); NumPy (operações de arrays); Matplotlib e Seaborn (visualização de dados); TensorFlow; Keras e PyTorch (redes neurais); Scikit-learn e XGBoost (aprendizado de máquina); NLTK e spaCy (processamento de linguagem natural); huggingface (LLM); PySpark (Big data); Beautiful Soup (web scraping); Streamlit (data apps).
Microsoft Power BI: conexão e importação de dados; modelagem de dados; criação de medidas e colunas calculadas; visualizações e gráficos; interações entre visualizações; criação de relatórios e painéis.
Noções de governança de dados (DMBOK): conceitos e objetivos da governança de dados; principais técnicas de qualidade e integridade de dados; princípios de privacidade e proteção a dados.