Dados estruturados e não estruturados. Dados abertos. Coleta, tratamento, armazenamento, integração e recuperação de dados. Processos de ETL.
Formatos e tecnologias: XML, JSON, CSV.
Representação de dados numéricos, textuais e estruturados; aritmética computacional.
Técnicas para pré-processamento de dados.
Noções do modelo CRISP-DM. Técnicas e tarefas de mineração de dados. Classificação. Regras de associação. Análise de agrupamentos (clusterização). Detecção de anomalias. Modelagem preditiva.
Exploração de dados: conceituação e características.
Conceitos de Machine Learning: fontes de erro em modelos preditivos, validação e avaliação de modelos preditivos, underfitting, overfitting e técnicas de regularização, otimização de hiperparâmetros, separabilidade de dados, redução da dimensionalidade. Modelos lineares, árvores de decisão, redes neurais feed-forward, classificador Naive Bayes.
Algoritmos de Machine Learning.
Conceitos de Processamento de Linguagem Natural (PLN): semântica vetorial, redução de dimensionalidade, modelagem de tópicos latentes, classificação de textos, análise de sentimentos, representações com n-gramas.
Linguagem Python: sintaxe, variáveis, tipos de dados e estruturas de controle de fluxo. Estruturas de dados, funções e arquivos.
Bibliotecas: NLTK, Tensor Flow, Pandas, Numpy, Sklearn, Scipy.