Obtenção de um modelo de mineração de dados aplicado a evasões universitárias do programa de Engenharia de Sistemas da Universidade de Cundinamarca
Resumo
Este artigo descreve a obtenção de um modelo de mineração de dados aplicado ao problema da evasão universitária no curso de Engenharia de Sistemas da Universidade de Cundinamarca, campus Facatativá. O modelo foi estruturado utilizando a metodologia de mineração de dados KDD (Knowledge Discovery in Databases) utilizando também a linguagem de programação Python, a biblioteca de processamento de dados Pandas e a Machine Learning Sklearn. Para o processo, foram levados em consideração os problemas adicionais ao processo de mineração, como, por exemplo, a alta dimensão, para a qual foram aplicados os métodos de seleção das variáveis estatísticas univariadas, feature importance e SelectFromModel (Sklearn). No projeto, foram selecionadas cinco técnicas de mineração de dados para avaliá-las: vizinhos mais próximos (K Nearest Neighbors, KNN), árvores de decisão (DT), árvores aleatórias (Random Forest, RF), regressão logística, (Logistic Regression LR) e máquinas de vetores de suporte (Support Vector Machines, SVM). No que diz respeito à seleção do modelo final, foram avaliados os resultados de cada modelo nas métricas de precisão, matriz de confusão e métricas adicionais da matriz de confusão. Por fim, os parâmetros do modelo selecionado foram ajustados e a generalização do modelo foi avaliada no momento de diagramar sua curva de aprendizado.