Análise completa de 59.381 clientes e 68 variáveis explicativas para prever compra de produtos.
Você tem 6 arquivos:
📄 Analise_Exploratoria.html (12 KB) ← Relatório em HTML
📄 Analise_Exploratoria.pdf (378 KB) ← Relatório em PDF
📊 train.csv (4.8 MB) ← Dados para modelagem
📋 metadata.csv (2 KB) ← Descrição das variáveis
📊 test.csv (7.2 MB) ← Dados de teste (não usar)
📋 submission_sample.csv (160 KB) ← Exemplo (não usar)
Opção A: Abrir HTML (no navegador)
Clique duplo em: Analise_Exploratoria.html
→ Abre no seu navegador
Opção B: Abrir PDF (imprimível)
Clique duplo em: Analise_Exploratoria.pdf
→ Abre no leitor de PDF
Arquivo: metadata.csv
- Mostra o tipo de cada variável (nominal, ordinal, discreto, contínuo)
Arquivo: train.csv
- 59.381 linhas (clientes)
- 70 colunas:
- Coluna 1: ID
- Colunas 2-69: Variáveis (var1 a var68)
- Coluna 70: Y (comprou ou não)
✅ Distribuição das variáveis
- Quantitativas: histogramas e boxplots
- Qualitativas: frequências
✅ Correlações
- Entre variáveis quantitativas
- Com a variável resposta (Y)
✅ Dados faltantes
- Quais variáveis têm dados faltantes
- Quanto faltam
✅ Recomendações
- Quais variáveis remover
- Como preparar os dados
- Quais modelos usar
| Achado | Ação |
|---|---|
| var65, var66 têm 95% de dados faltantes | Remover |
| Maioria das variáveis < 10% faltantes | Imputar com KNN |
| Escalas muito diferentes entre variáveis | Normalizar |
| Baixa correlação geral | Usar Random Forest ou XGBoost |
1. PREPARAR DADOS
├─ Remover var65 e var66
├─ Imputar dados faltantes
└─ Normalizar variáveis
2. ESCOLHER MODELO
├─ Random Forest (simples)
├─ XGBoost (melhor)
└─ LightGBM (mais rápido)
3. VALIDAR
└─ Cross-validation 5-fold
O arquivo HTML/PDF tem 10 seções:
- Introdução - O que é a análise
- Dados - Tipo de cada variável
- Faltantes - Onde faltam dados
- Variáveis Discretas - Gráficos boxplot
- Variáveis Contínuas - Distribuições
- Qualitativas - Frequências
- Correlações - Relações entre variáveis
- Relação com Y - O que afeta compra
- Testes Estatísticos - Chi-square
- Conclusões - Recomendações finais
P: Por onde começo?
R: Abra Analise_Exploratoria.html (mais fácil) ou Analise_Exploratoria.pdf
P: Qual arquivo uso para treinar modelo?
R: train.csv
P: Para que serve metadata.csv? R: Mostra o tipo de cada variável
P: Posso ignorar test.csv? R: Sim, use ele só para submissão no Kaggle depois
P: Onde vejo o código? R: Está no apêndice do PDF (arquivo .Rmd que gerou tudo)
- Clientes: 59.381
- Variáveis: 69 explicativas + 1 ID + 1 Y = 71 colunas
- Y balanceada: ~50% comprou, ~50% não comprou
- Tipos: 35 nominais, 4 ordinais, 18 discretas, 12 contínuas
Você tem um relatório profissional com:
- ✅ 10 seções detalhadas
- ✅ 15+ gráficos
- ✅ Análises estatísticas
- ✅ Recomendações claras
Pronto para usar como base para modelagem!
Criado em: Junho 2026
Status: Análise Exploratória Completa ✅