Label Encoder
Converta rótulos categóricos em inteiros, vetores one-hot ou frequências. Com mapeamento de classes e exportação em CSV ou JSON.
Input Labels
O que esta ferramenta faz
Cole uma coluna de categorias e receba as três codificações mais usadas sem escrever código. Serve para checar rápido quantas classes você realmente tem antes de montar o pipeline. Roda na página, sem enviar nada.
- Três modos — inteira, one-hot e por frequência.
- Mapeamento visível — qual número cada classe recebeu, para você reproduzir depois.
- Distribuição — a contagem por categoria, que normalmente já revela o desbalanceamento.
- Exportação — CSV ou JSON, e o mapeamento à parte.
Qual das três escolher
| Codificação | Saída | Boa para | Risco |
|---|---|---|---|
| Inteira | uma coluna | Árvores, categorias com ordem real | Inventa uma ordem que não existe |
| One-hot | uma coluna por classe | Modelos lineares, redes neurais | Explode com cardinalidade alta |
| Frequência | uma coluna | Cardinalidade alta | Empata categorias de frequência igual |
O erro clássico da ordem falsa
Codificar cores como inteiros parece inofensivo, mas um modelo linear lê esses números como magnitudes:
azul -> 0 vermelho -> 1 verde -> 2 O modelo deduz: azul < vermelho < verde e também: (azul + verde) / 2 = vermelho Nenhuma das duas coisas significa nada.
Com one-hot cada classe vira a própria coluna e não há relação de ordem para o modelo interpretar errado. Modelos de árvore toleram a codificação inteira, porque dividem por limiares e não assumem distâncias.
Duas coisas que quebram seu pipeline
- Codificar treino e teste separadamente. Se o mapeamento é recalculado em cada conjunto, a mesma categoria pode receber números diferentes. Ajuste o codificador no treino e reutilize aquele mapeamento — é por isso que aqui você pode exportá-lo.
- Categorias novas em produção. Um valor que não existia no treino não tem número atribuído. Decida antes o que fazer: uma classe
desconhecidaou rejeitar a linha.
Na codificação por frequência há um detalhe extra: se você calcular as frequências sobre o dataset inteiro antes de separar treino e teste, está vazando informação do teste. Calcule só com o treino.
Perguntas frequentes
Quando uso inteiro e quando uso one-hot?
Inteiro quando a categoria tem ordem real (baixo, médio, alto) ou quando o modelo é baseado em árvores, que lidam bem com cortes. One-hot quando não existe ordem e o modelo é linear, porque atribuir 0, 1, 2 a cores faz o modelo achar que verde fica entre vermelho e azul.
Em que ordem os números são atribuídos?
Ordem alfabética das classes únicas, igual ao LabelEncoder do scikit-learn. O mapeamento fica reproduzível, mas lembre que o número não diz nada sobre frequência nem importância.
O que é codificação por frequência?
Troca cada categoria pela quantidade de vezes que ela aparece. Ajuda quando a cardinalidade é alta e o one-hot geraria centenas de colunas. O risco é que duas categorias diferentes com a mesma frequência ficam indistinguíveis.
Consigo exportar o resultado?
Sim, em CSV ou JSON, e também o mapeamento de classes separado, para aplicar exatamente a mesma codificação no seu conjunto de teste.