Label Encoder

Converta rótulos categóricos em inteiros, vetores one-hot ou frequências. Com mapeamento de classes e exportação em CSV ou JSON.

Input Labels

0 samples·0 unique classes·Delimiter: newline

O que esta ferramenta faz

Cole uma coluna de categorias e receba as três codificações mais usadas sem escrever código. Serve para checar rápido quantas classes você realmente tem antes de montar o pipeline. Roda na página, sem enviar nada.

  • Três modos — inteira, one-hot e por frequência.
  • Mapeamento visível — qual número cada classe recebeu, para você reproduzir depois.
  • Distribuição — a contagem por categoria, que normalmente já revela o desbalanceamento.
  • Exportação — CSV ou JSON, e o mapeamento à parte.

Qual das três escolher

CodificaçãoSaídaBoa paraRisco
Inteirauma colunaÁrvores, categorias com ordem realInventa uma ordem que não existe
One-hotuma coluna por classeModelos lineares, redes neuraisExplode com cardinalidade alta
Frequênciauma colunaCardinalidade altaEmpata categorias de frequência igual

O erro clássico da ordem falsa

Codificar cores como inteiros parece inofensivo, mas um modelo linear lê esses números como magnitudes:

azul -> 0
vermelho -> 1
verde -> 2

O modelo deduz:  azul < vermelho < verde
e também:        (azul + verde) / 2 = vermelho

Nenhuma das duas coisas significa nada.

Com one-hot cada classe vira a própria coluna e não há relação de ordem para o modelo interpretar errado. Modelos de árvore toleram a codificação inteira, porque dividem por limiares e não assumem distâncias.

Duas coisas que quebram seu pipeline

  • Codificar treino e teste separadamente. Se o mapeamento é recalculado em cada conjunto, a mesma categoria pode receber números diferentes. Ajuste o codificador no treino e reutilize aquele mapeamento — é por isso que aqui você pode exportá-lo.
  • Categorias novas em produção. Um valor que não existia no treino não tem número atribuído. Decida antes o que fazer: uma classe desconhecida ou rejeitar a linha.

Na codificação por frequência há um detalhe extra: se você calcular as frequências sobre o dataset inteiro antes de separar treino e teste, está vazando informação do teste. Calcule só com o treino.

Perguntas frequentes

Quando uso inteiro e quando uso one-hot?

Inteiro quando a categoria tem ordem real (baixo, médio, alto) ou quando o modelo é baseado em árvores, que lidam bem com cortes. One-hot quando não existe ordem e o modelo é linear, porque atribuir 0, 1, 2 a cores faz o modelo achar que verde fica entre vermelho e azul.

Em que ordem os números são atribuídos?

Ordem alfabética das classes únicas, igual ao LabelEncoder do scikit-learn. O mapeamento fica reproduzível, mas lembre que o número não diz nada sobre frequência nem importância.

O que é codificação por frequência?

Troca cada categoria pela quantidade de vezes que ela aparece. Ajuda quando a cardinalidade é alta e o one-hot geraria centenas de colunas. O risco é que duas categorias diferentes com a mesma frequência ficam indistinguíveis.

Consigo exportar o resultado?

Sim, em CSV ou JSON, e também o mapeamento de classes separado, para aplicar exatamente a mesma codificação no seu conjunto de teste.

Ferramentas relacionadas

Outros idiomas