Label Encoder

Convierte etiquetas categóricas a enteros, vectores one-hot o frecuencias. Con mapeo de clases y exportación a CSV o JSON.

Input Labels

0 samples·0 unique classes·Delimiter: newline

Qué hace esta herramienta

Pega una columna de categorías y obtienes las tres codificaciones habituales sin escribir código. Útil para comprobar rápido cuántas clases tienes de verdad antes de montar el pipeline. Se ejecuta en la página, sin subir nada.

  • Tres modos — entera, one-hot y por frecuencia.
  • Mapeo visible — qué número recibió cada clase, para que puedas reproducirlo.
  • Distribución — el recuento por categoría, que suele delatar el desbalanceo.
  • Exportación — CSV o JSON, y el mapeo aparte.

Cuál de las tres elegir

CodificaciónSalidaBuena paraRiesgo
Enterauna columnaÁrboles, categorías con orden realInventa un orden si no existe
One-hotuna columna por claseModelos lineales, redes neuronalesExplota con cardinalidad alta
Frecuenciauna columnaCardinalidad altaEmpata categorías igual de frecuentes

El error clásico del orden falso

Codificar colores como enteros parece inofensivo, pero un modelo lineal lee esos números como magnitudes:

azul -> 0
rojo -> 1
verde -> 2

El modelo deduce:  azul < rojo < verde
y también:         (azul + verde) / 2 = rojo

Ninguna de las dos cosas significa nada.

Con one-hot cada clase es su propia columna y no hay relación de orden que malinterpretar. Los modelos de árbol sí toleran la codificación entera, porque parten por umbrales y no asumen distancias.

Dos cosas que romperán tu pipeline

  • Codificar train y test por separado. Si el mapeo se recalcula en cada conjunto, la misma categoría puede recibir números distintos. Ajusta el codificador con los datos de entrenamiento y reutiliza ese mapeo; por eso aquí puedes exportarlo.
  • Categorías nuevas en producción. Un valor que no estaba en el entrenamiento no tiene número asignado. Decide antes qué hacer: una clase desconocida o rechazar la fila.

Con la codificación por frecuencia hay un detalle extra: si calculas las frecuencias sobre todo el dataset antes de separar train y test, estás filtrando información del conjunto de prueba. Calcúlalas solo con el entrenamiento.

Preguntas frecuentes

¿Cuándo uso entero y cuándo one-hot?

Entero si la categoría tiene un orden real (bajo, medio, alto) o si vas a usar modelos de árbol, que manejan bien los cortes. One-hot si no hay orden y el modelo es lineal, porque asignar 0, 1, 2 a colores le hace creer que verde está entre rojo y azul.

¿En qué orden se asignan los números?

Alfabético sobre las clases únicas, igual que el LabelEncoder de scikit-learn. Así el mapeo es reproducible, pero recuerda que el número no dice nada sobre la frecuencia ni la importancia.

¿Qué es la codificación por frecuencia?

Sustituye cada categoría por cuántas veces aparece. Sirve con cardinalidad alta, donde one-hot generaría cientos de columnas. El riesgo es que dos categorías distintas con la misma frecuencia se vuelven indistinguibles.

¿Puedo exportar el resultado?

Sí, en CSV o JSON, y también el mapeo de clases por separado para poder aplicar exactamente la misma codificación a tu conjunto de prueba.

Herramientas relacionadas

Otros idiomas