Generación vs discriminación: cuál es la diferencia

La mayoría de las tareas de ML clásicas son discriminativas: el modelo aprende a asignar la entrada X a la etiqueta Y. Un filtro de spam genera spam/no spam. Un detector de objetos devuelve las coordenadas del cuadro delimitador. El modelo hace inferencias sobre datos existentes; no crea nada nuevo.

Modelo generativo: un modelo que aprende la distribución de datos P(X) y puede muestrear nuevos ejemplos a partir de ella. En lugar de preguntar "¿qué es este objeto?" responde "¿cómo es un objeto típico de este mundo?" GPT genera texto que nunca antes existió; Stable Diffusion pinta una imagen a partir de ruido aleatorio puro.
Diferencias clave entre los dos enfoques
Aspectodiscriminativogenerativo
Objetivo de entrenamientoPredecir etiqueta P(Y|X)Distribución de datos del modelo P(X) o P(X|Y)
ProducciónClase, número, cuadro delimitadorNuevo texto, imagen, audio, vídeo.
EtiquetasRequerido (supervisado)A menudo no es necesario (autosupervisado)
Ejemplos de tareasClasificación, regresión, NERGeneración de texto, síntesis de imágenes, traducción.
Ejemplos de modelosBERT, SVM, XGBoost, ResNetGPT, Claude, Difusión Estable, GAN, VAE

El límite no es absoluto. BERT entrena sin etiquetas (predicción de tokens enmascarados) pero se utiliza para tareas discriminativas. Un clasificador basado en GPT es técnicamente una arquitectura generativa que se utiliza para la discriminación. La diferencia clave está en el objetivo de la capacitación, no en la arquitectura.

Un mapa de la IA generativa: seis familias
Haga clic en una tarjeta para obtener más información
Por qué la IA generativa es posible ahora mismo

Las ideas detrás de los modelos generativos no son nuevas: las GAN se introdujeron en 2014 y los VAE en 2013. Lo que cambió fue la convergencia de tres factores que hicieron posible y productivo el entrenamiento a escala.

Tres factores convergieron para hacer posible la GenAI ▶
Transformador
2017: autoatención
GPU/TPU
×10 000 frente a 2012
Datos
Corpus a escala de Internet
Leyes de escala
Más datos + parámetros = mejor
GenAI
GPT-3 → GPT-4 → Claudio

Conclusiones clave

La IA generativa es un cambio de paradigma: en lugar de inferir etiquetas a partir de los datos, los modelos aprenden a crear nuevos datos que parecen provenir de la misma distribución. Esto se volvió práctico gracias a la convergencia de la arquitectura del transformador, el escalado de cómputo de GPU y los conjuntos de datos a escala de Internet.
Los modelos discriminativos aprenden P(Y|X): asignan entradas a etiquetas
Los modelos generativos aprenden P(X): la distribución de datos en sí, a partir de la cual se pueden tomar muestras de nuevos ejemplos.
La arquitectura puede ser idéntica (ambas usan transformadores); la diferencia está en el objetivo del entrenamiento.
Seis familias principales: LLM, Difusión, GAN, VAE, Audio Gen, Video Gen
GenAI se volvió práctica a través del transformador (2017), el escalado de computación y los datos a escala de Internet: los tres a la vez