La mayoría de las tareas de ML clásicas son discriminativas: el modelo aprende a asignar la entrada X a la etiqueta Y. Un filtro de spam genera spam/no spam. Un detector de objetos devuelve las coordenadas del cuadro delimitador. El modelo hace inferencias sobre datos existentes; no crea nada nuevo.
El límite no es absoluto. BERT entrena sin etiquetas (predicción de tokens enmascarados) pero se utiliza para tareas discriminativas. Un clasificador basado en GPT es técnicamente una arquitectura generativa que se utiliza para la discriminación. La diferencia clave está en el objetivo de la capacitación, no en la arquitectura.
Las ideas detrás de los modelos generativos no son nuevas: las GAN se introdujeron en 2014 y los VAE en 2013. Lo que cambió fue la convergencia de tres factores que hicieron posible y productivo el entrenamiento a escala.