Atlasingeniería

Aprendizaje automáticoNo supervisado y reducción de dimensiónTema 3

Modelos generativos y estimación de densidad

Un modelo discriminativo aprende dónde está la frontera; uno generativo aprende cómo se ven los datos. De ese cambio de objetivo salen la generación de imágenes, la detección de anomalías y los modelos de lenguaje.

Hay dos preguntas distintas frente a los mismos datos. “Dado esto, ¿qué clase es?” y “¿cómo son los datos que existen?”. La segunda es mucho más difícil, y responderla habilita cosas que la primera no: generar ejemplos nuevos, detectar lo raro, completar lo que falta.

Discriminativo aprende la frontera; generativo, los datos

Un modelo discriminativo aprende la probabilidad de la clase dada la entrada: sólo necesita la frontera. Un modelo generativo aprende la distribución conjunta, es decir cómo se distribuyen los datos en sí.

Con la conjunta se puede hacer todo lo del discriminativo y además muestrear ejemplos nuevos o evaluar qué tan probable es uno dado. Naive Bayes es generativo; la regresión logística es discriminativa. La regla práctica es que si sólo hace falta clasificar, el discriminativo suele ganar: estima menos cosas y con menos datos.

La tarea: decidir si un correo es spam. Las dos familias la pueden resolver.

1 / 6
La primera fila es la única que los dos resuelven, y ahí gana el discriminativo. Las otras tres son las que justifican pagar lo que cuesta un generativo, y si la aplicación no necesita ninguna, no hay motivo para estimar una distribución entera.

Antes de seguir, predecí

Un modelo generativo devuelve una respuesta con una cita bibliográfica precisa que no existe. ¿Por qué?

Estimar una densidad en muchas dimensiones

El problema de fondo es estimar una densidad en muchas dimensiones, que es difícil por la misma razón de siempre: el espacio es enorme y los datos, escasos.

Los métodos clásicos funcionan en pocas dimensiones: histogramas, estimación por núcleos, mezclas de gaussianas. Esta última modela la distribución como una suma ponderada de campanas y se ajusta con el algoritmo de esperanza-maximización, que alterna entre estimar a qué componente pertenece cada punto y recalcular las componentes. Es clustering probabilístico: cada punto pertenece a varios grupos con cierto grado.

Las ideas que funcionaron con imágenes

Para datos complejos como imágenes hicieron falta otras ideas. Los autocodificadores variacionales aprenden un espacio latente continuo del que se puede muestrear. Las redes generativas antagónicas enfrentan un generador contra un discriminador, y mejoran compitiendo.

Los modelos de difusión, que dominan hoy, hacen algo más simple de explicar: aprenden a quitar ruido. Se toma una imagen, se la degrada con ruido gaussiano paso a paso hasta que no queda nada, y se entrena una red para revertir cada paso. Generar es arrancar de puro ruido y aplicar esa reversión muchas veces.

En texto, autorregresivo

En texto, el enfoque dominante es autorregresivo: descomponer la probabilidad de una secuencia en el producto de las probabilidades de cada token dado lo anterior.

Eso convierte la estimación de densidad en algo entrenable con el mismo objetivo de siempre —predecir el próximo token— y es exactamente lo que hace un modelo de lenguaje. Un transformer con máscara causal entrenado así es un modelo generativo en el sentido estricto: asigna probabilidad a secuencias y permite muestrearlas.

Para qué sirve además de generar

Más allá de generar, la densidad sirve para otras cosas. Detección de anomalías: lo improbable bajo el modelo es sospechoso, y eso permite detectar fraude o fallas sin ejemplos etiquetados de fraude, que suelen no existir en cantidad.

Datos faltantes: con la conjunta se puede estimar lo que no está condicionando en lo que sí. Datos sintéticos: generar ejemplos que preserven la estructura sin exponer registros reales, con la advertencia de que la privacidad no es automática.

Evaluarlos es notoriamente difícil

Evaluarlos es notoriamente difícil. No hay una respuesta correcta contra la cual comparar: la verosimilitud es calculable en algunos modelos y no en otros, y correlaciona mal con la calidad percibida. Las métricas de imágenes son aproximaciones discutidas.

Y hay un fracaso característico: el colapso de modos, cuando el modelo genera ejemplos convincentes pero siempre parecidos, cubriendo sólo una porción de la variedad real. Un modelo generativo puede verse bien y estar reproduciendo apenas una fracción de sus datos.

Evaluar algo que no tiene respuesta correcta

FamiliaQué optimizaFortalezaDebilidad
Autorregresivospredecir lo siguienteprobabilidad exacta, muy buen textogenerar es secuencial y lento
Autocodificadores variacionalesuna cota de la verosimilitudespacio latente ordenadosalidas borrosas
Adversarios (GAN)engañar a un discriminadorimágenes nítidasentrenamiento inestable, colapso de modos
Difusiónquitar ruido paso a pasola mejor calidad hoy en imagengenerar cuesta muchos pasos
Las cuatro aprenden la misma cosa —cómo se distribuyen los datos— con estrategias muy distintas, y cada estrategia deja su huella en el tipo de defecto que producen sus salidas.

Cierre

Discriminativo aprende la frontera; generativo aprende la distribución, y con ella puede muestrear, completar y detectar lo improbable. De mezclas de gaussianas a difusión y modelos autorregresivos de lenguaje, todos estiman densidad, y evaluarlos sigue siendo el punto flojo.

Autoevaluación

¿Lo entendiste?

¿Qué diferencia a un modelo generativo de uno discriminativo?
Si sólo hace falta clasificar, ¿qué conviene?
¿Qué habilita modelar la distribución de los datos?
¿Por qué estimar una densidad en muchas dimensiones es difícil?