Modelos generativos y estimación de densidad
Un modelo discriminativo aprende dónde está la frontera; uno generativo aprende cómo se ven los datos. De ese cambio de objetivo salen la generación de imágenes, la detección de anomalías y los modelos de lenguaje.
Hay dos preguntas distintas frente a los mismos datos. “Dado esto, ¿qué clase es?” y “¿cómo son los datos que existen?”. La segunda es mucho más difícil, y responderla habilita cosas que la primera no: generar ejemplos nuevos, detectar lo raro, completar lo que falta.
Discriminativo aprende la frontera; generativo, los datos
Un modelo discriminativo aprende la probabilidad de la clase dada la entrada: sólo necesita la frontera. Un modelo generativo aprende la distribución conjunta, es decir cómo se distribuyen los datos en sí.
Con la conjunta se puede hacer todo lo del discriminativo y además muestrear ejemplos nuevos o evaluar qué tan probable es uno dado. Naive Bayes es generativo; la regresión logística es discriminativa. La regla práctica es que si sólo hace falta clasificar, el discriminativo suele ganar: estima menos cosas y con menos datos.
La tarea: decidir si un correo es spam. Las dos familias la pueden resolver.
Antes de seguir, predecí
Estimar una densidad en muchas dimensiones
El problema de fondo es estimar una densidad en muchas dimensiones, que es difícil por la misma razón de siempre: el espacio es enorme y los datos, escasos.
Los métodos clásicos funcionan en pocas dimensiones: histogramas, estimación por núcleos, mezclas de gaussianas. Esta última modela la distribución como una suma ponderada de campanas y se ajusta con el algoritmo de esperanza-maximización, que alterna entre estimar a qué componente pertenece cada punto y recalcular las componentes. Es clustering probabilístico: cada punto pertenece a varios grupos con cierto grado.
Las ideas que funcionaron con imágenes
Para datos complejos como imágenes hicieron falta otras ideas. Los autocodificadores variacionales aprenden un espacio latente continuo del que se puede muestrear. Las redes generativas antagónicas enfrentan un generador contra un discriminador, y mejoran compitiendo.
Los modelos de difusión, que dominan hoy, hacen algo más simple de explicar: aprenden a quitar ruido. Se toma una imagen, se la degrada con ruido gaussiano paso a paso hasta que no queda nada, y se entrena una red para revertir cada paso. Generar es arrancar de puro ruido y aplicar esa reversión muchas veces.
En texto, autorregresivo
En texto, el enfoque dominante es autorregresivo: descomponer la probabilidad de una secuencia en el producto de las probabilidades de cada token dado lo anterior.
Eso convierte la estimación de densidad en algo entrenable con el mismo objetivo de siempre —predecir el próximo token— y es exactamente lo que hace un modelo de lenguaje. Un transformer con máscara causal entrenado así es un modelo generativo en el sentido estricto: asigna probabilidad a secuencias y permite muestrearlas.
Para qué sirve además de generar
Más allá de generar, la densidad sirve para otras cosas. Detección de anomalías: lo improbable bajo el modelo es sospechoso, y eso permite detectar fraude o fallas sin ejemplos etiquetados de fraude, que suelen no existir en cantidad.
Datos faltantes: con la conjunta se puede estimar lo que no está condicionando en lo que sí. Datos sintéticos: generar ejemplos que preserven la estructura sin exponer registros reales, con la advertencia de que la privacidad no es automática.
Evaluarlos es notoriamente difícil
Evaluarlos es notoriamente difícil. No hay una respuesta correcta contra la cual comparar: la verosimilitud es calculable en algunos modelos y no en otros, y correlaciona mal con la calidad percibida. Las métricas de imágenes son aproximaciones discutidas.
Y hay un fracaso característico: el colapso de modos, cuando el modelo genera ejemplos convincentes pero siempre parecidos, cubriendo sólo una porción de la variedad real. Un modelo generativo puede verse bien y estar reproduciendo apenas una fracción de sus datos.
Evaluar algo que no tiene respuesta correcta
| Familia | Qué optimiza | Fortaleza | Debilidad |
|---|---|---|---|
| Autorregresivos | predecir lo siguiente | probabilidad exacta, muy buen texto | generar es secuencial y lento |
| Autocodificadores variacionales | una cota de la verosimilitud | espacio latente ordenado | salidas borrosas |
| Adversarios (GAN) | engañar a un discriminador | imágenes nítidas | entrenamiento inestable, colapso de modos |
| Difusión | quitar ruido paso a paso | la mejor calidad hoy en imagen | generar cuesta muchos pasos |
Cierre
Discriminativo aprende la frontera; generativo aprende la distribución, y con ella puede muestrear, completar y detectar lo improbable. De mezclas de gaussianas a difusión y modelos autorregresivos de lenguaje, todos estiman densidad, y evaluarlos sigue siendo el punto flojo.
Autoevaluación
¿Lo entendiste?
Práctica