Ayuda De qué se habló
modelado de temas (LDA) · tokens · lemas · matriz documento-término
¿De qué se habló?
Los temas de la semana o del mes encontrados por LDA, el método clásico de modelado de temas: cada tema es una lista de palabras con peso y cada nota una mezcla de temas. La máquina agrupa; el nombre de cada tema lo ponés vos leyendo la lista.
01 — Cómo se hace
Cada nota se corta en fichas y cada ficha se lleva a su forma de diccionario: «reclamaron», «reclamaba» y «reclamos» pasan a ser la misma palabra. Eso se llama lematizar y lo hace el mismo modelo que busca los nombres. Después nos quedamos sólo con sustantivos, nombres propios y adjetivos: los verbos y las muletillas no ayudan a separar temas.
Con eso se arma una tabla enorme: una fila por nota, una columna por palabra, y en cada celda cuántas veces esa nota usa esa palabra. Miles de filas, miles de columnas, casi todo ceros. Esa tabla es el texto convertido en números — y es lo único que el método mira de acá en adelante.
El LDA busca k grupos de palabras que suelan aparecer juntas en las mismas notas, y reparte cada nota entre esos grupos: una nota puede ser 70 % de un tema y 30 % de otro. Cada tema termina siendo una lista de palabras con peso. La máquina agrupa; el nombre de cada tema lo ponés vos leyendo la lista.
El k lo elegimos nosotros: 8 para la semana, 12 para el mes. No hay ninguna cuenta que diga cuántos temas hay de verdad. Si lo cambiás, cambian todos los temas. Eso no es un defecto del programa: es la decisión que el método le deja a quien lo usa, y por eso está escrita acá.
02 — El límite
Un tema puede salir mezclando dos asuntos que comparten palabras —el Concejo y la política nacional— o partir uno solo en dos. Y como la tabla pierde el orden de las palabras, «el fiscal imputó al médico» y «el médico imputó al fiscal» son idénticas para el LDA.
03 — De dónde viene
Nada de esto lo inventamos nosotros. Estos son los trabajos que fundaron cada técnica, y qué aportó cada uno.
De qué se habló
-
Blei, D. M., Ng, A. Y. & Jordan, M. I. (2003). «Latent Dirichlet Allocation». Journal of Machine Learning Research, 3, 993–1022. ↗
El método: cada texto como mezcla de temas y cada tema como lista de palabras con peso. Lo que corre acá es su versión de scikit-learn.
04 — Probalo