Ayuda Qué palabras se repiten
frecuencias · n-gramas · co-ocurrencia
¿Qué palabras se repiten?
Las palabras que más se repiten en las notas —o en un texto tuyo—, de a una, de a dos pegadas, o juntas en la misma oración. Es el conteo más simple que existe y la base de casi todo lo demás.
01 — Cómo se hace
Tomamos las notas del alcance que elegiste —una nota, un hecho, la semana, el mes, o lo que pegaste— y las pasamos a minúscula. Después las cortamos en fichas: una por palabra. «Los vecinos del puerto reclaman por la obra de agua» son diez fichas.
Sacamos las vacías: «los», «del», «por», «la», «de». Son unas 190 palabras de una lista que se puede leer entera en la pantalla. Quedan «vecinos», «puerto», «reclaman», «obra», «agua». Y contamos: cada ficha suma uno a su palabra.
Con la perilla en «de a dos» no contamos fichas sueltas sino pares seguidos: «obra agua», «vecinos puerto». Con la perilla en «juntas», contamos cuántas oraciones comparten dos palabras aunque estén lejos: «vecinos» y «agua» aparecen en la misma oración, así que se enlazan.
Eso es todo. No hay un modelo, no hay una inteligencia artificial: hay una lista, un contador y una regla para cortar. Por eso se puede revisar a mano, y por eso cuando tocás una palabra te mostramos la frase exacta de donde salió.
02 — El límite
«Obra» aparece 40 veces esta semana. Puede ser la inauguración de una obra, una obra parada, una obra en construcción o una denuncia por una obra. El conteo las suma todas igual: para saber cuál es, hay que tocar la palabra y leer.
03 — De dónde viene
Nada de esto lo inventamos nosotros. Estos son los trabajos que fundaron cada técnica, y qué aportó cada uno.
Frecuencia de palabras
-
Zipf, G. K. (1949). Human Behavior and the Principle of Least Effort. Cambridge (MA): Addison-Wesley. ↗
Mostró que en cualquier texto unas pocas palabras se repiten muchísimo y la gran mayoría casi nunca. Por eso las diez primeras de la lista son casi siempre palabras vacías, y hay que sacarlas.
-
Luhn, H. P. (1958). «The Automatic Creation of Literature Abstracts». IBM Journal of Research and Development, 2(2), 159–165. ↗
La primera vez que una computadora contó palabras para saber de qué habla un texto: sacando las muy comunes y las muy raras, las del medio son las que importan.
N-gramas
-
Shannon, C. E. (1948). «A Mathematical Theory of Communication». Bell System Technical Journal, 27(3), 379–423. ↗
Fundó la idea de que se puede predecir la palabra siguiente mirando las anteriores. Contar pares y tríos de palabras viene de acá.
-
Manning, C. D. & Schütze, H. (1999). Foundations of Statistical Natural Language Processing. Cambridge (MA): MIT Press. ↗
El manual que enseñó a toda una generación a contar palabras, pares y tríos con estadística, y a medir cuándo dos palabras van juntas más de lo que daría el azar.
Red de co-ocurrencia
-
Firth, J. R. (1957). «A synopsis of linguistic theory 1930–1955». En Studies in Linguistic Analysis. Oxford: Blackwell, 1–32. ↗
«Una palabra se conoce por las compañías que frecuenta»: el sentido de una palabra se ve en las que aparecen al lado. Es la idea detrás de la red.
-
Harris, Z. S. (1954). «Distributional Structure». Word, 10(2–3), 146–162. ↗
Dos palabras que aparecen en los mismos contextos tienen sentidos parecidos. Todo lo que hoy se llama «modelos de lenguaje» arranca en esta observación.
-
Church, K. W. & Hanks, P. (1990). «Word Association Norms, Mutual Information, and Lexicography». Computational Linguistics, 16(1), 22–29. ↗
La forma de medir con un número si dos palabras van juntas más seguido de lo que daría el azar, y no solo porque las dos sean frecuentes.
04 — Probalo