Ayuda Qué palabras se repiten

frecuencias · n-gramas · co-ocurrencia

¿Qué palabras se repiten?

Las palabras que más se repiten en las notas —o en un texto tuyo—, de a una, de a dos pegadas, o juntas en la misma oración. Es el conteo más simple que existe y la base de casi todo lo demás.

01 — Cómo se hace

Tomamos las notas del alcance que elegiste —una nota, un hecho, la semana, el mes, o lo que pegaste— y las pasamos a minúscula. Después las cortamos en fichas: una por palabra. «Los vecinos del puerto reclaman por la obra de agua» son diez fichas.

Sacamos las vacías: «los», «del», «por», «la», «de». Son unas 190 palabras de una lista que se puede leer entera en la pantalla. Quedan «vecinos», «puerto», «reclaman», «obra», «agua». Y contamos: cada ficha suma uno a su palabra.

Con la perilla en «de a dos» no contamos fichas sueltas sino pares seguidos: «obra agua», «vecinos puerto». Con la perilla en «juntas», contamos cuántas oraciones comparten dos palabras aunque estén lejos: «vecinos» y «agua» aparecen en la misma oración, así que se enlazan.

Eso es todo. No hay un modelo, no hay una inteligencia artificial: hay una lista, un contador y una regla para cortar. Por eso se puede revisar a mano, y por eso cuando tocás una palabra te mostramos la frase exacta de donde salió.

02 — El límite

Que una palabra se repita mucho no la vuelve importante. El conteo trata cada palabra suelta, sin orden ni contexto: no distingue si «obra» aparece en una inauguración o en una denuncia. Usá esto como punto de partida para preguntas, nunca como conclusión.

«Obra» aparece 40 veces esta semana. Puede ser la inauguración de una obra, una obra parada, una obra en construcción o una denuncia por una obra. El conteo las suma todas igual: para saber cuál es, hay que tocar la palabra y leer.

03 — De dónde viene

Nada de esto lo inventamos nosotros. Estos son los trabajos que fundaron cada técnica, y qué aportó cada uno.

Frecuencia de palabras

  1. Zipf, G. K. (1949). Human Behavior and the Principle of Least Effort. Cambridge (MA): Addison-Wesley.

    Mostró que en cualquier texto unas pocas palabras se repiten muchísimo y la gran mayoría casi nunca. Por eso las diez primeras de la lista son casi siempre palabras vacías, y hay que sacarlas.

  2. Luhn, H. P. (1958). «The Automatic Creation of Literature Abstracts». IBM Journal of Research and Development, 2(2), 159–165.

    La primera vez que una computadora contó palabras para saber de qué habla un texto: sacando las muy comunes y las muy raras, las del medio son las que importan.

N-gramas

  1. Shannon, C. E. (1948). «A Mathematical Theory of Communication». Bell System Technical Journal, 27(3), 379–423.

    Fundó la idea de que se puede predecir la palabra siguiente mirando las anteriores. Contar pares y tríos de palabras viene de acá.

  2. Manning, C. D. & Schütze, H. (1999). Foundations of Statistical Natural Language Processing. Cambridge (MA): MIT Press.

    El manual que enseñó a toda una generación a contar palabras, pares y tríos con estadística, y a medir cuándo dos palabras van juntas más de lo que daría el azar.

Red de co-ocurrencia

  1. Firth, J. R. (1957). «A synopsis of linguistic theory 1930–1955». En Studies in Linguistic Analysis. Oxford: Blackwell, 1–32.

    «Una palabra se conoce por las compañías que frecuenta»: el sentido de una palabra se ve en las que aparecen al lado. Es la idea detrás de la red.

  2. Harris, Z. S. (1954). «Distributional Structure». Word, 10(2–3), 146–162.

    Dos palabras que aparecen en los mismos contextos tienen sentidos parecidos. Todo lo que hoy se llama «modelos de lenguaje» arranca en esta observación.

  3. Church, K. W. & Hanks, P. (1990). «Word Association Norms, Mutual Information, and Lexicography». Computational Linguistics, 16(1), 22–29.

    La forma de medir con un número si dos palabras van juntas más seguido de lo que daría el azar, y no solo porque las dos sean frecuentes.

04 — Probalo