Quiénes aparecen

entidades nombradasEntidades nombradas (NER). Los nombres propios que aparecen en un texto: personas, lugares, instituciones. En minería de texto se llama NER (reconocimiento de entidades nombradas). Acá los reconoce un modelo entrenado con textos en español (spaCy); al lado se muestra lo que veían nuestras reglas —la mayúscula y listas de palabras conocidas— como contraste.⚠️ El modelo acierta unas dos de cada tres veces, y las reglas una de cada tres: siempre queda algo mal puesto. Un apellido solo («Montenegro») se junta con el nombre completo si apareció antes en el texto; si no, queda como otra persona.leer más →

Las palabras dicen de qué se habla. Los nombres dicen de quién: las personas, las organizaciones y los lugares más nombrados, con los dos filtros sin los cuales la lista es correcta e inútil.

Sobre qué se buscan los nombres

768 notas · 5 diarios · 290.101 palabras

01 — Lo que sale

Personas

  1. 63
  2. 49
  3. 44
  4. 27
  5. 27
  6. 25
  7. 25
  8. 21
  9. 17
  10. 17

Organizaciones

  1. 100
  2. 46
  3. 30
  4. 30
  5. 25
  6. 22
  7. 19
  8. 19
  9. 17
  10. 16

Lugares

  1. 100
  2. 81
  3. 77
  4. 66
  5. 39
  6. 39
  7. 35
  8. 33
  9. 32
  10. 31

768 notas · 5 diarios · 290.101 palabras · el número es cuántas veces se nombra. Tocá un nombre para ver dónde lo dicen y con qué palabras aparece. Lo tachado es lo que sacaron los filtros de abajo. Los nombres los encontró un modelo —spaCy, es_core_news_md— que corre en nuestra máquina.

Lo que veían nuestras reglas

Hasta el 25 de agosto de 2026 esta lista salía de reglas nuestras: dos palabras con mayúscula seguidas, más listas de cargos, de instituciones y de barrios. Medidas contra 30 notas marcadas a mano encontraban 26 de cada 100 nombres —22 de cada 100 personas— contra 63 del modelo (93 en personas). Se quedan acá porque se pueden abrir y mirar por dentro, que es lo que al modelo no se le puede hacer.

Personas

  1. Axel Kicillof 81
  2. Javier Milei 66
  3. Mariano Moyano 45
  4. Guillermo Montenegro 42
  5. Agustín Neme 26
  6. Cristina Kirchner 15
  7. Muñoz Larreta 15
  8. Responsabilidad Penal 14
  9. Fernanda Raverta 14
  10. Mariana Baqueiro 14

Organizaciones

  1. Provincia 302
  2. Policía 270
  3. Gobierno 241
  4. Justicia 219
  5. Hospital 120
  6. Fiscalía 111
  7. Escuela 109
  8. Universidad 87
  9. Nación 82
  10. Municipalidad 79

Lugares

  1. Centro 153
  2. Batán 133
  3. Libertad 114
  4. Puerto 63
  5. Playa Grande 45
  6. Constitución 43
  7. Miramar 40
  8. Punta Mogotes 35
  9. Chapadmalal 34
  10. Santa Fe 34

Personas · sólo el modelo: Carlos Bianco, Gustavo Damián Buenahora, Ulises Cristiano, Jorge Luis Borges, Andrés Escudero, Marta Pascual · sólo las reglas: Mariano Moyano, Guillermo Montenegro, Cristina Kirchner, Muñoz Larreta, Responsabilidad Penal, Fernanda Raverta

Organizaciones · sólo el modelo: Justicia Federal, Policía Bonaerense, Senado de la Nación, Universidad Nacional de Mar del Plata, Unidad Penal N, HIGA, Facultad de Psicología de la UNMDP, Poder Ejecutivo · sólo las reglas: Provincia, Policía, Gobierno, Justicia, Hospital, Fiscalía, Escuela, Universidad

Lugares · sólo el modelo: provincia de Buenos Aires, República Argentina, Circuito Turístico de Batán, El Municipio, Tel, Hospital Interzonal General de Agudos, Gobierno nacional, Estado nacional · sólo las reglas: Centro, Batán, Libertad, Puerto, Constitución, Miramar, Punta Mogotes, Chapadmalal

Qué se pierde acá: el modelo también se equivoca —a veces toma un título de nota por una organización, o parte un nombre— y, a diferencia de las reglas, no podés abrirlo y ver por qué decidió. Donde los dos coinciden hay bastante seguridad; donde se separan, tocá el nombre y mirá la frase.

03 — La perilla

Dos filtros que cambian todo

Sin ellos la lista es correcta y a la vez inútil. Lo descartado se ve tachado arriba.

«Mar del Plata» y los nombres de los diarios aparecen en todas las notas: es cierto y no dice nada. Como actores, son ruido. Y «Clínica Colón» no es una persona por más que empiece con mayúscula: cambia de columna.

04 — El límite

El modelo acierta bastante más que unas reglas (medido: 63 de cada 100 nombres contra 26), pero se equivoca igual: parte nombres, toma el título de una nota por una organización y no sabe que dos formas de escribir son la misma persona. Y no se le puede preguntar por qué decidió. Sirve para orientarse sobre quién está en escena — no como padrón.
¿Qué es Quiénes aparecen? — ver más

Los nombres los encuentra un modelo entrenado (spaCy) que lee la frase entera y aprendió, sobre miles de textos en español marcados a mano, qué suena a nombre de persona, de organización o de lugar. Después nosotros acomodamos: el apellido suelto se suma al nombre completo, y se tachan la ciudad y los diarios, que están en todas las notas y no dicen nada.

NER (reconocimiento de entidades nombradas) por modelo estadístico, no por reglas: spaCy es_core_news_md, corriendo en nuestro propio servidor. Nuestras reglas anteriores —mayúsculas más listas de cargos e instituciones— quedan al lado como contraste, porque se pueden mostrar por dentro y el modelo no.

Leer la explicación completa: cómo se hace paso a paso, y los trabajos que fundaron la técnica →

Todos investigamos algo.

Con una cuenta gratis cargás tus textos, los etiquetás, corrés estos mismos análisis sobre ellos y publicás lo que encontraste. Cuando publicás tu primera investigación, sos investigador del HLab.

Crear mi cuenta → Ver un caso completo: El Marquesado