glosario

Las palabras, en castellano

Acá están todos los términos técnicos que aparecen en EntropIA y en esta plataforma, explicados como se los explicarías a alguien que recién empieza. Ninguno hace falta saberlo de antes: están para cuando aparezcan.

Palabras de computadora

Las que vas a escuchar en cualquier lado, no solo acá. Si te perdés en una charla técnica, casi siempre es por alguna de estas.

API (la puerta de un programa) #

La puerta por la que dos programas se hablan sin que haya una persona en el medio. Cuando esta plataforma le pide un resumen a una inteligencia artificial, o le pregunta a un mapa dónde queda una calle, lo hace por una API: manda un pedido escrito y recibe una respuesta escrita.

⚠️ Casi siempre la puerta es de otro. Si el dueño la cambia, la cierra o la empieza a cobrar, lo que dependía de ella deja de andar de un día para el otro.

Llave de API #

Una clave larga que te da el proveedor del modelo y que la plataforma usa para hablar con él en tu nombre. Se guarda cifrada y el gasto corre por tu cuenta.

⚠️ Es la llave de tu casa: quien la tenga gasta con tu tarjeta. No se manda por mail, no se pega en un chat y no se sube a ningún lado junto con el código.

Dirección web (URL) #

La dirección completa de una página, con el https:// adelante. Es lo que copiás de la barra del navegador y lo que pegás cuando querés guardar una nota.

JSON #

Una forma de escribir datos para que los lea un programa: pares de «nombre: valor», uno abajo del otro. Es el formato en que EntropIA saca una colección entera y en el que la plataforma la vuelve a leer.

⚠️ Está pensado para la máquina. Se puede abrir con el Bloc de notas y se entiende, pero cansa. Y si el archivo quedó cortado por la mitad no se lee nada: es todo o nada.

CSV (una planilla en texto) #

Una tabla guardada como texto pelado: una fila por renglón y las columnas separadas por comas. Es lo que exporta cualquier planilla de cálculo y lo que entra por Importar.

⚠️ Guarda la tabla y nada más: no viajan los colores, ni las fórmulas, ni las otras hojas. Y si un texto tiene comas adentro hay que encomillarlo o las columnas se corren.

Metadatos #

Los datos sobre el dato. De una nota: el diario, la fecha, el autor y la dirección de dónde salió. De una foto: la cámara y el día. No es el contenido, es la ficha del contenido.

⚠️ Casi siempre faltan o vienen mal. Una fecha equivocada manda la nota a otro mes y ensucia cualquier línea de tiempo que armes después.

Exportar e importar #

Exportar es sacar tu material de un programa metido en un archivo; importar es meterlo en otro. Es el puente entre EntropIA, el que se instala, y la plataforma web: exportás la colección y la subís acá.

⚠️ En el camino se pierde lo que el otro programa no sepa guardar. Conviene mirar qué llegó antes de seguir trabajando encima.

Servidor #

Una computadora prendida todo el día en otro lado, cuyo único trabajo es atender pedidos. Cuando entrás a una página, tu navegador se la pide a un servidor y el servidor se la manda.

Base de datos #

El fichero ordenado donde un programa guarda las cosas para poder encontrarlas rápido: cada documento, cada etiqueta, cada usuario en su lugar. EntropIA la guarda en tu máquina; la plataforma web, en su servidor.

La nube #

Guardar cosas y hacerlas funcionar en la computadora de otro, a la que entrás por internet. «Está en la nube» quiere decir «está en un servidor que alquila alguien»: nada más que eso.

⚠️ Lo que subís queda donde no mandás vos. Por eso EntropIA, el programa que se instala, deja todo en tu máquina y solo sale lo que vos decidís mandar.

Inteligencia artificial

Qué es realmente lo que hay del otro lado cuando un programa «entiende» o «escribe», y hasta dónde se le puede creer.

Inteligencia artificial #

Programas que aprenden a hacer algo mirando muchísimos ejemplos, en vez de que alguien les escriba las reglas una por una: reconocer la letra de un escaneo, separar los nombres propios de un texto, redactar un resumen.

⚠️ Aprende de ejemplos que juntó alguien, y repite lo que había ahí: los aciertos y también los prejuicios. No entiende lo que hace ni puede explicar por qué contestó eso.

Modelo de lenguaje #

Un programa entrenado con muchísimo texto que, dado un pedido escrito, devuelve texto. Es lo que hay detrás de los asistentes tipo ChatGPT.

⚠️ No sabe: estima. Inventa con soltura, cambia de respuesta ante el mismo pedido, y no puede explicar por qué contestó eso. Lo que devuelve se revisa siempre.

Pedido (prompt) #

Lo que se le escribe a un modelo para que haga algo: la instrucción, más el texto sobre el que tiene que trabajar. Cambiando el pedido cambia la respuesta.

⚠️ No existe el pedido «correcto». Dos pedidos parecidos pueden dar resultados muy distintos, y el mismo pedido dos veces tampoco da lo mismo.

Invención (alucinación) #

Cuando un modelo contesta con toda seguridad algo que no existe: una cita inventada, una fecha que nunca fue, un autor que no escribió eso. No miente a propósito; completa lo que le falta.

⚠️ No hay manera de darse cuenta desde adentro: la invención suena igual de convincente que el dato bueno. Todo lo que sale de un modelo se chequea contra la fuente.

Sentido en números (embedding) #

Convertir un texto en una lista de números, hecha de modo que dos textos que dicen cosas parecidas queden con números parecidos. Sirve para buscar por sentido y no por la palabra exacta.

⚠️ «Parecido» lo define el modelo que hizo los números, no vos. Dos textos que dicen lo contrario sobre el mismo tema pueden quedar pegados.

Sacarle el texto a una imagen (OCR) #

Leer una foto o un documento escaneado y devolver el texto escrito que hay adentro, para poder buscarlo y contarlo.

⚠️ Con letra manuscrita, papel manchado o fotos torcidas se equivoca. Lo que devuelve se compara con la imagen antes de citarlo.

Transcripción #

Pasar un audio a texto: una entrevista grabada se vuelve un documento que después podés buscar, citar y contar.

⚠️ Se traba con los nombres propios, con dos personas hablando a la vez y con el ruido de fondo. Siempre se repasa contra el audio.

Trabajar con muchos textos

Las cuentas que se le hacen a un montón de textos a la vez para ver lo que no se ve leyendo de a uno.

Minería de texto #

Contar cosas en muchos textos a la vez para ver lo que no se ve leyendo de a uno: qué palabras se repiten, quiénes aparecen nombrados, cómo cambia todo eso en el tiempo.

⚠️ Cuenta, no comprende. Todo lo que sale de acá es una pista para ir a leer, nunca una conclusión.

Verlo funcionando →

Corpus #

El montón de textos con el que se trabaja, tomado como una sola cosa: las notas de un diario, los comentarios de una publicación, las entrevistas de una investigación.

⚠️ Un corpus es un recorte: lo que dejaste afuera no aparece en ningún resultado. Conviene decir siempre de dónde salió y qué período cubre.

Ficha (token) #

Cada pedacito en que se corta un texto para poder contarlo — normalmente, cada palabra. «El puerto está cerrado» son cuatro fichas.

⚠️ El corte es una decisión, no un hecho: «Mar del Plata» son tres fichas para la máquina y un solo nombre para vos.

Lema (lematizar) #

La forma de diccionario de una palabra: «corrían», «corrió» y «corriendo» son todas «correr». Se juntan así para que la misma idea no se cuente repartida en cinco.

⚠️ Hace falta un modelo del idioma y a veces se confunde, sobre todo con los nombres propios, que trata como si fueran verbos.

Palabras vacías (stopwords) #

Las palabras que aparecen en todos los textos y no dicen de qué habla ninguno: «de», «la», «que», «y». Se descartan antes de contar.

⚠️ La lista la elige alguien. Sacar «no» de un corpus de opiniones, por ejemplo, borra justo lo que distingue estar a favor de estar en contra.

Verlo funcionando →

N-grama #

Palabras que aparecen pegadas una detrás de otra. De a dos se llaman bigramas («arma fuego»), de a tres trigramas.

Verlo funcionando →

TF-IDF #

Una cuenta que resalta las palabras propias de un grupo de textos: las que ese grupo usa mucho y los demás casi no usan.

Verlo funcionando →

Co-ocurrencia #

Qué palabras aparecen cerca de qué otras. Dibujadas como una red, muestran los grupos de palabras que viajan juntas.

Verlo funcionando →

Entidades nombradas (NER) #

Los nombres propios que aparecen en un texto: personas, lugares, instituciones. En minería de texto se llama NER (reconocimiento de entidades nombradas). Acá la máquina los reconoce por la mayúscula y por listas de palabras conocidas, no con un modelo entrenado.

Verlo funcionando →

Sentimiento (polaridad) #

Ponerle un signo a un texto —positivo, neutro o negativo— sumando la carga que un diccionario le asigna a ciertas palabras.

Verlo funcionando →

Temas (LDA) #

Una cuenta que agrupa muchos textos en un puñado de temas, mirando qué palabras tienden a aparecer juntas. Nadie le dice cuáles son los temas: los arma sola.

⚠️ Los temas no vienen con nombre: son listas de palabras que hay que leer e interpretar. Y si le pedís ocho temas te da ocho, los haya o no.

Verlo funcionando →

Legibilidad #

Un número que estima cuán fácil de leer es un texto, a partir del largo de las palabras y de las oraciones.

Verlo funcionando →

El trabajo de investigar

Las palabras que aparecen adentro de EntropIA y del panel mientras armás y ordenás tu material.

Colección #

En EntropIA, todo el material de una investigación junto: los documentos, las imágenes, los audios y lo que les vayas agregando. En la plataforma web se llama proyecto, y es lo mismo.

Ítem (documento) #

Cada pieza suelta de una colección: una nota, un PDF, una foto, una entrevista. Es la unidad que se etiqueta, se anota y se cuenta.

Etiquetar (codificar) #

Ponerle a cada documento la respuesta a una pregunta tuya —«¿está a favor o en contra?»— para después poder contar cuántos hay de cada tipo.

⚠️ La etiqueta es tu lectura, no un dato del texto. Por eso se escribe con qué criterio se puso y, cuando se puede, se comparan dos personas etiquetando lo mismo.

Esquema de etiquetas #

La pregunta que le vas a hacer a cada documento y las respuestas posibles. Por ejemplo: «¿está a favor o en contra?» con tres opciones.

Relación (triple) #

Una afirmación anotada en tres partes: quién, qué hizo y sobre qué. «El intendente — inauguró — la escuela 12». Anotadas así se pueden buscar todas juntas y dibujarlas como una red.

⚠️ Es un recorte violento: la duda, el matiz y el «habría» del texto original no entran en las tres partes.

Anonimizar #

Reemplazar el nombre de cada autor por un seudónimo estable («Participante 7»), para poder trabajar y publicar el material sin exponer a nadie.

Recolección automática (scraping) #

Un programa que entra a un sitio, lee lo publicado y lo guarda como texto, todos los días, sin que nadie copie y pegue.

⚠️ Solo recolecta lo que el sitio publica y mientras lo publique. Si el diario cambia su página, la recolección se rompe hasta que se arregle.

Poner en el mapa (geocodificar) #

Convertir un lugar escrito en un texto —«el puerto», «Colón al 2000»— en un punto con coordenadas, para poder dibujarlo en un mapa.

⚠️ Los nombres repetidos caen en cualquier lado. Y un punto en el mapa no prueba que la cosa haya pasado ahí: prueba que ese nombre estaba escrito en la nota.

Acuerdo entre codificadores (Kappa) #

Cuánto coinciden dos personas al clasificar el mismo material, descontando lo que habrían coincidido por pura casualidad.