← Volver al Dashboard General
Análisis de Prensa

Metodología, Algoritmos e Inteligencia de Medios

Documentación técnica de lingüística computacional y agregación de datos

📚 Principios de Auditoría e Inteligencia de Prensa

La plataforma Análisis de Prensa PRO realiza un monitoreo automatizado e independiente de la agenda mediática en España. Su objetivo es auditar cuantitativamente el lenguaje empleado en las portadas digitales, detectar patrones de encuadre informativo (*framing*), medir el tono lexicográfico y contrastar la oferta informativa de las redacciones con el interés real de la sociedad.

Todos los datos se procesan cada 60 minutos mediante la lectura de canales de difusión RSS/XML públicos de 62 cabeceras nacionales, regionales, nativas digitales y especializadas de España. A continuación se detalla la formulación matemática y el marco metodológico de cada indicador.

🚨 1. Índice de Tono Alarmista y Sensacionalismo

Proporción Relativa

El Índice de Alarmismo (%) evalúa la intensidad emocional del lenguaje utilizado por cada redacción para captar la atención del lector en sus ediciones digitales (*clickbaiting* o periodismo de alto impacto).

Formulación Matemática:

Índice de Alarmismo (%) = ( N_titulares_alarmistas / N_titulares_totales ) × 100

Proceso de Procesamiento del Lenguaje Natural (NLP):

  1. Tokenización y Normalización: Cada titular se limpia de caracteres especiales, convirtiendo el texto a minúsculas y conservando la ortografía, tildes y caracteres normativos del español.
  2. Análisis de Tono Lexicográfico: Se evalúa la presencia de términos pertenecientes al diccionario auditado de vocablos de impacto o alerta emocional (ejemplos: brutal, estalla, caos, tragedia, alerta roja, pánico, devastador, desastre, violencia, shock, conmoción...).
  3. Relatividad de Volumen: La métrica se calcula respecto al volumen total de noticias publicadas por ese mismo periódico durante el periodo seleccionado. No mide el número absoluto de artículos, sino la proporción de la portada dedicada a este enfoque.

📚 2. Variedad de Vocabulario (Type-Token Ratio — TTR)

Lingüística Computacional

El indicador TTR (%) mide la diversidad del vocabulario empleado por una redacción. Es un estándar de la lingüística cuantitativa que mide la relación entre la cantidad de conceptos diferentes utilizados frente al número total de palabras emitidas.

Formulación Matemática:

TTR (%) = ( V / N ) × 100

Donde V = Types (Palabras únicas distintas) y N = Tokens (Total de palabras significativas escritas).

Filtrado y Depuración Léxica:

⚖️ 3. Consenso Mediático y Cobertura Exclusiva (Entropía de Shannon)

Teoría de la Información

Para determinar si un asunto es objeto de consenso en la opinión pública o si forma parte de un enfoque exclusivo impulsado por una sola cabecera, aplicamos el modelo de **Entropía de la Información de Claude Shannon**.

Formulación Matemática:

H(k) = - ∑ [ p_i × log2(p_i) ]

Donde p_i es la proporción de apariciones del término k en el medio i respecto al total de menciones del día.

Entropía Normalizada H_n = H(k) / log2(S)

Donde S es el número total de medios activos monitorizados (resultado acotado entre 0.0 y 1.0).

Clasificación de Encuadre:

H_n ≥ 0.80 Consenso Nacional (Todos los medios cubren el tema por igual)
0.40 ≤ H_n < 0.80 Interés Moderado (Compartido por varias cabeceras)
H_n < 0.40 Enfoque Singular (Un periódico acapara las menciones del tema)

🌐 4. Motor Híbrido de Demanda Popular (Google Trends + Wikipedia)

Resiliencia Dual

Para contrastar la Prensa (Oferta Informativa) con la Sociedad (Demanda Popular), la plataforma utiliza un motor de datos de doble capa que mide la curiosidad y consultas del público.

Capa 1: Google Trends (geo='ES')

Consulta el volumen relativo de búsqueda en Google España. Si la respuesta es satisfactoria, los datos se registran etiquetados como trend:ES.

Capa 2: Wikimedia REST API (es.wikipedia.org)

Si la red registra restricciones temporales de consulta, el motor conmuta de forma transparente a la API Oficial de Wikimedia para obtener las lecturas absolutas del artículo. Se registra etiquetado como wiki:ES.

Normalización a Cuota Porcentual (Suma = 100%):

Tanto para las búsquedas en Google como para las lecturas en Wikipedia, las cifras se convierten a una cuota de distribución sobre el Top 5 de la jornada, de manera que la suma total sea exactamente el 100.0%. Esto permite comparar ambas series en la misma escala porcentual de forma justa y equilibrada.

🛡️ 5. Frecuencia de Lectura, Caché y Privacidad (AEPD / RGPD)