El modelo, el método y sus límites.
Todo lo que publicamos (cada página de licitación, cada señal, cada cifra del Daily Tender) nace de un modelo de datos y de una cultura de verificación. Esta página presenta ambos, por completo.
1 · El modelo: un grafo de quién compra qué y a quién
El fondo de datos no es un montón de anuncios, sino un grafo conectado construido a partir de ellos:
- 24,0 millones de anuncios — los hechos: quién exigió qué y cuándo, mediante qué procedimiento de contratación, por encima o por debajo de los umbrales de la UE.
- 17,7 millones de adjudicaciones — los resultados: adjudicatario, precio y fecha, vinculados de vuelta a su anuncio de licitación.
- 2,0 millones de empresas — los adjudicatarios como personas jurídicas, de las cuales 1,3 millones están asociadas a números de registro oficiales (NIF, SIREN, CUI, EIK, Y-tunnus …), de modo que los homónimos nunca se fusionen ni las filiales se confundan entre sí.
- Órganos de contratación normalizados × categorías CPV × años — el ritmo de compra de cada órgano de contratación, legible por máquina.
La mayoría de los datos de contratación pública se detienen en el primer punto. La inteligencia está en los enlaces: los mismos registros, conectados, responden preguntas que por separado no pueden responder.
2 · El método: controles en lugar de intuición
La cadena de procesos se reconstruyó en torno a controles de verificación estrictos después de que la sorprendiéramos, en sus primeros meses, perdiendo campos en silencio y a gran escala. Las reglas desde entonces:
- Nunca suponer un campo. Cada conexión con una fuente parte de las respuestas reales de la plataforma; cada campo se asigna o se descarta expresamente, indicando el motivo.
- Un registro completo antes de procesar un millón. Los ensayos en vacío comparan la fuente con lo almacenado, campo por campo, antes de cada procesamiento masivo.
- Lo desconocido sigue siendo desconocido. La comprobación de solvencia responde cumple / no cumple / se desconoce — un dato que falta nunca se convierte en un veredicto.
- Nada se publica a partir de una sola medición. Las señales detectadas por la máquina se comprueban con un segundo método independiente (otro estadístico de comparación, normalización por país, recuento posterior a la deduplicación). Lo que no supera la prueba se descarta, y el descarte queda registrado.
- Nos auditamos en público. Nuestros propios errores se convierten en artículos; el pulso de la cadena de procesos es una página pública.
3 · Lo que el modelo sabe hacer hoy
- Encontrar — cada licitación abierta de 27 países, consultable en español, incluidos los 22.126 procedimientos por debajo de los umbrales que ningún agregador recoge.
- Cualificar — los criterios de solvencia de los órganos de contratación, estructurados para 33.429 procedimientos, y veredictos de aptitud trazables frente al perfil de una empresa.
- Contextualizar — para cada licitación: el historial del órgano de contratación, el círculo de adjudicatarios habituales y lo que se pagó hasta ahora.
- Anticipar — entre el 54 % y el 62 % de los pares órgano de contratación × categoría se repiten año tras año (según nuestra medición); la capa de ciclos convierte eso en un calendario hacia delante.
- Detectar — anomalías diarias acompañadas de casos históricos de comparación, verificadas de forma independiente antes de publicarse.
- Investigar — proporciones justo por debajo de los umbrales, correlaciones con acontecimientos (inundaciones, guerras, ciclos presupuestarios) y patrones de concentración: la clase de hallazgos del Daily Tender.
4 · Lo que deliberadamente no afirmamos
- Ninguna probabilidad de resultar adjudicatario en el producto. Construimos un modelo experimental de aprendizaje automático; su métrica honesta queda muy por debajo de lo que estaríamos dispuestos a vender. Mientras un modelo no supere al contexto trazable por un margen publicable, se queda en el laboratorio. (Los proveedores que anuncian tasas de acierto llamativas rara vez publican el diseño de su evaluación. Pídaselo.)
- Ninguna causalidad a partir de una correlación. Nuestros artículos sobre acontecimientos afirman una coincidencia en el tiempo, no una causa; el recuadro de método de cada uno indica exactamente qué se midió.
- Ninguna promesa tácita de cobertura. Cada fuente publica de una manera: unas solo de forma retrospectiva, a otras les faltan categorías. Allí donde la cobertura es escasa, nuestras cifras lo dicen: son cotas inferiores, no superiores.
- La traducción es un índice, no un texto jurídico. Los títulos originales se conservan en todo momento; los contratos se ganan sobre los documentos de origen.
El fondo de datos que hay detrás de este método: la página de datos. El método aplicado cada día: The Daily Tender.
FUENTE · todas las cifras de esta página están medidas sobre nuestro propio fondo de datos, la última vez el 16 de septiembre a las 09:56