Friedrich & ClementBETA
Comment nous savons ce que nous savons

Le modèle, la méthode et ses limites.

Tout ce que nous publions — chaque page d'appel d'offres, chaque signal, chaque chiffre du Daily Tender — naît d'un modèle de données et d'une culture de la vérification. Cette page présente l'un et l'autre, intégralement.

1 · Le modèle : un graphe de qui achète quoi à qui

Le corpus n'est pas une pile d'avis, mais un graphe connecté construit à partir d'eux :

  • 19,3 millions avis — les événements : qui a demandé quoi et quand, selon quelle procédure, au-dessus ou en dessous des seuils européens.
  • 13,7 millions attributions — les résultats : attributaire, prix, date, reliés à leur avis d'origine.
  • 1,7 million entreprises — les attributaires en tant qu'entités juridiques, dont 1,2 million rattachées à des numéros de registre officiels (NIF, SIREN, CUI, EIK, Y-tunnus …), afin que les homonymes ne fusionnent jamais et que les filiales ne se confondent jamais.
  • Pouvoirs adjudicateurs normalisés × catégories CPV × années — le rythme d'achat de chaque pouvoir adjudicateur, lisible par machine.

La plupart des données de marchés publics s'arrêtent au premier point. L'intelligence réside dans les liens : les mêmes enregistrements, connectés, répondent à des questions auxquelles ils ne peuvent pas répondre isolément.

2 · La méthode : des barrières plutôt que de l'intuition

La chaîne de traitement a été reconstruite autour de barrières de vérification strictes, après que nous l'avons surprise, dans ses premiers mois, à perdre silencieusement des champs à grande échelle. Les règles depuis :

  • Ne jamais deviner un champ. Chaque raccordement de source part des réponses réelles du portail ; chaque champ est soit affecté, soit explicitement écarté avec justification.
  • Un enregistrement complet avant d'en traiter un million. Des essais à blanc comparent la source au stockage, champ par champ, avant chaque traitement de masse.
  • L'inconnu reste inconnu. L'examen d'aptitude répond satisfait / non satisfait / inconnu — une information manquante n'est jamais transformée en verdict.
  • Rien n'est publié sur la base d'une seule mesure. Les signaux détectés par la machine sont contre-vérifiés par une seconde méthode indépendante (autre statistique de comparaison, normalisation par pays, recomptage après dédoublonnage). Ce qui échoue est écarté — et la mise à l'écart est consignée.
  • Nous nous auditons publiquement. Nos propres erreurs deviennent des articles ; le pouls de la chaîne de traitement est une page publique.

3 · Ce que le modèle sait faire aujourd'hui

  • Trouver — chaque appel d'offres ouvert de 27 pays, consultable en français, y compris les 25 615 procédures sous les seuils européens qu'aucun agrégateur ne recense.
  • Qualifier — les critères de sélection des pouvoirs adjudicateurs, structurés pour 48 470 procédures ; des verdicts d'aptitude traçables au regard d'un profil d'entreprise.
  • Situer — pour chaque appel d'offres : l'historique du pouvoir adjudicateur, le paysage des acteurs en place, les montants payés jusqu'ici.
  • Anticiper — 54–62 % des paires pouvoir adjudicateur × catégorie se répètent d'année en année (mesuré) ; la couche des cycles en fait un calendrier tourné vers l'avant.
  • Détecter — des anomalies quotidiennes accompagnées de cas de comparaison historiques, contre-vérifiées de manière indépendante avant publication.
  • Enquêter — quotas juste sous les seuils, corrélations d'événements (inondations, guerres, cycles budgétaires), schémas de concentration — la classe de constats du Daily Tender.

4 · Ce que nous nous refusons à affirmer

  • Pas de probabilités de gain dans le produit. Nous avons construit un modèle de ML expérimental ; sa mesure honnête est très en deçà de ce que nous accepterions de vendre. Tant qu'un modèle ne bat pas le contexte traçable avec une marge publiable, il reste au laboratoire. (Les prestataires qui annoncent des taux de réussite impressionnants publient rarement leur protocole d'évaluation. Demandez-le-leur.)
  • Pas de causalité tirée d'une corrélation. Nos articles événementiels affirment une concomitance temporelle, pas une cause — l'encadré méthodologique de chacun précise exactement ce qui a été mesuré.
  • Pas de promesses de couverture tacites. Les sources publient différemment : certaines seulement rétrospectivement, d'autres sans certaines catégories. Là où la couverture est mince, nos chiffres le disent — ce sont des bornes inférieures, pas des plafonds.
  • La traduction est un index, pas un texte juridique. Les titres originaux sont conservés partout ; les marchés se gagnent sur les documents sources.

Le corpus derrière cette méthode : la page des données. La méthode appliquée au quotidien : The Daily Tender.

SOURCE · tous les chiffres de cette page sont mesurés sur notre propre corpus, en dernier lieu le 19 août à 19:51

Friedrich & ClementLes appels d'offres publics européens, collectés et consultables — 73 portails, 27 pays.Inscription, recherche et édition du matin disponibles en français. Les pages légales restent en allemand.