Compare commits

..

525 Commits

Author SHA1 Message Date
Colin Maudry 06fad7ec2d Changelog 2.8.1 2026-06-25 09:54:45 +02:00
Colin Maudry 3eec248dab Fix tokens_cli est maintenant autonome pour récupérer l'env 2026-06-25 09:50:19 +02:00
Colin Maudry fc22eca661 Changelog 2.8.0 2026-06-23 07:06:44 +02:00
Colin Maudry e591c5500f Petites améliorations du rendu #81 2026-06-22 22:47:37 +02:00
Colin Maudry 074716bc16 feat(observatoire): restructurer tuile en 3 barres
- Barre 1 (grise) : % marchés avec champs considérations renseignés
- Barre 2 (rose)  : % positifs parmi les marchés renseignés — sociales
- Barre 3 (verte) : % positifs parmi les marchés renseignés — env

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-06-22 22:21:37 +02:00
Colin Maudry ae8292d68d fix(observatoire): filtre renseignées sur != 'Sans objet' plutôt que regex
Seule 'Sans objet' est considérée négative parmi les marchés renseignés,
cohérent avec le reste des traitements.

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-06-22 22:02:37 +02:00
Colin Maudry 26455a7616 fix(observatoire): barre renseignée = positifs parmi les marchés renseignés
Dénominateur = marchés non-null ; numérateur = marchés positifs (regex).
Label affiché : "parmi les N marchés renseignés".

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-06-22 21:18:00 +02:00
Colin Maudry 19e181734c feat(observatoire): ajouter barres 'valeur renseignée' dans tuile considérations
Affiche 4 barres groupées par type (sociales/env) : une pour les marchés
avec au moins une considération, une pour ceux qui ont une valeur renseignée
(non nulle, y compris 'Sans objet').

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-06-22 18:55:38 +02:00
Colin Maudry 8efd9b45eb fix(observatoire): texte % blanc sur les barres de considérations
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-06-22 18:46:37 +02:00
Colin Maudry eab06eedae fix(observatoire): couleurs barres considérations palette Plotly Safe
Utilise les codes hex #CC6677 (sociales) et #117733 (env) via le prop
color de dbc.Progress, qui accepte les valeurs hex.

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-06-22 18:45:33 +02:00
Colin Maudry 5586db23aa feat(observatoire): afficher la tuile considérations après Type d'achat
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-06-22 18:17:27 +02:00
Colin Maudry a85baca408 feat(observatoire): calcul et rendu tuile considérations sociales/env
Ajoute compute_considerations_stats (dédoublonnage par uid, regex
Clause|Critère|Marché réservé, colonne absente → 0%) et
get_considerations_card_content (deux dbc.Progress colorés Safe).

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-06-22 18:16:34 +02:00
Colin Maudry 2ce762b6cc docs: plan tuile considérations sociales/environnementales
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-22 18:11:45 +02:00
Colin Maudry 826448d6be docs: spec tuile considérations sociales/environnementales (observatoire)
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-22 18:09:05 +02:00
Colin Maudry e44af8add8 Dans les résultats de recherche, le contenu de la colonne Département wrappe le texte #77 2026-06-22 17:55:53 +02:00
Colin Maudry 992f6d4f93 Recherche dans les tableaux insensible aux accents #79 2026-06-22 17:46:31 +02:00
Colin Maudry 966d193ec4 test(api): benchmark comparatif decp.info vs data.gouv.fr (#78)
Requête identique envoyée aux deux APIs (drapeaux d'agrégation nus),
tableau côte à côte + ratio decp/datagouv. Couvre filtres, differs,
agrégation. --url decp.info paramétrable (défaut prod), data.gouv.fr
sans auth.

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-22 15:16:35 +02:00
Colin Maudry c264c36684 fix(api): next=null sur dernière page en mode agrégation (#78)
Si la page retournée est partielle (len < page_size), on sait qu'on est
sur la dernière page → next=null, parité data.gouv.fr.

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-06-22 14:23:09 +02:00
Colin Maudry 70ee819a51 feat(api): sort supporté sur colonnes groupby en mode agrégation (#78)
Testé contre tabular-api data.gouv.fr : sort sur une colonne groupby
est honoré (200), sort sur un alias d'agrégat retourne 400 (colonne
inconnue). aggregate_marches reçoit order_by ; doc Swagger mise à jour.

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-06-22 14:20:02 +02:00
Colin Maudry b87eb4328c docs(api): documente les opérateurs (filtres + agrégation) dans Swagger (#78)
Remplace la description du paramètre <colonne>__<opérateur> par une
documentation complète listant tous les opérateurs de filtre (exact, differs,
contains, notcontains, in, notin, less, greater, strictly_less,
strictly_greater, isnull, isnotnull, sort) et les agrégations (groupby, count,
sum, avg, min, max).

Met à jour le docstring de data() pour documenter le mode agrégation et les
paramètres réservés.

Ajoute test_openapi_doc.py qui valide la présence des mots-clés clés dans
l'OpenAPI généré.

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-06-22 14:09:34 +02:00
Colin Maudry 7c9a95355b feat(api): mode agrégation sur /data (groupby + agrégats) (#78) 2026-06-22 14:06:44 +02:00
Colin Maudry 28709a162a feat(db): aggregate_marches pour les requêtes GROUP BY (#78)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-06-22 14:04:08 +02:00
Colin Maudry 9324a734d4 feat(api): parsing des opérateurs d'agrégation (groupby/count/sum/avg/min/max) (#78) 2026-06-22 13:59:50 +02:00
Colin Maudry 2a8e82ccd6 feat(api): ajoute l'opérateur de filtre differs (IS DISTINCT FROM) (#78)
Implémente l'opérateur de filtre `differs` qui génère un fragment SQL
`IS DISTINCT FROM` pour exclure des valeurs en tenant compte des NULL.

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-06-22 13:55:18 +02:00
Colin Maudry f5db674e22 feat(api): renomme le param réservé count en count_results (#78)
- Renomme RESERVED_PARAMS dans src/api/filters.py
- Fait passer le paramètre de 'count' à 'count_results' dans src/api/routes.py
- Met à jour la documentation swagger pour le nouveau nom

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-06-22 13:50:12 +02:00
Colin Maudry 5166c88b8b docs: plan d'implémentation parité API decp.info / tabular-api (#78)
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-22 13:35:34 +02:00
Colin Maudry b0fbe89c2c docs: ajoute la doc Swagger des mots-clés au spec parité API (#78)
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-22 13:27:08 +02:00
Colin Maudry 441d36273a docs: spec parité API decp.info / tabular-api data.gouv.fr (#78)
Opérateurs manquants : differs + agrégation (groupby/count/sum/avg/min/max),
renommage du param réservé count -> count_results. or hors périmètre.

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-22 13:22:49 +02:00
Colin Maudry ffaf200c07 api/v1/schema n'est plus auth, schema renvoie table schema, adaptation des tests #78 2026-06-16 17:03:14 +02:00
Colin Maudry fede22f314 Plus d'options dans swagger UI pour Try it out #78 2026-06-16 11:06:46 +02:00
Colin Maudry d591d7f47a Merge branch 'feature/78_api' into dev 2026-06-12 20:26:30 +02:00
Colin Maudry b8d73c7f7b fix: omettre temporalCoverage si date inconnue + TimeoutException explicite (#78)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-06-12 17:58:23 +02:00
Colin Maudry cb93dbe05a feat: chargements de pages best-effort au boot (tableau, sources) (#78)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-06-12 13:58:50 +02:00
Colin Maudry fa2709b38c fix: re-vérifier db_path.exists() dans le handler et assertion return value (#78)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-06-12 13:50:57 +02:00
Colin Maudry bba53d81e1 feat: réutiliser le DuckDB existant si le bootstrap échoue (#78)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-06-12 13:48:32 +02:00
Colin Maudry 5a6aa31c86 fix: robustesse schéma — TransportError, validation name, ValueError cache (#78)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-06-12 13:28:36 +02:00
Colin Maudry 42ba73cd36 feat: schéma résilient URL→cache + suppression DATA_SCHEMA_LOCAL (#78)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-06-12 13:26:03 +02:00
Colin Maudry 21c65c34fb test: réparer le baseline test_db cassé par le merge (#78)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-06-12 11:37:54 +02:00
Colin Maudry afd6590c54 docs: plan d'implémentation bootstrap résilient (#78)
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-12 11:30:36 +02:00
Colin Maudry 20f81b5732 docs: spec surfaces C/D (chargements pages au boot) (#78)
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-12 11:23:35 +02:00
Colin Maudry 0ebbfcd872 docs: spec schéma en cache seul (#78)
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-12 11:10:13 +02:00
Colin Maudry 8a853b2384 docs: spec bootstrap résilient données et schéma (#78)
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-12 11:01:41 +02:00
Colin Maudry 1aea71be7f Merge branch 'main' into feature/78_api 2026-06-12 09:33:59 +02:00
Colin Maudry 317b2b5cdb Merge tag 'v2.7.9' into dev
- Ajout d'une vue "étapes" (elle sera mieux intégrée dans le site à l'avenir)
- Correction de petites erreurs qui polluent les logs
2026-06-09 11:33:32 +02:00
Colin Maudry c304f05d85 Merge branch 'release/2.7.9' 2026-06-09 11:31:21 +02:00
Colin Maudry 5341ca002e Bump changelog 2.7.9 2026-06-09 11:28:16 +02:00
Colin Maudry ed32b0f66b Réduction des petites erreurs qui polluent les logs 2026-06-07 18:56:16 +02:00
Colin Maudry 4d3e8ac344 feat(etapes): fiches cliquables sur les barres et vue mobile 2026-06-04 22:15:10 +02:00
Colin Maudry ab74717679 feat(etapes): suppression légende, JAL à la place de Journaux d'annonces légales 2026-06-04 22:04:31 +02:00
Colin Maudry c9a97fe9d2 feat(etapes): référencement de /etapes dans le sitemap 2026-06-04 21:51:30 +02:00
Colin Maudry b8db0cddf8 feat(etapes): styles du graphique étapes/seuils 2026-06-04 21:48:28 +02:00
Colin Maudry 4c60fed0c2 feat(etapes): vue mobile liste par étape
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-06-04 21:45:25 +02:00
Colin Maudry 070a91fed1 feat(etapes): graphique données par étape et par seuil 2026-06-04 21:42:33 +02:00
Colin Maudry e638ce45be feat(etapes): squelette de la page /etapes 2026-06-04 21:38:50 +02:00
Colin Maudry e55f3447db Possibilité de charger les données depuis une URL, memoisation de last_modified 2026-06-04 21:34:36 +02:00
Colin Maudry 6cf213add5 Spec+plan: vue mobile dédiée pour /etapes
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-04 21:31:17 +02:00
Colin Maudry 80c27bf357 Plan: page /etapes — données par étape et par seuil
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-04 21:26:09 +02:00
Colin Maudry 2e9b587613 Spec: page /etapes — données par étape et par seuil
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-04 21:13:35 +02:00
Colin Maudry ad7e3e5b1f Récupération de schéma plus robuste et changelog 2026-05-18 12:17:59 +02:00
Colin Maudry 7d4df0e6ad Récupération de schéma plus robuste et changelog 2026-05-18 12:16:03 +02:00
Colin Maudry 8dc5287918 Ajouts à flask #78 2026-05-18 11:47:05 +02:00
Colin Maudry 63f51d7b98 API: mention sur la page À propos (#78)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-05-13 14:47:03 +02:00
Colin Maudry 2f0cbada34 API: corriger flush() et isolation test compteur (#78) 2026-05-13 14:45:26 +02:00
Colin Maudry c683034e2b API: documentation OpenAPI et CHANGELOG (#78)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-05-13 14:37:21 +02:00
Colin Maudry 985af0fdc7 API: envoi Matomo fire-and-forget en async (#78)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-05-13 14:34:52 +02:00
Colin Maudry 912507b1d9 API: compteur de consommation SQLite asynchrone (#78)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-05-13 14:31:22 +02:00
Colin Maudry 04c8bb8b6d API: tests d'intégration filtres/tri/columns (#78) 2026-05-13 14:28:18 +02:00
Colin Maudry 6d2a95d775 API: retirer benchmark non demandé (#78) 2026-05-13 14:16:27 +02:00
Colin Maudry 6c591aeb08 API: endpoint /data avec pagination et filtres (#78)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-05-13 14:15:19 +02:00
Colin Maudry 7571b9a984 API: script de benchmark tests/benchmark_api.py (#78)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-05-13 14:12:27 +02:00
Colin Maudry 6f4e7f1853 API: endpoint /schema (#78)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-05-13 14:10:20 +02:00
Colin Maudry a05c869b0d API: renforcer test intégration /health (#78) 2026-05-13 14:08:30 +02:00
Colin Maudry 686218c639 API: branchement init_api dans l'app Dash (#78)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-05-13 14:07:47 +02:00
Colin Maudry f24d0ba168 API: blueprint flask-smorest + endpoint /health (#78)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-05-13 13:52:06 +02:00
Colin Maudry f12ada2fac API: décorateur @require_token (#78) 2026-05-13 13:49:01 +02:00
Colin Maudry a3cfad3d8f API: parser de filtres et génération SQL paramétré (#78)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-05-13 13:45:55 +02:00
Colin Maudry 4b67cde147 API: CLI tokens_cli (create/list/revoke) (#78)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-05-13 13:34:05 +02:00
Colin Maudry ca44b99016 API: tokens_db SQLite CRUD (#78) 2026-05-13 13:19:50 +02:00
Colin Maudry 1d190e4086 API: ajouter MATOMO_URL et MATOMO_SITE_ID dans .template.env (#78) 2026-05-13 13:05:58 +02:00
Colin Maudry bc3b09e2a9 API: dépendances et squelette de package (#78)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-05-13 13:04:09 +02:00
Colin Maudry 0363e89301 Plan : implémentation API privée (#78)
14 tâches TDD couvrant deps, tokens_db, CLI, filters, auth, blueprint,
endpoints (/health, /schema, /data), tracking SQLite + Matomo, OpenAPI,
changelog, mention page À propos.

Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
2026-05-13 12:55:09 +02:00
Colin Maudry 19d69e965f Format préfixe token #78 2026-05-13 12:29:41 +02:00
Colin Maudry 8fb1a2084d Spec : API privée tabulaire avec tokens (#78)
Design retenu : blueprint Flask + flask-smorest sur /api/v1, endpoint
tabulaire générique aligné sur le swagger data.gouv.fr, tokens Bearer
admin manuels (CLI), suivi via Matomo async + compteurs SQLite légers.

Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
2026-05-13 12:18:35 +02:00
Colin Maudry 75e5aeaf40 Merge tag 'v2.7.7' into dev
- Suppression des mentions sur les profils d'acheteur. Omnikles/Safetender publie via l'API DUME et Klekoon ne publie pas, mais c'est peut-être pas le seul, donc je préfère supprimer et refaire un tour.
2026-05-11 10:35:56 +02:00
Colin Maudry b8af6a17a1 Merge branch 'release/2.7.7' 2026-05-11 10:35:29 +02:00
Colin Maudry 0c9666204b Autorisation du HTML dans les annonces 2026-05-11 10:34:06 +02:00
Colin Maudry cd468a837c Changelog v2.7.7 2026-05-11 10:31:18 +02:00
Colin Maudry 8a2f7f620c Suppression des mentions sur les profils d'acheteurs qui ne publient pas de données
Omnikles publie via l'API DUME de l'AIFE, ne reste que Klekoon. Mais bon, ça fait des mauvaises vibes sur la page de le préciser :)
2026-05-11 10:26:16 +02:00
Colin Maudry 3a73cdf4b9 P dans les announcements plus compacts 2026-05-05 15:43:08 +02:00
Colin Maudry 62eb4d98f0 Correction de l'ajout de CORS 2026-05-05 15:32:27 +02:00
Colin Maudry 6fdec32b29 Merge tag 'v2.7.6' into dev
- Correction du problème de filtre par date dans les tableaux
- Retour des cartes dans les pages acheteur et titulaire
- Possibilité de chercher un SIRET/SIREN avec des espaces dans les champs `SIRET acheteur` et `Identifiant titulaire`
2026-05-05 15:06:32 +02:00
Colin Maudry 1447a9fcaf Merge branch 'release/2.7.6' 2026-05-05 15:05:55 +02:00
Colin Maudry 9d7f33905f Bumped version 2.7.6 2026-05-05 15:05:36 +02:00
Colin Maudry 755b8c13ab Bug nom colonne, amélioration test #76 2026-05-05 14:56:59 +02:00
Colin Maudry f4b57dbe5c Gestion des filtres de dates comme du texte #76 2026-05-05 14:08:50 +02:00
Colin Maudry 0322c20513 Suppression des espaces pour l'affichage du nom de l'org #75 2026-04-29 18:41:45 +02:00
Colin Maudry edbdeaa370 Suppression des espaces dans les SIREN/SIRET entrés dans l'observatoire et le tableau #75 2026-04-29 18:25:22 +02:00
Colin Maudry 25746b4869 Amélioration du rendu de la carte org 2026-04-28 13:34:33 +02:00
Colin Maudry 1a5f049b1a Map fonctionne mais lf cassé 2026-04-28 11:23:02 +02:00
Colin Maudry bd6a4ff266 Tentative de rétablissement de la carte sur acheteur/titulaire 2026-04-28 10:40:50 +02:00
Colin Maudry 1839928e69 Réduction des petites erreurs 2026-04-24 13:36:15 +02:00
Colin Maudry a6049b3244 Bumped version checkout 2026-04-24 13:35:49 +02:00
Colin Maudry d8ee6e5b37 Màj du mode d'emploi de Tableau #42 2026-04-24 12:31:46 +02:00
Colin Maudry b437decf5f Merge branch 'main' into dev 2026-04-24 12:10:51 +02:00
Colin Maudry 10f24dec30 Petites corrections 2026-04-24 12:08:48 +02:00
Colin Maudry 18b5488051 Merge tag 'v2.7.5' into dev
- Amélioration des permormances de l'observatoire
- Possibilité dans observatoire (champ objet) et tableau (tous champs texte) de soit chercher des mots présents, soit une suite de mot précise (voir mode d'emploi dans Tableau)
- Ajout d'une animation pendant le chargement de la prévisualisation des données de l'observatoire
2026-04-24 11:51:18 +02:00
Colin Maudry 7d8f8a7c19 Merge branch 'release/2.7.5' 2026-04-24 11:50:47 +02:00
Colin Maudry 93777cce6d Changelog v2.7.5 2026-04-24 11:50:36 +02:00
Colin Maudry dadbb0aeff Possibilité de chercher soit des mots présents, soit une suite de mot précise #42 2026-04-24 11:40:02 +02:00
Colin Maudry f7b7954ed2 Merge branch 'feature/72_observatoire_duckdb_filters' into dev 2026-04-23 12:33:48 +02:00
Colin Maudry fc4d965b20 Spinner de chargemetn sur la préviusalisation des données 2026-04-23 12:33:30 +02:00
Colin Maudry a715140af0 test(observatoire): intégration DuckDB pour prepare_dashboard_data (#72) 2026-04-23 00:07:24 +02:00
Colin Maudry c45d4e0ea1 refactor(observatoire): appelants utilisent la nouvelle signature (#72)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-04-22 23:57:10 +02:00
Colin Maudry 0777153c82 refactor(observatoire): prepare_dashboard_data utilise DuckDB (#72) 2026-04-22 23:55:45 +02:00
Colin Maudry 6e670c97c9 feat(observatoire): filtres montant min/max (#72) 2026-04-22 23:53:43 +02:00
Colin Maudry 522c467702 feat(observatoire): filtres liste via list_has_any (#72) 2026-04-22 23:49:32 +02:00
Colin Maudry 74ae1fb008 feat(observatoire): IN départements et skip conditionnel par ID (#72) 2026-04-22 23:43:55 +02:00
Colin Maudry e3a0fba4df feat(observatoire): filtres LIKE/ILIKE dans dashboard_filters_to_sql (#72) 2026-04-22 23:42:43 +02:00
Colin Maudry a382370767 feat(observatoire): filtres d'égalité simples dans dashboard_filters_to_sql (#72) 2026-04-22 23:39:13 +02:00
Colin Maudry 653999693c feat(observatoire): squelette de dashboard_filters_to_sql (#72) 2026-04-22 23:36:59 +02:00
Colin Maudry aaf54eef91 docs(observatoire): plan d'implémentation filtrage natif DuckDB (#72)
Plan en 10 tâches TDD : construction incrémentale de dashboard_filters_to_sql,
réécriture de prepare_dashboard_data, adaptation des 3 appelants de
observatoire.py, test d'intégration sur tests/test.parquet.
2026-04-22 23:21:47 +02:00
Colin Maudry b996eb97cc docs(observatoire): spec du filtrage natif DuckDB (#72)
Décrit la refonte de prepare_dashboard_data pour pousser le filtrage au
niveau DuckDB via un nouveau helper dashboard_filters_to_sql, sur le
modèle de filter_query_to_sql / _fetch_page_sql.
2026-04-22 23:16:41 +02:00
Colin Maudry 3e89dacff9 Correction de setup_table_columns et autres 2026-04-22 21:16:51 +02:00
Colin Maudry eb8d7abe0d actions/checkout@v4 2026-04-22 20:55:22 +02:00
Colin Maudry a484984e40 Merge tag 'v2.7.4' into dev
- Utilisation élargie de DuckDB au détriment de Polars => bien meilleure perf ([#72](https://github.com/ColinMaudry/decp.info/issues/72)
2026-04-22 20:50:47 +02:00
Colin Maudry bea160aa00 Merge branch 'release/2.7.4' 2026-04-22 20:50:12 +02:00
Colin Maudry 8e603d2806 Bump version number 2026-04-22 20:49:57 +02:00
Colin Maudry 1d833bb800 Merge branch 'feature/72_duckdb_performance' into dev 2026-04-22 20:48:39 +02:00
Colin Maudry f81c897342 Changelog 2.7.4 2026-04-22 20:48:27 +02:00
Colin Maudry 3532a9c381 Path de duckdb configurable, correction des tests #72 2026-04-22 20:43:38 +02:00
Colin Maudry b4956c34d1 Utilisation d'une seule fonction postprocess #72 2026-04-22 18:30:36 +02:00
Colin Maudry 72d4881796 Simplifications du code #72 2026-04-22 17:17:54 +02:00
Colin Maudry 1e67d329d0 perf(tableau): pousser filtre/tri/pagination/comptage dans DuckDB
Remplace le chemin lent de prepare_table_data (chargement de toutes les
lignes depuis DuckDB puis filtrage/post-traitement Polars avant slice)
par _fetch_page_sql qui pousse filtre, tri, pagination et comptage dans
DuckDB via filter_query_to_sql / sort_by_to_sql, puis post-traite
uniquement la page de 20 lignes.

Supprime _load_filter_sort_postprocess (plus utilisé). Met à jour les
tests test_table.py en supprimant les tests associés et en ajoutant
des tests dédiés pour _fetch_page_sql. Corrige le fixture flask_app
pour utiliser src.utils.cache (même instance que le module) afin que
@cache.memoize() fonctionne.

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-04-21 23:53:45 +02:00
Colin Maudry 4e25ff5c85 feat(table): ajouter postprocess_page pour post-traiter une page seule
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-04-21 23:42:52 +02:00
Colin Maudry cdb6a70f7a feat(db): ajouter count_marches, count_unique_marches et paramètre offset à query_marches
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-04-21 23:39:51 +02:00
Colin Maudry 74213d3844 fix(table_sql): gérer *foo* et utiliser isinstance pour les types Polars
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-04-21 23:37:03 +02:00
Colin Maudry 95c90e319e feat: ajouter traducteurs filter_query→SQL et sort_by→SQL
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-04-21 23:33:49 +02:00
Colin Maudry abc6390174 Améliorations CLAUDE.md pour plus utiliser rtk 2026-04-21 21:55:18 +02:00
Colin Maudry 6d22b7298a Merge tag 'v2.7.3' into dev
- Mise en cache des vues tableau par ensemble de filtres et de tris
- Résolution du bug d'écriture du fichier de vérouillage de la base de données
2026-04-20 11:55:55 +02:00
Colin Maudry e33e5da619 Merge branch 'release/2.7.3' 2026-04-20 11:42:17 +02:00
Colin Maudry ffeb708f1d Changelog 2.7.3 2026-04-20 11:42:04 +02:00
Colin Maudry aa445b6f01 Plan #72 2026-04-20 11:36:38 +02:00
Colin Maudry 330ed4f0cb Base de données et .lock à la racine de decp.info 2026-04-20 11:28:00 +02:00
Colin Maudry da5a99b3af Merge branch 'main' into dev 2026-04-20 10:49:31 +02:00
Colin Maudry 285ed37d79 Correction de l'import d'utils.cache 2026-04-20 00:06:44 +02:00
Colin Maudry e44fe452b2 Corrections de typage et d'appels à filter_table_data 2026-04-19 23:55:20 +02:00
Colin Maudry 7aef7acd34 Petits ajustements (cache => utils, noms de variables) 2026-04-19 23:49:02 +02:00
Colin Maudry 3ce6f224ae rtk, uv, pyproject 2026-04-19 23:39:33 +02:00
Colin Maudry c7c7c2c62c Factorisation des opération de postprocess des tables 2026-04-19 23:28:45 +02:00
Colin Maudry ad58c1152a Améliorations sur le typage 2026-04-19 23:23:07 +02:00
Colin Maudry 19449969d6 Mention de rtk dans CLAUDE.md 2026-04-19 23:22:48 +02:00
Colin Maudry b0d2aca4ff perf(tableau): memoize filter+sort+postprocess pipeline (#72)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-04-19 22:50:32 +02:00
Colin Maudry 0abbd982ea feat: add memoized _load_filter_sort_postprocess helper (#72)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-04-19 22:39:13 +02:00
Colin Maudry 18d07b5398 feat: add normalize_sort_by hashable cache-key helper (#72)
Add normalize_sort_by function to convert Dash DataTable's sort_by list
(unhashable) into a tuple representation (hashable) for use in cache keys.
Includes TDD-driven tests for empty inputs, hashability, and order preservation.

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-04-19 22:36:55 +02:00
Colin Maudry ff425108b0 fix: restore track_search import in table.py (#72) 2026-04-19 22:34:25 +02:00
Colin Maudry 0c7ca04f8e refactor: move track_search out of filter_table_data into callers (#72)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-04-19 22:32:28 +02:00
Colin Maudry 89904a5bad test: scaffold unit tests for table utilities (#72) 2026-04-19 22:30:28 +02:00
Colin Maudry 4d0baebb75 Vérification de l'existence de cache_dir 2026-04-19 15:54:36 +02:00
Colin Maudry 5ccfec35e9 Merge tag 'v2.7.2' into dev
- Chargement des données depuis une base DuckDB plutôt qu'en mémoire (plus de stabilité) ([#71](https://github.com/ColinMaudry/decp.info/issues/71))
- Mise en cache des vue sur l'observatoire pour un chargement plus rapide (remise à zéro quotidienne)
- Correction de bug : la liste de colonnes par défaut est bien appliquée plutôt qu'afficher toutes les colonnes
- Quelques corrections de bugs d'affichage
- Refactorisation des fonctions utilitaires (`utils.py` approchait des 1 000 lignes)
2026-04-19 15:33:58 +02:00
Colin Maudry 38f7543205 Merge branch 'release/2.7.2' 2026-04-19 15:32:41 +02:00
Colin Maudry 26169abc2f Suppression du cache à chaque redémarrage 2026-04-19 15:29:34 +02:00
Colin Maudry 1eb579da57 Logging des cache miss si DEVELOPMENT 2026-04-19 15:23:02 +02:00
Colin Maudry 1f5ffe2962 Changelog 2.7.2 2026-04-19 15:22:09 +02:00
Colin Maudry 4c4b010f44 Correction des tests avec données db 2026-04-18 21:39:36 +02:00
Colin Maudry 9d9760e596 Cache 2026-04-18 20:06:46 +02:00
Colin Maudry a7516d65e3 Utilisation du logger global dans app et db 2026-04-18 19:28:34 +02:00
Colin Maudry 600567330f Améliorations typing 2026-04-18 19:01:22 +02:00
Colin Maudry af3b3464e4 Refactorisation utils 2026-04-18 19:01:07 +02:00
Colin Maudry e4e1438220 Refactorisation des fonctions utils 2026-04-18 18:33:09 +02:00
Colin Maudry e352624c02 Capitalisation des constantes 2026-04-18 18:09:42 +02:00
Colin Maudry accdfe1384 Merge branch 'feat/duckdb-migration' into dev 2026-04-18 16:57:45 +02:00
Colin Maudry da13ed7984 DuckDB migration design spec #71 2026-04-18 16:57:41 +02:00
Colin Maudry 035e6b7ac3 Formatage prettier (reformatage automatique) 2026-04-16 11:13:08 +02:00
Colin Maudry 71f21b733f Mesure de l'impact mémoire post-migration DuckDB (#71) 2026-04-16 11:12:50 +02:00
Colin Maudry 09ddb0f485 Suppression des dataframes globaux remplacés par DuckDB (#71) 2026-04-16 11:11:58 +02:00
Colin Maudry 342f7b53a9 figures.py : remplacement de df.columns par schema.names() depuis src.db (#71) 2026-04-16 11:09:43 +02:00
Colin Maudry 88016d9517 observatoire.py : migration vers query_marches et schema depuis src.db (#71) 2026-04-16 11:09:22 +02:00
Colin Maudry 5ecfb463f3 tableau.py : migration vers query_marches et schema depuis src.db (#71) 2026-04-16 11:08:45 +02:00
Colin Maudry 1655af375c arbre/liste_marches_org.py : requêtes DuckDB pour les listes de marchés (#71) 2026-04-16 11:07:59 +02:00
Colin Maudry cba3128b8f departement.py : requêtes DuckDB sur acheteurs_departement et titulaires_departement (#71) 2026-04-16 11:07:32 +02:00
Colin Maudry a31d996812 titulaire.py : migration vers query_marches et schema depuis src.db (#71) 2026-04-16 11:07:07 +02:00
Colin Maudry e89311f3ab acheteur.py : migration vers query_marches et schema depuis src.db (#71) 2026-04-16 11:06:35 +02:00
Colin Maudry 31b68079e0 marche.py : utilisation de query_marches au lieu du df global (#71) 2026-04-16 11:05:52 +02:00
Colin Maudry 9cf92563ae Intégration de src.db dans utils (coexistence avec les globaux) (#71) 2026-04-16 11:05:18 +02:00
Colin Maudry 94ff13a66b test: reconstruction de la base DuckDB de test avant chaque session (#71) 2026-04-16 11:04:44 +02:00
Colin Maudry 4715db282e Les boutons de Tableau passent à ligne si écran plus étroit 2026-04-15 17:49:25 +02:00
Colin Maudry 2d592842ab Suppression print/logs inutiles 2026-04-15 16:33:57 +02:00
Colin Maudry cfd0da34cd test(db): sérialisation des builds concurrents par fcntl.flock (#71)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-04-15 16:27:41 +02:00
Colin Maudry f31522734c Connexion DuckDB globale, verrou fcntl et query_marches
- _ensure_database : vérifie rebuild sous verrou fcntl exclusif
- conn en lecture seule au niveau module, schema importé via SELECT LIMIT 0
- query_marches : helper SQL paramétré retournant un pl.DataFrame
- get_cursor : cursor par appel pour thread-safety Dash
- pyarrow ajouté en dépendance (requis par duckdb .pl())

refs #71

Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>
2026-04-15 16:23:09 +02:00
Colin Maudry 077af6dd2e Implémentation de build_database avec transforms Polars et tables dérivées
- _load_source_frame reprend la pipeline Polars (sort, filtre donneesActuelles,
  booleans_to_strings, remplacement des noms null)
- build_database utilise write_parquet + read_parquet pour zéro-dépendance
  pyarrow (pyarrow absent du venv) et écrit atomiquement via .tmp + os.replace
- 4 tables dérivées : acheteurs_marches, titulaires_marches,
  acheteurs_departement, titulaires_departement

refs #71

Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>
2026-04-15 16:16:12 +02:00
Colin Maudry 553e23dd98 Nettoyage des tests should_rebuild suite à la revue
- Import de should_rebuild au niveau module
- Suppression d'un setenv DEVELOPMENT inutile (branche db-missing)
- Utilisation de os.utime pour un ordre mtime déterministe

refs #71

Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>
2026-04-15 16:10:17 +02:00
Colin Maudry e83df64261 Ajout de src.db.should_rebuild et ses tests
refs #71
2026-04-15 16:07:41 +02:00
Colin Maudry 0c3b0265b4 Ajout de la dépendance duckdb
Ajoute duckdb (==1.5.2) à pyproject.toml et ignore les artefacts
runtime (decp.duckdb, .tmp, .lock) qui sont régénérés au démarrage
depuis decp_prod.parquet.

refs #71

Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>
2026-04-15 16:03:06 +02:00
Colin Maudry fd1a801ddb Ignore .worktrees pour exécution en worktree isolé
refs #71

Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>
2026-04-15 13:50:31 +02:00
Colin Maudry 035d7f23fa Plan de migration DuckDB — découpage en 20 tâches
20 étapes bite-sized couvrant : dépendance duckdb + .gitignore,
should_rebuild (TDD), build_database avec transforms Polars et verrou
fcntl, startup guard + query_marches, migration page-par-page
(marche → acheteur → titulaire → arbre → tableau → observatoire →
figures), suppression des globaux Polars, mesure RSS avant/après.

Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>
2026-04-15 13:37:49 +02:00
Colin Maudry e75a69e259 Spec: DuckDB migration for decp data layer
Replace global Polars dataframes in src/utils.py (lines 891-913) with
an on-disk DuckDB database, built at startup from decp_prod.parquet.
Keeps two small search-path frames (df_acheteurs, df_titulaires) in
memory; moves heavy filtering and aggregation to DuckDB via a
query_marches helper that returns pl.DataFrame.

Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>
2026-04-15 13:19:52 +02:00
Colin Maudry 9a19e5cba7 Mise en place d'un cache pour l'observatoire 2026-04-15 12:11:44 +02:00
Colin Maudry 0d0c0d0a75 Acheteur et titulaire appliquent bien la liste de colonnes par défaut 2026-04-15 11:35:10 +02:00
Colin Maudry ade9a20926 Tableau applique bien la liste de colonnes par défaut 2026-04-14 17:39:52 +02:00
Colin Maudry 24e0cee2b1 Améliorations de typage 2026-03-30 14:58:18 +02:00
Colin Maudry 9e8811e080 Merge tag 'v2.7.1' into dev
- Correction du partage de données filtrées entre dashboard et vue des données
2026-03-23 13:40:10 +01:00
Colin Maudry 06186c1691 Merge branch 'hotfix/2.7.1' 2026-03-23 13:40:01 +01:00
Colin Maudry 30b6874045 Changelog 2.7.1 2026-03-23 13:39:49 +01:00
Colin Maudry 6e5f4011e5 On garde toutes les valeurs en paramètre puour prepare_dashboard_data 2026-03-23 13:39:37 +01:00
Colin Maudry 1f48319a0f Utilisation d'un store plutôt que df global, regroupement des inputs/outputs 2026-03-23 13:25:08 +01:00
Colin Maudry 75005f43af Merge tag 'v2.7.0' into dev
- Remplacement de la page Statistiques par l'observatoire
- Généralisation de la grille dash (`dbc.Row`, `dbc.Col`)
- Ajout de l'histogramme de distances aux pages acheteur et titulaire
- Ajout de la colonne `acheteur_categorie` (commune, État, etc.)
2026-03-23 07:49:56 +01:00
Colin Maudry 08fc4dcfdc Merge branch 'release/2.7.0' 2026-03-23 07:49:04 +01:00
Colin Maudry ad3f2cf654 Changelog 2.7.0 2026-03-23 07:48:54 +01:00
Colin Maudry 24bce6e2d6 Lien vers #sources 2026-03-23 07:43:37 +01:00
Colin Maudry 72da1a15e2 Nettoyage HTML recherche.py 2026-03-23 07:43:37 +01:00
Colin Maudry f4514bf06c Le bouton Partager n'apparaît que s'il y a des filtres 2026-03-23 07:43:02 +01:00
Colin Maudry a54f78875e Utilise l'année en cours pour plafonner les données du graph sources #65 2026-03-21 12:25:31 +01:00
Colin Maudry 7b78e0a0ea Style, ordre des années #65 2026-03-21 12:09:00 +01:00
Colin Maudry eecd75ac42 Style des boutons Prévisualiser et Partager #65 2026-03-21 11:55:48 +01:00
Colin Maudry b06f3c91e0 test: add multi-param URL round-trip test for observatoire
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-03-21 11:33:38 +01:00
Colin Maudry 139b820b6b fix: remove duplicate observatoire-share-url element in layout
Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>
2026-03-21 11:32:43 +01:00
Colin Maudry bb2cde2fc5 feat: sync_observatoire_share_url encodes all 17 filter params
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-03-21 11:31:47 +01:00
Colin Maudry 3957ca1662 feat: restore_filters reads all 17 filter params from URL
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-03-21 11:27:54 +01:00
Colin Maudry 547accd7be fix: update test_010 to use prepare_dashboard_data instead of removed _apply_filters
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-03-21 11:25:54 +01:00
Colin Maudry ff6b5d0d41 Add design spec for full URL sharing on observatoire page 2026-03-21 11:15:26 +01:00
Colin Maudry a3dce84cc5 Merge branch 'feature/preview_data' into dev 2026-03-21 10:28:19 +01:00
Colin Maudry e6bf671f16 Prévisualisation des données: bonnes données téléchargées #65 2026-03-21 10:28:07 +01:00
Colin Maudry b34f63f711 Prévisualisation des données: choix des colonnes #65 2026-03-21 10:17:58 +01:00
Colin Maudry d6e14e2564 Prévisualisation des données fonctionnelle #65 2026-03-21 10:02:11 +01:00
Colin Maudry dd63feeeac Style des boutons 2026-03-20 17:49:27 +01:00
Colin Maudry 3b2cb15935 Prévisualisation basique des données #65 2026-03-20 17:38:10 +01:00
Colin Maudry 91ea9eccea Top 10 acheteurs et titulaires #65 2026-03-20 16:44:29 +01:00
Colin Maudry a89677604b Médian des distances titulaire-acheteur #65 2026-03-20 14:20:44 +01:00
Colin Maudry e5419bab9c Donut : ajout à autres si moins de 1% #65; 2026-03-20 13:57:44 +01:00
Colin Maudry 4f9f31c4c7 Ajout des filtres objet et code CPV #65 2026-03-20 11:46:56 +01:00
Colin Maudry 28fdca2a06 Tri des départements pour dropdown #65 2026-03-20 11:33:25 +01:00
Colin Maudry 771dcf0ea1 Moins de barres dans l'histogramme distances #65 2026-03-20 11:32:50 +01:00
Colin Maudry dac9efee88 Carte résumé => figures.py #65 2026-03-20 10:20:44 +01:00
Colin Maudry 50c3947c04 Filtres sur techniques, sous-traitance, innovant #65 2026-03-19 18:36:54 +01:00
Colin Maudry 9852d55a3d Tentative de tri des départemetns 2026-03-19 13:02:42 +01:00
Colin Maudry 144e714235 fix: reduce right margin in distance histogram to use full card width
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-03-19 13:02:41 +01:00
Colin Maudry a9d3d96a5e "Partager" masqué dans l'observatoire pour l'instant #65 2026-03-19 00:04:59 +01:00
Colin Maudry dbfc20921a Amélioration du layout dans titulaire et acheteur 2026-03-18 23:54:41 +01:00
Colin Maudry d8f1a884a3 fix: show actual km ranges in distance histogram tooltip
Replace px.histogram with manually-computed go.Bar so hover text
displays human-readable distance ranges (e.g. "8.9 – 10.0 km")
instead of raw log10 bin values.

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-03-18 23:35:04 +01:00
Colin Maudry 0ac6c55d9e Correction imports 2026-03-18 23:21:47 +01:00
Colin Maudry 6a6be51455 refactor: replace CSS grid layout with Dash Bootstrap Components grid
Replace the custom CSS grid (`.wrapper`, `.org_*`, `.results_*` classes)
in acheteur, titulaire, and recherche pages with dbc.Row/dbc.Col.

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-03-18 23:21:17 +01:00
Colin Maudry 52958ccbaa Merge branch 'feature/65_observatoire' into dev 2026-03-18 22:59:28 +01:00
Colin Maudry 8a61d3268a fix: lecture du dataframe plus flexible dans la création de l'histogram 2026-03-18 22:53:17 +01:00
Colin Maudry 32aa877797 fix: guard against missing titulaire_distance column in get_distance_histogram 2026-03-18 22:40:28 +01:00
Colin Maudry 858ab6c61a feat: add distance histogram to titulaire detail page 2026-03-18 22:28:34 +01:00
Colin Maudry b08d517f36 feat: add distance histogram to acheteur detail page 2026-03-18 22:26:57 +01:00
Colin Maudry 44d2d7d2c1 feat: add distance histogram card to observatoire dashboard
Integrate the get_distance_histogram function into the observatoire dashboard
to display buyer-contractor distance distribution on a logarithmic scale.

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-03-18 22:24:01 +01:00
Colin Maudry f2af09bb35 fix: use streaming collect and filter zero distances in get_distance_histogram 2026-03-18 22:22:54 +01:00
Colin Maudry 24db748b6a feat: add get_distance_histogram figure function
Implement get_distance_histogram that creates a histogram of titulaire distances
with logarithmic scale. Add 3 unit tests covering basic functionality, null handling,
and edge cases. Also add DATA_SCHEMA_PATH to pytest env config.

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-03-18 22:15:26 +01:00
Colin Maudry 1ffa995a4a docs: spec for distance histogram on observatoire, acheteur, titulaire pages
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-03-18 22:02:20 +01:00
Colin Maudry 9da3d9ce34 Ne pas supprimer les données de test à la fin 2026-03-18 21:48:23 +01:00
Colin Maudry 125c520c19 Claude memory 2026-03-18 21:47:29 +01:00
Colin Maudry 78d528f75b Filtre par montant #65 2026-03-18 21:13:21 +01:00
Colin Maudry c77511d4e8 Taille de donut flexible #65 2026-03-18 20:57:30 +01:00
Colin Maudry f2046d6ba7 Meilleure intégration du nom de l'org #65 2026-03-18 20:46:38 +01:00
Colin Maudry 26dd2aaf1a Correction de l'injection du nom d'org dans le titre #65 2026-03-18 20:41:46 +01:00
Colin Maudry f8fffb6fa4 get_top_org un peu plus configurable #65 2026-03-18 20:40:59 +01:00
Colin Maudry b4a42449ad feat: restore observatoire filters from localStorage on page load #65 2026-03-18 20:35:31 +01:00
Colin Maudry 051e908bd1 feat: save observatoire filters to localStorage on change #65 2026-03-18 20:33:15 +01:00
Colin Maudry 1fdcb12dd2 feat: add dcc.Store and debounce text inputs on observatoire page #65 2026-03-18 20:32:43 +01:00
Colin Maudry 5d4c0b8438 test: failing test for observatoire localStorage filter persistence #65 2026-03-18 20:31:45 +01:00
Colin Maudry 958c3956ea Correction des problèmes de double reload #65 2026-03-18 16:05:29 +01:00
Colin Maudry acb8500dc0 Test e2e : recherche → observatoire #65
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-03-18 15:02:27 +01:00
Colin Maudry e804b6bca2 URL partageable pour la page observatoire #65
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-03-18 14:59:32 +01:00
Colin Maudry 3745f6df74 Callback URL → filtres sur la page observatoire #65
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-03-18 14:55:41 +01:00
Colin Maudry bf1791635f Ajout du lien observatoire dans titulaire_nom via add_links() #65
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-03-18 14:48:05 +01:00
Colin Maudry 1d88682f85 Ajout du lien observatoire dans acheteur_nom via add_links() #65
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-03-18 14:43:10 +01:00
Colin Maudry d1a876ba9c Plan d'implémentation : lien observatoire depuis recherche/tableau #65
Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>
2026-03-18 14:35:58 +01:00
Colin Maudry 3a70bbd9ea Ajout du spec : lien observatoire depuis recherche/tableau #65
Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>
2026-03-18 14:24:11 +01:00
Colin Maudry 79a06f996e Bouton de téléchargement des données #65 2026-03-18 13:54:00 +01:00
Colin Maudry 2f90a754ab Style inputs, ajout donut type marché #65 2026-03-18 13:38:38 +01:00
Colin Maudry d50ec5b01e Statistiques => Observatoire #65 2026-03-17 22:59:01 +01:00
Colin Maudry c02fb995c5 Ajout de filtres et des donuts de catégorie #65 2026-03-17 22:44:15 +01:00
Colin Maudry 6c778882f9 Filtre par type de marché #65 2026-03-17 20:51:09 +01:00
Colin Maudry e754a3a217 Configuration fine des tailles de cartes #65 2026-03-17 20:33:36 +01:00
Colin Maudry 9629231e29 Fixed masquage silencieux de la chloropleth #65 2026-03-17 17:30:41 +01:00
Colin Maudry ab3377ef60 Grid de cards avec points de rupture #65 2026-03-17 17:16:24 +01:00
Colin Maudry f531ce7091 Choix de carte dynamique, même pour les TOM #65 2026-03-16 18:06:32 +01:00
Colin Maudry adc8457abc Cartes avec cluster de points si > lignes #65 2026-03-15 16:05:33 +01:00
Colin Maudry 302d253e6e Utilisation de cluster de marqueurs grâce à dash-leaflet #65 2026-03-14 00:28:02 +01:00
Colin Maudry f0f9d8cb3d dashboard_acheteur_departement_code est une liste 2026-03-14 00:15:53 +01:00
Colin Maudry 4771d14744 Utilise map_count_marches si trop de marchés 2026-03-14 00:00:15 +01:00
Colin Maudry d9f97cf8b3 Modification de map_count_marches (plus efficace, utilise le dép de l'acheteur) 2026-03-13 23:59:54 +01:00
Colin Maudry c7d1a5ec73 Début de dashboard avec quelques filtres et viz #65 2026-03-13 19:22:48 +01:00
Colin Maudry 4f19085b75 Merge branch 'main' into feature/65_observatoire 2026-03-03 14:31:00 +01:00
Colin Maudry 0db800fdab Changelog 2.6.2 2026-02-22 18:41:01 +01:00
Colin Maudry 4619dd2708 Correction du téléchargemnent buggé dans /tableau + test 2026-02-22 18:39:31 +01:00
Colin Maudry 367e5f64ff Changelog 2.6.1 2026-02-17 14:50:29 +01:00
Colin Maudry adda58bada Suppresion des liens canoniques, pas trouvé comment les insérer assez tôt 2026-02-17 14:24:46 +01:00
Colin Maudry 2b0b048520 Amélioration du nom titulaire/acheteur 2026-02-15 16:54:30 +01:00
Colin Maudry 5c43bfea78 AMélioration de la génération de liens canoniques (pas de doublons) 2026-02-15 16:50:09 +01:00
Colin Maudry 15c5a800ed Merge tag 'v2.6.0' into dev
- Suite de la refonte graphique
- Persistence des filtres, des tris et des choix de colonnes sur toutes les pages
- Joli tableau pour choisir les colonnes à afficher
- Meilleure gestion des acheteurs et titulaires absents de la base SIRENE
- Amélioration du SEO (liens canoniques)
2026-02-05 18:23:44 +01:00
Colin Maudry 83119b86e9 Merge branch 'release/2.6.0' 2026-02-05 18:23:26 +01:00
Colin Maudry af89bb0630 Plus grosses cases à cocher 2026-02-05 18:22:17 +01:00
Colin Maudry eb5be1972e Correction de soucis de sauvegarde des colonnes dans acheteur.py 2026-02-05 18:10:20 +01:00
Colin Maudry b303a8bea6 Bump version 2.6.0 et changelog 2026-02-05 17:29:54 +01:00
Colin Maudry 472fbb7cbb Améliorations des textes et petits ajustements 2026-02-05 17:16:31 +01:00
Colin Maudry 6891aabd4d Merge branch 'feature/ui_tests' into dev 2026-02-05 15:05:59 +01:00
Colin Maudry 3beedbcfe4 Test de la persistence des fitres (toutes pages) 2026-02-05 15:05:37 +01:00
Colin Maudry 37e893d642 Utilisation de la persistence sur /acheteurs 2026-02-05 14:54:30 +01:00
Colin Maudry 64fc40e5aa Meilleure gestion des SIRET absents du SIRENE dans acheteur et titulaire 2026-02-05 14:18:38 +01:00
Colin Maudry cb885eeb90 Utilisation des options de persistence de Dash 2026-02-04 23:59:01 +01:00
Colin Maudry 61dbf237cf Premier test UI 2026-02-04 23:33:59 +01:00
Colin Maudry 39af4bafbe titulaire : clientside callback ajouté 2026-02-04 13:05:59 +01:00
Colin Maudry f480439985 acheteur : le clientside callback est aussi trigger quand les colonnes affichées changent 2026-02-04 13:04:11 +01:00
Colin Maudry ad9b4f0fdf Nettoyage des filtres aussi sur acheteur (clientside callback) 2026-02-04 12:17:41 +01:00
Colin Maudry 0532f6b0a7 Colonnes, filtres et tri de la page titulaire en LocalStorage (buggy) 2026-02-04 09:46:22 +01:00
Colin Maudry 6fdf01e5e1 Colonnes, filtres et tri de la page acheteur en LocalStorage 2026-02-02 19:56:27 +01:00
Colin Maudry 15de2aaf17 Placeholder de dropdown plus visible 2026-02-02 19:51:40 +01:00
Colin Maudry 55e2992559 id table => tableau_datatable 2026-02-02 19:51:21 +01:00
Colin Maudry f16cca036d Toutes les pages s'ouvrent dans le même onglet puisque plus de perte de filtre 2026-02-02 19:02:27 +01:00
Colin Maudry deba0a244e Ajout d'un lien canonique vers chaque page dans le head #70
Dynamique, donc pas sûr que les moteurs de recherche le voit.
2026-02-02 18:28:50 +01:00
Colin Maudry ef11184286 Les colonnes masquées sont stockées en LocalStorage et correctement synchronisées 2026-02-02 17:11:32 +01:00
Colin Maudry edd52d471e Suppression (pour l'instant de la carte acheteur/titulaire) 2026-01-31 19:20:41 +01:00
Colin Maudry 7b3ea9c580 Les tris sont stockés en LocalStorage 2026-01-31 19:12:34 +01:00
Colin Maudry bfc4065cbb Les filtres sont stockés en LocalStorage 2026-01-31 18:28:19 +01:00
Colin Maudry 41a832d7be Tableau de choix des colonnes aussi sur les pages acheteur et titulaire 2026-01-31 17:38:54 +01:00
Colin Maudry 1561cb3c9a Tableau de choix des colonnes => filtrable 2026-01-31 01:44:11 +01:00
Colin Maudry f1725a95f8 Une ligne de boutons 2026-01-31 01:41:08 +01:00
Colin Maudry b59afd1cbc Merge branch 'feature/columns_modal' into dev 2026-01-31 01:34:20 +01:00
Colin Maudry 75b42f4baf Correction bug style cell 2026-01-31 01:33:26 +01:00
Colin Maudry 8f5d38ff78 Petites améliorations sur les boutons 2026-01-31 01:29:37 +01:00
Colin Maudry bd149ff11f Meilleure gestion des styles dans les tableaux 2026-01-31 01:27:59 +01:00
Colin Maudry cd81aa9532 Syncro sélection de colonnes et tableau fonctionnelle 2026-01-31 01:04:49 +01:00
Colin Maudry 2a381f6dbb Merge branch 'feature/mode_demploi_modal' into dev 2026-01-30 21:14:03 +01:00
Colin Maudry e609bc3e32 Weight des titres 2026-01-30 21:13:29 +01:00
Colin Maudry c3ebdb0057 Améliorations styles tableaux, headers 2026-01-30 20:13:59 +01:00
Colin Maudry 55bb92468e Styles de boutons homogènes 2026-01-30 20:05:58 +01:00
Colin Maudry 965aef06f9 Bonne application des fonts dans les cellules de tableau 2026-01-30 20:04:43 +01:00
Colin Maudry 3ce37784dc Modal mode d'emploi et style boutons 2026-01-30 19:22:54 +01:00
Colin Maudry cee51d929c Petites améliorations au suivi des recherches 2026-01-30 18:29:48 +01:00
Colin Maudry b11aa20743 Correction loggers 2026-01-30 15:19:46 +01:00
Colin Maudry 674639cf6e Merge branch 'main' into dev 2026-01-29 21:49:36 +01:00
Colin Maudry 68a87985c7 Bump version number 2.5.1 2026-01-29 21:48:35 +01:00
Colin Maudry 776aa271f1 Correction de la recherche #67 2026-01-29 21:48:13 +01:00
Colin Maudry 427eb111bf Merge tag 'v2.5.1' into dev
- Mise en production un peu hâtive ([#67](https://github.com/ColinMaudry/decp.info/issues/67), [#68](https://github.com/ColinMaudry/decp.info/issues/68))
2026-01-29 21:27:12 +01:00
Colin Maudry fe7277ce26 Merge branch 'hotfix/2.5.1' 2026-01-29 21:26:57 +01:00
Colin Maudry b68fa3872f Changelog 2.5.1 2026-01-29 21:26:54 +01:00
Colin Maudry b7ff04c69c Correction de l'affichage de la distance 2026-01-29 21:26:16 +01:00
Colin Maudry ccee27baee Correction de la couleur des bordures dans statistiques 2026-01-29 21:19:36 +01:00
Colin Maudry 47e17c48e7 Bugs de créations de noms acheteur/titulaire #67 #68 2026-01-29 21:16:35 +01:00
Colin Maudry e3b57608f4 padding right dans les td 2026-01-29 20:32:35 +01:00
Colin Maudry f4f0d70864 Merge branch 'release/2.5.0' 2026-01-29 20:26:31 +01:00
Colin Maudry 10c69013f0 Bump version 2.5.0 2026-01-29 20:26:00 +01:00
Colin Maudry c08e2fa143 Date changelog 2026-01-29 20:24:43 +01:00
Colin Maudry afd812c50d Suppression des styles non utilisés 2026-01-29 19:55:11 +01:00
Colin Maudry 536d37d67c Correction style tableau sources (bords) 2026-01-29 19:39:22 +01:00
Colin Maudry f43bb14e23 Alignement à droite pour les nombres 2026-01-29 19:38:21 +01:00
Colin Maudry 5422f95ea7 400 et 600 en weight 2026-01-29 19:37:56 +01:00
Colin Maudry 29f6e5c2c2 Finalisation en-têtes 2026-01-29 19:37:35 +01:00
Colin Maudry c311ed5f23 Doublons 2026-01-29 19:36:29 +01:00
Colin Maudry 31d0a626e6 Version number redesign 2026-01-29 19:24:07 +01:00
Colin Maudry 307e3379e0 Angles arrondis OK et tableau aligné 2026-01-29 18:48:30 +01:00
Colin Maudry 1fb18bcf6f Tentative d'angles ronds pour les data tables 2026-01-29 18:23:24 +01:00
Colin Maudry 30e822d435 Quelques améliorations visuelles sur les tableaux 2026-01-29 03:01:50 +01:00
Colin Maudry a44aaf6df6 Changelog 2026-01-29 02:43:14 +01:00
Colin Maudry 8c11a018a0 Alignement du logo et du numéro de version 2026-01-29 02:38:10 +01:00
Colin Maudry a0d6222424 Ajout des attributions pour les fonts 2026-01-29 02:25:47 +01:00
Colin Maudry 25115c305c Smoothing des fonts, logo plus fin 2026-01-29 02:25:24 +01:00
Colin Maudry 9d9533b8a2 Auto-cleanup des filtres après restauration URL 2026-01-29 01:41:21 +01:00
Colin Maudry e4f06acc56 Exemple de filtres domain-agnostic 2026-01-29 01:40:12 +01:00
Colin Maudry e0dc2687c4 Logging bug avec le contenu des filter_part 2026-01-29 01:39:27 +01:00
Colin Maudry 274e06cde4 Hébergement de bootstrap pour supprimer google fonts 2026-01-29 01:37:56 +01:00
Colin Maudry f9aadede8b robots.txt généré par le code #66 2026-01-29 01:37:08 +01:00
Colin Maudry d35862beb0 Réorganisation du CSS 2026-01-29 00:31:30 +01:00
Colin Maudry ed6811266d Nombreuses améliorations esthétiques et texte (font, couleurs, etc.) 2026-01-29 00:23:28 +01:00
Colin Maudry 06f658ccf1 Suivi des filtres comme des recherches, avec page source 2026-01-28 22:18:39 +01:00
Colin Maudry e4c6659205 Exclue des colonnes que si *_left *_right 2026-01-28 22:17:19 +01:00
Colin Maudry 434a659778 Généralisation du logging avec logger 2026-01-28 22:16:11 +01:00
Colin Maudry e573fcccae Page d'accueil plus accueillante, plus de recheche auto 2026-01-28 21:59:54 +01:00
Colin Maudry 84739df7cb Les pages dédiées au SEO ont leur répertoire #66 2026-01-28 21:59:06 +01:00
Colin Maudry 1d241ca9b7 Améliorations de l'UX tableau 2026-01-28 21:15:31 +01:00
Colin Maudry 0264aae3b9 Suivi des filtres appliqués 2026-01-28 18:42:25 +01:00
Colin Maudry fb5c37b34b Merge branch 'feature/66_seo' into dev 2026-01-28 14:06:03 +01:00
Colin Maudry 639b342178 Changelog #66 2026-01-28 14:02:25 +01:00
Colin Maudry e8534c8108 Finalement suppression des json-ld titulaire et acheteur #66 2026-01-28 14:01:15 +01:00
Colin Maudry f5d8026061 Ajout des données JSON-LD aux pages titulaires #66 2026-01-28 13:50:05 +01:00
Colin Maudry 1eecc45e29 Meta keywords (même si a priori ça aide pas pour le SEO) #66 2026-01-28 13:49:19 +01:00
Colin Maudry 07bdcf232d Ajout des données JSON-LD acheteur et fix make_org_jsonld #66 2026-01-28 13:32:08 +01:00
Colin Maudry 6e992e0a6e Ajout des données JSON-LD acheteur #66 2026-01-28 13:30:47 +01:00
Colin Maudry a76a14b030 Petits ajustements 2026-01-28 12:49:04 +01:00
Colin Maudry b3bd488882 Liste des marchés par acheteur et par titulaire #66 2026-01-28 12:48:47 +01:00
Colin Maudry a385e999d3 Plus jolie table des sources 2026-01-28 11:59:04 +01:00
Colin Maudry a4bda0483f Déplacement de la génération des df en bas, nouveaux dfs de base 2026-01-28 11:58:41 +01:00
Colin Maudry 9a1e5bee63 Départements sous forme de liste, ajout des titulaires par département #66 2026-01-28 11:57:41 +01:00
Colin Maudry 1c4fccac6e Nom de l'acheteur et du titulaire dans les titres #66 2026-01-28 11:50:55 +01:00
Colin Maudry 187feee544 Ajout d'une arborescence de departements #66 2026-01-27 17:48:49 +01:00
Colin Maudry 965f24ab92 Meta tag noindex sur test.decp.info 2026-01-26 07:02:03 +01:00
Colin Maudry 3aee2667d0 Meilleure description pour la page d'accueil 2026-01-26 07:01:35 +01:00
Colin Maudry 3d96a5e1b8 Ajout du JSON-LD #66 2026-01-24 17:19:47 +01:00
Colin Maudry 35928d7245 Namespacing de dcc.Location dans /acheteur 2026-01-24 14:44:32 +01:00
Colin Maudry ac42dde488 Fin de l'exception pour les colonnes *_left *_right 2026-01-24 14:43:33 +01:00
Colin Maudry ae366bf014 Page marché : objet en H1, durée restante, catégorie titulaire, distance 2026-01-24 14:42:45 +01:00
Colin Maudry bd64c397dc Namespacing des dcc.Location pour éviter les conflits entre pages 2026-01-24 14:35:12 +01:00
Colin Maudry 937e8be356 distance => titulaire_distance (+ affichage dans vue marché) 2026-01-24 14:19:02 +01:00
Colin Maudry e880eaff12 Description optionnelle 2026-01-22 18:58:23 +01:00
Colin Maudry 07a97293cc Merge branch 'main' into dev 2026-01-22 18:51:17 +01:00
Colin Maudry ef97cea679 Exclure les colonnes _right et _left 2026-01-22 18:49:08 +01:00
Colin Maudry c9fc2a01fc Changelog 2.4.1 2026-01-22 18:36:25 +01:00
Colin Maudry 8002bd711a Gestion des colonnes absentes du schéma 2026-01-22 18:32:27 +01:00
Colin Maudry 1ba78fe8df Màj changelog 2.4.0 2026-01-22 18:17:26 +01:00
Colin Maudry f1e24794e6 Màj changelog 2.4.0 2026-01-22 18:04:29 +01:00
Colin Maudry 9110b78f2a Merge tag 'v2.4.0' into dev
- Site à peu près utilisable sur petit écran (smartphone) ([#63](https://github.com/ColinMaudry/decp.info/issues/63))
- Amélioration du référencement Web (sitemap, titres, descriptions) ([#50](https://github.com/ColinMaudry/decp.info/issues/50))
- Possibilité dans les champs non-numériques de filtrer le texte selon son début ou sa fin (`text*` et `*text`)
- Ajout d'une table des matières dans la page [À propos](https://decp.infi/a-propos) ([#36](https://github.com/ColinMaudry/decp.info/issues/36))
- Désactivation du bloquage des robot d'agents de LLM (robots.txt)
2026-01-22 17:58:47 +01:00
Colin Maudry 2ce6005c88 Merge branch 'release/2.4.0' 2026-01-22 17:57:53 +01:00
Colin Maudry 4234736656 Déblockage de tous les bots d'agents LLM 2026-01-22 17:42:39 +01:00
Colin Maudry 39faeca4d3 Màj mode d'emploi #42 2026-01-22 16:46:19 +01:00
Colin Maudry 82bd82944a Changelog #36 2026-01-22 16:36:55 +01:00
Colin Maudry 92f30a963f Ajout d'une table des matières dans A propos #36 2026-01-22 16:31:25 +01:00
Colin Maudry 267e2e15f8 Possibilité dans les champs non-numériques de filtrer le texte selon son début ou sa fin (text* et *text) #42 2026-01-21 18:04:33 +01:00
Colin Maudry dd52bd5158 Amélioration des titres et descriptions de pages #50 2026-01-21 17:47:03 +01:00
Colin Maudry d499906bbe Génération d'une sitemap #50 2026-01-21 17:40:53 +01:00
Colin Maudry 2fc501efbb Container de l'app toujours fluid, fix noms props #63 2026-01-21 16:32:20 +01:00
Colin Maudry 945f7974c8 Configuration du point de rupture de la navbar à 992px #63 2026-01-21 15:13:59 +01:00
Colin Maudry 1044379425 Meilleur affichage sur petit écran #63 2026-01-21 14:22:52 +01:00
Colin Maudry 421eaa0772 Premier jet navbar #63 2026-01-20 17:31:42 +01:00
Colin Maudry 3776b18ff5 Meilleure gestion des colonnes absentes du schéma 2026-01-20 11:24:26 +01:00
Colin Maudry 6005b2fcb5 Mise en valeur des moyens de consommer les données 2026-01-19 11:44:41 +01:00
Colin Maudry fc99723b2e Gestion des colonnes ajoutées mais absentes du schéma 2026-01-19 11:44:14 +01:00
Colin Maudry c3e801a15a Utilisation des dbc pour /marche #63 2026-01-19 11:34:20 +01:00
Colin Maudry 38ea8834af Merge tag 'v2.3.1' into dev
- Les champs absents du [schéma](https://www.data.gouv.fr/datasets/donnees-essentielles-de-la-commande-publique-consolidees-format-tabulaire?resource_id=9a4144c0-ee44-4dec-bee5-bbef38191d9a) sont ignorés pour éviter les erreurs
2026-01-16 14:16:47 +01:00
Colin Maudry efac172ac8 Merge branch 'hotfix/2.3.1' 2026-01-16 14:11:15 +01:00
Colin Maudry 337f68f2fc Changelog 2.3.1 2026-01-16 14:10:56 +01:00
Colin Maudry 2d43654c81 Ignore les champs absents du schéma 2026-01-16 14:08:42 +01:00
Colin Maudry 5bcd17e8b0 Skip les colonnes absentes du schéma 2026-01-16 13:57:19 +01:00
Colin Maudry ec28e89788 Style et texte 2026-01-16 03:14:56 +01:00
Colin Maudry 338311fc62 Style et texte 2026-01-16 02:57:35 +01:00
Colin Maudry 86b445a007 Tableau pour les statistiques par an 2026-01-16 02:18:17 +01:00
Colin Maudry 16a914a98a Ajout de la matrice de doublons par source 2026-01-16 02:17:47 +01:00
Colin Maudry 0bc82fae1e màj de l'état des sources de DECP 2026-01-16 00:31:27 +01:00
Colin Maudry 3c68317f9d Utilisation des stats produites par decp_processing 2026-01-14 18:16:50 +01:00
Colin Maudry d8dcb04fbf Fix anchor pour Sources 2025-12-27 10:18:01 +01:00
Colin Maudry edfe6dd65e Correction URL changelog 2025-12-24 11:44:40 +01:00
Colin Maudry 021361e2c1 Màj CHANGELOG.md 2025-12-24 11:34:23 +01:00
Colin Maudry 04ec9438f1 Liste de colonnes dans les URL plus compacte #58 2025-12-24 11:32:15 +01:00
Colin Maudry e6960dc16d Merge branch 'main' into dev 2025-12-24 11:05:28 +01:00
Colin Maudry 2fb71e466c Exemple d'URL dans le CHANGELOG 2025-12-24 11:02:35 +01:00
Colin Maudry b47463b638 L'URL de partage contient les colonnes à afficher, non les colonnes à masquer #58 2025-12-24 10:50:21 +01:00
Colin Maudry 84cf48182d Possibilité de filtrer une colonne avec plusieurs mots 2025-12-24 10:16:25 +01:00
Colin Maudry 0f11a575ff Merge tag 'v2.3.0' into dev
- Possibilité de filtrer, trier etc. dans les vues acheteur et titulaire
- Possibilité de partager les filtres, tris et choix de colonnes via une adresse Web
2025-12-24 09:46:48 +01:00
Colin Maudry c9459771ac Merge branch 'release/2.3.0' 2025-12-24 09:45:55 +01:00
Colin Maudry 99eef0eaa3 Ajout mode d'emploi #58 2025-12-24 09:40:15 +01:00
Colin Maudry 4719ef5754 Ajout de copy.svg 2025-12-24 09:35:55 +01:00
Colin Maudry 032ca5554e Déplacement des notes de version vers CHANGELOG.md 2025-12-24 09:31:33 +01:00
Colin Maudry 90d66bcbb6 Merge branch 'feature/58_filter_url' into dev 2025-12-18 04:25:39 +01:00
Colin Maudry 43104f611e Réparation des callbacks, mode d'emploi #58 2025-12-18 04:23:53 +01:00
Colin Maudry 24ef21761f Gestion des annonces dans .env 2025-12-18 01:37:58 +01:00
Colin Maudry e0fa8464d2 Merge tag 'v2.2.3' into dev
- mise à jour de l'adresse email de contact (colmo.tech)
- message sur l'indisponibilité des données MINEF
2025-12-04 16:40:14 +01:00
Colin Maudry 0691329b04 Merge branch 'hotfix/2.2.3' 2025-12-04 16:38:38 +01:00
Colin Maudry 359ba248ac Changelog 2.2.3 2025-12-04 16:38:19 +01:00
Colin Maudry 19d7735306 Message informant du problème avec les données MINEF 2025-12-04 16:34:56 +01:00
Colin Maudry 43fd2df2c0 Suggested by Gemini Pro, but race condition: filters apply before columns are created #58
Prompt: - In the tableau page (src/pages/tableau.py), I want to allow users to copy a URL in their clipboard that enables opening the page with the same view: applied filters, sorting and column selection of the datatable. Typically to share the view with a colleague via email or chat.
  In terms of Dash callbacks, that would mean the following:
	- one callback syncs the filters, the sort parameters and the selection of columns with a read-only text input that stores the URL to copy. This callback also ensures the button to copy to the clipboard is visible, possibly replacing the confirmation message (see next point)
	- one callback reacts to clicks on a button to store the URLin the clipboard. This button in on the same row as "Télécharger au format Excel" button. When clicked, the URL is stored in the clipboard, and the button is replaced with a confrmation message (URL copiée)
	- one callback reads the URL, and applies the filters, sorting and column selection
- The URL stores the view configuration (filters, sorting and columns) in URL parameters, similar to what is done in REST APIs. The values are the same as stored in the DataTable parameters, just URL encoded. The URL parameters are in French: filtres, tris, colonnes.
2025-12-03 16:31:05 +01:00
Colin Maudry 9ae6f29391 Plus de tolérance dans l'ingestion des data dicts 2025-11-24 16:54:50 +01:00
Colin Maudry 80a7e51ec4 Merge branch 'feature/share_filtering_datatables' into dev 2025-11-24 16:01:34 +01:00
Colin Maudry e216b42379 Meilleure gestion des df vides acheteur/titulaire 2025-11-24 16:00:21 +01:00
Colin Maudry 7f42ca67a2 Bonne configuration des boutons de téléchargemetn 2025-11-24 15:33:27 +01:00
Colin Maudry ec15852406 Téléchargemetn filtré OK dans acheteur 2025-11-24 14:00:28 +01:00
Colin Maudry 8c98a60c75 filtres, tris fonctionnels (acheteur) 2025-11-24 13:43:42 +01:00
Colin Maudry 565a0cfd08 Custom filter logic 2025-11-24 11:17:05 +01:00
Colin Maudry 53919bff3e Cast acheteur_year to int et non dateNotification to string 2025-11-24 10:41:47 +01:00
Colin Maudry 193cf5302c Merge branch 'main' into dev 2025-11-24 09:38:27 +01:00
Colin Maudry fd2f87e382 Annonce fichiers excel fonctionnels 2025-11-24 09:37:35 +01:00
Colin Maudry 59e363a1fc Merge tag 'v2.2.2' into dev
- Correction d'un bug dans le téléchargement Excel
2025-11-22 18:49:11 +01:00
Colin Maudry fdeedde983 Merge branch 'hotfix/2.2.2' 2025-11-22 18:48:51 +01:00
Colin Maudry 925d050c96 Changelog 2.2.2 2025-11-22 18:48:42 +01:00
Colin Maudry 5d4ee692f3 Changements de type pour le téléchargement 2025-11-22 18:45:14 +01:00
Colin Maudry a51d2a83b4 Nettoyage 2025-11-18 15:37:47 +01:00
Colin Maudry 6b133c21ab Classe partagée pour la génération de datatables #56 2025-11-15 21:08:28 +01:00
Colin Maudry 503ec33f43 Classe partagée pour la génération de datatables #56 2025-11-15 21:01:59 +01:00
Colin Maudry 6b6d2ca790 Bump version 2.2.1 2025-11-15 16:49:29 +01:00
Colin Maudry fa84271759 Merge tag 'v2.2.1' into dev
- Le moteur de recherche ignore les tirets ("franche comté" trouve "Bourgogne-Franche-Comté)
- Phrase "tagline" au-dessus du champ de recherche
- Les infos de Contact rebasculent dans À propos
- Police de caractère "Open Sans" généralisée
2025-11-15 16:48:53 +01:00
Colin Maudry d8f5739168 Merge branch 'hotfix/2.2.1' 2025-11-15 16:48:46 +01:00
Colin Maudry dd07351bdd Changelog 2.2.1 2025-11-15 16:48:37 +01:00
Colin Maudry 4fb376d43d Open Sans partout 2025-11-14 23:03:39 +01:00
Colin Maudry 2335ae3d59 Contact => À propos 2025-11-14 18:29:32 +01:00
Colin Maudry 9e9770b1a0 Ajout d'une phrase d'intro et développement du placeholder search #58 2025-11-14 18:17:42 +01:00
Colin Maudry ce4570afad Suppression de l'annonce sur le contact 2025-11-14 18:16:06 +01:00
Colin Maudry 4c72c0e269 Suppression du workflow tag release 2025-11-13 14:59:11 +01:00
Colin Maudry 9a035ae431 Ignorer les - dans les recherches #58 2025-11-13 14:53:08 +01:00
Colin Maudry f511c4fcef Merge tag 'v2.2.0' into dev
- Moteur de recherche (acheteurs et titulaires) en page d'accueil ([#58](https://github.com/ColinMaudry/decp.info/issues/58))
- Top acheteurs / titulaires par montant attribué/remporté (([#55](https://github.com/ColinMaudry/decp.info/issues/55)))
- Moins de colonnes affichées par défaut dans Tableau ([#54](https://github.com/ColinMaudry/decp.info/issues/54))
2025-11-13 14:27:01 +01:00
Colin Maudry d58183beb5 Merge branch 'release/2.2.0' 2025-11-13 14:26:41 +01:00
Colin Maudry 18f8388df5 Changelog 2.2.0 2025-11-13 14:25:41 +01:00
Colin Maudry ef39be3346 Réduction du logging httpx 2025-11-13 14:23:08 +01:00
Colin Maudry 783fb88d0c Line height 2025-11-13 14:13:36 +01:00
Colin Maudry c19076ee85 Hauteur de lignes tableau 2025-11-12 22:18:46 +01:00
Colin Maudry c44ef311c3 Suppression du temps de latence entre les recherches #58 2025-11-12 22:09:15 +01:00
Colin Maudry 63622d83f5 Suivi des recherches #58 2025-11-12 16:08:38 +01:00
Colin Maudry 5bfce2a1d9 Merge branch 'main' into dev 2025-11-12 15:07:36 +01:00
Colin Maudry a3f8bd0981 Merge branch 'feature/58_search' into dev 2025-11-12 14:56:37 +01:00
Colin Maudry bb6c0dec26 Changelog #58 2025-11-12 14:55:38 +01:00
Colin Maudry 459ca6a846 Réarrangements résultats #58 2025-11-12 14:54:12 +01:00
Colin Maudry 8637915eb2 Cleanup HTML 2025-11-11 12:50:58 +01:00
Colin Maudry e187cf33aa Recherche fonctinonelle acheteurs et titulaires #58 2025-11-11 12:42:01 +01:00
Colin Maudry 2f3ce6a467 Amélioration du message d'annonce 2025-11-11 09:04:11 +01:00
Colin Maudry 1310caef4d Merge tag 'v2.1.7' into dev
- Remplacement du formulaire de contact par une adresse email
2025-11-11 08:42:28 +01:00
Colin Maudry efd9bd4238 Merge branch 'hotfix/2.1.7' 2025-11-11 08:39:58 +01:00
Colin Maudry 39844071ad Changelog 2.1.7 2025-11-11 08:39:41 +01:00
Colin Maudry 5c64177c6a Remplacement du formulaire de contact par email 2025-11-11 08:37:47 +01:00
Colin Maudry 1e85dbe562 Champ de recherche, récup de données dédiée #58 2025-11-11 07:47:00 +01:00
Colin Maudry 6835f328b6 Ajout de la distance dans les tableaux top #55 2025-11-10 15:30:47 +01:00
Colin Maudry a3eb48bacb Format values inclut le formatage des distances 2025-11-10 15:29:44 +01:00
Colin Maudry 1848c881ac Merge branch 'feature/55_top10' into dev 2025-11-10 13:33:42 +01:00
Colin Maudry bbb04a4487 Changelog #55 2025-11-10 13:33:37 +01:00
Colin Maudry e9faf80609 Top 10 acheteurs sur les pages titulaire #55 2025-11-10 13:30:50 +01:00
Colin Maudry f6a38a29bd Top 10 titulaires sur les pages acheteur #55 2025-11-10 13:01:17 +01:00
Colin Maudry c6e096e42a Merge branch 'feature/54_colonnes_defaut' into dev 2025-11-07 08:19:12 +01:00
Colin Maudry 4c6f63f723 Changelog #54 2025-11-07 08:15:18 +01:00
Colin Maudry f3c8fd4481 Configuration des colonnes affichées par défaut #54 2025-11-07 08:13:35 +01:00
Colin Maudry 5ca52fadd7 Merge tag 'v2.1.6' into dev
- Stabilisation de la vue marché
2025-10-15 19:44:55 +02:00
Colin Maudry ee91e7a91f Merge branch 'hotfix/2.1.6' 2025-10-15 19:44:09 +02:00
Colin Maudry 392f862baa Changelog 2.1.6 2025-10-15 19:44:02 +02:00
Colin Maudry 199476ec30 Stabilisation affichage fiche marché #40 2025-10-15 19:42:53 +02:00
Colin Maudry c98a36f759 Fix fiche marche 2025-10-14 12:54:47 +02:00
Colin Maudry 65e0f4c5f0 Gestion des montants inexistants 2025-10-10 18:25:08 +02:00
Colin Maudry bc7652f336 Merge branch 'main' into dev 2025-10-10 17:48:47 +02:00
Colin Maudry 188383a882 Changelog 2.1.5 2025-10-10 17:47:18 +02:00
Colin Maudry 7f3a0bcb21 Renommage de la Github action d'auto release 2025-10-10 17:45:15 +02:00
Colin Maudry 3270abb7f6 Refactor du filtre pour être plus résilient (et fonctionner sur les montants) 2025-10-10 17:44:51 +02:00
Colin Maudry 2eb984a95f Ne plus afficher de nulls dans les tableaux de données (tableau, titulaire, acheteur) 2025-10-10 17:44:16 +02:00
Colin Maudry 776126a481 Merge tag 'v2.1.4' into dev
- possibilité de filtrer sur le champ "Source"
- création automatique d'une release Github quand je push un tag
2025-10-08 09:34:30 +02:00
Colin Maudry 59abf35a12 Merge branch 'hotfix/2.1.4' 2025-10-08 09:34:00 +02:00
Colin Maudry a40eb64245 Changelog 2.1.4 2025-10-08 09:33:51 +02:00
Colin Maudry acae1517cb Nouvelle tentative auto-release 2025-10-08 09:31:41 +02:00
Colin Maudry 9a9decde6e Possible de filtrer sur le champ 'Source' 2025-10-08 09:26:44 +02:00
Colin Maudry 816d0de324 Merge tag 'v2.1.1' into dev
- ajout d'une section dans À propos sur la qualité et l'exhaustivité des données ([#43](https://github.com/ColinMaudry/decp.info/issues/43))
- ajout du nombre de marchés en plus du nombre de lignes dans la vue Tableau
2025-10-01 13:22:42 +02:00
Colin Maudry 90e9bc3c8c Merge tag 'v2.1.0' into dev
- Ajout des vues [acheteur](https://decp.info/acheteurs/24350013900189) ([#28](https://github.com/ColinMaudry/decp.info/issues/28)), [titulaire](https://decp.info/titulaires/51903758414786)
([#35](https://github.com/ColinMaudry/decp.info/issues/35)) et [marché](https://decp.info/marches/532239472000482025S00004) ([#40](https://github.com/ColinMaudry/decp.info/issues/40)) 🔎
 - Ajout des balises HTML meta Open Graph et Twitter ([#39](https://github.com/ColinMaudry/decp.info/issues/39)) pour de beaux aperçus de liens 🖼️
- Formulaire de contact ([#48](https://github.com/ColinMaudry/decp.info/issues/48)) 📨
- Nom de colonnes plus_agréables ([#33](https://github.com/ColinMaudry/decp.info/issues/33)) 💅
- Définition des colonnes quand vous passez votre souris sur les en-têtes ([#33](https://github.com/ColinMaudry/decp.info/issues/33)) 📖#
- Affichage du numéro de version près du logo et lien vers ici 🤓
- Variables globales uniquement en lecture (😁)
2025-09-30 17:16:45 +02:00
97 changed files with 36877 additions and 1775 deletions
+1 -1
View File
@@ -20,7 +20,7 @@ jobs:
environment: ${{ github.ref_name }}
steps:
- name: Checkout repository
uses: actions/checkout@v3
uses: actions/checkout@v5
- name: Set up SSH key
run: |
-32
View File
@@ -1,32 +0,0 @@
on:
push:
# Sequence of patterns matched against refs/tags
tags:
- 'v*' # Push events to matching v*, i.e. v1.0, v20.15.10
name: Create Release
jobs:
build:
name: Create Release
runs-on: ubuntu-latest
steps:
- name: Checkout code
uses: actions/checkout@master
- name: Get tag message
run: |
tag_message=`git show "$TAG" | grep "^\- "`
echo "tag_message=$tag_message" >> "$GITHUB_ENV"
env:
TAG: ${{ github.ref }}
- name: Create Release
id: create_release
uses: actions/create-release@latest
env:
GITHUB_TOKEN: ${{ secrets.GITHUB_TOKEN }} # This token is provided by Actions, you do not need to create your own token
with:
tag_name: ${{ github.ref }}
release_name: ${{ github.ref }}
body: ${{ env.tag_message }}
draft: false
prerelease: false
+7
View File
@@ -3,5 +3,12 @@
__pycache__
.idea
.venv
.worktrees
build
.env
# DuckDB runtime artifacts (regenerated from decp_prod.parquet at startup)
**/decp.duckdb
**/decp.duckdb.tmp
**/decp.duckdb.lock
**/schema.cache.json
+20
View File
@@ -1,10 +1,18 @@
DATA_FILE_PARQUET_PATH=https://www.data.gouv.fr/fr/datasets/r/11cea8e8-df3e-4ed1-932b-781e2635e432
DUCKDB_PATH=./decp.duckdb
PORT=8050
DEVELOPMENT=True
SOURCE_STATS_CSV_PATH="https://www.data.gouv.fr/api/1/datasets/r/8ded94de-3b80-4840-a5bb-7faad1c9c234"
# Annonce dans l'en-tête du site
ANNOUNCEMENTS=
# Chemin vers le schéma de données
DATA_SCHEMA_PATH=https://www.data.gouv.fr/api/1/datasets/r/9a4144c0-ee44-4dec-bee5-bbef38191d9a
DATA_SCHEMA_CACHE=./schema.cache.json
# Colonnes masquées par défaut
DISPLAYED_COLUMNS="uid, acheteur_id, acheteur_nom, montant, objet, titulaire_nom, titulaire_id, dateNotification, dureeMois, acheteur_departement_code, sourceDataset"
# Formulaire de contact
SENDER_SERVER_DOMAIN="mail.example.com" # serveur SMTP
@@ -12,3 +20,15 @@ LOGIN_PASSWORD="" # mot de passe du serveur
LOGIN_EMAIL="connect@example.fr" # adresse utilisée pour se connecter au serveur SMTP
FROM_EMAIL="from@example.com" # adresse d'envoi des emails (From)
TO_EMAIL="to@example.com" # adresse de destination des emails (To)
# Matomo
MATOMO_ID_SITE=
MATOMO_BASE_URL=
MATOMO_TOKEN=
# API privée
DISABLE_API_AUTH="false"
USERS_DB_PATH=./users.sqlite
MATOMO_URL=https://analytics.maudry.com/matomo.php
MATOMO_SITE_ID=14
MATOMO_TRACKING_ENABLED=true
+240
View File
@@ -0,0 +1,240 @@
##### 2.8.1 (25 juin 2026)
- Correction du bug dans la création de token d'API
#### 2.8.0 (23 juin 2026)
- Ajout des considérations sociales et environnementales à l'observatoire
- Les filtres textuels dans les vues tableaux ne sont plus sensibles à l'accentuation
- API privée tabulaire sur abonnement (filtres dynamiques, pagination, tri) avec documentation interactive Swagger UI à `/api/v1/swagger` (📨 <colin@colmo.tech> si intéressé)
##### 2.7.9 (9 juin 2026)
- Ajout d'une vue "étapes" (elle sera mieux intégrée dans le site à l'avenir)
- Correction de petites erreurs qui polluent les logs
##### 2.7.8 (18 mai 2026)
- Récupération du schéma de données plus robuste, ne pas dépendre de data.gouv.fr
##### 2.7.7 (11 mai 2026)
- Suppression des mentions sur les profils d'acheteur. Omnikles/Safetender publie via l'API DUME et Klekoon ne publie pas, mais c'est peut-être pas le seul, donc je préfère supprimer et refaire un tour.
##### 2.7.6 (5 mai 2026)
- Correction du problème de filtre par date dans les tableaux
- Retour des cartes dans les pages acheteur et titulaire
- Possibilité de chercher un SIRET/SIREN avec des espaces dans les champs `SIRET acheteur` et `Identifiant titulaire`
##### 2.7.5 (24 avril 2026)
- Amélioration des permormances de l'observatoire
- Possibilité dans observatoire (champ objet) et tableau (tous champs texte) de soit chercher des mots présents, soit une suite de mot précise (voir mode d'emploi dans Tableau)
- Ajout d'une animation pendant le chargement de la prévisualisation des données de l'observatoire
##### 2.7.4 (22 avril 2026)
- Utilisation élargie de DuckDB au détriment de Polars => bien meilleure perf ([#72](https://github.com/ColinMaudry/decp.info/issues/72)
##### 2.7.3 (20 avril 2026)
- Mise en cache des vues tableau par ensemble de filtres et de tris
- Résolution du bug d'écriture du fichier de vérouillage de la base de données
##### 2.7.2 (19 avril 2026)
- Chargement des données depuis une base DuckDB plutôt qu'en mémoire (plus de stabilité) ([#71](https://github.com/ColinMaudry/decp.info/issues/71))
- Mise en cache des vue sur l'observatoire pour un chargement plus rapide (remise à zéro quotidienne)
- Correction de bug : la liste de colonnes par défaut est bien appliquée plutôt qu'afficher toutes les colonnes
- Quelques corrections de bugs d'affichage
- Refactorisation des fonctions utilitaires (`utils.py` approchait des 1 000 lignes)
##### 2.7.1 (23 mars 2026)
- Correction du partage de données filtrées entre dashboard et vue des données
#### 2.7.0 (23 mars 2026)
- Remplacement de la page Statistiques par l'observatoire
- Généralisation de la grille dash (`dbc.Row`, `dbc.Col`)
- Ajout de l'histogramme de distances aux pages acheteur et titulaire
- Ajout de la colonne `acheteur_categorie` (commune, État, etc.)
##### 2.6.2 (22 février 2026)
- Correction du téléchargemnent buggé dans /tableau
##### 2.6.1 (17 février 2026)
- Corrections la création des liens canoniques (SEO)
#### 2.6.0 (5 février 2026)
- Suite de la refonte graphique
- Persistence des filtres, des tris et des choix de colonnes sur toutes les pages
- Joli tableau pour choisir les colonnes à afficher
- Meilleure gestion des acheteurs et titulaires absents de la base SIRENE
- Amélioration du SEO (liens canoniques)
##### 2.5.1 (29 janvier 2026)
- Mise en production un peu hâtive ([#67](https://github.com/ColinMaudry/decp.info/issues/67), [#68](https://github.com/ColinMaudry/decp.info/issues/68))
#### 2.5.0 (29 janvier 2026)
- Refonte graphique et amélioration des textes d'aide
- Amélioration du filtrage du tableau à partir d'une URL
- Renforcement du SEO avec une arborescence permettant l'accès aux marchés et des snippets JSON-LD
- Suppression de la dépendance à Google Fonts grâce à [Bunny Fonts](https://fonts.bunny.net) 🇪🇺 🇸🇮
##### 2.4.1 (22 janvier 2026)
- Meilleure gestion des colonnes absentes du schéma
#### 2.4.0 (22 janvier 2026)
- Site à peu près utilisable sur petit écran (smartphone) ([#63](https://github.com/ColinMaudry/decp.info/issues/63))
- Ajout de nouvelles statistiques dans [/statistiques](https://decp.info/statistiques) (stats par année, doublons par source)
- Amélioration du référencement Web (sitemap, titres, descriptions) ([#50](https://github.com/ColinMaudry/decp.info/issues/50))
- Possibilité dans les champs non-numériques de filtrer le texte selon son début ou sa fin (`text*` et `*text`)
- Ajout d'une table des matières dans la page [À propos](https://decp.infi/a-propos) ([#36](https://github.com/ColinMaudry/decp.info/issues/36))
- Désactivation du bloquage des robot d'agents de LLM (robots.txt)
##### 2.3.1 (16 janvier 2026)
- Les champs absents du [schéma](https://www.data.gouv.fr/datasets/donnees-essentielles-de-la-commande-publique-consolidees-format-tabulaire?resource_id=9a4144c0-ee44-4dec-bee5-bbef38191d9a) sont ignorés pour éviter les erreurs
#### 2.3.0 (24 décembre 2025)
- Possibilité de filtrer, trier etc. dans les vues acheteur et titulaire
- Possibilité de partager les filtres, tris et choix de colonnes via une adresse Web ([exemple](https://decp.info/tableau?filtres=%7Bobjet%7D+icontains+%22d%C3%A9corations+de+no%C3%ABl%22+%26%26+%7BdateNotification%7D+icontains+2025&colonnes=uid%2Cacheteur_id%2Cacheteur_nom%2Ctitulaire_id%2Ctitulaire_nom%2Cobjet%2Cmontant%2CdateNotification%2Cdistance%2Cacheteur_departement_code))
- Possibilité de filtrer une colonne avec plusieurs mots
##### 2.2.3 (4 décembre 2025)
- mise à jour de l'adresse email de contact (colmo.tech)
- message sur l'indisponibilité des données MINEF
##### 2.2.2 (22 novembre 2025)
- Correction d'un bug dans le téléchargement Excel
##### 2.2.1 (15 novembre 2025)
- Le moteur de recherche ignore les tirets ("franche comté" trouve "Bourgogne-Franche-Comté)
- Phrase "tagline" au-dessus du champ de recherche
- Les infos de Contact rebasculent dans À propos
- Police de caractère "Open Sans" généralisée
#### 2.2.0 (13 novembre 2025)
- Moteur de recherche (acheteurs et titulaires) en page d'accueil ([#58](https://github.com/ColinMaudry/decp.info/issues/58))
- Top acheteurs / titulaires par montant attribué/remporté (([#55](https://github.com/ColinMaudry/decp.info/issues/55)))
- Moins de colonnes affichées par défaut dans Tableau ([#54](https://github.com/ColinMaudry/decp.info/issues/54))
##### 2.1.7 (11 novembre 2025)
- Remplacement du formulaire de contact par une adresse email
##### 2.1.6 (15 octobre 2025)
- Stabilisation de la vue marché
##### 2.1.5 (10 octobre 2025)
- réparation des filtres (notamment < > sur les montants)
- remplacement des valeurs "null" dans les tableaux par des cellules vides
##### 2.1.4 (8 octobre 2025)
- possibilité de filtrer sur le champ "Source"
- création automatique d'une release Github quand je push un tag
##### 2.1.3 (4 octobre 2025)
- tentative d'auto-release à chaque création de tag git
- adaptation au format TableSchema
##### 2.1.2 (3 octobre 2025)
- dataframe global plutôt que lazyframe, pour plus de résilience et charger toutes les données en mémoire
##### 2.1.1 (1er octobre 2025)
- ajout d'une section dans À propos sur la qualité et l'exhaustivité des données ([#43](https://github.com/ColinMaudry/decp.info/issues/43))
- ajout du nombre de marchés en plus du nombre de lignes dans la vue Tableau
#### 2.1.0 (30 septembre 2025)
- Ajout des vues [acheteur](https://decp.info/acheteurs/24350013900189) ([#28](https://github.com/ColinMaudry/decp.info/issues/28)), [titulaire](https://decp.info/titulaires/51903758414786) ([#35](https://github.com/ColinMaudry/decp.info/issues/35)) et [marché](https://decp.info/marches/532239472000482025S00004) ([#40](https://github.com/ColinMaudry/decp.info/issues/40)) 🔎
- Ajout des balises HTML meta Open Graph et Twitter ([#39](https://github.com/ColinMaudry/decp.info/issues/39)) pour de beaux aperçus de liens 🖼️
- Formulaire de contact ([#48](https://github.com/ColinMaudry/decp.info/issues/48)) 📨
- Nom de colonnes plus_agréables ([#33](https://github.com/ColinMaudry/decp.info/issues/33)) 💅
- Définition des colonnes quand vous passez votre souris sur les en-têtes ([#33](https://github.com/ColinMaudry/decp.info/issues/33)) 📖
- Affichage du numéro de version près du logo et lien vers ici 🤓
- Variables globales uniquement en lecture (😁)
##### 2.0.1 (23 septembre 2025)
- Bloquage du bouton de téléchargement si trop de lignes (+ 65000) [#38](https://github.com/ColinMaudry/decp.info/issues/38)
- Amélioration du script de déploiement (deploy.sh)
- Meilleures instructions d'installation et lancement
- Coquilles 🐚
### 2.0.0 (23 septembre 2025)
- détails des sources de données
- section "À propos" plus développée
- correction de bugs dans les filtres de la data table
#### 2.0.0-alpha
- Data table fonctionnelle
### 1.5.0 (28/01/2023
- fixation des dépendances Python pour plus de stabilité en cas de réinstallation (Pipfile)
#### 1.4.1 (14/06/2021)
- ajout des traductions des opérations de filtrage à toutes les vues, pas seulement /db/decp
### 1.4.0 (14/06/2021)
- traduction des opérations de filtrage (ex : contains => contient)
- élargissement des menus de filtrage
- correction du titre de la page des notes de versions
### 1.3.0 (03/06/2021)
- utilisation de noms de colonnes plus lisibles dans l'application
- suppression des références à la licence et aux données source sur la page d'accueil
- correction des liens vers le code source
- correction de l'indentation des puces dans les notes de version
### 1.2.0 (28/05/2021)
- ajout d'une page "Notes de version"
- meilleur lien pour la documentation des champs
- déplacement du code de decp.info depuis [ColinMaudry/decp-table-schema-utils](https://github.com/ColinMaudry/decp-table-schema-utils) vers [ColinMaudry/decp.info](https://github.com/ColinMaudry/decp.info)
### 1.1.0 (25/05/2021)
- ajout de nouvelles vues :
- Marchés publics sans leurs titulaires : vue dédiée aux titulaires de marchés avec des données provenant du répertoire SIRENE
- Données sur les titulaires et géolocalisation : vue sans les titulaires pour analyser les nombres de marchés et les montants
- amélioration de la page d'accueil
- développement de la page "db" avec description des vues et liste des colonnes
- les codes APE sont cliquables
- ajout des mentions légales
- ajout d'un formulatire d'inscription à une lettre d'information
- correction de bugs :
- correction du format de certaines dates dans les données
### 1.0.0
- publication sur <https://decp.info>
- ajout d'une vue équivalente au format DECP réglementaire
- personnalisation de datasette
- script de conversion quotidien basé sur [dataflows](https://github.com/datahq/dataflows)
+98
View File
@@ -0,0 +1,98 @@
# CLAUDE.md
This file provides guidance to Claude Code (claude.ai/code) when working with code in this repository.
## Project Overview
**decp.info** is a French public procurement data explorer — a Dash (Python) web app for browsing, filtering, and visualizing _Données Essentielles de la Commande Publique_ (DECP). The UI is in French.
## Commands
### Setup
Setting up the virtual environment:
```bash
python -m venv .venv # s'il n'existe pas déjà
source .venv/bin/activate
rtk pip install -U pip > /dev/null 2>&1
rtk pip install -e . --group=dev
```
Environment variables:
```bash
cp .template.env .env # then customize .env
```
### Development
```bash
python run.py # starts Dash app
```
### Production
```bash
gunicorn app:server
```
### Tests
```bash
rtk pytest # run all tests (some are Selenium-based integration tests)
rtk pytest tests/test_main.py::test_001_logo_and_search # run a single test
```
Tests require a running Chrome/Chromium browser. They use `DashComposite` from `dash[testing]` with Selenium WebDriver.
## Architecture
### Multi-page Dash app
- `src/app.py` — creates the Dash app instance, navbar, SEO endpoints (robots.txt, sitemap.xml), Matomo analytics
- `src/pages/*.py` — each page registers itself with `@register_page()` and o.wns its own layout and callbacks
- `run.py` — dev entry point; exports `server` (Flask) for gunicorn
### Module imports
- always import modules from the app starting with `src.` (e.g. `src.utils.`, `src.pages.recherche`, etc.), NOT `utils.cache` or `pages.observatoire`.
### Key pages
| Page | URL | Purpose |
| ----------------- | --------------- | -------------------------------------- |
| `recherche.py` | `/` | Search homepage for buyers/contractors |
| `acheteur.py` | `/acheteur` | Buyer detail with stats, charts, maps |
| `titulaire.py` | `/titulaire` | Contractor detail |
| `tableau.py` | `/tableau` | Filterable data table with exports |
| `marche.py` | `/marche` | Individual contract detail |
| `observatoire.py` | `/observatoire` | An interactive analytics dashboard |
### Data layer
- Data is stored as **Parquet** at rest, possibly in DuckDB, loaded in DuckDB, served from DuckDB for big queries and manipulated with **Polars** for the remaining steps
- Path set via `DATA_FILE_PARQUET_PATH` env var; tests use `tests/test.parquet`
- `src/util/*.py` — helpers shared by other modules, search (`search_org`), link generation, geographic data loading
- `src/callbacks.py` — shared Dash callbacks (e.g. `get_top_org_table`)
- `src/figures.py` — chart and map components (Plotly Express, Dash Leaflet with marker clustering)
- a Parquet file with production data is located at `../decp-processing/decp_prod.parquet` (~ 1,5 million records)
- the TableSchema of the dataset with the list of field and their definition is located at `../decp-processing/reference/base_schema.json`
- `tests/test.parquet` is very small and may not contain all possible columns, only those necessary for testing
### UI stack
- **Dash 3.4** + **Dash Bootstrap Components** for layout
- **Plotly Express** for charts
- **Dash Leaflet** + **Dash Extensions** for interactive maps with clustering
- Custom CSS in `src/assets/css/`
### Environment
- `DEVELOPMENT=true` enables debug logging and is set automatically during tests
- `.env` file is required at runtime (copy from `template.env`)
### Deployment
- `main` branch → manual deploy to decp.info via GitHub Actions
- `dev` branch → auto-deploy to test.decp.info via GitHub Actions
+4 -96
View File
@@ -1,27 +1,21 @@
# decp.info
> v2.1.3
Outil d'exploration et de téléchargement des données essentielles de la commande publique.
> Outil d'exploration et de téléchargement des données essentielles de la commande publique.
=> [decp.info](https://decp.info)
## Installation et lancement
```shell
python -m venv .venv
source .venv/bin/activate
pip install .
# Copie et personnalisation du .env
cp template.env .env
nano .env
# Pour la production
gunicorn app:server
uv run gunicorn app:server
# Pour avoir le debuggage et le hot reload
python run.py
uv run run.py
```
## Déploiement
@@ -38,90 +32,4 @@ Ne pas oublier de mettre à jour les fichier .env.
## Notes de version
##### 2.1.3 (4 octobre 2025)
- tentative d'auto-release à chaque création de tag git
- adaptation au format TableSchema
##### 2.1.2 (3 octobre 2025)
- dataframe global plutôt que lazyframe, pour plus de résilience et charger toutes les données en mémoire
##### 2.1.1 (1er octobre 2025)
- ajout d'une section dans À propos sur la qualité et l'exhaustivité des données ([#43](https://github.com/ColinMaudry/decp.info/issues/43))
- ajout du nombre de marchés en plus du nombre de lignes dans la vue Tableau
#### 2.1.0 (30 septembre 2025)
- Ajout des vues [acheteur](https://decp.info/acheteurs/24350013900189) ([#28](https://github.com/ColinMaudry/decp.info/issues/28)), [titulaire](https://decp.info/titulaires/51903758414786) ([#35](https://github.com/ColinMaudry/decp.info/issues/35)) et [marché](https://decp.info/marches/532239472000482025S00004) ([#40](https://github.com/ColinMaudry/decp.info/issues/40)) 🔎
- Ajout des balises HTML meta Open Graph et Twitter ([#39](https://github.com/ColinMaudry/decp.info/issues/39)) pour de beaux aperçus de liens 🖼️
- Formulaire de contact ([#48](https://github.com/ColinMaudry/decp.info/issues/48)) 📨
- Nom de colonnes plus_agréables ([#33](https://github.com/ColinMaudry/decp.info/issues/33)) 💅
- Définition des colonnes quand vous passez votre souris sur les en-têtes ([#33](https://github.com/ColinMaudry/decp.info/issues/33)) 📖
- Affichage du numéro de version près du logo et lien vers ici 🤓
- Variables globales uniquement en lecture (😁)
##### 2.0.1 (23 septembre 2025)
- Bloquage du bouton de téléchargement si trop de lignes (+ 65000) [#38](https://github.com/ColinMaudry/decp.info/issues/38)
- Amélioration du script de déploiement (deploy.sh)
- Meilleures instructions d'installation et lancement
- Coquilles 🐚
### 2.0.0 (23 septembre 2025)
- détails des sources de données
- section "À propos" plus développée
- correction de bugs dans les filtres de la data table
#### 2.0.0-alpha
- Data table fonctionnelle
### 1.5.0 (28/01/2023
- fixation des dépendances Python pour plus de stabilité en cas de réinstallation (Pipfile)
#### 1.4.1 (14/06/2021)
- ajout des traductions des opérations de filtrage à toutes les vues, pas seulement /db/decp
### 1.4.0 (14/06/2021)
- traduction des opérations de filtrage (ex : contains => contient)
- élargissement des menus de filtrage
- correction du titre de la page des notes de versions
### 1.3.0 (03/06/2021)
- utilisation de noms de colonnes plus lisibles dans l'application
- suppression des références à la licence et aux données source sur la page d'accueil
- correction des liens vers le code source
- correction de l'indentation des puces dans les notes de version
### 1.2.0 (28/05/2021)
- ajout d'une page "Notes de version"
- meilleur lien pour la documentation des champs
- déplacement du code de decp.info depuis [ColinMaudry/decp-table-schema-utils](https://github.com/ColinMaudry/decp-table-schema-utils) vers [ColinMaudry/decp.info](https://github.com/ColinMaudry/decp.info)
### 1.1.0 (25/05/2021)
- ajout de nouvelles vues :
- Marchés publics sans leurs titulaires : vue dédiée aux titulaires de marchés avec des données provenant du répertoire SIRENE
- Données sur les titulaires et géolocalisation : vue sans les titulaires pour analyser les nombres de marchés et les montants
- amélioration de la page d'accueil
- développement de la page "db" avec description des vues et liste des colonnes
- les codes APE sont cliquables
- ajout des mentions légales
- ajout d'un formulatire d'inscription à une lettre d'information
- correction de bugs :
- correction du format de certaines dates dans les données
### 1.0.0
- publication sur https://decp.info
- ajout d'une vue équivalente au format DECP réglementaire
- personnalisation de datasette
- script de conversion quotidien basé sur [dataflows](https://github.com/datahq/dataflows)
Voir [CHANGELOG](https://github.com/ColinMaudry/decp.info/blob/main/CHANGELOG.md).
+8
View File
@@ -391,8 +391,16 @@
"departement": "La Réunion",
"region": "La Réunion"
},
"975": {
"departement": "Saint-Pierre-et-Miquelon",
"region": "Saint-Pierre-et-Miquelon"
},
"976": {
"departement": "Mayotte",
"region": "Mayotte"
},
"977": {
"departement": "Saint-Barthelemy",
"region": "Saint-Barthelemy"
}
}
@@ -0,0 +1,473 @@
# Observatoire Link from Search & Tableau Results — Implementation Plan
> **For agentic workers:** REQUIRED SUB-SKILL: Use superpowers:subagent-driven-development (recommended) or superpowers:executing-plans to implement this plan task-by-task. Steps use checkbox (`- [ ]`) syntax for tracking.
**Goal:** Let users jump from search/tableau results to the observatoire page, pre-filtered for a given organization, via a 📊 link in the `_nom` columns.
**Architecture:** Modify `add_links()` in `src/utils.py` to append an observatoire link to `_nom` columns. Add two callbacks to `src/pages/observatoire.py` for bidirectional URL ↔ filter sync using the existing `dcc.Location(id="dashboard_url")`. Add a share URL input and clipboard button to the observatoire layout.
**Tech Stack:** Dash 3.4, Polars, `urllib.parse`, `dcc.Location`, `dcc.Clipboard`
**Spec:** `docs/superpowers/specs/2026-03-18-observatoire-link-from-search-design.md`
---
### Task 1: Add observatoire link to `acheteur_nom` in `add_links()`
**Files:**
- Modify: `src/utils.py:82-91` (the `acheteur_` block inside `add_links()`)
- Test: `tests/test_main.py`
**Context:** The `add_links()` function loops over column names. The `if col.startswith("acheteur_")` block (lines 82-91) currently wraps both `acheteur_nom` and `acheteur_id` in a detail page link. We must only append the observatoire link when `col == "acheteur_nom"`.
- [ ] **Step 1: Write a unit test for the observatoire link in acheteur_nom**
In `tests/test_main.py`, add a test that calls `add_links()` on a minimal DataFrame and checks the `acheteur_nom` column contains both the detail link and the observatoire link, while `acheteur_id` does NOT contain the observatoire link.
```python
def test_004_add_links_observatoire_acheteur():
import polars as pl
from src.utils import add_links
dff = pl.DataFrame(
{
"acheteur_id": ["a1"],
"acheteur_nom": ["ACHETEUR 1"],
}
)
result = add_links(dff)
nom_value = result["acheteur_nom"][0]
id_value = result["acheteur_id"][0]
# acheteur_nom should contain detail link + observatoire link
assert "/acheteurs/a1" in nom_value
assert "ACHETEUR 1" in nom_value
assert '/observatoire?acheteur_id=a1' in nom_value
assert "📊" in nom_value
# acheteur_id should NOT contain observatoire link
assert "/observatoire" not in id_value
```
- [ ] **Step 2: Run test to verify it fails**
Run: `source .venv/bin/activate && pytest tests/test_main.py::test_004_add_links_observatoire_acheteur -v`
Expected: FAIL — `'/observatoire?acheteur_id=a1'` not found in the output string.
- [ ] **Step 3: Implement the observatoire link for acheteur_nom**
In `src/utils.py`, modify the `if col.startswith("acheteur_")` block (lines 82-91). Gate the observatoire link append on `col == "acheteur_nom"`:
```python
if col.startswith("acheteur_"):
detail_link = (
'<a href = "/acheteurs/'
+ pl.col("acheteur_id")
+ '">'
+ pl.col(col)
+ "</a>"
)
if col == "acheteur_nom":
detail_link = (
detail_link
+ ' <a href="/observatoire?acheteur_id='
+ pl.col("acheteur_id")
+ '" title="Voir dans l\'observatoire">📊</a>'
)
dff = dff.with_columns(detail_link.alias(col))
```
- [ ] **Step 4: Run test to verify it passes**
Run: `source .venv/bin/activate && pytest tests/test_main.py::test_004_add_links_observatoire_acheteur -v`
Expected: PASS
- [ ] **Step 5: Update `test_001` to account for the new emoji in cell text**
The existing `test_001` asserts `result_table.find_element(...).text == name` for `acheteur_nom`. The cell text now includes "📊" from the observatoire link. Update the assertion in `tests/test_main.py` to use `startswith` instead of exact match:
```python
assert result_table.find_element(
by=By.CSS_SELECTOR, value=f'td[data-dash-column="{org_type}_nom"]'
).text.startswith(
name
), f"The search result should have the right {org_type} name"
```
- [ ] **Step 6: Run `test_001` to verify it still passes**
Run: `source .venv/bin/activate && pytest tests/test_main.py::test_001_logo_and_search -v`
Expected: PASS
- [ ] **Step 7: Commit**
```bash
git add src/utils.py tests/test_main.py
git commit -m "Ajout du lien observatoire dans acheteur_nom via add_links() #65"
```
---
### Task 2: Add observatoire link to `titulaire_nom` in `add_links()`
**Files:**
- Modify: `src/utils.py:64-81` (the `titulaire_` block inside `add_links()`)
- Test: `tests/test_main.py`
**Context:** The `titulaire_` block (lines 64-81) uses a `pl.when().then().otherwise()` pattern because it guards on `titulaire_typeIdentifiant` being SIRET or null. The observatoire link must be appended inside the `.then()` branch, and only when `col == "titulaire_nom"`. Note: this block requires `titulaire_typeIdentifiant` to be present in the DataFrame.
- [ ] **Step 1: Write a unit test for the observatoire link in titulaire_nom**
```python
def test_005_add_links_observatoire_titulaire():
import polars as pl
from src.utils import add_links
dff = pl.DataFrame(
{
"titulaire_id": ["t1"],
"titulaire_nom": ["TITULAIRE 1"],
"titulaire_typeIdentifiant": ["SIRET"],
}
)
result = add_links(dff)
nom_value = result["titulaire_nom"][0]
id_value = result["titulaire_id"][0]
# titulaire_nom should contain detail link + observatoire link
assert "/titulaires/t1" in nom_value
assert "TITULAIRE 1" in nom_value
assert '/observatoire?titulaire_id=t1' in nom_value
assert "📊" in nom_value
# titulaire_id should NOT contain observatoire link
assert "/observatoire" not in id_value
```
- [ ] **Step 2: Run test to verify it fails**
Run: `source .venv/bin/activate && pytest tests/test_main.py::test_005_add_links_observatoire_titulaire -v`
Expected: FAIL — `'/observatoire?titulaire_id=t1'` not found.
- [ ] **Step 3: Implement the observatoire link for titulaire_nom**
In `src/utils.py`, modify the `if col.startswith("titulaire_")` block (lines 64-81). The `.then()` branch must build the link differently when `col == "titulaire_nom"`:
```python
if col.startswith("titulaire_"):
detail_link = (
'<a href = "/titulaires/'
+ pl.col("titulaire_id")
+ '">'
+ pl.col(col)
+ "</a>"
)
if col == "titulaire_nom":
detail_link = (
detail_link
+ ' <a href="/observatoire?titulaire_id='
+ pl.col("titulaire_id")
+ '" title="Voir dans l\'observatoire">📊</a>'
)
dff = dff.with_columns(
pl.when(
pl.Expr.or_(
pl.col("titulaire_typeIdentifiant").is_null(),
pl.col("titulaire_typeIdentifiant") == "SIRET",
)
)
.then(detail_link)
.otherwise(pl.col(col))
.alias(col)
)
```
- [ ] **Step 4: Run test to verify it passes**
Run: `source .venv/bin/activate && pytest tests/test_main.py::test_005_add_links_observatoire_titulaire -v`
Expected: PASS
- [ ] **Step 5: Run all tests so far to check for regressions**
Run: `source .venv/bin/activate && pytest tests/test_main.py::test_004_add_links_observatoire_acheteur tests/test_main.py::test_005_add_links_observatoire_titulaire -v`
Expected: both PASS
- [ ] **Step 6: Commit**
```bash
git add src/utils.py tests/test_main.py
git commit -m "Ajout du lien observatoire dans titulaire_nom via add_links() #65"
```
---
### Task 3: Observatoire Callback A — URL → Inputs (page load)
**Files:**
- Modify: `src/pages/observatoire.py` (add import + new callback after line 281)
- Test: `tests/test_main.py`
**Context:** The existing `dcc.Location(id="dashboard_url")` is in the observatoire layout. A new callback reads `dashboard_url.search` on page load, parses query params, and sets `dashboard_acheteur_id.value` and/or `dashboard_titulaire_id.value`. It also clears `dashboard_url.search` to `""` to prevent re-triggering. Two imports must be added: `import urllib.parse` at the top of the file, and `no_update` to the existing `from dash import ...` line (currently: `from dash import ALL, Input, Output, State, callback, ctx, dcc, html, register_page` — add `no_update` to this).
- [ ] **Step 1: Write a Selenium test for URL → Input sync**
This test navigates to `/observatoire?acheteur_id=a1` and verifies the SIRET input gets populated.
```python
def test_006_observatoire_url_to_input(dash_duo: DashComposite):
from src.app import app
dash_duo.start_server(app)
dash_duo.wait_for_text_to_equal(".logo > h1", "decp.info", timeout=4)
# Navigate to observatoire with acheteur_id query param
dash_duo.wait_for_page(f"{dash_duo.server_url}/observatoire?acheteur_id=a1")
dash_duo.wait_for_element("#dashboard_acheteur_id", timeout=4)
acheteur_input = dash_duo.find_element("#dashboard_acheteur_id")
dash_duo.wait_for_text_to_equal(
"#dashboard_acheteur_id", "", timeout=4
) # Wait for callback
import time
time.sleep(1) # Allow callback chain to complete
assert acheteur_input.get_attribute("value") == "a1", (
"acheteur_id input should be populated from URL param"
)
```
- [ ] **Step 2: Run test to verify it fails**
Run: `source .venv/bin/activate && pytest tests/test_main.py::test_006_observatoire_url_to_input -v`
Expected: FAIL — the input value is empty because no callback reads URL params yet.
- [ ] **Step 3: Implement Callback A**
Add `import urllib.parse` to the imports at the top of `src/pages/observatoire.py` (after line 1). Also add `no_update` to the existing dash import line:
```python
from dash import ALL, Input, Output, State, callback, ctx, dcc, html, no_update, register_page
```
Add the callback after the `layout` list ends, before existing callbacks:
```python
@callback(
Output("dashboard_acheteur_id", "value"),
Output("dashboard_titulaire_id", "value"),
Output("dashboard_url", "search"),
Input("dashboard_url", "search"),
)
def restore_filters_from_url(search):
if not search:
return no_update, no_update, no_update
params = urllib.parse.parse_qs(search.lstrip("?"))
acheteur_id = params.get("acheteur_id", [None])[0] or no_update
titulaire_id = params.get("titulaire_id", [None])[0] or no_update
return acheteur_id, titulaire_id, ""
```
- [ ] **Step 4: Run test to verify it passes**
Run: `source .venv/bin/activate && pytest tests/test_main.py::test_006_observatoire_url_to_input -v`
Expected: PASS
- [ ] **Step 5: Commit**
```bash
git add src/pages/observatoire.py tests/test_main.py
git commit -m "Callback URL → filtres sur la page observatoire #65"
```
---
### Task 4: Observatoire Callback B — Inputs → shareable URL + layout
**Files:**
- Modify: `src/pages/observatoire.py` (add layout components + new callback)
- Test: `tests/test_main.py`
**Context:** Following the tableau.py pattern (lines 237-238 for layout, lines 399-450 for callback), add a hidden `share-url` input and a `copy-container` div to the observatoire layout. The callback listens to the ID inputs and builds a shareable URL. Component IDs must be unique across the app, so use `observatoire-share-url` and `observatoire-copy-container` to avoid collisions with tableau's `share-url` and `copy-container`.
- [ ] **Step 1: Write a test for the shareable URL generation**
```python
def test_007_observatoire_share_url(dash_duo: DashComposite):
from src.app import app
dash_duo.start_server(app)
dash_duo.wait_for_text_to_equal(".logo > h1", "decp.info", timeout=4)
# Navigate to observatoire with acheteur_id query param
dash_duo.wait_for_page(f"{dash_duo.server_url}/observatoire?acheteur_id=a1")
dash_duo.wait_for_element("#observatoire-share-url", timeout=4)
import time
time.sleep(1) # Allow callback chain to complete
share_url_input = dash_duo.find_element("#observatoire-share-url")
share_url_value = share_url_input.get_attribute("value")
assert "acheteur_id=a1" in share_url_value, (
f"Share URL should contain acheteur_id param, got: {share_url_value}"
)
```
- [ ] **Step 2: Run test to verify it fails**
Run: `source .venv/bin/activate && pytest tests/test_main.py::test_007_observatoire_share_url -v`
Expected: FAIL — `#observatoire-share-url` element does not exist yet.
- [ ] **Step 3: Add layout components to observatoire**
In `src/pages/observatoire.py`, add the share URL input and copy container inside the filters column (after the download button, before the closing `]` of the `id="filters"` children list, around line 264):
```python
dcc.Input(
id="observatoire-share-url",
readOnly=True,
style={"display": "none"},
),
html.Div(id="observatoire-copy-container"),
```
- [ ] **Step 4: Implement Callback B**
Add after Callback A in `src/pages/observatoire.py`:
```python
@callback(
Output("observatoire-share-url", "value"),
Output("observatoire-copy-container", "children"),
Input("dashboard_acheteur_id", "value"),
Input("dashboard_titulaire_id", "value"),
State("dashboard_url", "href"),
prevent_initial_call=True,
)
def sync_observatoire_share_url(acheteur_id, titulaire_id, href):
if not href:
return no_update, no_update
base_url = href.split("?")[0]
params = {}
if acheteur_id:
params["acheteur_id"] = acheteur_id
if titulaire_id:
params["titulaire_id"] = titulaire_id
query_string = urllib.parse.urlencode(params)
full_url = f"{base_url}?{query_string}" if query_string else base_url
copy_button = dcc.Clipboard(
id="btn-copy-observatoire-url",
target_id="observatoire-share-url",
title="Copier l'URL de cette vue",
style={
"display": "inline-block",
"fontSize": 20,
"verticalAlign": "top",
"cursor": "pointer",
},
className="fa fa-link",
children=[
dbc.Button(
"Partager",
className="btn btn-primary mt-2",
title="Copier l'adresse de cette vue filtrée pour la partager.",
)
],
)
return full_url, copy_button
```
- [ ] **Step 5: Run test to verify it passes**
Run: `source .venv/bin/activate && pytest tests/test_main.py::test_007_observatoire_share_url -v`
Expected: PASS
- [ ] **Step 6: Run all tests to check for regressions**
Run: `source .venv/bin/activate && pytest tests/test_main.py -v`
Expected: all tests PASS
- [ ] **Step 7: Commit**
```bash
git add src/pages/observatoire.py tests/test_main.py
git commit -m "URL partageable pour la page observatoire #65"
```
---
### Task 5: End-to-end integration test
**Files:**
- Test: `tests/test_main.py`
**Context:** Verify the full flow: search for an organization on the homepage, see the 📊 link in results, click it, arrive on the observatoire with the correct input populated.
- [ ] **Step 1: Write end-to-end test**
```python
def test_008_search_to_observatoire(dash_duo: DashComposite):
from src.app import app
dash_duo.start_server(app)
dash_duo.wait_for_text_to_equal(".logo > h1", "decp.info", timeout=4)
# Search for an acheteur
search_bar = dash_duo.find_element("#search")
search_bar.send_keys("ACHETEUR 1")
search_bar.send_keys(Keys.ENTER)
dash_duo.wait_for_element("#results_acheteur_datatable", timeout=2)
# Find the observatoire link in acheteur_nom column
observatoire_link = dash_duo.find_element(
'#results_acheteur_datatable td[data-dash-column="acheteur_nom"] a[href*="observatoire"]'
)
assert "📊" in observatoire_link.text
# Click the observatoire link
observatoire_link.click()
# Wait for observatoire page to load
dash_duo.wait_for_element("#dashboard_acheteur_id", timeout=4)
import time
time.sleep(1) # Allow callback chain to complete
acheteur_input = dash_duo.find_element("#dashboard_acheteur_id")
assert acheteur_input.get_attribute("value") == "a1", (
"acheteur_id input should be populated after navigating from search"
)
```
- [ ] **Step 2: Run end-to-end test**
Run: `source .venv/bin/activate && pytest tests/test_main.py::test_008_search_to_observatoire -v`
Expected: PASS
- [ ] **Step 3: Run the full test suite**
Run: `source .venv/bin/activate && pytest tests/test_main.py -v`
Expected: all tests PASS
- [ ] **Step 4: Commit**
```bash
git add tests/test_main.py
git commit -m "Test e2e : recherche → observatoire #65"
```
File diff suppressed because it is too large Load Diff
@@ -0,0 +1,838 @@
# Tableau prepare_table_data Cache Implementation Plan
> **For agentic workers:** REQUIRED SUB-SKILL: Use superpowers:subagent-driven-development (recommended) or superpowers:executing-plans to implement this plan task-by-task. Steps use checkbox (`- [ ]`) syntax for tracking.
**Goal:** Make page navigation, sort changes, and repeated filter visits in the `/tableau` page near-instant by memoizing the expensive filter+sort+post-process pipeline inside `prepare_table_data`.
**Architecture:** Extract a memoized inner function `_load_filter_sort_postprocess(filter_query, sort_by_key)` that performs the heavy work (load full data, filter, sort, collect, cast-to-string, fill-null, add HTML links, format values) and returns a fully post-processed Polars DataFrame. The outer `prepare_table_data` becomes a thin wrapper that handles non-deterministic side effects (`track_search`, `uuid.uuid4()` for cleanup trigger, `data_timestamp + 1`) and pagination. The memoized helper only runs when no `data` argument is passed (i.e., the Tableau path). Other callers (`acheteur`, `titulaire`, `observatoire`) keep the current uncached path because they pass an externally-provided LazyFrame that is not safely hashable for cache keys.
**Tech Stack:** Polars (LazyFrame, DataFrame), Flask-Caching (`@cache.memoize()` on `FileSystemCache` already configured in `src/app.py:38`), pytest for unit tests.
**Git**: the issue id is #72, add the reference in commit messages.
---
## Background and constraints
Read these before starting; they explain why the design takes the shape it does.
1. **Cache infrastructure is already wired.** `src/cache.py` defines `cache = Cache()`. `src/app.py:38-48` initializes it with `FileSystemCache`, default 24h timeout, `CACHE_THRESHOLD=300`. The cache directory is wiped on every restart (`rmtree` at `src/app.py:36`), so cache always starts empty.
2. **Existing pattern to mirror.** `src/pages/observatoire.py:650-660` already uses `@cache.memoize()` plus a `_normalize_filter_params` helper that converts a dict of filters into a hashable tuple. This plan applies the same idiom to `sort_by` (which is a `list[dict]` from Dash DataTable).
3. **Non-deterministic outputs that MUST stay outside the memoized function:**
- `data_timestamp + 1` (increments each call; would freeze if cached)
- `trigger_cleanup = str(uuid.uuid4())` (intentionally unique per call to fire the clientside filter-cleanup callback)
- `track_search(filter_query, source_table)` — Matomo HTTP POST, currently called inside `filter_table_data` at `src/utils/table.py:214`. Must fire on every user action including cache hits.
4. **Tracking call site move.** `track_search` must move OUT of `filter_table_data` and into each caller, otherwise cache hits would silently skip Matomo tracking. Current callers of `filter_table_data` to update:
- `src/utils/table.py:402` (inside `prepare_table_data`)
- `src/pages/tableau.py:325` (`download_data` callback)
- `src/pages/acheteur.py:427` (`download_data_acheteur` callback)
- `src/pages/titulaire.py:443` (`download_data_titulaire` callback)
5. **Why Tableau-only caching.** `prepare_table_data` is also called from `acheteur.py`, `titulaire.py`, `observatoire.py`. Those callers pass a pre-filtered LazyFrame or list-of-dicts as `data`. Hashing arbitrary LazyFrames or large lists for memoization is impractical. The fix gates on `data is None` (the Tableau path) and leaves the other paths byte-for-byte identical.
6. **Cache key composition.** The memoized function takes only `(filter_query, sort_by_key)`. `page_current` and `page_size` are intentionally NOT in the key — pagination happens in the outer wrapper after retrieving the cached, fully post-processed frame. This means every page click and page-size change is a cache hit (the whole point of the change).
7. **Pickling.** Flask-Caching pickles arguments to form keys and pickles return values to disk. Polars `DataFrame` pickles cleanly. `LazyFrame` does not — so the memoized function must `.collect()` before returning.
8. **File path expectations.** All paths below are relative to repo root `/home/colin/git/decp.info`. Run all commands from there.
---
## File Structure
- **Modify** `src/utils/table.py` — extract memoized helper, refactor `prepare_table_data`, remove `track_search` call from `filter_table_data`.
- **Modify** `src/pages/tableau.py` — add explicit `track_search` call in `download_data`.
- **Modify** `src/pages/acheteur.py` — add explicit `track_search` call in `download_data_acheteur`.
- **Modify** `src/pages/titulaire.py` — add explicit `track_search` call in `download_data_titulaire`.
- **Create** `tests/test_table.py` — unit tests for new helpers and refactored `prepare_table_data`.
---
## Task 1: Set up unit tests for table.py
**Files:**
- Create: `tests/test_table.py`
This task scaffolds a non-Selenium pytest module so subsequent tasks can do TDD without booting a Dash server. The conftest already writes a small `tests/test.parquet` fixture (see `tests/conftest.py:10`); reuse it.
- [ ] **Step 1: Write the failing test**
Create `tests/test_table.py` with:
```python
import os
import polars as pl
import pytest
@pytest.fixture
def sample_lff():
"""Small LazyFrame with the columns needed by add_links / format_values."""
return pl.LazyFrame(
[
{
"uid": "u1",
"id": "u1",
"acheteur_id": "12345678900011",
"acheteur_nom": "Mairie de Test",
"titulaire_id": "98765432100022",
"titulaire_nom": "Entreprise Test",
"titulaire_typeIdentifiant": "SIRET",
"objet": "Travaux divers",
"montant": 12500.0,
"dateNotification": "2025-03-15",
"codeCPV": "45000000",
"dureeRestanteMois": 6,
"titulaire_distance": 42.0,
}
]
)
def test_table_module_imports():
from src.utils import table
assert hasattr(table, "prepare_table_data")
```
- [ ] **Step 2: Run test to verify it passes (sanity check)**
Run: `uv run pytest tests/test_table.py -v`
Expected: PASS for `test_table_module_imports`. (Selenium is not invoked because no `dash_duo` fixture is used.)
- [ ] **Step 3: Commit**
```bash
git add tests/test_table.py
git commit -m "test: scaffold unit tests for table utilities"
```
---
## Task 2: Move track_search out of filter_table_data
**Files:**
- Modify: `src/utils/table.py:210-274` (remove `track_search` import usage at line 214)
- Modify: `src/pages/tableau.py:317-334` (`download_data` callback)
- Modify: `src/pages/acheteur.py:425-430` area (`download_data_acheteur` callback)
- Modify: `src/pages/titulaire.py:441-446` area (`download_data_titulaire` callback)
- Modify: `tests/test_table.py` (add a test that confirms `filter_table_data` no longer calls Matomo)
`track_search` must move out so that the soon-to-be-memoized helper does not swallow tracking on cache hits. We do this BEFORE introducing caching so that the diff is small and verifiable on its own.
- [ ] **Step 1: Write the failing test**
Append to `tests/test_table.py`:
```python
def test_filter_table_data_does_not_call_track_search(monkeypatch, sample_lff):
from src.utils import table
calls = []
monkeypatch.setattr(table, "track_search", lambda *a, **kw: calls.append(a))
result = table.filter_table_data(
sample_lff, "{objet} icontains travaux", "tableau"
).collect()
assert calls == []
assert result.height == 1
```
- [ ] **Step 2: Run test to verify it fails**
Run: `uv run pytest tests/test_table.py::test_filter_table_data_does_not_call_track_search -v`
Expected: FAIL (`assert calls == []` fails because `filter_table_data` currently calls `track_search` at line 214).
- [ ] **Step 3: Remove the track_search call from filter_table_data**
Edit `src/utils/table.py` — find this block:
```python
def filter_table_data(
lff: pl.LazyFrame, filter_query: str, filter_source: str
) -> pl.LazyFrame:
_schema = lff.collect_schema()
track_search(filter_query, filter_source)
filtering_expressions = filter_query.split(" && ")
```
Remove the `track_search(filter_query, filter_source)` line. Result:
```python
def filter_table_data(
lff: pl.LazyFrame, filter_query: str, filter_source: str
) -> pl.LazyFrame:
_schema = lff.collect_schema()
filtering_expressions = filter_query.split(" && ")
```
The `filter_source` parameter remains in the signature (avoids changing all callers in this task). It becomes unused; that is acceptable since callers will pass it again later if needed. Do NOT remove the `from src.utils.tracking import track_search` import yet — `prepare_table_data` will use it in Task 5.
- [ ] **Step 4: Add explicit track_search calls in download callbacks**
In `src/pages/tableau.py`, find:
```python
def download_data(n_clicks, filter_query, sort_by, hidden_columns: list = None):
lff: pl.LazyFrame = query_marches().lazy()
# Les colonnes masquées sont supprimées
if hidden_columns:
lff = lff.drop(hidden_columns)
if filter_query:
lff = filter_table_data(lff, filter_query, "tab download")
```
Insert a `track_search` call so behavior is preserved. First add the import at the top of `src/pages/tableau.py` next to other `src.utils` imports:
```python
from src.utils.tracking import track_search
```
Then change the body:
```python
def download_data(n_clicks, filter_query, sort_by, hidden_columns: list = None):
lff: pl.LazyFrame = query_marches().lazy()
# Les colonnes masquées sont supprimées
if hidden_columns:
lff = lff.drop(hidden_columns)
if filter_query:
track_search(filter_query, "tab download")
lff = filter_table_data(lff, filter_query, "tab download")
```
Repeat the same pattern in `src/pages/acheteur.py` (search for `filter_table_data(lff, filter_query, "ach download")`):
Add import:
```python
from src.utils.tracking import track_search
```
Wrap the call:
```python
if filter_query:
track_search(filter_query, "ach download")
lff = filter_table_data(lff, filter_query, "ach download")
```
Repeat in `src/pages/titulaire.py` (search for `filter_table_data(lff, filter_query, "titu download")`):
Add import:
```python
from src.utils.tracking import track_search
```
Wrap the call:
```python
if filter_query:
track_search(filter_query, "titu download")
lff = filter_table_data(lff, filter_query, "titu download")
```
- [ ] **Step 5: Run test to verify it passes**
Run: `uv run pytest tests/test_table.py::test_filter_table_data_does_not_call_track_search -v`
Expected: PASS.
- [ ] **Step 6: Run full unit test file to verify no regressions**
Run: `uv run pytest tests/test_table.py -v`
Expected: All tests in `test_table.py` PASS.
- [ ] **Step 7: Commit**
```bash
git add src/utils/table.py src/pages/tableau.py src/pages/acheteur.py src/pages/titulaire.py tests/test_table.py
git commit -m "refactor: move track_search out of filter_table_data into callers"
```
---
## Task 3: Add normalize_sort_by helper
**Files:**
- Modify: `src/utils/table.py` (add helper near other utility functions, e.g. after `dates_to_strings`)
- Modify: `tests/test_table.py` (add tests)
A cache key must be hashable. Dash DataTable's `sort_by` is a `list[dict]` like `[{"column_id": "montant", "direction": "asc"}, ...]`, which is not hashable. We mirror the `_normalize_filter_params` idiom from `src/pages/observatoire.py:650-657`.
- [ ] **Step 1: Write the failing tests**
Append to `tests/test_table.py`:
```python
def test_normalize_sort_by_handles_empty():
from src.utils.table import normalize_sort_by
assert normalize_sort_by(None) == ()
assert normalize_sort_by([]) == ()
def test_normalize_sort_by_returns_hashable_tuple():
from src.utils.table import normalize_sort_by
sort_by = [
{"column_id": "montant", "direction": "desc"},
{"column_id": "dateNotification", "direction": "asc"},
]
key = normalize_sort_by(sort_by)
assert key == (("montant", "desc"), ("dateNotification", "asc"))
# Must be hashable so that flask-caching can build a cache key from it
hash(key)
def test_normalize_sort_by_preserves_order():
"""Order matters for sort: [A, B] != [B, A]."""
from src.utils.table import normalize_sort_by
a_then_b = normalize_sort_by(
[{"column_id": "a", "direction": "asc"}, {"column_id": "b", "direction": "asc"}]
)
b_then_a = normalize_sort_by(
[{"column_id": "b", "direction": "asc"}, {"column_id": "a", "direction": "asc"}]
)
assert a_then_b != b_then_a
```
- [ ] **Step 2: Run tests to verify they fail**
Run: `uv run pytest tests/test_table.py -v -k normalize_sort_by`
Expected: FAIL with `ImportError` for `normalize_sort_by`.
- [ ] **Step 3: Implement normalize_sort_by**
Edit `src/utils/table.py`. Add this function immediately after the `dates_to_strings` function (around line 148):
```python
def normalize_sort_by(sort_by) -> tuple:
"""Convert Dash DataTable sort_by (list[dict]) into a hashable tuple
suitable for use as a cache key. Order is preserved because it determines
sort precedence."""
if not sort_by:
return ()
return tuple((entry["column_id"], entry["direction"]) for entry in sort_by)
```
- [ ] **Step 4: Run tests to verify they pass**
Run: `uv run pytest tests/test_table.py -v -k normalize_sort_by`
Expected: 3 PASS.
- [ ] **Step 5: Commit**
```bash
git add src/utils/table.py tests/test_table.py
git commit -m "feat: add normalize_sort_by hashable cache-key helper"
```
---
## Task 4: Extract memoized post-process helper
**Files:**
- Modify: `src/utils/table.py` (add `_load_filter_sort_postprocess`, decorate with `@cache.memoize()`, import `cache`)
- Modify: `tests/test_table.py` (add tests)
Introduce the function whose result will live in the FileSystemCache. Inputs: `(filter_query, sort_by_key)`. Output: a fully post-processed, unpaginated Polars DataFrame ready to slice and convert to dicts.
This task does NOT yet wire the helper into `prepare_table_data` — that happens in Task 5. Splitting these tasks keeps each diff small and testable.
- [ ] **Step 1: Write the failing tests**
Append to `tests/test_table.py`:
```python
@pytest.fixture(autouse=True)
def reset_cache():
"""Ensure the flask-caching backend is empty between tests so that
cache-hit assertions are meaningful. Falls back to no-op when no
Flask app context is active (NullCache)."""
from utils.cache import cache
try:
cache.clear()
except RuntimeError:
# No app context — cache is NullCache, nothing to clear
pass
yield
def test_load_filter_sort_postprocess_returns_dataframe(monkeypatch, sample_lff):
from src.utils import table
monkeypatch.setattr(
table, "query_marches", lambda: sample_lff.collect()
)
df = table._load_filter_sort_postprocess(filter_query=None, sort_by_key=())
assert isinstance(df, pl.DataFrame)
assert df.height == 1
# All values must be strings after post-processing
for col in df.columns:
assert df.schema[col] == pl.String
def test_load_filter_sort_postprocess_applies_filter(monkeypatch, sample_lff):
from src.utils import table
monkeypatch.setattr(
table, "query_marches", lambda: sample_lff.collect()
)
df = table._load_filter_sort_postprocess(
filter_query="{objet} icontains travaux", sort_by_key=()
)
assert df.height == 1
df_empty = table._load_filter_sort_postprocess(
filter_query="{objet} icontains nonexistent", sort_by_key=()
)
assert df_empty.height == 0
def test_load_filter_sort_postprocess_adds_links(monkeypatch, sample_lff):
from src.utils import table
monkeypatch.setattr(
table, "query_marches", lambda: sample_lff.collect()
)
df = table._load_filter_sort_postprocess(filter_query=None, sort_by_key=())
# add_links injects an <a href> wrapper around uid, acheteur_nom, titulaire_nom
assert "<a href" in df["uid"][0]
assert "<a href" in df["acheteur_nom"][0]
assert "<a href" in df["titulaire_nom"][0]
```
- [ ] **Step 2: Run tests to verify they fail**
Run: `uv run pytest tests/test_table.py -v -k load_filter_sort_postprocess`
Expected: FAIL with `AttributeError: module 'src.utils.table' has no attribute '_load_filter_sort_postprocess'`.
- [ ] **Step 3: Implement the helper**
Edit `src/utils/table.py`. Add this import near the top, with the other `src.` imports:
```python
from utils.cache import cache
```
Then add the helper function. Place it ABOVE `prepare_table_data` (around line 370, just before `def prepare_table_data`):
```python
@cache.memoize()
def _load_filter_sort_postprocess(filter_query, sort_by_key):
"""Memoized core of the Tableau page pipeline.
Loads the full marchés dataset, applies filter and sort, materializes,
then runs the per-row post-processing (cast to string, fill nulls, add
HTML links, format values). Returns an unpaginated Polars DataFrame.
Inputs MUST be hashable: filter_query is str|None, sort_by_key is the
tuple produced by normalize_sort_by(). Pagination intentionally lives
in the outer wrapper so that page changes are cache hits.
"""
logger.debug(f"Cache miss — recomputing for filter={filter_query!r} sort={sort_by_key!r}")
lff: pl.LazyFrame = query_marches().lazy()
if filter_query:
lff = filter_table_data(lff, filter_query, "tableau")
if sort_by_key:
sort_by = [
{"column_id": col, "direction": direction}
for col, direction in sort_by_key
]
lff = sort_table_data(lff, sort_by)
# The remaining steps are cheap per-row operations that we run ONCE here
# so that pagination in the outer function is a pure slice + to_dicts.
lff = lff.cast(pl.String)
lff = lff.fill_null("")
dff: pl.DataFrame = lff.collect()
dff = add_links(dff)
if "sourceFile" in dff.columns:
dff = add_resource_link(dff)
if dff.height > 0:
dff = format_values(dff)
return dff
```
- [ ] **Step 4: Run tests to verify they pass**
Run: `uv run pytest tests/test_table.py -v -k load_filter_sort_postprocess`
Expected: 3 PASS.
- [ ] **Step 5: Run the full test_table.py to catch regressions**
Run: `uv run pytest tests/test_table.py -v`
Expected: All PASS.
- [ ] **Step 6: Commit**
```bash
git add src/utils/table.py tests/test_table.py
git commit -m "feat: add memoized _load_filter_sort_postprocess helper"
```
---
## Task 5: Wire the memoized helper into prepare_table_data
**Files:**
- Modify: `src/utils/table.py` — replace the body of `prepare_table_data` so the Tableau path uses the cache
- Modify: `tests/test_table.py` — add tests covering the new flow
The outer function keeps its signature unchanged so callers in `acheteur.py`, `titulaire.py`, `observatoire.py`, `tableau.py` need no updates. When `data is None` (the Tableau case), use the memoized helper; otherwise fall through to the original logic.
- [ ] **Step 1: Write the failing tests**
Append to `tests/test_table.py`:
```python
def test_prepare_table_data_returns_expected_tuple(monkeypatch, sample_lff):
from src.utils import table
monkeypatch.setattr(
table, "query_marches", lambda: sample_lff.collect()
)
result = table.prepare_table_data(
data=None,
data_timestamp=5,
filter_query=None,
page_current=0,
page_size=20,
sort_by=[],
source_table="tableau",
)
# Same arity as before: 9 outputs
assert len(result) == 9
dicts, columns, tooltip, ts, nb_rows, dl_disabled, dl_text, dl_title, cleanup = result
assert isinstance(dicts, list)
assert ts == 6 # data_timestamp + 1 must still increment
assert "1 lignes" in nb_rows
def test_prepare_table_data_calls_track_search_on_filter(monkeypatch, sample_lff):
from src.utils import table
calls = []
monkeypatch.setattr(
table, "query_marches", lambda: sample_lff.collect()
)
monkeypatch.setattr(table, "track_search", lambda *a, **kw: calls.append(a))
table.prepare_table_data(
data=None,
data_timestamp=0,
filter_query="{objet} icontains travaux",
page_current=0,
page_size=20,
sort_by=[],
source_table="tableau",
)
assert calls == [("{objet} icontains travaux", "tableau")]
def test_prepare_table_data_paginates_without_recomputing(monkeypatch, sample_lff):
"""Two calls with same filter+sort but different pages must invoke
the inner heavy work only once."""
from src.utils import table
call_count = {"n": 0}
real_query = sample_lff.collect()
def counting_query():
call_count["n"] += 1
return real_query
monkeypatch.setattr(table, "query_marches", counting_query)
# First call: cache miss
table.prepare_table_data(
data=None,
data_timestamp=0,
filter_query=None,
page_current=0,
page_size=10,
sort_by=[],
source_table="tableau",
)
first_count = call_count["n"]
# Second call, different page: cache hit, query_marches must NOT fire again
table.prepare_table_data(
data=None,
data_timestamp=0,
filter_query=None,
page_current=1,
page_size=10,
sort_by=[],
source_table="tableau",
)
assert call_count["n"] == first_count, (
"query_marches was called again — pagination triggered cache miss"
)
def test_prepare_table_data_cleanup_trigger_for_non_tableau(monkeypatch, sample_lff):
"""Non-tableau pages still get a fresh uuid trigger, not no_update."""
from dash import no_update
from src.utils import table
monkeypatch.setattr(
table, "query_marches", lambda: sample_lff.collect()
)
result = table.prepare_table_data(
data=None,
data_timestamp=0,
filter_query="{objet} icontains travaux",
page_current=0,
page_size=20,
sort_by=[],
source_table="acheteur",
)
cleanup = result[8]
assert cleanup is not no_update
assert isinstance(cleanup, str)
assert len(cleanup) >= 32 # uuid4 hex string
def test_prepare_table_data_with_external_data_does_not_use_cache(
monkeypatch, sample_lff
):
"""When a caller passes data (acheteur/titulaire/observatoire path),
bypass the memoized helper entirely."""
from src.utils import table
sentinel = {"called": False}
def should_not_be_called(*a, **kw):
sentinel["called"] = True
raise AssertionError("Memoized helper must not be called when data is provided")
monkeypatch.setattr(
table, "_load_filter_sort_postprocess", should_not_be_called
)
table.prepare_table_data(
data=sample_lff, # external LazyFrame
data_timestamp=0,
filter_query=None,
page_current=0,
page_size=20,
sort_by=[],
source_table="acheteur",
)
assert sentinel["called"] is False
```
- [ ] **Step 2: Run tests to verify they fail**
Run: `uv run pytest tests/test_table.py -v -k prepare_table_data`
Expected: At least the cache-hit (`paginates_without_recomputing`) and `track_search`-routing tests FAIL because the current `prepare_table_data` re-runs the full pipeline on every call and routes tracking through `filter_table_data` (which Task 2 already neutralized — so tracking would be lost without the new explicit call).
- [ ] **Step 3: Refactor prepare_table_data**
Edit `src/utils/table.py`. Replace the entire `prepare_table_data` function body with:
```python
def prepare_table_data(
data, data_timestamp, filter_query, page_current, page_size, sort_by, source_table
):
"""
Préparation des données pour les datatables.
Pour la page Tableau (data is None), le calcul lourd (chargement complet,
filtre, tri, post-traitement) est mémorisé via _load_filter_sort_postprocess.
Les changements de page deviennent ainsi des cache hits.
Pour les autres pages (data fourni), le chemin original est conservé : la
LazyFrame externe n'est pas hashable et le coût de filtre/tri y est déjà
minime puisque les données sont pré-restreintes.
"""
logger.debug(" + + + + + + + + + + + + + + + + + + ")
# Side effect non-cacheable : le tracking doit firer sur chaque action
# utilisateur, y compris sur cache hit.
if filter_query:
track_search(filter_query, source_table)
# Trigger uuid pour les pages autres que tableau (clientside cleanup)
trigger_cleanup = (
no_update if source_table == "tableau" else str(uuid.uuid4())
)
if data is None:
# Tableau path : utilise le cache
sort_by_key = normalize_sort_by(sort_by)
dff: pl.DataFrame = _load_filter_sort_postprocess(
filter_query=filter_query, sort_by_key=sort_by_key
)
else:
# acheteur / titulaire / observatoire path : code original, non caché
if isinstance(data, list):
lff: pl.LazyFrame = pl.LazyFrame(
data, strict=False, infer_schema_length=5000
)
elif isinstance(data, pl.LazyFrame):
lff = data
else:
lff = query_marches().lazy()
if filter_query:
lff = filter_table_data(lff, filter_query, source_table)
if sort_by and len(sort_by) > 0:
lff = sort_table_data(lff, sort_by)
dff = lff.collect()
dff = dff.cast(pl.String)
dff = dff.fill_null("")
dff = add_links(dff)
if "sourceFile" in dff.columns:
dff = add_resource_link(dff)
if dff.height > 0:
dff = format_values(dff)
height = dff.height
if height > 0:
nb_rows = (
f"{format_number(height)} lignes "
f"({format_number(dff.select('uid').unique().height)} marchés)"
)
else:
nb_rows = "0 lignes (0 marchés)"
# Pagination — toujours hors cache pour rester sur des cache hits
start_row = page_current * page_size
dff = dff.slice(start_row, page_size)
table_columns, tooltip = setup_table_columns(dff)
dicts = dff.to_dicts()
download_disabled, download_text, download_title = get_button_properties(height)
return (
dicts,
table_columns,
tooltip,
data_timestamp + 1,
nb_rows,
download_disabled,
download_text,
download_title,
trigger_cleanup,
)
```
Notes on what changed vs the original at `src/utils/table.py:372-458`:
- `track_search` now called explicitly at the top, on every invocation (not via `filter_table_data`).
- `data is None` branch delegates the heavy work to the memoized helper.
- `data is not None` branch is functionally identical to the original (pagination still happens after collect+post-process).
- The post-processing (`cast`, `fill_null`, `add_links`, `add_resource_link`, `format_values`) is now done in BOTH branches before `nb_rows` calculation. In the cached branch this was already done inside `_load_filter_sort_postprocess`; in the uncached branch we keep doing it inline. This means `nb_rows` and `dff.select('uid').unique().height` operate on the post-processed frame in both branches, matching the original semantics.
- [ ] **Step 4: Run all unit tests**
Run: `uv run pytest tests/test_table.py -v`
Expected: All PASS, including `test_prepare_table_data_paginates_without_recomputing`.
- [ ] **Step 5: Run the full repo test suite to catch regressions**
Run: `uv run pytest -v`
Expected: All PASS. Selenium tests (`tests/test_main.py`) require Chrome/Chromium; if the executor lacks a browser, those tests will error/skip — note the failures and rerun in an environment with Chrome before declaring done.
- [ ] **Step 6: Commit**
```bash
git add src/utils/table.py tests/test_table.py
git commit -m "perf(tableau): memoize filter+sort+postprocess pipeline"
```
---
## Task 6: Manual smoke test in the browser
**Files:** none modified.
Type checks and unit tests cannot validate that page navigation actually feels faster. This task is explicitly a hands-on verification.
- [ ] **Step 1: Start the dev server**
Run: `uv run run.py`
Wait for `Dash is running on http://...`.
- [ ] **Step 2: Open the Tableau page and warm the cache**
1. Open `http://localhost:8050/tableau` (or whatever port the dev server prints).
2. With no filter applied, wait for the first page to load fully. This is the cold-cache load (slow expected).
3. Open the browser devtools Network panel.
- [ ] **Step 3: Verify pagination is fast**
1. Click "page 2" / "page 3" / "page 4" in the table footer in quick succession.
2. Each navigation should return data in well under 1 second (in the original code each took several seconds).
3. In the dev server logs, look for the line `Cache miss — recomputing for filter=...` from `_load_filter_sort_postprocess`. It should appear ONCE for the initial load and NOT appear again as you change pages.
- [ ] **Step 4: Verify a new filter triggers exactly one cache miss**
1. In the table, type a filter into one of the columns (e.g. `paris` in `acheteur_commune_nom`) and press Enter.
2. The dev log should show ONE new `Cache miss — recomputing` line.
3. Change page within the filtered view — no new cache miss line should appear.
- [ ] **Step 5: Verify filter cleanup trigger still fires**
1. Open `http://localhost:8050/acheteur?id=<some_acheteur_id>` (use any valid id from the dataset).
2. Apply a filter on the embedded table.
3. The clientside callback for filter cleanup (`src/assets/dash_clientside.js` `clean_filters`) should still rewrite the filter operators (e.g. `contains``icontains`). If it doesn't fire, the `trigger_cleanup` uuid is broken — investigate.
- [ ] **Step 6: Verify download still works**
1. On the Tableau page, click "Télécharger au format Excel" (the button must be enabled — apply a filter that brings the row count under 65,000).
2. The downloaded XLSX must open and contain the filtered rows.
- [ ] **Step 7: Stop the dev server**
Ctrl-C.
- [ ] **Step 8: If all checks pass, this completes the implementation**
No commit — this task is verification only. Report results to the user.
File diff suppressed because it is too large Load Diff
@@ -0,0 +1,951 @@
# Observatoire — filtrage natif DuckDB — Plan d'implémentation
> **For agentic workers:** REQUIRED SUB-SKILL: Use superpowers:subagent-driven-development (recommended) or superpowers:executing-plans to implement this plan task-by-task. Steps use checkbox (`- [ ]`) syntax for tracking.
**Goal:** Remplacer le filtrage Polars sur LazyFrame dans `prepare_dashboard_data` par un requêtage natif DuckDB, pour ne matérialiser que le sous-ensemble utile au lieu de l'intégralité de la table `decp` (~1,5 M lignes).
**Architecture:** Nouveau helper pur `dashboard_filters_to_sql(**filter_params) -> (where_sql, params)` dans `src/utils/table_sql.py` (modèle de `filter_query_to_sql`). `prepare_dashboard_data` devient une fonction fine qui appelle `query_marches(where_sql, params)` et retourne une `pl.DataFrame`. Les 3 appelants dans `src/pages/observatoire.py` sont adaptés à la nouvelle signature.
**Tech Stack:** Python 3.12, Polars, DuckDB, Dash, pytest.
**Spec:** `docs/superpowers/specs/2026-04-22-observatoire-duckdb-filters-design.md`.
---
## File Structure
**À créer :**
- `tests/test_dashboard_filters_to_sql.py` — tests unitaires du nouveau helper SQL (cas vide + cas par filtre).
- `tests/test_prepare_dashboard_data.py` — test d'intégration léger (appel DuckDB réel sur `tests/test.parquet`).
**À modifier :**
- `src/utils/table_sql.py` — ajouter `dashboard_filters_to_sql` + import `datetime`/`timedelta`.
- `src/utils/data.py` — réécrire `prepare_dashboard_data` (signature et implémentation), ajouter `query_marches` aux imports `from src.db`.
- `src/pages/observatoire.py` — adapter 3 sites d'appel (lignes ~668, ~791, ~882) ; retirer `query_marches` de l'import `from src.db` (plus utilisé).
- `tests/test_main.py` — supprimer `test_010_observatoire_montant_filter` (migré en test unitaire du helper).
---
## Task 1: Tests unitaires — cas par défaut + filtre année
**Files:**
- Create: `tests/test_dashboard_filters_to_sql.py`
- Modify: `src/utils/table_sql.py`
- [ ] **Step 1: Write the failing tests**
Create `tests/test_dashboard_filters_to_sql.py`:
```python
from datetime import datetime, timedelta
from src.utils.table_sql import dashboard_filters_to_sql
def test_no_filters_uses_default_365_day_window():
where_sql, params = dashboard_filters_to_sql()
assert where_sql == '"dateNotification" > ?'
assert len(params) == 1
assert isinstance(params[0], datetime)
expected = datetime.now() - timedelta(days=365)
assert abs((params[0] - expected).total_seconds()) < 2
def test_year_filter_overrides_default_window():
where_sql, params = dashboard_filters_to_sql(dashboard_year="2025")
assert where_sql == 'YEAR("dateNotification") = ?'
assert params == [2025]
```
- [ ] **Step 2: Run tests to verify they fail**
Run: `rtk pytest tests/test_dashboard_filters_to_sql.py -v`
Expected: FAIL with `ImportError: cannot import name 'dashboard_filters_to_sql'`.
- [ ] **Step 3: Implement the helper**
Add to the top of `src/utils/table_sql.py` (below existing imports):
```python
from datetime import datetime, timedelta
```
Append this function at the end of `src/utils/table_sql.py`:
```python
def dashboard_filters_to_sql(
dashboard_year=None,
dashboard_acheteur_id=None,
dashboard_acheteur_categorie=None,
dashboard_acheteur_departement_code=None,
dashboard_titulaire_id=None,
dashboard_titulaire_categorie=None,
dashboard_titulaire_departement_code=None,
dashboard_marche_type=None,
dashboard_marche_objet=None,
dashboard_marche_code_cpv=None,
dashboard_marche_considerations_sociales=None,
dashboard_marche_considerations_environnementales=None,
dashboard_marche_techniques=None,
dashboard_marche_innovant=None,
dashboard_marche_sous_traitance_declaree=None,
dashboard_montant_min=None,
dashboard_montant_max=None,
) -> tuple[str, list]:
"""Traduit les filtres du tableau de bord en (where_clause, params) DuckDB."""
clauses: list[str] = []
params: list = []
if dashboard_year:
clauses.append('YEAR("dateNotification") = ?')
params.append(int(dashboard_year))
else:
clauses.append('"dateNotification" > ?')
params.append(datetime.now() - timedelta(days=365))
return " AND ".join(clauses), params
```
- [ ] **Step 4: Run tests to verify they pass**
Run: `rtk pytest tests/test_dashboard_filters_to_sql.py -v`
Expected: PASS (2 tests).
- [ ] **Step 5: Commit**
```bash
rtk pre-commit run --files tests/test_dashboard_filters_to_sql.py src/utils/table_sql.py
rtk git add tests/test_dashboard_filters_to_sql.py src/utils/table_sql.py
rtk git commit -m "feat(observatoire): squelette de dashboard_filters_to_sql (#72)"
```
---
## Task 2: Filtres d'égalité simples (catégorie, type, innovant, sous-traitance)
**Files:**
- Modify: `tests/test_dashboard_filters_to_sql.py`
- Modify: `src/utils/table_sql.py`
- [ ] **Step 1: Add failing tests**
Append to `tests/test_dashboard_filters_to_sql.py`:
```python
def test_marche_type_equality():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_marche_type="Marché",
)
assert where_sql == 'YEAR("dateNotification") = ? AND "type" = ?'
assert params == [2025, "Marché"]
def test_innovant_value_all_is_skipped():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_marche_innovant="all",
)
assert where_sql == 'YEAR("dateNotification") = ?'
assert params == [2025]
def test_innovant_value_oui_adds_clause():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_marche_innovant="oui",
)
assert where_sql == 'YEAR("dateNotification") = ? AND "marcheInnovant" = ?'
assert params == [2025, "oui"]
def test_sous_traitance_value_non_adds_clause():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_marche_sous_traitance_declaree="non",
)
assert (
where_sql
== 'YEAR("dateNotification") = ? AND "sousTraitanceDeclaree" = ?'
)
assert params == [2025, "non"]
```
- [ ] **Step 2: Run tests to verify they fail**
Run: `rtk pytest tests/test_dashboard_filters_to_sql.py -v`
Expected: 4 new tests FAIL (missing clauses).
- [ ] **Step 3: Extend the helper**
Insert the following block in `dashboard_filters_to_sql`, **after** the `if dashboard_year / else` block and **before** `return " AND ".join(clauses), params`:
```python
if dashboard_marche_type:
clauses.append('"type" = ?')
params.append(dashboard_marche_type)
if dashboard_marche_innovant and dashboard_marche_innovant != "all":
clauses.append('"marcheInnovant" = ?')
params.append(dashboard_marche_innovant)
if (
dashboard_marche_sous_traitance_declaree
and dashboard_marche_sous_traitance_declaree != "all"
):
clauses.append('"sousTraitanceDeclaree" = ?')
params.append(dashboard_marche_sous_traitance_declaree)
```
- [ ] **Step 4: Run tests to verify they pass**
Run: `rtk pytest tests/test_dashboard_filters_to_sql.py -v`
Expected: PASS (6 tests total).
- [ ] **Step 5: Commit**
```bash
rtk pre-commit run --files tests/test_dashboard_filters_to_sql.py src/utils/table_sql.py
rtk git add tests/test_dashboard_filters_to_sql.py src/utils/table_sql.py
rtk git commit -m "feat(observatoire): filtres d'égalité simples dans dashboard_filters_to_sql (#72)"
```
---
## Task 3: Filtres LIKE/ILIKE (ids, objet, cpv)
**Files:**
- Modify: `tests/test_dashboard_filters_to_sql.py`
- Modify: `src/utils/table_sql.py`
- [ ] **Step 1: Add failing tests**
Append to `tests/test_dashboard_filters_to_sql.py`:
```python
def test_acheteur_id_uses_like_wildcards():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_acheteur_id="12345678900010",
)
assert where_sql == 'YEAR("dateNotification") = ? AND "acheteur_id" LIKE ?'
assert params == [2025, "%12345678900010%"]
def test_titulaire_id_uses_like_wildcards():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_titulaire_id="999",
)
assert where_sql == 'YEAR("dateNotification") = ? AND "titulaire_id" LIKE ?'
assert params == [2025, "%999%"]
def test_marche_objet_uses_case_insensitive_ilike():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_marche_objet="travaux",
)
assert where_sql == 'YEAR("dateNotification") = ? AND "objet" ILIKE ?'
assert params == [2025, "%travaux%"]
def test_code_cpv_uses_prefix_like():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_marche_code_cpv="4521",
)
assert where_sql == 'YEAR("dateNotification") = ? AND "codeCPV" LIKE ?'
assert params == [2025, "4521%"]
```
- [ ] **Step 2: Run tests to verify they fail**
Run: `rtk pytest tests/test_dashboard_filters_to_sql.py -v`
Expected: 4 new tests FAIL.
- [ ] **Step 3: Extend the helper**
Insert the following block, **just after** the year/default block and **before** the `if dashboard_marche_type` block:
```python
if dashboard_acheteur_id:
clauses.append('"acheteur_id" LIKE ?')
params.append(f"%{dashboard_acheteur_id}%")
if dashboard_titulaire_id:
clauses.append('"titulaire_id" LIKE ?')
params.append(f"%{dashboard_titulaire_id}%")
```
Insert in the "marché" block, **after** `dashboard_marche_type` and **before** `dashboard_marche_innovant`:
```python
if dashboard_marche_objet:
clauses.append('"objet" ILIKE ?')
params.append(f"%{dashboard_marche_objet}%")
if dashboard_marche_code_cpv:
clauses.append('"codeCPV" LIKE ?')
params.append(f"{dashboard_marche_code_cpv}%")
```
- [ ] **Step 4: Run tests to verify they pass**
Run: `rtk pytest tests/test_dashboard_filters_to_sql.py -v`
Expected: PASS (10 tests total).
- [ ] **Step 5: Commit**
```bash
rtk pre-commit run --files tests/test_dashboard_filters_to_sql.py src/utils/table_sql.py
rtk git add tests/test_dashboard_filters_to_sql.py src/utils/table_sql.py
rtk git commit -m "feat(observatoire): filtres LIKE/ILIKE dans dashboard_filters_to_sql (#72)"
```
---
## Task 4: Filtre IN (départements) + skip conditionnel par ID
**Files:**
- Modify: `tests/test_dashboard_filters_to_sql.py`
- Modify: `src/utils/table_sql.py`
- [ ] **Step 1: Add failing tests**
Append to `tests/test_dashboard_filters_to_sql.py`:
```python
def test_acheteur_departement_multiple_uses_in_clause():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_acheteur_departement_code=["75", "92", "93"],
)
assert where_sql == (
'YEAR("dateNotification") = ? '
'AND "acheteur_departement_code" IN (?, ?, ?)'
)
assert params == [2025, "75", "92", "93"]
def test_acheteur_categorie_adds_clause():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_acheteur_categorie="Commune",
)
assert where_sql == 'YEAR("dateNotification") = ? AND "acheteur_categorie" = ?'
assert params == [2025, "Commune"]
def test_titulaire_categorie_and_departement():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_titulaire_categorie="PME",
dashboard_titulaire_departement_code=["35"],
)
assert where_sql == (
'YEAR("dateNotification") = ? '
'AND "titulaire_categorie" = ? '
'AND "titulaire_departement_code" IN (?)'
)
assert params == [2025, "PME", "35"]
def test_acheteur_id_present_skips_categorie_and_departement():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_acheteur_id="123",
dashboard_acheteur_categorie="Commune",
dashboard_acheteur_departement_code=["75"],
)
assert where_sql == 'YEAR("dateNotification") = ? AND "acheteur_id" LIKE ?'
assert params == [2025, "%123%"]
def test_titulaire_id_present_skips_categorie_and_departement():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_titulaire_id="999",
dashboard_titulaire_categorie="PME",
dashboard_titulaire_departement_code=["35"],
)
assert where_sql == 'YEAR("dateNotification") = ? AND "titulaire_id" LIKE ?'
assert params == [2025, "%999%"]
```
- [ ] **Step 2: Run tests to verify they fail**
Run: `rtk pytest tests/test_dashboard_filters_to_sql.py -v`
Expected: 5 new tests FAIL.
- [ ] **Step 3: Refactor the helper with conditional skip**
Replace the two simple `if dashboard_acheteur_id` / `if dashboard_titulaire_id` blocks added in Task 3 with the nested form:
```python
if dashboard_acheteur_id:
clauses.append('"acheteur_id" LIKE ?')
params.append(f"%{dashboard_acheteur_id}%")
else:
if dashboard_acheteur_categorie:
clauses.append('"acheteur_categorie" = ?')
params.append(dashboard_acheteur_categorie)
if dashboard_acheteur_departement_code:
placeholders = ", ".join(["?"] * len(dashboard_acheteur_departement_code))
clauses.append(f'"acheteur_departement_code" IN ({placeholders})')
params.extend(dashboard_acheteur_departement_code)
if dashboard_titulaire_id:
clauses.append('"titulaire_id" LIKE ?')
params.append(f"%{dashboard_titulaire_id}%")
else:
if dashboard_titulaire_categorie:
clauses.append('"titulaire_categorie" = ?')
params.append(dashboard_titulaire_categorie)
if dashboard_titulaire_departement_code:
placeholders = ", ".join(
["?"] * len(dashboard_titulaire_departement_code)
)
clauses.append(f'"titulaire_departement_code" IN ({placeholders})')
params.extend(dashboard_titulaire_departement_code)
```
- [ ] **Step 4: Run tests to verify they pass**
Run: `rtk pytest tests/test_dashboard_filters_to_sql.py -v`
Expected: PASS (15 tests total).
- [ ] **Step 5: Commit**
```bash
rtk pre-commit run --files tests/test_dashboard_filters_to_sql.py src/utils/table_sql.py
rtk git add tests/test_dashboard_filters_to_sql.py src/utils/table_sql.py
rtk git commit -m "feat(observatoire): IN départements et skip conditionnel par ID (#72)"
```
---
## Task 5: Filtre liste (techniques, considérations sociales/environnementales)
**Files:**
- Modify: `tests/test_dashboard_filters_to_sql.py`
- Modify: `src/utils/table_sql.py`
- [ ] **Step 1: Add failing tests**
Append to `tests/test_dashboard_filters_to_sql.py`:
```python
def test_marche_techniques_uses_list_has_any():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_marche_techniques=["Enchère", "Accord-cadre"],
)
assert where_sql == (
'YEAR("dateNotification") = ? '
"AND list_has_any(string_split(\"techniques\", ', '), ?::VARCHAR[])"
)
assert params == [2025, ["Enchère", "Accord-cadre"]]
def test_considerations_sociales_uses_list_has_any():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_marche_considerations_sociales=["Clause sociale"],
)
assert where_sql == (
'YEAR("dateNotification") = ? '
"AND list_has_any(string_split(\"considerationsSociales\", ', '), ?::VARCHAR[])"
)
assert params == [2025, ["Clause sociale"]]
def test_considerations_environnementales_uses_list_has_any():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_marche_considerations_environnementales=["Clause env."],
)
assert where_sql == (
'YEAR("dateNotification") = ? '
"AND list_has_any(string_split(\"considerationsEnvironnementales\", ', '), ?::VARCHAR[])"
)
assert params == [2025, ["Clause env."]]
```
- [ ] **Step 2: Run tests to verify they fail**
Run: `rtk pytest tests/test_dashboard_filters_to_sql.py -v`
Expected: 3 new tests FAIL.
- [ ] **Step 3: Extend the helper**
Insert the following block in `dashboard_filters_to_sql`, **after** the `dashboard_marche_sous_traitance_declaree` block and **before** `return " AND ".join(clauses), params`:
```python
if dashboard_marche_techniques:
clauses.append(
"list_has_any(string_split(\"techniques\", ', '), ?::VARCHAR[])"
)
params.append(list(dashboard_marche_techniques))
if dashboard_marche_considerations_sociales:
clauses.append(
"list_has_any(string_split(\"considerationsSociales\", ', '), ?::VARCHAR[])"
)
params.append(list(dashboard_marche_considerations_sociales))
if dashboard_marche_considerations_environnementales:
clauses.append(
"list_has_any(string_split(\"considerationsEnvironnementales\", ', '), ?::VARCHAR[])"
)
params.append(list(dashboard_marche_considerations_environnementales))
```
- [ ] **Step 4: Run tests to verify they pass**
Run: `rtk pytest tests/test_dashboard_filters_to_sql.py -v`
Expected: PASS (18 tests total).
- [ ] **Step 5: Commit**
```bash
rtk pre-commit run --files tests/test_dashboard_filters_to_sql.py src/utils/table_sql.py
rtk git add tests/test_dashboard_filters_to_sql.py src/utils/table_sql.py
rtk git commit -m "feat(observatoire): filtres liste via list_has_any (#72)"
```
---
## Task 6: Filtres montant min/max (incluant 0)
**Files:**
- Modify: `tests/test_dashboard_filters_to_sql.py`
- Modify: `src/utils/table_sql.py`
- [ ] **Step 1: Add failing tests**
Append to `tests/test_dashboard_filters_to_sql.py`:
```python
def test_montant_min_only():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_montant_min=1000,
)
assert where_sql == 'YEAR("dateNotification") = ? AND "montant" >= ?'
assert params == [2025, 1000]
def test_montant_max_only():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_montant_max=500,
)
assert where_sql == 'YEAR("dateNotification") = ? AND "montant" <= ?'
assert params == [2025, 500]
def test_montant_zero_is_a_valid_lower_bound():
# 0 est falsy mais reste un filtre valide (distinct de None)
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_montant_min=0,
)
assert where_sql == 'YEAR("dateNotification") = ? AND "montant" >= ?'
assert params == [2025, 0]
def test_montant_min_and_max_combined():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_montant_min=100,
dashboard_montant_max=1000,
)
assert where_sql == (
'YEAR("dateNotification") = ? AND "montant" >= ? AND "montant" <= ?'
)
assert params == [2025, 100, 1000]
```
- [ ] **Step 2: Run tests to verify they fail**
Run: `rtk pytest tests/test_dashboard_filters_to_sql.py -v`
Expected: 4 new tests FAIL.
- [ ] **Step 3: Extend the helper**
Insert at the very end of `dashboard_filters_to_sql`, **just before** `return " AND ".join(clauses), params`:
```python
if dashboard_montant_min is not None:
clauses.append('"montant" >= ?')
params.append(dashboard_montant_min)
if dashboard_montant_max is not None:
clauses.append('"montant" <= ?')
params.append(dashboard_montant_max)
```
- [ ] **Step 4: Run tests to verify they pass**
Run: `rtk pytest tests/test_dashboard_filters_to_sql.py -v`
Expected: PASS (22 tests total).
- [ ] **Step 5: Commit**
```bash
rtk pre-commit run --files tests/test_dashboard_filters_to_sql.py src/utils/table_sql.py
rtk git add tests/test_dashboard_filters_to_sql.py src/utils/table_sql.py
rtk git commit -m "feat(observatoire): filtres montant min/max (#72)"
```
---
## Task 7: Réécriture de `prepare_dashboard_data`
**Files:**
- Modify: `src/utils/data.py`
- Modify: `tests/test_main.py` (supprimer `test_010_observatoire_montant_filter`)
- [ ] **Step 1: Remove the obsolete Polars-based test**
Delete the function `test_010_observatoire_montant_filter` from `tests/test_main.py` (lines ~218-256). La couverture du filtre montant est déjà assurée par les tests unitaires `test_montant_*` de la Task 6.
- [ ] **Step 2: Rewrite `prepare_dashboard_data`**
Replace the entire `prepare_dashboard_data` function in `src/utils/data.py` (lines ~86-194) with:
```python
def prepare_dashboard_data(**filter_params) -> pl.DataFrame:
"""Exécute la requête DuckDB filtrée pour le tableau de bord.
Retourne une pl.DataFrame matérialisée uniquement pour le sous-ensemble
correspondant aux filtres. Les appelants qui ont besoin d'une LazyFrame
appellent `.lazy()` sur le résultat.
"""
from src.utils.table_sql import dashboard_filters_to_sql
where_sql, params = dashboard_filters_to_sql(**filter_params)
return query_marches(where_sql=where_sql, params=params)
```
Update the import at the top of `src/utils/data.py`:
```python
from src.db import get_cursor, query_marches, schema
```
Remove the now-unused import in `src/utils/data.py`:
```python
from datetime import datetime, timedelta
```
(Si `datetime` n'est plus référencé dans `data.py` hors de `prepare_dashboard_data`, sinon garder.)
**Vérification rapide à effectuer avant de supprimer `datetime`/`timedelta`** :
```bash
rtk grep -n "datetime\|timedelta" src/utils/data.py
```
Si d'autres occurrences existent, conserver les imports.
- [ ] **Step 3: Run the full test suite**
Run: `rtk pytest tests/test_dashboard_filters_to_sql.py tests/test_main.py -v -k "not selenium and not dash_duo"`
Ou, si filter n'est pas pratique :
Run: `rtk pytest tests/test_dashboard_filters_to_sql.py -v`
Expected: PASS (22 tests).
- [ ] **Step 4: Commit**
```bash
rtk pre-commit run --files src/utils/data.py tests/test_main.py
rtk git add src/utils/data.py tests/test_main.py
rtk git commit -m "refactor(observatoire): prepare_dashboard_data utilise DuckDB (#72)"
```
---
## Task 8: Adaptation des 3 appelants dans `observatoire.py`
**Files:**
- Modify: `src/pages/observatoire.py`
- [ ] **Step 1: Update `_compute_dashboard_children`**
Remplacer dans `src/pages/observatoire.py` (autour des lignes 660-670) :
```python
@cache.memoize()
def _compute_dashboard_children(filter_params_normalized: tuple):
logger.debug("Cache miss — computing dashboard")
filter_params = {
k: (list(v) if isinstance(v, tuple) else v) for k, v in filter_params_normalized
}
lff: pl.LazyFrame = query_marches().lazy()
lff = prepare_dashboard_data(lff=lff, **filter_params)
dff = lff.collect(engine="streaming")
```
Par :
```python
@cache.memoize()
def _compute_dashboard_children(filter_params_normalized: tuple):
logger.debug("Cache miss — computing dashboard")
filter_params = {
k: (list(v) if isinstance(v, tuple) else v) for k, v in filter_params_normalized
}
dff = prepare_dashboard_data(**filter_params)
lff = dff.lazy()
```
Le reste de la fonction (à partir de `df_per_uid = ...`) est inchangé.
- [ ] **Step 2: Update `download_observatoire`**
Remplacer dans `src/pages/observatoire.py` (autour des lignes 789-800) :
```python
def download_observatoire(_n_clicks, filter_params, hidden_columns):
lff = prepare_dashboard_data(lff=query_marches().lazy(), **(filter_params or {}))
if hidden_columns:
lff = lff.drop(hidden_columns)
def to_bytes(buffer):
lff.collect(engine="streaming").write_excel(buffer, worksheet="DECP")
date = datetime.now().strftime("%Y-%m-%d_%H:%M:%S")
return dcc.send_bytes(to_bytes, filename=f"decp_observatoire_{date}.xlsx")
```
Par :
```python
def download_observatoire(_n_clicks, filter_params, hidden_columns):
dff = prepare_dashboard_data(**(filter_params or {}))
if hidden_columns:
dff = dff.drop(hidden_columns)
def to_bytes(buffer):
dff.write_excel(buffer, worksheet="DECP")
date = datetime.now().strftime("%Y-%m-%d_%H:%M:%S")
return dcc.send_bytes(to_bytes, filename=f"decp_observatoire_{date}.xlsx")
```
- [ ] **Step 3: Update `populate_preview_table`**
Remplacer dans `src/pages/observatoire.py` (autour des lignes 879-892) :
```python
if not is_open:
return (no_update,) * 9
lff = prepare_dashboard_data(lff=query_marches().lazy(), **(filter_params or {}))
return prepare_table_data(
lff,
data_timestamp,
filter_query,
page_current,
page_size,
sort_by,
"observatoire-preview",
)
```
Par :
```python
if not is_open:
return (no_update,) * 9
dff = prepare_dashboard_data(**(filter_params or {}))
return prepare_table_data(
dff.lazy(),
data_timestamp,
filter_query,
page_current,
page_size,
sort_by,
"observatoire-preview",
)
```
- [ ] **Step 4: Remove unused `query_marches` import**
Dans `src/pages/observatoire.py`, ligne ~19 :
```python
from src.db import query_marches, schema
```
Devient :
```python
from src.db import schema
```
Vérifier avant de committer :
```bash
rtk grep -n "query_marches" src/pages/observatoire.py
```
Expected: aucun résultat (ou uniquement des commentaires).
- [ ] **Step 5: Smoke test**
Démarrer l'app et naviguer sur `/observatoire`, vérifier à la main que :
- Les cartes s'affichent.
- Un filtre année se propage.
- Un filtre acheteur par SIRET partiel fonctionne.
- Un filtre département (multi-valeur) fonctionne.
- Un filtre montant_min fonctionne.
- Le bouton « Télécharger au format Excel » génère un fichier non vide.
- Le bouton « Voir les données » ouvre l'offcanvas et peuple la table.
Run: `python run.py`
Expected: app démarre sans erreur ; les filtres se comportent comme avant.
- [ ] **Step 6: Commit**
```bash
rtk pre-commit run --files src/pages/observatoire.py
rtk git add src/pages/observatoire.py
rtk git commit -m "refactor(observatoire): appelants utilisent la nouvelle signature (#72)"
```
---
## Task 9: Test d'intégration — `prepare_dashboard_data` sur `tests/test.parquet`
**Files:**
- Create: `tests/test_prepare_dashboard_data.py`
- [ ] **Step 1: Write the failing test**
Le but : vérifier que la fonction s'exécute réellement contre DuckDB, retourne une `pl.DataFrame`, et applique bien les filtres simples. `conftest.py` construit `tests/test.parquet` avec un jeu de données d'une ligne : acheteur_id `123`, acheteur_departement_code `75`, dateNotification `2025-01-01`, montant `10`.
Create `tests/test_prepare_dashboard_data.py`:
```python
import polars as pl
def test_returns_dataframe_with_year_filter():
from src.utils.data import prepare_dashboard_data
dff = prepare_dashboard_data(dashboard_year="2025")
assert isinstance(dff, pl.DataFrame)
assert dff.height == 1
def test_year_mismatch_returns_empty():
from src.utils.data import prepare_dashboard_data
dff = prepare_dashboard_data(dashboard_year="2024")
assert isinstance(dff, pl.DataFrame)
assert dff.height == 0
def test_acheteur_id_partial_match():
from src.utils.data import prepare_dashboard_data
dff = prepare_dashboard_data(
dashboard_year="2025",
dashboard_acheteur_id="12",
)
assert dff.height == 1
def test_departement_in_clause():
from src.utils.data import prepare_dashboard_data
dff = prepare_dashboard_data(
dashboard_year="2025",
dashboard_acheteur_departement_code=["75", "92"],
)
assert dff.height == 1
def test_montant_min_above_value_excludes_row():
from src.utils.data import prepare_dashboard_data
dff = prepare_dashboard_data(
dashboard_year="2025",
dashboard_montant_min=1000,
)
assert dff.height == 0
```
- [ ] **Step 2: Run the test**
Run: `rtk pytest tests/test_prepare_dashboard_data.py -v`
Expected: PASS (5 tests).
- [ ] **Step 3: Commit**
```bash
rtk pre-commit run --files tests/test_prepare_dashboard_data.py
rtk git add tests/test_prepare_dashboard_data.py
rtk git commit -m "test(observatoire): intégration DuckDB pour prepare_dashboard_data (#72)"
```
---
## Task 10: Vérification finale
**Files:** (aucune modification)
- [ ] **Step 1: Run the full test suite**
Run: `rtk pytest -v`
Expected: tous les tests unitaires passent. Les tests Selenium peuvent échouer si Chrome n'est pas disponible — ce n'est pas bloquant s'ils étaient déjà rouges avant.
- [ ] **Step 2: Check for leftover references**
Run: `rtk grep -rn "prepare_dashboard_data(lff" src/ tests/`
Expected: aucun résultat (plus d'appels avec l'ancienne signature).
Run: `rtk grep -rn "query_marches().lazy()" src/`
Expected: aucun résultat (ou uniquement dans `src/utils/table.py:prepare_table_data` pour le fallback).
- [ ] **Step 3: Confirm `datetime`/`timedelta` in data.py if needed**
Run: `rtk grep -n "datetime\|timedelta" src/utils/data.py`
Si aucune occurrence hors imports, vérifier que les imports inutiles ont bien été retirés dans Task 7.
- [ ] **Step 4: Manual timing sanity check (optionnel)**
Si possible, comparer informellement le temps de `_compute_dashboard_children` sur un filtre sélectif (ex. un département) avant/après. Pas de benchmark formel attendu.
- [ ] **Step 5: Push (manuel, à l'initiative de l'utilisateur)**
Conformément aux consignes projet, ne jamais `git push`. Laisser l'utilisateur pousser la branche `feature/72_observatoire_duckdb_filters` et ouvrir la PR.
@@ -0,0 +1,108 @@
# Plan: Ajouter des cartes de localisation aux pages acheteur et titulaire
## Date: 2026-04-28
## Statut: Approuvé
## Objectif: Ajouter des cartes interactives montrant la localisation des organisations sur les pages acheteur et titulaire
## Contexte
- Les pages acheteur et titulaire ont déjà des placeholders pour les cartes (`acheteur_map` et `titulaire_map`)
- La fonction `point_on_map()` existe déjà dans `src/figures.py` mais utilise un centrage fixe sur la France
- Les données de localisation proviennent de l'API Annuaire des Entreprises
- Les codes départementaux sont disponibles et plus fiables que les coordonnées pour la détection de région
## Exigences
### 1. Carte interactive
- **Localisation**: Colonne de droite dans la section d'informations sur l'organisation
- **Taille**: 400px de largeur × 300px de hauteur (fixe)
- **Contenu**: Carte centrée sur la France ou le département d'outre-mer approprié avec un point rouge à l'emplacement de l'organisation
- **Niveau de zoom**: Approprié pour montrer l'Hexagone ou le département d'outre-mer spécifique
- **Style**: Fond de carte clair avec point rouge visible
- **Interactivité**: Carte zoomable et déplaçable (pas de configuration statique)
### 2. Sources de données
- Utiliser les colonnes `acheteur_latitude` et `acheteur_longitude` pour les pages acheteur
- Utiliser les colonnes `titulaire_latitude` et `titulaire_longitude` pour les pages titulaire
- Utiliser les codes départementaux (`acheteur_departement_code`, `titulaire_departement_code`) pour la détection de région
- Solution de repli: Si les coordonnées ou codes départementaux sont manquants ou invalides, afficher une div vide
### 3. Détection de région
- **Départements métropolitains**: Codes à 2 caractères (ex: "75" pour Paris) → Carte Hexagone
- **Départements d'outre-mer**:
- "971" → Guadeloupe
- "972" → Martinique
- "973" → Guyane
- "974" → La Réunion
- "976" → Mayotte
- **Code département manquant**: Retourner une div vide (pas de détection basée sur les coordonnées)
### 4. Gestion des erreurs
- Coordonnées invalides → div vide
- Code département manquant → div vide
- Échec de l'API Annuaire → div vide (comportement existant)
- Format de code département invalide → div vide
## Implémentation
### Fichiers à modifier
#### 1. `src/figures.py` - Améliorer la fonction `point_on_map()`
**Ligne 178-209**: Remplacer la fonction existante par une version améliorée avec:
- Détection de région basée sur les codes départementaux
- Configuration de carte interactive (zoomable)
- Point plus grand (size=15)
- Commentaires en français
#### 2. `src/pages/acheteur.py` - Mettre à jour le callback
**Ligne 249-297**: Modifier `update_acheteur_infos()` pour:
- Extraire le code département du code postal
- Passer le code département à `point_on_map()`
- Ajouter des commentaires en français
#### 3. `src/pages/titulaire.py` - Mettre à jour le callback
**Ligne 259-297**: Modifier `update_titulaire_infos()` pour:
- Extraire le code département du code postal
- Passer le code département à `point_on_map()`
- Ajouter des commentaires en français
## Plan de Test
### Cas de test prioritaires
1. **Organisation métropolitaine**: Code département "75" (Paris) → Carte Hexagone
2. **Organisation à La Réunion**: Code département "974" → Carte centrée sur La Réunion
3. **Code département manquant**: Retourne une div vide
4. **Coordonnées invalides**: Retourne une div vide
5. **Interactivité**: Vérifier zoom et déplacement
### Critères d'acceptation
- [ ] Cartes fonctionnelles avec codes départementaux valides
- [ ] Div vide pour codes manquants/invalides
- [ ] Cartes correctement centrées et zoomées
- [ ] Interactivité (zoom et déplacement)
- [ ] Point de localisation visible (size=15)
## Approbation
Plan approuvé avec spécifications:
- Réutiliser et améliorer `point_on_map`
- Retourner div vide sans code département
- Point légèrement plus grand
- Cartes zoomables
- Utiliser codes départementaux pour détection de région
- Commentaires en français
File diff suppressed because it is too large Load Diff
@@ -0,0 +1,699 @@
# Page `/etapes` — « Quelles données pour quelles étapes et quels seuils ? » — Implementation Plan
> **For agentic workers:** REQUIRED SUB-SKILL: Use superpowers:subagent-driven-development (recommended) or superpowers:executing-plans to implement this plan task-by-task. Steps use checkbox (`- [ ]`) syntax for tracking.
**Goal:** Créer une page statique `/etapes` qui affiche un graphique HTML/CSS montrant quelles données (Approch, Journaux d'annonces légales, BOAMP, JOUE, DECP) sont publiées à chaque étape de la passation d'un marché public et à partir de quel seuil réglementaire.
**Architecture:** Une nouvelle page Dash auto-enregistrée (`src/pages/etapes.py`) qui expose un `layout` composé uniquement de `html.Div`/`dcc.Markdown` (aucun callback, aucune donnée dynamique). La page rend **deux représentations des mêmes données** basculées par media query : sur desktop/tablette, un graphique en grille CSS (1 colonne de libellés + 5 colonnes de seuils) où chaque publication est une barre positionnée en pourcentage ; sur mobile portrait (< 768 px), une liste verticale par étape. Le style vit dans `src/assets/css/style.css` (auto-chargé par Dash). L'URL est ajoutée au sitemap mais pas à la navbar.
**Tech Stack:** Python 3, Dash 3.4 (pages API), CSS (grille + positionnement absolu), Flask (route sitemap existante).
---
## Contexte pour l'engineer (à lire avant de commencer)
- decp.info est une app Dash multi-pages. Chaque page est un module dans `src/pages/` qui appelle `register_page(...)` au niveau du module et expose une variable `layout`. Dash découvre ces pages automatiquement grâce à `use_pages=True` (voir `src/app.py:30`).
- **Imports** : toujours importer les modules de l'app avec le préfixe `src.` (ex. `from src.utils.seo import META_CONTENT`).
- La navbar (`src/app.py:170-182`) est construite à partir d'une **liste blanche de noms** : `["Recherche", "À propos", "Tableau", "Observatoire"]`. Une page dont le `name` n'est pas dans cette liste **n'apparaît pas** dans la navbar. On ne touche donc PAS à la navbar.
- Le sitemap (`src/app.py:70-86`) est une **liste d'URLs codée en dur**. Il faut y ajouter `/etapes`.
- Le CSS personnalisé est dans `src/assets/css/style.css` (Dash charge automatiquement tout ce qui est dans `src/assets/`). On y ajoute les règles du graphique.
- **Pré-requis commit** : ce dépôt utilise `pre-commit` (prettier, ruff). Les hooks ne tournent que si le virtualenv est activé. Avant chaque `git commit`, faire `source .venv/bin/activate` dans la même commande shell. Prettier peut reformater les fichiers Markdown/CSS : si un commit échoue parce que des fichiers ont été modifiés par un hook, refaire `git add` puis `git commit`.
- **Référence visuelle** : la maquette validée est `.superpowers/brainstorm/80498-1780599135/content/chart-concept-v3.html`. Le code HTML/CSS ci-dessous en est la transposition.
- Ce projet n'a **pas** de test automatisé pour cette page (contenu 100 % statique). La vérification est manuelle via `python run.py`. Les tâches ci-dessous remplacent donc le cycle TDD par des vérifications de rendu explicites.
---
## File Structure
- **Create** `src/pages/etapes.py` — la page : `register_page(...)` + `layout`. Contient `build_chart()` (graphique grille desktop), `build_mobile()` (liste verticale mobile, alimentée par la structure `STAGES_MOBILE`) et `build_legend()`, pour garder le `layout` lisible. Responsabilité unique : décrire la page `/etapes`.
- **Modify** `src/app.py` — ajouter `"/etapes"` à la liste `pages` de la fonction `sitemap()`.
- **Modify** `src/assets/css/style.css` — ajouter un bloc de règles préfixées `.etapes-*` : graphique en grille, liste mobile `.etapes-m-*`, et media query de bascule à 768 px.
---
## Task 1 : Squelette de la page `/etapes`
**Files:**
- Create: `src/pages/etapes.py`
- [ ] **Step 1: Créer le fichier avec l'enregistrement de page et un layout minimal**
Créer `src/pages/etapes.py` avec exactement ce contenu (le graphique sera ajouté en Task 2) :
```python
from dash import dcc, html, register_page
from src.utils.seo import META_CONTENT
NAME = "Quelles données pour quelles étapes et quels seuils ?"
register_page(
__name__,
path="/etapes",
title=f"{NAME} | decp.info",
name="Étapes et données",
description=(
"À chaque étape d'un marché public (programmation, publicité, "
"attribution), quelles données sont publiées et à partir de quel "
"seuil : DECP, BOAMP, JOUE, journaux d'annonces légales, Approch."
),
image_url=META_CONTENT["image_url"],
)
layout = html.Div(
className="container",
children=[
html.H2(NAME),
dcc.Markdown(
"Un marché public passe par plusieurs étapes. À chacune, des "
"données peuvent être publiées — selon le montant du marché et "
"des obligations réglementaires. Ce graphique situe les "
"principales publications de données par **étape** (de haut en "
"bas) et par **seuil** (de gauche à droite, en euros hors taxes)."
),
# Le graphique sera inséré ici en Task 2
dcc.Markdown(
"**À noter :** l'axe horizontal n'est pas linéaire — les seuils "
"sont espacés régulièrement pour rester lisibles. Les étapes "
"*Contrat* et *Paiement* n'ont aujourd'hui aucune donnée publiée "
"en open data.",
className="etapes-note",
),
],
)
```
- [ ] **Step 2: Lancer l'app et vérifier que la page se charge**
Run :
```bash
source .venv/bin/activate && python run.py
```
Puis ouvrir `http://127.0.0.1:8050/etapes` dans un navigateur.
Expected : la page affiche le titre « Quelles données pour quelles étapes et quels seuils ? », le paragraphe d'intro et la note, avec le bandeau de navigation en haut. Aucune erreur dans la console du serveur. Arrêter le serveur (Ctrl-C).
- [ ] **Step 3: Vérifier l'absence dans la navbar**
Sur n'importe quelle page, vérifier visuellement que « Étapes et données » **n'apparaît pas** dans la barre de navigation (la liste blanche `src/app.py:181` ne la contient pas).
Expected : la navbar montre uniquement Recherche / Tableau / Observatoire / À propos.
- [ ] **Step 4: Commit**
```bash
source .venv/bin/activate && git add src/pages/etapes.py && git commit -m "feat(etapes): squelette de la page /etapes"
```
(Si le commit échoue car un hook a reformaté le fichier : refaire `git add src/pages/etapes.py && git commit -m "feat(etapes): squelette de la page /etapes"`.)
---
## Task 2 : Le graphique HTML/CSS
**Files:**
- Modify: `src/pages/etapes.py`
Le graphique est une grille de 6 colonnes : 1 colonne de libellés d'étape (150 px) + 5 colonnes de seuils égales. L'en-tête X et chaque ligne d'étape occupent les colonnes 2 → 6 (`grid-column: 2 / -1`). À l'intérieur d'une ligne, les barres sont positionnées en `position:absolute` avec `left`/`right` en pourcentage, où chaque segment de seuil = 20 % de la largeur :
- Segment 1 (0 € → 40 k€) : 0 % 20 %
- Segment 2 (40 k€ → 90 k€) : 20 % 40 %
- Segment 3 (90 k€ → 140/216 k€) : 40 % 60 %
- Segment 4 (140/216 k€ → 5,404 M€) : 60 % 80 %
- Segment 5 (≥ 5,404 M€) : 80 % 100 %
Une barre qui « commence à 40 k€ et va jusqu'à l'infini » s'écrit donc `left:20%; right:2%` (les `2%` de marge évitent de coller au bord). Une barre qui remplit la case 90 k€ → seuil formalisé s'écrit `left:40%; right:40%`.
- [ ] **Step 1: Ajouter la fonction `build_chart()` au-dessus de `layout`**
Dans `src/pages/etapes.py`, insérer cette fonction entre le bloc `register_page(...)` et la définition de `layout` :
```python
def _lane(*bars):
"""Une ligne d'étape : fond segmenté en 5 + barres positionnées."""
return html.Div(
className="etapes-lane",
children=[
html.Div(
className="etapes-segs",
children=[html.Div() for _ in range(5)],
),
*bars,
],
)
def _bar(label, color, style):
base = {"backgroundColor": color}
base.update(style)
return html.Div(label, className="etapes-bar", style=base)
def build_chart():
return html.Div(
className="etapes-chart-scroll",
children=html.Div(
className="etapes-chart",
children=[
# En-tête : coin vide + 5 marqueurs de seuils
html.Div(className="etapes-corner"),
html.Div(
className="etapes-xhead",
children=[
html.Div("0 €", className="etapes-xcell"),
html.Div(
[html.Strong("40 000 €"), "seuil DECP"],
className="etapes-xcell",
),
html.Div(
[html.Strong("90 000 €"), "publicité"],
className="etapes-xcell",
),
html.Div(
[html.Strong("140 k€ / 216 k€"), "seuils formalisés (UE)"],
className="etapes-xcell",
),
html.Div(
[html.Strong("5,404 M€"), "travaux (UE)"],
className="etapes-xcell",
),
],
),
# Programmation
html.Div("Programmation", className="etapes-stage"),
_lane(
_bar(
"Approch — sourcing / préinformation (non réglementaire)",
"#7c5cff",
{"left": "2%", "right": "2%"},
),
),
# Publicité (appel d'offres)
html.Div(
["Publicité ", html.Small("(appel d'offres)")],
className="etapes-stage",
),
_lane(
_bar(
"Journaux d'annonces légales",
"#f79009",
{"left": "40%", "right": "40%", "top": "6px", "height": "20px"},
),
_bar(
"BOAMP",
"#1570ef",
{"left": "40%", "right": "2%", "top": "28px", "height": "20px"},
),
_bar(
"JOUE — avis de marché",
"#0e9384",
{"left": "60%", "right": "2%", "top": "6px", "height": "20px"},
),
),
# Attribution
html.Div("Attribution", className="etapes-stage"),
_lane(
_bar(
"DECP — données essentielles",
"#12b76a",
{"left": "20%", "right": "2%", "top": "6px", "height": "20px"},
),
_bar(
"JOUE — avis d'attribution",
"#0e9384",
{"left": "60%", "right": "2%", "top": "28px", "height": "20px"},
),
),
# Contrat (vide)
html.Div("Contrat", className="etapes-stage"),
html.Div(
"— aucune donnée publiée aujourd'hui —",
className="etapes-lane etapes-empty",
),
# Paiement (vide)
html.Div("Paiement", className="etapes-stage"),
html.Div(
"— aucune donnée publiée aujourd'hui —",
className="etapes-lane etapes-empty",
),
],
),
)
def build_legend():
items = [
("Approch", "#7c5cff"),
("Journaux d'annonces légales", "#f79009"),
("BOAMP", "#1570ef"),
("JOUE", "#0e9384"),
("DECP", "#12b76a"),
]
return html.Div(
className="etapes-legend",
children=[
html.Span(
[
html.I(style={"backgroundColor": color}),
label,
]
)
for label, color in items
],
)
```
- [ ] **Step 2: Insérer le graphique et la légende dans `layout`**
Dans `layout`, remplacer la ligne de commentaire `# Le graphique sera inséré ici en Task 2` par :
```python
build_chart(),
build_legend(),
```
- [ ] **Step 3: Lancer l'app et vérifier le rendu**
Run :
```bash
source .venv/bin/activate && python run.py
```
Ouvrir `http://127.0.0.1:8050/etapes`.
Expected (comparer à la maquette `.superpowers/brainstorm/80498-1780599135/content/chart-concept-v3.html`) :
- En-tête X : `0 € · 40 000 € (seuil DECP) · 90 000 € (publicité) · 140 k€/216 k€ (seuils formalisés UE) · 5,404 M€ (travaux UE)`.
- Lignes de haut en bas : Programmation (barre Approch pleine largeur), Publicité (Journaux d'annonces légales + BOAMP + JOUE), Attribution (DECP + JOUE), Contrat (vide), Paiement (vide).
- La barre « Journaux d'annonces légales » occupe la case 90 k€ → seuil formalisé ; DECP démarre à 40 k€ ; JOUE et BOAMP démarrent aux bons segments.
- La légende sous le graphique liste les 5 publications avec leurs couleurs.
À ce stade le style brut (couleurs des barres) doit déjà être visible car appliqué inline ; la mise en page de la grille sera finalisée en Task 4. Si la grille n'est pas encore correcte (colonnes non alignées), c'est attendu — continuer. Arrêter le serveur.
- [ ] **Step 4: Commit**
```bash
source .venv/bin/activate && git add src/pages/etapes.py && git commit -m "feat(etapes): graphique données par étape et par seuil"
```
(Si échec dû à un hook : refaire `git add` puis `git commit`.)
---
## Task 3 : Vue mobile (liste verticale par étape)
**Files:**
- Modify: `src/pages/etapes.py`
Sur écran portrait étroit, le graphique en grille n'est pas lisible (vue d'ensemble perdue). On ajoute une **liste verticale par étape** qui décrit les mêmes données en texte. Le basculement entre les deux rendus se fera en CSS (Task 4). Pour éviter la duplication, les publications de chaque étape sont décrites dans une structure de données Python consommée par le rendu mobile.
- [ ] **Step 1: Ajouter la structure de données et `build_mobile()`**
Dans `src/pages/etapes.py`, ajouter ce bloc juste avant la fonction `build_legend()` :
```python
# Données par étape, partagées par la vue mobile.
# Chaque item : (libellé, couleur, plage de seuils en texte).
STAGES_MOBILE = [
(
"Programmation",
[
("Approch", "#7c5cff", "tous montants — publication non réglementaire"),
],
),
(
"Publicité (appel d'offres)",
[
("Journaux d'annonces légales", "#f79009", "de 90 000 € au seuil formalisé"),
("BOAMP", "#1570ef", "à partir de 90 000 €"),
(
"JOUE — avis de marché",
"#0e9384",
"à partir des seuils formalisés (140 k€ / 216 k€)",
),
],
),
(
"Attribution",
[
("DECP — données essentielles", "#12b76a", "à partir de 40 000 €"),
("JOUE — avis d'attribution", "#0e9384", "à partir des seuils formalisés"),
],
),
("Contrat", []),
("Paiement", []),
]
def build_mobile():
blocks = []
for stage, items in STAGES_MOBILE:
if items:
children = [
html.Div(
[
html.I(style={"backgroundColor": color}),
html.Span(label, className="etapes-m-label"),
html.Span(seuil, className="etapes-m-seuil"),
],
className="etapes-m-item",
)
for label, color, seuil in items
]
else:
children = [
html.Div(
"aucune donnée publiée aujourd'hui",
className="etapes-m-item etapes-m-empty",
)
]
blocks.append(
html.Div(
[html.H4(stage, className="etapes-m-stage"), *children],
className="etapes-m-block",
)
)
return html.Div(blocks, className="etapes-mobile")
```
- [ ] **Step 2: Insérer `build_mobile()` dans `layout`**
Dans `layout`, la ligne `build_chart(),` (insérée en Task 2) est suivie de `build_mobile(),`, soit :
```python
build_chart(),
build_mobile(),
build_legend(),
```
- [ ] **Step 3: Lancer l'app et vérifier (rendu brut, avant CSS de bascule)**
Run :
```bash
source .venv/bin/activate && python run.py
```
Ouvrir `http://127.0.0.1:8050/etapes`. À ce stade les deux rendus s'affichent l'un sous l'autre (la bascule CSS arrive en Task 4) : sous le graphique, la liste affiche Programmation (Approch…), Publicité (3 publications), Attribution (2 publications), puis Contrat et Paiement avec « aucune donnée publiée aujourd'hui ». C'est attendu. Arrêter le serveur.
- [ ] **Step 4: Commit**
```bash
source .venv/bin/activate && git add src/pages/etapes.py && git commit -m "feat(etapes): vue mobile liste par étape"
```
(Si échec dû à un hook : refaire `git add` puis `git commit`.)
---
## Task 4 : CSS du graphique + bascule mobile
**Files:**
- Modify: `src/assets/css/style.css`
- [ ] **Step 1: Ajouter le bloc CSS à la fin de `src/assets/css/style.css`**
Ajouter à la fin du fichier :
```css
/* ===== Page /etapes : graphique données par étape et par seuil ===== */
.etapes-chart-scroll {
overflow-x: auto;
margin: 1rem 0;
}
.etapes-chart {
min-width: 720px;
background: #fff;
border: 1px solid #d0d5dd;
border-radius: 8px;
overflow: hidden;
font-size: 13px;
display: grid;
grid-template-columns: 150px repeat(5, 1fr);
}
.etapes-corner {
border-bottom: 2px solid #344054;
}
.etapes-xhead {
grid-column: 2 / -1;
display: grid;
grid-template-columns: repeat(5, 1fr);
border-bottom: 2px solid #344054;
}
.etapes-xcell {
text-align: center;
padding: 6px 2px;
font-size: 11px;
color: #475467;
border-left: 1px dashed #d0d5dd;
}
.etapes-xcell strong {
display: block;
color: #101828;
font-size: 12px;
}
.etapes-stage {
padding: 14px 10px;
font-weight: 600;
color: #101828;
border-bottom: 1px solid #eaecf0;
display: flex;
align-items: center;
}
.etapes-stage small {
font-weight: 400;
color: #667085;
}
.etapes-lane {
grid-column: 2 / -1;
position: relative;
border-bottom: 1px solid #eaecf0;
min-height: 52px;
}
.etapes-segs {
position: absolute;
inset: 0;
display: grid;
grid-template-columns: repeat(5, 1fr);
}
.etapes-segs > div {
border-left: 1px dashed #eaecf0;
}
.etapes-bar {
position: absolute;
top: 9px;
height: 32px;
border-radius: 6px;
color: #fff;
font-size: 11px;
font-weight: 600;
display: flex;
align-items: center;
padding: 0 10px;
box-shadow: 0 1px 2px rgba(0, 0, 0, 0.12);
white-space: nowrap;
overflow: hidden;
}
.etapes-empty {
color: #98a2b3;
font-style: italic;
padding: 14px;
display: flex;
align-items: center;
}
.etapes-legend {
margin-top: 14px;
display: flex;
gap: 16px;
flex-wrap: wrap;
font-size: 12px;
}
.etapes-legend span {
display: inline-flex;
align-items: center;
gap: 6px;
}
.etapes-legend i {
width: 14px;
height: 14px;
border-radius: 3px;
display: inline-block;
}
.etapes-note {
margin-top: 8px;
color: #667085;
font-size: 13px;
}
/* --- Vue mobile (liste par étape) : masquée par défaut --- */
.etapes-mobile {
display: none;
margin: 1rem 0;
}
.etapes-m-block {
border: 1px solid #d0d5dd;
border-radius: 8px;
margin-bottom: 12px;
overflow: hidden;
}
.etapes-m-stage {
margin: 0;
padding: 10px 12px;
background: #f9fafb;
border-bottom: 1px solid #eaecf0;
font-size: 15px;
color: #101828;
}
.etapes-m-item {
display: flex;
align-items: baseline;
gap: 8px;
padding: 8px 12px;
border-bottom: 1px solid #f2f4f7;
font-size: 13px;
}
.etapes-m-item:last-child {
border-bottom: none;
}
.etapes-m-item i {
width: 12px;
height: 12px;
border-radius: 3px;
flex: 0 0 auto;
position: relative;
top: 2px;
}
.etapes-m-label {
font-weight: 600;
color: #101828;
}
.etapes-m-seuil {
color: #667085;
}
.etapes-m-empty {
color: #98a2b3;
font-style: italic;
}
/* --- Bascule desktop / mobile au point de rupture 768 px --- */
@media (max-width: 768px) {
.etapes-chart-scroll,
.etapes-legend {
display: none;
}
.etapes-mobile {
display: block;
}
}
```
- [ ] **Step 2: Lancer l'app et vérifier le rendu final**
Run :
```bash
source .venv/bin/activate && python run.py
```
Ouvrir `http://127.0.0.1:8050/etapes` en grand écran (≥ 768 px).
Expected : le graphique est identique à la maquette v3 — colonnes alignées, en-tête X avec ligne de séparation foncée, barres colorées bien positionnées dans chaque segment, lignes Contrat/Paiement grisées en italique, légende sous le graphique. La **liste mobile est masquée** (le graphique seul est visible).
- [ ] **Step 3: Vérifier la bascule responsive**
Dans le navigateur, ouvrir les devtools et passer en mode mobile portrait (largeur < 768 px, ex. iPhone SE 375 px). Tester aussi une largeur intermédiaire (~800 px).
Expected :
- À largeur intermédiaire (~800 px, ≥ 768) : le **graphique** s'affiche, défilable horizontalement (`overflow-x:auto` + `min-width:720px`), barres non écrasées ; liste mobile masquée.
- En portrait (< 768 px) : le graphique **et la légende disparaissent**, remplacés par la **liste verticale par étape** — chaque étape est un bloc avec son titre, et chaque publication a sa pastille de couleur, son nom et sa plage de seuils en texte. Aucun défilement horizontal nécessaire. Contrat/Paiement affichent « aucune donnée publiée aujourd'hui » en italique.
Arrêter le serveur.
- [ ] **Step 4: Commit**
```bash
source .venv/bin/activate && git add src/assets/css/style.css && git commit -m "feat(etapes): styles du graphique étapes/seuils"
```
(Si échec dû à un hook prettier : refaire `git add` puis `git commit`.)
---
## Task 5 : Référencement de la page dans le sitemap
**Files:**
- Modify: `src/app.py` (fonction `sitemap()`, ~ligne 73)
- [ ] **Step 1: Ajouter `/etapes` à la liste des URLs du sitemap**
Dans `src/app.py`, dans la fonction `sitemap()`, modifier la liste `pages` :
```python
pages = [
"/",
"/observatoire",
"/tableau",
"/a-propos",
"/etapes",
]
```
- [ ] **Step 2: Vérifier le sitemap**
Run :
```bash
source .venv/bin/activate && python run.py
```
Ouvrir `http://127.0.0.1:8050/sitemap.xml`.
Expected : le XML contient désormais une entrée `<loc>https://decp.info/etapes</loc>`. Arrêter le serveur.
- [ ] **Step 3: Commit**
```bash
source .venv/bin/activate && git add src/app.py && git commit -m "feat(etapes): référencement de /etapes dans le sitemap"
```
---
## Vérification finale (checklist de la spec)
- [ ] `/etapes` affiche le graphique fidèle à la maquette v3, avec le bandeau de navigation global en haut.
- [ ] La page est **absente** de la navbar.
- [ ] `/sitemap.xml` **contient** `/etapes`.
- [ ] Sur fenêtre intermédiaire (≥ 768 px), le graphique défile horizontalement sans s'écraser.
- [ ] Sur écran portrait étroit (< 768 px), le graphique est masqué et remplacé par la liste verticale par étape, lisible sans défilement horizontal.
- [ ] Titre H2 de la page = « Quelles données pour quelles étapes et quels seuils ? ».
- [ ] `name` de la page = « Étapes et données ».
@@ -0,0 +1,665 @@
# Bootstrap résilient des données et du schéma — Plan d'implémentation
> **For agentic workers:** REQUIRED SUB-SKILL: Use superpowers:subagent-driven-development (recommended) or superpowers:executing-plans to implement this plan task-by-task. Steps use checkbox (`- [ ]`) syntax for tracking.
**Goal:** Rendre le démarrage de decp.info résilient aux ressources externes KO (parquet, schéma, stats), pour que l'API partagée ne tombe plus à cause d'un déploiement défaillant.
**Architecture:** Trois invariants. (1) Le DuckDB est réutilisé si la reconstruction échoue. (2) Le schéma suit la chaîne `URL → cache → RuntimeError`, le dernier schéma distant fonctionnel étant persisté localement. (3) Les chargements de pages au boot ne lèvent jamais sur une ressource externe KO. Une tâche préalable répare le baseline de tests laissé rouge par le merge de `main`.
**Tech Stack:** Python, Polars, DuckDB, httpx, flask-caching, pytest (+ monkeypatch).
**Spec de référence:** `docs/superpowers/specs/2026-06-12-bootstrap-resilient-donnees-schema-design.md`
---
## Structure des fichiers
| Fichier | Responsabilité | Action |
| ------------------------------------- | ---------------------------------------- | ----------------------------- |
| `tests/test_db.py` | Tests bootstrap DuckDB | Modifier (réparer + ajouter) |
| `tests/conftest.py` | Setup déterministe des tests | Modifier (seed schéma) |
| `tests/schema.fixture.json` | Schéma complet figé pour tests (offline) | Créer (commité) |
| `tests/test_schema.py` | Tests résolution schéma | Créer |
| `tests/test_page_loads.py` | Tests chargements best-effort (C/D) | Créer |
| `src/utils/data.py` | Résolution schéma | Modifier |
| `src/db.py` | Bootstrap DuckDB | Modifier (`_ensure_database`) |
| `src/utils/__init__.py` | Helper date MAJ best-effort | Modifier (ajout fonction) |
| `src/pages/tableau.py` | Date MAJ au niveau module | Modifier |
| `src/figures.py` | `get_sources_tables` | Modifier |
| `.template.env`, `.env`, `.gitignore` | Config | Modifier |
---
## Task 1 : Réparer le baseline de tests `test_db.py`
Le merge de `main` a changé `build_database(db_path)` (1 arg, parquet lu via env) et memoïsé `get_last_modified` (besoin du contexte d'app). Trois corrections pour repartir au vert. **Aucune logique applicative ne change ici.**
**Files:**
- Modify: `tests/test_db.py`
- [ ] **Step 1 : Corriger la fixture `built_db` (signature `build_database`)**
Dans `tests/test_db.py`, remplacer :
```python
from src.db import build_database
build_database(db_path, parquet_path)
return db_path
```
par :
```python
from src.db import build_database
build_database(db_path)
return db_path
```
(L'env `DATA_FILE_PARQUET_PATH` est déjà posé juste au-dessus dans la fixture.)
- [ ] **Step 2 : Corriger `test_concurrent_build_serialized`**
Ajouter `monkeypatch` à la signature et poser l'env du parquet ; corriger l'appel `build_database`.
Remplacer la ligne de signature :
```python
def test_concurrent_build_serialized(tmp_path):
```
par :
```python
def test_concurrent_build_serialized(tmp_path, monkeypatch):
```
Juste après `df.write_parquet(parquet_path)`, ajouter :
```python
monkeypatch.setenv("DATA_FILE_PARQUET_PATH", str(parquet_path))
```
Et dans `worker()`, remplacer :
```python
if db.should_rebuild(db_path, parquet_path):
db.build_database(db_path, parquet_path)
```
par :
```python
if db.should_rebuild(db_path, parquet_path):
db.build_database(db_path)
```
- [ ] **Step 3 : Corriger les 2 tests prod de `should_rebuild` (memoïsation)**
`should_rebuild` non-dev appelle `get_last_modified`, memoïsé et inutilisable hors contexte d'app en test. On le monkeypatche pour tester la logique de comparaison de dates.
Dans `test_should_rebuild_prod_when_parquet_newer`, juste avant l'`assert`, ajouter :
```python
monkeypatch.setattr("src.db.get_last_modified", lambda p: parquet.stat().st_mtime)
```
Dans `test_should_not_rebuild_prod_when_parquet_older`, juste avant l'`assert`, ajouter la même ligne :
```python
monkeypatch.setattr("src.db.get_last_modified", lambda p: parquet.stat().st_mtime)
```
- [ ] **Step 4 : Lancer les tests, vérifier le vert**
Run: `rtk proxy python -m pytest tests/test_db.py -q`
Expected: tous PASS (plus aucun `TypeError`/`AttributeError`).
- [ ] **Step 5 : Commit**
```bash
git add tests/test_db.py
git commit -m "test: réparer le baseline test_db cassé par le merge (#78)"
```
---
## Task 2 : Schéma résilient — chaîne `URL → cache → RuntimeError`
Réécrire `get_data_schema` avec helpers robustes et persistance du dernier schéma distant fonctionnel. Supprimer `DATA_SCHEMA_LOCAL` au profit de `DATA_SCHEMA_CACHE`.
**Files:**
- Create: `tests/schema.fixture.json`, `tests/test_schema.py`
- Modify: `tests/conftest.py`, `src/utils/data.py`, `.template.env`, `.env`, `.gitignore`
- [ ] **Step 1 : Créer le fixture schéma complet (offline, déterministe)**
Run:
```bash
cp ../decp-processing/dist/schema.json tests/schema.fixture.json
test -s tests/schema.fixture.json && python -c "import json;assert 'fields' in json.load(open('tests/schema.fixture.json'))" && echo OK
```
Expected: `OK` (le fixture contient bien une clé `fields`).
- [ ] **Step 2 : Rendre la résolution du schéma déterministe en test (conftest)**
Dans `tests/conftest.py`, ajouter `import json` en tête (avec les autres imports) puis, au niveau module **avant** toute logique existante (juste après la ligne `_DB_PATH = Path(...)`), ajouter :
```python
# Schéma déterministe et hors-ligne pour les tests : on pointe le cache sur un
# fixture commité et on désactive la récupération distante.
_SCHEMA_FIXTURE = Path(os.path.abspath("tests/schema.fixture.json"))
os.environ["DATA_SCHEMA_CACHE"] = str(_SCHEMA_FIXTURE)
os.environ.pop("DATA_SCHEMA_PATH", None)
```
- [ ] **Step 3 : Écrire les tests schéma (échouent d'abord)**
Créer `tests/test_schema.py` :
```python
import json
import httpx
import pytest
from src.utils import data as data_mod
VALID = {"fields": [{"name": "uid", "title": "UID"}, {"name": "objet"}]}
class FakeResp:
def __init__(self, payload, ok=True, bad_json=False):
self._payload = payload
self._ok = ok
self._bad_json = bad_json
def raise_for_status(self):
if not self._ok:
raise httpx.HTTPError("boom")
return self
def json(self):
if self._bad_json:
raise json.JSONDecodeError("bad", "", 0)
return self._payload
def test_remote_ok_returns_schema_and_writes_cache(tmp_path, monkeypatch):
cache = tmp_path / "schema.cache.json"
monkeypatch.setenv("DATA_SCHEMA_PATH", "http://x")
monkeypatch.setenv("DATA_SCHEMA_CACHE", str(cache))
monkeypatch.setattr(data_mod, "get", lambda *a, **k: FakeResp(VALID))
result = data_mod.get_data_schema()
assert "uid" in result
assert json.loads(cache.read_text())["fields"][0]["name"] == "uid"
def test_remote_http_error_falls_back_to_cache(tmp_path, monkeypatch):
cache = tmp_path / "schema.cache.json"
cache.write_text(json.dumps(VALID))
monkeypatch.setenv("DATA_SCHEMA_PATH", "http://x")
monkeypatch.setenv("DATA_SCHEMA_CACHE", str(cache))
monkeypatch.setattr(data_mod, "get", lambda *a, **k: FakeResp(None, ok=False))
assert "uid" in data_mod.get_data_schema()
def test_remote_malformed_falls_back_to_cache(tmp_path, monkeypatch):
cache = tmp_path / "schema.cache.json"
cache.write_text(json.dumps(VALID))
monkeypatch.setenv("DATA_SCHEMA_PATH", "http://x")
monkeypatch.setenv("DATA_SCHEMA_CACHE", str(cache))
monkeypatch.setattr(data_mod, "get", lambda *a, **k: FakeResp({"nope": 1}))
assert "uid" in data_mod.get_data_schema()
def test_no_url_uses_cache(tmp_path, monkeypatch):
cache = tmp_path / "schema.cache.json"
cache.write_text(json.dumps(VALID))
monkeypatch.delenv("DATA_SCHEMA_PATH", raising=False)
monkeypatch.setenv("DATA_SCHEMA_CACHE", str(cache))
assert "uid" in data_mod.get_data_schema()
def test_no_source_raises(tmp_path, monkeypatch):
monkeypatch.delenv("DATA_SCHEMA_PATH", raising=False)
monkeypatch.setenv("DATA_SCHEMA_CACHE", str(tmp_path / "missing.json"))
with pytest.raises(RuntimeError):
data_mod.get_data_schema()
def test_cache_write_failure_is_non_blocking(tmp_path, monkeypatch):
# parent inexistant => l'écriture du cache échoue, mais le schéma est renvoyé
cache = tmp_path / "nodir" / "schema.cache.json"
monkeypatch.setenv("DATA_SCHEMA_PATH", "http://x")
monkeypatch.setenv("DATA_SCHEMA_CACHE", str(cache))
monkeypatch.setattr(data_mod, "get", lambda *a, **k: FakeResp(VALID))
assert "uid" in data_mod.get_data_schema()
```
- [ ] **Step 4 : Lancer les tests, vérifier l'échec**
Run: `rtk proxy python -m pytest tests/test_schema.py -q`
Expected: FAIL (les helpers/comportements n'existent pas encore ; `get_data_schema` actuel plante différemment).
- [ ] **Step 5 : Réécrire `get_data_schema` + helpers**
Dans `src/utils/data.py`, remplacer entièrement la fonction `get_data_schema` (actuellement lignes ~68-95) par :
```python
def _validate_schema(raw) -> dict | None:
if isinstance(raw, dict) and isinstance(raw.get("fields"), list) and raw["fields"]:
return raw
return None
def _fetch_remote_schema(url: str | None) -> dict | None:
if not url:
return None
try:
raw = get(url, follow_redirects=True).raise_for_status().json()
except (httpx.HTTPError, json.JSONDecodeError) as e:
logger.error(f"Schéma distant indisponible ({url}) : {e}")
return None
return _validate_schema(raw)
def _load_schema_file(path: str) -> dict | None:
if not path or not os.path.exists(path):
return None
try:
with open(path) as f:
raw = json.load(f)
except (OSError, json.JSONDecodeError) as e:
logger.error(f"Schéma local illisible ({path}) : {e}")
return None
return _validate_schema(raw)
def _persist_schema_cache(raw: dict, path: str) -> None:
if not path:
return
try:
tmp = f"{path}.tmp"
with open(tmp, "w") as f:
json.dump(raw, f)
os.replace(tmp, path)
except OSError as e:
logger.warning(f"Écriture du cache schéma échouée ({path}) : {e}")
def get_data_schema() -> dict:
cache_path = os.getenv("DATA_SCHEMA_CACHE", "./schema.cache.json")
raw = _fetch_remote_schema(os.getenv("DATA_SCHEMA_PATH"))
if raw is not None:
_persist_schema_cache(raw, cache_path)
else:
raw = _load_schema_file(cache_path)
if raw is None:
raise RuntimeError("Aucun schéma disponible (ni distant ni cache).")
return OrderedDict((c["name"], c) for c in raw["fields"])
```
Vérifier que les imports en tête de `src/utils/data.py` couvrent : `json`, `os`, `OrderedDict`, `httpx`, `get` (déjà présents : `from httpx import HTTPError, get`). `HTTPError` peut devenir inutilisé — voir Step 7.
- [ ] **Step 6 : Lancer les tests, vérifier le vert**
Run: `rtk proxy python -m pytest tests/test_schema.py -q`
Expected: 6 PASS.
- [ ] **Step 7 : Nettoyer imports + config + gitignore**
Dans `src/utils/data.py`, si `HTTPError` n'est plus utilisé, remplacer `from httpx import HTTPError, get` par `from httpx import get` (garder `import httpx`). Vérifier avec :
Run: `rtk proxy python -m ruff check src/utils/data.py`
Expected: pas d'erreur F401.
Dans `.gitignore`, ajouter sous la ligne `**/decp.duckdb` :
```
**/schema.cache.json
```
Dans `.template.env`, supprimer la ligne `DATA_SCHEMA_PATH_LOCAL=...` et ajouter :
```
DATA_SCHEMA_CACHE=./schema.cache.json
```
Dans `.env` (local, non versionné), supprimer la ligne `DATA_SCHEMA_LOCAL=...` et ajouter `DATA_SCHEMA_CACHE=./schema.cache.json`.
- [ ] **Step 8 : Commit**
```bash
git add tests/schema.fixture.json tests/test_schema.py tests/conftest.py src/utils/data.py .template.env .gitignore
git commit -m "feat: schéma résilient URL→cache + suppression DATA_SCHEMA_LOCAL (#78)"
```
---
## Task 3 : Bootstrap DuckDB résilient
Ajouter le garde-fou `try/except` dans `_ensure_database` : réutiliser le DuckDB existant si la reconstruction échoue ; ne lever qu'en cold start.
**Files:**
- Modify: `src/db.py:117-128` (`_ensure_database`)
- Test: `tests/test_db.py`
- [ ] **Step 1 : Écrire les tests (échouent d'abord)**
Ajouter à la fin de `tests/test_db.py` :
```python
def _raise(*args, **kwargs):
raise RuntimeError("boom")
def test_ensure_database_reuses_db_when_should_rebuild_raises(tmp_path, monkeypatch):
import src.db as db
dbf = tmp_path / "decp.duckdb"
dbf.write_bytes(b"existing")
monkeypatch.setenv("DUCKDB_PATH", str(dbf))
monkeypatch.setenv("DATA_FILE_PARQUET_PATH", "http://unreachable")
monkeypatch.setattr(db, "should_rebuild", _raise)
result = db._ensure_database() # ne doit pas lever
assert result == dbf
assert dbf.read_bytes() == b"existing"
def test_ensure_database_reuses_db_when_build_raises(tmp_path, monkeypatch):
import src.db as db
dbf = tmp_path / "decp.duckdb"
dbf.write_bytes(b"existing")
monkeypatch.setenv("DUCKDB_PATH", str(dbf))
monkeypatch.setenv("DATA_FILE_PARQUET_PATH", "http://unreachable")
monkeypatch.setattr(db, "should_rebuild", lambda *a, **k: True)
monkeypatch.setattr(db, "build_database", _raise)
db._ensure_database() # ne doit pas lever
assert dbf.read_bytes() == b"existing"
def test_ensure_database_raises_on_cold_start(tmp_path, monkeypatch):
import src.db as db
dbf = tmp_path / "decp.duckdb" # n'existe pas
monkeypatch.setenv("DUCKDB_PATH", str(dbf))
monkeypatch.setenv("DATA_FILE_PARQUET_PATH", "http://unreachable")
monkeypatch.setattr(db, "should_rebuild", lambda *a, **k: True)
monkeypatch.setattr(db, "build_database", _raise)
with pytest.raises(RuntimeError):
db._ensure_database()
def test_ensure_database_builds_when_needed(tmp_path, monkeypatch):
import src.db as db
dbf = tmp_path / "decp.duckdb"
dbf.write_bytes(b"old")
monkeypatch.setenv("DUCKDB_PATH", str(dbf))
monkeypatch.setenv("DATA_FILE_PARQUET_PATH", "http://x")
called = {}
monkeypatch.setattr(db, "should_rebuild", lambda *a, **k: True)
monkeypatch.setattr(db, "build_database", lambda p: called.setdefault("built", p))
db._ensure_database()
assert called.get("built") == dbf
```
Ajouter `import pytest` en tête de `tests/test_db.py` s'il n'y est pas déjà (il y est).
- [ ] **Step 2 : Lancer, vérifier l'échec**
Run: `rtk proxy python -m pytest tests/test_db.py -q -k ensure_database`
Expected: FAIL (le `try/except` n'existe pas ; les exceptions remontent).
- [ ] **Step 3 : Implémenter le garde-fou**
Dans `src/db.py`, remplacer `_ensure_database` (lignes ~117-128) par :
```python
def _ensure_database() -> Path:
db_path = Path(os.getenv("DUCKDB_PATH", "./decp.duckdb"))
parquet_path = os.getenv("DATA_FILE_PARQUET_PATH", "")
lock_path = db_path.with_suffix(".duckdb.lock")
db_exists = db_path.exists()
with open(lock_path, "w") as lock_fd:
fcntl.flock(lock_fd, fcntl.LOCK_EX)
try:
if should_rebuild(db_path, parquet_path):
build_database(db_path)
else:
logger.debug("Base de données déjà disponible et à jour.")
except Exception as e:
if db_exists:
logger.error(
f"Bootstrap données KO ({e}). "
f"Réutilisation du DuckDB existant : {db_path}"
)
else:
logger.critical("Aucune base DuckDB et reconstruction impossible.")
raise
return db_path
```
- [ ] **Step 4 : Lancer, vérifier le vert**
Run: `rtk proxy python -m pytest tests/test_db.py -q`
Expected: tous PASS (anciens + 4 nouveaux).
- [ ] **Step 5 : Commit**
```bash
git add src/db.py tests/test_db.py
git commit -m "feat: réutiliser le DuckDB existant si le bootstrap échoue (#78)"
```
---
## Task 4 : Chargements de pages best-effort (C + D)
`tableau.py` (date MAJ via `get_last_modified`) et `a-propos.py` (stats via `get_sources_tables`) chargent au boot et peuvent tuer le démarrage. On les rend best-effort.
**Files:**
- Create: `tests/test_page_loads.py`
- Modify: `src/utils/__init__.py`, `src/pages/tableau.py`, `src/figures.py`
- [ ] **Step 1 : Écrire les tests (échouent d'abord)**
Créer `tests/test_page_loads.py` :
```python
import os
def test_update_timestamp_falls_back_to_db_mtime(tmp_path, monkeypatch):
import src.utils as u
from src.utils import get_data_update_timestamp
def boom(*a, **k):
raise RuntimeError("net down")
monkeypatch.setattr(u, "get_last_modified", boom)
fb = tmp_path / "decp.duckdb"
fb.write_bytes(b"x")
assert get_data_update_timestamp("http://x", str(fb)) == os.path.getmtime(str(fb))
def test_update_timestamp_none_when_all_fail(monkeypatch):
import src.utils as u
from src.utils import get_data_update_timestamp
def boom(*a, **k):
raise RuntimeError("net down")
monkeypatch.setattr(u, "get_last_modified", boom)
assert get_data_update_timestamp("http://x", None) is None
def test_update_timestamp_nominal(monkeypatch):
import src.utils as u
from src.utils import get_data_update_timestamp
monkeypatch.setattr(u, "get_last_modified", lambda p: 123.0)
assert get_data_update_timestamp("http://x", None) == 123.0
def test_sources_tables_none_path():
from src.figures import get_sources_tables
div = get_sources_tables(None)
assert "indisponible" in str(div.children).lower()
def test_sources_tables_missing_file():
from src.figures import get_sources_tables
div = get_sources_tables("/does/not/exist.csv")
assert "indisponible" in str(div.children).lower()
def test_sources_tables_valid_csv(tmp_path):
from dash import dash_table
from src.figures import get_sources_tables
csv = tmp_path / "s.csv"
csv.write_text(
"nom,organisation,nb_marchés,nb_acheteurs,code,url,unique\n"
"Source A,Org A,5,2,XA,http://a,1\n"
)
div = get_sources_tables(str(csv))
assert isinstance(div.children, dash_table.DataTable)
```
- [ ] **Step 2 : Lancer, vérifier l'échec**
Run: `rtk proxy python -m pytest tests/test_page_loads.py -q`
Expected: FAIL (`get_data_update_timestamp` n'existe pas ; `get_sources_tables(None)` plante).
- [ ] **Step 3 : Ajouter `get_data_update_timestamp` dans `src/utils/__init__.py`**
À la fin de `src/utils/__init__.py`, ajouter :
```python
def get_data_update_timestamp(
parquet_path: str, fallback_path: str | None = None
) -> float | None:
"""Date de MAJ des données, best-effort, sans jamais lever (usage au boot)."""
try:
return get_last_modified(parquet_path)
except Exception as e:
logger.warning(f"Date de mise à jour des données indisponible ({e})")
if fallback_path:
try:
return os.path.getmtime(fallback_path)
except OSError:
pass
return None
```
(`os` et `logger` sont déjà disponibles dans ce module.)
- [ ] **Step 4 : Utiliser le helper dans `tableau.py`**
Dans `src/pages/tableau.py`, remplacer l'import ligne 24 :
```python
from src.utils import get_last_modified, logger
```
par :
```python
from src.utils import get_data_update_timestamp, logger
```
Et remplacer les lignes 36-38 :
```python
update_date_timestamp = get_last_modified(os.getenv("DATA_FILE_PARQUET_PATH", ""))
update_date = datetime.fromtimestamp(update_date_timestamp).strftime("%d/%m/%Y")
update_date_iso = datetime.fromtimestamp(update_date_timestamp).isoformat()
```
par :
```python
update_date_timestamp = get_data_update_timestamp(
os.getenv("DATA_FILE_PARQUET_PATH", ""),
os.getenv("DUCKDB_PATH", "./decp.duckdb"),
)
if update_date_timestamp is not None:
update_date = datetime.fromtimestamp(update_date_timestamp).strftime("%d/%m/%Y")
update_date_iso = datetime.fromtimestamp(update_date_timestamp).isoformat()
else:
update_date = "date inconnue"
update_date_iso = ""
```
- [ ] **Step 5 : Élargir `get_sources_tables` dans `src/figures.py`**
Dans `src/figures.py` (`get_sources_tables`, ~lignes 122-125), remplacer :
```python
try:
dff = pl.read_csv(source_path)
except (URLError, HTTPError):
return html.Div("Erreur de connexion")
```
par :
```python
try:
if not source_path:
raise ValueError("SOURCE_STATS_CSV_PATH non défini")
dff = pl.read_csv(source_path)
except Exception as e:
logger.warning(f"Sources de données indisponibles ({e})")
return html.Div("Sources de données momentanément indisponibles.")
```
Si `URLError`/`HTTPError` (import ligne 3 `from urllib.error import HTTPError, URLError`) ne sont plus utilisés ailleurs dans le fichier, supprimer cet import.
Run: `rtk proxy python -m ruff check src/figures.py`
Expected: pas d'erreur F401.
- [ ] **Step 6 : Lancer, vérifier le vert**
Run: `rtk proxy python -m pytest tests/test_page_loads.py -q`
Expected: 6 PASS.
- [ ] **Step 7 : Smoke test — l'import des modules modifiés ne casse pas**
Run: `rtk proxy python -c "import src.figures, src.pages.tableau; print('import OK')"`
Expected: `import OK`.
(NB : `a-propos.py` a un tiret, non importable par nom — son correctif `get_sources_tables` est couvert par les tests unitaires du Step 6 et la page sera validée par la suite Selenium au Step 8.)
- [ ] **Step 8 : Suite complète**
Run: `rtk proxy python -m pytest -q`
Expected: vert (hors tests Selenium nécessitant Chrome, à lancer si l'environnement le permet).
- [ ] **Step 9 : Commit**
```bash
git add tests/test_page_loads.py src/utils/__init__.py src/pages/tableau.py src/figures.py
git commit -m "feat: chargements de pages best-effort au boot (tableau, sources) (#78)"
```
---
## Notes d'exécution
- **Dev hors-ligne 1er run :** « cache seul » supprime le fallback in-repo. Au tout premier démarrage sur une machine sans `schema.cache.json` ni réseau, le boot lèvera `RuntimeError`. En conditions normales (URL OK une fois, ou cache déjà présent) c'est transparent. Les tests sont rendus déterministes via `tests/schema.fixture.json` (Task 2).
- **CHANGELOG :** penser à ajouter une entrée (résilience bootstrap données/schéma) avant de finaliser la PR #78, si le projet le tient à jour.
- **`get_last_modified` reste memoïsé** : non modifié ici ; le cache FileSystem est vidé à chaque boot (`rmtree` dans `app.py`), donc pas de last-modified périmé entre déploiements.
@@ -0,0 +1,725 @@
# Parité API decp.info / tabular-api — Implementation Plan
> **For agentic workers:** REQUIRED SUB-SKILL: Use superpowers:subagent-driven-development (recommended) or superpowers:executing-plans to implement this plan task-by-task. Steps use checkbox (`- [ ]`) syntax for tracking.
**Goal:** Atteindre la parité de l'API `/api/v1/data` de decp.info avec `tabular-api` (data.gouv.fr) sur les opérateurs manquants, et documenter chaque mot-clé dans le Swagger UI.
**Architecture:** Le parsing des filtres reste dans `src/api/filters.py` (`build_where`). On y ajoute l'opérateur `differs` et une nouvelle fonction `parse_aggregators` qui détecte les drapeaux d'agrégation et produit des fragments SQL. `src/db.py` gagne `aggregate_marches`. `src/api/routes.py` oriente vers le chemin agrégation ou le chemin normal, renomme le param réservé `count``count_results`, et documente les opérateurs.
**Tech Stack:** Flask + flask-smorest, DuckDB, Polars, pytest.
## Global Constraints
- Imports internes toujours préfixés `src.` (ex. `src.api.filters`).
- Valeurs de filtre liées par paramètres `?` (jamais interpolées). Noms de colonnes validés contre `schema` avant interpolation.
- Spec de référence : `docs/superpowers/specs/2026-06-22-api-parite-datagouv-design.md`.
- Périmètre : `count_results`, `differs`, agrégation (`groupby`/`count`/`sum`/`avg`/`min`/`max`), doc. **Hors périmètre : `or`.**
- Lancer les tests via `rtk pytest` ; l'environnement de test définit `DEVELOPMENT=true` et `DATA_FILE_PARQUET_PATH=tests/test.parquet`.
- `tests/test.parquet` contient notamment les colonnes : `uid`, `montant` (Int64), `acheteur_departement_code`, `objet`, `dateNotification` (Date).
---
### Task 1 : Renommer le param réservé `count` → `count_results`
**Files:**
- Modify: `src/api/filters.py` (constante `RESERVED_PARAMS`)
- Modify: `src/api/routes.py` (lecture du param + doc swagger)
- Test: `tests/api/test_filters.py`, `tests/api/test_endpoints_data.py`
**Interfaces:**
- Consumes: rien.
- Produces: le param réservé s'appelle désormais `count_results` ; `count` n'est plus réservé (libéré pour l'agrégation en Task 3).
- [ ] **Step 1 : Mettre à jour les tests existants**
Dans `tests/api/test_filters.py`, remplacer `("count", "false")` par `("count_results", "false")` dans `test_reserved_params_are_ignored` :
```python
def test_reserved_params_are_ignored():
where, params, order = build_where(
[
("page", "2"),
("page_size", "100"),
("columns", "uid"),
("count_results", "false"),
("uid__exact", "z"),
],
SCHEMA,
)
assert where == '"uid" = ?'
assert params == ["z"]
```
Dans `tests/api/test_endpoints_data.py`, renommer le test et l'URL :
```python
def test_data_count_results_false_omits_total(api_client, valid_token_header):
client, _ = api_client
resp = client.get("/api/v1/data?count_results=false", headers=valid_token_header)
assert resp.status_code == 200
body = resp.get_json()
assert "total" not in body["meta"]
```
- [ ] **Step 2 : Lancer les tests, vérifier l'échec**
Run: `rtk pytest tests/api/test_endpoints_data.py::test_data_count_results_false_omits_total tests/api/test_filters.py::test_reserved_params_are_ignored -v`
Expected: FAIL (`count_results` encore traité comme filtre inconnu → 400 / `FilterError`).
- [ ] **Step 3 : Modifier `RESERVED_PARAMS`**
Dans `src/api/filters.py` :
```python
RESERVED_PARAMS = {"page", "page_size", "columns", "count_results"}
```
- [ ] **Step 4 : Modifier la lecture dans la route**
Dans `src/api/routes.py`, fonction `data()`, remplacer :
```python
count = request.args.get("count", "true").lower() != "false"
```
par :
```python
count_results = request.args.get("count_results", "true").lower() != "false"
```
et plus bas remplacer `if count else None` par `if count_results else None`.
- [ ] **Step 5 : Mettre à jour la doc swagger du param**
Dans `src/api/routes.py`, dans `@bp.doc(parameters=[...])`, remplacer le bloc du paramètre `count` par :
```python
{
"name": "count_results",
"in": "query",
"schema": {"type": "string", "enum": ["true", "false"], "default": "true"},
"description": "Inclure le total (`COUNT(*)`) dans `meta`. Mettre `false` pour accélérer la requête. Ignoré en mode agrégation.",
},
```
Et dans le docstring de `data()`, remplacer la mention `count (true|false ...)` par `count_results (true|false ; mettre false pour économiser le COUNT(*))`.
- [ ] **Step 6 : Lancer les tests, vérifier le succès**
Run: `rtk pytest tests/api/test_endpoints_data.py tests/api/test_filters.py -v`
Expected: PASS (tous).
- [ ] **Step 7 : Commit**
```bash
git add src/api/filters.py src/api/routes.py tests/api/test_filters.py tests/api/test_endpoints_data.py
git commit -m "feat(api): renomme le param réservé count en count_results (#78)"
```
---
### Task 2 : Opérateur de filtre `differs`
**Files:**
- Modify: `src/api/filters.py` (`OPERATORS`, `build_where`)
- Test: `tests/api/test_filters.py`, `tests/api/test_endpoints_data.py`
**Interfaces:**
- Consumes: `build_where(args, schema) -> (where_sql, params, order_sql)` (existant).
- Produces: `col__differs=val` → fragment SQL `"col" IS DISTINCT FROM ?`.
- [ ] **Step 1 : Écrire les tests unitaires (échec attendu)**
Dans `tests/api/test_filters.py` :
```python
def test_differs_filter():
where, params, _ = build_where([("uid__differs", "abc")], SCHEMA)
assert where == '"uid" IS DISTINCT FROM ?'
assert params == ["abc"]
def test_differs_filter_on_int():
where, params, _ = build_where([("annee__differs", "2020")], SCHEMA)
assert where == '"annee" IS DISTINCT FROM ?'
assert params == [2020]
```
- [ ] **Step 2 : Lancer, vérifier l'échec**
Run: `rtk pytest tests/api/test_filters.py::test_differs_filter tests/api/test_filters.py::test_differs_filter_on_int -v`
Expected: FAIL (`FilterError: Opérateur inconnu : __differs`).
- [ ] **Step 3 : Ajouter `differs` à `OPERATORS`**
Dans `src/api/filters.py`, ajouter `"differs",` dans le set `OPERATORS` (après `"notcontains",`).
- [ ] **Step 4 : Ajouter la branche dans `build_where`**
Dans `src/api/filters.py`, dans `build_where`, après le bloc `elif op == "notcontains":` (lignes ~132-134), ajouter :
```python
elif op == "differs":
where_parts.append(f'"{col}" IS DISTINCT FROM ?')
params.append(v)
```
- [ ] **Step 5 : Lancer les tests unitaires, vérifier le succès**
Run: `rtk pytest tests/api/test_filters.py -k differs -v`
Expected: PASS.
- [ ] **Step 6 : Ajouter un test d'endpoint**
Dans `tests/api/test_endpoints_data.py` :
```python
def test_data_differs_excludes_value(api_client, valid_token_header):
client, _ = api_client
base = client.get("/api/v1/data?page_size=1", headers=valid_token_header).get_json()
uid = base["data"][0]["uid"]
resp = client.get(f"/api/v1/data?uid__differs={uid}", headers=valid_token_header)
assert resp.status_code == 200
body = resp.get_json()
assert all(row["uid"] != uid for row in body["data"])
```
- [ ] **Step 7 : Lancer, vérifier le succès**
Run: `rtk pytest tests/api/test_endpoints_data.py::test_data_differs_excludes_value -v`
Expected: PASS.
- [ ] **Step 8 : Commit**
```bash
git add src/api/filters.py tests/api/test_filters.py tests/api/test_endpoints_data.py
git commit -m "feat(api): ajoute l'opérateur de filtre differs (IS DISTINCT FROM) (#78)"
```
---
### Task 3 : Parsing des agrégateurs (`parse_aggregators`)
**Files:**
- Modify: `src/api/filters.py` (constantes `AGGREGATORS`/`AGG_SQL`, dataclass `AggregationSpec`, fonction `parse_aggregators`, skip dans `build_where`)
- Test: `tests/api/test_filters.py`
**Interfaces:**
- Consumes: `_split_key`, `FilterError` (existants).
- Produces:
- `AGGREGATORS: set[str]` = `{"groupby","count","sum","avg","min","max"}`.
- `@dataclass class AggregationSpec: select_sql: str; group_by_sql: str | None`.
- `parse_aggregators(args: list[tuple[str,str]], schema: pl.Schema) -> AggregationSpec | None``None` si aucun agrégateur.
- `build_where` ignore désormais les clés dont l'opérateur ∈ `AGGREGATORS`.
- [ ] **Step 1 : Écrire les tests unitaires (échec attendu)**
Dans `tests/api/test_filters.py`, ajouter l'import et les tests :
```python
from src.api.filters import AggregationSpec, parse_aggregators
def test_parse_aggregators_none_when_absent():
assert parse_aggregators([("uid__exact", "a")], SCHEMA) is None
def test_parse_aggregators_groupby_and_count():
spec = parse_aggregators(
[("annee__groupby", ""), ("uid__count", "")], SCHEMA
)
assert isinstance(spec, AggregationSpec)
assert spec.select_sql == '"annee", COUNT("uid") AS "uid__count"'
assert spec.group_by_sql == '"annee"'
def test_parse_aggregators_multiple_aggregates():
spec = parse_aggregators(
[
("annee__groupby", ""),
("montant__sum", ""),
("montant__avg", ""),
("montant__min", ""),
("montant__max", ""),
],
SCHEMA,
)
assert spec.select_sql == (
'"annee", SUM("montant") AS "montant__sum", '
'AVG("montant") AS "montant__avg", '
'MIN("montant") AS "montant__min", '
'MAX("montant") AS "montant__max"'
)
assert spec.group_by_sql == '"annee"'
def test_parse_aggregators_global_without_groupby():
spec = parse_aggregators([("uid__count", "")], SCHEMA)
assert spec.select_sql == 'COUNT("uid") AS "uid__count"'
assert spec.group_by_sql is None
def test_parse_aggregators_unknown_column_raises():
with pytest.raises(FilterError):
parse_aggregators([("nope__count", "")], SCHEMA)
def test_build_where_ignores_aggregator_flags():
where, params, _ = build_where(
[("annee__groupby", ""), ("uid__count", ""), ("montant__greater", "100")],
SCHEMA,
)
assert where == '"montant" >= ?'
assert params == [100.0]
```
- [ ] **Step 2 : Lancer, vérifier l'échec**
Run: `rtk pytest tests/api/test_filters.py -k aggregator -v`
Expected: FAIL (`ImportError: cannot import name 'parse_aggregators'`).
- [ ] **Step 3 : Ajouter constantes + dataclass + fonction**
Dans `src/api/filters.py`, ajouter en haut l'import `from dataclasses import dataclass` (après les imports existants), puis après `RESERVED_PARAMS` :
```python
AGGREGATORS = {"groupby", "count", "sum", "avg", "min", "max"}
AGG_SQL = {"count": "COUNT", "sum": "SUM", "avg": "AVG", "min": "MIN", "max": "MAX"}
@dataclass
class AggregationSpec:
select_sql: str
group_by_sql: str | None
def parse_aggregators(
args: list[tuple[str, str]], schema: pl.Schema
) -> AggregationSpec | None:
"""Détecte les drapeaux d'agrégation (`col__groupby`, `col__count`, ...).
Retourne None si aucun agrégateur. Sinon, construit les fragments SQL
`select_sql` et `group_by_sql` (noms de colonnes validés contre le schéma).
"""
group_cols: list[str] = []
aggregates: list[tuple[str, str]] = [] # (operator, column)
has_agg = False
for key, _ in args:
parsed = _split_key(key)
if not parsed:
continue
col, op = parsed
if op not in AGGREGATORS:
continue
has_agg = True
if col not in schema:
raise FilterError(f"Colonne inconnue : {col!r}", field=key)
if op == "groupby":
group_cols.append(col)
else:
aggregates.append((op, col))
if not has_agg:
return None
select_parts = [f'"{c}"' for c in group_cols]
for op, col in aggregates:
select_parts.append(f'{AGG_SQL[op]}("{col}") AS "{col}__{op}"')
group_by_sql = ", ".join(f'"{c}"' for c in group_cols) if group_cols else None
return AggregationSpec(select_sql=", ".join(select_parts), group_by_sql=group_by_sql)
```
- [ ] **Step 4 : Faire ignorer les drapeaux d'agrégation par `build_where`**
Dans `src/api/filters.py`, dans `build_where`, juste après `col, op = parsed` (et avant `if op not in OPERATORS:`), ajouter :
```python
if op in AGGREGATORS:
continue
```
- [ ] **Step 5 : Lancer les tests, vérifier le succès**
Run: `rtk pytest tests/api/test_filters.py -v`
Expected: PASS (tous, anciens et nouveaux).
- [ ] **Step 6 : Commit**
```bash
git add src/api/filters.py tests/api/test_filters.py
git commit -m "feat(api): parsing des opérateurs d'agrégation (groupby/count/sum/avg/min/max) (#78)"
```
---
### Task 4 : `aggregate_marches` dans la couche DB
**Files:**
- Modify: `src/db.py` (nouvelle fonction `aggregate_marches`)
- Test: `tests/api/test_db_aggregate.py` (créer)
**Interfaces:**
- Consumes: `get_cursor()`, `logger` (existants dans `src/db.py`).
- Produces: `aggregate_marches(select_sql: str, where_sql: str = "TRUE", params: tuple | list = (), group_by: str | None = None, limit: int | None = None, offset: int | None = None) -> pl.DataFrame`.
- [ ] **Step 1 : Écrire le test (échec attendu)**
Créer `tests/api/test_db_aggregate.py` :
```python
import polars as pl
from src.db import aggregate_marches
def test_aggregate_groupby_count_returns_named_columns():
df = aggregate_marches(
select_sql='"acheteur_departement_code", COUNT("uid") AS "uid__count"',
group_by='"acheteur_departement_code"',
)
assert isinstance(df, pl.DataFrame)
assert df.columns == ["acheteur_departement_code", "uid__count"]
assert df["uid__count"].sum() > 0
def test_aggregate_global_without_groupby_returns_one_row():
df = aggregate_marches(select_sql='COUNT("uid") AS "uid__count"')
assert df.height == 1
assert df["uid__count"][0] > 0
```
- [ ] **Step 2 : Lancer, vérifier l'échec**
Run: `rtk pytest tests/api/test_db_aggregate.py -v`
Expected: FAIL (`ImportError: cannot import name 'aggregate_marches'`).
- [ ] **Step 3 : Implémenter `aggregate_marches`**
Dans `src/db.py`, après `count_marches` (vers la ligne 186), ajouter :
```python
def aggregate_marches(
select_sql: str,
where_sql: str = "TRUE",
params: tuple | list = (),
group_by: str | None = None,
limit: int | None = None,
offset: int | None = None,
) -> pl.DataFrame:
"""SELECT agrégé paramétré contre la table decp.
`select_sql` et `group_by` sont des fragments SQL construits depuis des
noms de colonnes validés (jamais de valeur utilisateur libre). Les
valeurs de filtre passent par le binding `?` via `params`.
"""
sql = f"SELECT {select_sql} FROM decp WHERE {where_sql}"
if group_by:
sql += f" GROUP BY {group_by}"
if limit is not None:
sql += f" LIMIT {int(limit)}"
if offset is not None:
sql += f" OFFSET {int(offset)}"
logger.debug("aggregate_marches: " + sql.replace("?", "{}").format(*params))
return get_cursor().execute(sql, list(params)).pl()
```
- [ ] **Step 4 : Lancer, vérifier le succès**
Run: `rtk pytest tests/api/test_db_aggregate.py -v`
Expected: PASS.
- [ ] **Step 5 : Commit**
```bash
git add src/db.py tests/api/test_db_aggregate.py
git commit -m "feat(db): aggregate_marches pour les requêtes GROUP BY (#78)"
```
---
### Task 5 : Orchestration du mode agrégation dans la route
**Files:**
- Modify: `src/api/routes.py` (fonction `data()`)
- Test: `tests/api/test_endpoints_data.py`
**Interfaces:**
- Consumes: `parse_aggregators` (Task 3), `aggregate_marches` (Task 4), `build_where` (existant), `AggregationSpec`.
- Produces: l'endpoint `/api/v1/data` renvoie des lignes agrégées quand un opérateur d'agrégation est présent ; `meta` sans `total` ; `columns` + agrégation → 400.
- [ ] **Step 1 : Écrire les tests d'endpoint (échec attendu)**
Dans `tests/api/test_endpoints_data.py` :
```python
def test_data_aggregation_groupby_count(api_client, valid_token_header):
client, _ = api_client
resp = client.get(
"/api/v1/data?acheteur_departement_code__groupby&uid__count",
headers=valid_token_header,
)
assert resp.status_code == 200
body = resp.get_json()
assert body["data"], "agrégation vide ?"
for row in body["data"]:
assert set(row.keys()) == {"acheteur_departement_code", "uid__count"}
assert "total" not in body["meta"]
def test_data_aggregation_global_count(api_client, valid_token_header):
client, _ = api_client
resp = client.get("/api/v1/data?uid__count", headers=valid_token_header)
assert resp.status_code == 200
body = resp.get_json()
assert len(body["data"]) == 1
assert "uid__count" in body["data"][0]
def test_data_aggregation_with_filter(api_client, valid_token_header):
client, _ = api_client
resp = client.get(
"/api/v1/data?acheteur_departement_code__groupby&uid__count&montant__greater=0",
headers=valid_token_header,
)
assert resp.status_code == 200
def test_data_aggregation_with_columns_returns_400(api_client, valid_token_header):
client, _ = api_client
resp = client.get(
"/api/v1/data?uid__count&columns=uid",
headers=valid_token_header,
)
assert resp.status_code == 400
```
- [ ] **Step 2 : Lancer, vérifier l'échec**
Run: `rtk pytest tests/api/test_endpoints_data.py -k aggregation -v`
Expected: FAIL (les drapeaux d'agrégation sont ignorés → réponse non agrégée, clés inattendues / pas de 400).
- [ ] **Step 3 : Mettre à jour les imports de la route**
Dans `src/api/routes.py`, remplacer la ligne d'import des filtres :
```python
from src.api.filters import FilterError, build_where
```
par :
```python
from src.api.filters import FilterError, build_where, parse_aggregators
from src.db import aggregate_marches
```
(et conserver l'import existant `from src.db import count_marches, query_marches`).
- [ ] **Step 4 : Brancher le chemin agrégation dans `data()`**
Dans `src/api/routes.py`, fonction `data()`, remplacer le bloc qui va de `try:` (parsing `build_where`) jusqu'au `return {...}` final par :
```python
args = list(request.args.items(multi=True))
try:
agg = parse_aggregators(args, duckdb_schema)
where_sql, params, order_sql = build_where(args, duckdb_schema)
except FilterError as e:
abort(400, message=str(e), errors={"field": e.field})
if agg is not None:
if columns:
abort(
400,
message="`columns` ne peut pas être combiné avec une agrégation",
)
df = aggregate_marches(
select_sql=agg.select_sql,
where_sql=where_sql,
params=params,
group_by=agg.group_by_sql,
limit=page_size,
offset=(page - 1) * page_size,
)
df_ready = df.with_columns(cs.temporal().cast(pl.String))
return {
"data": df_ready.to_dicts(),
"meta": {"page": page, "page_size": page_size},
"links": _build_links(page, page_size, None),
}
df = query_marches(
where_sql=where_sql,
params=params,
columns=columns,
order_by=order_sql,
limit=page_size,
offset=(page - 1) * page_size,
)
# JSON ne sérialise pas date/datetime nativement → cast en string ISO
df_ready = df.with_columns(cs.temporal().cast(pl.String))
total = count_marches(where_sql, params) if count_results else None
meta = {"page": page, "page_size": page_size}
if total is not None:
meta["total"] = total
return {
"data": df_ready.to_dicts(),
"meta": meta,
"links": _build_links(page, page_size, total),
}
```
(Note : `count_results` provient de la Task 1 ; `columns`, `page`, `page_size` sont déjà calculés plus haut dans la fonction.)
- [ ] **Step 5 : Lancer les tests d'endpoint, vérifier le succès**
Run: `rtk pytest tests/api/test_endpoints_data.py -v`
Expected: PASS (tous).
- [ ] **Step 6 : Commit**
```bash
git add src/api/routes.py tests/api/test_endpoints_data.py
git commit -m "feat(api): mode agrégation sur /data (groupby + agrégats) (#78)"
```
---
### Task 6 : Documentation Swagger des mots-clés
**Files:**
- Modify: `src/api/routes.py` (bloc `@bp.doc` du param dynamique + docstring de `data()`)
- Test: `tests/api/test_openapi_doc.py` (créer)
**Interfaces:**
- Consumes: l'OpenAPI généré, servi sur `/api/v1/openapi.json`.
- Produces: la description du paramètre `<colonne>__<opérateur>` liste tous les opérateurs (filtres + agrégation) avec une définition d'une ligne chacun, et décrit le mode agrégation.
- [ ] **Step 1 : Écrire le test (échec attendu)**
Créer `tests/api/test_openapi_doc.py` :
```python
def test_openapi_documents_new_keywords(api_client):
client, _ = api_client
resp = client.get("/api/v1/openapi.json")
assert resp.status_code == 200
raw = resp.get_data(as_text=True)
for keyword in ["count_results", "differs", "groupby", "__sum", "__avg", "__min", "__max"]:
assert keyword in raw, f"{keyword} absent de la doc OpenAPI"
```
- [ ] **Step 2 : Lancer, vérifier l'échec**
Run: `rtk pytest tests/api/test_openapi_doc.py -v`
Expected: FAIL (`differs`, `groupby`, etc. absents de la description).
- [ ] **Step 3 : Étoffer la description du paramètre dynamique**
Dans `src/api/routes.py`, remplacer la `description` du paramètre `<colonne>__<opérateur>` par :
```python
"description": (
"Filtre ou agrégation dynamique : `<colonne>__<opérateur>` "
"(voir les colonnes via `/schema`).\n\n"
"**Filtres** (`<colonne>__<op>=<valeur>`) :\n"
"- `exact` : égal à la valeur\n"
"- `differs` : différent de la valeur (null-safe, `IS DISTINCT FROM`)\n"
"- `contains` / `notcontains` : contient / ne contient pas (LIKE)\n"
"- `in` / `notin` : dans / hors d'une liste séparée par des virgules\n"
"- `less` / `greater` : ≤ / ≥\n"
"- `strictly_less` / `strictly_greater` : < / >\n"
"- `isnull` / `isnotnull` : valeur nulle / non nulle (sans valeur)\n"
"- `sort` : tri, valeur `asc` ou `desc`\n\n"
"**Agrégation** (drapeaux sans valeur, ex. `acheteur_departement_code__groupby&montant__sum`) :\n"
"- `groupby` : regroupe sur la colonne\n"
"- `count`, `sum`, `avg`, `min`, `max` : agrège la colonne ; "
"la colonne de sortie est nommée `colonne__count`, `colonne__sum`, "
"`colonne__avg`, `colonne__min`, `colonne__max`\n\n"
"En mode agrégation, la réponse contient des lignes groupées, "
"`columns` est interdit et `meta` ne contient pas `total`.\n\n"
"Exemples : `acheteur_id__contains=VILLE`, `montant__greater=10000`, "
"`acheteur_departement_code__groupby&montant__sum`."
),
```
- [ ] **Step 4 : Mettre à jour le docstring de `data()`**
Dans `src/api/routes.py`, remplacer le docstring de `data()` par :
```python
"""Récupère des marchés publics filtrés, triés ou agrégés.
Filtres en query string : `<colonne>__<opérateur>=<valeur>`.
Opérateurs de filtre : exact, differs, contains, notcontains, in, notin,
less, greater, strictly_less, strictly_greater, isnull, isnotnull, sort.
Agrégation (drapeaux sans valeur) : `<colonne>__groupby`,
`<colonne>__count|sum|avg|min|max`. Les colonnes agrégées sont nommées
`<colonne>__<opérateur>`. `columns` est interdit avec une agrégation et
`meta` ne contient alors pas `total`.
Paramètres réservés : page (défaut 1), page_size (défaut 50, max 1000),
columns (csv), count_results (true|false ; mettre false pour économiser
le COUNT(*)).
Exemple d'agrégation :
`?acheteur_departement_code__groupby&uid__count&montant__sum`
"""
```
- [ ] **Step 5 : Lancer, vérifier le succès**
Run: `rtk pytest tests/api/test_openapi_doc.py -v`
Expected: PASS.
- [ ] **Step 6 : Vérifier la non-régression complète de l'API**
Run: `rtk pytest tests/api/ -v`
Expected: PASS (tous).
- [ ] **Step 7 : Commit**
```bash
git add src/api/routes.py tests/api/test_openapi_doc.py
git commit -m "docs(api): documente les opérateurs (filtres + agrégation) dans Swagger (#78)"
```
---
## Notes de vérification de référence (manuel, hors tests automatisés)
Après implémentation, vérifier que quelques requêtes d'agrégation renvoient
des valeurs cohérentes avec data.gouv.fr sur la même ressource DECP
(`22847056-61df-452d-837d-8b8ceadbfc52`), aux différences de fraîcheur près :
```
GET /api/v1/data?acheteur_departement_code__groupby&uid__count&montant__sum
```
à comparer à :
```
https://tabular-api.data.gouv.fr/api/resources/22847056-61df-452d-837d-8b8ceadbfc52/data/?acheteur_departement_code__groupby&uid__count&montant__sum
```
@@ -0,0 +1,426 @@
# Tuile « Considérations sociales et environnementales » — Implementation Plan
> **For agentic workers:** REQUIRED SUB-SKILL: Use superpowers:subagent-driven-development (recommended) or superpowers:executing-plans to implement this plan task-by-task. Steps use checkbox (`- [ ]`) syntax for tracking.
**Goal:** Ajouter dans `/observatoire`, juste après la tuile « Type d'achat », une tuile montrant via deux barres de progression la part des marchés filtrés comportant au moins une considération sociale (rouge) et au moins une considération environnementale (vert).
**Architecture:** Une fonction pure de calcul (`compute_considerations_stats`) dans `src/figures.py`, testée directement, alimente une fonction de rendu (`get_considerations_card_content`) qui produit un `html.Div` de deux `dbc.Progress`. La tuile est ajoutée dans `_compute_dashboard_children` via le `make_card` existant.
**Tech Stack:** Polars (LazyFrame), Dash / Dash Bootstrap Components (`dbc.Progress`), pytest.
## Global Constraints
- Imports internes toujours préfixés `src.` (ex. `from src.figures import ...`), jamais `figures` ou `utils`.
- Dédoublonnage **par `uid`** : un marché compté une fois (première valeur par `uid`).
- « Au moins une considération » = la valeur de colonne **contient** (insensible casse) `Clause`, `Critère` ou `Marché réservé`. Regex exacte : `(?i)Clause|Critère|Marché réservé`.
- Dénominateur = **tous** les marchés filtrés (uid distincts), y compris `Sans objet` et non renseignés.
- `pct = round(100 * numérateur / dénominateur)` ; si dénominateur = 0 → `pct = 0`.
- Couleurs issues de `px.colors.qualitative.Safe` : sociales = `rgb(204, 102, 119)` (index 1, rouge) ; environnementales = `rgb(17, 119, 51)` (index 3, vert).
- Robustesse : si une colonne `considerations*` est absente du schéma, son `(count, pct)` vaut `(0, 0)` sans exception.
---
### Task 1: Fonction de calcul `compute_considerations_stats`
**Files:**
- Modify: `src/figures.py` (ajouter la fonction après `get_dashboard_summary_table`, ~ ligne 729)
- Test: `tests/test_figures.py` (créer)
**Interfaces:**
- Consumes: rien (fonction pure prenant un `pl.LazyFrame`).
- Produces: `compute_considerations_stats(lff: pl.LazyFrame) -> dict[str, tuple[int, int]]` renvoyant `{"sociales": (count, pct), "environnementales": (count, pct)}``count` = nombre de marchés (uid distincts) avec au moins une considération et `pct` = pourcentage entier sur le total des uid distincts.
- [ ] **Step 1: Write the failing test**
Créer `tests/test_figures.py` :
```python
import polars as pl
def _make_lff(rows):
return pl.LazyFrame(rows)
def test_compute_considerations_stats_basic():
from src.figures import compute_considerations_stats
lff = _make_lff(
[
# uid u1 : social oui (Clause), env non (Sans objet)
{"uid": "u1", "considerationsSociales": "Clause sociale", "considerationsEnvironnementales": "Sans objet"},
# uid u2 : social non (Sans objet), env oui (Critère)
{"uid": "u2", "considerationsSociales": "Sans objet", "considerationsEnvironnementales": "Critère environnemental"},
# uid u3 : social oui (Marché réservé compte), env null
{"uid": "u3", "considerationsSociales": "Marché réservé", "considerationsEnvironnementales": None},
# uid u4 : aucune considération
{"uid": "u4", "considerationsSociales": "Pas de considération sociale", "considerationsEnvironnementales": "Sans objet"},
]
)
stats = compute_considerations_stats(lff)
# 4 marchés au total. Social : u1, u3 -> 2/4 = 50%. Env : u2 -> 1/4 = 25%.
assert stats["sociales"] == (2, 50)
assert stats["environnementales"] == (1, 25)
def test_compute_considerations_stats_dedup_per_uid():
from src.figures import compute_considerations_stats
lff = _make_lff(
[
# uid u1 présent 2 fois (2 titulaires) -> compté une seule fois
{"uid": "u1", "considerationsSociales": "Clause sociale", "considerationsEnvironnementales": "Sans objet"},
{"uid": "u1", "considerationsSociales": "Clause sociale", "considerationsEnvironnementales": "Sans objet"},
{"uid": "u2", "considerationsSociales": "Sans objet", "considerationsEnvironnementales": "Sans objet"},
]
)
stats = compute_considerations_stats(lff)
# 2 marchés distincts. Social : u1 -> 1/2 = 50%.
assert stats["sociales"] == (1, 50)
assert stats["environnementales"] == (0, 0)
def test_compute_considerations_stats_missing_column():
from src.figures import compute_considerations_stats
lff = _make_lff(
[
{"uid": "u1", "considerationsSociales": "Clause sociale"},
{"uid": "u2", "considerationsSociales": "Sans objet"},
]
)
stats = compute_considerations_stats(lff)
# Colonne env absente -> (0, 0) sans exception. Social : 1/2 = 50%.
assert stats["sociales"] == (1, 50)
assert stats["environnementales"] == (0, 0)
def test_compute_considerations_stats_empty():
from src.figures import compute_considerations_stats
lff = pl.LazyFrame(
{
"uid": pl.Series([], dtype=pl.String),
"considerationsSociales": pl.Series([], dtype=pl.String),
"considerationsEnvironnementales": pl.Series([], dtype=pl.String),
}
)
stats = compute_considerations_stats(lff)
assert stats["sociales"] == (0, 0)
assert stats["environnementales"] == (0, 0)
```
- [ ] **Step 2: Run test to verify it fails**
Run: `uv run pytest tests/test_figures.py -v`
Expected: FAIL avec `ImportError: cannot import name 'compute_considerations_stats'`.
- [ ] **Step 3: Write minimal implementation**
Dans `src/figures.py`, ajouter après `get_dashboard_summary_table` (avant `make_card`) :
```python
CONSIDERATIONS_REGEX = r"(?i)Clause|Critère|Marché réservé"
CONSIDERATIONS_COLUMNS = {
"sociales": "considerationsSociales",
"environnementales": "considerationsEnvironnementales",
}
def compute_considerations_stats(lff: pl.LazyFrame) -> dict[str, tuple[int, int]]:
"""Part des marchés (uid distincts) ayant au moins une considération.
Renvoie {"sociales": (count, pct), "environnementales": (count, pct)}.
Dénominateur = tous les uid distincts. Colonne absente -> (0, 0).
"""
names = lff.collect_schema().names()
present = {
key: col for key, col in CONSIDERATIONS_COLUMNS.items() if col in names
}
stats = {key: (0, 0) for key in CONSIDERATIONS_COLUMNS}
if not present:
return stats
agg = (
lff.select(["uid"] + list(present.values()))
.group_by("uid")
.agg([pl.col(col).first() for col in present.values()])
.collect(engine="streaming")
)
total = agg.height
if total == 0:
return stats
for key, col in present.items():
count = agg.filter(
pl.col(col).str.contains(CONSIDERATIONS_REGEX)
).height
pct = round(100 * count / total)
stats[key] = (count, pct)
return stats
```
- [ ] **Step 4: Run test to verify it passes**
Run: `uv run pytest tests/test_figures.py -v`
Expected: 4 tests PASS.
- [ ] **Step 5: Commit**
```bash
git add src/figures.py tests/test_figures.py
git commit -m "feat(observatoire): calcul part marchés avec considération sociale/env
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>"
```
---
### Task 2: Rendu de la tuile `get_considerations_card_content`
**Files:**
- Modify: `src/figures.py` (ajouter après `compute_considerations_stats`)
- Test: `tests/test_figures.py` (ajouter au fichier de la Task 1)
**Interfaces:**
- Consumes: `compute_considerations_stats(lff) -> dict[str, tuple[int, int]]` (Task 1) ; `format_number` (déjà importé en tête de `src/figures.py` : `from src.utils.table import add_links, format_number, setup_table_columns`).
- Produces: `get_considerations_card_content(lff: pl.LazyFrame) -> html.Div` : un `html.Div` contenant deux blocs (sociales, environnementales), chacun avec un libellé, un `dbc.Progress` coloré rempli au pourcentage, et le nombre de marchés.
- [ ] **Step 1: Write the failing test**
Ajouter à `tests/test_figures.py` :
```python
def test_get_considerations_card_content_returns_two_progress_bars():
import dash_bootstrap_components as dbc
from dash import html
from src.figures import get_considerations_card_content
lff = pl.LazyFrame(
[
{"uid": "u1", "considerationsSociales": "Clause sociale", "considerationsEnvironnementales": "Sans objet"},
{"uid": "u2", "considerationsSociales": "Sans objet", "considerationsEnvironnementales": "Critère environnemental"},
]
)
div = get_considerations_card_content(lff)
assert isinstance(div, html.Div)
# Récupère récursivement tous les dbc.Progress
def find_progress(component, found):
children = getattr(component, "children", None)
if isinstance(component, dbc.Progress):
found.append(component)
if isinstance(children, (list, tuple)):
for c in children:
find_progress(c, found)
elif children is not None:
find_progress(children, found)
return found
bars = find_progress(div, [])
assert len(bars) == 2
# Sociales (rouge) : u1 -> 50%. Environnementales (vert) : u2 -> 50%.
social_bar, env_bar = bars[0], bars[1]
assert social_bar.value == 50
assert social_bar.label == "50 %"
assert social_bar.style["backgroundColor"] == "rgb(204, 102, 119)"
assert env_bar.value == 50
assert env_bar.label == "50 %"
assert env_bar.style["backgroundColor"] == "rgb(17, 119, 51)"
```
- [ ] **Step 2: Run test to verify it fails**
Run: `uv run pytest tests/test_figures.py::test_get_considerations_card_content_returns_two_progress_bars -v`
Expected: FAIL avec `ImportError: cannot import name 'get_considerations_card_content'`.
- [ ] **Step 3: Write minimal implementation**
Dans `src/figures.py`, ajouter après `compute_considerations_stats` :
```python
CONSIDERATIONS_DISPLAY = [
# (clé, libellé, couleur Safe)
("sociales", "Sociales", "rgb(204, 102, 119)"),
("environnementales", "Environnementales", "rgb(17, 119, 51)"),
]
def get_considerations_card_content(lff: pl.LazyFrame) -> html.Div:
"""Deux barres de progression : part des marchés avec considération."""
stats = compute_considerations_stats(lff)
blocks = []
for key, label, color in CONSIDERATIONS_DISPLAY:
count, pct = stats[key]
blocks.append(
html.Div(
className="mb-3",
children=[
html.Div(
className="d-flex justify-content-between",
children=[
html.Span(label),
html.Span(
f"{format_number(count)} marchés",
className="text-muted",
),
],
),
dbc.Progress(
value=pct,
label=f"{pct} %",
style={"backgroundColor": color},
),
],
)
)
return html.Div(children=blocks)
```
- [ ] **Step 4: Run test to verify it passes**
Run: `uv run pytest tests/test_figures.py -v`
Expected: tous les tests PASS (5 au total).
- [ ] **Step 5: Commit**
```bash
git add src/figures.py tests/test_figures.py
git commit -m "feat(observatoire): tuile considérations en barres de progression
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>"
```
---
### Task 3: Intégration dans l'Observatoire
**Files:**
- Modify: `src/pages/observatoire.py` (import ~ lignes 20-31 ; appel dans `_compute_dashboard_children` après le bloc « Type d'achat », ~ ligne 723)
**Interfaces:**
- Consumes: `get_considerations_card_content(lff) -> html.Div` (Task 2) ; `make_card` (déjà importé).
- Produces: une nouvelle `dbc.Col` (card) insérée dans la liste `cards` entre « Type d'achat » et « Distance acheteurtitulaire ».
- [ ] **Step 1: Ajouter l'import**
Dans `src/pages/observatoire.py`, dans le bloc `from src.figures import (...)` (lignes 20-31), ajouter `get_considerations_card_content` en respectant l'ordre alphabétique existant (après `get_barchart_sources`) :
```python
from src.figures import (
DataTable,
get_barchart_sources,
get_considerations_card_content,
get_dashboard_summary_table,
get_distance_histogram,
get_duplicate_matrix,
get_geographic_maps,
get_top_org_table,
make_card,
make_column_picker,
make_donut,
)
```
- [ ] **Step 2: Insérer la tuile après « Type d'achat »**
Dans `_compute_dashboard_children`, juste après le `cards.append(...)` du donut « Type d'achat » (qui se termine ligne ~723) et avant `distance_histogram = ...`, insérer :
```python
considerations_content = get_considerations_card_content(lff)
cards.append(
make_card(
title="Considérations sociales et environnementales",
subtitle="part des marchés concernés",
fig=considerations_content,
)
)
```
Le bloc résultant doit ressembler à :
```python
donut_marche_type = make_donut(lff, "type", per_uid=True, nulls="?")
cards.append(
make_card(
title="Type d'achat",
subtitle="en nombre de marchés attribués",
fig=donut_marche_type,
)
)
considerations_content = get_considerations_card_content(lff)
cards.append(
make_card(
title="Considérations sociales et environnementales",
subtitle="part des marchés concernés",
fig=considerations_content,
)
)
distance_histogram = get_distance_histogram(lff)
```
- [ ] **Step 3: Vérifier que la page se charge (test d'import/rendu)**
Run: `uv run pytest tests/test_page_loads.py -v`
Expected: PASS (aucune régression sur le chargement des pages). Si `tests/test_page_loads.py` ne couvre pas `/observatoire`, lancer en complément :
Run: `uv run python -c "import src.pages.observatoire"`
Expected: aucune erreur d'import.
- [ ] **Step 4: Lancer l'ensemble de la suite figures + observatoire**
Run: `uv run pytest tests/test_figures.py -v`
Expected: tous PASS.
- [ ] **Step 5: Commit**
```bash
git add src/pages/observatoire.py
git commit -m "feat(observatoire): afficher la tuile considérations après Type d'achat
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>"
```
---
## Self-Review
**Spec coverage :**
- Définition « au moins une considération » (regex incl. `Marché réservé`) → Task 1, `CONSIDERATIONS_REGEX`, tests `basic`.
- Dédoublonnage par `uid` → Task 1, test `dedup_per_uid`.
- Dénominateur = tous les marchés filtrés → Task 1 (`total = agg.height`), tests.
- Colonne absente → 0 % → Task 1, test `missing_column` ; cas vide → test `empty`.
- Deux barres `dbc.Progress`, couleurs Safe rouge/vert, labels `XX %` + `N marchés` → Task 2.
- Insertion après « Type d'achat », dimensions par défaut `make_card` → Task 3.
- Hors périmètre (pas de tooltip, pas de filtre) → respecté, rien d'ajouté.
**Placeholder scan :** aucun TODO/TBD ; tout le code est fourni.
**Type consistency :** `compute_considerations_stats` renvoie `dict[str, tuple[int, int]]` clés `sociales`/`environnementales`, consommé tel quel par `get_considerations_card_content` (Task 2) ; `get_considerations_card_content` renvoie `html.Div`, passé à `make_card(fig=...)` (Task 3). Cohérent.
@@ -0,0 +1,64 @@
# Distance Histogram — Design Spec
**Date:** 2026-03-18
**Branch:** feature/65_observatoire
## Goal
Display the distribution of distances (in km) between buyers and winning contractors, to help users assess whether a buyer or contractor tends to deal locally or at a national scale.
## Data
- Column: `titulaire_distance` (`Int64`, km)
- Measured at address level — values are always > 0, no zero-handling needed
- Already selected in the observatoire LazyFrame via `cs.starts_with("titulaire")`
- Already available on acheteur and titulaire detail pages
## Figure Function
**Location:** `src/figures.py`
**Signature:**
```python
def get_distance_histogram(lff: pl.LazyFrame) -> dcc.Graph:
```
**Behaviour:**
- Collects `titulaire_distance` from the LazyFrame, drops nulls
- If the resulting DataFrame is empty after dropping nulls, `px.histogram` produces a blank figure without errors — no guard logic needed. The order of operations must be: drop nulls → log-transform → histogram
- Drop nulls first, then pre-log-transform the column (`pl.col("titulaire_distance").log(10)`) so bins are truly equal-width on a log scale. Use `px.histogram` with `nbins=50` on the transformed values
- Set custom X-axis tick values at powers of 10 (1, 10, 100, 1000, 10000) with km labels, using `fig.update_xaxes(tickvals=[0,1,2,3,4], ticktext=["1","10","100","1 000","10 000"])`
- Y axis: count of contracts
- French axis labels: x = `"Distance (km)"`, y = `"Nombre de marchés"`
- Returns a `dcc.Graph`
## Integration
### Observatoire (`src/pages/observatoire.py`)
- `get_distance_histogram` imported and called inside `udpate_dashboard_cards`
- Result wrapped in `make_card(title="Distance acheteurtitulaire", subtitle="en nombre de marchés, échelle logarithmique", fig=...)`
- Card appended to the `cards` list alongside existing donuts and charts
- No changes to the data pipeline — `titulaire_distance` is already in the LazyFrame
### Acheteur page (`src/pages/acheteur.py`)
The acheteur page uses a `dcc.Store` (`acheteur_data`) that holds serialised contract rows as a list of dicts. The integration follows the existing pattern used by other chart callbacks on this page:
- Add a new `html.Div(id="acheteur-distance-histogram")` placeholder in the layout
- Add a new callback with `Input("acheteur_data", "data")` that:
- Reconstructs `pl.LazyFrame(data)` from the store
- Calls `get_distance_histogram(lff)`
- Wraps the result in `make_card(...)` and returns it to the placeholder div
### Titulaire page (`src/pages/titulaire.py`)
Same pattern as acheteur: `dcc.Store` (`titulaire_data`) → new callback → `html.Div` placeholder.
## Out of Scope
- Filtering by distance range (could be a future filter on the observatoire page)
- Showing distance on a map or as a trend over time
- Bucket-based (named zone) grouping
@@ -0,0 +1,78 @@
# Observatoire Link from Search & Tableau Results
## Problem
Users searching for an organization (acheteur or titulaire) on the search page or browsing the tableau cannot jump directly to the observatoire page filtered for that organization. They must manually navigate and re-enter the identifier.
## Solution
Extend `add_links()` in `src/utils.py` to append an observatoire link (📊 emoji) to `_nom` columns, and add bidirectional URL parameter sync to the observatoire page.
## Changes
### 1. `src/utils.py` — `add_links()` modification
The existing `add_links()` loop iterates over `["uid", "acheteur_nom", "titulaire_nom", "acheteur_id", "titulaire_id"]`. The `if col.startswith("acheteur_")` and `if col.startswith("titulaire_")` blocks match both `_nom` and `_id` columns. The observatoire link must only be appended to `_nom` columns, so it must be gated on `col == "acheteur_nom"` or `col == "titulaire_nom"` explicitly.
For `acheteur_nom`, append an observatoire link after the existing detail page link:
```
Before: <a href="/acheteurs/12345678901234">Ville de Paris</a>
After: <a href="/acheteurs/12345678901234">Ville de Paris</a> <a href="/observatoire?acheteur_id=12345678901234" title="Voir dans l'observatoire">📊</a>
```
For `titulaire_nom`, same pattern but only when the existing `typeIdentifiant` guard passes (SIRET or null):
```
Before: <a href="/titulaires/12345678901234">Entreprise X</a>
After: <a href="/titulaires/12345678901234">Entreprise X</a> <a href="/observatoire?titulaire_id=12345678901234" title="Voir dans l'observatoire">📊</a>
```
The identifier used in the observatoire link (`acheteur_id` / `titulaire_id`) is the same `pl.col("acheteur_id")` / `pl.col("titulaire_id")` column value already used for the detail page link.
The `_id` and `uid` columns are unchanged.
### 2. `src/pages/observatoire.py` — URL parameter handling
#### Callback A: URL → Inputs (page load)
- Trigger: `Input("dashboard_url", "search")`
- Outputs: `Output("dashboard_acheteur_id", "value")`, `Output("dashboard_titulaire_id", "value")`, `Output("dashboard_url", "search")` (to clear it)
- `prevent_initial_call=False` (must fire on page load to read URL params)
- If `search` is empty or None: return `no_update` for all outputs
- Otherwise: parse query params with `urllib.parse.parse_qs`
- Set `dashboard_acheteur_id` from `?acheteur_id=` param, or `no_update` if absent
- Set `dashboard_titulaire_id` from `?titulaire_id=` param, or `no_update` if absent
- Return `""` for `dashboard_url.search` to clear the URL and prevent re-triggering
- No validation of param values — consistent with existing input handling in the observatoire callbacks
#### Callback B: Inputs → shareable URL
- Trigger: `Input("dashboard_acheteur_id", "value")`, `Input("dashboard_titulaire_id", "value")`
- State: `State("dashboard_url", "href")` for base URL
- `prevent_initial_call=True` (avoid generating URL on initial empty state)
- Build query string with `urllib.parse.urlencode`, omitting empty values
- Write full URL to a new `share-url` input component
- Render a `dcc.Clipboard` + share button (same pattern as tableau.py)
#### Callback chain
When navigating from search with `?acheteur_id=123`: Callback A fires on page load, sets input values, clears URL search. The input value changes then trigger both the existing `udpate_dashboard_cards` callback and Callback B. Dash handles this chaining deterministically — no race condition.
#### Layout additions
- A `dcc.Input(id="share-url", ...)` (hidden or read-only) to hold the shareable URL
- A `dcc.Clipboard` share/copy button near the filters
### 3. Reuse of existing `dcc.Location`
The existing `dcc.Location(id="dashboard_url")` component is reused — no new Location component needed.
## Future extension
The bidirectional URL sync pattern is designed to extend to all observatoire filters (year, categories, departments, market type, etc.) by adding more params to both callbacks.
## Files touched
- `src/utils.py` — modify `add_links()`
- `src/pages/observatoire.py` — add 2 callbacks, add share-url + clipboard to layout
@@ -0,0 +1,121 @@
# Observatoire: Full URL Sharing for All Filters
## Problem
The "Partager" button on `/observatoire` currently only encodes `acheteur_id` and `titulaire_id` in the shareable URL. The other 15 filter parameters are lost, so a shared link does not reproduce the sender's filtered view.
## Goal
Extend URL sharing so that **all 17 filter parameters** are encoded in the URL and restored when a recipient opens it. The recipient sees exactly what the sender intended — URL params replace all local filter state.
## Approach
Flat query parameters with short, readable keys. Multi-value filters use repeated keys (native to `urllib.parse`). Only non-default values appear in the URL.
## URL Parameter Mapping
| Component ID | URL key | Type | Default (omitted) |
| -------------------------------------------------- | ---------------- | --------------- | ----------------- |
| `dashboard_year` | `annee` | single | `None` |
| `dashboard_acheteur_id` | `acheteur_id` | single | `None` |
| `dashboard_acheteur_categorie` | `acheteur_cat` | single | `None` |
| `dashboard_acheteur_departement_code` | `acheteur_dept` | multi | `[]`/`None` |
| `dashboard_titulaire_id` | `titulaire_id` | single | `None` |
| `dashboard_titulaire_categorie` | `titulaire_cat` | single | `None` |
| `dashboard_titulaire_departement_code` | `titulaire_dept` | multi | `[]`/`None` |
| `dashboard_marche_type` | `type` | single | `None` |
| `dashboard_marche_objet` | `objet` | single | `None` |
| `dashboard_marche_code_cpv` | `cpv` | single | `None` |
| `dashboard_montant_min` | `montant_min` | single (number) | `None` |
| `dashboard_montant_max` | `montant_max` | single (number) | `None` |
| `dashboard_marche_techniques` | `techniques` | multi | `[]`/`None` |
| `dashboard_marche_innovant` | `innovant` | single | `"all"` |
| `dashboard_marche_sousTraitanceDeclaree` | `sous_traitance` | single | `"all"` |
| `dashboard_marche_considerationsSociales` | `social` | multi | `[]`/`None` |
| `dashboard_marche_considerationsEnvironnementales` | `env` | multi | `[]`/`None` |
Example URL:
```
/observatoire?annee=2024&acheteur_id=12345678901234&acheteur_dept=75&acheteur_dept=13&montant_min=10000&innovant=oui
```
## Data Structure
A list of tuples defines the mapping, used by both callbacks to avoid scattered string literals:
```python
FILTER_PARAMS = [
# (component_id, url_key, is_multi, default_value)
("dashboard_year", "annee", False, None),
("dashboard_acheteur_id", "acheteur_id", False, None),
("dashboard_acheteur_categorie", "acheteur_cat", False, None),
("dashboard_acheteur_departement_code", "acheteur_dept", True, None),
("dashboard_titulaire_id", "titulaire_id", False, None),
("dashboard_titulaire_categorie", "titulaire_cat", False, None),
("dashboard_titulaire_departement_code", "titulaire_dept", True, None),
("dashboard_marche_type", "type", False, None),
("dashboard_marche_objet", "objet", False, None),
("dashboard_marche_code_cpv", "cpv", False, None),
("dashboard_montant_min", "montant_min", False, None),
("dashboard_montant_max", "montant_max", False, None),
("dashboard_marche_techniques", "techniques", True, None),
("dashboard_marche_innovant", "innovant", False, "all"),
("dashboard_marche_sousTraitanceDeclaree", "sous_traitance", False, "all"),
("dashboard_marche_considerationsSociales", "social", True, None),
("dashboard_marche_considerationsEnvironnementales", "env", True, None),
]
```
## Callback Changes
### 1. `sync_observatoire_share_url` (line 575)
**Current:** Takes `acheteur_id` and `titulaire_id` as Inputs.
**New:** Takes all 17 filter values as Inputs (same as `udpate_dashboard_cards`). Builds the URL using `FILTER_PARAMS`, skipping default values. Uses `urllib.parse.urlencode(params, doseq=True)` for multi-value params.
### 2. `restore_filters` (line 539)
**Current:** Extracts only `acheteur_id` and `titulaire_id` from URL.
**New:**
- Iterates over `FILTER_PARAMS` to extract all values from `parse_qs`
- For multi-value params: reads the full list from `parse_qs` (returns lists natively)
- For number params (`montant_min`, `montant_max`): casts to `float`
- The guard condition changes from `if acheteur_id or titulaire_id` to "if any URL param is present" — this is necessary so URLs like `?annee=2024&montant_min=10000` (without an ID) work correctly
- When **any** URL param is present: returns explicit values for all 17 outputs — the URL value for params present, `None`/default for params absent. This ensures "URL replaces all" semantics.
- When **no** URL params are present: returns `(no_update,) * 17` (preserving local persistence)
- Radio buttons (`innovant`, `sous_traitance`): value from URL if present, otherwise `"all"` (their default)
### 3. Layout bug fix
Remove the duplicate `dcc.Input(id="observatoire-share-url")` (lines 413-422 — two identical elements).
## Backward Compatibility
Old URLs with only `?acheteur_id=...` or `?titulaire_id=...` continue to work — the new `restore_filters` will read those keys and reset all others to defaults, which is the same effective behavior as before.
Links generated by `add_links()` in `src/utils.py` (used on search results to link to `/observatoire?acheteur_id=...`) are unaffected.
## Test Changes
### Fix broken test `test_010_observatoire_montant_filter`
This test imports `_apply_filters` from `pages.observatoire`, which no longer exists (replaced by `prepare_dashboard_data` in `src/utils.py`). Fix:
- Replace import with `from src.utils import prepare_dashboard_data`
- Update the call to match `prepare_dashboard_data`'s signature: rename `marche_type` keyword to `type`, and add missing params `objet`, `code_cpv`, `techniques`, `marche_innovant`, `sous_traitance_declaree` (all as `None`)
### New test: multi-param URL round-trip
Add a test that navigates to `/observatoire?annee=2024&acheteur_id=<test_id>&montant_min=10000` and verifies that:
- `dashboard_year` dropdown shows "2024"
- `dashboard_acheteur_id` input contains the test ID
- `dashboard_montant_min` input contains "10000"
### Update existing tests
Tests `test_006` and `test_007` validate `acheteur_id` round-trip. These should continue to pass without changes since `acheteur_id` keeps the same URL key.
@@ -0,0 +1,196 @@
# DuckDB migration — design spec
**Date:** 2026-04-15
**Branch:** dev
**Status:** Approved, ready for planning
## Goal
Replace the global Polars dataframes that `src/utils.py` materializes at import time (`df` and the five derived frames, lines 891913) with a DuckDB database on disk. The main table holds ~1.5M rows from `decp_prod.parquet`. Per-request queries pull only what each page needs, dramatically reducing steady-state RSS memory.
Polars stays the primary API for small result sets and post-processing. DuckDB carries the heavy filtering, joining, and aggregation.
## Approach summary
- **Approach A — compatibility layer.** A new `src/db.py` module exposes a `query_marches(where_sql, params, columns, ...)` helper that runs SQL and returns a `pl.DataFrame`. Most existing `df.filter(pl.col(...) == x)` call sites translate mechanically to `query_marches("col = ?", (x,))`. The shape of downstream Polars code is unchanged.
- **Two small helpers stay in memory.** `df_acheteurs` and `df_titulaires` (tens of thousands of rows, consumed by the autocomplete search on every keystroke) are kept as module-level Polars frames. They are populated from DuckDB at import time, not from Parquet.
- **Four derived tables live in DuckDB**, built at startup alongside the main table: `acheteurs_marches`, `titulaires_marches`, `acheteurs_departement`, `titulaires_departement`.
- **Connection model.** One read-only `duckdb.connect(..., read_only=True)` at module load, shared across the process. `conn.cursor()` per Dash callback for thread-safety. The read-write connection is short-lived and only used during the startup build phase.
## Cache invalidation rule
At startup, rebuild the DuckDB file if:
1. **The DB file does not exist**, OR
2. **`decp_prod.parquet.mtime > duckdb.mtime`**, **unless** `DEVELOPMENT=true` and `REBUILD_DUCKDB != true` — in which case the DB stays as-is (fast dev reloads).
Production auto-rebuilds when the source Parquet is newer. Development keeps a stable DB across reloads unless the developer explicitly sets `REBUILD_DUCKDB=true` to force a rebuild.
## Concurrency
Multi-worker Gunicorn startup and crashed-mid-build scenarios are handled by a file lock, not by polling for the tmp file's existence:
```python
with open(DB_PATH.with_suffix(".duckdb.lock"), "w") as lock_fd:
fcntl.flock(lock_fd, fcntl.LOCK_EX) # blocks if another worker is building
if should_rebuild(DB_PATH, PARQUET_PATH):
build_database(DB_PATH, PARQUET_PATH)
conn = duckdb.connect(str(DB_PATH), read_only=True)
```
- Worker A acquires the lock, builds, atomically renames tmp → final, releases the lock.
- Worker B blocks on `flock`, then re-checks `should_rebuild`, sees the fresh DB, skips building.
- `fcntl.flock` is auto-released on process death, so a crash never deadlocks the next worker.
- `build_database` unlinks any pre-existing tmp file before starting (safe because it holds the lock) — handles an abandoned tmp from a crashed previous build.
## Build logic
The build keeps **one source of truth** for transforms by reusing the existing Polars pipeline:
```python
def build_database(db_path, parquet_path):
tmp_path = db_path.with_suffix(".duckdb.tmp")
if tmp_path.exists():
tmp_path.unlink()
frame = get_decp_data() # existing function in utils.py
with duckdb.connect(str(tmp_path)) as w:
w.register("frame", frame)
w.execute("CREATE TABLE decp AS SELECT * FROM frame")
w.execute("CREATE TABLE acheteurs_marches AS "
"SELECT DISTINCT uid, objet, acheteur_id FROM decp "
"ORDER BY acheteur_id")
w.execute("CREATE TABLE titulaires_marches AS "
"SELECT DISTINCT uid, objet, titulaire_id FROM decp "
"ORDER BY titulaire_id")
w.execute("CREATE TABLE acheteurs_departement AS "
"SELECT DISTINCT acheteur_id, acheteur_nom, acheteur_departement_code "
"FROM decp ORDER BY acheteur_nom")
w.execute("CREATE TABLE titulaires_departement AS "
"SELECT DISTINCT titulaire_id, titulaire_nom, titulaire_departement_code "
"FROM decp ORDER BY titulaire_nom")
os.replace(tmp_path, db_path)
```
Why Polars, not SQL, for the row-level transforms:
- `booleans_to_strings` is not a simple cast — it replaces `true`/`false` with `"oui"`/`"non"` on every boolean column. Reimplementing in SQL risks drifting from the Polars version.
- The null-name replacement (`acheteur_nom`, `titulaire_nom``"[Identifiant non reconnu dans la base INSEE]"`) is also easier to keep identical in Polars.
- `w.register("frame", frame)` is zero-copy. The memory spike is one-time during build and released when the write connection closes.
`os.replace` is atomic on POSIX — the read-only connection that opens next always sees a complete DB.
## Module layout
### New: `src/db.py`
```python
conn: duckdb.DuckDBPyConnection # read-only, module-level
schema: pl.Schema # from conn.execute("SELECT * FROM decp LIMIT 0").pl().schema
def get_cursor() -> duckdb.DuckDBPyConnection: ...
def query_marches(where_sql: str = "TRUE",
params: tuple = (),
columns: list[str] | None = None,
order_by: str | None = None,
limit: int | None = None) -> pl.DataFrame: ...
def should_rebuild(db_path: Path, parquet_path: Path) -> bool: ...
def build_database(db_path: Path, parquet_path: Path) -> None: ...
```
Only imports: `polars`, `duckdb`, `os`, `fcntl`, `pathlib`, `logging`. No app modules — prevents circular imports.
### Changes to `src/utils.py`
- `df: pl.DataFrame = get_decp_data()`**removed** (after migration).
- `df_acheteurs`, `df_titulaires`**kept as Polars globals**, populated via DuckDB at import time. The query mirrors today's `get_org_data(df, org_type)`: select all columns whose name starts with `acheteur_` (or `titulaire_`) except the `_latitude` / `_longitude` pair, plus `COUNT(*) AS "Marchés"`, grouped by the same set. Implementation can either:
- enumerate the columns by filtering `schema.names()` at import time and build the `SELECT` / `GROUP BY` strings, or
- call `get_org_data()` once against a small Polars frame returned by `SELECT <org_ cols> FROM decp`.
Feeds `search_org` unchanged.
- `df_acheteurs_marches`, `df_titulaires_marches`, `df_acheteurs_departement`, `df_titulaires_departement`**removed** as Python globals. Call sites query the corresponding DuckDB tables.
- `schema` — imported from `src/db.py` (stays a `pl.Schema` — so `schema.names()` and dtype lookups both work, no call-site changes beyond `acheteur.py:303`).
- `columns` — replaced with `schema.names()`.
- `get_decp_data()`**kept** (used by `build_database`).
- `get_org_data()` — can be removed once `df_acheteurs` / `df_titulaires` are populated from DuckDB directly.
### Call-site translations
| Before (Polars global) | After |
| ------------------------------------------------------------ | --------------------------------------------------------------------------------- |
| `df.filter(pl.col("acheteur_id") == aid)` | `query_marches("acheteur_id = ?", (aid,))` |
| `df.filter(pl.col("uid") == uid).row(0, named=True)` | `query_marches("uid = ?", (uid,)).row(0, named=True)` |
| `df.select("uid","objet","acheteur_id").filter(...)` | `query_marches("...", (...), columns=["uid","objet","acheteur_id"])` |
| `df.columns` | `schema.names()` |
| `df_acheteurs_marches.filter(...)` | `get_cursor().execute("SELECT ... FROM acheteurs_marches WHERE ...", [...]).pl()` |
| `pl.DataFrame(schema=df.collect_schema())` (acheteur.py:303) | `pl.DataFrame(schema=schema)` |
Heavy dashboard aggregations (observatoire, tableau full-scan) use raw SQL via `get_cursor().execute(...).pl()` rather than the helper.
## Configuration
- **`DATA_FILE_PARQUET_PATH`** — unchanged.
- **DuckDB file location** — computed: `Path(DATA_FILE_PARQUET_PATH).parent / "decp.duckdb"`. No new env var.
- **`REBUILD_DUCKDB`** — new, optional, default `false`. In development, setting this to `true` forces a rebuild when the parquet is newer.
- **`DEVELOPMENT`** — unchanged; now also gates the auto-rebuild behavior per the rule above.
## Testing
- `tests/conftest.py` (or a startup hook in `src/db.py`) ensures the test run builds the DuckDB in a temp directory derived from the parquet path — `tests/test.parquet``tests/decp.duckdb`. This file is added to `.gitignore`.
- Tests already set `DEVELOPMENT=true`; they must also set `REBUILD_DUCKDB=true` on cold test runs to force a fresh build from the test parquet.
- The existing Selenium suite exercises every page and is the primary acceptance signal.
## Migration order
Incremental — `df` global coexists with `src/db.py` until every page is migrated.
1. **Add `src/db.py`** (build, lock, `query_marches`, `schema`). `df` global unchanged.
2. **Migrate `marche.py`** — single-row lookup by `uid`, one call site.
3. **Migrate `acheteur.py`, `titulaire.py`** — filter by id.
4. **Migrate `arbre/departement.py`, `arbre/liste_marches_org.py`** — use the new derived DuckDB tables.
5. **Migrate `tableau.py`** — may need raw SQL.
6. **Migrate `observatoire.py`** — heaviest aggregations, most likely raw SQL.
7. **Migrate `figures.py`** — uses `df` in chart generation.
8. **Remove** `df`, `df_*_marches`, `df_*_departement` globals, `get_org_data()`, and the `df = get_decp_data()` call from `utils.py`. Move `schema` / `columns` exports to `src/db.py`.
### Verification gates
- `uv run pytest` green after every page migration.
- Manual smoke test via `uv run run.py` of the migrated page before proceeding.
- RSS memory measurement (`ps -o rss`) of a cold `gunicorn app:server` with the prod parquet, before and after, to confirm the memory reduction.
## Out of scope
- Changes to `src/cache.py` (flask-caching stays).
- The in-progress observatoire-localstorage-filters work on `dev`.
- Schema changes to the parquet.
- SQL views beyond the four derived tables.
- Multi-database or replication setups.
## Risks and mitigations
| Risk | Mitigation |
| ----------------------------------------------------------------------------- | -------------------------------------------------------------------------------------------------------------------------------- |
| `booleans_to_strings` reimplemented in SQL and drifts from Polars version | Transforms stay in Polars via `w.register("frame", frame)`. One source of truth. |
| Two Gunicorn workers rebuild concurrently | `fcntl.flock` serializes the build; second worker re-checks and skips. |
| Crashed build leaves stale `.tmp` file | Build unlinks any pre-existing tmp before starting (safe under lock). |
| `schema` shape change breaks `acheteur.py:303` | `schema` stays a `pl.Schema` object, not a list. One call site (`collect_schema()` → module `schema`) updated. |
| Test runs inherit a stale DuckDB from a previous run with a different parquet | Tests force `REBUILD_DUCKDB=true` on cold runs; test DB added to `.gitignore`. |
| Read-only connection opened before build finishes in another worker | Lock held across build + rename; read-only `connect` happens after lock release. Atomic `os.replace` guarantees a complete file. |
## Outcome
### Memory impact
Memory measurement against the production parquet (`decp_prod.parquet`, ~1.5M rows) requires a running gunicorn process with access to the production data file. The measurement was deferred to the post-merge smoke test on the staging server (test.decp.info).
**Expected reduction:** The removed globals (`df`, `df_acheteurs_departement`, `df_titulaires_departement`, `df_acheteurs_marches`, `df_titulaires_marches`) previously materialised the full 1.5M-row Parquet in memory as multiple Polars frames. At ~300 bytes/row × 5 frames, steady-state RSS reduction is estimated at **12 GB per worker**. The retained `df_acheteurs` and `df_titulaires` (autocomplete search) represent only the distinct-organisation subset (~tens of thousands of rows) and are negligible.
**What remains in memory:**
- `df_acheteurs` — distinct acheteurs with Marchés count (populated from DuckDB at startup)
- `df_titulaires` — same for titulaires
- DuckDB's own page cache (disk-backed, grows under load, evicted by OS)
All per-request data is fetched from DuckDB and discarded after the callback returns.
@@ -0,0 +1,206 @@
# Observatoire — filtrage natif DuckDB
## Contexte
La page `/observatoire` construit ses cartes, ses téléchargements et sa prévisualisation
tabulaire à partir de la fonction `prepare_dashboard_data` (dans `src/utils/data.py`).
Aujourd'hui, cette fonction prend une `pl.LazyFrame` — typiquement obtenue par
`query_marches().lazy()` — et applique une série de filtres côté Polars.
`query_marches()` matérialise l'intégralité de la table `decp` (~1,5 M lignes) en
DataFrame Polars, même lorsqu'un utilisateur applique des filtres restrictifs. Les
filtres sont ensuite appliqués sur cet ensemble déjà matérialisé.
Le pattern utilisé par `_fetch_page_sql` (dans `src/utils/table.py`) montre comment
déléguer le filtrage à DuckDB :
1. Un traducteur (`filter_query_to_sql`, dans `src/utils/table_sql.py`) transforme le
DSL utilisateur en `(where_sql, params)`.
2. `query_marches(where_sql=..., params=...)` ne matérialise que le sous-ensemble utile.
Ce spec décrit comment appliquer ce même pattern aux filtres de l'observatoire.
## Objectifs
- Réduire la consommation mémoire et le temps de chaque callback de l'observatoire
en poussant le filtrage au niveau DuckDB.
- Conserver strictement la sémantique des filtres actuels (pas de régression
fonctionnelle).
- Garder une frontière claire : un helper pur `dashboard_filters_to_sql` qui ne
touche pas à la base, et une `prepare_dashboard_data` fine qui appelle DuckDB.
## Non-objectifs
- Pas de refonte de l'UI de filtres.
- Pas d'optimisation ou de cache supplémentaire autour de
`_compute_dashboard_children` (déjà `@cache.memoize()`).
- Pas de changement du comportement par défaut (365 derniers jours quand aucune
année n'est sélectionnée).
## Architecture
### Nouveau helper — `src/utils/table_sql.py`
```python
def dashboard_filters_to_sql(
dashboard_year=None,
dashboard_acheteur_id=None,
dashboard_acheteur_categorie=None,
dashboard_acheteur_departement_code=None,
dashboard_titulaire_id=None,
dashboard_titulaire_categorie=None,
dashboard_titulaire_departement_code=None,
dashboard_marche_type=None,
dashboard_marche_objet=None,
dashboard_marche_code_cpv=None,
dashboard_marche_considerations_sociales=None,
dashboard_marche_considerations_environnementales=None,
dashboard_marche_techniques=None,
dashboard_marche_innovant=None,
dashboard_marche_sous_traitance_declaree=None,
dashboard_montant_min=None,
dashboard_montant_max=None,
) -> tuple[str, list]:
"""Traduit les filtres du tableau de bord en (where_clause, params) DuckDB."""
```
Fonction pure, sans accès à la base. Même signature que `prepare_dashboard_data`
actuelle (hors `lff`). Retourne `("TRUE", [])` si aucun filtre n'est actif.
### Réécriture — `prepare_dashboard_data` (`src/utils/data.py`)
```python
def prepare_dashboard_data(**filter_params) -> pl.DataFrame:
where_sql, params = dashboard_filters_to_sql(**filter_params)
return query_marches(where_sql=where_sql, params=params)
```
- **Signature** : suppression du paramètre `lff`. Retour `pl.DataFrame` (et non plus
`pl.LazyFrame`).
- Les appelants qui ont besoin d'une LazyFrame appellent `.lazy()` sur le résultat.
### Appelants — `src/pages/observatoire.py`
Trois sites d'appel à adapter :
1. **`_compute_dashboard_children`** (ligne ~668) — on remplace
```python
lff: pl.LazyFrame = query_marches().lazy()
lff = prepare_dashboard_data(lff=lff, **filter_params)
dff = lff.collect(engine="streaming")
```
par
```python
dff = prepare_dashboard_data(**filter_params)
lff = dff.lazy()
```
Les appels existants à `make_donut`, `get_distance_histogram`, `get_top_org_table`,
`get_barchart_sources` continuent de recevoir `lff` ; `get_geographic_maps`
continue de recevoir `dff`. `df_per_uid` est calculé à partir de `dff`.
2. **`download_observatoire`** (ligne ~791) —
```python
dff = prepare_dashboard_data(**(filter_params or {}))
if hidden_columns:
dff = dff.drop(hidden_columns)
def to_bytes(buffer):
dff.write_excel(buffer, worksheet="DECP")
```
3. **`populate_preview_table`** (ligne ~882) —
```python
dff = prepare_dashboard_data(**(filter_params or {}))
return prepare_table_data(
dff.lazy(), # prepare_table_data accepte une LazyFrame
...
)
```
## Traduction des filtres
| Filtre | Actuel (Polars) | Cible (SQL DuckDB) |
| --------------------------------------------------------- | ---------------------------------------------------------- | -------------------------------------------------------------- |
| `dashboard_year` (présent) | `dt.year() == int(year)` | `YEAR("dateNotification") = ?` |
| `dashboard_year` (absent) — comportement par défaut | `> now - 365j` | `"dateNotification" > ?` (datetime calculé à l'appel) |
| `dashboard_acheteur_id` | `str.contains(val)` | `"acheteur_id" LIKE ?` avec `%val%` |
| `dashboard_acheteur_categorie` | `== val` (skip si acheteur_id présent) | `"acheteur_categorie" = ?` |
| `dashboard_acheteur_departement_code` | `is_in(list)` (skip si acheteur_id présent) | `"acheteur_departement_code" IN (?, ?, ...)` |
| `dashboard_titulaire_id` | idem acheteur | idem |
| `dashboard_titulaire_categorie` | idem | idem |
| `dashboard_titulaire_departement_code` | idem | idem |
| `dashboard_marche_type` | `== val` | `"type" = ?` |
| `dashboard_marche_objet` | `str.contains("(?i)val")` | `"objet" ILIKE ?` avec `%val%` |
| `dashboard_marche_code_cpv` | `str.starts_with(val)` | `"codeCPV" LIKE ?` avec `val%` |
| `dashboard_marche_techniques` | `str.split(", ").list.set_intersection(xs).list.len() > 0` | `list_has_any(string_split("techniques", ', '), ?::VARCHAR[])` |
| `dashboard_marche_considerations_sociales` | idem | idem sur `"considerationsSociales"` |
| `dashboard_marche_considerations_environnementales` | idem | idem sur `"considerationsEnvironnementales"` |
| `dashboard_marche_innovant` (`"oui"`/`"non"`, sinon skip) | `== val` | `"marcheInnovant" = ?` |
| `dashboard_marche_sous_traitance_declaree` | idem | `"sousTraitanceDeclaree" = ?` |
| `dashboard_montant_min` | `>= val` | `"montant" >= ?` |
| `dashboard_montant_max` | `<= val` | `"montant" <= ?` |
**Logique conditionnelle conservée** : si `dashboard_acheteur_id` est fourni, les filtres
`categorie` et `departement_code` acheteur sont ignorés (même chose pour titulaire).
**Traitement des valeurs spéciales** :
- `dashboard_marche_innovant` / `dashboard_marche_sous_traitance_declaree` : valeur
`"all"` ou falsy → aucun filtre ajouté.
- `dashboard_year` : converti en `int` avant injection.
- `dashboard_montant_min` / `_max` : `None` → aucun filtre (distinct de `0`, qui reste
un filtre valide via `>=` ou `<=`).
**Sécurité SQL** : toutes les valeurs utilisateurs passent par DuckDB en paramètres liés
(`?`). Seuls des noms de colonnes statiques (contrôlés par le code) sont injectés dans le
fragment SQL via `f"..."`. Pas de différence avec le pattern existant de
`filter_query_to_sql`.
## Tests
### Unitaires (nouveaux)
Nouveau fichier `tests/test_dashboard_filters_to_sql.py` :
- Cas vide → `("TRUE", [])`.
- Un seul filtre simple (année, type, etc.) → fragment SQL et params attendus.
- Filtre montant min/max (migration de l'actuel `test_010_observatoire_montant_filter`).
- Filtre liste (techniques, considerationsSociales) → usage de `list_has_any`.
- Filtre acheteur_id fourni → catégorie/département acheteur ignorés.
- Filtre `"all"` / `None` sur innovant/sous_traitance → aucun fragment ajouté.
- Comportement par défaut sans année → fragment `"dateNotification" > ?` avec un param
datetime à ~365 j dans le passé (tolérance de quelques secondes).
### Intégration (nouveau, léger)
Un test qui appelle `prepare_dashboard_data` contre `tests/test.parquet` avec un ou
deux filtres connus, vérifie le `height` et la bonne nature du retour (`pl.DataFrame`).
### Test Selenium existant
`test_009_observatoire_filter_persistence` et `test_008_observatoire_navigation_from_search`
ne touchent pas à la signature ; ils doivent continuer à passer.
## Risques et migration
- **Risque sémantique** : la fonction Polars `str.contains` utilisée pour les IDs est
un regex. Les utilisateurs attendent probablement un contains littéral sur un SIRET
(14 chiffres). Le passage à `LIKE '%val%'` est neutre si la valeur ne contient pas de
caractère spécial regex — ce qui est le cas pour des SIRET. **Hypothèse** acceptée :
le contenu `dashboard_acheteur_id`/`dashboard_titulaire_id` est alphanumérique.
- **Risque de drift du cache** : la date "365 derniers jours" n'est pas incluse dans
la clé de cache de `_compute_dashboard_children`. C'est un comportement pré-existant
; non traité par ce spec.
- **Import circulaire** : `src/utils/data.py` importe déjà depuis `src/db.py`.
`src/utils/table_sql.py` importe depuis `src/utils/table.py`. Pas de nouveau cycle.
## Succès
- Les 3 callbacks de l'observatoire restent fonctionnellement équivalents.
- Les tests unitaires et d'intégration passent.
- Une inspection manuelle confirme un temps d'exécution réduit sur un filtre
sélectif (par ex. un département + une année).
@@ -0,0 +1,428 @@
# API privée decp.info — Design
**Date** : 2026-05-13
**Statut** : design validé, en attente du plan d'implémentation
## 1. Contexte et objectifs
decp.info reçoit des demandes récurrentes pour un accès programmatique aux
données DECP exposées par l'application web. Le besoin est d'ouvrir une API
HTTP **privée** (accès sur token), inspirée de l'API tabulaire de data.gouv.fr
(https://tabular-api.data.gouv.fr/api/resources/22847056-61df-452d-837d-8b8ceadbfc52/swagger/),
qu'un utilisateur en cours s'est déjà appropriée comme référence.
Objectifs explicites :
- Réponses rapides.
- API documentée (OpenAPI + Swagger UI).
- Suivi de la consommation par utilisateur.
Non-objectifs (V1) :
- Self-service de création de tokens via UI web.
- Rate-limiting / quotas.
- Formats de sortie autres que JSON (CSV, Parquet…).
- Endpoints sémantiques métier (`/acheteurs/{id}`, etc.).
## 2. Choix structurants
### 2.1 Framework : Flask + flask-smorest
L'API est ajoutée à l'application Flask existante (serveur Dash) sous forme
d'un blueprint flask-smorest monté sur `/api/v1`. Choix motivé par :
- L'app Dash actuelle tourne déjà sur Flask via gunicorn.
- DuckDB est ouvert une seule fois au boot dans `src/db.py` (`conn` read-only)
et peut être partagé directement par les endpoints API.
- L'API est tabulaire avec filtres **dynamiques** : la liste des colonnes et
des types vient du schéma DuckDB, pas d'une déclaration Pydantic. Les
bénéfices de FastAPI (auto-validation Pydantic) sont donc faibles.
- flask-smorest génère OpenAPI + sert Swagger UI nativement.
- Un seul process, un seul serveur, un seul déploiement.
Alternatives écartées :
- **FastAPI séparé reverse-proxié** : deux processus, ops plus complexe,
bénéfice marginal vu les filtres dynamiques.
- **FastAPI englobant Flask via WSGIMiddleware** : changerait le serveur de
toute l'app Dash existante, migration risquée.
### 2.2 Style d'API : tabulaire générique
Un endpoint unique de requête (`/api/v1/data`) avec filtres dynamiques sur
toutes les colonnes du schéma, à l'image du swagger cible. Aucun endpoint
sémantique métier en V1.
### 2.3 Authentification : tokens admin manuels
Tokens Bearer émis manuellement par l'admin via un CLI. Pas de page web de
gestion en V1. Modèle prévu pour se lier ultérieurement aux comptes
utilisateurs (cf. `comptes_utilisateurs.md`) sans migration de données.
### 2.4 Suivi de consommation : Matomo asynchrone + compteurs locaux
- Matomo en fire-and-forget pour l'analyse fine (qui, quand, quoi, code HTTP).
- Compteurs locaux SQLite (`count_total`, `last_used_at`) pour identifier
les tokens inactifs et préparer un éventuel rate-limit futur.
## 3. Architecture
### 3.1 Arborescence
```
src/api/
├── __init__.py # init_api(server) — enregistre le blueprint flask-smorest
├── routes.py # endpoints /data, /schema, /health
├── schemas.py # marshmallow : query params, réponses
├── filters.py # parsing & validation `col__op=val` → (where_sql, params)
├── auth.py # décorateur @require_token, header Authorization Bearer
├── tracking.py # worker thread compteurs SQLite + httpx fire-and-forget Matomo
├── tokens_db.py # CRUD api_tokens dans users.sqlite
└── tokens_cli.py # python -m src.api.tokens_cli create|list|revoke
```
`src/auth/` reste réservé aux comptes utilisateurs interactifs
(`comptes_utilisateurs.md`), distincts des tokens API.
### 3.2 Branchement
Dans `src/app.py`, après l'init Dash :
```python
from src.api import init_api
init_api(app.server)
```
`init_api` enregistre le blueprint sur `/api/v1` et expose :
- `/api/v1/data`
- `/api/v1/schema`
- `/api/v1/health`
- `/api/v1/swagger` (UI)
- `/api/v1/openapi.json`
### 3.3 Partage de la connexion DuckDB
Les routes importent `src.db.conn` et utilisent les helpers existants
(`query_marches`, `count_marches`) ainsi que `src.db.schema` (Polars Schema)
pour la whitelist de colonnes.
## 4. Stockage
### 4.1 SQLite consolidée
Une seule base SQLite, `users.sqlite` à la racine, contient :
- `users` (futur — cf. `comptes_utilisateurs.md`)
- `api_tokens` (V1)
Bénéfice : un seul fichier à sauvegarder et migrer ; la liaison future
`api_tokens.user_id → users.id` est immédiate sans migration de données.
### 4.2 Schéma `api_tokens`
```sql
CREATE TABLE api_tokens (
id INTEGER PRIMARY KEY,
token_hash TEXT NOT NULL UNIQUE,
label TEXT NOT NULL,
user_id INTEGER,
created_at TEXT NOT NULL,
last_used_at TEXT,
count_total INTEGER NOT NULL DEFAULT 0,
revoked_at TEXT
);
CREATE INDEX idx_api_tokens_hash ON api_tokens(token_hash);
```
`user_id` est `NULL` pour les tokens admin manuels. Quand le self-service
arrivera, il suffira de le renseigner.
## 5. Endpoints
### 5.1 Vue d'ensemble
| Méthode | Path | Auth | Rôle |
| ------- | ---------------------- | ------ | ------------------------------------------- |
| GET | `/api/v1/data` | Bearer | Endpoint tabulaire principal |
| GET | `/api/v1/schema` | Bearer | Liste des colonnes (nom, type, description) |
| GET | `/api/v1/health` | Aucune | Sonde monitoring |
| GET | `/api/v1/swagger` | Aucune | Swagger UI |
| GET | `/api/v1/openapi.json` | Aucune | Spec OpenAPI |
### 5.2 `/api/v1/data` — langage de requête
Filtres en query string, opérateurs suffixés par `__` (mirror swagger cible) :
| Opérateur | Sens |
| -------------------- | ----------------------------------------------------- |
| `__exact` | égalité |
| `__contains` | sous-chaîne (LIKE %v%) |
| `__notcontains` | négation de `__contains` |
| `__less` | ≤ |
| `__greater` | ≥ |
| `__strictly_less` | < |
| `__strictly_greater` | > |
| `__in` | liste séparée par virgules |
| `__notin` | négation de `__in` |
| `__isnull` | `IS NULL` (valeur ignorée) |
| `__isnotnull` | `IS NOT NULL` (valeur ignorée) |
| `__sort` | `asc` ou `desc` — ordre = ordre des params dans l'URL |
Autres paramètres réservés :
- `page` (int, défaut 1, ≥1)
- `page_size` (int, défaut 50, max 1000)
- `columns` (string, liste séparée par virgules ; défaut = toutes)
- `count` (bool, défaut `true` ; `false``meta.total` absent, économise un `COUNT(*)`)
Exemple :
```
GET /api/v1/data?acheteur_departement_code__exact=44
&dateNotification__greater=2024-01-01
&montant__strictly_greater=100000
&objet__contains=informatique
&cpv_8__in=72000000,72200000
&dateNotification__sort=desc
&page=1
&page_size=50
&columns=uid,objet,montant,dateNotification
```
### 5.3 Sécurité du parsing
`filters.py` est l'unique chemin de génération du `WHERE` SQL :
1. Chaque clé `<col>__<op>` est splittée puis validée :
- `<col>` doit être dans `src.db.schema` (whitelist stricte).
- `<op>` doit être dans la liste blanche d'opérateurs.
- La valeur est convertie selon le type Polars de la colonne :
- `String` : utilisée telle quelle.
- `Int*` : `int(value)`, 400 si non parseable.
- `Float*` : `float(value)`, 400 si non parseable.
- `Date` / `Datetime` : ISO 8601 (`YYYY-MM-DD` ou `YYYY-MM-DDTHH:MM:SS`), 400 sinon.
- Booléens : **les colonnes booléennes sont stockées comme strings
"oui"/"non" en DuckDB** (cf. `src/db.py:43`), donc traitées comme
`String`. L'utilisateur filtre avec `colonne__exact=oui`.
2. Le `WHERE` est composé de fragments paramétrés (`?`) ; les valeurs
utilisateur sont passées au moteur DuckDB via les paramètres, **jamais
concaténées** dans le SQL.
3. Le résultat est consommé par `src.db.query_marches(where_sql=..., params=...)`
qui existe déjà.
### 5.4 Format de réponse
```json
{
"data": [{ "uid": "...", "objet": "...", "montant": 12345.0 }],
"meta": { "page": 1, "page_size": 50, "total": 1234 },
"links": {
"next": "/api/v1/data?...&page=2",
"prev": null
}
}
```
`meta.total` est omis si `count=false`. `links.next`/`links.prev` sont
`null` aux extrémités.
### 5.5 `/api/v1/schema`
```json
{
"columns": [
{ "name": "uid", "type": "string", "description": "..." },
{ "name": "montant", "type": "float", "description": "..." }
]
}
```
Descriptions tirées de `../decp-processing/reference/base_schema.json` si
disponible ; sinon vides.
### 5.6 V1 : JSON only
Pas de CSV / Parquet. Ajout possible plus tard via `?format=`.
## 6. Authentification
### 6.1 Transmission
Header HTTP standard :
```
Authorization: Bearer decpinfo_a1b2c3d4...
```
Pas de support via query string (fuites dans les logs).
### 6.2 Format du token
Préfixe `decpinfo_` + 32 octets aléatoires hex (43 caractères au total).
Le préfixe facilite la détection de fuites (gitleaks, etc.).
### 6.3 Hashing
`sha256(token)` stocké dans `api_tokens.token_hash`. Pas de bcrypt/argon2 :
les tokens ont 256 bits d'entropie, le brute-force est impossible et un
hash lent ralentirait inutilement chaque requête API.
### 6.4 Décorateur `@require_token`
1. Lit `Authorization` ; absent → 401 `missing_token`.
2. Calcule `sha256`, `SELECT` indexé.
3. Pas trouvé → 401 `invalid_token`.
4. `revoked_at IS NOT NULL` → 401 `revoked_token`.
5. Pose `flask.g.token_id` pour `tracking.py`.
### 6.5 CLI de gestion
`python -m src.api.tokens_cli` :
```
create --label "Marie Dupont - étude transport 2026"
→ affiche UNE FOIS le token plaintext (irrécupérable ensuite)
list
→ id | label | created_at | last_used_at | count_total | revoked?
revoke <id>
→ set revoked_at = now() (ISO 8601 UTC)
```
Pas d'UI web pour les tokens en V1.
## 7. Suivi de consommation
### 7.1 Hook
`@bp.after_request` déclenche deux actions **sans bloquer la réponse** :
1. Enfilage d'un update SQLite dans une `queue.Queue` consommée par un
worker thread unique (writer série, pas de contention SQLite).
2. POST httpx fire-and-forget vers la Tracking API Matomo.
Les erreurs des deux chemins sont loggées en `warning` mais jamais propagées
à l'utilisateur.
### 7.2 Update SQLite
```sql
UPDATE api_tokens
SET count_total = count_total + 1,
last_used_at = ?
WHERE id = ?
```
### 7.3 Event Matomo
```
POST https://analytics.maudry.com/matomo.php
idsite=14
rec=1
url=https://decp.info/api/v1/data?<query>
action_name=API /data
uid=token-<id> # jamais le token plaintext
dimension1=<token_id>
dimension2=<status_code>
ua=<user_agent client>
```
Custom Dimensions à créer côté Matomo : `dimension1=token_id`,
`dimension2=http_status`.
### 7.4 Variables d'environnement nouvelles
```
MATOMO_URL=https://analytics.maudry.com/matomo.php
MATOMO_SITE_ID=14
MATOMO_TRACKING_ENABLED=true # false en dev/test par défaut
USERS_DB_PATH=./users.sqlite # tests : tests/users.test.sqlite
```
## 8. Erreurs
Format uniforme (RFC 7807, déjà standard flask-smorest) :
```json
{
"code": 400,
"status": "Bad Request",
"message": "Colonne inconnue 'foo'.",
"errors": { "field": "foo__exact" }
}
```
| HTTP | Cas |
| ---- | --------------------------------------------------------------------- |
| 200 | Succès |
| 400 | Colonne/opérateur/valeur invalide, `page_size` hors bornes |
| 401 | `missing_token` / `invalid_token` / `revoked_token` |
| 404 | Path API inexistant |
| 500 | Exception non gérée — message générique, stack trace loggée seulement |
Pas de 429 en V1.
Les 4xx sont loggées en `info` (path + token_id), les 500 en `error` avec
stack trace.
## 9. Tests
Tests pytest purs (pas de Selenium) via `app.server.test_client()`.
```
tests/api/
├── test_filters.py # parsing, génération SQL/params, erreurs
├── test_auth.py # 401 cases, last_used_at update
├── test_tokens_cli.py # create/list/revoke
├── test_endpoints_data.py # pagination, filtres, sort, columns, count=false
├── test_endpoints_schema.py # /schema renvoie les colonnes attendues
├── test_health.py # /health 200 sans auth
└── test_tracking.py # compteurs SQLite, Matomo désactivé par défaut + mock httpx
```
Fixtures pytest :
- `api_client` : `app.server.test_client()`
- `valid_token_header` : crée un token dans `tests/users.test.sqlite`, renvoie le header `Authorization: Bearer …`
- `revoked_token_header` : idem avec `revoked_at` set
Ajouts `pyproject.toml` `[tool.pytest.ini_options].env` :
```
USERS_DB_PATH=tests/users.test.sqlite
MATOMO_TRACKING_ENABLED=false
```
Couverture cible : 100% de `filters.py` et `auth.py` (sécurité-critique) ;
raisonnable ailleurs.
## 10. Dépendances nouvelles
À ajouter dans `pyproject.toml` :
- `flask-smorest` (blueprint + OpenAPI + Swagger UI)
- `marshmallow` (déjà transitif de flask-smorest, à expliciter)
`httpx` est déjà présent. Pas d'autres dépendances.
## 11. Documentation utilisateur
À fournir séparément (hors scope spec, à inclure dans le plan d'implémentation) :
- Section "API" dans la page À propos ou page dédiée `/api` avec :
- lien vers Swagger UI
- exemples curl
- procédure pour obtenir un token (« contactez X »)
- Mention dans le `CHANGELOG.md` à la sortie de version.
## 12. Risques et points ouverts
- **Coût du `COUNT(*)`** sur gros filtres : mitigé par `count=false` opt-out.
- **Charge SQLite write** : un worker série suffira pour le trafic attendu
(admin tokens manuels, faible volume). Si le volume monte, passer à un
buffer en RAM avec flush périodique.
- **Matomo down** : impact nul sur l'API (fire-and-forget loggué).
- **Évolution vers self-service** : déjà préparée par `user_id` nullable et
séparation `src/api/` vs `src/auth/`.
@@ -0,0 +1,122 @@
# Page `/etapes` — « Quelles données pour quelles étapes et quels seuils ? »
Date : 2026-06-04
Branche : `dev`
## Objectif
Créer une page pédagogique sur decp.info qui montre, sur un seul graphique, **quelles données sont publiées à chaque étape de la passation d'un marché public** et **à partir de quel seuil réglementaire** (en € HT).
La page aide à comprendre l'écosystème des publications de données de la commande publique et à situer les DECP (le cœur de decp.info) parmi les autres sources.
## Portée
- Une page dédiée à l'URL `/etapes`.
- Layout standard (bandeau de navigation global affiché en haut, comme toutes les pages).
- **Non listée** dans la navbar pour l'instant (on ne sait pas encore comment la lier depuis le reste de l'app — elle n'est pas secrète).
- **Référencée** dans le sitemap pour le SEO.
- Graphique en **HTML/CSS statique** (pas de Plotly, pas de SVG, pas d'interactivité).
- Pas de test automatisé spécifique (contenu statique) ; vérification visuelle via `python run.py`.
Hors portée : tout lien entrant depuis la navbar ou d'autres pages, toute interactivité (survol, filtre), toute donnée dynamique.
## Le graphique
### Axes
- **Axe Y** (de haut en bas) — étapes de la passation :
1. Programmation
2. Publicité (appel d'offres)
3. Attribution
4. Contrat — _vide_ (« aucune donnée publiée aujourd'hui »)
5. Paiement — _vide_ (« aucune donnée publiée aujourd'hui »)
- **Axe X** — seuils réglementaires en € HT, **segmenté** (espacement égal entre seuils, pas linéaire, sinon tout serait écrasé entre 40 k€ et 5,4 M€). Marqueurs de colonnes :
- `0 €`
- `40 000 €` — seuil DECP
- `90 000 €` — seuil de publicité
- `140 000 € / 216 000 €` — seuils formalisés (UE)
- `5 404 000 €` — travaux (UE)
### Barres (publications de données)
Chaque barre est une bande horizontale colorée, positionnée sur sa ligne d'étape et couvrant la plage de seuils où la publication s'applique.
| Publication | Étape(s) | Plage de seuils | Note |
| ------------------------------- | ------------------------------------------------------------- | ----------------------------- | -------------------------------------------------------------------- |
| **Approch** | Programmation | toute la largeur | sourcing / préinformation, publication **non réglementaire** |
| **Journaux d'annonces légales** | Publicité | 90 000 € → seuil formalisé | remplit exactement cette case |
| **BOAMP** | Publicité | ≥ 90 000 € (jusqu'à l'infini) | au-delà des seuils UE, publicité obligatoire au BOAMP **et** au JOUE |
| **JOUE** | Publicité (avis de marché) + Attribution (avis d'attribution) | ≥ seuils formalisés | deux barres, une par étape |
| **DECP** | Attribution | ≥ 40 000 € (jusqu'à l'infini) | données essentielles de la commande publique |
### Légende
Sous le graphique : une pastille de couleur + le nom complet pour chaque publication (Approch, Journaux d'annonces légales, BOAMP, JOUE, DECP).
## Implémentation
### Nouveau fichier `src/pages/etapes.py`
Enregistrement de la page :
```python
register_page(
__name__,
path="/etapes",
title="Quelles données pour quelles étapes et quels seuils ? | decp.info",
name="Étapes et données",
description="À chaque étape d'un marché public (programmation, publicité, attribution), quelles données sont publiées et à partir de quel seuil : DECP, BOAMP, JOUE, journaux d'annonces légales, Approch.",
image_url=META_CONTENT["image_url"],
)
```
Le `name="Étapes et données"` n'est pas dans la liste blanche de la navbar (`src/app.py:181`), la page reste donc hors navigation tout en étant accessible.
`layout` = `html.Div(className="container", children=[...])` :
1. `html.H2("Quelles données pour quelles étapes et quels seuils ?")`
2. Paragraphe d'intro (`dcc.Markdown`) expliquant ce que montre le graphique.
3. Le graphique (composants `html.Div` reproduisant la maquette v3, barres positionnées en `left`/`right` en `%`).
4. La légende.
5. Note de bas (`dcc.Markdown`) : axe X segmenté (non linéaire) ; Contrat et Paiement sans données ouvertes à ce jour.
### Modification de `src/app.py`
Ajouter `"/etapes"` à la liste des URLs du sitemap (`sitemap()`, ~ligne 73) :
```python
pages = [
"/",
"/observatoire",
"/tableau",
"/a-propos",
"/etapes",
]
```
Aucune modification de la navbar.
### CSS
Bloc dédié dans `src/assets/css/` (fichier existant ou nouveau), avec classes préfixées (ex. `.etapes-chart`, `.etapes-lane`, `.etapes-bar`…) pour éviter toute collision.
### Responsive — deux rendus
Le graphique en grille n'est pas lisible sur écran portrait étroit (la vue d'ensemble est perdue). On rend donc **deux représentations des mêmes données**, basculées par media query (point de rupture ~768 px) :
- **Desktop / tablette (≥ 768 px)** : le graphique en grille (maquette v3), enveloppé dans un conteneur `overflow-x:auto` + `min-width` pour les écrans intermédiaires. Le rendu mobile est masqué.
- **Mobile (< 768 px)** : le graphique est masqué et remplacé par une **liste verticale par étape**. Chaque étape est un bloc qui liste ses publications, chacune avec sa pastille de couleur, son nom, et sa **plage de seuils en texte** (ex. « DECP — à partir de 40 000 € »). Les étapes Contrat/Paiement affichent « aucune donnée publiée aujourd'hui ».
Pour éviter la duplication, les publications de chaque étape (libellé, couleur, texte de plage) sont décrites **une seule fois** dans une structure de données Python, consommée par le rendu mobile et la légende. Le graphique en grille garde son positionnement explicite (intrinsèquement spatial).
## Vérification
- `python run.py` puis ouvrir `/etapes` : le graphique s'affiche, fidèle à la maquette v3, avec le bandeau de navigation en haut.
- `/etapes` **absente** de la navbar.
- `/sitemap.xml` **contient** `/etapes`.
- Sur fenêtre intermédiaire : défilement horizontal du graphique, pas d'écrasement.
- Sur écran portrait étroit (< 768 px) : le graphique en grille est masqué, remplacé par la liste verticale par étape, lisible sans défilement horizontal.
## Référence
Maquette validée : `.superpowers/brainstorm/80498-1780599135/content/chart-concept-v3.html`.
@@ -0,0 +1,293 @@
# Bootstrap résilient des données et du schéma
**Date :** 2026-06-12
**Branche :** `feature/78_api`
**Statut :** design approuvé, à implémenter
## Problème
L'API et l'appli Web Dash partagent le même process Python (`gunicorn app:server`).
L'API sera consommée par des clients en production. Or decp.info tombe « de temps
en temps », et comme tout est dans le même process, une chute du Web emporte l'API.
**Diagnostic (clé).** Les chutes ne sont **pas** des crashs runtime aléatoires
pendant l'ingestion. Ce sont des **échecs de bootstrap au déploiement** :
- env oubliée lors d'un déploiement (ex. `DATA_FILE_PARQUET_PATH` vide) ;
- `DATA_FILE_PARQUET_PATH` (désormais une URL data.gouv.fr) injoignable ou
pointant vers un parquet absent/invalide à cause d'un souci dans
`decp-processing` ;
- `DATA_SCHEMA_PATH` (URL data.gouv.fr) qui renvoie une erreur.
Le process démarre sur des ressources manquantes/invalides, lève une exception
**au moment de l'import** (`src/db.py` et `src/utils/data.py` font leur bootstrap
au niveau module), et meurt au boot — API comprise.
## Pourquoi pas « séparer les process » ?
La séparation API / Web protège contre la **contagion runtime** (un callback Dash
qui tue le worker). Elle ne protège **pas** contre le mode d'échec réel : si les
deux process partagent les mêmes ressources de bootstrap (parquet, schéma, env),
ils échouent **tous les deux** au démarrage, de manière identique.
Le levier réel est donc le **durcissement du bootstrap avec fallback
« last-known-good »** : garantir présence + validité des ressources, et sinon
repartir sur les dernières ressources fonctionnelles.
La séparation des process reste **hors périmètre** de ce spec. La couche données
(`src/db.py`) est déjà process-agnostique et sans dépendance à Dash, donc la
séparation restera bon marché à dégainer plus tard _si_ un vrai crash runtime
touche l'API. On ne paie pas cette complexité tant qu'on n'en a pas la preuve.
## État actuel du code (post-merge `main`)
### `src/db.py`
- Bootstrap au niveau module : `DB_PATH = _ensure_database()` puis ouverture d'une
connexion DuckDB read-only partagée et lecture du `schema`.
- `build_database()` écrit dans un fichier temporaire puis `os.replace()` atomique :
un build qui échoue en cours de route **laisse l'ancien DuckDB intact**. ✅
- **Faille :** `should_rebuild()` appelle `get_last_modified(parquet_path)` qui
fait un `httpx.head(...).headers["last-modified"]` **sans aucune gestion
d'erreur** (`src/utils/__init__.py:12`). URL injoignable, lente, ou sans en-tête
`last-modified` ⇒ exception ⇒ remonte jusqu'à l'import ⇒ **mort au démarrage
alors qu'un DuckDB valide existe sur disque**.
- **Faille :** `_load_source_frame()` fait `assert os.path.exists(parquet_path)`
(non-http) et `scan_parquet` (http) — les deux peuvent lever et ne sont pas
rattrapés au niveau de `_ensure_database()`.
### `src/utils/data.py` — `get_data_schema()`
- Tente l'URL, attrape **seulement 4 erreurs httpx** (`ReadTimeout`, `ReadError`,
`ConnectError`, `ConnectTimeout`), sinon fallback sur `DATA_SCHEMA_LOCAL`.
- **Faille :** pas de `raise_for_status()`. Quand data.gouv renvoie une **erreur
HTTP** (le cas cité par l'utilisateur), `.json()` ne contient pas `"fields"`
`KeyError` ligne 92, **sans fallback local**.
- **Faille :** un payload distant valide JSON mais malformé (sans `"fields"`)
plante aussi sans fallback.
- **Faille :** si les deux sources échouent, `original_schema["fields"]`
`KeyError` opaque au lieu d'une erreur claire.
## Décisions
1. **Schéma** : URL primaire, **cache seul** en fallback (on supprime
`DATA_SCHEMA_LOCAL`). (confirmé)
2. **DuckDB** : réutiliser le dernier DuckDB construit en cas d'échec. (confirmé)
3. **Last-known-good réel du schéma** : après un fetch distant réussi, persister
le schéma dans un cache local pour que le fallback soit toujours le _dernier
schéma distant fonctionnel_. (confirmé)
### Chemin de persistance du schéma : `DATA_SCHEMA_CACHE` seul
On remplace `DATA_SCHEMA_LOCAL` (qui pointait, en dev, vers
`../decp-processing/dist/schema.json` — un fichier cross-repo qu'on ne veut pas
écraser) par un **cache unique possédé par l'app**.
- `DATA_SCHEMA_PATH` (URL) — source primaire.
- `DATA_SCHEMA_CACHE` (nouveau, ex. défaut `./schema.cache.json`) — écrit après
chaque fetch distant réussi, lu en fallback.
Chaîne de résolution : `URL → cache → RuntimeError`.
**Pourquoi c'est suffisant.** Le déploiement est en place sur un VM persistant
(`ssh → cd /var/www/APP_NAME → git pull → restart systemd`), donc le fichier de
cache survit aux déploiements — **même garantie de persistance que le DuckDB
réutilisé**. Tous les incidents constatés (env oubliée, parquet KO, URL schéma en
erreur) surviennent sur un **redéploiement** d'un hôte déjà chaud, où le cache a
déjà été écrit par un boot précédent réussi ⇒ couvert.
**Seul cas non couvert (assumé) :** le _cold start absolu_ — un hôte qui n'a jamais
booté avec succès **et** URL distante down au même instant. Étroit, non-récurrent.
Fermable plus tard par une graine commitée in-repo si jamais il se matérialise
(YAGNI).
**Contraintes :**
- `DATA_SCHEMA_CACHE` (`./schema.cache.json`) doit être **`.gitignore`** — sinon le
`git pull` du déploiement entrerait en conflit. (Comme `decp.duckdb` aujourd'hui.)
- En dev, plus de fallback vers le schéma frais de `decp-processing` : on bascule
sur le cache (dernier schéma data.gouv). Acceptable, l'URL restant primaire.
## Design
### Invariant 1 — Bootstrap DuckDB (`src/db.py`)
> Le process démarre tant qu'un DuckDB exploitable existe, quel que soit l'état de
> la source distante/parquet. Échec dur **seulement** s'il n'existe aucune base
> (cold start).
Garde-fou unique dans `_ensure_database()` :
```python
def _ensure_database() -> Path:
db_path = Path(os.getenv("DUCKDB_PATH", "./decp.duckdb"))
parquet_path = os.getenv("DATA_FILE_PARQUET_PATH", "")
lock_path = db_path.with_suffix(".duckdb.lock")
db_exists = db_path.exists()
with open(lock_path, "w") as lock_fd:
fcntl.flock(lock_fd, fcntl.LOCK_EX)
try:
if should_rebuild(db_path, parquet_path):
build_database(db_path)
except Exception as e:
if db_exists:
logger.error(
f"Bootstrap données KO ({e}). "
f"Réutilisation du DuckDB existant : {db_path}"
)
else:
logger.critical("Aucune base DuckDB et reconstruction impossible.")
raise
return db_path
```
- `should_rebuild()` qui lève (via `get_last_modified()`) est désormais rattrapé :
base existante ⇒ on la réutilise.
- `build_database()` qui lève sur parquet invalide : base existante intacte
(atomicité) ⇒ on la réutilise.
- Le mode `DEVELOPMENT` sort de `should_rebuild()` **avant** tout appel réseau
(court-circuit `if dev and not force: return False`) ⇒ dev inchangé.
### Invariant 2 — Schéma (`src/utils/data.py`)
> Un schéma valide non-vide est toujours retourné si une source (distant ou cache)
> en fournit un. Échec dur seulement si aucune.
```python
def get_data_schema() -> dict:
cache_path = os.getenv("DATA_SCHEMA_CACHE", "./schema.cache.json")
raw = _fetch_remote_schema(os.getenv("DATA_SCHEMA_PATH")) # dict valide | None
if raw is not None:
_persist_schema_cache(raw, cache_path)
else:
raw = _load_schema_file(cache_path)
if raw is None:
raise RuntimeError("Aucun schéma disponible (ni distant ni cache).")
return OrderedDict((c["name"], c) for c in raw["fields"])
```
Helpers :
- `_fetch_remote_schema(url) -> dict | None` : `get(...).raise_for_status().json()`,
**valide `"fields" in data`**, attrape large (`httpx.HTTPError`,
`json.JSONDecodeError`, `KeyError`), log l'erreur, renvoie `None` sur tout échec.
- `_load_schema_file(path) -> dict | None` : lit le fichier s'il existe, parse,
valide `"fields"`, renvoie `None` sinon.
- `_persist_schema_cache(data, path)` : écriture atomique (tmp + `os.replace`) ;
un échec d'écriture est loggé mais **non bloquant** (le schéma en mémoire reste
valide).
### Invariant 3 — Chargements au niveau module des pages
> L'import d'une page (exécuté au boot via `use_pages`) ne doit jamais tuer le
> démarrage à cause d'une ressource externe KO. Une ressource indisponible
> dégrade gracieusement l'affichage.
Audit des chargements à l'import (tous les `layout` de pages sont au niveau
module ⇒ leur contenu s'exécute au boot). Deux points de rupture **externes** :
**C — `src/pages/tableau.py:36-38`.** `get_last_modified(URL parquet)` fait un
HTTP HEAD **sans gestion d'erreur** (URL injoignable, en-tête `last-modified`
absent) ⇒ import KO ⇒ boot KO. C'est le même piège que `db.py`, mais dans une page.
Correctif : un helper best-effort dans `src/utils/__init__.py` qui ne lève jamais
et retombe sur le mtime du DuckDB (garanti présent par l'Invariant 1) :
```python
def get_data_update_timestamp(parquet_path: str, fallback_path: str | None = None) -> float | None:
"""Date de MAJ des données, best-effort, sans jamais lever (usage au boot)."""
try:
return get_last_modified(parquet_path)
except Exception as e:
logger.warning(f"Date de mise à jour des données indisponible ({e})")
if fallback_path:
try:
return os.path.getmtime(fallback_path)
except OSError:
pass
return None
```
`tableau.py` l'utilise et gère le cas `None` (affiche « date inconnue »,
`update_date_iso = ""`).
**D — `src/pages/a-propos.py:103`.** `get_sources_tables(SOURCE_STATS_CSV_PATH)`
(`src/figures.py:121`) fait `pl.read_csv(source_path)` mais ne rattrape que
`URLError, HTTPError` — pas les erreurs Polars, ni `source_path` vide/`None`, ni
fichier absent ⇒ import KO ⇒ boot KO.
Correctif : élargir le `except` et gérer le chemin vide :
```python
def get_sources_tables(source_path) -> html.Div:
try:
if not source_path:
raise ValueError("SOURCE_STATS_CSV_PATH non défini")
dff = pl.read_csv(source_path)
except Exception as e:
logger.warning(f"Sources de données indisponibles ({e})")
return html.Div("Sources de données momentanément indisponibles.")
... # suite inchangée
```
Hors périmètre des pages : `data/departements.json` + `.geojson` (fichiers
in-repo apportés par `git pull`, pas pilotés par env/URL — voir Hors périmètre).
## Tests (TDD)
Couvrir chaque branche de fallback. Sans dépendre du réseau réel.
**Schéma (`get_data_schema` / helpers) :**
1. URL OK ⇒ schéma distant retourné **et** cache écrit.
2. URL renvoie une erreur HTTP (mock 500) ⇒ fallback cache.
3. URL renvoie un JSON malformé (sans `"fields"`) ⇒ fallback cache.
4. URL KO + cache présent ⇒ schéma du cache.
5. URL KO + cache absent ⇒ `RuntimeError` claire.
6. Échec d'écriture du cache ⇒ schéma quand même retourné (non bloquant).
**Bootstrap DuckDB (`_ensure_database`) :**
7. `should_rebuild` lève + DuckDB existant ⇒ réutilisé, pas d'exception.
8. `build_database` lève + DuckDB existant ⇒ réutilisé, pas d'exception.
9. Échec + **aucun** DuckDB (cold start) ⇒ ré-lève.
10. Cas nominal : rebuild nécessaire et possible ⇒ build effectué.
Mocker `get_last_modified` / `build_database` / `httpx.get` ; utiliser des fichiers
DuckDB et schéma temporaires (`tmp_path`).
**Chargements de pages (Invariant 3) :**
11. `get_data_update_timestamp` : `get_last_modified` lève + `fallback_path`
existant ⇒ retourne le mtime du fallback (pas d'exception).
12. `get_data_update_timestamp` : tout KO (lève + pas de fallback) ⇒ `None`.
13. `get_data_update_timestamp` : cas nominal ⇒ retourne la valeur de
`get_last_modified` (mocké).
14. `get_sources_tables(None)``html.Div` de repli (pas d'exception).
15. `get_sources_tables("/inexistant.csv")``html.Div` de repli.
16. `get_sources_tables(<csv valide>)``html.Div` contenant la `DataTable`.
## Hors périmètre
- Séparation des process API / Web (reportée — voir plus haut).
- Surveillance / alerting externe (les logs `error`/`critical` suffisent pour ce lot).
- Validation fine du contenu du parquet au-delà de « lisible par Polars/DuckDB ».
- Durcissement des `open()` in-repo (`data/departements.json` + `.geojson`) :
fichiers versionnés, apportés par `git pull`, jamais pilotés par env/URL (YAGNI).
## Variables d'environnement
| Variable | Rôle | Changement |
| ------------------------ | --------------------------------------- | ------------ |
| `DATA_FILE_PARQUET_PATH` | Source parquet (URL ou chemin) | inchangé |
| `DATA_SCHEMA_PATH` | URL schéma (primaire) | inchangé |
| `DATA_SCHEMA_LOCAL` | Ancien fichier de secours statique | **supprimé** |
| `DATA_SCHEMA_CACHE` | Cache last-known-good du schéma distant | **nouveau** |
| `DUCKDB_PATH` | Fichier DuckDB | inchangé |
| `SOURCE_STATS_CSV_PATH` | CSV stats sources (page À propos, D) | inchangé |
À faire côté config :
- Ajouter `DATA_SCHEMA_CACHE` à `.template.env`, retirer `DATA_SCHEMA_LOCAL` de
`.template.env` / `.env`.
- Ajouter `schema.cache.json` (ou la valeur de `DATA_SCHEMA_CACHE`) au `.gitignore`.
@@ -0,0 +1,220 @@
# Parité de l'API decp.info avec tabular-api (data.gouv.fr) — opérateurs manquants
**Date :** 2026-06-22
**Périmètre :** `count_results` + `differs` + suite d'agrégation. **Hors périmètre :** le paramètre réservé `or` (itération dédiée ultérieure).
## Contexte
L'API `/api/v1/data` de decp.info reproduit le schéma de requête de
`tabular-api` (`datagouv/api-tabular`), qui sert la même donnée DECP sur
data.gouv.fr. L'objectif est d'atteindre la parité sur les **opérateurs**
de filtrage/agrégation, pour qu'une requête écrite pour data.gouv.fr
fonctionne à l'identique sur decp.info.
Source faisant autorité du comportement cible : `api_tabular/core/query.py`
du dépôt `datagouv/api-tabular`. Tous les comportements ci-dessous ont été
vérifiés en direct contre la ressource DECP
`22847056-61df-452d-837d-8b8ceadbfc52`.
### Écart constaté
Opérateurs présents chez data.gouv.fr et absents de decp.info :
| Mot-clé | Nature |
| ----------------------------------- | ----------------------------------- |
| `differs` | opérateur de filtre |
| `groupby` | drapeau d'agrégation (sans valeur) |
| `count`, `sum`, `avg`, `min`, `max` | drapeaux d'agrégation (sans valeur) |
De plus, le paramètre réservé `count=true|false` de decp.info entre en
collision avec l'opérateur d'agrégation `count` de data.gouv.fr.
État courant pertinent :
- `src/api/filters.py` : `OPERATORS`, `RESERVED_PARAMS`, `build_where()`.
- `src/api/routes.py` : route `data()`, doc swagger des paramètres.
- `src/db.py` : `query_marches()`, `count_marches()`.
## Objectifs
1. Renommer le paramètre réservé `count``count_results` (valeurs
`true|false`, défaut `true`), libérant `count` comme opérateur.
2. Ajouter l'opérateur de filtre `differs`.
3. Ajouter les opérateurs d'agrégation `groupby`, `count`, `sum`, `avg`,
`min`, `max`, avec la même forme de réponse que data.gouv.fr.
4. **Documenter** chaque mot-clé dans le Swagger UI de l'API, de façon à
mettre en valeur les possibilités de l'API decp.info.
Non-objectifs : le paramètre `or` (grammaire récursive imbriquée), les
opérateurs `groupby`/agrégats appliqués via `or`, toute évolution du
benchmark (sera traitée après).
## Conception
### 1. Renommage `count` → `count_results`
- `RESERVED_PARAMS` : `{"page", "page_size", "columns", "count_results"}`.
- `routes.data()` : lire `request.args.get("count_results", "true")`.
- Doc swagger : remplacer le paramètre `count` par `count_results`, même
description (« inclure le total `COUNT(*)` ; `false` pour accélérer »).
- Le mot `count` n'est donc plus réservé ; il est interprété comme
opérateur d'agrégation (section 3).
**Rupture de contrat :** un client qui passait `count=false` verra ce
paramètre ré-interprété. Sans conséquence : l'API n'est pas encore en
production, on peut donc itérer librement.
### 2. Opérateur `differs`
Sémantique data.gouv.fr : `col__differs=val` → PostgREST `isdistinct`, soit
`IS DISTINCT FROM` (≠ null-safe : `NULL differs 44` est vrai).
- Ajouter `"differs"` à `OPERATORS`.
- Dans `build_where()`, après coercition de la valeur :
`where_parts.append('"col" IS DISTINCT FROM ?')` ; `params.append(v)`.
- DuckDB supporte nativement `IS DISTINCT FROM`.
### 3. Opérateurs d'agrégation
#### Forme des requêtes (vérifiée)
Drapeaux **sans valeur** dans la query string :
`?acheteur_departement_code__groupby&uid__count&montant__sum&montant__avg&montant__min&montant__max`
Une valeur (`__groupby=1`) est un cas d'erreur côté data.gouv.fr ; on
n'impose pas cette stricte interdiction mais on accepte la forme sans
valeur (Werkzeug fournit alors la valeur `""`).
Opérateurs : `groupby`, `count`, `sum`, `avg`, `min`, `max`.
#### Forme de la réponse (vérifiée)
```
SELECT <cols groupby>, FN("<col>") AS "<col>__<op>", ...
FROM decp
WHERE <filtres>
GROUP BY <cols groupby>
LIMIT <page_size> OFFSET <offset>
```
- Colonnes de sortie : la colonne `groupby` garde son nom ; chaque agrégat
est nommé `"<colonne>__<opérateur>"` (ex. `uid__count`, `montant__sum`).
- `meta` : `{"page", "page_size"}` **sans `total`** (data.gouv.fr n'en
renvoie pas en mode agrégation). `count_results` est ignoré dans ce mode.
- Pas de tri par défaut.
- Les filtres `WHERE` (y compris `differs`) restent appliqués.
#### Contraintes répliquées
- `columns` + agrégation → erreur 400 (`columns ne peut pas être combiné avec des agrégateurs`). Vérifié identique chez data.gouv.fr.
- Un agrégat (`count`/`sum`/…) sans `groupby` est autorisé (agrégat global,
une ligne).
#### Architecture
Nouvelle fonction de parsing dans `src/api/filters.py` :
```
parse_aggregators(args, schema) -> AggregationSpec | None
```
- Retourne `None` si aucun opérateur d'agrégation présent → la route suit
le chemin existant.
- Sinon retourne les colonnes `groupby` et la liste des agrégats
`(fonction_sql, colonne, alias)`.
- Valide que chaque colonne existe dans le schéma ; opérateur inconnu →
`FilterError`.
`build_where()` est inchangé pour WHERE/ORDER ; il continue d'ignorer les
clés réservées et **doit ignorer les drapeaux d'agrégation** (ne pas les
traiter comme des filtres). Comme les drapeaux d'agrégation arrivent comme
`(col__op, "")`, et que `op` ∈ agrégateurs, `build_where` les saute.
Nouvelle fonction dans `src/db.py` :
```
aggregate_marches(select_sql, where_sql, params, group_by, limit, offset) -> pl.DataFrame
```
- `select_sql` et `group_by` sont des fragments SQL construits depuis des
noms de colonnes validés contre le schéma (jamais de valeur utilisateur
libre) ; les valeurs de filtre passent par le binding `?`.
Orchestration dans `routes.data()` :
```
agg = parse_aggregators(args, schema)
where_sql, params, order_sql = build_where(args, schema) # filtres seuls
if agg:
if columns: -> abort(400)
df = aggregate_marches(agg.select_sql, where_sql, params, agg.group_by, page_size, offset)
meta = {"page", "page_size"} # pas de total
else:
<chemin existant>
```
### 4. Documentation (Swagger UI)
La doc de l'API est générée par flask-smorest et exposée sur
`/api/v1/swagger`, pilotée par le docstring de `routes.data()` et le bloc
`@bp.doc(parameters=[...])`. C'est la surface de documentation à enrichir
(aucune autre page de doc API n'existe).
À mettre à jour :
- Remplacer le paramètre `count` par `count_results` (même description).
- Étendre la description du paramètre dynamique `<colonne>__<opérateur>`
avec une **définition d'une ligne par opérateur**, regroupés par
catégorie :
- _Filtres_ : `exact`, `differs`, `contains`, `notcontains`, `in`,
`notin`, `less`, `greater`, `strictly_less`, `strictly_greater`,
`isnull`, `isnotnull`, `sort`.
- _Agrégation_ (drapeaux sans valeur) : `groupby`, `count`, `sum`,
`avg`, `min`, `max`.
- Décrire le **mode agrégation** : drapeaux sans valeur, réponse en lignes
groupées, colonnes `col__op`, `columns` interdit, pas de `total`.
- Mettre à jour le docstring de `data()` (visible dans Swagger) en
cohérence, avec au moins un exemple de requête d'agrégation.
Objectif éditorial : un lecteur qui découvre l'API doit comprendre, depuis
le seul Swagger UI, l'ensemble des opérateurs disponibles et comment s'en
servir.
### Sécurité SQL
Les noms de colonnes proviennent du schéma DuckDB validé (`col in schema`),
jamais interpolés depuis une valeur arbitraire ; les fonctions d'agrégation
sont une liste blanche fixe (`COUNT/SUM/AVG/MIN/MAX`). Les valeurs de
filtre restent liées par paramètres `?`. Aucun chemin n'interpole de valeur
utilisateur dans le SQL.
## Tests
Tests existants à adapter (renommage `count``count_results`).
Nouveaux tests (`tests/` API) :
- `differs` : exclut les lignes égales, inclut les NULL.
- agrégation `groupby` + `count` : nombre de groupes, noms de colonnes
`col__count`.
- agrégation multiple `groupby`+`count`+`sum`+`avg`+`min`+`max` : alias et
types corrects, `meta` sans `total`.
- agrégat sans `groupby` : une ligne.
- `groupby` + filtre `WHERE` : le filtre s'applique avant l'agrégation.
- `columns` + agrégation : 400.
- `count_results=false` : réponse sans `total` (chemin non-agrégé).
- non-régression : opérateurs existants inchangés.
- doc : le spec OpenAPI généré (`/api/v1/openapi.json`) référence
`count_results` et mentionne les nouveaux opérateurs (vérif légère, p. ex.
présence des chaînes attendues).
Comparaison de référence : pour quelques requêtes, les valeurs agrégées
doivent correspondre à celles renvoyées par data.gouv.fr sur la même
ressource (aux différences de fraîcheur de données près).
## Gestion des erreurs
- Opérateur inconnu, colonne inconnue → `FilterError` → 400 (existant).
- `columns` + agrégation → 400 avec message explicite.
- Valeur non coercible pour `differs``FilterError` (existant via
`_coerce`).
@@ -0,0 +1,112 @@
# Tuile « Considérations sociales et environnementales » — Observatoire
## Objectif
Ajouter dans `/observatoire` une tuile (card) qui visualise, à l'aide de barres
de progression « plus ou moins remplies », la part des marchés publics filtrés
qui comportent **au moins une considération sociale** et la part qui comportent
**au moins une considération environnementale**.
La tuile s'insère juste **après la tuile « Type d'achat »**, avec le même style
que les autres cards.
## Données
Colonnes concernées (type `String`, valeurs libres potentiellement composées) :
- `considerationsSociales`
- `considerationsEnvironnementales`
Exemples de valeurs : `Sans objet`, `Clause sociale`, `Critère social`,
`Marché réservé`, `Clause environnementale`, `Critère environnemental`,
`Pas de considération sociale`, `null`, ou des combinaisons
(`Critère social, Clause sociale`).
### Définition « au moins une considération »
Un marché compte comme ayant une considération si la valeur de la colonne
**contient** l'un des mots-clés (insensible à la casse) :
- `Clause`
- `Critère`
- `Marché réservé`
Regex utilisée : `(?i)Clause|Critère|Marché réservé`.
Conséquence (validée avec l'utilisateur) : **`Marché réservé` compte comme
considération sociale**. Les valeurs `Sans objet`, `Pas de considération…` et
`null` ne contiennent aucun de ces mots-clés et ne comptent donc pas.
### Calcul du pourcentage
- **Dédoublonnage par `uid`** : un marché est compté une seule fois même s'il
apparaît sur plusieurs lignes (plusieurs titulaires). On prend la première
valeur de chaque colonne par `uid`.
- **Dénominateur** : **tous** les marchés filtrés (y compris `Sans objet` et
non renseignés) — validé avec l'utilisateur.
- **Numérateur** : nombre de marchés (uid distincts) dont la valeur de colonne
satisfait la regex.
- `pourcentage = round(100 * numérateur / dénominateur)` ; si dénominateur = 0,
pourcentage = 0.
## Composant visuel
Nouvelle fonction `get_considerations_card_content(lff: pl.LazyFrame)` dans
`src/figures.py`, renvoyant un `html.Div` contenant deux barres `dbc.Progress`
empilées :
| Considération | Couleur (px.colors.qualitative.Safe) | Valeur RGB |
| ----------------- | ------------------------------------ | -------------------- |
| Sociales | index 1 (rouge) | `rgb(204, 102, 119)` |
| Environnementales | index 3 (vert) | `rgb(17, 119, 51)` |
Chaque barre :
- `dbc.Progress(value=pourcentage, label=f"{pourcentage} %", style={"backgroundColor": <couleur>})`
- précédée d'un libellé (`Sociales` / `Environnementales`) et suivie du nombre
de marchés concernés (`N marchés`), formaté avec `format_number`.
### Robustesse (colonne absente)
`tests/test.parquet` peut ne pas contenir ces colonnes. La fonction vérifie la
présence de chaque colonne via `lff.collect_schema().names()` ; si une colonne
manque, son pourcentage et son compte valent 0 (pas d'exception), à l'image de
`get_distance_histogram`.
## Intégration
Dans `src/pages/observatoire.py`, fonction `_compute_dashboard_children` :
```python
donut_marche_type = make_donut(lff, "type", per_uid=True, nulls="?")
cards.append(make_card(title="Type d'achat", ...))
# NOUVEAU
considerations = get_considerations_card_content(lff)
cards.append(
make_card(
title="Considérations sociales et environnementales",
subtitle="part des marchés concernés",
fig=considerations,
)
)
```
`make_card` utilise ses dimensions par défaut (`lg=6, xl=4`), comme la tuile
« Type d'achat ».
Import à ajouter : `get_considerations_card_content` depuis `src.figures`.
## Tests
- Test unitaire de `get_considerations_card_content` sur un petit `LazyFrame`
construit en mémoire couvrant : valeur avec considération, `Sans objet`,
`null`, `Marché réservé`, doublon de `uid`. Vérifier les pourcentages
attendus.
- Cas colonne absente → 0 % sans exception.
## Hors périmètre (YAGNI)
- Pas de tooltip détaillé sur les types de considérations.
- Pas de graphe de répartition par type (clause vs critère).
- Pas de nouveau filtre (les filtres existants `social`/`env` restent inchangés).
+34 -7
View File
@@ -1,13 +1,11 @@
[project]
name = "decp.info"
description = "Interface d'exploration et d'analyse des marchés publics français."
version = "2.1.3"
version = "2.8.1"
requires-python = ">= 3.10"
authors = [
{ name = "Colin Maudry", email = "colin+decp@maudry.com" }
]
authors = [{ name = "Colin Maudry", email = "colin@colmo.tech" }]
dependencies = [
"dash==3.2.0",
"dash==3.4.0",
"dash[compress]",
"polars",
"gunicorn",
@@ -16,10 +14,39 @@ dependencies = [
"xlsxwriter",
"plotly[express]",
"httpx",
"pandas" # utilisé pour la création de certains graphiques
"pandas", # utilisé pour la création de certains graphiques
"unidecode",
"dash-leaflet",
"dash-extensions",
"duckdb",
"flask-caching",
"pyarrow>=23.0.1",
"flask-cors>=6.0.2",
"flask-smorest>=0.46.0",
"marshmallow>=3.20.0",
]
[project.optional-dependencies]
[dependency-groups]
dev = [
"pytest",
"pytest-env",
"pre-commit",
"selenium",
"webdriver-manager",
"dash[testing]",
"fastexcel",
]
[tool.pytest.ini_options]
pythonpath = ["src"]
testpaths = ["tests"]
env = [
"DATA_FILE_PARQUET_PATH=tests/test.parquet",
"DEVELOPMENT=true",
"REBUILD_DUCKDB=true",
"DATA_SCHEMA_PATH=/home/colin/git/decp-processing/dist/schema.json",
"USERS_DB_PATH=tests/users.test.sqlite",
"MATOMO_TRACKING_ENABLED=false",
"DATA_SCHEMA_LOCAL=/home/colin/git/decp-processing/dist/schema.json",
]
addopts = "-p no:warnings"
+3
View File
@@ -1,7 +1,10 @@
from flask_cors import CORS
from src.app import app
# To use `gunicorn run:server` (prod)
server = app.server
CORS(server)
# To use `python run.py` (dev)
if __name__ == "__main__":
+34
View File
@@ -0,0 +1,34 @@
from flask_smorest import Api
from src.api import routes
def init_api(server) -> None:
"""Enregistre le blueprint d'API privée sur le serveur Flask."""
server.config.setdefault("API_TITLE", "decp.info API")
server.config.setdefault("API_VERSION", "v1")
server.config.setdefault("OPENAPI_VERSION", "3.0.3")
server.config.setdefault("OPENAPI_URL_PREFIX", "/api/v1")
server.config.setdefault("OPENAPI_JSON_PATH", "openapi.json")
server.config.setdefault("OPENAPI_SWAGGER_UI_PATH", "swagger")
server.config.setdefault(
"OPENAPI_SWAGGER_UI_URL",
"https://cdn.jsdelivr.net/npm/swagger-ui-dist/",
)
server.config.setdefault(
"API_SPEC_OPTIONS",
{
"components": {
"securitySchemes": {"BearerAuth": {"type": "http", "scheme": "bearer"}}
}
},
)
api = Api(server)
api.register_blueprint(routes.bp)
import os
from src.api import tracking
tracking.start_worker(os.environ["USERS_DB_PATH"])
+35
View File
@@ -0,0 +1,35 @@
import os
from functools import wraps
from flask import abort, g, jsonify, make_response, request
from src.api import tokens_db
API_AUTH_DISABLED = os.getenv("API_AUTH_DISABLED", "False").lower() == "true"
def _abort_401(message: str):
resp = make_response(jsonify({"message": message}), 401)
abort(resp)
def require_token(fn):
@wraps(fn)
def wrapper(*args, **kwargs):
if not API_AUTH_DISABLED:
header = request.headers.get("Authorization", "")
if not header.startswith("Bearer "):
_abort_401("missing_token")
token = header[len("Bearer ") :].strip()
if not token:
_abort_401("missing_token")
db_path = os.environ["USERS_DB_PATH"]
row = tokens_db.get_token_by_plaintext(db_path, token)
if row is None:
_abort_401("invalid_token")
if row["revoked_at"] is not None:
_abort_401("revoked_token")
g.token_id = row["id"]
return fn(*args, **kwargs)
return wrapper
+195
View File
@@ -0,0 +1,195 @@
from dataclasses import dataclass
from datetime import date, datetime
import polars as pl
OPERATORS = {
"exact",
"contains",
"notcontains",
"differs",
"less",
"greater",
"strictly_less",
"strictly_greater",
"in",
"notin",
"isnull",
"isnotnull",
"sort",
}
RESERVED_PARAMS = {"page", "page_size", "columns", "count_results"}
AGGREGATORS = {"groupby", "count", "sum", "avg", "min", "max"}
AGG_SQL = {"count": "COUNT", "sum": "SUM", "avg": "AVG", "min": "MIN", "max": "MAX"}
@dataclass
class AggregationSpec:
select_sql: str
group_by_sql: str | None
def parse_aggregators(
args: list[tuple[str, str]], schema: pl.Schema
) -> "AggregationSpec | None":
"""Détecte les drapeaux d'agrégation (`col__groupby`, `col__count`, ...).
Retourne None si aucun agrégateur. Sinon, construit les fragments SQL
`select_sql` et `group_by_sql` (noms de colonnes validés contre le schéma).
"""
group_cols: list[str] = []
aggregates: list[tuple[str, str]] = [] # (operator, column)
has_agg = False
for key, _ in args:
parsed = _split_key(key)
if not parsed:
continue
col, op = parsed
if op not in AGGREGATORS:
continue
has_agg = True
if col not in schema:
raise FilterError(f"Colonne inconnue : {col!r}", field=key)
if op == "groupby":
group_cols.append(col)
else:
aggregates.append((op, col))
if not has_agg:
return None
select_parts = [f'"{c}"' for c in group_cols]
for op, col in aggregates:
select_parts.append(f'{AGG_SQL[op]}("{col}") AS "{col}__{op}"')
group_by_sql = ", ".join(f'"{c}"' for c in group_cols) if group_cols else None
return AggregationSpec(
select_sql=", ".join(select_parts), group_by_sql=group_by_sql
)
class FilterError(ValueError):
def __init__(self, message: str, field: str | None = None):
super().__init__(message)
self.field = field
def _coerce(value: str, dtype: pl.DataType, key: str):
if dtype == pl.String:
return value
if dtype.is_integer():
try:
return int(value)
except ValueError:
raise FilterError(f"Valeur entière attendue, reçu {value!r}", field=key)
if dtype.is_float():
try:
return float(value)
except ValueError:
raise FilterError(f"Valeur décimale attendue, reçu {value!r}", field=key)
if dtype == pl.Date:
try:
return date.fromisoformat(value)
except ValueError:
raise FilterError(
f"Date ISO 8601 attendue (YYYY-MM-DD), reçu {value!r}", field=key
)
if dtype == pl.Datetime:
try:
return datetime.fromisoformat(value)
except ValueError:
raise FilterError(f"Datetime ISO 8601 attendu, reçu {value!r}", field=key)
return value
def _split_key(key: str) -> tuple[str, str] | None:
if "__" not in key:
return None
col, _, op = key.rpartition("__")
if not col or not op:
return None
return col, op
def build_where(
args: list[tuple[str, str]], schema: pl.Schema
) -> tuple[str, list, str | None]:
"""Parse query params into (where_sql, params, order_by_sql).
args: list of (key, value) tuples preserving URL order (Werkzeug MultiDict
preserves insertion order on `request.args.items(multi=True)`).
"""
where_parts: list[str] = []
params: list = []
order_parts: list[str] = []
for key, value in args:
if key in RESERVED_PARAMS:
continue
parsed = _split_key(key)
if not parsed:
raise FilterError(f"Paramètre non reconnu : {key}", field=key)
col, op = parsed
if op in AGGREGATORS:
continue
if op not in OPERATORS:
raise FilterError(f"Opérateur inconnu : __{op}", field=key)
if col not in schema:
raise FilterError(f"Colonne inconnue : {col!r}", field=key)
if op == "sort":
direction = value.lower()
if direction not in ("asc", "desc"):
raise FilterError(
f"Tri attendu 'asc' ou 'desc', reçu {value!r}", field=key
)
order_parts.append(f'"{col}" {direction.upper()}')
continue
if op in ("isnull", "isnotnull"):
sql = "IS NULL" if op == "isnull" else "IS NOT NULL"
where_parts.append(f'"{col}" {sql}')
continue
dtype = schema[col]
if op in ("in", "notin"):
values = [_coerce(v.strip(), dtype, key) for v in value.split(",")]
placeholders = ",".join(["?"] * len(values))
sql_op = "IN" if op == "in" else "NOT IN"
where_parts.append(f'"{col}" {sql_op} ({placeholders})')
params.extend(values)
continue
v = _coerce(value, dtype, key)
op_sql = {
"exact": "=",
"less": "<=",
"greater": ">=",
"strictly_less": "<",
"strictly_greater": ">",
}
if op in op_sql:
where_parts.append(f'"{col}" {op_sql[op]} ?')
params.append(v)
elif op == "contains":
where_parts.append(f'"{col}" LIKE ?')
params.append(f"%{v}%")
elif op == "notcontains":
where_parts.append(f'"{col}" NOT LIKE ?')
params.append(f"%{v}%")
elif op == "differs":
where_parts.append(f'"{col}" IS DISTINCT FROM ?')
params.append(v)
where_sql = " AND ".join(where_parts) if where_parts else "TRUE"
order_sql = ", ".join(order_parts) if order_parts else None
return where_sql, params, order_sql
+236
View File
@@ -0,0 +1,236 @@
from flask import g, request
from flask_smorest import Blueprint, abort
from src.api import tracking
from src.api.auth import require_token
from src.api.filters import FilterError, build_where, parse_aggregators
from src.db import aggregate_marches, count_marches, query_marches
from src.db import schema as duckdb_schema
from src.utils.data import DATA_SCHEMA
bp = Blueprint(
"api_v1",
"api_v1",
url_prefix="/api/v1",
description="API privée decp.info — accès tabulaire aux marchés publics.",
)
MAX_PAGE_SIZE = 1000
def _parse_pagination():
try:
page = int(request.args.get("page", "1"))
page_size = int(request.args.get("page_size", "50"))
except ValueError:
abort(400, message="page et page_size doivent être des entiers")
if page < 1:
abort(400, message="page doit être >= 1")
if page_size < 1 or page_size > MAX_PAGE_SIZE:
abort(
400,
message=f"page_size doit être dans [1, {MAX_PAGE_SIZE}]",
)
return page, page_size
def _parse_columns():
raw = request.args.get("columns")
if not raw:
return None
cols = [c.strip() for c in raw.split(",") if c.strip()]
unknown = [c for c in cols if c not in duckdb_schema]
if unknown:
abort(400, message=f"Colonnes inconnues : {unknown}")
return cols
def _build_links(page, page_size, total):
base = request.path
qs = request.args.to_dict(flat=False)
qs.pop("page", None)
def url_for(p):
from urllib.parse import urlencode
params = [(k, v) for k, vs in qs.items() for v in vs]
params.append(("page", str(p)))
return f"{base}?{urlencode(params)}"
prev_url = url_for(page - 1) if page > 1 else None
next_url = None
if total is None or page * page_size < total:
next_url = url_for(page + 1)
return {"prev": prev_url, "next": next_url}
@bp.after_request
def _track_consumption(response):
token_id = getattr(g, "token_id", None)
if token_id is not None:
tracking.enqueue_counter_update(token_id)
tracking.enqueue_matomo_event(
token_id=token_id,
path=request.path,
query_string=request.query_string.decode("utf-8", errors="replace"),
status_code=response.status_code,
user_agent=request.headers.get("User-Agent", ""),
)
return response
@bp.route("/health")
def health():
"""Sonde de santé, sans authentification."""
return {"status": "ok"}
@bp.route("/schema")
def schema():
"""Liste des champs disponibles dans le dataset DECP (format TableSchema)."""
return {"fields": list(DATA_SCHEMA.values())}
@bp.route("/data")
@bp.doc(
security=[{"BearerAuth": []}],
parameters=[
{
"name": "page",
"in": "query",
"schema": {"type": "integer", "default": 1, "minimum": 1},
"description": "Numéro de page (commence à 1).",
},
{
"name": "page_size",
"in": "query",
"schema": {"type": "integer", "default": 50, "minimum": 1, "maximum": 1000},
"description": "Nombre de résultats par page (max 1000).",
},
{
"name": "columns",
"in": "query",
"schema": {"type": "string"},
"description": "Liste de colonnes à retourner, séparées par des virgules (ex: `id,acheteur_id,montant`). Par défaut : toutes.",
},
{
"name": "count_results",
"in": "query",
"schema": {"type": "string", "enum": ["true", "false"], "default": "true"},
"description": "Inclure le total (`COUNT(*)`) dans `meta`. Mettre `false` pour accélérer la requête. Ignoré en mode agrégation.",
},
{
"name": "<colonne>__<opérateur>",
"in": "query",
"schema": {"type": "string"},
"description": (
"Filtre ou agrégation dynamique : `<colonne>__<opérateur>` "
"(voir les colonnes via `/schema`).\n\n"
"**Filtres** (`<colonne>__<op>=<valeur>`) :\n"
"- `exact` : égal à la valeur\n"
"- `differs` : différent de la valeur (null-safe, `IS DISTINCT FROM`)\n"
"- `contains` / `notcontains` : contient / ne contient pas (LIKE)\n"
"- `in` / `notin` : dans / hors d'une liste séparée par des virgules\n"
"- `less` / `greater` : ≤ / ≥\n"
"- `strictly_less` / `strictly_greater` : < / >\n"
"- `isnull` / `isnotnull` : valeur nulle / non nulle (sans valeur)\n"
"- `sort` : tri, valeur `asc` ou `desc`\n\n"
"**Agrégation** (drapeaux sans valeur, ex. `acheteur_departement_code__groupby&montant__sum`) :\n"
"- `groupby` : regroupe sur la colonne\n"
"- `count`, `sum`, `avg`, `min`, `max` : agrège la colonne ; "
"la colonne de sortie est nommée `colonne__count`, `colonne__sum`, "
"`colonne__avg`, `colonne__min`, `colonne__max`\n\n"
"En mode agrégation, la réponse contient des lignes groupées, "
"`columns` est interdit et `meta` ne contient pas `total`. "
"`sort` peut être appliqué sur une colonne `groupby` (ex. `acheteur_departement_code__sort=asc`) ; "
"il n'est pas supporté sur les alias d'agrégats (ex. `uid__count__sort=desc` → 400).\n\n"
"Exemples : `acheteur_id__contains=VILLE`, `montant__greater=10000`, "
"`acheteur_departement_code__groupby&montant__sum`, "
"`acheteur_departement_code__groupby&uid__count&acheteur_departement_code__sort=asc`."
),
},
],
)
@require_token
def data():
"""Récupère des marchés publics filtrés, triés ou agrégés.
Filtres en query string : `<colonne>__<opérateur>=<valeur>`.
Opérateurs de filtre : exact, differs, contains, notcontains, in, notin,
less, greater, strictly_less, strictly_greater, isnull, isnotnull, sort.
Agrégation (drapeaux sans valeur) : `<colonne>__groupby`,
`<colonne>__count|sum|avg|min|max`. Les colonnes agrégées sont nommées
`<colonne>__<opérateur>`. `columns` est interdit avec une agrégation et
`meta` ne contient alors pas `total`. `sort` est supporté sur les colonnes
`groupby` ; non supporté sur les alias d'agrégats (→ 400).
Paramètres réservés : page (défaut 1), page_size (défaut 50, max 1000),
columns (csv), count_results (true|false ; mettre false pour économiser
le COUNT(*)).
Exemple d'agrégation :
`?acheteur_departement_code__groupby&uid__count&montant__sum`
"""
import polars as pl
import polars.selectors as cs
page, page_size = _parse_pagination()
columns = _parse_columns()
count_results = request.args.get("count_results", "true").lower() != "false"
args = list(request.args.items(multi=True))
try:
agg = parse_aggregators(args, duckdb_schema)
where_sql, params, order_sql = build_where(args, duckdb_schema)
except FilterError as e:
abort(400, message=str(e), errors={"field": e.field})
if agg is not None:
if columns:
abort(
400,
message="`columns` ne peut pas être combiné avec une agrégation",
)
df = aggregate_marches(
select_sql=agg.select_sql,
where_sql=where_sql,
params=params,
group_by=agg.group_by_sql,
order_by=order_sql or None,
limit=page_size,
offset=(page - 1) * page_size,
)
df_ready = df.with_columns(cs.temporal().cast(pl.String))
# Si la page est partielle, on connaît le total exact ; sinon on ne sait pas.
agg_total = (
(page - 1) * page_size + df.height if df.height < page_size else None
)
return {
"data": df_ready.to_dicts(),
"meta": {"page": page, "page_size": page_size},
"links": _build_links(page, page_size, agg_total),
}
df = query_marches(
where_sql=where_sql,
params=params,
columns=columns,
order_by=order_sql,
limit=page_size,
offset=(page - 1) * page_size,
)
# JSON ne sérialise pas date/datetime nativement → cast en string ISO
df_ready = df.with_columns(cs.temporal().cast(pl.String))
total = count_marches(where_sql, params) if count_results else None
meta = {"page": page, "page_size": page_size}
if total is not None:
meta["total"] = total
return {
"data": df_ready.to_dicts(),
"meta": meta,
"links": _build_links(page, page_size, total),
}
+60
View File
@@ -0,0 +1,60 @@
import argparse
import os
import sys
from dotenv import load_dotenv
from src.api import tokens_db
def main(argv=None, env=None) -> int:
load_dotenv()
env = env if env is not None else os.environ
parser = argparse.ArgumentParser(prog="python -m src.api.tokens_cli")
sub = parser.add_subparsers(dest="cmd", required=True)
p_create = sub.add_parser("create", help="Créer un token API")
p_create.add_argument("--label", required=True)
p_create.add_argument("--user-id", type=int, default=None)
sub.add_parser("list", help="Lister les tokens")
p_revoke = sub.add_parser("revoke", help="Révoquer un token")
p_revoke.add_argument("token_id", type=int)
args = parser.parse_args(argv)
db_path = env["USERS_DB_PATH"]
tokens_db.init_schema(db_path)
if args.cmd == "create":
token, token_id = tokens_db.create_token(db_path, args.label, args.user_id)
print(f"id={token_id} label={args.label}")
print(f"token (à conserver, ne sera plus affiché) : {token}")
return 0
if args.cmd == "list":
rows = tokens_db.list_tokens(db_path)
if not rows:
print("(aucun token)")
return 0
print(
f"{'id':<4} {'label':<40} {'created_at':<26} {'last_used_at':<26} {'count':<7} revoked"
)
for r in rows:
print(
f"{r['id']:<4} {r['label']:<40} {r['created_at']:<26} "
f"{(r['last_used_at'] or '-'):<26} {r['count_total']:<7} "
f"{r['revoked_at'] or ''}"
)
return 0
if args.cmd == "revoke":
tokens_db.revoke_token(db_path, args.token_id)
print(f"token id={args.token_id} révoqué")
return 0
return 1
if __name__ == "__main__": # pragma: no cover
sys.exit(main())
+94
View File
@@ -0,0 +1,94 @@
import hashlib
import secrets
import sqlite3
from contextlib import contextmanager
from datetime import datetime, timezone
from pathlib import Path
TOKEN_PREFIX = "decpinfo_"
SCHEMA = """
CREATE TABLE IF NOT EXISTS api_tokens (
id INTEGER PRIMARY KEY,
token_hash TEXT NOT NULL UNIQUE,
label TEXT NOT NULL,
user_id INTEGER,
created_at TEXT NOT NULL,
last_used_at TEXT,
count_total INTEGER NOT NULL DEFAULT 0,
revoked_at TEXT
);
CREATE INDEX IF NOT EXISTS idx_api_tokens_hash ON api_tokens(token_hash);
"""
def _utcnow_iso() -> str:
return datetime.now(timezone.utc).isoformat(timespec="seconds")
def _hash(token: str) -> str:
return hashlib.sha256(token.encode()).hexdigest()
@contextmanager
def _connect(db_path):
conn = sqlite3.connect(str(db_path))
conn.row_factory = sqlite3.Row
try:
yield conn
finally:
conn.close()
def init_schema(db_path) -> None:
Path(db_path).parent.mkdir(parents=True, exist_ok=True)
with _connect(db_path) as conn:
conn.executescript(SCHEMA)
conn.commit()
def create_token(db_path, label: str, user_id: int | None = None) -> tuple[str, int]:
token = TOKEN_PREFIX + secrets.token_hex(32)
with _connect(db_path) as conn:
cur = conn.execute(
"INSERT INTO api_tokens (token_hash, label, user_id, created_at) "
"VALUES (?, ?, ?, ?)",
(_hash(token), label, user_id, _utcnow_iso()),
)
conn.commit()
return token, cur.lastrowid
def get_token_by_plaintext(db_path, token: str) -> dict | None:
with _connect(db_path) as conn:
row = conn.execute(
"SELECT * FROM api_tokens WHERE token_hash = ?",
(_hash(token),),
).fetchone()
return dict(row) if row else None
def revoke_token(db_path, token_id: int) -> None:
with _connect(db_path) as conn:
conn.execute(
"UPDATE api_tokens SET revoked_at = ? WHERE id = ?",
(_utcnow_iso(), token_id),
)
conn.commit()
def increment_usage(db_path, token_id: int) -> None:
with _connect(db_path) as conn:
conn.execute(
"UPDATE api_tokens "
"SET count_total = count_total + 1, last_used_at = ? "
"WHERE id = ?",
(_utcnow_iso(), token_id),
)
conn.commit()
def list_tokens(db_path) -> list[dict]:
with _connect(db_path) as conn:
rows = conn.execute("SELECT * FROM api_tokens ORDER BY id").fetchall()
return [dict(r) for r in rows]
+110
View File
@@ -0,0 +1,110 @@
import os
import queue
import threading
from typing import Optional
import httpx
from src.api import tokens_db
from src.utils import logger
_STOP_SENTINEL = object()
_queue: Optional[queue.Queue] = None
_worker_thread: Optional[threading.Thread] = None
def _worker_loop(q: queue.Queue, db_path: str) -> None:
while True:
item = q.get()
try:
if item is _STOP_SENTINEL:
return
kind, payload = item
if kind == "counter":
token_id = payload
try:
tokens_db.increment_usage(db_path, token_id)
except Exception: # noqa: BLE001
logger.warning(
"tracking: échec increment_usage token_id=%s",
token_id,
exc_info=True,
)
elif kind == "matomo":
try:
_post_matomo(**payload)
except Exception: # noqa: BLE001
logger.warning("tracking: échec envoi Matomo", exc_info=True)
finally:
q.task_done()
def _post_matomo(url: str, params: dict) -> None:
"""POST fire-and-forget vers la Tracking API Matomo. Mockable en test."""
httpx.post(url, data=params, timeout=5.0)
def enqueue_matomo_event(
token_id: int,
path: str,
query_string: str,
status_code: int,
user_agent: str,
) -> None:
if _queue is None:
return
if os.getenv("MATOMO_TRACKING_ENABLED", "false").lower() != "true":
return
url = os.getenv("MATOMO_URL")
site_id = os.getenv("MATOMO_SITE_ID")
if not url or not site_id:
return
full_url = f"https://decp.info{path}"
if query_string:
full_url += f"?{query_string}"
params = {
"idsite": site_id,
"rec": "1",
"url": full_url,
"action_name": f"API {path}",
"uid": f"token-{token_id}",
"dimension1": str(token_id),
"dimension2": str(status_code),
"ua": user_agent,
}
_queue.put(("matomo", {"url": url, "params": params}))
def start_worker(db_path: str) -> None:
global _queue, _worker_thread
if _worker_thread is not None and _worker_thread.is_alive():
return
_queue = queue.Queue()
_worker_thread = threading.Thread(
target=_worker_loop, args=(_queue, db_path), daemon=True
)
_worker_thread.start()
def stop_worker() -> None:
global _worker_thread, _queue
if _worker_thread is None:
return
_queue.put(_STOP_SENTINEL)
_worker_thread.join(timeout=2.0)
_worker_thread = None
_queue = None
def enqueue_counter_update(token_id: int) -> None:
if _queue is None:
return # tracking désactivé (tests par ex.)
_queue.put(("counter", token_id))
def flush(timeout: float = 2.0) -> None:
"""Attend que la queue soit drainée. Utile en test."""
q = _queue
if q is None:
return
q.join()
+150 -37
View File
@@ -1,37 +1,95 @@
import logging
import os
from shutil import rmtree
import dash_bootstrap_components as dbc
import pandas # noqa: F401 # eager import: avoid plotly's lazy-import race across Dash callback threads
import tomllib
from dash import Dash, dcc, html, page_container, page_registry
from dash import Dash, Input, Output, State, dcc, html, page_container, page_registry
from dotenv import load_dotenv
from flask import send_from_directory
from flask import Flask, Response
from src.utils import DEVELOPMENT
from src.utils.cache import cache
load_dotenv()
app = Dash(
external_stylesheets=[dbc.themes.SIMPLEX],
# if os.getenv("PYTEST_CURRENT_TEST"):
# os.environ["DATA_FILE_PARQUET_PATH"]
META_TAGS = [
{"name": "viewport", "content": "width=device-width, initial-scale=1"},
{
"name": "keywords",
"content": "commande publique, decp, marchés publics, données essentielles",
},
]
if DEVELOPMENT:
META_TAGS.append({"name": "robots", "content": "noindex"})
# Le cache doit être initialisé AVANT la construction de Dash : `use_pages=True`
# importe les modules de pages pendant l'instanciation, et certains appellent des
# fonctions memoizées (@cache.memoize) dès l'import (ex. tableau.py).
server = Flask(__name__)
cache_dir = os.getenv("CACHE_DIR", "/tmp/decp-cache")
if os.path.exists(cache_dir):
rmtree(cache_dir)
cache.init_app(
server,
config={
"CACHE_TYPE": "FileSystemCache",
"CACHE_DIR": cache_dir,
"CACHE_DEFAULT_TIMEOUT": int(
os.getenv("CACHE_DEFAULT_TIMEOUT", 3600 * 24)
), # 24h par défaut
"CACHE_THRESHOLD": 300,
},
)
app: Dash = Dash(
server=server,
title="decp.info",
use_pages=True,
compress=True,
meta_tags=META_TAGS,
)
# COSMO (belle font, blue),
# UNITED (rouge, ubuntu font),
# LUMEN (gros séparateur, blue clair),
# SIMPLEX (rouge, séparateur)
from src.api import init_api # noqa: E402 # inline: src.db.conn must be ready first
init_api(app.server)
# robots.txt
@app.server.route("/robots.txt")
def robots():
return send_from_directory("./assets", "robots.txt", mimetype="text/plain")
text = """User-agent: *
Allow: /
"""
return Response(text, mimetype="text/plain")
logger = logging.getLogger("decp.info")
logging.basicConfig(
format="%(asctime)s %(levelname)-8s %(message)s",
level=logging.INFO,
datefmt="%Y-%m-%d %H:%M:%S",
)
@app.server.route("/sitemap.xml")
def sitemap():
base_url = "https://decp.info"
pages = [
"/",
"/observatoire",
"/tableau",
"/a-propos",
"/etapes",
]
xml = '<?xml version="1.0" encoding="UTF-8"?>\n'
xml += '<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">\n'
for page in pages:
xml += " <url>\n"
xml += f" <loc>{base_url}{page}</loc>\n"
xml += " </url>\n"
xml += "</urlset>"
return Response(xml, mimetype="text/xml")
with open("./pyproject.toml", "rb") as f:
pyproject = tomllib.load(f)
@@ -46,6 +104,7 @@ app.index_string = """
<title>{%title%}</title>
{%favicon%}
{%css%}
<!-- canonical link -->
</head>
<body>
{%app_entry%}
@@ -72,39 +131,93 @@ app.index_string = """
</html>
"""
app.layout = html.Div(
[
navbar = dbc.Navbar(
dbc.Container(
fluid=True,
children=[
dbc.NavItem(
children=[
html.Div(
[
html.Div(
[
html.A(children=html.H1("decp.info"), href="/"),
dcc.Link(html.H1("decp.info"), href="/", className="logo"),
html.P(
children=html.A(
[
html.A(
version,
href="https://github.com/ColinMaudry/decp.info?tab=readme-ov-file#notes-de-version",
target="_blank",
),
href="https://github.com/ColinMaudry/decp.info/blob/main/CHANGELOG.md",
)
],
className="version",
),
],
className="logo",
),
html.Div(
[
dcc.Link(
page["name"], href=page["relative_path"], className="nav"
className="logo-wrapper",
)
for page in page_registry.values()
if page["name"] not in ["Acheteur", "Titulaire", "Marché"]
]
],
style={"minWidth": "230px"},
),
dbc.Nav(
children=[
dcc.Markdown(
os.getenv("ANNOUNCEMENTS"),
id="announcements",
dangerously_allow_html=True,
),
],
className="navbar",
style={
"maxWidth": "1200px",
"display": "inline-block",
},
navbar=True,
id="announcements-nav",
),
dbc.NavbarToggler(id="navbar-toggler"),
dbc.Collapse(
dbc.Nav(
[
dbc.NavItem(
dbc.NavLink(
page["name"].replace(" ", " "),
href=page["relative_path"],
active="exact",
)
)
for page in page_registry.values()
if page["name"]
in ["Recherche", "À propos", "Tableau", "Observatoire"]
],
className="ms-auto",
navbar=True,
),
id="navbar-collapse",
navbar=True,
),
],
),
color="light",
dark=False,
className="mb-4",
expand="lg",
)
app.layout = html.Div(
[
navbar,
dbc.Container(
page_container,
fluid=True,
id="page-content-container",
className="mb-4",
),
]
)
if __name__ == "__main__":
app.run(debug=True)
@app.callback(
Output("navbar-collapse", "is_open"),
[Input("navbar-toggler", "n_clicks")],
[State("navbar-collapse", "is_open")],
)
def toggle_navbar_collapse(n, is_open):
if n:
return not is_open
return is_open
+1
View File
@@ -0,0 +1 @@
<svg aria-hidden="true" focusable="false" data-prefix="far" data-icon="copy" class="svg-inline--fa fa-copy fa-w-14 " role="img" xmlns="http://www.w3.org/2000/svg" viewBox="0 0 448 512"><path fill="currentColor" d="M433.941 65.941l-51.882-51.882A48 48 0 0 0 348.118 0H176c-26.51 0-48 21.49-48 48v48H48c-26.51 0-48 21.49-48 48v320c0 26.51 21.49 48 48 48h224c26.51 0 48-21.49 48-48v-48h80c26.51 0 48-21.49 48-48V99.882a48 48 0 0 0-14.059-33.941zM266 464H54a6 6 0 0 1-6-6V150a6 6 0 0 1 6-6h74v224c0 26.51 21.49 48 48 48h96v42a6 6 0 0 1-6 6zm128-96H182a6 6 0 0 1-6-6V54a6 6 0 0 1 6-6h106v88c0 13.255 10.745 24 24 24h88v202a6 6 0 0 1-6 6zm6-256h-64V48h9.632c1.591 0 3.117.632 4.243 1.757l48.368 48.368a6 6 0 0 1 1.757 4.243V112z"></path></svg>

After

Width:  |  Height:  |  Size: 738 B

File diff suppressed because it is too large Load Diff
+767
View File
@@ -0,0 +1,767 @@
@import url(https://fonts.bunny.net/css?family=fira-code:400|inter:400,600);
/* ==========================================================================
Variables
========================================================================== */
:root {
--bs-font-monospace: "Fira Code";
--primary-color: rgb(179, 56, 33);
--primary-color-text: #b33821;
}
/* ==========================================================================
Base & Reset
========================================================================== */
body {
font-family: "Inter", sans-serif;
font-weight: 400;
background-color: rgb(255 240 240 / 40%);
-moz-osx-font-smoothing: grayscale;
-webkit-font-smoothing: antialiased;
font-smooth: always;
font-display: swap;
}
strong,
b {
font-weight: 600 !important;
}
h1,
h2,
h3,
h4,
h5 {
font-weight: 600;
}
h3 {
margin: 36px 0 20px 0;
}
/* Base Button Styles
button {
font-weight: 400;
background-color: #fff;
border-radius: 3px;
appearance: auto;
border: solid var(--primary-color) 1px;
} */
button.btn.btn-primary,
button.show-hide {
display: block;
border-radius: 3px;
outline: 0;
color: #fff;
border: 0;
height: 30px;
padding-top: 2px;
background-image: linear-gradient(
rgb(209, 96, 73),
rgb(179, 56, 33) 26%,
rgb(159, 36, 22)
);
}
button.btn.btn-primary:hover,
button.show-hide:hover {
background-image: linear-gradient(
rgb(239, 126, 103),
rgb(209, 86, 63) 26%,
rgb(189, 66, 52)
);
}
button[disabled] {
border-color: #ccc;
color: #666;
}
button:hover:not([disabled]) {
background-color: #fee;
}
/* Global Link Styles */
#_pages_content a {
color: #993333;
}
/* ==========================================================================
Layout
========================================================================== */
#_pages_content {
padding: 28px 24px 0 24px;
}
#header > * {
margin: 0 0 20px 0px;
}
/* ==========================================================================
Components
========================================================================== */
/* --- Navigation & Header --- */
a.logo {
color: black;
text-decoration: none;
}
a.logo > h1 {
font-weight: 400;
margin: 0;
line-height: 1;
}
.logo-wrapper {
display: flex;
align-items: baseline;
}
p.version {
margin: 0 0 0 12px;
font-family: "Fira Code";
font-size: 0.9rem;
}
p.version > a {
text-decoration: none;
margin-top: 10px;
}
.navbar-brand {
margin-right: 2px;
}
.navbar-nav .nav-link.active {
font-weight: 600;
}
#announcements {
margin: 25px 40px 0 60px;
font-size: 90%;
max-width: 900px;
}
#announcements p {
margin-bottom: 0.2rem;
}
.seeBorder {
border: dotted 1px green;
}
/* --- Search Page --- */
.tagline {
text-align: center;
font-size: 120%;
display: block;
margin-top: 50px;
}
#search {
margin: 30px auto 0px auto;
width: 500px;
font-size: 16px;
height: 30px;
display: block;
}
.search_options {
margin: 16px auto;
width: 450px;
}
.search_options input {
margin-right: 12px;
}
#search_results td[data-dash-column="Département"] {
text-wrap: wrap;
}
/* --- Dashboard inputs --- */
.Select--multi .Select-value {
color: var(--primary-color) !important;
background-color: rgba(255, 240, 240, 0.4) !important;
}
#filters .row > * {
margin-bottom: 6px;
}
#filters input[type="text"],
#filters input[type="number"] {
border: 1px #ccc solid;
border-radius: 3px;
padding-left: 8px;
}
/* --- Tables (Dash & Custom) --- */
/* Table Menu (Exports etc) */
.table-menu {
font-size: 16px;
margin: 12px 0 12px 0;
display: flex;
align-items: center;
flex-wrap: wrap;
}
.table-menu > * {
margin: 8px 16px 8px 0;
}
#source_table {
margin-bottom: 25px;
}
#source_table p {
line-height: 1.5;
}
/* Dash Table Overrides */
.column-header--sort {
margin-left: 3px;
}
dash-table-container dash-spreadsheet-menu table.cell-table {
margin-right: 8px;
margin-lef: 8px;
}
table.cell-table,
table.cell-table tr {
border-color: #fff;
padding: 0;
border-collapse: separate !important;
/* Required for border-radius */
border-spacing: 0;
}
table.cell-table th {
border-collapse: separate !important;
border-spacing: 0;
}
.dash-table-container p {
margin-bottom: 0;
}
.dash-table-container
.dash-spreadsheet-container
.dash-spreadsheet-inner
th.dash-header,
.dash-table-container
.dash-spreadsheet-container
.dash-spreadsheet-inner
th.dash-select-header {
margin: 0;
color: white;
font-family: "Inter", sans-serif;
text-align: left;
font-weight: 600;
padding: 2px 12px 4px 2px;
border: 1px solid rgb(179, 56, 33) !important;
background-color: rgb(179, 56, 33);
border-bottom: none !important;
height: 32px;
}
.dash-table-container
.dash-spreadsheet-container
.dash-spreadsheet-inner
table.cell-table
tr:first-of-type
th.dash-header:first-of-type,
.dash-table-container
.dash-spreadsheet-container
.dash-spreadsheet-inner
table.cell-table
tr:first-of-type
th.dash-select-header:first-of-type {
border-top-left-radius: 3px !important;
}
.dash-table-container
.dash-spreadsheet-container
.dash-spreadsheet-inner
table.cell-table
tr:first-of-type
th.dash-header:last-of-type {
border-top-right-radius: 3px !important;
}
/* Dash Filters */
.dash-table-container
.dash-spreadsheet-container
.dash-spreadsheet-inner
.cell-table
.dash-filter
input[type="text"] {
border-color: #ccc;
border-style: solid;
border-width: 1px;
border-radius: 3px;
height: 28px;
font-family: "Fira Code";
caret-color: #000;
background-color: rgb(250 250 250);
text-align: left !important;
padding: 1px 2px 0 2px;
vertical-align: center;
}
.dash-table-container
.dash-spreadsheet-container
.dash-spreadsheet-inner
.cell-table
.dash-filter
input[type="text"]::placeholder {
color: #999;
}
.dash-filter--case {
display: none;
}
.dash-table-container
.dash-spreadsheet-container
.dash-spreadsheet-inner
.cell-table
th.dash-filter {
background-color: #ccc;
}
/* Custom Marches Table */
.dash-table-container
.dash-spreadsheet-container
.dash-spreadsheet-inner
.cell-table
td {
padding-left: 5px;
padding-right: 5px;
}
.dash-table-container
.dash-spreadsheet-container
.dash-spreadsheet-inner
td
div.dash-cell-value.cell-markdown {
font-family: "Inter", sans-serif !important;
font-weight: 400;
}
.marches_table.stuck {
position: relative;
right: 200px;
}
.marches_table .cell-table tr:nth-child(even) td {
background-color: rgb(255 240 240 / 40%);
}
/* Column Visibility Menu */
.column-actions {
margin-right: 8px;
}
.column-header--hide {
display: none;
}
button.show-hide {
position: relative;
width: 180px;
margin: 0 0 10px 0;
display: none;
}
/*
.show-hide::before {
background: inherit;
content: "Colonnes affichées";
position: absolute;
left: 5px;
right: 5px;
#column_list .show-hide,
#table .show-hide {
display: none;
}
.show-hide-menu-item > input {
margin-right: 10px;
} */
#btn-copy-url:before {
}
/* Dropdowns */
.Select-placeholder {
color: #333 !important;
}
/* Checkboxes */
input[type="checkbox"] {
height: 17px;
width: 17px;
}
/* Tooltips */
.dash-tooltip,
.dash-table-tooltip {
color: #333;
width: 400px !important;
max-width: 400px !important;
height: 150px !important;
max-height: 150px !important;
overflow: hidden;
}
.dash-tooltip pre,
.dash-tooltip code {
overflow: hidden;
height: 150px;
text-wrap: wrap;
font-family: "Inter", sans-serif;
}
/* --- Organization Cards (Grid Items) --- */
#cards .card {
margin-bottom: 16px;
}
.org_infos > p {
margin: 8px 0;
}
/* --- About Page (A Propos) --- */
.a-propos-container {
display: flex;
flex-wrap: wrap;
align-items: flex-start;
position: relative;
max-width: 1200px;
margin: 0 auto;
}
.a-propos-content {
flex: 1 1 70%;
max-width: 75%;
padding-right: 40px;
}
.a-propos-toc {
flex: 0 0 25%;
max-width: 25%;
/* Keeps it from growing too large */
position: sticky;
top: 40px;
/* Sticks 40px from the top of the viewport */
border-left: 2px solid #333;
/* Dark vertical line like hedgedoc */
padding-left: 15px;
margin-top: 40px;
background-color: #fff;
/* Aligns visually with the first header */
}
/* TOC Links */
.toc-link {
display: block;
color: #666;
text-decoration: none;
font-size: 0.9em;
padding: 2px 0;
transition: color 0.2s, font-weight 0.2s;
line-height: 1.4;
}
.toc-link:hover {
color: #000;
text-decoration: none;
}
.toc-active {
color: #000;
font-weight: bold;
}
.toc-level-2 {
margin-left: 15px;
font-size: 0.85em;
}
.toc-header {
font-weight: bold;
margin-bottom: 10px;
display: block;
color: #333;
}
/* --- Misc & Utility --- */
#instructions {
max-width: 1000px;
}
details > div {
padding-top: 24px;
}
summary > h4 {
margin: 0;
display: inline;
}
/* ==========================================================================
Media Queries
========================================================================== */
@media (max-width: 992px) {
/* Navigation */
#announcements-nav {
display: none !important;
}
/* About Page */
.a-propos-content {
max-width: 100%;
padding-right: 0;
flex: 1 1 100%;
}
.a-propos-toc {
display: none;
}
}
input[type="number"]::-webkit-outer-spin-button,
input[type="number"]::-webkit-inner-spin-button {
-webkit-appearance: none;
margin: 0;
}
input[type="number"] {
-moz-appearance: textfield;
}
/* ===== Page /etapes : graphique données par étape et par seuil ===== */
.etapes-chart-scroll {
overflow-x: auto;
margin: 1rem 0;
}
.etapes-chart {
min-width: 720px;
background: #fff;
border: 1px solid #d0d5dd;
border-radius: 8px;
overflow: hidden;
font-size: 13px;
display: grid;
grid-template-columns: 150px repeat(5, 1fr);
}
.etapes-corner {
border-bottom: 2px solid #344054;
}
.etapes-xhead {
grid-column: 2 / -1;
display: grid;
grid-template-columns: repeat(5, 1fr);
border-bottom: 2px solid #344054;
}
.etapes-xcell {
text-align: center;
padding: 6px 2px;
font-size: 11px;
color: #475467;
border-left: 1px dashed #d0d5dd;
}
.etapes-xcell strong {
display: block;
color: #101828;
font-size: 12px;
}
.etapes-stage {
padding: 14px 10px;
font-weight: 600;
color: #101828;
border-bottom: 1px solid #eaecf0;
display: flex;
align-items: center;
}
.etapes-stage small {
font-weight: 400;
color: #667085;
}
.etapes-lane {
grid-column: 2 / -1;
position: relative;
border-bottom: 1px solid #eaecf0;
min-height: 52px;
}
.etapes-segs {
position: absolute;
inset: 0;
display: grid;
grid-template-columns: repeat(5, 1fr);
}
.etapes-segs > div {
border-left: 1px dashed #eaecf0;
}
.etapes-bar {
position: absolute;
top: 9px;
height: 32px;
border-radius: 6px;
color: #fff;
font-size: 11px;
font-weight: 600;
display: flex;
align-items: center;
padding: 0 10px;
box-shadow: 0 1px 2px rgba(0, 0, 0, 0.12);
white-space: nowrap;
overflow: hidden;
cursor: pointer;
transition: filter 0.15s, box-shadow 0.15s;
}
.etapes-bar:hover {
filter: brightness(1.12);
box-shadow: 0 2px 8px rgba(0, 0, 0, 0.22);
}
.etapes-empty {
color: #98a2b3;
font-style: italic;
padding: 14px;
display: flex;
align-items: center;
}
.etapes-note {
margin-top: 8px;
color: #667085;
font-size: 13px;
}
/* --- Vue mobile (liste par étape) : masquée par défaut --- */
.etapes-mobile {
display: none;
margin: 1rem 0;
}
.etapes-m-block {
border: 1px solid #d0d5dd;
border-radius: 8px;
margin-bottom: 12px;
overflow: hidden;
}
.etapes-m-header {
display: flex;
align-items: center;
justify-content: space-between;
background: #f9fafb;
border-bottom: 1px solid #eaecf0;
}
.etapes-m-stage {
margin: 0;
padding: 10px 12px;
font-size: 15px;
color: #101828;
}
.etapes-m-link {
background: none;
border: none;
color: #1570ef;
font-size: 12px;
font-weight: 600;
cursor: pointer;
padding: 0 12px;
white-space: nowrap;
}
.etapes-m-link:hover {
text-decoration: underline;
}
.etapes-m-item {
display: flex;
align-items: baseline;
gap: 8px;
padding: 8px 12px;
border-bottom: 1px solid #f2f4f7;
font-size: 13px;
}
.etapes-m-item:last-child {
border-bottom: none;
}
.etapes-m-item i {
width: 12px;
height: 12px;
border-radius: 3px;
flex: 0 0 auto;
position: relative;
top: 2px;
}
.etapes-m-label {
font-weight: 600;
color: #101828;
}
.etapes-m-seuil {
color: #667085;
}
.etapes-m-empty {
color: #98a2b3;
font-style: italic;
}
.etapes-detail {
margin: 1rem 0;
padding: 1rem 1.25rem;
border: 1px solid #d0d5dd;
border-radius: 8px;
background: #f9fafb;
}
.etapes-detail:empty {
display: none;
}
/* --- Bascule desktop / mobile au point de rupture 768 px --- */
@media (max-width: 768px) {
.etapes-chart-scroll {
display: none;
}
.etapes-mobile {
display: block;
}
}
+132
View File
@@ -0,0 +1,132 @@
window.dash_clientside = Object.assign({}, window.dash_clientside, {
leaflet: {
pointToLayer: function (feature, latlng, context) {
return L.circleMarker(latlng, {
radius: 5,
fillColor: feature.properties.marker_color,
color: "white",
weight: 1,
opacity: 1,
fillOpacity: 0.8,
}).bindTooltip(feature.properties.tooltip);
},
clusterToLayer: function (feature, latlng, index, context) {
console.log(feature);
console.log(index);
console.log(context);
const count = feature.properties.point_count;
const size = count < 100 ? 30 : count < 1000 ? 40 : 50;
const color = "#555"; // Default cluster color
const icon = L.divIcon({
html: `<div style="background-color: ${context.fillColor}; width: ${size}px; height: ${size}px; border-radius: 50%; display: flex; align-items:center; justify-content:center; color: white; border: 2px solid white; font-weight: bold;">${count}</div>`,
className: "marker-cluster",
iconSize: L.point(size, size),
});
return L.marker(latlng, { icon: icon });
},
},
clientside: {
clean_filters: function (trigger) {
if (!trigger) {
return window.dash_clientside.no_update;
}
// Helper to set value on a React text input
const setNativeValue = (element, value) => {
const valueSetter = Object.getOwnPropertyDescriptor(
element,
"value"
).set;
const prototype = Object.getPrototypeOf(element);
const prototypeValueSetter = Object.getOwnPropertyDescriptor(
prototype,
"value"
).set;
if (valueSetter && valueSetter !== prototypeValueSetter) {
prototypeValueSetter.call(element, value);
} else {
valueSetter.call(element, value);
}
element.dispatchEvent(new Event("input", { bubbles: true }));
};
const cleanInputs = () => {
const inputs = document.querySelectorAll(
'.dash-filter input[type="text"]'
);
inputs.forEach((input) => {
let val = input.value;
let original = val;
// Remove "icontains " prefix
if (/^icontains\s+/i.test(val)) {
val = val.replace(/^icontains\s+/i, "");
// Check for surrounding quotes (single or double) and remove them
if (
(val.startsWith('"') && val.endsWith('"')) ||
(val.startsWith("'") && val.endsWith("'"))
) {
val = val.substring(1, val.length - 1);
}
}
// Handle relational operators (i<, s>, i<=, etc.)
else if (/^[is][<>]=?/i.test(val)) {
val = val.substring(1);
}
if (val !== original) {
try {
// Try setting it the React-friendly way
setNativeValue(input, val);
} catch (e) {
// Fallback to direct assignment if fancy way fails
input.value = val;
}
}
});
};
// Use MutationObserver to wait for table to appear/update
const observer = new MutationObserver((mutations) => {
cleanInputs();
});
const target = document.querySelector(".dash-table-container");
if (target) {
observer.observe(target, {
childList: true,
subtree: true,
attributes: true,
attributeFilter: ["value"],
});
// Disconnect after 5 seconds
setTimeout(() => {
observer.disconnect();
}, 5000);
// Also try immediately just in case
cleanInputs();
} else {
// Poll briefly if container not found yet
const checkInterval = setInterval(() => {
const t = document.querySelector(".dash-table-container");
if (t) {
clearInterval(checkInterval);
observer.observe(t, { childList: true, subtree: true });
setTimeout(() => observer.disconnect(), 5000);
cleanInputs();
}
}, 200);
// Stop polling after 2s if still nothing
setTimeout(() => clearInterval(checkInterval), 2000);
}
return window.dash_clientside.no_update;
},
},
});
Binary file not shown.

After

Width:  |  Height:  |  Size: 333 KiB

-41
View File
@@ -1,41 +0,0 @@
# START YOAST BLOCK
# Copié depuis https://next.ink/robots.txt
# ---------------------------
User-agent: *
Allow: /
# ---------------------------
# END YOAST BLOCK
User-agent: GPTBot
Disallow: /
User-agent: ChatGPT-User
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Amazonbot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-Agent: FacebookBot
Disallow: /
User-Agent: Applebot
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: Claude-Web
Disallow: /
User-agent: Diffbot
Disallow: /
User-agent: ImagesiftBot
Disallow: /
User-agent: Omgilibot
Disallow: /
User-agent: Omgili
Disallow: /
User-agent: YouBot
Disallow: /
-240
View File
@@ -1,240 +0,0 @@
/* Change la marge bout d'export */
.table-menu {
font-size: 16px;
margin: 12px;
height: 36px;
}
.table-menu > * {
margin: 8px;
float: left;
}
#source_table p {
line-height: 1.5;
}
#source_table {
margin-bottom: 25px;
}
#instructions {
max-width: 1000px;
}
details > div {
padding-top: 24px;
}
/* Logo et version */
div.logo {
width: 230px;
}
p.version {
float: left;
margin-top: 21px;
margin-left: 12px;
}
p.version > a {
text-decoration: none;
}
div.logo h1 {
float: left;
}
div.logo > a {
text-decoration: none;
color: black;
}
/* Réduire la taille du texte de la colonne Objet */
td[data-dash-column="objet"] {
font-size: 85%;
}
/* Couleur des en-têtes */
.dash-table-container
.dash-spreadsheet-container
.dash-spreadsheet-inner
th.dash-header {
background-color: #b33821;
color: white;
font-family: sans-serif;
text-align: left;
}
.dash-table-container
.dash-spreadsheet-container
.dash-spreadsheet-inner
th.dash-filter {
background-color: #f0afa3;
}
.dash-table-container p {
margin-bottom: 0;
}
.dash-filter--case {
display: none;
}
.dash-tooltip,
.dash-table-tooltip {
color: #333;
width: 400px !important;
max-width: 400px !important;
height: 150px !important;
max-height: 150px !important;
overflow: hidden;
}
.dash-tooltip pre,
.dash-tooltip code {
overflow: hidden;
height: 150px;
text-wrap: wrap;
font-family: sans-serif;
}
/* Menu de masquage des colonnes */
.column-actions {
margin-right: 8px;
}
.column-header--hide {
display: none;
}
.show-hide {
position: relative;
width: 180px;
margin: 0 0 10px 10px;
}
.show-hide::before {
background: inherit;
content: "Colonnes affichées";
position: absolute;
left: 5px;
right: 5px;
}
.show-hide-menu-item > input {
margin-right: 10px;
}
/* Alternance des couleurs pour les lignes */
.marches_table {
font-family: sans-serif;
}
.marches_table .cell-table tr:nth-child(even) td {
background-color: #feeeee;
font-family: sans-serif;
}
#header > *,
.dash-spreadsheet-menu button.export {
margin: 0 0 20px 20px;
}
/* Menu de navigation */
.navbar {
width: 100%;
height: 100px;
padding: 0 10px;
border: 0;
border-bottom: solid 1px black;
}
a.nav {
float: left;
margin-right: 40px;
font-size: 120%;
}
h3 {
margin: 36px 0 24px 0;
}
summary > h3 {
margin: 0;
display: inline;
}
#_pages_content {
padding-top: 28px;
}
/* Vue acheteur/titulaire */
.wrapper {
display: grid;
grid-gap: 10px;
margin-bottom: 50px;
justify-content: space-between;
}
.wrapper > div {
}
.org_title {
grid-column: 1 / 3;
grid-row: 1;
}
.org_year {
grid-column: 3;
grid-row: 1;
}
.org_infos {
grid-column: 1;
grid-row: 2;
}
.org_infos > p {
margin: 8px 0;
}
.org_stats {
grid-column: 2;
grid-row: 2;
}
.org_map {
grid-column: 3;
grid-row: 2;
}
/* Vue marché */
.marche_infos p {
margin-top: 6px;
margin-bottom: 6px;
}
.marche_title {
grid-column: 1/3;
grid-row: 1;
}
.marche_map {
grid-column: 3;
grid-row: 2;
width: 400px;
}
.marche_infos_1 {
grid-column: 1;
grid-row: 2;
}
.marche_infos_2 {
grid-column: 2;
grid-row: 2;
}
+223
View File
@@ -0,0 +1,223 @@
import fcntl
import os
from pathlib import Path
from time import sleep
import duckdb
import polars as pl
import polars.selectors as cs
from polars.exceptions import ComputeError
from src.utils import get_last_modified, logger
def should_rebuild(db_path: Path, parquet_path: str) -> bool:
db_path = Path(db_path)
if not db_path.exists():
return True
dev = os.getenv("DEVELOPMENT", "False").lower() == "true"
force = os.getenv("REBUILD_DUCKDB", "False").lower() == "true"
if dev and not force:
return False
last_modified: float = get_last_modified(parquet_path)
return last_modified > db_path.stat().st_mtime
def _load_source_frame() -> pl.DataFrame:
"""Read the source parquet and apply the row-level transforms.
Kept here (not in utils.py) so src.db has no dependency on utils.
Mirrors the behavior previously in utils.get_decp_data().
"""
parquet_path: str = os.getenv("DATA_FILE_PARQUET_PATH", "")
if not (parquet_path.startswith("http")):
assert os.path.exists(parquet_path)
try:
lff: pl.LazyFrame = pl.scan_parquet(str(parquet_path))
except ComputeError:
logger.info("Lecture du parquet échouée, nouvelle tentative dans 10s...")
sleep(10)
lff = pl.scan_parquet(str(parquet_path))
lff = lff.sort(by=["dateNotification", "uid"], descending=True, nulls_last=True)
lff = lff.filter(pl.col("donneesActuelles")).drop("donneesActuelles")
# booleans_to_strings: true → "oui", false → "non"
lff = lff.with_columns(
pl.col(cs.Boolean)
.cast(pl.String)
.str.replace("true", "oui")
.str.replace("false", "non")
)
for col in ["acheteur_nom", "titulaire_nom"]:
lff = lff.with_columns(
pl.when(pl.col(col).is_null())
.then(pl.lit("[Identifiant non reconnu dans la base INSEE]"))
.otherwise(pl.col(col))
.name.keep()
)
return lff.collect()
def build_database(db_path: Path) -> None:
"""Build the DuckDB database atomically under an exclusive lock.
Caller MUST hold the fcntl.flock on the .lock file.
"""
db_path = Path(db_path)
tmp_path = db_path.with_suffix(".duckdb.tmp")
staging_parquet = db_path.with_suffix(".staging.parquet")
if tmp_path.exists():
tmp_path.unlink()
logger.info(
f"Construction de la base DuckDB à partir de {os.getenv('DATA_FILE_PARQUET_PATH', '')}..."
)
frame = _load_source_frame()
# Write transformed frame as parquet so DuckDB can read it natively
# (avoids pyarrow dependency for the Polars→DuckDB handoff)
frame.write_parquet(str(staging_parquet))
try:
with duckdb.connect(str(tmp_path)) as w:
w.execute(
f"CREATE TABLE decp AS SELECT * FROM read_parquet('{staging_parquet}')"
)
w.execute(
"CREATE TABLE acheteurs_marches AS "
"SELECT DISTINCT uid, objet, acheteur_id FROM decp "
"ORDER BY acheteur_id"
)
w.execute(
"CREATE TABLE titulaires_marches AS "
"SELECT DISTINCT uid, objet, titulaire_id FROM decp "
"ORDER BY titulaire_id"
)
w.execute(
"CREATE TABLE acheteurs_departement AS "
"SELECT DISTINCT acheteur_id, acheteur_nom, acheteur_departement_code "
"FROM decp ORDER BY acheteur_nom"
)
w.execute(
"CREATE TABLE titulaires_departement AS "
"SELECT DISTINCT titulaire_id, titulaire_nom, titulaire_departement_code "
"FROM decp ORDER BY titulaire_nom"
)
finally:
if staging_parquet.exists():
staging_parquet.unlink()
os.replace(tmp_path, db_path)
logger.info(f"Base DuckDB construite : {db_path}")
def _ensure_database() -> Path:
db_path = Path(os.getenv("DUCKDB_PATH", "./decp.duckdb"))
parquet_path = os.getenv("DATA_FILE_PARQUET_PATH", "")
lock_path = db_path.with_suffix(".duckdb.lock")
db_exists = db_path.exists()
with open(lock_path, "w") as lock_fd:
fcntl.flock(lock_fd, fcntl.LOCK_EX)
try:
if should_rebuild(db_path, parquet_path):
build_database(db_path)
else:
logger.debug("Base de données déjà disponible et à jour.")
except Exception as e:
if db_exists and db_path.exists():
logger.error(
f"Bootstrap données KO ({e}). "
f"Réutilisation du DuckDB existant : {db_path}"
)
else:
logger.critical("Aucune base DuckDB et reconstruction impossible.")
raise
return db_path
DB_PATH = _ensure_database()
conn: duckdb.DuckDBPyConnection = duckdb.connect(str(DB_PATH), read_only=True)
schema: pl.Schema = conn.execute("SELECT * FROM decp LIMIT 0").pl().schema
def get_cursor() -> duckdb.DuckDBPyConnection:
"""Return a per-request cursor that shares the process-wide connection."""
return conn.cursor()
def query_marches(
where_sql: str = "TRUE",
params: tuple | list = (),
columns: list[str] | None = None,
order_by: str | None = None,
limit: int | None = None,
offset: int | None = None,
) -> pl.DataFrame:
"""Run a parameterized SELECT against the decp table and return Polars.
`where_sql` and `order_by` are trusted SQL fragments (callers are internal
code, never user input). `params` values are passed through DuckDB's
parameter binding.
"""
cols = ", ".join(columns) if columns else "*"
sql = f"SELECT {cols} FROM decp WHERE {where_sql}"
if order_by:
sql += f" ORDER BY {order_by}"
if limit is not None:
sql += f" LIMIT {int(limit)}"
if offset is not None:
sql += f" OFFSET {int(offset)}"
logger.debug("query_marches: " + sql.replace("?", "{}").format(*params))
return get_cursor().execute(sql, list(params)).pl()
def count_marches(where_sql: str = "TRUE", params: tuple | list = ()) -> int:
"""Retourne le nombre de lignes correspondant à where_sql."""
sql = f"SELECT COUNT(*) FROM decp WHERE {where_sql}"
logger.debug("count_marches: " + sql.replace("?", "{}").format(*params))
result = get_cursor().execute(sql, list(params)).fetchone()
return int(result[0]) if result else 0
def count_unique_marches(where_sql: str = "TRUE", params: tuple | list = ()) -> int:
"""Retourne le nombre de uid distincts correspondant à where_sql."""
sql = f"SELECT COUNT(DISTINCT uid) FROM decp WHERE {where_sql}"
logger.debug("count_unique_marches: " + sql.replace("?", "{}").format(*params))
result = get_cursor().execute(sql, list(params)).fetchone()
return int(result[0]) if result else 0
def aggregate_marches(
select_sql: str,
where_sql: str = "TRUE",
params: tuple | list = (),
group_by: str | None = None,
order_by: str | None = None,
limit: int | None = None,
offset: int | None = None,
) -> pl.DataFrame:
"""SELECT agrégé paramétré contre la table decp.
`select_sql`, `group_by` et `order_by` sont des fragments SQL construits
depuis des noms de colonnes validés (jamais de valeur utilisateur libre).
Les valeurs de filtre passent par le binding `?` via `params`.
"""
sql = f"SELECT {select_sql} FROM decp WHERE {where_sql}"
if group_by:
sql += f" GROUP BY {group_by}"
if order_by:
sql += f" ORDER BY {order_by}"
if limit is not None:
sql += f" LIMIT {int(limit)}"
if offset is not None:
sql += f" OFFSET {int(offset)}"
logger.debug("aggregate_marches: " + sql.replace("?", "{}").format(*params))
return get_cursor().execute(sql, list(params)).pl()
+911 -90
View File
File diff suppressed because it is too large Load Diff
+161 -53
View File
@@ -3,25 +3,31 @@ import os
from dash import dcc, html, register_page
from src.figures import get_sources_tables
from src.utils import meta_content
from src.utils.seo import META_CONTENT
name = "À propos"
NAME = "À propos"
register_page(
__name__,
path="/a-propos",
title=meta_content["title"],
name=name,
description=meta_content["description"],
image_url=meta_content["image_url"],
title="À propos | decp.info",
name="À propos",
description="En savoir plus sur decp.info, l'outil d'exploration des données essentielles de la commande publique.",
image_url=META_CONTENT["image_url"],
order=5,
)
layout = [
html.Div(
layout = html.Div(
className="container",
children=[
html.H2(name),
html.H2(NAME),
html.Div(
className="a-propos-container",
children=[
# Main Content Column
html.Div(
className="a-propos-content",
children=[
dcc.Markdown(
"""Outil d'exploration libre et gratuit des données de marchés publics, développé par Colin Maudry.
@@ -32,20 +38,49 @@ En effet, le potentiel des données d'attribution de marchés et des données qu
les fonctionnalités actuelles de decp.info. Il est ainsi possible de rajouter
- de nombreuses visualisations de données (cartes, graphiques, tableaux) sur des thématiques variées (vivacité de la concurrence, secteurs d'activité, insertion par l'activité économique (IAE), distance acheteur-titulaire...)
- la sauvegarde de filtres pour les retrouver plus tard et les partager
- des alertes par email si des marchés correspondant à certains critères
- le développement d'une API pour alimenter d'autres logiciels
- ...et toutes les fonctionnalités auxquelles vous pourrez penser
"""
),
html.H4("Consommer les données brutes", id="donnees-brutes"),
dcc.Markdown(
"""
Vous pouvez consommer les données qui alimentent decp.info
- en les téléchargeant [sur data.gouv.fr](https://www.data.gouv.fr/datasets/donnees-essentielles-de-la-commande-publique-consolidees-format-tabulaire) (Parquet, CSV), pensez à lire la description du jeu de données
- en interrogeant l'[API REST ouverte](https://www.data.gouv.fr/datasets/donnees-essentielles-de-la-commande-publique-consolidees-format-tabulaire#user-content-api-rest)
"""
),
html.H4("API privée", id="api-privee"),
dcc.Markdown(
"""
Une API HTTP est disponible pour accéder aux mêmes données par programme.
Documentation interactive : [Swagger UI](/api/v1/swagger).
L'accès se fait sur token. Pour en obtenir un, contactez
[colin@maudry.com](mailto:colin@maudry.com).
"""
),
html.H4("Contact", id="contact"),
dcc.Markdown(
"""
- Email : [colin@colmo.tech](mailto:colin@colmo.tech)
- Bluesky : [@col1m.bsky.social](https://bsky.app/profile/col1m.bsky.social)
- Mastodon : [col1m@mamot.fr](https://mamot.fr/@col1m)
- LinkedIn : [colinmaudry](https://www.linkedin.com/in/colinmaudry/)
"""
),
html.H4("Pour contribuer", id="contribuer"),
dcc.Markdown("""
dcc.Markdown(
"""
- via l'achat d'une prestation de service (devis, prestation, facture), vous pouvez financer le développement de [fonctionnalités prévues](https://github.com/ColinMaudry/decp.info/issues), ou d'autres !
- ma société accepte aussi les dons (pas de réduction d'impôt possible)
- [écrivez-moi](/contact) et on discute !
#### Pour explorer le projet
- écrivez-moi et on discute !
"""
),
html.H4("Pour explorer le projet", id="explorer"),
dcc.Markdown(
"""
- [inscription à la liste de diffusion](https://6254d9a3.sibforms.com/serve/MUIFAEonUVkoSVrdgey18CTgLyI16xw4yeu-M-YOUzhWE_AgfQfbgkyT7GvA_RYLro9MfuRqkzQxSvu7-uzbMSv2a2ZQPsliM7wtiiqIL8kR2zOvl6m11fb5qjcOxMAYsLiY_YBi3P7NY95CTJ8vRY4CpsDclF2iLooOElKkTgIgi5nePe7zAIrgiYM5v2EuALlGJZMEG9vBP-Cu) (annonces des mises à jour et évènements, maximum une fois par mois)
- 💾 [données consolidées en Open Data](https://www.data.gouv.fr/datasets/donnees-essentielles-de-la-commande-publique-consolidees-format-tabulaire/)
- 🗞 [mon blog](https://colin.maudry.com)
@@ -53,34 +88,33 @@ les fonctionnalités actuelles de decp.info. Il est ainsi possible de rajouter
- 🚰 code source
- [de decp.info](https://github.com/ColinMaudry/decp.info)
- [du traitement des données](https://github.com/ColinMaudry/decp-processing)
"""),
html.H4("Qualité et exhaustivité des données", id="qualite-exhausitivite"),
dcc.Markdown("""Les données visibles sur ce site proviennent exclusivement de la publication de données ouvertes par les acheteurs publics ou en leur nom, régie par [l'arrêté du 22 décembre 2022](https://www.legifrance.gouv.fr/jorf/id/JORFTEXT000046850496). Leur qualité est donc principalement liée à la qualité de leur saisie par les agents publics, parfois peu aidé·es par la qualité des outils à leur disposition. Je pense que l'analyse de marchés individuels et le comptage de marchés sur des critères autres que financiers sont plutôt fiables. En revanche, certains montants de marché estimés à des valeurs farfelues ([1 euro](https://decp.info/marches/432766947000192025S01301), [1 milliard](https://decp.info/marches/2459004280001320210000000271)) faussent les calculs par aggrégation (sommes, moyennes, médianes) et donc la production de statistiques financières fiables. Acheteurs, acheteuses : s'il vous plaît, essayez d'estimer les montants des marchés publics attribués de manière plus précise.
"""
),
html.H4(
"Qualité et exhaustivité des données",
id="qualite-exhausitivite",
),
dcc.Markdown(
"""Les données visibles sur ce site proviennent exclusivement de la publication de données ouvertes par les acheteurs publics ou en leur nom, régie par [l'arrêté du 22 décembre 2022](https://www.legifrance.gouv.fr/jorf/id/JORFTEXT000046850496). Leur qualité est donc principalement liée à la qualité de leur saisie par les agents publics, parfois peu aidé·es par la qualité des outils à leur disposition. Je pense que l'analyse de marchés individuels et le comptage de marchés sur des critères autres que financiers sont plutôt fiables. En revanche, certains montants de marché estimés à des valeurs farfelues ([1 euro](https://decp.info/marches/432766947000192025S01301), [1 milliard](https://decp.info/marches/2459004280001320210000000271)) faussent les calculs par aggrégation (sommes, moyennes, médianes) et donc la production de statistiques financières fiables. Acheteurs, acheteuses : s'il vous plaît, essayez d'estimer les montants des marchés publics attribués de manière plus précise.
Quant à l'exhaustivité, je consolide toutes les sources de données exploitables que j'ai pu identifier (voir [statistiques](/statistiques)). Certains profils d'acheteurs ne publient pas leurs données malgré l'obligation réglementaire :
- marches-securises.fr
- klekoon.fr (ils y travaillent)
**marches-publics.gouv.fr** (PLACE, [AIFE](https://aife.economie.gouv.fr)), la plateforme des marchés de l'État, ne publie plus de données depuis le 1er janvier 2024 et l'entrée en vigueur de l'arrêté. Nous n'avons donc plus de données sur les marchés publics passés par les ministères, ainsi que sur ceux passés par les acheteurs clients d'[achatpublic.com](https://www.achatpublic.com), qui s'appuie sur les moyens de publication de l'AIFE.
**marches-publics.info** (AWS) publie ses données de manière assez sporadique depuis début 2023. Compte tenu de son poids dans le secteur, c'est assez dommageable pour la transparence des marchés publics.
Au milieu de ces mauvaises nouvelles, je tiens à souligner la belle continuité de la publication par la DGFiP des données des marchés publics remontées via le [protocole PES](https://www.collectivites-locales.gouv.fr/finances-locales/le-protocole-dechange-standard-pes). Merci à leurs équipes."""),
html.H4("Sources de données ", id="qualite-exhausitivite"),
Quant à l'exhaustivité, je consolide toutes les sources de données exploitables que j'ai pu identifier (voir [ci-dessous](/bin.usr-is-merged/)). Je tiens à souligner la belle continuité de la publication par la DGFiP des données des marchés publics remontées via le [protocole PES](https://www.collectivites-locales.gouv.fr/finances-locales/le-protocole-dechange-standard-pes). Merci à leurs équipes."""
),
html.H4("Sources de données ", id="sources"),
get_sources_tables(os.getenv("SOURCE_STATS_CSV_PATH")),
html.H4("Mentions légales", id="mentions-legales"),
dcc.Markdown("""
##### Publication
html.H5("Publication", id="publication"),
dcc.Markdown(
"""
Site Web développé et édité par [SAS Colmo](https://annuaire-entreprises.data.gouv.fr/entreprise/colmo-989393350), 989 393 350 RCS Rennes au capital de 3 000 euros.
Siège social : 1 carrefour Jouaust, 35000 Rennes
Hébergement : serveur situé en France et administré par Scaleway, 8 rue de la Ville lEvêque, 75008 Paris
##### Suivi d'audience
"""
),
html.H5("Suivi d'audience", id="audience"),
dcc.Markdown(
"""
Ce site dépose un petit fichier texte (un « cookie ») sur votre ordinateur lorsque vous le consultez ([Wikipédia](https://fr.wikipedia.org/wiki/Cookie_(informatique))). Cela me permet de mesurer le nombre de visites, de distinguer les nouveaux visiteurs des utilisateurs réguliers et ainsi de communiquer sur l'impact de decp.info.
**Ce site naffiche pas de bannière de consentement aux cookies, pourquoi ?**
@@ -89,21 +123,95 @@ Cest vrai, vous navez pas eu à cliquer sur un bloc qui recouvre la moiti
Rien dexceptionnel, je respecte simplement la loi, qui dit que certains outils de suivi daudience, correctement configurés pour respecter la vie privée, sont exemptés dautorisation préalable.
Jutilise pour cela [Matomo](https://matomo.org/), un outil [libre](https://matomo.org/free-software/), paramétré pour être en conformité avec [la recommandation « Cookies »](https://www.cnil.fr/fr/solutions-pour-les-cookies-de-mesure-daudience) de la CNIL. Cela signifie que votre adresse IP, par exemple, est anonymisée avant dêtre enregistrée. Il mest donc impossible dassocier vos visites sur ce site à votre personne."""),
# Matomo propose cependant ce formulaire si vous souhaitez totalement désactiver le suivi de vos sessions sur ce site :"""),
# html.Div(
# id="matomo-opt-out",
# style={
# "border": "1pt solid lightgrey",
# "padding": "12px",
# "margin": "auto 0 auto 12px",
# "width": "80%",
# },
# children=["Vous utilisez un bloqueur de suivi de trafic."],
# ),
# html.Script(
# src="https://analytics.maudry.com/index.php?module=CoreAdminHome&action=optOutJS&divId=matomo-opt-out&language=auto&showIntro=1"
# ),
Jutilise pour cela [Matomo](https://matomo.org/), un outil [libre](https://matomo.org/free-software/), paramétré pour être en conformité avec [la recommandation « Cookies »](https://www.cnil.fr/fr/solutions-pour-les-cookies-de-mesure-daudience) de la CNIL. Cela signifie que votre adresse IP, par exemple, est anonymisée avant dêtre enregistrée. Il mest donc impossible dassocier vos visites sur ce site à votre personne.
J'enregistre également les données suivantes, de manière anonyme, afin de mieux comprendre comment vous utilisez le site et l'améliorer :
- recherches sur la page d'accueil
- filtres appliqués aux données
"""
),
html.H5("Attributions", id="attributions"),
dcc.Markdown("""
Les polices de caractères sont distribuées par [Bunny fonts](https://fonts.bunny.net), une alternative européenne et qualitative à Google Fonts.
- la police de caractère [Inter](https://fonts.bunny.net/family/inter), principale police de ce site, a été créée par The Inter Project Authors ([source](https://github.com/rsms/inter))
- la police de caractère [Fira Code](https://fonts.bunny.net/family/fira-code), la police à largeure fixe, a été créée par The Fira Code Project Authors (https://github.com/tonsky/FiraCode)
"""),
html.H4(
"Liste des marchés par département", id="liste_marches"
),
dcc.Markdown(
"""
- [Marchés par département](/departements)
"""
),
],
)
]
),
# Table of Contents Column
html.Div(
className="a-propos-toc",
children=[
html.Div(
[
html.A(
"Consommer les données brutes",
href="#donnees-brutes",
className="toc-link",
),
html.A(
"API privée",
href="#api-privee",
className="toc-link",
),
html.A(
"Contact", href="#contact", className="toc-link"
),
html.A(
"Pour contribuer",
href="#contribuer",
className="toc-link",
),
html.A(
"Pour explorer le projet",
href="#explorer",
className="toc-link",
),
html.A(
"Qualité et exhaustivité des données",
href="#qualite-exhausitivite",
className="toc-link",
),
html.A(
"Sources de données",
href="#sources",
className="toc-link",
),
html.A(
"Mentions légales",
href="#mentions-legales",
className="toc-link",
),
html.A(
"Publication",
href="#publication",
className="toc-link toc-level-2",
),
html.A(
"Suivi d'audience",
href="#audience",
className="toc-link toc-level-2",
),
html.A(
"Attributions",
href="#attributions",
className="toc-link toc-level-2",
),
]
),
],
),
],
),
],
)
+387 -125
View File
@@ -1,52 +1,105 @@
import datetime
from typing import Any
import dash_bootstrap_components as dbc
import polars as pl
from dash import Input, Output, State, callback, dash_table, dcc, html, register_page
from src.figures import point_on_map
from src.utils import (
add_links_in_dict,
df,
format_montant,
format_number,
get_annuaire_data,
get_departement_region,
meta_content,
setup_table_columns,
from dash import (
ClientsideFunction,
Input,
Output,
State,
callback,
clientside_callback,
dcc,
html,
register_page,
)
from src.db import query_marches, schema
from src.figures import (
DataTable,
get_distance_histogram,
get_top_org_table,
make_card,
make_column_picker,
point_on_map,
)
from src.utils.data import DF_ACHETEURS, get_annuaire_data, get_departement_region
from src.utils.frontend import get_button_properties
from src.utils.seo import META_CONTENT
from src.utils.table import (
COLUMNS,
filter_table_data,
format_number,
get_default_hidden_columns,
prepare_table_data,
sort_table_data,
)
from src.utils.tracking import track_search
def get_title(acheteur_id: str | None = None) -> str:
acheteur_nom = DF_ACHETEURS.filter(pl.col("acheteur_id") == acheteur_id).select(
"acheteur_nom"
)
if acheteur_nom.height > 0:
return f"Marchés publics attribués par {acheteur_nom.item(0, 0)} | decp.info"
return "Marchés publics attribués | decp.info"
register_page(
__name__,
path_template="/acheteurs/<acheteur_id>",
title=meta_content["title"],
title=get_title,
name="Acheteur",
description=meta_content["description"],
image_url=meta_content["image_url"],
description="Consultez les marchés publics attribués par cet acheteur.",
image_url=META_CONTENT["image_url"],
order=5,
)
DATATABLE = html.Div(
className="marches_table",
children=DataTable(
dtid="acheteur_datatable",
persistence=True,
persistence_type="local",
persisted_props=["filter_query", "sort_by"],
page_action="custom",
filter_action="custom",
sort_action="custom",
page_size=10,
hidden_columns=[],
columns=[{"id": col, "name": col} for col in schema.names()],
),
)
layout = [
dcc.Store(id="acheteur_data", storage_type="memory"),
dcc.Location(id="url", refresh="callback-nav"),
dcc.Store(id="acheteur-hidden-columns", storage_type="local"),
dcc.Store(id="filter-cleanup-trigger-acheteur"),
dcc.Location(id="acheteur_url", refresh="callback-nav"),
html.Div(
className="container",
children=[
html.Div(
className="wrapper",
style={"marginBottom": "50px"},
children=[
dbc.Row(
className="mb-2",
children=[
dbc.Col(
html.H2(
className="org_title",
children=[
html.Span(id="acheteur_siret"),
" - ",
html.Span(id="acheteur_nom"),
],
),
html.Div(
className="org_year",
children=dcc.Dropdown(
width=8,
),
dbc.Col(
dcc.Dropdown(
id="acheteur_year",
options=["Toutes"]
options=["Toutes les années"]
+ [
str(year)
for year in range(
@@ -55,45 +108,129 @@ layout = [
],
placeholder="Année",
),
width=4,
),
html.Div(
],
),
dbc.Row(
className="mb-2",
children=[
dbc.Col(
className="org_infos",
children=[
# TODO: ajouter le type d'acheteur : commune, CD, CR, etc.
html.P(["Commune : ", html.Strong(id="acheteur_commune")]),
html.P(
[
"Commune : ",
html.Strong(id="acheteur_commune"),
]
),
html.P(
[
"Département : ",
html.Strong(id="acheteur_departement"),
]
),
html.P(["Région : ", html.Strong(id="acheteur_region")]),
html.P(
["Région : ", html.Strong(id="acheteur_region")]
),
html.A(
id="acheteur_lien_annuaire",
children="Plus de détails sur l'Annuaire des entreprises",
target="_blank",
),
],
width=4,
),
html.Div(
className="org_stats",
dbc.Col(
children=[
html.P(id="acheteur_titre_stats"),
html.P(id="acheteur_marches_attribues"),
html.P(id="acheteur_titulaires_differents"),
html.Button(
"Téléchargement au format Excel",
id="btn-download-acheteur-data",
id="btn-download-data-acheteur",
className="btn btn-primary",
),
dcc.Download(id="download-data-acheteur"),
],
width=4,
),
dbc.Col(
id="acheteur_map",
width=4,
),
dcc.Download(id="download-acheteur-data"),
],
),
html.Div(className="org_map", id="acheteur_map"),
dbc.Row(
children=[
dbc.Col(
className="marches_table",
id="top10_titulaires",
width=8,
),
dbc.Col(id="acheteur-distance-histogram", width=4),
],
),
],
),
# récupérer les données de l'acheteur sur l'api annuaire
html.H3("Derniers marchés publics attribués"),
html.Div(id="acheteur_last_marches", children=""),
dcc.Loading(
overlay_style={"visibility": "visible", "filter": "blur(2px)"},
id="loading-home",
type="default",
children=[
html.Div(
[
# Bouton modal des colonnes affichées
dbc.Button(
"Colonnes affichées",
id="acheteur_columns_open",
className="column_list",
),
html.P("lignes", id="acheteur_nb_rows"),
html.Button(
"Téléchargement désactivé au-delà de 65 000 lignes",
id="btn-download-filtered-data-acheteur",
className="btn btn-primary",
disabled=True,
),
dcc.Download(id="acheteur-download-filtered-data"),
dbc.Button(
"Remise à zéro",
title="Supprime tous les filtres et les tris. Autrement ils sont conservés même si vous fermez la page.",
id="btn-acheteur-reset",
),
],
className="table-menu",
),
dbc.Modal(
[
dbc.ModalHeader(
dbc.ModalTitle("Choix des colonnes à afficher")
),
dbc.ModalBody(
id="acheteur_columns_body",
children=make_column_picker("acheteur"),
),
dbc.ModalFooter(
dbc.Button(
"Fermer",
id="acheteur_columns_close",
className="ms-auto",
n_clicks=0,
)
),
],
id="acheteur_columns",
is_open=False,
fullscreen="md-down",
scrollable=True,
size="xl",
),
DATATABLE,
],
),
],
),
]
@@ -107,18 +244,28 @@ layout = [
Output(component_id="acheteur_departement", component_property="children"),
Output(component_id="acheteur_region", component_property="children"),
Output(component_id="acheteur_lien_annuaire", component_property="href"),
Input(component_id="url", component_property="pathname"),
Input(component_id="acheteur_url", component_property="pathname"),
)
def update_acheteur_infos(url):
acheteur_siret = url.split("/")[-1]
if len(acheteur_siret) != 14:
acheteur_siret = (
f"Le SIRET renseigné doit faire 14 caractères ({acheteur_siret})"
)
# if len(acheteur_siret) != 14:
# acheteur_siret = (
# f"Le SIRET renseigné doit faire 14 caractères ({acheteur_siret})"
# )
data = get_annuaire_data(acheteur_siret)
data_etablissement = data["matching_etablissements"][0]
data_etablissement = data.get("matching_etablissements") if data else None
if data_etablissement:
data_etablissement = data_etablissement[0]
# Extraction du code département à partir du code postal
code_postal = data_etablissement.get("code_postal", "")
departement_code = code_postal[:2] if code_postal else None
# Création de la carte avec le code département pour un centrage approprié
acheteur_map = point_on_map(
data_etablissement["latitude"], data_etablissement["longitude"]
data_etablissement["latitude"],
data_etablissement["longitude"],
departement_code,
)
code_departement, nom_departement, nom_region = get_departement_region(
data_etablissement["code_postal"]
@@ -127,10 +274,21 @@ def update_acheteur_infos(url):
lien_annuaire = (
f"https://annuaire-entreprises.data.gouv.fr/etablissement/{acheteur_siret}"
)
raison_sociale = data["nom_raison_sociale"]
libelle_commune = data_etablissement["libelle_commune"]
else:
acheteur_map = html.Div()
code_departement, nom_departement, nom_region = "", "", ""
departement = ""
lien_annuaire = ""
raison_sociale = ""
libelle_commune = ""
return (
acheteur_siret,
data["nom_raison_sociale"],
data_etablissement["libelle_commune"],
raison_sociale,
libelle_commune,
acheteur_map,
departement,
nom_region,
@@ -146,114 +304,85 @@ def update_acheteur_infos(url):
Input(component_id="acheteur_data", component_property="data"),
)
def update_acheteur_stats(data):
df = pl.DataFrame(data)
if df.height == 0:
df = pl.DataFrame(schema=df.collect_schema())
df_marches = df.unique("id")
dff = pl.DataFrame(data, strict=False, infer_schema_length=5000)
if dff.height == 0:
dff = pl.DataFrame(schema=schema)
df_marches = dff.unique("id")
nb_marches = format_number(df_marches.height)
# somme_marches = format_number(int(df_marches.select(pl.sum("montant")).item()))
marches_attribues = [html.Strong(nb_marches), " marchés et accord-cadres attribués"]
# + ", pour un total de ", html.Strong(somme_marches + " €")]
del df_marches
nb_titulaires = df.unique("titulaire_id").height
nb_titulaires = dff.unique("titulaire_id").height
nb_titulaires = [
html.Strong(format_number(nb_titulaires)),
" titulaires (SIRET) différents",
]
del df
del dff
return marches_attribues, nb_titulaires
@callback(
Output(component_id="acheteur_data", component_property="data"),
Input(component_id="url", component_property="pathname"),
Output("btn-download-data-acheteur", "disabled"),
Output("btn-download-data-acheteur", "children"),
Output("btn-download-data-acheteur", "title"),
Input(component_id="acheteur_url", component_property="pathname"),
Input(component_id="acheteur_year", component_property="value"),
)
def get_acheteur_marches_data(url, acheteur_year: str) -> list[dict]:
def get_acheteur_marches_data(url, ach_year: str) -> tuple:
acheteur_siret = url.split("/")[-1]
lff = df.lazy()
lff = lff.filter(pl.col("acheteur_id") == acheteur_siret)
lff = lff.fill_null("")
lff = lff.select(
"id",
"uid",
"objet",
"dateNotification",
"titulaire_id",
"titulaire_typeIdentifiant",
"titulaire_nom",
"montant",
"codeCPV",
"dureeMois",
)
if acheteur_year and acheteur_year != "Toutes":
lff = lff.filter(
pl.col("dateNotification").cast(pl.String).str.starts_with(acheteur_year)
)
lff = lff.sort(["dateNotification", "id"], descending=True, nulls_last=True)
data = lff.collect(engine="streaming").to_dicts()
return data
lff = query_marches("acheteur_id = ?", (acheteur_siret,)).lazy()
if ach_year and ach_year != "Toutes les années":
ach_year = int(ach_year)
lff = lff.filter(pl.col("dateNotification").dt.year() == ach_year)
lff = lff.sort(["dateNotification", "uid"], descending=True, nulls_last=True)
dff: pl.DataFrame = lff.collect(engine="streaming")
download_disabled, download_text, download_title = get_button_properties(dff.height)
data = dff.to_dicts()
return data, download_disabled, download_text, download_title
@callback(
Output(component_id="acheteur_last_marches", component_property="children"),
Output("acheteur_datatable", "data"),
Output("acheteur_datatable", "columns"),
Output("acheteur_datatable", "tooltip_header"),
Output("acheteur_datatable", "data_timestamp"),
Output("acheteur_nb_rows", "children"),
Output("btn-download-filtered-data-acheteur", "disabled"),
Output("btn-download-filtered-data-acheteur", "children"),
Output("btn-download-filtered-data-acheteur", "title"),
Output("filter-cleanup-trigger-acheteur", "data"),
Input("acheteur_url", "href"),
Input("acheteur_data", "data"),
Input("acheteur_datatable", "page_current"),
Input("acheteur_datatable", "page_size"),
Input("acheteur_datatable", "filter_query"),
Input("acheteur_datatable", "sort_by"),
State("acheteur_datatable", "data_timestamp"),
)
def get_last_marches_data(
href, data, page_current, page_size, filter_query, sort_by, data_timestamp
) -> tuple:
return prepare_table_data(
data, data_timestamp, filter_query, page_current, page_size, sort_by, "acheteur"
)
@callback(
Output(component_id="top10_titulaires", component_property="children"),
Input(component_id="acheteur_data", component_property="data"),
)
def get_last_marches_table(data) -> html.Div:
dff = pl.DataFrame(data)
dff = format_montant(dff)
columns, tooltip = setup_table_columns(
dff,
hideable=False,
exclude=["titulaire_id", "titulaire_typeIdentifiant", "uid"],
)
data = dff.to_dicts()
data = add_links_in_dict(data, "titulaire")
table = html.Div(
className="marches_table",
id="acheteur_datatable",
children=dash_table.DataTable(
data=data,
markdown_options={"html": True},
page_action="native",
filter_action="native",
filter_options={"case": "insensitive", "placeholder_text": "Filtrer..."},
columns=columns,
tooltip_header=tooltip,
tooltip_duration=8000,
tooltip_delay=350,
cell_selectable=False,
page_size=10,
style_cell_conditional=[
{
"if": {"column_id": "objet"},
"minWidth": "300px",
"textAlign": "left",
"overflow": "hidden",
"lineHeight": "14px",
"whiteSpace": "normal",
},
{
"if": {"column_id": "titulaire_nom"},
"minWidth": "200px",
"textAlign": "left",
"overflow": "hidden",
"lineHeight": "18px",
"whiteSpace": "normal",
},
],
),
)
return table
def get_top_titulaires(data):
table = get_top_org_table(data, "titulaire", ["titulaire_distance"])
return make_card(fig=table, title="Top titulaires", lg=12, xl=12)
@callback(
Output("download-acheteur-data", "data"),
Input("btn-download-acheteur-data", "n_clicks"),
Output("download-data-acheteur", "data"),
Input("btn-download-data-acheteur", "n_clicks"),
State(component_id="acheteur_data", component_property="data"),
State(component_id="acheteur_nom", component_property="children"),
State(component_id="acheteur_year", component_property="value"),
@@ -261,7 +390,7 @@ def get_last_marches_table(data) -> html.Div:
)
def download_acheteur_data(
n_clicks,
data: [dict],
data: list[dict[str, Any]],
acheteur_nom: str,
annee: str,
):
@@ -269,8 +398,141 @@ def download_acheteur_data(
def to_bytes(buffer):
df_to_download.write_excel(
buffer, worksheet="DECP" if annee in ["Toutes", None] else annee
buffer, worksheet="DECP" if annee in ["Toutes les années", None] else annee
)
date = datetime.datetime.now().strftime("%Y-%m-%d_%H:%M:%S")
return dcc.send_bytes(to_bytes, filename=f"decp_{acheteur_nom}_{date}.xlsx")
@callback(
Output("acheteur-download-filtered-data", "data"),
State("acheteur_data", "data"),
Input("btn-download-filtered-data-acheteur", "n_clicks"),
State("acheteur_nom", "children"),
State("acheteur_datatable", "filter_query"),
State("acheteur_datatable", "sort_by"),
State("acheteur_datatable", "hidden_columns"),
prevent_initial_call=True,
)
def download_filtered_acheteur_data(
data,
n_clicks,
acheteur_nom,
filter_query,
sort_by,
hidden_columns: list | None = None,
):
lff: pl.LazyFrame = pl.LazyFrame(
data
) # start from the full acheteur data, not from paginated table data
# Les colonnes masquées sont supprimées
if hidden_columns:
lff = lff.drop(hidden_columns)
if filter_query:
track_search(filter_query, "ach download")
lff = filter_table_data(lff, filter_query)
if len(sort_by) > 0:
lff = sort_table_data(lff, sort_by)
def to_bytes(buffer):
lff.collect(engine="streaming").write_excel(buffer, worksheet="DECP")
date = datetime.datetime.now().strftime("%Y-%m-%d_%H:%M:%S")
return dcc.send_bytes(
to_bytes, filename=f"decp_filtrées_{acheteur_nom}_{date}.xlsx"
)
# Pour nettoyer les icontains et i< des filtres
# voir aussi src/assets/dash_clientside.js
clientside_callback(
ClientsideFunction(
namespace="clientside",
function_name="clean_filters",
),
Output("filter-cleanup-trigger-acheteur", "data", allow_duplicate=True),
Input("filter-cleanup-trigger-acheteur", "data"),
prevent_initial_call=True,
)
@callback(
Output("acheteur-hidden-columns", "data", allow_duplicate=True),
Input("acheteur_column_list", "selected_rows"),
prevent_initial_call=True,
)
def update_hidden_columns_from_checkboxes(selected_columns):
if selected_columns:
selected_columns = [COLUMNS[i] for i in selected_columns]
hidden_columns = [col for col in COLUMNS if col not in selected_columns]
return hidden_columns
else:
return []
@callback(
Output("acheteur_datatable", "hidden_columns"),
Input(
"acheteur-hidden-columns",
"data",
),
)
def store_hidden_columns(hidden_columns):
if hidden_columns is None:
hidden_columns = get_default_hidden_columns("acheteur")
return hidden_columns
@callback(
Output("acheteur_column_list", "selected_rows"),
Input("acheteur_datatable", "hidden_columns"),
State("acheteur_column_list", "selected_rows"), # pour éviter la boucle infinie
)
def update_checkboxes_from_hidden_columns(hidden_cols, current_checkboxes):
hidden_cols = hidden_cols or get_default_hidden_columns("acheteur")
# Show all columns that are NOT hidden
visible_cols = [COLUMNS.index(col) for col in COLUMNS if col not in hidden_cols]
return visible_cols
@callback(
Output("acheteur_columns", "is_open"),
Input("acheteur_columns_open", "n_clicks"),
Input("acheteur_columns_close", "n_clicks"),
State("acheteur_columns", "is_open"),
)
def toggle_acheteur_columns(click_open, click_close, is_open):
if click_open or click_close:
return not is_open
return is_open
@callback(
Output("acheteur_datatable", "filter_query", allow_duplicate=True),
Output("acheteur_datatable", "sort_by"),
Input("btn-acheteur-reset", "n_clicks"),
prevent_initial_call=True,
)
def reset_view(n_clicks):
return "", []
@callback(
Output("acheteur-distance-histogram", "children"),
Input("acheteur_data", "data"),
)
def update_acheteur_distance_histogram(data):
lff = pl.LazyFrame(data, strict=False, infer_schema_length=5000)
fig = get_distance_histogram(lff)
return make_card(
title="Distance acheteurtitulaire",
subtitle="en nombre de marchés, échelle logarithmique",
fig=fig,
lg=12,
xl=12,
)
View File
+91
View File
@@ -0,0 +1,91 @@
from dash import Input, Output, callback, dcc, html, register_page
from src.db import get_cursor
from src.utils.data import DEPARTEMENTS
NAME = "Département"
def get_title(code):
return f"Marchés publics de {DEPARTEMENTS[code]['departement']} | decp.info"
def get_description(code):
return f"Marchés publics passés dans le département {DEPARTEMENTS[code]['departement']} | decp.info"
register_page(
__name__,
path_template="/departements/<code>",
title=get_title,
description=get_description,
order=50,
name=NAME,
)
layout = html.Div(
[
dcc.Location(id="departement_url", refresh="callback-nav"),
html.Div(id="departement_marches"),
]
)
@callback(
Output(component_id="departement_marches", component_property="children"),
Input(component_id="departement_url", component_property="pathname"),
)
def departement_marches(url):
departement = url.split("/")[-1]
def make_link_list(org_type) -> list:
table = (
"acheteurs_departement"
if org_type == "acheteur"
else "titulaires_departement"
if org_type == "titulaire"
else None
)
if table is None:
raise ValueError
col_prefix = org_type
rows = (
get_cursor()
.execute(
f"SELECT {col_prefix}_id, {col_prefix}_nom "
f"FROM {table} "
f"WHERE {col_prefix}_departement_code = ? "
f"ORDER BY {col_prefix}_nom",
[departement],
)
.fetchall()
)
link_list = []
for org_id, org_nom in rows:
li = html.Li(
[
dcc.Link(
org_nom,
href=url + f"/{org_type}/{org_id}",
title=f"Marchés publics de {org_nom}",
),
" ",
dcc.Link(
"(page dédiée)",
href=f"/{org_type}s/{org_id}",
title=f"Page dédiée aux marchés publics de {org_nom}",
),
]
)
link_list.append(li)
return link_list
content = [
html.H3("Acheteurs publics du département"),
html.Ul(make_link_list("acheteur")),
html.H3("Titulaires du département"),
html.Ul(make_link_list("titulaire")),
]
return content
+25
View File
@@ -0,0 +1,25 @@
from dash import dcc, html, register_page
from src.utils.data import DEPARTEMENTS
NAME = "Départements"
register_page(
__name__,
path="/departements",
title="Marchés par département | decp.info",
name="Départements",
description="Tous les marchés publics, classés par départements",
)
layout = html.Div(
[
html.H3("Départements"),
html.Ul(
[
html.Li(dcc.Link(d["departement"], href=f"/departements/{k}"))
for k, d in DEPARTEMENTS.items()
]
),
]
)
+107
View File
@@ -0,0 +1,107 @@
import polars as pl
from dash import Input, Output, callback, dcc, html, register_page
from src.db import get_cursor
from src.utils import logger
from src.utils.data import DF_ACHETEURS, DF_TITULAIRES
NAME = "Liste des marchés publics"
def make_org_nom_verbe(org_type, org_id) -> tuple:
if org_type == "titulaire":
df = DF_TITULAIRES
verbe = "remportés"
elif org_type == "acheteur":
df = DF_ACHETEURS
verbe = "attribués"
else:
raise ValueError
org_nom = (
df.filter(pl.col(f"{org_type}_id") == org_id)
.select(f"{org_type}_nom")
.item(0, 0)
)
return org_nom, verbe
def get_title(code, org_type, org_id):
if org_type:
org_nom, verbe = make_org_nom_verbe(org_type, org_id)
return f"Marchés publics {verbe} par {org_nom} | decp.info"
else:
logger.warning(f"Pas de org_type pour org_id: {org_id}")
return "Marchés publics | decp.info"
def get_description(code, org_type, org_id):
org_nom, verbe = make_org_nom_verbe(org_type, org_id)
return f"Liste complète des marchés publics {verbe} par {org_nom} et publiés par decp.info. Cliquez sur les liens pour consulter les détails de chaque marché."
register_page(
__name__,
path_template="/departements/<code>/<org_type>/<org_id>",
title=get_title,
description=get_description,
order=40,
name=NAME,
)
layout = html.Div(
[
dcc.Location(id="liste_marches_url", refresh="callback-nav"),
html.Div(id="liste_marches"),
]
)
@callback(
Output(component_id="liste_marches", component_property="children"),
Input(component_id="liste_marches_url", component_property="pathname"),
)
def liste_marches(url):
org_type = url.split("/")[-2]
org_id = url.split("/")[-1]
def make_link_list() -> list:
table = (
"acheteurs_marches"
if org_type == "acheteur"
else "titulaires_marches"
if org_type == "titulaire"
else None
)
if table is None:
raise ValueError
rows = (
get_cursor()
.execute(
f"SELECT uid, objet FROM {table} WHERE {org_type}_id = ?",
[org_id],
)
.fetchall()
)
return [
html.Li(
dcc.Link(
objet,
href=f"/marches/{uid}",
title=f"Marchés public attribué : {objet}",
)
)
for uid, objet in rows
]
nom, verbe = make_org_nom_verbe(org_type, org_id)
content = [
html.H3(f"Marchés publics {verbe} par {nom}"),
html.Ul(make_link_list()),
]
return content
-170
View File
@@ -1,170 +0,0 @@
import os
import re
import smtplib
import time
from email.mime.multipart import MIMEMultipart
from email.mime.text import MIMEText
from dash import Input, Output, State, callback, dcc, html, register_page
from flask import request
from src.utils import meta_content
name = "Contact"
register_page(
__name__,
path="/contact",
title=meta_content["title"],
name=name,
description=meta_content["description"],
image_url=meta_content["image_url"],
order=6,
)
layout = html.Div(
className="container",
children=[
html.H2("Contact", id="contact"),
html.P(
"Votre message arrivera directement dans ma boîte mail, et je reviendrai vers vous rapidement."
),
html.Div(
[
html.Label("Votre nom"),
dcc.Input(
id="input-name",
type="text",
style={"width": "100%", "padding": "8px", "margin": "8px 0"},
),
html.Label("Votre adresse email"),
dcc.Input(
id="input-email",
type="email",
style={"width": "100%", "padding": "8px", "margin": "8px 0"},
),
html.Label("Message"),
dcc.Textarea(
id="input-message",
style={
"width": "100%",
"height": 200,
"padding": "8px",
"margin": "8px 0",
},
),
html.Button(
"Envoyer ",
id="submit-button",
n_clicks=0,
style={"marginTop": "10px"},
),
html.Div(
id="output-message", style={"marginTop": "10px", "color": "green"}
),
],
style={
"maxWidth": "600px",
"margin": "auto",
"padding": "20px",
"lineHeight": "20px",
},
),
dcc.Markdown("""
- Bluesky : [@col1m.bsky.social](https://bsky.app/profile/col1m.bsky.social)
- Mastodon : [col1m@mamot.fr](https://mamot.fr/@col1m)
- LinkedIn : [colinmaudry](https://www.linkedin.com/in/colinmaudry/)
- venez discuter de la transparence de la commande publique [sur le forum teamopendata.org](https://teamopendata.org/c/commande-publique/101)
"""),
],
)
rate_limit_store = {} # {ip: last_timestamp}
RATE_LIMIT_WINDOW = 300 # 5 minutes
def is_rate_limited():
ip = request.remote_addr
now = time.time()
last_time = rate_limit_store.get(ip)
if last_time and (now - last_time) < RATE_LIMIT_WINDOW:
return True # rate limited !
rate_limit_store[ip] = now # màj du timestamp
return False
def sanitize_email(email):
return re.match(r"[^@]+@[^@]+\.[^@]+", email)
@callback(
Output("output-message", "children"),
Input("submit-button", "n_clicks"),
State("input-name", "value"),
State("input-email", "value"),
State("input-message", "value"),
prevent_initial_call=True,
)
def send_email(n_clicks, form_name, form_email, form_message):
if not all([form_name, form_email, form_message]):
return html.Div(
"Veuillez s'il vous plaît remplir tous les champs.", style={"color": "red"}
)
client_ip = request.remote_addr
if is_rate_limited():
wait_time = int(RATE_LIMIT_WINDOW - (time.time() - rate_limit_store[client_ip]))
return html.Div(
f"⏳ J'ai mis en place une protection contre le spam, et vous m'avez écrit il y a moins de 5 minutes. "
f"Veuillez s'il vous plaît attendre {wait_time} secondes avant de renvoyer un message.",
style={"color": "black"},
)
try:
# Configuration du serveur SMTP
smtp_server = os.getenv("SENDER_SERVER_DOMAIN")
smtp_port = 587
login_email = os.getenv("LOGIN_EMAIL")
from_email = os.getenv("FROM_EMAIL")
to_email = os.getenv("TO_EMAIL", from_email)
login_password = os.getenv("LOGIN_PASSWORD")
print(
smtp_server,
smtp_port,
login_email,
from_email,
to_email,
login_password,
sep="\n",
)
# Création de l'email
email = MIMEMultipart()
email["From"] = from_email
email["To"] = to_email
email["Subject"] = f"[decp.info] Message de {form_name}"
body = f"""
Nom : {form_name}
Email : {form_email}
Message :
{form_message}
"""
email.attach(MIMEText(body, "plain"))
# Send email
server = smtplib.SMTP(smtp_server, smtp_port)
server.starttls()
server.login(login_email, login_password)
server.sendmail(from_email, to_email, email.as_string())
server.quit()
return html.Div("✅ Envoi réussi", style={"color": "green"})
except Exception as e:
print(e)
return html.Div(
f"❌ Échec de l'envoi du message : {str(e)}", style={"color": "red"}
)
+297
View File
@@ -0,0 +1,297 @@
from dash import Input, Output, State, callback, ctx, dcc, html, register_page
from src.utils.seo import META_CONTENT
NAME = "Quelles données pour quelles étapes et quels seuils dans les marchés publics ?"
register_page(
__name__,
path="/etapes",
title=f"{NAME} | decp.info",
name="Étapes et données",
description=(
"À chaque étape d'un marché public (programmation, publicité, "
"attribution), quelles données sont publiées et à partir de quel "
"seuil : DECP, BOAMP, JOUE, journaux d'annonces légales, Approch."
),
image_url=META_CONTENT["image_url"],
)
# Contenu des fiches — à rédiger en Markdown.
# Clés barres : "bar-approch", "bar-jal", "bar-boamp", "bar-joue-marche",
# "bar-decp", "bar-joue-attribution"
# Clés étapes (mobile) : "stage-programmation", "stage-publicite",
# "stage-attribution", "stage-contrat", "stage-paiement"
ALL_CONTENT: dict[str, str | None] = {
"bar-approch": None,
"bar-jal": None,
"bar-boamp": None,
"bar-joue-marche": None,
"bar-decp": None,
"bar-joue-attribution": None,
"stage-programmation": None,
"stage-publicite": None,
"stage-attribution": None,
"stage-contrat": None,
"stage-paiement": None,
}
_BAR_IDS = [
"bar-approch",
"bar-jal",
"bar-boamp",
"bar-joue-marche",
"bar-decp",
"bar-joue-attribution",
]
_STAGE_IDS = [
"stage-programmation",
"stage-publicite",
"stage-attribution",
"stage-contrat",
"stage-paiement",
]
def _lane(*bars):
"""Une ligne d'étape : fond segmenté en 5 + barres positionnées."""
return html.Div(
className="etapes-lane",
children=[
html.Div(
className="etapes-segs",
children=[html.Div() for _ in range(5)],
),
*bars,
],
)
def _bar(label, color, style, bar_id=None):
base = {"backgroundColor": color}
base.update(style)
props = {"className": "etapes-bar", "style": base}
if bar_id is not None:
props["id"] = bar_id
props["n_clicks"] = 0
return html.Div(label, **props)
def build_chart():
return html.Div(
className="etapes-chart-scroll",
children=html.Div(
className="etapes-chart",
children=[
# En-tête : coin vide + 5 marqueurs de seuils
html.Div(className="etapes-corner"),
html.Div(
className="etapes-xhead",
children=[
html.Div("0 €", className="etapes-xcell"),
html.Div(
[html.Strong("40 000 €"), "seuil DECP"],
className="etapes-xcell",
),
html.Div(
[html.Strong("90 000 €"), "publicité"],
className="etapes-xcell",
),
html.Div(
[html.Strong("140 k€ / 216 k€"), "seuils formalisés (UE)"],
className="etapes-xcell",
),
html.Div(
[html.Strong("5,404 M€"), "travaux (UE)"],
className="etapes-xcell",
),
],
),
# Programmation
html.Div("Programmation", className="etapes-stage"),
_lane(
_bar(
"Approch — sourcing / préinformation (non réglementaire)",
"#7c5cff",
{"left": "2%", "right": "2%"},
bar_id="bar-approch",
),
),
# Publicité (appel d'offres)
html.Div(["Publicité"], className="etapes-stage"),
_lane(
_bar(
"JAL",
"#f79009",
{"left": "40%", "right": "40%", "top": "6px", "height": "20px"},
bar_id="bar-jal",
),
_bar(
"BOAMP",
"#1570ef",
{"left": "40%", "right": "2%", "top": "28px", "height": "20px"},
bar_id="bar-boamp",
),
_bar(
"JOUE — avis de marché",
"#0e9384",
{"left": "60%", "right": "2%", "top": "6px", "height": "20px"},
bar_id="bar-joue-marche",
),
),
# Attribution
html.Div("Attribution", className="etapes-stage"),
_lane(
_bar(
"DECP — données essentielles",
"#12b76a",
{"left": "20%", "right": "2%", "top": "6px", "height": "20px"},
bar_id="bar-decp",
),
_bar(
"JOUE — avis d'attribution",
"#0e9384",
{"left": "60%", "right": "2%", "top": "28px", "height": "20px"},
bar_id="bar-joue-attribution",
),
),
# Contrat (vide)
html.Div("Contrat", className="etapes-stage"),
html.Div(
"— aucune donnée publiée aujourd'hui —",
className="etapes-lane etapes-empty",
),
# Paiement (vide)
html.Div("Paiement", className="etapes-stage"),
html.Div(
"— aucune donnée publiée aujourd'hui —",
className="etapes-lane etapes-empty",
),
],
),
)
# Données par étape, partagées par la vue mobile.
# Chaque tuple : (libellé étape, id CSS, [(libellé, couleur, plage seuils)]).
STAGES_MOBILE = [
(
"Programmation",
"stage-programmation",
[
("Approch", "#7c5cff", "tous montants — publication non réglementaire"),
],
),
(
"Publicité (appel d'offres)",
"stage-publicite",
[
("JAL", "#f79009", "de 90 000 € au seuil formalisé"),
("BOAMP", "#1570ef", "à partir de 90 000 €"),
(
"JOUE — avis de marché",
"#0e9384",
"à partir des seuils formalisés (140 k€ / 216 k€)",
),
],
),
(
"Attribution",
"stage-attribution",
[
("DECP — données essentielles", "#12b76a", "à partir de 40 000 €"),
("JOUE — avis d'attribution", "#0e9384", "à partir des seuils formalisés"),
],
),
("Contrat", "stage-contrat", []),
("Paiement", "stage-paiement", []),
]
def build_mobile():
blocks = []
for stage, stage_id, items in STAGES_MOBILE:
if items:
children = [
html.Div(
[
html.I(style={"backgroundColor": color}),
html.Span(label, className="etapes-m-label"),
html.Span(seuil, className="etapes-m-seuil"),
],
className="etapes-m-item",
)
for label, color, seuil in items
]
else:
children = [
html.Div(
"aucune donnée publiée aujourd'hui",
className="etapes-m-item etapes-m-empty",
)
]
blocks.append(
html.Div(
[
html.Div(
[
html.H4(stage, className="etapes-m-stage"),
html.Button(
"Voir fiche →",
id=stage_id,
n_clicks=0,
className="etapes-m-link",
),
],
className="etapes-m-header",
),
*children,
],
className="etapes-m-block",
)
)
return html.Div(blocks, className="etapes-mobile")
layout = html.Div(
className="container",
children=[
html.H2(NAME),
dcc.Markdown(
"Un marché public passe par plusieurs étapes. À chacune, des "
"données peuvent être publiées — selon le montant du marché et "
"des obligations réglementaires. Ce graphique situe les "
"principales publications de données par **étape** (de haut en "
"bas) et par **seuil** (de gauche à droite, en euros hors taxes)."
),
build_chart(),
build_mobile(),
dcc.Store(id="etapes-selected", data=None),
html.Div(id="etapes-detail", className="etapes-detail"),
dcc.Markdown(
"**À noter :** l'axe horizontal n'est pas linéaire — les seuils "
"sont espacés régulièrement pour rester lisibles. Les étapes "
"*Contrat* et *Paiement* n'ont aujourd'hui aucune donnée publiée "
"en open data.",
className="etapes-note",
),
],
)
@callback(
Output("etapes-detail", "children"),
Output("etapes-selected", "data"),
[Input(id_, "n_clicks") for id_ in _BAR_IDS + _STAGE_IDS],
State("etapes-selected", "data"),
prevent_initial_call=True,
)
def _show_detail(*args):
current = args[-1]
triggered = ctx.triggered_id
if triggered == current:
return None, None
content = ALL_CONTENT.get(triggered)
if content is None:
return dcc.Markdown(f"*Fiche en cours de rédaction.* {triggered}"), triggered
return dcc.Markdown(content), triggered
+114 -42
View File
@@ -1,29 +1,45 @@
import json
from datetime import datetime
import polars as pl
import dash_bootstrap_components as dbc
from dash import Input, Output, callback, dcc, html, register_page
from polars import selectors as cs
from src.utils import data_schema, df, format_montant, meta_content
from src.db import query_marches
from src.utils.data import DATA_SCHEMA
from src.utils.seo import META_CONTENT, make_org_jsonld
from src.utils.table import format_values, unformat_montant
def get_title(uid: str = None) -> str:
return f"Marché {uid} | decp.info"
register_page(
__name__,
path_template="/marches/<uid>",
title=meta_content["title"],
title=get_title,
name="Marché",
description=meta_content["description"],
image_url=meta_content["image_url"],
description="Consultez les détails de ce marché public : montant, acheteur, titulaires, modifications, etc.",
image_url=META_CONTENT["image_url"],
order=7,
)
layout = [
dcc.Store(id="marche_data"),
dcc.Store(id="titulaires_data"),
dcc.Location(id="url", refresh="callback-nav"),
html.Div(
className="container marche_infos",
dcc.Location(id="marche_url", refresh="callback-nav"),
html.Script(type="application/ld+json", id="marche_jsonld"),
dbc.Container(
className="marche_infos",
children=[
html.P("Vous consultez un résumé des données de ce marché public"),
dbc.Row(
dbc.Col(
[
html.H1(id="marche_objet", style={"fontSize": "1.5em"}),
html.P(
"Vous consultez un résumé des données de ce marché public"
),
html.Ul(
[
html.Li(
@@ -37,20 +53,22 @@ layout = [
html.P(
"Le montant total payé aux titulaires, la durée du marché et la liste des titulaires peuvent cependant encore évoluer jusqu'à la fin de l'exécution du marché."
),
html.Div(
className="wrapper",
children=[
html.Div(
className="marche_map",
id="marche_map",
]
)
),
dbc.Row(
[
dbc.Col(id="marche_infos_1", width=12, md=4),
dbc.Col(id="marche_infos_2", width=12, md=4),
dbc.Col(
width=12,
md=4,
children=[
html.H4("Titulaires"),
html.Ul(id="marche_infos_titulaires"),
],
),
html.Div(className="marche_infos_1", id="marche_infos_1"),
html.Div(className="marche_infos_2", id="marche_infos_2"),
],
]
),
],
),
@@ -60,30 +78,26 @@ layout = [
@callback(
Output("marche_data", "data"),
Output("titulaires_data", "data"),
Input(component_id="url", component_property="pathname"),
Input(component_id="marche_url", component_property="pathname"),
)
def get_marche_data(url) -> tuple[dict, list]:
marche_uid = url.split("/")[-1]
# Récupération des données du marché à partir du df global
lff = df.lazy()
lff = lff.filter(pl.col("uid") == pl.lit(marche_uid))
# Filtre SQL côté DuckDB, puis Polars pour le post-traitement
dff_marche = query_marches("uid = ?", (marche_uid,))
if dff_marche.height == 0:
return {}, []
# Données des titulaires du marché
lff = dff_marche.lazy()
dff_titulaires = lff.select(cs.starts_with("titulaire")).collect(engine="streaming")
dff_marche_unique = lff.unique("uid").collect(engine="streaming")
dff_marche_unique = format_values(dff_marche_unique)
# Données du marché
dff_marche = (
lff.select(~cs.starts_with("titulaires")).unique().collect(engine="streaming")
)
dff_marche = format_montant(dff_marche)
assert dff_marche.height == 1
return dff_marche.to_dicts()[0], dff_titulaires.to_dicts()
return dff_marche_unique.to_dicts()[0], dff_titulaires.to_dicts()
@callback(
Output("marche_objet", "children"),
Output("marche_infos_1", "children"),
Output("marche_infos_2", "children"),
Output("marche_infos_titulaires", "children"),
@@ -91,12 +105,11 @@ def get_marche_data(url) -> tuple[dict, list]:
Input("titulaires_data", "data"),
)
def update_marche_info(marche, titulaires):
def make_parameter(col):
column_object = data_schema.get(col)
print(column_object)
def make_parameter(col, bold=True):
column_object = DATA_SCHEMA.get(col)
column_name = column_object.get("title") if column_object else col
if marche[col]:
if marche and col in marche:
if col == "acheteur_nom":
value = html.A(
href=f"/acheteurs/{marche['acheteur_id']}",
@@ -110,8 +123,6 @@ def update_marche_info(marche, titulaires):
# Dates
elif col in ["dateNotification", "datePublicationDonnees"]:
print(marche[col])
value = datetime.fromisoformat(marche[col]).strftime("%d/%m/%Y")
# Listes
@@ -123,6 +134,7 @@ def update_marche_info(marche, titulaires):
"considerationsSociales",
"considerationsEnvironnementales",
]
and col in marche
and "," in marche[col]
):
col_values = marche[col].split(", ")
@@ -138,12 +150,14 @@ def update_marche_info(marche, titulaires):
else:
value = ""
param_content = html.P([column_name, " : ", html.Strong(value)])
value = html.Strong(value) if bold else value
param_content = html.P([column_name, " : ", value])
return param_content
marche_objet = make_parameter("objet", bold=False)
marche_infos = [
make_parameter("id"),
make_parameter("objet"),
make_parameter("dateNotification"), # date
make_parameter("nature"),
make_parameter("acheteur_nom"), # lien
@@ -152,6 +166,7 @@ def update_marche_info(marche, titulaires):
make_parameter("procedure"),
make_parameter("techniques"), # list
make_parameter("dureeMois"),
make_parameter("dureeRestanteMois"),
make_parameter("offresRecues"),
make_parameter("datePublicationDonnees"), # date
make_parameter("formePrix"),
@@ -177,14 +192,71 @@ def update_marche_info(marche, titulaires):
titulaires_lines = []
for titulaire in titulaires:
if titulaire["titulaire_typeIdentifiant"] == "SIRET":
categorie = titulaire.get("titulaire_categorie", "")
if titulaire.get("titulaire_distance"):
distance = str(titulaire.get("titulaire_distance")) + " km"
else:
distance = ""
content = html.Li(
[
html.A(
href=f"/titulaires/{titulaire['titulaire_id']}",
children=titulaire["titulaire_nom"],
)
),
f" ({categorie}, {distance})",
]
)
else:
content = html.Li(titulaire["titulaire_nom"])
titulaires_lines.append(content)
return marche_infos[:half], marche_infos[half:], titulaires_lines
return marche_objet, marche_infos[:half], marche_infos[half:], titulaires_lines
@callback(
Output(component_id="marche_jsonld", component_property="children"),
Input("marche_data", "data"),
Input("titulaires_data", "data"),
)
def get_marche_jsonld(marche, titulaires) -> str:
acheteur_id = marche.get("acheteur_id")
type_order = (
"Service" if marche.get("categorie") in ["Services", "Travaux"] else "Product"
)
result = []
for titulaire in titulaires:
jsonld = {
"@context": "https://schema.org",
"@type": "Order",
"@id": f"https://decp.info/marches/{marche.get('uid')}",
"name": f"{marche.get('nature')} conclu par {marche.get('acheteur_nom')} le {marche.get('dateNotification')}",
"description": marche.get("objet"),
"orderNumber": marche.get("uid"),
"orderDate": marche.get("dateNotification"),
"price": unformat_montant(marche.get("montant")),
"priceCurrency": "EUR",
"customer": make_org_jsonld(
acheteur_id, org_name=marche.get("acheteur_nom"), org_type="acheteur"
),
"seller": make_org_jsonld(
titulaire.get("titulaire_id"),
org_name=titulaire.get("titulaire_nom"),
org_type="titulaire",
type_org_id=titulaire.get("titulaire_typeIdentifiant", "SIRET"),
),
"orderedItem": {
"@type": type_order,
"name": marche.get("objet"),
"category": {
"@type": "CategoryCode",
"propertyID": "cpv",
"codeValue": marche.get("codeCPV"),
# "description": "Description du code CPV"
},
# "serviceType": "Description du code CPV"
},
}
result.append(jsonld)
return json.dumps(result, indent=2)
+964
View File
@@ -0,0 +1,964 @@
import urllib.parse
from datetime import datetime
import dash_bootstrap_components as dbc
import polars as pl
from dash import (
ALL,
Input,
Output,
State,
callback,
ctx,
dcc,
html,
no_update,
register_page,
)
from src.db import schema
from src.figures import (
DataTable,
get_barchart_sources,
get_considerations_card_content,
get_dashboard_summary_table,
get_distance_histogram,
get_duplicate_matrix,
get_geographic_maps,
get_top_org_table,
make_card,
make_column_picker,
make_donut,
)
from src.utils import logger
from src.utils.cache import cache
from src.utils.data import (
DEPARTEMENTS,
DF_ACHETEURS,
DF_TITULAIRES,
prepare_dashboard_data,
)
from src.utils.frontend import get_enum_values_as_dict
from src.utils.seo import META_CONTENT
from src.utils.table import COLUMNS, get_default_hidden_columns, prepare_table_data
NAME = "Observatoire"
register_page(
__name__,
path="/observatoire",
title="Observatoire | decp.info",
name=NAME,
description="Visualisez l'état de la publication des données essentielles des marchés publics en France.",
image_url=META_CONTENT["image_url"],
order=3,
)
OPTIONS_YEARS = []
for year in reversed(range(2017, datetime.now().year + 1)):
option_year = {
"label": str(year),
"value": year,
}
OPTIONS_YEARS.append(option_year)
OPTIONS_DEPARTEMENTS = []
for code in DEPARTEMENTS.keys():
departement = {
"label": f"{DEPARTEMENTS[code]['departement']} ({code})",
"value": code,
}
OPTIONS_DEPARTEMENTS.append(departement)
OBSERVATOIRE_COLUMNS = [
col
for col in schema.names()
if col.startswith("acheteur")
or col.startswith("titulaire")
or col
in [
"uid",
"dateNotification",
"montant",
"considerationsSociales",
"considerationsEnvironnementales",
"marcheInnovant",
"sousTraitanceDeclaree",
"techniques",
"sourceDataset",
"type",
"codeCPV",
]
]
layout = [
dcc.Location(id="dashboard_url", refresh="callback-nav"),
dcc.Store(id="observatoire-filters", storage_type="local"),
dcc.Store(id="observatoire-hidden-columns", storage_type="local"),
dcc.Store(
id="filter-cleanup-trigger-observatoire-preview"
), # utilisé juste pour ne pas avoir à adapter les données retournées de prepare_table data
dbc.Modal(
[
dbc.ModalHeader(dbc.ModalTitle("Montants")),
dbc.ModalBody(
[
dcc.Markdown(
"""
Les données saisies et publiées par les acheteurs comportent de nombreux montants farfelus qui sabotent les statistiques, au lieu de montants estimés avec rigueur. On parle de montants atteignant parfois les millions de milliards. Certains réutilisateurs des données mettent de côté ces marchés ou bien modifient les montants selon des règles fatalement arbitraires. J'ai fait le choix de ne quasiment pas modifier les données* afin de visibiliser le problème.
Alors, on fait comment ?
\\* Les montants composés de plus de 11 chiffres, sans les décimales, [sont ramenés](https://github.com/ColinMaudry/decp-processing/blob/main/src/tasks/clean.py#L63-L71) à 12 311 111 111, un nombre qui reste très élevé et qui est facilement reconnaissable.
"""
),
]
),
dbc.ModalFooter(
dbc.Button("Fermer", id="montant-modal-close", className="ms-auto")
),
],
id="montant-modal",
is_open=False,
),
html.Div(
className="container-fluid",
children=[
html.H2(children=[NAME], id="page_title"),
dcc.Loading(
overlay_style={"visibility": "visible", "filter": "blur(2px)"},
id="loading-statistques",
type="default",
children=[
dbc.Row(
[
dbc.Col(
xl=3,
lg=4,
id="filters",
children=[
html.H5("Période d'attribution"),
dbc.Row(
dbc.Col(
dcc.Dropdown(
id="dashboard_year",
options=OPTIONS_YEARS,
placeholder="12 derniers mois",
persistence=True,
persistence_type="local",
),
),
),
html.H5("Acheteur"),
dbc.Row(
dbc.Col(
dcc.Input(
id="dashboard_acheteur_id",
placeholder="SIRET",
debounce=True,
style={"width": "100%"},
persistence=True,
persistence_type="local",
),
),
),
dbc.Row(
dbc.Col(
dcc.Dropdown(
id="dashboard_acheteur_categorie",
options=get_enum_values_as_dict(
"acheteur_categorie"
),
placeholder="Catégorie",
persistence=True,
persistence_type="local",
)
),
),
dbc.Row(
dbc.Col(
dcc.Dropdown(
id="dashboard_acheteur_departement_code",
searchable=True,
multi=True,
placeholder="Département",
options=OPTIONS_DEPARTEMENTS,
persistence=True,
persistence_type="local",
),
),
),
html.H5("Titulaire"),
dbc.Row(
dbc.Col(
dcc.Input(
id="dashboard_titulaire_id",
placeholder="SIRET",
debounce=True,
style={"width": "100%"},
persistence=True,
persistence_type="local",
),
),
),
dbc.Row(
dbc.Col(
dcc.Dropdown(
id="dashboard_titulaire_categorie",
placeholder="Catégorie",
options=get_enum_values_as_dict(
"titulaire_categorie"
),
persistence=True,
persistence_type="local",
),
),
),
dbc.Row(
dbc.Col(
dcc.Dropdown(
id="dashboard_titulaire_departement_code",
searchable=True,
multi=True,
placeholder="Département",
options=OPTIONS_DEPARTEMENTS,
persistence=True,
persistence_type="local",
),
),
),
html.H5("Marché"),
dbc.Row(
dbc.Col(
dcc.Dropdown(
id="dashboard_marche_type",
placeholder="Type",
options=get_enum_values_as_dict("type"),
persistence=True,
persistence_type="local",
),
),
),
dbc.Row(
dbc.Col(
dcc.Input(
id="dashboard_marche_objet",
placeholder="Objet",
debounce=True,
style={"width": "100%"},
persistence=True,
persistence_type="local",
),
),
),
dbc.Row(
[
dbc.Col(
dcc.Input(
id="dashboard_marche_code_cpv",
placeholder="Code CPV (début)",
debounce=True,
style={"width": "100%"},
persistence=True,
persistence_type="local",
),
lg=8,
),
dbc.Col(
html.A(
"liste des codes",
href="https://cpvcodes.eu/fr",
target="_blank",
),
lg=4,
),
]
),
dbc.Row(
[
dbc.Col(
dcc.Input(
id="dashboard_montant_min",
placeholder="Montant min.",
type="number",
min=0,
debounce=True,
style={"width": "100%"},
persistence=True,
persistence_type="local",
),
width=6,
),
dbc.Col(
dcc.Input(
id="dashboard_montant_max",
placeholder="Montant max.",
type="number",
min=0,
debounce=True,
style={"width": "100%"},
persistence=True,
persistence_type="local",
),
width=6,
),
]
),
dbc.Row(
dbc.Col(
dcc.Dropdown(
id="dashboard_marche_techniques",
placeholder="Techniques d'achat",
options=get_enum_values_as_dict(
"techniques"
),
multi=True,
persistence=True,
persistence_type="local",
),
),
),
dbc.Row(
[
dbc.Col("Sous-traitance :", lg=5),
dbc.Col(
dbc.RadioItems(
id="dashboard_marche_sous_traitance_declaree",
options=[
{
"label": "Tous",
"value": "all",
},
{
"label": "Oui",
"value": "oui",
},
{
"label": "Non",
"value": "non",
},
],
value="all",
inline=True,
persistence=True,
persistence_type="local",
),
lg=7,
),
]
),
dbc.Row(
[
dbc.Col("Marché innovant :", lg=5),
dbc.Col(
dbc.RadioItems(
id="dashboard_marche_innovant",
options=[
{
"label": "Tous",
"value": "all",
},
{
"label": "Oui",
"value": "oui",
},
{
"label": "Non",
"value": "non",
},
],
value="all",
inline=True,
persistence=True,
persistence_type="local",
),
lg=7,
),
]
),
dbc.Row(
dbc.Col(
dcc.Dropdown(
id="dashboard_marche_considerations_sociales",
placeholder="Considérations sociales",
options=get_enum_values_as_dict(
"considerationsSociales"
),
multi=True,
persistence=True,
persistence_type="local",
),
),
),
dbc.Row(
dbc.Col(
dcc.Dropdown(
id="dashboard_marche_considerations_environnementales",
placeholder="Considérations environnementales",
multi=True,
options=get_enum_values_as_dict(
"considerationsEnvironnementales"
),
persistence=True,
persistence_type="local",
),
),
),
dbc.Row(
[
dbc.Col(
[
dcc.Download(
id="download-observatoire"
),
dbc.Button(
"Voir les données",
id="btn-observatoire-preview",
className="btn btn-primary mt-2",
color="primary",
outline=True,
),
dcc.Input(
id="observatoire-share-url",
readOnly=True,
style={"display": "none"},
),
],
lg=12,
xl=6,
),
dbc.Col(
id="observatoire-copy-container",
lg=12,
xl=6,
),
]
),
],
),
dbc.Col(
width=12,
lg=8,
xl=9,
id="cards",
children=[],
),
]
)
],
),
],
),
dbc.Offcanvas(
id="observatoire-preview",
title="Prévisualisation des données",
placement="bottom",
is_open=False,
scrollable=True,
style={"height": "75vh"},
children=[
# Header row: title + "Colonnes affichées" button
dbc.Row(
[
dbc.Col(
html.Div(
className="table-menu",
children=[
dbc.Button(
"Choisir les colonnes",
id="observatoire-preview-columns-open",
className="btn btn-primary",
),
html.P(id="nb_rows_observatoire"),
dbc.Button(
"Télécharger au format Excel",
id="btn-download-observatoire",
disabled=True,
className="btn btn-primary",
outline=True,
),
],
),
width="auto",
),
],
className="mb-2 align-items-center",
),
# Column picker modal
dbc.Modal(
[
dbc.ModalHeader(
dbc.ModalTitle("Colonnes affichées dans la prévisualisation")
),
dbc.ModalBody(
id="observatoire-preview-columns-body",
children=make_column_picker("observatoire_preview"),
),
dbc.ModalFooter(
dbc.Button(
"Fermer",
id="observatoire-preview-columns-close",
className="ms-auto",
n_clicks=0,
)
),
],
id="observatoire-preview-columns-modal",
is_open=False,
fullscreen="md-down",
scrollable=True,
size="xl",
),
# DataTable
dcc.Loading(
overlay_style={"visibility": "visible", "filter": "blur(2px)"},
id="loading-statistques",
type="default",
children=[
html.Div(
className="marches_table",
children=DataTable(
dtid="observatoire-preview-table",
page_size=5,
page_action="custom",
sort_action="custom",
filter_action="custom",
hidden_columns=[],
columns=[
{"id": col, "name": col} for col in OBSERVATOIRE_COLUMNS
],
),
)
],
),
],
),
]
FILTER_PARAMS = [
# (component_id, url_key, is_multi, default_value)
("dashboard_year", "annee", False, None),
("dashboard_acheteur_id", "acheteur_id", False, None),
("dashboard_acheteur_categorie", "acheteur_cat", False, None),
("dashboard_acheteur_departement_code", "acheteur_dept", True, None),
("dashboard_titulaire_id", "titulaire_id", False, None),
("dashboard_titulaire_categorie", "titulaire_cat", False, None),
("dashboard_titulaire_departement_code", "titulaire_dept", True, None),
("dashboard_marche_type", "type", False, None),
("dashboard_marche_objet", "objet", False, None),
("dashboard_marche_code_cpv", "cpv", False, None),
("dashboard_montant_min", "montant_min", False, None),
("dashboard_montant_max", "montant_max", False, None),
("dashboard_marche_techniques", "techniques", True, None),
("dashboard_marche_innovant", "innovant", False, "all"),
("dashboard_marche_sous_traitance_declaree", "sous_traitance", False, "all"),
("dashboard_marche_considerations_sociales", "social", True, None),
("dashboard_marche_considerations_environnementales", "env", True, None),
]
@callback(
*[Output(fp[0], "value") for fp in FILTER_PARAMS],
Input("dashboard_url", "search"),
Input("dashboard_url", "pathname"),
State("observatoire-filters", "data"),
)
def restore_filters(search, _pathname, stored_filters):
if search:
params = urllib.parse.parse_qs(search.lstrip("?"))
known_keys = {fp[1] for fp in FILTER_PARAMS}
if any(k in params for k in known_keys):
values = []
for _comp_id, url_key, is_multi, default in FILTER_PARAMS:
if url_key in params:
if is_multi:
values.append(params[url_key])
else:
raw = params[url_key][0]
if url_key in ("montant_min", "montant_max"):
try:
raw = float(raw)
except (ValueError, TypeError):
raw = None
values.append(raw)
else:
values.append(default)
return tuple(values)
return (no_update,) * 17
@callback(
Output("observatoire-share-url", "value"),
Output("observatoire-copy-container", "children"),
*[Input(fp[0], "value") for fp in FILTER_PARAMS],
Input("dashboard_url", "href"),
)
def sync_observatoire_share_url(*args):
# Last arg is href (State), rest are filter values
filter_values = args[:-1]
href = args[-1]
if not href:
return no_update, no_update
base_url = href.split("?")[0]
params = []
for (_, url_key, is_multi, default), value in zip(FILTER_PARAMS, filter_values):
if value is None or value == default or value == [] or value == "":
continue
if is_multi and isinstance(value, list):
for v in value:
params.append((url_key, v))
else:
params.append((url_key, value))
query_string = urllib.parse.urlencode(params)
full_url = f"{base_url}?{query_string}" if query_string else base_url
if params:
copy_button = dcc.Clipboard(
id="btn-copy-observatoire-url",
target_id="observatoire-share-url",
title="Copier l'URL de cette vue",
style={
"display": "inline-block",
"fontSize": 20,
"verticalAlign": "top",
"cursor": "pointer",
},
className="fa fa-link",
children=[
dbc.Button(
"Partager cette vue",
id="btn-copy-observatoire",
className="btn btn-primary mt-2",
title="Copier l'adresse de cette vue filtrée pour la partager.",
)
],
)
else:
copy_button = html.Div()
return full_url, copy_button
@callback(
Output("observatoire-copy-container", "children", allow_duplicate=True),
Input("btn-copy-observatoire", "n_clicks", allow_optional=True),
prevent_initial_call=True,
)
def show_confirmation(n_clicks):
if n_clicks:
return html.Span(
"Adresse de la vue copiée",
style={"color": "green", "fontWeight": "bold", "marginLeft": "10px"},
)
return no_update
def _normalize_filter_params(filter_params: dict) -> tuple:
"""Produce a deterministic, hashable key for caching."""
return tuple(
sorted(
(k, tuple(v) if isinstance(v, list) else v)
for k, v in filter_params.items()
)
)
@cache.memoize()
def _compute_dashboard_children(filter_params_normalized: tuple):
logger.debug("Cache miss — computing dashboard")
filter_params = {
k: (list(v) if isinstance(v, tuple) else v) for k, v in filter_params_normalized
}
dff = prepare_dashboard_data(**filter_params)
lff = dff.lazy()
df_per_uid = (
dff.select("uid", "montant").group_by("uid").agg(pl.col("montant").first())
)
nb_marches = df_per_uid.height
cards = []
card_summary_table = get_dashboard_summary_table(dff, df_per_uid, nb_marches)
cards.append(make_card(title="Résumé", paragraphs=card_summary_table))
donut_acheteur_categorie, nb_acheteur_categories = make_donut(
lff,
"acheteur_categorie",
nulls="Autres",
per_uid=True,
potentially_many_names=True,
)
cards.append(
make_card(
title="Catégorie d'acheteur",
subtitle="en nombre de marchés attribués",
fig=donut_acheteur_categorie,
lg=12 if nb_acheteur_categories > 4 else 6,
xl=8 if nb_acheteur_categories > 4 else 4,
)
)
donut_titulaire_categorie = make_donut(
lff, "titulaire_categorie", per_uid=False, nulls="?"
)
cards.append(
make_card(
title="Catégorie d'entreprise",
subtitle="en nombre de titulaires",
fig=donut_titulaire_categorie,
)
)
donut_marche_type = make_donut(lff, "type", per_uid=True, nulls="?")
cards.append(
make_card(
title="Type d'achat",
subtitle="en nombre de marchés attribués",
fig=donut_marche_type,
)
)
considerations_content = get_considerations_card_content(lff)
cards.append(
make_card(
title="Considérations sociales et environnementales",
subtitle="part des marchés concernés",
fig=considerations_content,
)
)
distance_histogram = get_distance_histogram(lff)
cards.append(
make_card(
title="Distance acheteurtitulaire",
subtitle="en nombre de marchés, échelle logarithmique",
fig=distance_histogram,
)
)
top_acheteurs = get_top_org_table(
lff, org_type="acheteur", filters=False, extra_columns=[]
)
cards.append(make_card(title="Top acheteurs", fig=top_acheteurs, lg=12, xl=8))
top_titulaires = get_top_org_table(
lff, org_type="titulaire", filters=False, extra_columns=[]
)
cards.append(make_card(title="Top titulaires", fig=top_titulaires, lg=12, xl=8))
geographic_maps: list[dbc.Col] | None = get_geographic_maps(dff)
other_cards = []
sources_barchart = get_barchart_sources(lff, type_date="dateNotification")
other_cards.append(
make_card(
title="Sources de données",
subtitle="Nombre de marchés attribués par mois de notification et source de données",
fig=sources_barchart,
lg=12,
xl=8,
)
)
duplicate_matrix = get_duplicate_matrix()
other_cards.append(
make_card(
title="Matrice de doublons entre sources de données",
subtitle="Ce graphique illustre les doublons de marchés publics entre sources, c'est-à-dire la proportion de marchés publiés par plus d'une source.",
fig=duplicate_matrix,
lg=12,
xl=8,
)
)
return cards + geographic_maps + other_cards
@callback(
Output("cards", "children"),
Output("observatoire-filters", "data"),
*[Input(fp[0], "value") for fp in FILTER_PARAMS],
)
def update_dashboard_cards(*filter_values):
filter_params = {}
for (input_id, _url_key, _is_multi, _default), value in zip(
FILTER_PARAMS, filter_values
):
filter_params[input_id] = value
filter_params_normalized = _normalize_filter_params(filter_params)
children = _compute_dashboard_children(filter_params_normalized)
return dbc.Row(children=children), filter_params
@callback(
Output("download-observatoire", "data"),
Input("btn-download-observatoire", "n_clicks"),
State("observatoire-filters", "data"),
State("observatoire-hidden-columns", "data"),
prevent_initial_call=True,
)
def download_observatoire(_n_clicks, filter_params, hidden_columns):
dff = prepare_dashboard_data(**(filter_params or {}))
if hidden_columns:
dff = dff.drop(hidden_columns)
def to_bytes(buffer):
dff.write_excel(buffer, worksheet="DECP")
date = datetime.now().strftime("%Y-%m-%d_%H:%M:%S")
return dcc.send_bytes(to_bytes, filename=f"decp_observatoire_{date}.xlsx")
@callback(
Output("montant-modal", "is_open"),
Input({"type": "modal-trigger", "index": ALL}, "n_clicks"),
Input("montant-modal-close", "n_clicks"),
prevent_initial_call=True,
)
def toggle_montant_modal(n_triggers, _close):
return isinstance(ctx.triggered_id, dict) and any(n_triggers)
@callback(
Output("page_title", "children"),
Input("dashboard_acheteur_id", "value"),
Input("dashboard_titulaire_id", "value"),
prevent_initial_call=False,
)
def add_organization_name_in_title(acheteur_id, titulaire_id):
acheteur_id = acheteur_id.replace(" ", "") if acheteur_id else None
titulaire_id = titulaire_id.replace(" ", "") if titulaire_id else None
def lookup_nom(df_org, id_col, nom_col, org_id):
match = df_org.filter(pl.col(id_col) == org_id)
return match[nom_col].item(0) if match.height >= 1 else None
if acheteur_id and len(acheteur_id) == 14:
if nom := lookup_nom(DF_ACHETEURS, "acheteur_id", "acheteur_nom", acheteur_id):
return [
NAME,
html.Small(nom, className="text-muted d-block fw-normal fs-5"),
]
elif titulaire_id and len(titulaire_id) == 14:
if nom := lookup_nom(
DF_TITULAIRES, "titulaire_id", "titulaire_nom", titulaire_id
):
return [
NAME,
html.Small(nom, className="text-muted d-block fw-normal fs-5"),
]
return NAME
@callback(
Output("observatoire-preview", "is_open"),
Input("btn-observatoire-preview", "n_clicks"),
State("observatoire-preview", "is_open"),
prevent_initial_call=True,
)
def toggle_observatoire_preview(n_clicks, is_open):
return not is_open
@callback(
Output("observatoire-preview-table", "data"),
Output("observatoire-preview-table", "columns"),
Output("observatoire-preview-table", "tooltip_header"),
Output("observatoire-preview-table", "data_timestamp"),
Output("nb_rows_observatoire", "children"),
Output("btn-download-observatoire", "disabled"),
Output("btn-download-observatoire", "children"),
Output("btn-download-observatoire", "title"),
Output("filter-cleanup-trigger-observatoire-preview", "data", allow_duplicate=True),
Input("observatoire-preview", "is_open"),
Input("observatoire-preview-table", "filter_query"),
Input("observatoire-preview-table", "page_current"),
Input("observatoire-preview-table", "page_size"),
Input("observatoire-preview-table", "sort_by"),
State("observatoire-preview-table", "data_timestamp"),
State("observatoire-filters", "data"),
prevent_initial_call=True,
)
def populate_preview_table(
is_open,
filter_query,
page_current,
page_size,
sort_by,
data_timestamp,
filter_params,
):
if not is_open:
return (no_update,) * 9
dff = prepare_dashboard_data(**(filter_params or {}))
return prepare_table_data(
dff.lazy(),
data_timestamp,
filter_query,
page_current,
page_size,
sort_by,
"observatoire-preview",
)
@callback(
Output("observatoire-hidden-columns", "data", allow_duplicate=True),
Input("observatoire_preview_column_list", "selected_rows"),
prevent_initial_call=True,
)
def update_hidden_columns_from_checkboxes(selected_columns):
if selected_columns:
selected_columns = [COLUMNS[i] for i in selected_columns]
hidden_columns = [col for col in COLUMNS if col not in selected_columns]
return hidden_columns
else:
return []
@callback(
Output("observatoire-preview-table", "hidden_columns"),
Input(
"observatoire-hidden-columns",
"data",
),
)
def store_hidden_columns(hidden_columns):
return hidden_columns
@callback(
Output("observatoire_preview_column_list", "selected_rows"),
Input("observatoire-preview-table", "hidden_columns"),
State(
"observatoire_preview_column_list", "selected_rows"
), # pour éviter la boucle infinie
)
def update_checkboxes_from_hidden_columns(hidden_cols, current_checkboxes):
hidden_cols = hidden_cols or get_default_hidden_columns("tableau")
# Show all columns that are NOT hidden
visible_cols = [COLUMNS.index(col) for col in COLUMNS if col not in hidden_cols]
return visible_cols
@callback(
Output("observatoire-preview-columns-modal", "is_open"),
Input("observatoire-preview-columns-open", "n_clicks"),
Input("observatoire-preview-columns-close", "n_clicks"),
State("observatoire-preview-columns-modal", "is_open"),
)
def toggle_tableau_columns(click_open, click_close, is_open):
if click_open or click_close:
return not is_open
return is_open
+132
View File
@@ -0,0 +1,132 @@
import dash_bootstrap_components as dbc
from dash import Input, Output, State, callback, dcc, html, register_page
from src.figures import DataTable
from src.utils.data import DF_ACHETEURS, DF_TITULAIRES
from src.utils.search import search_org
from src.utils.seo import META_CONTENT
from src.utils.table import setup_table_columns
NAME = "Recherche"
register_page(
__name__,
path="/",
title="Recherche de marchés publics | decp.info",
name=NAME,
description="Explorez et analysez les données des marchés publics français avec cet outil libre et gratuit. Pour une commande publique accessible à toutes et tous.",
image_url=META_CONTENT["image_url"],
order=0,
)
layout = html.Div(
className="container",
children=[
html.Div(
className="tagline",
children=html.P("Recherchez un acheteur ou un titulaire de marché public"),
),
html.Div(
style={
"display": "flex",
"justifyContent": "center",
"marginTop": "30px",
"marginBottom": "30px",
},
children=[
dcc.Input(
id="search",
type="text",
placeholder="Nom d'acheteur/entreprise, SIREN/SIRET, code département",
autoFocus=True,
style={
"margin": "0",
"width": "500px",
"border": "1px solid #ccc",
"borderRight": "none",
"borderRadius": "3px 0 0 3px",
"padding": "5px 10px",
"outline": "none",
"height": "34px",
},
),
html.Button(
"=>",
id="search-button",
className="btn btn-primary",
style={
"border": "1px solid #ccc",
"borderRadius": "0 3px 3px 0",
"marginLeft": "0",
"height": "auto", # Ensure it matches input height if necessary, often relying on padding/line-height
},
),
],
),
html.P(
[
"...ou bien filtrez les marchés publics dans la vue ",
dcc.Link("Tableau", href="/tableau"),
],
style={"textAlign": "center"},
id="mention_tableau",
),
# html.Div(
# className="search_options",
# children=[dcc.RadioItems(options=["Acheteur(s)"])],
# ),
dbc.Row(id="search_results"),
],
)
@callback(
Output("search_results", "children"),
Output("mention_tableau", "style"),
Input("search", "n_submit"),
Input("search-button", "n_clicks"),
State("search", "value"),
prevent_initial_call=True,
)
def update_search_results(n_submit, n_clicks, query):
if query and len(query) >= 1:
cols = []
for org_type in ["acheteur", "titulaire"]:
if org_type == "acheteur":
dff = DF_ACHETEURS
elif org_type == "titulaire":
dff = DF_TITULAIRES
else:
raise ValueError(f"{org_type} is not supported")
# Search acheteurs and titulaires using the same function
results = search_org(dff, query, org_type=org_type)
count = results.height
# Format output
columns, tooltip = setup_table_columns(results, hideable=False)
col = (
dbc.Col(
children=[
html.H3(f"{org_type.title()}s : {count}"),
DataTable(
dtid=f"results_{org_type}_datatable",
columns=columns,
data=results.to_dicts(),
page_size=10,
sort_action="none",
filter_action="none",
),
],
md=6,
)
if count > 0
else html.P(f"Aucun {org_type} trouvé.")
)
cols.append(col)
style = {"textAlign": "center", "display": "none"}
return cols, style
return html.P(""), {"textAlign": "center"}
-55
View File
@@ -1,55 +0,0 @@
from dash import dcc, html, register_page
from src.figures import get_barchart_sources, get_map_count_marches
from src.utils import df, meta_content
name = "Statistiques"
register_page(
__name__,
path="/statistiques",
title=meta_content["title"],
name=name,
description=meta_content["description"],
image_url=meta_content["image_url"],
order=3,
)
layout = [
html.Div(
className="container",
children=[
html.H2(name),
dcc.Loading(
overlay_style={"visibility": "visible", "filter": "blur(2px)"},
id="loading-statistques",
type="default",
children=[
html.Div(
children=[
dcc.Markdown("""
La publication de données essentielles de marchés publics (DECP) est souvent effectuée par
les plateformes de marchés publics (profils d'acheteurs). Cependant, certaines plateformes ne publient pas,
ou publient d'une manière qui rend la récupération des données compliquée. Les données présentées sur ce site
ne représentent donc pas tous les marchés attribués en France, seulement une partie significative.
L'ajout de nouvelles plateformes [est en cours](https://github.com/ColinMaudry/decp-processing/issues?q=is%3Aissue%20state%3Aopen%20label%3A%22source%20de%20donn%C3%A9es%22),
toutes les [contributions](/a-propos#contribuer) sont les bienvenues pour atteindre l'exhaustivité.
"""),
dcc.Graph(figure=get_map_count_marches(df)),
dcc.Graph(
figure=get_barchart_sources(df, "dateNotification")
),
dcc.Graph(
figure=get_barchart_sources(
df, "datePublicationDonnees"
)
),
],
)
],
),
],
)
]
+455 -164
View File
@@ -1,112 +1,214 @@
import json
import os
import urllib.parse
import uuid
from datetime import datetime
import dash_bootstrap_components as dbc
import polars as pl
from dash import Input, Output, State, callback, dash_table, dcc, html, register_page
from src.utils import (
add_links,
add_resource_link,
df,
filter_table_data,
format_montant,
format_number,
meta_content,
setup_table_columns,
sort_table_data,
from dash import (
ClientsideFunction,
Input,
Output,
State,
callback,
clientside_callback,
dcc,
html,
no_update,
register_page,
)
update_date = os.path.getmtime(os.getenv("DATA_FILE_PARQUET_PATH"))
update_date = datetime.fromtimestamp(update_date).strftime("%d/%m/%Y")
from src.db import query_marches, schema
from src.figures import DataTable, make_column_picker
from src.utils import get_data_update_timestamp, logger
from src.utils.seo import META_CONTENT
from src.utils.table import (
COLUMNS,
filter_table_data,
get_default_hidden_columns,
invert_columns,
prepare_table_data,
sort_table_data,
)
from src.utils.tracking import track_search
schema = df.collect_schema()
update_date_timestamp = get_data_update_timestamp(
os.getenv("DATA_FILE_PARQUET_PATH", ""),
os.getenv("DUCKDB_PATH", "./decp.duckdb"),
)
if update_date_timestamp is not None:
update_date = datetime.fromtimestamp(update_date_timestamp).strftime("%d/%m/%Y")
update_date_iso = datetime.fromtimestamp(update_date_timestamp).isoformat()
else:
update_date = "date inconnue"
update_date_iso = ""
name = "Tableau"
NAME = "Tableau"
register_page(
__name__,
path="/",
title=meta_content["title"],
name=name,
description=meta_content["description"],
image_url=meta_content["image_url"],
path="/tableau",
title="Tableau des marchés publics | decp.info",
name=NAME,
description="Consultez, filtrez et exportez les données essentielles de la commande publique sous forme de tableau.",
image_url=META_CONTENT["image_url"],
order=1,
)
datatable = html.Div(
DATATABLE = html.Div(
className="marches_table",
children=dash_table.DataTable(
cell_selectable=False,
id="table",
children=DataTable(
dtid="tableau_datatable",
persisted_props=["filter_query", "sort_by"],
persistence_type="local",
persistence=True,
page_size=20,
page_current=0,
page_action="custom",
filter_action="custom",
filter_options={"case": "insensitive", "placeholder_text": "Filtrer..."},
sort_action="custom",
sort_mode="multi",
sort_by=[],
row_deletable=False,
style_cell_conditional=[
{
"if": {"column_id": "objet"},
"minWidth": "350px",
"textAlign": "left",
"overflow": "hidden",
"lineHeight": "14px",
"whiteSpace": "normal",
},
{
"if": {"column_id": "acheteur_nom"},
"minWidth": "250px",
"textAlign": "left",
"overflow": "hidden",
"lineHeight": "14px",
"whiteSpace": "normal",
},
{
"if": {"column_id": "titulaire_nom"},
"minWidth": "250px",
"textAlign": "left",
"overflow": "hidden",
"lineHeight": "14px",
"whiteSpace": "normal",
},
],
data_timestamp=0,
markdown_options={"html": True},
tooltip_duration=8000,
tooltip_delay=350,
hidden_columns=[],
columns=[{"id": col, "name": col} for col in schema.names()],
),
)
layout = [
html.Div(
html.Details(
dcc.Location(id="tableau_url", refresh=False),
dcc.Store(id="filter-cleanup-trigger-tableau"),
dcc.Store(id="tableau-hidden-columns", storage_type="local"),
dcc.Store(id="tableau-table"),
html.Script(
type="application/ld+json",
id="dataset_jsonld",
children=[
html.Summary(
html.H3("Mode d'emploi", style={"text-decoration": "underline"}),
json.dumps(
{
"@context": "https://schema.org/",
"@type": "Dataset",
"name": "Données essentielles des marchés publics français (DECP)",
"description": "Données de marchés publics exhaustives décrivant les marchés publics attribués en France depuis 2018.",
"url": "https://decp.info",
"sameAs": "https://www.data.gouv.fr/datasets/608c055b35eb4e6ee20eb325",
"keywords": [
"marchés publics",
"commande publique",
"decp",
"public procurement",
],
"license": "https://www.etalab.gouv.fr/licence-ouverte-open-licence",
"isAccessibleForFree": True,
"creator": {
"@type": "Organization",
"url": "https://colmo.tech",
"name": "Colmo",
"sameAs": "https://annuaire-entreprises.data.gouv.fr/entreprise/colmo-989393350",
"contactPoint": {
"@type": "ContactPoint",
"contactType": "Support et contact commercial",
"email": "colin@colmo.tech",
},
},
"includedInDataCatalog": {
"@type": "DataCatalog",
"name": "data.gouv.fr",
},
"distribution": [
{
"@type": "DataDownload",
"encodingFormat": "CSV",
"contentUrl": "https://www.data.gouv.fr/api/1/datasets/r/22847056-61df-452d-837d-8b8ceadbfc52",
},
{
"@type": "DataDownload",
"encodingFormat": "Parquet",
"contentUrl": "https://www.data.gouv.fr/api/1/datasets/r/11cea8e8-df3e-4ed1-932b-781e2635e432",
},
],
**(
{"temporalCoverage": f"2018-01-01/{update_date_iso[:10]}"}
if update_date_iso
else {}
),
"spatialCoverage": {
"@type": "Place",
"address": {"countryCode": "FR"},
},
},
indent=2,
)
],
),
dcc.Markdown(
"""
f"Ce tableau contient tous les marchés attribués en France. Il vous permet d'appliquer un filtre sur une ou plusieurs colonnes, et ainsi produire la liste de marchés dont vous avez besoin (exemples : [marchés de voirie < 40 k€ en 2025](/tableau?filtres=%7Bacheteur_id%7D+icontains+24350013900189+%26%26+%7BdateNotification%7D+icontains+2025%2A+%26%26+%7Bmontant%7D+i%3C+40000+%26%26+%7Bobjet%7D+icontains+voirie&colonnes=uid%2Cacheteur_id%2Cacheteur_nom%2Ctitulaire_id%2Ctitulaire_nom%2Cobjet%2Cmontant%2CdureeMois%2CdateNotification%2Cacheteur_departement_code%2CsourceDataset), [marchés > 500 k€ avec clause sociale attribués à des PME à plus de 100 km dans le Var](/tableau?filtres=%7Btitulaire_categorie%7D+icontains+PME+%26%26+%7Btitulaire_distance%7D+i%3E+100+%26%26+%7Bmontant%7D+i%3E+500000+%26%26+%7Bacheteur_departement_code%7D+icontains+83+%26%26+%7BconsiderationsSociales%7D+icontains+clause&colonnes=uid%2Cacheteur_id%2Cacheteur_nom%2Ctitulaire_id%2Ctitulaire_nom%2Cobjet%2Cmontant%2CdureeMois%2CdateNotification%2CconsiderationsSociales%2Ctitulaire_distance%2Cacheteur_departement_code%2Ctitulaire_categorie%2CsourceDataset)). Par défaut seules quelques colonnes sont affichées, mais vous pouvez en afficher jusqu'à {len(schema.names())} en cliquant sur le bouton **Choisir les colonnes**. Cet outil est assez puissant, je vous recommande de lire le mode d'emploi pour en tirer pleinement partie.",
style={"maxWidth": "1000px"},
),
html.Div(
[],
id="header",
),
dcc.Loading(
overlay_style={"visibility": "visible", "filter": "blur(2px)"},
id="loading-home",
type="default",
children=[
html.Div(
[
# Modal du mode d'emploi
dbc.Button("Mode d'emploi", id="tableau_help_open"),
dbc.Modal(
[
dbc.ModalHeader(dbc.ModalTitle("Mode d'emploi")),
dbc.ModalBody(
dcc.Markdown(
dangerously_allow_html=True,
children=f"""
##### Définition des colonnes
Pour voir la définition d'une colonne, passez votre souris sur son en-tête.
##### Filtres
##### Vos réglages sont persistents
Les filtres, les tris et le choix de colonnes sont automatiquement enregistrés dans votre navigateur et persistent même si vous changez de page ou si vous fermez votre navigateur. À votre retour, vous retrouverez cette page comme vous l'avez laissée.
##### Appliquer des filtres
Vous pouvez appliquer un filtre pour chaque colonne en entrant du texte sous le nom de la colonne, puis en tapant sur `Entrée`.
- Champs textuels : la recherche est insensible à la casse (majuscules/minuscules) et retourne les valeurs qui contiennent
le texte recherché. Exemple : `rennes` retourne "RENNES METROPOLE".
- Champs numériques : vous pouvez soit taper un nombre pour trouver les valeurs égales, soit le précéder de **>** ou **<** pour filtrer les valeurs supérieures ou inférieures. Exemple pour les offres reçues : `> 4` retourne les marchés ayant reçu plus de 4 offres.
- Champs date : vous pouvez également utiliser **>** ou **<**. Exemples : `< 2024-01-31` pour "avant le 31 janvier 2024",
`2024` pour "en 2024", `> 2022` pour "à partir de 2022"
- Champs textuels : la recherche retourne les valeurs qui contiennent le texte recherché, n'est pas sensible à la casse (majuscules/minuscules) et est sensbible à l'accentuation.
- `rennes` => le texte contient "rennes"
- `metro* *pole` => le texte contient un mot qui commence par "metro" et un mot qui finit par "pole"
- `metropole rennes` => le texte contient les mots "metropole" et "rennes", n'importe où dans le texte
- `metropole+rennes` => le texte contient "metropole rennes", collé et dans cet ordre
- `metropole+rennes travaux distri*` => le texte contient "metropole rennes", "travaux" et un mot qui commence par "distri"
- Les guillemets simples (apostrophe du 4) doivent être prédédées d'une barre oblique (AltGr + 8). Exemple : `services d\\\'assurances`
- Champs numériques (Durée en mois, Montant, ...) : vous pouvez...
- soit taper un nombre pour trouver les valeurs strictement égales. Exemple : `12` ne retourne que des 12
- soit le précéder de **>** ou **<** pour filtrer les valeurs supérieures ou inférieures. Exemple pour les offres reçues : `> 4` retourne les marchés ayant reçu plus de 4 offres.
- Champs date (Date de notification, ...) :
- `< 2024-01-31` pour "avant le 31 janvier 2024"
- `2024` pour "en 2024", `> 2022` pour "à partir de 2022"
Vous pouvez filtrer plusieurs colonnes à la fois. Vos filtres sont remis à zéro quand vous rafraîchissez la page.
Vous pouvez filtrer plusieurs colonnes à la fois.
##### Tri
##### Trier les données
Pour trier une colonne, utilisez les flèches grises à côté des noms de colonnes. Chaque clic change le tri dans cet ordre : tri ascendant, tri descendant, pas de tri.
Pour trier une colonne, utilisez les flèches grises à côté des noms de colonnes. Chaque clic change le tri dans cet ordre :
1. tri croissant
2. tri décroissant
3. pas de tri
##### Afficher plus de colonnes
Par défaut, un nombre réduit de colonnes est affiché pour ne pas surcharger la page. Mais vous avez le choix parmi {len(schema.names())} colonnes, ce serait dommage de vous limiter !
Pour afficher plus de colonnes, cliquez sur le bouton **Choisir les colonnes** et cochez les colonnes pour les afficher.
##### Partager une vue
Une vue est un ensemble de filtres, de tris et de choix de colonnes que vous avez appliqués. Cliquez sur **Partager** pour copier une adresse Web qui reproduit la vue courante à l'identique : en la collant dans la barre d'adresse d'un navigateur, vous ouvrez la vue Tableau avec les mêmes paramètres.
Pratique pour partager une vue avec un·e collègue, sur les réseaux sociaux, ou la sauvegarder pour plus tard.
##### Télécharger le résultat
@@ -117,28 +219,35 @@ layout = [
Les liens dans les colonnes Identifiant unique, Acheteur et Titulaire vous permettent de consulter une vue qui leur est dédiée
(informations, marchés attribués/remportés, etc.)
"""
""",
),
),
dbc.ModalFooter(
dbc.Button(
"Fermer",
id="tableau_help_close",
className="ms-auto",
n_clicks=0,
)
),
],
id="instructions",
id="tableau_help",
is_open=False,
fullscreen="md-down",
scrollable=True,
size="lg",
),
id="header",
# Bouton modal des colonnes affichées
dbc.Button(
"Choisir les colonnes",
id="tableau_columns_open",
className="column_list",
title="Choisir les colonnes à afficher et masquer",
),
# html.Div(
# [
# "Recherche dans objet : ",
# dcc.Input(id="search", value="", type="text"),
# ]
# )]),
dcc.Loading(
overlay_style={"visibility": "visible", "filter": "blur(2px)"},
id="loading-home",
type="default",
children=[
html.Div(
[
html.P("lignes", id="nb_rows"),
html.Button(
html.Div(id="copy-container"),
dcc.Input(id="share-url", readOnly=True, style={"display": "none"}),
dbc.Button(
"Téléchargement désactivé au-delà de 65 000 lignes",
id="btn-download-data",
disabled=True,
@@ -146,109 +255,90 @@ layout = [
dcc.Download(id="download-data"),
dcc.Store(id="filtered_data", storage_type="memory"),
html.P("Données mises à jour le " + str(update_date)),
dbc.Button(
"Remettre à zéro",
title="Supprime tous les filtres et les tris. Autrement ils sont conservés même si vous fermez la page.",
id="btn-tableau-reset",
),
],
className="table-menu",
),
datatable,
dbc.Modal(
[
dbc.ModalHeader(dbc.ModalTitle("Choix des colonnes à afficher")),
dbc.ModalBody(
id="tableau_columns_body",
children=make_column_picker("tableau"),
),
dbc.ModalFooter(
dbc.Button(
"Fermer",
id="tableau_columns_close",
className="ms-auto",
n_clicks=0,
)
),
],
id="tableau_columns",
is_open=False,
fullscreen="md-down",
scrollable=True,
size="xl",
),
DATATABLE,
],
),
]
@callback(
Output("table", "data"),
Output("table", "columns"),
Output("table", "tooltip_header"),
Output("table", "data_timestamp"),
Output("tableau_datatable", "data"),
Output("tableau_datatable", "columns"),
Output("tableau_datatable", "tooltip_header"),
Output("tableau_datatable", "data_timestamp"),
Output("nb_rows", "children"),
Output("btn-download-data", "disabled"),
Output("btn-download-data", "children"),
Output("btn-download-data", "title"),
Input("table", "page_current"),
Input("table", "page_size"),
Input("table", "filter_query"),
Input("table", "sort_by"),
State("table", "data_timestamp"),
Output("filter-cleanup-trigger-tableau", "data", allow_duplicate=True),
Input("tableau_url", "href"),
Input("tableau_datatable", "page_current"),
Input("tableau_datatable", "page_size"),
Input("tableau_datatable", "filter_query"),
Input("tableau_datatable", "sort_by"),
State("tableau_datatable", "data_timestamp"),
prevent_initial_call=True,
)
def update_table(page_current, page_size, filter_query, sort_by, data_timestamp):
if os.getenv("DEVELOPMENT").lower() == "true":
print(" + + + + + + + + + + + + + + + + + + ")
# Application des filtres
lff: pl.LazyFrame = df.lazy() # start from the original data
if filter_query:
lff = filter_table_data(lff, filter_query)
if len(sort_by) > 0:
lff = sort_table_data(lff, sort_by)
# Remplace les strings null par "", mais pas les numeric null
lff = lff.fill_null("")
# Matérialisation des filtres
dff: pl.DataFrame = lff.collect()
height = dff.height
nb_rows = f"{format_number(height)} lignes ({format_number(dff.select('uid').unique().height)} marchés)"
# Pagination des données
start_row = page_current * page_size
# end_row = (page_current + 1) * page_size
dff = dff.slice(start_row, page_size)
# Ajout des liens vers l'annuaire des entreprises
dff = add_links(dff)
# Ajout des liens vers les fichiers Open Data
dff = add_resource_link(dff)
# Formatage des montants
dff = format_montant(dff)
columns, tooltip = setup_table_columns(dff)
dicts = dff.to_dicts()
if height > 65000:
download_disabled = True
download_text = "Téléchargement désactivé au-delà de 65 000 lignes"
download_title = "Excel ne supporte pas d'avoir plus de 65 000 URLs dans une même feuille de calcul. Contactez-moi pour me présenter votre besoin en téléchargement afin que je puisse adapter la solution."
else:
download_disabled = False
download_text = "Télécharger au format Excel"
download_title = ""
return (
dicts,
columns,
tooltip,
data_timestamp + 1,
nb_rows,
download_disabled,
download_text,
download_title,
def update_table(href, page_current, page_size, filter_query, sort_by, data_timestamp):
# if ctx.triggered_id != "url":
# search_params = None
# else:
# search_params = urllib.parse.parse_qs(search_params.lstrip("?"))
return prepare_table_data(
None, data_timestamp, filter_query, page_current, page_size, sort_by, "tableau"
)
@callback(
Output("download-data", "data"),
Input("btn-download-data", "n_clicks"),
State("table", "filter_query"),
State("table", "sort_by"),
State("table", "hidden_columns"),
State("tableau_datatable", "filter_query"),
State("tableau_datatable", "sort_by"),
State("tableau_datatable", "hidden_columns"),
prevent_initial_call=True,
)
def download_data(n_clicks, filter_query, sort_by, hidden_columns: list = None):
lff: pl.LazyFrame = df # start from the original data
def download_data(n_clicks, filter_query, sort_by, hidden_columns: list | None = None):
lff: pl.LazyFrame = query_marches().lazy()
# Les colonnes masquées sont supprimées
if hidden_columns:
lff = lff.drop(hidden_columns)
if filter_query:
track_search(filter_query, "tab download")
lff = filter_table_data(lff, filter_query)
if len(sort_by) > 0:
if sort_by and len(sort_by) > 0:
lff = sort_table_data(lff, sort_by)
def to_bytes(buffer):
@@ -256,3 +346,204 @@ def download_data(n_clicks, filter_query, sort_by, hidden_columns: list = None):
date = datetime.now().strftime("%Y-%m-%d_%H:%M:%S")
return dcc.send_bytes(to_bytes, filename=f"decp_{date}.xlsx")
@callback(
Output("tableau_datatable", "filter_query"),
Output("tableau_datatable", "sort_by"),
Output("tableau-hidden-columns", "data"),
Output("tableau_url", "search"),
Output("filter-cleanup-trigger-tableau", "data"),
Input("tableau_url", "search"),
State("tableau_datatable", "filter_query"),
State("tableau_datatable", "sort_by"),
)
def restore_view_from_url(search, stored_filters, stored_sort):
if not search and not stored_filters:
return no_update, no_update, no_update, no_update, no_update
params = urllib.parse.parse_qs(search.lstrip("?")) if search else {}
logger.debug("params " + json.dumps(params, indent=2))
filter_query = no_update
sort_by = no_update
hidden_columns = no_update
trigger_cleanup = no_update
if "filtres" in params:
filter_query = params["filtres"][0]
trigger_cleanup = str(uuid.uuid4())
elif stored_filters:
filter_query = stored_filters
trigger_cleanup = str(uuid.uuid4())
if "tris" in params:
try:
sort_by = json.loads(params["tris"][0])
except json.JSONDecodeError:
pass
elif stored_sort:
sort_by = stored_sort
if "colonnes" in params:
table_columns = params["colonnes"][0].split(",")
verified_columns = [
column for column in table_columns if column in schema.names()
]
hidden_columns = invert_columns(verified_columns)
return filter_query, sort_by, hidden_columns, "", trigger_cleanup
# Pour nettoyer les icontains et i< des filtres
# voir aussi src/assets/dash_clientside.js
clientside_callback(
ClientsideFunction(
namespace="clientside",
function_name="clean_filters",
),
Output("filter-cleanup-trigger-tableau", "data", allow_duplicate=True),
Input("filter-cleanup-trigger-tableau", "data"),
prevent_initial_call=True,
)
@callback(
Output("share-url", "value"),
Output("copy-container", "children"),
Input("tableau_datatable", "filter_query"),
Input("tableau_datatable", "sort_by"),
Input("tableau_datatable", "hidden_columns"),
State("tableau_url", "href"),
prevent_initial_call=True,
)
def sync_url_and_reset_button(filter_query, sort_by, hidden_columns, href):
if not href:
return no_update, no_update
# Extract base URL (remove existing query params)
base_url = href.split("?")[0]
params = {}
if filter_query:
params["filtres"] = filter_query
if sort_by:
params["tris"] = json.dumps(sort_by)
if hidden_columns:
table_columns = invert_columns(hidden_columns)
table_columns = ",".join(table_columns)
params["colonnes"] = table_columns
query_string = urllib.parse.urlencode(params)
full_url = f"{base_url}?{query_string}" if query_string else base_url
copy_button = dcc.Clipboard(
id="btn-copy-url",
target_id="share-url",
title="Copier l'URL de cette vue",
style={
"display": "inline-block",
"fontSize": 20,
"verticalAlign": "top",
"cursor": "pointer",
},
className="fa fa-link",
children=[
dbc.Button(
"Partager la vue",
className="btn btn-primary",
title="Copier l'adresse de cette vue (filtres, tris, choix de colonnes) pour la partager.",
)
],
)
return full_url, copy_button
@callback(
Output("copy-container", "children", allow_duplicate=True),
Input("btn-copy-url", "n_clicks", allow_optional=True),
prevent_initial_call=True,
)
def show_confirmation(n_clicks):
if n_clicks:
return html.Span(
"Adresse de la vue copiée",
style={"color": "green", "fontWeight": "bold", "marginLeft": "10px"},
)
return no_update
@callback(
Output("tableau_help", "is_open"),
[Input("tableau_help_open", "n_clicks"), Input("tableau_help_close", "n_clicks")],
[State("tableau_help", "is_open")],
)
def toggle_tableau_help(click_open, click_close, is_open):
if click_open or click_close:
return not is_open
return is_open
@callback(
Output("tableau-hidden-columns", "data", allow_duplicate=True),
Input("tableau_column_list", "selected_rows"),
prevent_initial_call=True,
)
def update_hidden_columns_from_checkboxes(selected_columns):
if selected_columns:
selected_columns = [COLUMNS[i] for i in selected_columns]
hidden_columns = [col for col in COLUMNS if col not in selected_columns]
return hidden_columns
else:
return []
@callback(
Output("tableau_datatable", "hidden_columns"),
Input(
"tableau-hidden-columns",
"data",
),
)
def store_hidden_columns(hidden_columns):
if hidden_columns is None:
hidden_columns = get_default_hidden_columns("tableau")
return hidden_columns
@callback(
Output("tableau_column_list", "selected_rows"),
Input("tableau_datatable", "hidden_columns"),
State("tableau_column_list", "selected_rows"), # pour éviter la boucle infinie
)
def update_checkboxes_from_hidden_columns(hidden_cols, current_checkboxes):
hidden_cols = hidden_cols or get_default_hidden_columns("tableau")
# Show all columns that are NOT hidden
visible_cols = [COLUMNS.index(col) for col in COLUMNS if col not in hidden_cols]
return visible_cols
@callback(
Output("tableau_columns", "is_open"),
Input("tableau_columns_open", "n_clicks"),
Input("tableau_columns_close", "n_clicks"),
State("tableau_columns", "is_open"),
)
def toggle_tableau_columns(click_open, click_close, is_open):
if click_open or click_close:
return not is_open
return is_open
@callback(
Output("tableau_datatable", "filter_query", allow_duplicate=True),
Output("tableau_datatable", "sort_by", allow_duplicate=True),
Input("btn-tableau-reset", "n_clicks"),
prevent_initial_call=True,
)
def reset_view(n_clicks):
return "", []
+412 -141
View File
@@ -1,54 +1,104 @@
import datetime
from typing import Any
import dash_bootstrap_components as dbc
import polars as pl
from dash import Input, Output, State, callback, dash_table, dcc, html, register_page
from src.figures import point_on_map
from src.utils import (
add_links_in_dict,
df,
format_montant,
format_number,
get_annuaire_data,
get_departement_region,
meta_content,
setup_table_columns,
from dash import (
ClientsideFunction,
Input,
Output,
State,
callback,
clientside_callback,
dcc,
html,
register_page,
)
from src.db import query_marches, schema
from src.figures import (
DataTable,
get_distance_histogram,
get_top_org_table,
make_column_picker,
point_on_map,
)
from src.utils.data import DF_TITULAIRES, get_annuaire_data, get_departement_region
from src.utils.frontend import get_button_properties
from src.utils.seo import META_CONTENT
from src.utils.table import (
COLUMNS,
filter_table_data,
format_number,
get_default_hidden_columns,
prepare_table_data,
sort_table_data,
)
from src.utils.tracking import track_search
def get_title(titulaire_id: str = None) -> str:
titulaire_nom = DF_TITULAIRES.filter(pl.col("titulaire_id") == titulaire_id).select(
"titulaire_nom"
)
if titulaire_nom.height > 0:
return f"Marchés publics remportés par {titulaire_nom.item(0, 0)} | decp.info"
return "Marchés publics remportés | decp.info"
register_page(
__name__,
path_template="/titulaires/<titulaire_id>",
title=meta_content["title"],
title=get_title,
name="Titulaire",
description=meta_content["description"],
image_url=meta_content["image_url"],
description="Consultez les marchés publics remportés par ce titulaire.",
image_url=META_CONTENT["image_url"],
order=5,
)
# 21690123100011
DATATABLE = html.Div(
className="marches_table",
children=DataTable(
dtid="titulaire_datatable",
persistence=True,
persistence_type="local",
persisted_props=["filter_query", "sort_by"],
page_action="custom",
filter_action="custom",
sort_action="custom",
page_size=10,
hidden_columns=[],
columns=[{"id": col, "name": col} for col in schema.names()],
),
)
layout = [
dcc.Store(id="titulaire_data", storage_type="memory"),
dcc.Location(id="url", refresh="callback-nav"),
dcc.Store(id="titulaire-hidden-columns", storage_type="local"),
dcc.Store(id="filter-cleanup-trigger-titulaire"),
dcc.Location(id="titulaire_url", refresh="callback-nav"),
html.Div(
className="container",
children=[
html.Div(
className="wrapper",
style={"marginBottom": "50px"},
children=[
dbc.Row(
className="mb-2",
children=[
dbc.Col(
html.H2(
className="org_title",
children=[
html.Span(id="titulaire_siret"),
" - ",
html.Span(id="titulaire_nom"),
],
),
html.Div(
className="org_year",
children=dcc.Dropdown(
width=8,
),
dbc.Col(
dcc.Dropdown(
id="titulaire_year",
options=["Toutes"]
options=["Toutes les années"]
+ [
str(year)
for year in range(
@@ -57,45 +107,140 @@ layout = [
],
placeholder="Année",
),
width=4,
),
html.Div(
],
),
dbc.Row(
className="mb-2",
children=[
dbc.Col(
className="org_infos",
children=[
# TODO: ajouter le type d'acheteur : commune, CD, CR, etc.
html.P(["Commune : ", html.Strong(id="titulaire_commune")]),
html.P(
[
"Commune : ",
html.Strong(id="titulaire_commune"),
]
),
html.P(
[
"Département : ",
html.Strong(id="titulaire_departement"),
]
),
html.P(["Région : ", html.Strong(id="titulaire_region")]),
html.P(
[
"Région : ",
html.Strong(id="titulaire_region"),
]
),
html.A(
id="titulaire_lien_annuaire",
children="Plus de détails sur l'Annuaire des entreprises",
target="_blank",
),
],
width=4,
),
html.Div(
className="org_stats",
dbc.Col(
children=[
html.P(id="titulaire_titre_stats"),
html.P(id="titulaire_marches_remportes"),
html.P(id="titulaire_acheteurs_differents"),
html.Button(
"Téléchargement au format Excel",
id="btn-download-titulaire-data",
id="btn-download-data-titulaire",
className="btn btn-primary",
),
dcc.Download(id="download-data-titulaire"),
],
width=4,
),
dbc.Col(
id="titulaire_map",
width=4,
),
dcc.Download(id="download-titulaire-data"),
],
),
html.Div(className="org_map", id="titulaire_map"),
dbc.Row(
children=[
dbc.Col(
html.Div(
children=[
html.H3("Top acheteurs"),
html.Div(
className="marches_table",
id="top10_acheteurs",
),
],
),
width=8,
),
dbc.Col(id="titulaire-distance-histogram", width=4),
],
),
],
),
# récupérer les données de l'acheteur sur l'api annuaire
html.H3("Derniers marchés publics remportés"),
html.Div(id="titulaire_last_marches", children=""),
dcc.Loading(
overlay_style={"visibility": "visible", "filter": "blur(2px)"},
id="loading-home",
type="default",
children=[
html.Div(
[
# Bouton modal des colonnes affichées
dbc.Button(
"Colonnes affichées",
id="titulaire_columns_open",
className="column_list",
),
html.P("lignes", id="titulaire_nb_rows"),
html.Button(
"Téléchargement désactivé au-delà de 65 000 lignes",
id="btn-download-filtered-data-titulaire",
disabled=True,
className="btn btn-primary",
),
dcc.Download(id="titulaire-download-filtered-data"),
dbc.Button(
"Remise à zéro",
title="Supprime tous les filtres et les tris. Autrement ils sont conservés même si vous fermez la page.",
id="btn-titulaire-reset",
className="btn btn-primary",
),
],
className="table-menu",
),
dbc.Modal(
[
dbc.ModalHeader(
dbc.ModalTitle("Choix des colonnes à afficher")
),
dbc.ModalBody(
id="titulaire_columns_body",
children=make_column_picker("titulaire"),
),
dbc.ModalFooter(
dbc.Button(
"Fermer",
id="titulaire_columns_close",
className="ms-auto",
n_clicks=0,
)
),
],
id="titulaire_columns",
is_open=False,
fullscreen="md-down",
scrollable=True,
size="xl",
),
DATATABLE,
],
),
],
),
]
@@ -109,18 +254,24 @@ layout = [
Output(component_id="titulaire_departement", component_property="children"),
Output(component_id="titulaire_region", component_property="children"),
Output(component_id="titulaire_lien_annuaire", component_property="href"),
Input(component_id="url", component_property="pathname"),
Input(component_id="titulaire_url", component_property="pathname"),
)
def update_titulaire_infos(url):
titulaire_siret = url.split("/")[-1]
if len(titulaire_siret) != 14:
titulaire_siret = (
f"Le SIRET renseigné doit faire 14 caractères ({titulaire_siret})"
)
data = get_annuaire_data(titulaire_siret)
data_etablissement = data["matching_etablissements"][0]
data_etablissement = data.get("matching_etablissements") if data else None
if data_etablissement:
data_etablissement = data_etablissement[0]
# Extraction du code département à partir du code postal
code_postal = data_etablissement.get("code_postal", "")
departement_code = code_postal[:2] if code_postal else None
# Création de la carte avec le code département pour un centrage approprié
titulaire_map = point_on_map(
data_etablissement["latitude"], data_etablissement["longitude"]
data_etablissement["latitude"],
data_etablissement["longitude"],
departement_code,
)
code_departement, nom_departement, nom_region = get_departement_region(
data_etablissement["code_postal"]
@@ -129,10 +280,23 @@ def update_titulaire_infos(url):
lien_annuaire = (
f"https://annuaire-entreprises.data.gouv.fr/etablissement/{titulaire_siret}"
)
raison_sociale = data["nom_raison_sociale"]
libelle_commune = data_etablissement["libelle_commune"]
else:
titulaire_map = html.Div()
code_departement, nom_departement, nom_region = "", "", ""
departement = ""
lien_annuaire = ""
raison_sociale = html.Span(
f"N° SIREN inconnu de l'INSEE ({titulaire_siret[:9]})"
)
libelle_commune = ""
return (
titulaire_siret,
data["nom_raison_sociale"],
data_etablissement["libelle_commune"],
raison_sociale,
libelle_commune,
titulaire_map,
departement,
nom_region,
@@ -148,126 +312,98 @@ def update_titulaire_infos(url):
Input(component_id="titulaire_data", component_property="data"),
)
def update_titulaire_stats(data):
dff = pl.DataFrame(data)
dff = pl.DataFrame(data, strict=False, infer_schema_length=5000)
if dff.height == 0:
dff = pl.DataFrame(schema=dff.collect_schema())
nb_marches = 0
nb_acheteurs = 0
else:
df_marches = dff.unique("uid")
nb_marches = format_number(df_marches.height)
# somme_marches = format_number(int(df_marches.select(pl.sum("montant")).item()))
marches_remportes = [html.Strong(nb_marches), " marchés et accord-cadres remportés"]
# + ", pour un total de ", html.Strong(somme_marches + " €")]
del df_marches
nb_acheteurs = dff.unique("acheteur_id").height
nb_acheteurs = [
html.Strong(format_number(nb_acheteurs)),
" titulaires (SIRET) différents",
]
del dff
return marches_remportes, nb_acheteurs
texte_marches_remportes = [
html.Strong(nb_marches),
" marchés et accord-cadres remportés",
]
# + ", pour un total de ", html.Strong(somme_marches + " €")]
texte_nb_acheteurs = [
html.Strong(format_number(nb_acheteurs)),
" acheteurs (SIRET) différents",
]
return texte_marches_remportes, texte_nb_acheteurs
@callback(
Output(component_id="titulaire_data", component_property="data"),
Input(component_id="url", component_property="pathname"),
Output("btn-download-data-titulaire", "disabled"),
Output("btn-download-data-titulaire", "children"),
Output("btn-download-data-titulaire", "title"),
Input(component_id="titulaire_url", component_property="pathname"),
Input(component_id="titulaire_year", component_property="value"),
)
def get_titulaire_marches_data(url, titulaire_year: str) -> list[dict]:
def get_titulaire_marches_data(url, titulaire_year: str) -> tuple:
titulaire_siret = url.split("/")[-1]
lff = df.lazy()
lff = lff.filter(
(pl.col("titulaire_id") == titulaire_siret)
& (pl.col("titulaire_typeIdentifiant") == "SIRET")
)
lff = lff.fill_null("")
lff = lff.select(
"id",
"uid",
"objet",
"dateNotification",
"acheteur_id",
"acheteur_nom",
"montant",
"codeCPV",
"dureeMois",
)
if titulaire_year and titulaire_year != "Toutes":
lff = query_marches(
"titulaire_id = ? AND titulaire_typeIdentifiant = 'SIRET'",
(titulaire_siret,),
).lazy()
if titulaire_year and titulaire_year != "Toutes les années":
lff = lff.filter(
pl.col("dateNotification").cast(pl.String).str.starts_with(titulaire_year)
)
lff = lff.sort(["dateNotification", "uid"], descending=True, nulls_last=True)
data = lff.collect(engine="streaming").to_dicts()
return data
lff = lff.fill_null("")
dff: pl.DataFrame = lff.collect(engine="streaming")
download_disabled, download_text, download_title = get_button_properties(dff.height)
data = dff.to_dicts()
return data, download_disabled, download_text, download_title
@callback(
Output(component_id="titulaire_last_marches", component_property="children"),
Output("titulaire_datatable", "data"),
Output("titulaire_datatable", "columns"),
Output("titulaire_datatable", "tooltip_header"),
Output("titulaire_datatable", "data_timestamp"),
Output("titulaire_nb_rows", "children"),
Output("btn-download-filtered-data-titulaire", "disabled"),
Output("btn-download-filtered-data-titulaire", "children"),
Output("btn-download-filtered-data-titulaire", "title"),
Output("filter-cleanup-trigger-titulaire", "data"),
Input(component_id="titulaire_url", component_property="href"),
Input("titulaire_data", "data"),
Input("titulaire_datatable", "page_current"),
Input("titulaire_datatable", "page_size"),
Input("titulaire_datatable", "filter_query"),
Input("titulaire_datatable", "sort_by"),
State("titulaire_datatable", "data_timestamp"),
)
def get_last_marches_data(
href, data, page_current, page_size, filter_query, sort_by, data_timestamp
) -> list[dict]:
return prepare_table_data(
data,
data_timestamp,
filter_query,
page_current,
page_size,
sort_by,
"titulaire",
)
@callback(
Output(component_id="top10_acheteurs", component_property="children"),
Input(component_id="titulaire_data", component_property="data"),
)
def get_last_marches_table(data) -> html.Div:
columns = [
"uid",
"objet",
"dateNotification",
"acheteur_nom",
"montant",
"codeCPV",
"dureeMois",
]
dff = pl.DataFrame(data)
dff = format_montant(dff)
columns, tooltip = setup_table_columns(
dff, hideable=False, exclude=["acheteur_id", "id"]
)
data = dff.to_dicts()
# Idéalement on utiliserait add_org_links(), mais le résultat attendu
# est différent de home.py (Tableau)
data = add_links_in_dict(data, "acheteur")
table = html.Div(
className="marches_table",
id="titulaire_datatable",
children=dash_table.DataTable(
data=data,
markdown_options={"html": True},
page_action="native",
filter_action="native",
filter_options={"case": "insensitive", "placeholder_text": "Filtrer..."},
columns=columns,
tooltip_header=tooltip,
tooltip_duration=8000,
tooltip_delay=350,
cell_selectable=False,
page_size=10,
style_cell_conditional=[
{
"if": {"column_id": "objet"},
"minWidth": "300px",
"textAlign": "left",
"overflow": "hidden",
"lineHeight": "14px",
"whiteSpace": "normal",
},
{
"if": {"column_id": "acheteur_nom"},
"maxWidth": "400px",
"textAlign": "left",
"overflow": "hidden",
"lineHeight": "18px",
"whiteSpace": "normal",
},
],
),
)
return table
def get_top_acheteurs(data):
return get_top_org_table(data, "acheteur", ["titulaire_distance"])
@callback(
Output("download-titulaire-data", "data"),
Input("btn-download-titulaire-data", "n_clicks"),
Output("download-data-titulaire", "data"),
Input("btn-download-data-titulaire", "n_clicks"),
State(component_id="titulaire_data", component_property="data"),
State(component_id="titulaire_nom", component_property="children"),
State(component_id="titulaire_year", component_property="value"),
@@ -275,7 +411,7 @@ def get_last_marches_table(data) -> html.Div:
)
def download_titulaire_data(
n_clicks,
data: [dict],
data: list[dict[str, Any]],
titulaire_nom: str,
annee: str,
):
@@ -283,8 +419,143 @@ def download_titulaire_data(
def to_bytes(buffer):
df_to_download.write_excel(
buffer, worksheet="DECP" if annee in ["Toutes", None] else annee
buffer, worksheet="DECP" if annee in ["Toutes les années", None] else annee
)
date = datetime.datetime.now().strftime("%Y-%m-%d_%H:%M:%S")
return dcc.send_bytes(to_bytes, filename=f"decp_{titulaire_nom}_{date}.xlsx")
@callback(
Output("titulaire-download-filtered-data", "data"),
State("titulaire_data", "data"),
Input("btn-download-filtered-data-titulaire", "n_clicks"),
State("titulaire_nom", "children"),
State("titulaire_datatable", "filter_query"),
State("titulaire_datatable", "sort_by"),
State("titulaire_datatable", "hidden_columns"),
prevent_initial_call=True,
)
def download_filtered_titulaire_data(
data,
n_clicks,
titulaire_nom,
filter_query,
sort_by,
hidden_columns: list | None = None,
):
lff: pl.LazyFrame = pl.LazyFrame(
data
) # start from the full titulaire data, not from paginated table data
# Les colonnes masquées sont supprimées
if hidden_columns:
lff = lff.drop(hidden_columns)
if filter_query:
track_search(filter_query, "titu download")
lff = filter_table_data(lff, filter_query)
if len(sort_by) > 0:
lff = sort_table_data(lff, sort_by)
def to_bytes(buffer):
lff.collect(engine="streaming").write_excel(buffer, worksheet="DECP")
date = datetime.datetime.now().strftime("%Y-%m-%d_%H:%M:%S")
return dcc.send_bytes(
to_bytes, filename=f"decp_filtrées_{titulaire_nom}_{date}.xlsx"
)
# Pour nettoyer les icontains et i< des filtres
# voir aussi src/assets/dash_clientside.js
clientside_callback(
ClientsideFunction(
namespace="clientside",
function_name="clean_filters",
),
Output("filter-cleanup-trigger-titulaire", "data", allow_duplicate=True),
Input("filter-cleanup-trigger-titulaire", "data"),
prevent_initial_call=True,
)
@callback(
Output("titulaire-hidden-columns", "data", allow_duplicate=True),
Input("titulaire_column_list", "selected_rows"),
prevent_initial_call=True,
)
def update_hidden_columns_from_checkboxes(selected_columns):
if selected_columns:
selected_columns = [COLUMNS[i] for i in selected_columns]
hidden_columns = [col for col in COLUMNS if col not in selected_columns]
return hidden_columns
else:
return []
@callback(
Output("titulaire_datatable", "hidden_columns"),
Input(
"titulaire-hidden-columns",
"data",
),
)
def store_hidden_columns(hidden_columns):
if hidden_columns is None:
hidden_columns = get_default_hidden_columns("titulaire")
return hidden_columns
@callback(
Output("titulaire_column_list", "selected_rows"),
Input("titulaire_datatable", "hidden_columns"),
State("titulaire_column_list", "selected_rows"), # pour éviter la boucle infinie
)
def update_checkboxes_from_hidden_columns(hidden_cols, current_checkboxes):
hidden_cols = hidden_cols or get_default_hidden_columns("titulaire")
# Show all columns that are NOT hidden
visible_cols = [COLUMNS.index(col) for col in COLUMNS if col not in hidden_cols]
return visible_cols
@callback(
Output("titulaire_columns", "is_open"),
Input("titulaire_columns_open", "n_clicks"),
Input("titulaire_columns_close", "n_clicks"),
State("titulaire_columns", "is_open"),
)
def toggle_titulaire_columns(click_open, click_close, is_open):
if click_open or click_close:
return not is_open
return is_open
@callback(
Output("titulaire_datatable", "filter_query", allow_duplicate=True),
Output("titulaire_datatable", "sort_by"),
Input("btn-titulaire-reset", "n_clicks"),
prevent_initial_call=True,
)
def reset_view(n_clicks):
return "", []
@callback(
Output("titulaire-distance-histogram", "children"),
Input("titulaire_data", "data"),
)
def update_titulaire_distance_histogram(data):
lff = pl.LazyFrame(data)
if "titulaire_distance" in lff.collect_schema().names():
lff = lff.with_columns(
pl.col("titulaire_distance").cast(pl.Float64, strict=False)
)
fig = get_distance_histogram(lff)
return [
html.H3("Distance acheteur-titulaire"),
html.H6("par nombre de marchés", className="card-subtitle mb-2 text-muted"),
fig,
]
-337
View File
@@ -1,337 +0,0 @@
import json
import logging
import os
from time import sleep
import polars as pl
import polars.selectors as cs
from httpx import get
from polars.exceptions import ComputeError
operators = [
["s<", "<"],
["s>", ">"],
["i<", "<"],
["i>", ">"],
["icontains", "contains"],
]
logger = logging.getLogger("decp.info")
logging.basicConfig(
format="%(asctime)s %(levelname)-8s %(message)s",
level=logging.INFO,
datefmt="%Y-%m-%d %H:%M:%S",
)
def split_filter_part(filter_part):
print("filter part", filter_part)
for operator_group in operators:
if operator_group[0] in filter_part:
name_part, value_part = filter_part.split(operator_group[0], 1)
name_part = name_part.strip()
value = value_part.strip()
name = name_part[name_part.find("{") + 1 : name_part.rfind("}")]
print("=>", name, operator_group[1], value)
return name, operator_group[1], value
return [None] * 3
def add_resource_link(dff: pl.DataFrame) -> pl.DataFrame:
dff = dff.with_columns(
(
'<a href="' + pl.col("sourceFile") + '">' + pl.col("sourceDataset") + "</a>"
).alias("source")
)
dff = dff.drop(["sourceFile", "sourceDataset"])
return dff
def add_links(dff: pl.DataFrame):
dff = dff.with_columns(
pl.when(pl.col("titulaire_typeIdentifiant") == "SIRET")
.then(
'<a href = "/titulaires/'
+ pl.col("titulaire_id")
+ '">'
+ pl.col("titulaire_id")
+ "</a>"
)
.otherwise(pl.col("titulaire_id"))
.alias("titulaire_id")
)
for column, path in [("acheteur_id", "acheteurs"), ("uid", "marches")]:
dff = dff.with_columns(
(
f'<a href = "/{path}/'
+ pl.col(column)
+ '" target="_blank">'
+ pl.col(column)
+ "</a>"
).alias(column)
)
return dff
def add_links_in_dict(data: list, org_type: str) -> list:
new_data = []
for marche in data:
org_id = marche[org_type + "_id"]
marche[org_type + "_nom"] = (
f'<a href="/{org_type}s/{org_id}">{marche[org_type + "_nom"]}</a>'
)
marche["id"] = f'<a href="/marches/{marche["uid"]}">{marche["id"]}</a>'
marche["uid"] = f'<a href="/marches/{marche["uid"]}">{marche["uid"]}</a>'
new_data.append(marche)
return new_data
def booleans_to_strings(lff: pl.LazyFrame) -> pl.LazyFrame:
"""
Convert all boolean columns to string type.
"""
lff = lff.with_columns(
pl.col(cs.Boolean)
.cast(pl.String)
.str.replace("true", "oui")
.str.replace("false", "non")
)
return lff
def numbers_to_strings(lff: pl.LazyFrame) -> pl.LazyFrame:
"""
Convert all numeric columns to string type.
"""
lff = lff.with_columns(pl.col(pl.Float64, pl.Int16).cast(pl.String).fill_null(""))
return lff
def dates_to_strings(lff: pl.LazyFrame, column: str) -> pl.LazyFrame:
"""
Convert a date column to string type.
"""
lff = lff.with_columns(pl.col(column).cast(pl.String).fill_null(""))
return lff
def format_number(number) -> str:
number = "{:,}".format(number).replace(",", " ")
return number
def format_montant(dff: pl.DataFrame) -> pl.DataFrame:
def format_function(expr, scale=None):
# https://stackoverflow.com/a/78636786
expr = expr.cast(pl.String).str.splitn(".", 2)
num = expr.struct[0]
frac = expr.struct[1]
# Ajout des espaces
num = (
num.str.reverse()
.str.replace_all(r"\d{3}", "$0 ")
.str.reverse()
.str.replace(r"^ ", "")
)
frac: pl.Expr = (
pl.when(frac.is_not_null() & ~frac.is_in(["0"]))
.then("," + frac)
.otherwise(pl.lit(""))
)
return num + frac + pl.lit("")
dff = dff.with_columns(pl.col("montant").pipe(format_function).alias("montant"))
return dff
def get_annuaire_data(siret: str) -> dict:
url = f"https://recherche-entreprises.api.gouv.fr/search?q={siret}"
response = get(url)
return response.json()["results"][0]
def get_decp_data() -> pl.DataFrame:
# Chargement du fichier parquet
# Le fichier est chargé en mémoire, ce qui est plus rapide qu'une base de données pour le moment.
# On utilise polars pour la rapidité et la facilité de manipulation des données.
try:
logger.info(
f"Lecture du fichier parquet ({os.getenv('DATA_FILE_PARQUET_PATH')})..."
)
lff: pl.LazyFrame = pl.scan_parquet(os.getenv("DATA_FILE_PARQUET_PATH"))
except ComputeError:
# Le fichier est probablement en cours de mise à jour
logger.info("Échec, nouvelle tentative dans 10s...")
sleep(10)
lff: pl.LazyFrame = pl.scan_parquet(os.getenv("DATA_FILE_PARQUET_PATH"))
# Tri des marchés par date de notification
lff = lff.sort(by=["dateNotification", "uid"], descending=True, nulls_last=True)
# Uniquement les données actuelles, pas les anciennes versions de marchés
lff = lff.filter(pl.col("donneesActuelles")).drop("donneesActuelles")
# Convertir les colonnes booléennes en chaînes de caractères
lff = booleans_to_strings(lff)
# Bizarrement je ne peux pas faire lff = lff.fill_null("") ici
# ça génère une erreur dans la page acheteur (acheteur_data.table) :
# AttributeError: partially initialized module 'pandas' has no attribute 'NaT' (most likely due to a circular import)
return lff.collect()
def get_departements() -> dict:
with open("data/departements.json", "rb") as f:
data = json.load(f)
return data
def get_departement_region(code_postal):
if code_postal > "97000":
code_departement = code_postal[:3]
else:
code_departement = code_postal[:2]
nom_departement = departements[code_departement]["departement"]
nom_region = departements[code_departement]["region"]
return code_departement, nom_departement, nom_region
def filter_table_data(lff: pl.LazyFrame, filter_query: str) -> pl.LazyFrame:
debug = os.getenv("DEVELOPMENT", "False").lower() == "true"
schema = lff.collect_schema()
filtering_expressions = filter_query.split(" && ")
for filter_part in filtering_expressions:
col_name, operator, filter_value = split_filter_part(filter_part)
col_type = str(schema[col_name])
if debug:
print("filter_value:", filter_value)
print("filter_value_type:", type(filter_value))
print("col_type:", col_type)
if col_type == "Date":
# Convertir la colonne en chaînes de caractères
lff = dates_to_strings(lff, col_name)
if operator in ("<", "<=", ">", ">="):
lff = lff.filter(
pl.col(col_name).is_not_null() & (pl.col(col_name) != pl.lit(""))
)
if operator == "<":
lff = lff.filter(pl.col(col_name) < filter_value)
elif operator == ">":
lff = lff.filter(pl.col(col_name) > filter_value)
elif operator == ">=":
lff = lff.filter(pl.col(col_name) >= filter_value)
elif operator == "<=":
lff = lff.filter(pl.col(col_name) <= filter_value)
elif col_type.startswith("Int") or col_type.startswith("Float"):
try:
filter_value = int(filter_value)
except ValueError:
logger.error(f"Invalid numeric filter value: {filter_value}")
continue
lff = lff.filter(pl.col(col_name) == filter_value)
elif operator == "contains" and col_type in ["String", "Date"]:
lff = lff.filter(pl.col(col_name).str.contains("(?i)" + filter_value))
# elif operator == 'datestartswith':
# lff = lff.filter(pl.col(col_name).str.startswith(filter_value)")
return lff
def sort_table_data(lff: pl.LazyFrame, sort_by: list) -> pl.LazyFrame:
lff = lff.sort(
[col["column_id"] for col in sort_by],
descending=[col["direction"] == "desc" for col in sort_by],
nulls_last=True,
)
print(sort_by)
return lff
def setup_table_columns(dff, hideable: bool = True, exclude: list = None) -> tuple:
# Liste finale de colonnes
columns = []
tooltip = {}
for column_id in dff.columns:
if exclude and column_id in exclude:
continue
column_object = data_schema.get(column_id)
if column_object:
column_name = column_object.get("title", column_id)
else:
column_name = column_id
column = {
"name": column_name,
"id": column_id,
"presentation": "markdown",
"type": "text",
"format": {"nully": "N/A"},
"hideable": hideable,
}
columns.append(column)
if column_object:
tooltip[column_id] = {
"value": f"""**{column_object.get("title")}** ({column_id})
"""
+ column_object["description"],
"type": "markdown",
}
return columns, tooltip
def get_data_schema() -> dict:
# Récupération du schéma des données tabulaires
path = os.getenv("DATA_SCHEMA_PATH")
if path.startswith("http"):
original_schema: dict = get(
os.getenv("DATA_SCHEMA_PATH"), follow_redirects=True
).json()
elif os.path.exists(path):
with open(path) as f:
original_schema: dict = json.load(f)
else:
raise Exception(f"Chemin vers le schéma invalide: {path}")
new_schema = {}
for col in original_schema["fields"]:
new_schema[col["name"]] = col
new_schema["source"] = {
"description": "Code de la source des données, avec un lien vers le fichier Open Data dont proviennent les données de ce marché public.",
"title": "Source des données",
"short_name": "Source",
}
return new_schema
df: pl.DataFrame = get_decp_data()
departements = get_departements()
domain_name = (
"test.decp.info" if os.getenv("DEVELOPMENT").lower() == "true" else "decp.info"
)
meta_content = {
"image_url": f"https://{domain_name}/assets/decp.info.png",
"title": "decp.info - exploration des marchés publics français",
"description": (
"Explorez et analysez les données des marchés publics français avec cet outil libre et gratuit. "
"Pour une commande publique accessible à toutes et tous."
),
}
data_schema = get_data_schema()
+59
View File
@@ -0,0 +1,59 @@
import logging
import os
from datetime import datetime
from pathlib import Path
import httpx
from src.utils.cache import cache
@cache.memoize()
def get_last_modified(parquet_path: str) -> float:
logger.info("Récupération de la date de modification des données...")
logging.getLogger("httpx").setLevel("WARNING")
if parquet_path.startswith("http"):
last_modified = httpx.head(
url=parquet_path,
follow_redirects=True,
).headers["last-modified"]
last_modified = datetime.strptime(last_modified, "%a, %d %b %Y %X %Z").strftime(
"%s"
)
return float(last_modified)
parquet_local_path = Path(parquet_path)
return parquet_local_path.stat().st_mtime
logging.basicConfig(
format="%(asctime)s %(levelname)-8s %(message)s",
level=logging.INFO,
datefmt="%Y-%m-%d %H:%M:%S",
)
DEVELOPMENT = os.getenv("DEVELOPMENT", "False").lower() == "true"
logger = logging.getLogger("decp.info")
if DEVELOPMENT:
logger.setLevel(logging.DEBUG)
DOMAIN_NAME = (
"test.decp.info"
if os.getenv("DEVELOPMENT", "False").lower() == "true"
else "decp.info"
)
def get_data_update_timestamp(
parquet_path: str, fallback_path: str | None = None
) -> float | None:
"""Date de MAJ des données, best-effort, sans jamais lever (usage au boot)."""
try:
return get_last_modified(parquet_path)
except Exception as e:
logger.warning(f"Date de mise à jour des données indisponible ({e})")
if fallback_path:
try:
return os.path.getmtime(fallback_path)
except OSError:
pass
return None
+4
View File
@@ -0,0 +1,4 @@
from flask_caching import Cache
# Isolé dans un fichier dédié pour éviter les imports circulaires
cache = Cache()
+160
View File
@@ -0,0 +1,160 @@
import json
import logging
import os
from collections import OrderedDict
import httpx
import polars as pl
from httpx import HTTPError, get
from src.db import get_cursor, query_marches, schema
from src.utils import logger
logging.getLogger("httpx").setLevel("WARNING")
def get_annuaire_data(siret: str) -> dict | None:
url = f"https://recherche-entreprises.api.gouv.fr/search?q={siret}"
try:
response = get(url).raise_for_status()
response = response.json()["results"][0]
except (HTTPError, IndexError):
response = None
logger.warning("Could not fetch data from recherche-entreprises.api.")
return response
def get_statistics() -> dict:
return (
get(
"https://www.data.gouv.fr/api/1/datasets/r/0ccf4a75-f3aa-4b46-8b6a-18aeb63e36df",
follow_redirects=True,
)
.raise_for_status()
.json()
)
def get_departements() -> dict:
with open("data/departements.json", "rb") as f:
data = json.load(f)
return data
def get_departements_geojson() -> dict:
with open("./data/departements-1000m.geojson") as f:
geojson = json.load(f)
# Ajout de feature.id
for f in geojson["features"]:
f["id"] = f["properties"]["code"]
return geojson
def get_departement_region(code_postal: str | None):
if code_postal:
if code_postal > "97000":
code_departement = code_postal[:3]
else:
code_departement = code_postal[:2]
nom_departement = DEPARTEMENTS[code_departement]["departement"]
nom_region = DEPARTEMENTS[code_departement]["region"]
return code_departement, nom_departement, nom_region
return "", "", ""
def _validate_schema(raw) -> dict | None:
if (
isinstance(raw, dict)
and isinstance(raw.get("fields"), list)
and raw["fields"]
and all(isinstance(c, dict) and "name" in c for c in raw["fields"])
):
return raw
return None
def _fetch_remote_schema(url: str | None) -> dict | None:
if not url:
return None
try:
raw = get(url, follow_redirects=True).raise_for_status().json()
except (
httpx.HTTPError,
httpx.TransportError,
httpx.TimeoutException,
json.JSONDecodeError,
) as e:
logger.error(f"Schéma distant indisponible ({url}) : {e}")
return None
return _validate_schema(raw)
def _load_schema_file(path: str) -> dict | None:
if not path or not os.path.exists(path):
return None
try:
with open(path) as f:
raw = json.load(f)
except (OSError, json.JSONDecodeError) as e:
logger.error(f"Schéma local illisible ({path}) : {e}")
return None
return _validate_schema(raw)
def _persist_schema_cache(raw: dict, path: str) -> None:
if not path:
return
try:
tmp = f"{path}.tmp"
with open(tmp, "w") as f:
json.dump(raw, f)
os.replace(tmp, path)
except (OSError, ValueError) as e:
logger.warning(f"Écriture du cache schéma échouée ({path}) : {e}")
def get_data_schema() -> dict:
cache_path = os.getenv("DATA_SCHEMA_CACHE", "./schema.cache.json")
raw = _fetch_remote_schema(os.getenv("DATA_SCHEMA_PATH"))
if raw is not None:
_persist_schema_cache(raw, cache_path)
else:
raw = _load_schema_file(cache_path)
if raw is None:
raise RuntimeError("Aucun schéma disponible (ni distant ni cache).")
return OrderedDict((c["name"], c) for c in raw["fields"])
def prepare_dashboard_data(**filter_params) -> pl.DataFrame:
"""Exécute la requête DuckDB filtrée pour le tableau de bord.
Retourne une pl.DataFrame matérialisée uniquement pour le sous-ensemble
correspondant aux filtres. Les appelants qui ont besoin d'une LazyFrame
appellent `.lazy()` sur le résultat.
"""
from src.utils.table_sql import dashboard_filters_to_sql
where_sql, params = dashboard_filters_to_sql(**filter_params)
return query_marches(where_sql=where_sql, params=params)
def build_org_frame(org_type: str) -> pl.DataFrame:
org_cols = [
c
for c in schema.names()
if c.startswith(f"{org_type}_")
and c not in (f"{org_type}_latitude", f"{org_type}_longitude")
]
select_list = ", ".join(org_cols)
group_list = ", ".join(org_cols)
sql = f'SELECT {select_list}, COUNT(*) AS "Marchés" FROM decp GROUP BY {group_list}'
return get_cursor().execute(sql).pl()
DF_ACHETEURS = build_org_frame("acheteur")
DF_TITULAIRES = build_org_frame("titulaire")
DEPARTEMENTS = get_departements()
DEPARTEMENTS_GEOJSON = get_departements_geojson()
DATA_SCHEMA = get_data_schema()
+27
View File
@@ -0,0 +1,27 @@
from src.utils.data import DATA_SCHEMA
def get_button_properties(height):
if height > 65000:
download_disabled = True
download_text = "Téléchargement désactivé au-delà de 65 000 lignes"
download_title = " Ajoutez des filtres pour réduire le nombre de lignes, Excel ne supporte pas d'avoir plus de 65 000 URLs dans une même feuille de calcul."
elif height == 0:
download_disabled = True
download_text = "Pas de données à télécharger"
download_title = ""
else:
download_disabled = False
download_text = "Télécharger au format Excel"
download_title = "Télécharger les données telles qu'affichées au format Excel"
return download_disabled, download_text, download_title
def get_enum_values_as_dict(column_name):
try:
options = {}
for value in DATA_SCHEMA[column_name]["enum"]:
options[value] = value
return options
except KeyError:
return {"not_found": "not found"}
+84
View File
@@ -0,0 +1,84 @@
import polars as pl
from unidecode import unidecode
from src.utils.table import add_links
from src.utils.tracking import track_search
def search_org(dff: pl.DataFrame, query: str, org_type: str) -> pl.DataFrame:
"""
Search in either 'acheteur' or 'titulaire' DataFrame.
:param dff: Polars DataFrame with acheteur or titulaire columns
:param query: User search string
:param org_type: 'acheteur' or 'titulaire'
:return: Filtered DataFrame with 'matches' column
"""
if not query.strip():
return dff.select(pl.lit(False).alias("matches"))
# Enregistrement des recherche dans Matomo
track_search(query, "home_page_search")
# Normalize query
normalized_query = unidecode(query.strip()).upper()
tokens = [" " + t.strip() for t in normalized_query.split() if t.strip()]
# Define columns based on entity type
cols = [
f"{org_type}_id",
f"{org_type}_nom",
f"{org_type}_departement_nom",
f"{org_type}_departement_code",
f"{org_type}_commune_nom",
]
# Concatenate all fields into one string per row
org_str = pl.concat_str(pl.lit(" "), pl.col(cols), separator=" ").str.replace(
"-", " "
)
# For each token, create a boolean column: True if token is found
token_matches = []
for token in tokens:
token_match = org_str.str.contains(token).alias(f"token_{token}")
token_matches.append(token_match)
# Count how many tokens match per row
match_score = pl.sum_horizontal(token_matches).alias("match_score")
# For each token, create a boolean column: True if token is found
token_matches = []
for token in tokens:
token_match = org_str.str.contains(token).alias(f"token_{token}")
token_matches.append(token_match)
# Sélection des colonnes
if org_type == "acheteur":
dff = dff.select(cols + ["Marchés"])
if org_type == "titulaire":
dff = dff.select(cols + ["Marchés", "titulaire_typeIdentifiant"])
# Apply and filter
dff = (
dff.with_columns(token_matches + [match_score])
.filter(pl.col("match_score") == len(tokens))
.drop([f"token_{token}" for token in tokens])
)
# Format result
dff = add_links(dff)
dff = dff.with_columns(
pl.concat_str(
pl.col(f"{org_type}_departement_nom"),
pl.lit(" ("),
pl.col(f"{org_type}_departement_code"),
pl.lit(")"),
).alias("Département")
)
dff = dff.select(f"{org_type}_id", f"{org_type}_nom", "Département", "Marchés")
dff = dff.group_by(f"{org_type}_id", f"{org_type}_nom", "Département").sum()
dff = dff.sort("Marchés", descending=True)
return dff
+54
View File
@@ -0,0 +1,54 @@
from src.utils import DOMAIN_NAME
from src.utils.data import get_annuaire_data
def make_org_jsonld(org_id, org_type, org_name=None, type_org_id="SIRET") -> dict:
org_types = {"acheteur": "GovernmentOrganization", "titulaire": "Organization"}
address = None
if type_org_id.lower() == "siret" and len(org_id) == 14:
annuaire_data = get_annuaire_data(org_id)
if not annuaire_data:
return {}
annuaire_address = annuaire_data["matching_etablissements"][0]
code_postal = annuaire_address["code_postal"]
commune = annuaire_address["libelle_commune"]
address = (
{
"@type": "PostalAddress",
"streetAddress": annuaire_address.get("adresse", "")
.replace(code_postal, "")
.replace(commune, "")
.strip(),
"addressLocality": commune,
"postalCode": code_postal,
"addressCountry": "FR",
},
)
jsonld = {
"@type": org_types[org_type],
"name": org_name,
"url": f"https://decp.info/{org_type}s/{org_id}",
"sameAs": f"https://annuaire-entreprises.data.gouv.fr/etablissement/{org_id}",
"identifier": {
"@type": "PropertyValue",
"propertyID": type_org_id.lower(),
"value": org_id,
},
}
if address:
jsonld["address"] = address
return jsonld
META_CONTENT = {
"image_url": f"https://{DOMAIN_NAME}/assets/decp.info.png",
"title": "decp.info - exploration des marchés publics français",
"description": (
"Explorez et analysez les données des marchés publics français avec cet outil libre et gratuit. "
"Pour une commande publique accessible à toutes et tous."
),
}
+553
View File
@@ -0,0 +1,553 @@
import os
import uuid
import polars as pl
from dash import no_update
from polars import selectors as cs
from unidecode import unidecode
from src.db import count_marches, count_unique_marches, query_marches, schema
from src.utils import logger
from src.utils.cache import cache
from src.utils.data import DATA_SCHEMA
from src.utils.frontend import get_button_properties
from src.utils.tracking import track_search
def split_filter_part(filter_part):
operators = [
["s<", "<"],
["s>", ">"],
["i<", "<"],
["i>", ">"],
["icontains", "contains"],
# [" ", "contains"]
]
logger.debug("filter part " + filter_part)
for operator_group in operators:
if operator_group[0] in filter_part:
name_part, value_part = filter_part.split(operator_group[0], 1)
name_part = name_part.strip()
value = value_part.strip()
name = name_part[name_part.find("{") + 1 : name_part.rfind("}")]
logger.debug("=> " + " ".join([name, operator_group[1], value]))
return name, operator_group[1], value
return [None] * 3
def add_resource_link(dff: pl.DataFrame) -> pl.DataFrame:
dff = dff.with_columns(
(
'<a href="' + pl.col("sourceFile") + '">' + pl.col("sourceDataset") + "</a>"
).alias("sourceDataset")
)
dff = dff.drop(["sourceFile"])
return dff
def add_links(dff: pl.DataFrame):
for col in ["uid", "acheteur_nom", "titulaire_nom", "acheteur_id", "titulaire_id"]:
if col in dff.columns:
if col.startswith("titulaire_"):
detail_link = (
'<a href = "/titulaires/'
+ pl.col("titulaire_id")
+ '">'
+ pl.col(col)
+ "</a>"
)
if col == "titulaire_nom":
detail_link = (
detail_link
+ ' <a href="/observatoire?titulaire_id='
+ pl.col("titulaire_id")
+ '" title="Voir dans l\'observatoire">📊</a>'
)
dff = dff.with_columns(
pl.when(
pl.Expr.or_(
pl.col("titulaire_typeIdentifiant").is_null(),
pl.col("titulaire_typeIdentifiant") == "SIRET",
)
)
.then(detail_link)
.otherwise(pl.col(col))
.alias(col)
)
if col.startswith("acheteur_"):
detail_link = (
'<a href = "/acheteurs/'
+ pl.col("acheteur_id")
+ '">'
+ pl.col(col)
+ "</a>"
)
if col == "acheteur_nom":
detail_link = (
detail_link
+ ' <a href="/observatoire?acheteur_id='
+ pl.col("acheteur_id")
+ '" title="Voir dans l\'observatoire">📊</a>'
)
dff = dff.with_columns(detail_link.alias(col))
if col == "uid":
dff = dff.with_columns(
(
'<a href = "/marches/'
+ pl.col("uid")
+ '">'
+ pl.col("uid")
+ "</a>"
).alias("uid")
)
return dff
def add_links_in_dict(data: list[dict], org_type: str) -> list:
new_data = []
for marche in data:
org_id = marche[org_type + "_id"]
marche[org_type + "_nom"] = (
f'<a href="/{org_type}s/{org_id}">{marche[org_type + "_nom"]}</a>'
)
if marche.get("uid"):
marche["id"] = f'<a href="/marches/{marche["uid"]}">{marche["id"]}</a>'
marche["uid"] = f'<a href="/marches/{marche["uid"]}">{marche["uid"]}</a>'
new_data.append(marche)
return new_data
def booleans_to_strings(lff: pl.LazyFrame) -> pl.LazyFrame:
"""
Convert all boolean columns to string type.
"""
lff = lff.with_columns(
pl.col(cs.Boolean)
.cast(pl.String)
.str.replace("true", "oui")
.str.replace("false", "non")
)
return lff
def numbers_to_strings(lff: pl.LazyFrame) -> pl.LazyFrame:
"""
Convert all numeric columns to string type.
"""
lff = lff.with_columns(pl.col(pl.Float64, pl.Int16).cast(pl.String).fill_null(""))
return lff
def dates_to_strings(lff: pl.LazyFrame, column: str) -> pl.LazyFrame:
"""
Convert a date column to string type.
"""
lff = lff.with_columns(pl.col(column).cast(pl.String).fill_null(""))
return lff
def normalize_sort_by(sort_by) -> tuple:
if not sort_by:
return ()
return tuple((entry["column_id"], entry["direction"]) for entry in sort_by)
def format_number(number) -> str:
if not number:
return ""
number = "{:,}".format(number).replace(",", " ")
return number
def unformat_montant(number: str) -> float:
number = number.replace("", "")
number = number.replace("", "").replace(" ", "")
number = number.replace(",", ".")
number = number.strip()
return float(number)
def format_values(dff: pl.DataFrame) -> pl.DataFrame:
def format_montant(expr):
# https://stackoverflow.com/a/78636786
expr = expr.cast(pl.String)
expr = expr.str.splitn(".", 2)
num = expr.struct[0]
frac = expr.struct[1]
# Ajout des espaces
num = (
num.str.reverse()
.str.replace_all(r"\d{3}", "$0 ")
.str.reverse()
.str.replace(r"^ ", "")
)
frac: pl.Expr = (
pl.when(frac.is_not_null() & ~frac.is_in(["0"]))
.then("," + frac.str.head(2))
.otherwise(pl.lit(""))
)
montant: pl.Expr = (
pl.when((num + frac) == pl.lit(""))
.then(pl.lit(""))
.otherwise(num + frac + pl.lit(""))
)
return montant
def format_distance(expr):
expr = expr.cast(pl.String)
return pl.concat_str(expr, pl.lit(" km"))
if "montant" in dff.columns:
dff = dff.with_columns(pl.col("montant").pipe(format_montant).alias("montant"))
if "titulaire_distance" in dff.columns:
dff = dff.with_columns(
pl.col("titulaire_distance")
.pipe(format_distance)
.alias("titulaire_distance")
)
return dff
_ACCENT_REPLACEMENTS = [
("[éèêëÉÈÊË]", "e"),
("[àâäÀÂÄ]", "a"),
("[ùûüÙÛÜ]", "u"),
("[îïÎÏ]", "i"),
("[ôöÔÖ]", "o"),
("[çÇ]", "c"),
("[ñÑ]", "n"),
("[æÆ]", "ae"),
("[œŒ]", "oe"),
]
def _deaccent_col(expr: pl.Expr) -> pl.Expr:
for pattern, replacement in _ACCENT_REPLACEMENTS:
expr = expr.str.replace_all(pattern, replacement)
return expr
def filter_table_data(lff: pl.LazyFrame, filter_query: str) -> pl.LazyFrame:
_schema = lff.collect_schema()
filtering_expressions = filter_query.split(" && ")
for filter_part in filtering_expressions:
col_name, operator, filter_value = split_filter_part(filter_part)
if not isinstance(col_name, str) or not isinstance(filter_value, str):
continue
col_type = str(_schema[col_name])
# logger.debug("filter_value:", filter_value)
# logger.debug("filter_value_type:", type(filter_value))
# logger.debug("operator:", operator)
# logger.debug("col_type:", col_type)
lff = lff.filter(pl.col(col_name).is_not_null())
if col_type == "Date":
# Convertir la colonne date en chaînes de caractères
lff = dates_to_strings(lff, col_name)
col_type = "String"
if col_type == "String":
lff = lff.filter(pl.col(col_name) != pl.lit(""))
elif col_type.startswith("Int") or col_type.startswith("Float"):
try:
filter_value = int(filter_value)
except ValueError:
logger.error(f"Invalid numeric filter value: {filter_value}")
continue
if operator in ("contains", "<", "<=", ">", ">="):
if operator == "<":
lff = lff.filter(pl.col(col_name) < filter_value)
elif operator == ">":
lff = lff.filter(pl.col(col_name) > filter_value)
elif operator == ">=":
lff = lff.filter(pl.col(col_name) >= filter_value)
elif operator == "<=":
lff = lff.filter(pl.col(col_name) <= filter_value)
elif operator == "contains":
if col_type in ["String", "Date"] and isinstance(filter_value, str):
filter_value = filter_value.strip('"')
normalized_value = unidecode(filter_value)
col_expr = _deaccent_col(pl.col(col_name))
if filter_value.endswith("*"):
lff = lff.filter(
col_expr.str.starts_with(normalized_value[:-1])
)
elif filter_value.startswith("*"):
lff = lff.filter(col_expr.str.ends_with(normalized_value[1:]))
else:
lff = lff.filter(
col_expr.str.contains("(?i)" + normalized_value)
)
elif col_type.startswith("Int") or col_type.startswith("Float"):
lff = lff.filter(pl.col(col_name) == filter_value)
else:
logger.error(f"Invalid column type: {col_type}")
else:
logger.error(f"Invalid operator: {operator}")
# elif operator == 'datestartswith':
# lff = lff.filter(pl.col(col_name).str.startswith(filter_value)")
return lff
def sort_table_data(lff: pl.LazyFrame, sort_by: list) -> pl.LazyFrame:
lff = lff.sort(
[col["column_id"] for col in sort_by],
descending=[col["direction"] == "desc" for col in sort_by],
nulls_last=True,
)
logger.debug(sort_by)
return lff
def setup_table_columns(
dff,
hideable: bool = True,
exclude: list | None = None,
) -> tuple:
# Liste finale de colonnes
markdown_exceptions = ["montant", "titulaire_distance", "distance", "dureeMois"]
columns = []
tooltip = {}
for column_id in dff.columns:
if exclude and column_id in exclude:
continue
column_object = DATA_SCHEMA.get(column_id)
if column_object:
column_name = column_object.get("title")
else:
# Si le champ est un champ créé par erreur lors d'une jointure, on le skip
if column_id.endswith("_left") or column_id.endswith("_right"):
logger.warning(f"Champ innatendu : {column_id}")
continue
column_name = column_id
column_object = {"title": column_name, "description": ""}
presentation = "input" if column_id in markdown_exceptions else "markdown"
column = {
"name": column_name,
"id": column_id,
"presentation": presentation,
"type": "text",
"format": {"nully": "N/A"},
"hideable": hideable,
}
columns.append(column)
if column_object:
tooltip[column_id] = {
"value": f"""**{column_object.get("title")}** ({column_id})
"""
+ column_object.get("description", ""),
"type": "markdown",
}
return columns, tooltip
def get_default_hidden_columns(page):
if page == "acheteur":
displayed_columns = [
"uid",
"objet",
"dateNotification",
"titulaire_id",
"titulaire_typeIdentifiant",
"titulaire_nom",
"titulaire_distance",
"montant",
"codeCPV",
"dureeRestanteMois",
]
elif page == "titulaire":
displayed_columns = [
"uid",
"objet",
"dateNotification",
"acheteur_id",
"acheteur_nom",
"titulaire_distance",
"montant",
"codeCPV",
"dureeRestanteMois",
]
elif page == "tableau":
displayed_columns = os.getenv("DISPLAYED_COLUMNS")
else:
displayed_columns = os.getenv("DISPLAYED_COLUMNS")
logger.warning(f"Invalid page: {page}")
hidden_columns = []
for col in schema.names():
if col in displayed_columns:
continue
else:
hidden_columns.append(col)
return hidden_columns
def postprocess_page(dff: pl.DataFrame) -> pl.DataFrame:
"""Post-traitement à appliquer sur une page déjà paginée.
À appeler après la pagination.
"""
dff = dff.with_columns(pl.all().cast(pl.String).fill_null(""))
dff = add_links(dff)
if "sourceFile" in dff.columns:
dff = add_resource_link(dff)
if dff.height > 0:
dff = format_values(dff)
return dff
@cache.memoize()
def _fetch_page_sql(
filter_query: str | None,
sort_by_key: tuple,
page_current: int,
page_size: int,
) -> tuple[pl.DataFrame, int, int]:
"""Chemin rapide : filtre/tri/pagine dans DuckDB, post-traite la page seule.
Retourne (page_dataframe_post_traitée, total_count, total_unique_count).
"""
# Import local pour éviter une dépendance circulaire
# (src.utils.table_sql importe split_filter_part depuis src.utils.table).
from src.utils.table_sql import filter_query_to_sql, sort_by_to_sql
logger.debug(
f"Cache miss SQL — filter={filter_query!r} sort={sort_by_key!r} "
f"page={page_current} size={page_size}"
)
where_sql, params = filter_query_to_sql(filter_query or "", schema)
sort_by_dash = [
{"column_id": col, "direction": direction} for col, direction in sort_by_key
]
order_by = sort_by_to_sql(sort_by_dash, schema) or None
total = count_marches(where_sql, params)
total_unique = count_unique_marches(where_sql, params)
page = query_marches(
where_sql=where_sql,
params=params,
order_by=order_by,
limit=page_size,
offset=page_current * page_size,
)
page = postprocess_page(page)
return page, total, total_unique
def prepare_table_data(
data, data_timestamp, filter_query, page_current, page_size, sort_by, source_table
):
"""
Fonction de préparation des données pour les datatables, afin de permettre une gestion fine des logiques,
notamment pour les filtres et les tris.
:param data
:param data_timestamp:
:param filter_query:
:param page_current:
:param page_size:
:param sort_by:
:param source_table:
:return:
"""
logger.debug(" + + + + + + + + + + + + + + + + + + ")
if filter_query:
track_search(filter_query, source_table)
trigger_cleanup = no_update if source_table == "tableau" else str(uuid.uuid4())
if data is None:
# Probablement car il s'agit de la page Tableau
sort_by_key = normalize_sort_by(sort_by)
dff, height, total_unique = _fetch_page_sql(
filter_query=filter_query,
sort_by_key=sort_by_key,
page_current=page_current,
page_size=page_size,
)
else:
if isinstance(data, list):
lff: pl.LazyFrame = pl.LazyFrame(
data, strict=False, infer_schema_length=5000
)
elif isinstance(data, pl.LazyFrame):
lff = data
else:
lff = query_marches().lazy()
if filter_query:
lff = filter_table_data(lff, filter_query)
df_height = lff.select("uid").collect(engine="streaming")
height = df_height.height
total_unique = df_height["uid"].n_unique()
if sort_by and len(sort_by) > 0:
lff = sort_table_data(lff, sort_by)
start_row = page_current * page_size
lff = lff.slice(start_row, page_size)
dff = lff.collect(engine="streaming")
dff: pl.DataFrame = postprocess_page(dff)
if height > 0:
nb_rows = (
f"{format_number(height)} lignes ({format_number(total_unique)} marchés)"
)
else:
nb_rows = "0 lignes (0 marchés)"
table_columns, tooltip = setup_table_columns(dff)
dicts = dff.to_dicts()
download_disabled, download_text, download_title = get_button_properties(height)
return (
dicts,
table_columns,
tooltip,
data_timestamp + 1,
nb_rows,
download_disabled,
download_text,
download_title,
trigger_cleanup,
)
def invert_columns(columns):
"""
Renvoie les colonnes du schéma non spécifiées en paramètre. Utile pour passer d'une colonnes masquées à une liste de colonnes affichées, et vice versa.
:param columns:
:return:
"""
inverted_columns = []
for column in schema.names():
if column not in columns:
inverted_columns.append(column)
return inverted_columns
COLUMNS = schema.names()
+241
View File
@@ -0,0 +1,241 @@
from datetime import datetime, timedelta
import polars as pl
from src.utils import logger
from src.utils.table import split_filter_part
def filter_query_to_sql(filter_query: str, schema: pl.Schema) -> tuple[str, list]:
"""Traduit le DSL de filtres de dash_table.DataTable en fragment SQL DuckDB.
Retourne (where_clause, params) where_clause est un fragment à injecter
après WHERE et params est la liste des valeurs à passer à
cursor.execute(sql, params). Les identifiants de colonnes sont validés
contre le schéma fourni ; jamais concaténés avec des valeurs utilisateur.
"""
if not filter_query:
return "TRUE", []
clauses: list[str] = []
params: list = []
for part in filter_query.split(" && "):
col_name, operator, raw_value = split_filter_part(part)
if not isinstance(col_name, str) or not isinstance(raw_value, str):
continue
if col_name not in schema.names():
logger.warning(f"Colonne inconnue ignorée : {col_name!r}")
continue
col_type = schema[col_name]
is_numeric = col_type.is_numeric()
col_is_date = col_type == pl.Date
quoted_col = f'"{col_name}"'
if is_numeric:
try:
value = int(raw_value) if col_type.is_integer() else float(raw_value)
except ValueError:
logger.warning(f"Valeur numérique invalide ignorée : {raw_value!r}")
continue
if operator == "contains":
clauses.append(f"{quoted_col} IS NOT NULL AND {quoted_col} = ?")
elif operator == ">":
clauses.append(f"{quoted_col} IS NOT NULL AND {quoted_col} > ?")
elif operator == "<":
clauses.append(f"{quoted_col} IS NOT NULL AND {quoted_col} < ?")
else:
logger.warning(f"Opérateur invalide pour numérique : {operator!r}")
continue
params.append(value)
continue
# String / Date : toujours traité comme texte (parité avec Polars)
value = raw_value.strip('"')
if operator == "contains":
if col_is_date:
target = f"CAST({quoted_col} AS VARCHAR)"
if col_name in ("acheteur_id", "titulaire_id"):
value = value.replace(" ", "")
where_clause, param_list = tokenize_text_filter(
col_name, value, col_is_date
)
clauses.append(where_clause)
params.extend(param_list)
logger.debug(params)
continue
elif operator in (">", "<"):
target = f"CAST({quoted_col} AS VARCHAR)" if col_is_date else quoted_col
clauses.append(f"{quoted_col} IS NOT NULL AND {target} {operator} ?")
params.append(value)
else:
logger.warning(f"Opérateur invalide pour chaîne : {operator!r}")
continue
if not clauses:
return "TRUE", []
return " AND ".join(clauses), params
def sort_by_to_sql(sort_by: list[dict] | None, schema: pl.Schema) -> str:
"""Traduit sort_by (format Dash) en clause ORDER BY DuckDB.
Retourne '' si pas de tri (aucun ORDER BY à ajouter).
"""
if not sort_by:
return ""
fragments: list[str] = []
for entry in sort_by:
col = entry.get("column_id")
direction = entry.get("direction")
if col not in schema.names():
logger.warning(f"Tri sur colonne inconnue ignoré : {col!r}")
continue
if direction not in ("asc", "desc"):
logger.warning(f"Tri sur direction inconnue ignoré : {direction!r}")
continue
fragments.append(f'"{col}" {direction.upper()} NULLS LAST')
return ", ".join(fragments)
def dashboard_filters_to_sql(
dashboard_year=None,
dashboard_acheteur_id=None,
dashboard_acheteur_categorie=None,
dashboard_acheteur_departement_code=None,
dashboard_titulaire_id=None,
dashboard_titulaire_categorie=None,
dashboard_titulaire_departement_code=None,
dashboard_marche_type=None,
dashboard_marche_objet=None,
dashboard_marche_code_cpv=None,
dashboard_marche_considerations_sociales=None,
dashboard_marche_considerations_environnementales=None,
dashboard_marche_techniques=None,
dashboard_marche_innovant=None,
dashboard_marche_sous_traitance_declaree=None,
dashboard_montant_min=None,
dashboard_montant_max=None,
) -> tuple[str, list]:
"""Traduit les filtres du tableau de bord en (where_clause, params) DuckDB."""
clauses: list[str] = []
params: list = []
if dashboard_year:
clauses.append('YEAR("dateNotification") = ?')
params.append(int(dashboard_year))
else:
clauses.append('"dateNotification" > ?')
params.append(datetime.now() - timedelta(days=365))
if dashboard_acheteur_id:
dashboard_acheteur_id = dashboard_acheteur_id.replace(" ", "")
clauses.append('"acheteur_id" LIKE ?')
params.append(f"%{dashboard_acheteur_id}%")
else:
if dashboard_acheteur_categorie:
clauses.append('"acheteur_categorie" = ?')
params.append(dashboard_acheteur_categorie)
if dashboard_acheteur_departement_code:
placeholders = ", ".join(["?"] * len(dashboard_acheteur_departement_code))
clauses.append(f'"acheteur_departement_code" IN ({placeholders})')
params.extend(dashboard_acheteur_departement_code)
if dashboard_titulaire_id:
dashboard_titulaire_id = dashboard_titulaire_id.replace(" ", "")
clauses.append('"titulaire_id" LIKE ?')
params.append(f"%{dashboard_titulaire_id}%")
else:
if dashboard_titulaire_categorie:
clauses.append('"titulaire_categorie" = ?')
params.append(dashboard_titulaire_categorie)
if dashboard_titulaire_departement_code:
placeholders = ", ".join(["?"] * len(dashboard_titulaire_departement_code))
clauses.append(f'"titulaire_departement_code" IN ({placeholders})')
params.extend(dashboard_titulaire_departement_code)
if dashboard_marche_type:
clauses.append('"type" = ?')
params.append(dashboard_marche_type)
if dashboard_marche_objet:
where_clause, param_list = tokenize_text_filter("objet", dashboard_marche_objet)
clauses.append(where_clause)
params.extend(param_list)
if dashboard_marche_code_cpv:
clauses.append('"codeCPV" LIKE ?')
params.append(f"{dashboard_marche_code_cpv}%")
if dashboard_marche_innovant and dashboard_marche_innovant != "all":
clauses.append('"marcheInnovant" = ?')
params.append(dashboard_marche_innovant)
if (
dashboard_marche_sous_traitance_declaree
and dashboard_marche_sous_traitance_declaree != "all"
):
clauses.append('"sousTraitanceDeclaree" = ?')
params.append(dashboard_marche_sous_traitance_declaree)
if dashboard_marche_techniques:
clauses.append("list_has_any(string_split(\"techniques\", ', '), ?::VARCHAR[])")
params.append(list(dashboard_marche_techniques))
if dashboard_marche_considerations_sociales:
clauses.append(
"list_has_any(string_split(\"considerationsSociales\", ', '), ?::VARCHAR[])"
)
params.append(list(dashboard_marche_considerations_sociales))
if dashboard_marche_considerations_environnementales:
clauses.append(
"list_has_any(string_split(\"considerationsEnvironnementales\", ', '), ?::VARCHAR[])"
)
params.append(list(dashboard_marche_considerations_environnementales))
if dashboard_montant_min is not None:
clauses.append('"montant" >= ?')
params.append(dashboard_montant_min)
if dashboard_montant_max is not None:
clauses.append('"montant" <= ?')
params.append(dashboard_montant_max)
return " AND ".join(clauses), params
def tokenize_text_filter(
column: str, text: str, col_is_date: bool = False
) -> tuple[str, list]:
terms = text.split()
# si col_is_date alors le deuxième doit être casté en VARCHAR
if col_is_date:
quoted_col = f'CAST("{column}" AS VARCHAR)'
else:
quoted_col = f'"{column}"'
conditions = [f'"{column}" IS NOT NULL', f"{quoted_col} <> ''"]
params = []
for term in terms:
conditions.append(f"{quoted_col} ILIKE ?")
if term.startswith("*") or term.endswith("*"):
params.append(term.replace("*", "%"))
elif "+" in term:
params.append(f"%{term.replace('+', ' ')}%")
else:
params.append(f"%{term}%")
where_clause = " AND ".join(conditions)
return where_clause, params
+30
View File
@@ -0,0 +1,30 @@
import os
import uuid
from time import localtime
from httpx import post
from src.utils import DEVELOPMENT
def track_search(query, category):
if len(query) >= 4 and not DEVELOPMENT and os.getenv("MATOMO_DOMAIN"):
url = "https://decp.info"
params = {
"idsite": os.getenv("MATOMO_ID_SITE"),
"url": url,
"rec": "1",
"action_name": "search" if category == "home_page_search" else "filter",
"search_cat": category,
"rand": uuid.uuid4().hex,
"apiv": "1",
"h": localtime().tm_hour,
"m": localtime().tm_min,
"s": localtime().tm_sec,
"search": query,
"token_auth": os.getenv("MATOMO_TOKEN"),
}
post(
url=f"https://{os.getenv('MATOMO_DOMAIN')}/matomo.php",
params=params,
).raise_for_status()
View File
View File
+290
View File
@@ -0,0 +1,290 @@
#!/usr/bin/env python
"""Benchmark comparatif de l'endpoint /data : decp.info vs data.gouv.fr.
Les deux APIs partagent le même schéma de requête (mêmes opérateurs), donc
chaque scénario est envoyé à l'identique aux deux et les temps de réponse
sont comparés côte à côte.
Usage :
python tests/api/benchmark.py --token decpinfo_xxx
python tests/api/benchmark.py --url http://localhost:8050/api/v1/data --token decpinfo_xxx
python tests/api/benchmark.py --decp-only --token decpinfo_xxx --runs 20
Par défaut, --url pointe vers la production decp.info ; data.gouv.fr est
interrogé sans authentification.
AVERTISSEMENT : les deux bases n'ont pas le même volume (data.gouv.fr ~3M
lignes, decp.info ~1,5M). C'est une comparaison d'implémentation, pas à
volume égal.
"""
import argparse
import sys
import time
from dataclasses import dataclass, field
from urllib.parse import quote
import httpx
DECP_DEFAULT_URL = "https://decp.info/api/v1/data"
DATAGOUV_DEFAULT_URL = (
"https://tabular-api.data.gouv.fr/api/resources/"
"22847056-61df-452d-837d-8b8ceadbfc52/data/"
)
# Chaque scénario : liste de (clé, valeur). valeur=None → drapeau nu (sans `=`),
# requis par data.gouv.fr pour les opérateurs d'agrégation et isnull.
SCENARIOS: list[dict] = [
{
"name": "sans filtre (page 1, 50 résultats)",
"params": [("page", "1"), ("page_size", "50")],
},
{
"name": "filtre __exact sur département",
"params": [("acheteur_departement_code__exact", "44"), ("page_size", "50")],
},
{
"name": "filtre __differs sur département",
"params": [("acheteur_departement_code__differs", "44"), ("page_size", "50")],
},
{
"name": "filtre __contains sur objet",
"params": [("objet__contains", "informatique"), ("page_size", "50")],
},
{
"name": "filtre __greater sur date",
"params": [("dateNotification__greater", "2024-01-01"), ("page_size", "50")],
},
{
"name": "filtre __strictly_greater sur montant",
"params": [("montant__strictly_greater", "100000"), ("page_size", "50")],
},
{
"name": "filtre __in (CPV multiples)",
"params": [("codeCPV__in", "72000000,72200000"), ("page_size", "50")],
},
{
"name": "filtre __isnull sur montant",
"params": [("montant__isnull", None), ("page_size", "50")],
},
{
"name": "tri desc + colonnes sélectionnées",
"params": [
("dateNotification__sort", "desc"),
("columns", "uid,objet,montant,dateNotification"),
("page_size", "50"),
],
},
{
"name": "filtres combinés",
"params": [
("acheteur_departement_code__exact", "75"),
("dateNotification__greater", "2023-01-01"),
("montant__strictly_greater", "50000"),
("dateNotification__sort", "desc"),
("page_size", "50"),
],
},
{
"name": "agrégation groupby + count",
"params": [
("acheteur_departement_code__groupby", None),
("uid__count", None),
("page_size", "100"),
],
},
{
"name": "agrégation groupby + sum + avg",
"params": [
("acheteur_departement_code__groupby", None),
("montant__sum", None),
("montant__avg", None),
("page_size", "100"),
],
},
{
"name": "page 2",
"params": [("page", "2"), ("page_size", "50")],
},
{
"name": "count_results=false (optim COUNT(*))",
"params": [("page_size", "50"), ("count_results", "false")],
"decp_only": True,
},
]
COL_NAME = 40
COL_STAT = 9
@dataclass
class Target:
label: str
base_url: str
headers: dict = field(default_factory=dict)
def build_query(params: list[tuple[str, str | None]]) -> str:
"""Construit la query string. valeur=None → clé nue (sans `=`)."""
parts = []
for key, value in params:
if value is None:
parts.append(key)
else:
parts.append(f"{key}={quote(str(value), safe=',:')}")
return "&".join(parts)
def percentile(data: list[float], p: float) -> float:
if not data:
return float("nan")
sorted_data = sorted(data)
k = (len(sorted_data) - 1) * p / 100
lo, hi = int(k), min(int(k) + 1, len(sorted_data) - 1)
return sorted_data[lo] + (sorted_data[hi] - sorted_data[lo]) * (k - lo)
def measure(target: Target, query: str, runs: int) -> dict | None:
"""Chauffe (1 requête non mesurée) puis chronomètre `runs` requêtes."""
url = f"{target.base_url}?{query}"
try:
warm = httpx.get(url, headers=target.headers, timeout=30)
last_status = warm.status_code
except httpx.RequestError as exc:
return {"error": str(exc), "status": 0}
timings: list[float] = []
for _ in range(runs):
try:
t0 = time.perf_counter()
resp = httpx.get(url, headers=target.headers, timeout=30)
timings.append((time.perf_counter() - t0) * 1000)
last_status = resp.status_code
except httpx.RequestError as exc:
return {"error": str(exc), "status": 0}
return {
"status": last_status,
"median": percentile(timings, 50),
"p95": percentile(timings, 95),
"min": min(timings),
"max": max(timings),
}
def run_benchmark(targets: list[Target], decp_label: str, runs: int) -> None:
print("\nAVERTISSEMENT : volumes de données différents entre les deux APIs.")
print(f"Scénarios : {len(SCENARIOS)} | Répétitions : {runs}\n")
rows: list[dict] = []
for scenario in SCENARIOS:
query = build_query(scenario["params"])
decp_only = scenario.get("decp_only", False)
active = [t for t in targets if not (decp_only and t.label != decp_label)]
measures = {t.label: measure(t, query, runs) for t in active}
rows.append({"name": scenario["name"], "measures": measures})
bits = []
for t in active:
m = measures[t.label]
if "error" in m:
bits.append(f"{t.label}: ERREUR")
else:
bits.append(f"{t.label}: méd {m['median']:.0f}ms [{m['status']}]")
print(f" {scenario['name'][:COL_NAME]:<{COL_NAME}} " + " | ".join(bits))
_print_summary(rows, targets, decp_label)
def _fmt(m: dict | None, key: str) -> str:
if m is None:
return ""
if "error" in m:
return "ERR"
return f"{m[key]:.0f}"
def _print_summary(rows: list[dict], targets: list[Target], decp_label: str) -> None:
dg = next((t.label for t in targets if t.label != decp_label), None)
header = (
f"{'Scénario':<{COL_NAME}}"
f" {'DG méd':>{COL_STAT}} {'DG p95':>{COL_STAT}}"
f" {'decp méd':>{COL_STAT}} {'decp p95':>{COL_STAT}}"
f" {'ratio':>7}"
)
sep = "-" * len(header)
print(
f"\n{'=' * len(header)}\nRÉSUMÉ (ratio = decp / data.gouv.fr, <1 = decp plus rapide)"
)
print(f"{'=' * len(header)}\n{header}\n{sep}")
for row in rows:
m_decp = row["measures"].get(decp_label)
m_dg = row["measures"].get(dg) if dg else None
ratio = ""
if m_decp and m_dg and "error" not in m_decp and "error" not in m_dg:
if m_dg["median"] > 0:
ratio = f"{m_decp['median'] / m_dg['median']:.2f}"
print(
f"{row['name'][:COL_NAME]:<{COL_NAME}}"
f" {_fmt(m_dg, 'median'):>{COL_STAT}} {_fmt(m_dg, 'p95'):>{COL_STAT}}"
f" {_fmt(m_decp, 'median'):>{COL_STAT}} {_fmt(m_decp, 'p95'):>{COL_STAT}}"
f" {ratio:>7}"
)
print(sep)
def main() -> None:
parser = argparse.ArgumentParser(
description="Benchmark comparatif decp.info vs data.gouv.fr (/data)"
)
parser.add_argument(
"--url",
default=DECP_DEFAULT_URL,
help=f"Endpoint /data de decp.info (défaut : {DECP_DEFAULT_URL})",
)
parser.add_argument(
"--datagouv-url",
default=DATAGOUV_DEFAULT_URL,
help="Endpoint /data/ de la ressource data.gouv.fr",
)
parser.add_argument(
"--token",
default=None,
help="Token Bearer decp.info (format decpinfo_xxx)",
)
parser.add_argument(
"--runs",
type=int,
default=5,
help="Répétitions chronométrées par scénario (défaut : 5)",
)
parser.add_argument(
"--decp-only",
action="store_true",
help="Ne benchmarker que decp.info (saute data.gouv.fr)",
)
args = parser.parse_args()
if args.runs < 1:
print("--runs doit être ≥ 1", file=sys.stderr)
sys.exit(1)
decp_label = "decp.info"
decp_headers = {"Authorization": f"Bearer {args.token}"} if args.token else {}
decp = Target(label=decp_label, base_url=args.url, headers=decp_headers)
targets = [decp]
if not args.decp_only:
# data.gouv.fr d'abord pour l'affichage côte à côte
targets.insert(0, Target(label="data.gouv.fr", base_url=args.datagouv_url))
run_benchmark(targets, decp_label, args.runs)
if __name__ == "__main__":
main()
+37
View File
@@ -0,0 +1,37 @@
import pytest
@pytest.fixture
def temp_db(tmp_path, monkeypatch):
"""Une SQLite éphémère pour les tests qui modifient la DB."""
db_path = tmp_path / "users.test.sqlite"
monkeypatch.setenv("USERS_DB_PATH", str(db_path))
from src.api import tokens_db
tokens_db.init_schema(db_path)
return db_path
@pytest.fixture
def api_client(monkeypatch, tmp_path):
"""Client Flask test avec USERS_DB_PATH éphémère et blueprint API monté."""
db_path = tmp_path / "users.test.sqlite"
monkeypatch.setenv("USERS_DB_PATH", str(db_path))
from flask import Flask
from src.api import init_api, tokens_db, tracking
tokens_db.init_schema(db_path)
server = Flask(__name__)
init_api(server)
yield server.test_client(), db_path
tracking.stop_worker()
@pytest.fixture
def valid_token_header(api_client):
from src.api import tokens_db
_, db_path = api_client
token, _ = tokens_db.create_token(db_path, "test-token")
return {"Authorization": f"Bearer {token}"}
+59
View File
@@ -0,0 +1,59 @@
from flask import Flask, g, jsonify
from src.api import tokens_db
from src.api.auth import require_token
def _make_app():
app = Flask(__name__)
@app.route("/protected")
@require_token
def protected():
return jsonify({"token_id": g.token_id})
return app
def test_missing_header_returns_401(temp_db):
app = _make_app()
resp = app.test_client().get("/protected")
assert resp.status_code == 401
assert resp.get_json()["message"] == "missing_token"
def test_bearer_without_value_returns_401(temp_db):
app = _make_app()
resp = app.test_client().get("/protected", headers={"Authorization": "Bearer "})
assert resp.status_code == 401
assert resp.get_json()["message"] == "missing_token"
def test_invalid_token_returns_401(temp_db):
app = _make_app()
resp = app.test_client().get(
"/protected", headers={"Authorization": "Bearer decpinfo_unknown"}
)
assert resp.status_code == 401
assert resp.get_json()["message"] == "invalid_token"
def test_revoked_token_returns_401(temp_db):
token, token_id = tokens_db.create_token(temp_db, "x")
tokens_db.revoke_token(temp_db, token_id)
app = _make_app()
resp = app.test_client().get(
"/protected", headers={"Authorization": f"Bearer {token}"}
)
assert resp.status_code == 401
assert resp.get_json()["message"] == "revoked_token"
def test_valid_token_sets_g_and_calls_view(temp_db):
token, token_id = tokens_db.create_token(temp_db, "x")
app = _make_app()
resp = app.test_client().get(
"/protected", headers={"Authorization": f"Bearer {token}"}
)
assert resp.status_code == 200
assert resp.get_json()["token_id"] == token_id
+19
View File
@@ -0,0 +1,19 @@
import polars as pl
from src.db import aggregate_marches
def test_aggregate_groupby_count_returns_named_columns():
df = aggregate_marches(
select_sql='"acheteur_departement_code", COUNT("uid") AS "uid__count"',
group_by='"acheteur_departement_code"',
)
assert isinstance(df, pl.DataFrame)
assert df.columns == ["acheteur_departement_code", "uid__count"]
assert df["uid__count"].sum() > 0
def test_aggregate_global_without_groupby_returns_one_row():
df = aggregate_marches(select_sql='COUNT("uid") AS "uid__count"')
assert df.height == 1
assert df["uid__count"][0] > 0
+155
View File
@@ -0,0 +1,155 @@
def test_data_without_token_returns_401(api_client):
client, _ = api_client
resp = client.get("/api/v1/data")
assert resp.status_code == 401
def test_data_default_pagination(api_client, valid_token_header):
client, _ = api_client
resp = client.get("/api/v1/data", headers=valid_token_header)
assert resp.status_code == 200
body = resp.get_json()
assert set(body.keys()) >= {"data", "meta", "links"}
assert isinstance(body["data"], list)
assert len(body["data"]) <= 50 # default page_size
assert body["meta"]["page"] == 1
assert body["meta"]["page_size"] == 50
assert "total" in body["meta"]
def test_data_count_results_false_omits_total(api_client, valid_token_header):
client, _ = api_client
resp = client.get("/api/v1/data?count_results=false", headers=valid_token_header)
assert resp.status_code == 200
body = resp.get_json()
assert "total" not in body["meta"]
def test_data_page_size_max_enforced(api_client, valid_token_header):
client, _ = api_client
resp = client.get("/api/v1/data?page_size=5000", headers=valid_token_header)
assert resp.status_code == 400
def test_data_page_size_below_min_rejected(api_client, valid_token_header):
client, _ = api_client
resp = client.get("/api/v1/data?page_size=0", headers=valid_token_header)
assert resp.status_code == 400
def test_data_pagination_links(api_client, valid_token_header):
client, _ = api_client
resp = client.get("/api/v1/data?page=1&page_size=1", headers=valid_token_header)
body = resp.get_json()
assert body["links"]["prev"] is None
if body["meta"]["total"] > 1:
assert body["links"]["next"] is not None
assert "page=2" in body["links"]["next"]
def test_data_filter_exact_string(api_client, valid_token_header):
client, _ = api_client
# On choisit une valeur qui existe dans test.parquet : récupère via la 1re ligne
base = client.get("/api/v1/data?page_size=1", headers=valid_token_header).get_json()
assert base["data"], "test.parquet vide ?"
uid = base["data"][0]["uid"]
resp = client.get(f"/api/v1/data?uid__exact={uid}", headers=valid_token_header)
assert resp.status_code == 200
body = resp.get_json()
assert all(row["uid"] == uid for row in body["data"])
def test_data_unknown_column_filter_returns_400(api_client, valid_token_header):
client, _ = api_client
resp = client.get(
"/api/v1/data?colonne_inexistante__exact=x",
headers=valid_token_header,
)
assert resp.status_code == 400
def test_data_columns_selection(api_client, valid_token_header):
client, _ = api_client
resp = client.get(
"/api/v1/data?columns=uid,objet&page_size=3",
headers=valid_token_header,
)
assert resp.status_code == 200
body = resp.get_json()
for row in body["data"]:
assert set(row.keys()) == {"uid", "objet"}
def test_data_columns_unknown_returns_400(api_client, valid_token_header):
client, _ = api_client
resp = client.get(
"/api/v1/data?columns=uid,foobar",
headers=valid_token_header,
)
assert resp.status_code == 400
def test_data_sort_desc(api_client, valid_token_header):
client, _ = api_client
resp = client.get(
"/api/v1/data?dateNotification__sort=desc&page_size=5",
headers=valid_token_header,
)
assert resp.status_code == 200
body = resp.get_json()
dates = [
row["dateNotification"] for row in body["data"] if row.get("dateNotification")
]
assert dates == sorted(dates, reverse=True)
def test_data_differs_excludes_value(api_client, valid_token_header):
client, _ = api_client
base = client.get("/api/v1/data?page_size=1", headers=valid_token_header).get_json()
uid = base["data"][0]["uid"]
resp = client.get(f"/api/v1/data?uid__differs={uid}", headers=valid_token_header)
assert resp.status_code == 200
body = resp.get_json()
assert all(row["uid"] != uid for row in body["data"])
def test_data_aggregation_groupby_count(api_client, valid_token_header):
client, _ = api_client
resp = client.get(
"/api/v1/data?acheteur_departement_code__groupby&uid__count",
headers=valid_token_header,
)
assert resp.status_code == 200
body = resp.get_json()
assert body["data"], "agrégation vide ?"
for row in body["data"]:
assert set(row.keys()) == {"acheteur_departement_code", "uid__count"}
assert "total" not in body["meta"]
def test_data_aggregation_global_count(api_client, valid_token_header):
client, _ = api_client
resp = client.get("/api/v1/data?uid__count", headers=valid_token_header)
assert resp.status_code == 200
body = resp.get_json()
assert len(body["data"]) == 1
assert "uid__count" in body["data"][0]
def test_data_aggregation_with_filter(api_client, valid_token_header):
client, _ = api_client
resp = client.get(
"/api/v1/data?acheteur_departement_code__groupby&uid__count&montant__greater=0",
headers=valid_token_header,
)
assert resp.status_code == 200
def test_data_aggregation_with_columns_returns_400(api_client, valid_token_header):
client, _ = api_client
resp = client.get(
"/api/v1/data?uid__count&columns=uid",
headers=valid_token_header,
)
assert resp.status_code == 400
+18
View File
@@ -0,0 +1,18 @@
def test_schema_accessible_without_token(api_client):
client, _ = api_client
resp = client.get("/api/v1/schema")
assert resp.status_code == 200
def test_schema_returns_fields(api_client):
client, _ = api_client
resp = client.get("/api/v1/schema")
assert resp.status_code == 200
data = resp.get_json()
assert "fields" in data
assert isinstance(data["fields"], list)
assert len(data["fields"]) > 0
first = data["fields"][0]
assert set(first.keys()) >= {"name", "type", "title", "description"}
names = [f["name"] for f in data["fields"]]
assert "uid" in names
+204
View File
@@ -0,0 +1,204 @@
import polars as pl
import pytest
from src.api.filters import AggregationSpec, FilterError, build_where, parse_aggregators
SCHEMA = pl.Schema(
{
"uid": pl.String,
"objet": pl.String,
"montant": pl.Float64,
"annee": pl.Int64,
"dateNotification": pl.Date,
}
)
def test_no_filters_returns_true():
where, params, order = build_where([], SCHEMA)
assert where == "TRUE"
assert params == []
assert order is None
def test_exact_filter():
where, params, _ = build_where([("uid__exact", "abc")], SCHEMA)
assert where == '"uid" = ?'
assert params == ["abc"]
def test_contains_filter_uses_like_wildcards():
where, params, _ = build_where([("objet__contains", "informatique")], SCHEMA)
assert where == '"objet" LIKE ?'
assert params == ["%informatique%"]
def test_notcontains_filter():
where, params, _ = build_where([("objet__notcontains", "x")], SCHEMA)
assert where == '"objet" NOT LIKE ?'
assert params == ["%x%"]
def test_comparison_operators_on_int():
where, params, _ = build_where([("annee__strictly_greater", "2023")], SCHEMA)
assert where == '"annee" > ?'
assert params == [2024 - 1] # int coercion: 2023
def test_in_filter_splits_on_commas():
where, params, _ = build_where([("annee__in", "2022,2023,2024")], SCHEMA)
assert where == '"annee" IN (?,?,?)'
assert params == [2022, 2023, 2024]
def test_notin_filter():
where, params, _ = build_where([("annee__notin", "2020,2021")], SCHEMA)
assert where == '"annee" NOT IN (?,?)'
assert params == [2020, 2021]
def test_isnull_filter_ignores_value():
where, params, _ = build_where([("dateNotification__isnull", "anything")], SCHEMA)
assert where == '"dateNotification" IS NULL'
assert params == []
def test_isnotnull_filter():
where, params, _ = build_where([("dateNotification__isnotnull", "")], SCHEMA)
assert where == '"dateNotification" IS NOT NULL'
def test_multiple_filters_joined_by_and():
where, params, _ = build_where(
[("uid__exact", "a"), ("annee__greater", "2020")], SCHEMA
)
assert where == '"uid" = ? AND "annee" >= ?'
assert params == ["a", 2020]
def test_unknown_column_raises():
with pytest.raises(FilterError) as exc:
build_where([("foo__exact", "bar")], SCHEMA)
assert "foo" in str(exc.value)
assert exc.value.field == "foo__exact"
def test_unknown_operator_raises():
with pytest.raises(FilterError) as exc:
build_where([("uid__weird", "x")], SCHEMA)
assert "weird" in str(exc.value)
def test_bad_int_value_raises():
with pytest.raises(FilterError):
build_where([("annee__exact", "notanint")], SCHEMA)
def test_bad_date_value_raises():
with pytest.raises(FilterError):
build_where([("dateNotification__exact", "notadate")], SCHEMA)
def test_date_iso_coercion():
where, params, _ = build_where(
[("dateNotification__greater", "2024-01-01")], SCHEMA
)
from datetime import date
assert params == [date(2024, 1, 1)]
def test_reserved_params_are_ignored():
where, params, order = build_where(
[
("page", "2"),
("page_size", "100"),
("columns", "uid"),
("count_results", "false"),
("uid__exact", "z"),
],
SCHEMA,
)
assert where == '"uid" = ?'
assert params == ["z"]
def test_sort_returns_order_by():
where, params, order = build_where(
[("annee__sort", "desc"), ("uid__sort", "asc")], SCHEMA
)
assert where == "TRUE"
assert order == '"annee" DESC, "uid" ASC'
def test_sort_invalid_direction_raises():
with pytest.raises(FilterError):
build_where([("uid__sort", "sideways")], SCHEMA)
def test_param_without_operator_raises():
with pytest.raises(FilterError):
build_where([("uidexact", "x")], SCHEMA)
def test_differs_filter():
where, params, _ = build_where([("uid__differs", "abc")], SCHEMA)
assert where == '"uid" IS DISTINCT FROM ?'
assert params == ["abc"]
def test_differs_filter_on_int():
where, params, _ = build_where([("annee__differs", "2020")], SCHEMA)
assert where == '"annee" IS DISTINCT FROM ?'
assert params == [2020]
def test_parse_aggregators_none_when_absent():
assert parse_aggregators([("uid__exact", "a")], SCHEMA) is None
def test_parse_aggregators_groupby_and_count():
spec = parse_aggregators([("annee__groupby", ""), ("uid__count", "")], SCHEMA)
assert isinstance(spec, AggregationSpec)
assert spec.select_sql == '"annee", COUNT("uid") AS "uid__count"'
assert spec.group_by_sql == '"annee"'
def test_parse_aggregators_multiple_aggregates():
spec = parse_aggregators(
[
("annee__groupby", ""),
("montant__sum", ""),
("montant__avg", ""),
("montant__min", ""),
("montant__max", ""),
],
SCHEMA,
)
assert spec.select_sql == (
'"annee", SUM("montant") AS "montant__sum", '
'AVG("montant") AS "montant__avg", '
'MIN("montant") AS "montant__min", '
'MAX("montant") AS "montant__max"'
)
assert spec.group_by_sql == '"annee"'
def test_parse_aggregators_global_without_groupby():
spec = parse_aggregators([("uid__count", "")], SCHEMA)
assert spec.select_sql == 'COUNT("uid") AS "uid__count"'
assert spec.group_by_sql is None
def test_parse_aggregators_unknown_column_raises():
with pytest.raises(FilterError):
parse_aggregators([("nope__count", "")], SCHEMA)
def test_build_where_ignores_aggregator_flags():
where, params, _ = build_where(
[("annee__groupby", ""), ("uid__count", ""), ("montant__greater", "100")],
SCHEMA,
)
assert where == '"montant" >= ?'
assert params == [100.0]
+25
View File
@@ -0,0 +1,25 @@
from flask import Flask
from src.api import init_api
def _make_app():
app = Flask(__name__)
init_api(app)
return app
def test_health_returns_ok_without_auth():
app = _make_app()
resp = app.test_client().get("/api/v1/health")
assert resp.status_code == 200
assert resp.get_json() == {"status": "ok"}
def test_health_via_real_app():
"""Vérifie que init_api est bien branché dans src.app."""
from src.app import app as dash_app
resp = dash_app.server.test_client().get("/api/v1/health")
assert resp.status_code == 200
assert resp.get_json() == {"status": "ok"}
+15
View File
@@ -0,0 +1,15 @@
def test_openapi_documents_new_keywords(api_client):
client, _ = api_client
resp = client.get("/api/v1/openapi.json")
assert resp.status_code == 200
raw = resp.get_data(as_text=True)
for keyword in [
"count_results",
"differs",
"groupby",
"__sum",
"__avg",
"__min",
"__max",
]:
assert keyword in raw, f"{keyword} absent de la doc OpenAPI"
+33
View File
@@ -0,0 +1,33 @@
from src.api import tokens_cli, tokens_db
def _run(args, env):
return tokens_cli.main(args, env=env)
def test_create_prints_plaintext_token_once(temp_db, capsys):
rc = _run(["create", "--label", "alice"], env={"USERS_DB_PATH": str(temp_db)})
out = capsys.readouterr().out
assert rc == 0
assert "decpinfo_" in out
tokens = tokens_db.list_tokens(temp_db)
assert len(tokens) == 1
assert tokens[0]["label"] == "alice"
def test_list_shows_tokens(temp_db, capsys):
tokens_db.create_token(temp_db, "alice")
tokens_db.create_token(temp_db, "bob")
rc = _run(["list"], env={"USERS_DB_PATH": str(temp_db)})
out = capsys.readouterr().out
assert rc == 0
assert "alice" in out
assert "bob" in out
def test_revoke_sets_revoked_at(temp_db, capsys):
_, token_id = tokens_db.create_token(temp_db, "alice")
rc = _run(["revoke", str(token_id)], env={"USERS_DB_PATH": str(temp_db)})
assert rc == 0
tokens = tokens_db.list_tokens(temp_db)
assert tokens[0]["revoked_at"] is not None
+64
View File
@@ -0,0 +1,64 @@
import sqlite3
from src.api import tokens_db
def test_init_schema_creates_table(temp_db):
with sqlite3.connect(str(temp_db)) as conn:
rows = conn.execute(
"SELECT name FROM sqlite_master WHERE type='table' AND name='api_tokens'"
).fetchall()
assert rows == [("api_tokens",)]
def test_create_token_returns_plaintext_and_stores_hash(temp_db):
token, token_id = tokens_db.create_token(temp_db, "test-label")
assert token.startswith("decpinfo_")
assert len(token) == len("decpinfo_") + 64 # 32 octets hex = 64 chars
assert token_id >= 1
with sqlite3.connect(str(temp_db)) as conn:
row = conn.execute(
"SELECT token_hash, label, count_total FROM api_tokens WHERE id = ?",
(token_id,),
).fetchone()
assert row[1] == "test-label"
assert row[2] == 0
assert row[0] != token # stocké en clair impossible
assert len(row[0]) == 64 # sha256 hex
def test_get_token_by_plaintext_returns_row(temp_db):
token, token_id = tokens_db.create_token(temp_db, "x")
row = tokens_db.get_token_by_plaintext(temp_db, token)
assert row is not None
assert row["id"] == token_id
assert row["label"] == "x"
assert row["revoked_at"] is None
def test_get_token_unknown_returns_none(temp_db):
assert tokens_db.get_token_by_plaintext(temp_db, "decpinfo_zzz") is None
def test_revoke_token_sets_revoked_at(temp_db):
token, token_id = tokens_db.create_token(temp_db, "x")
tokens_db.revoke_token(temp_db, token_id)
row = tokens_db.get_token_by_plaintext(temp_db, token)
assert row["revoked_at"] is not None
def test_increment_usage_updates_counter_and_timestamp(temp_db):
token, token_id = tokens_db.create_token(temp_db, "x")
tokens_db.increment_usage(temp_db, token_id)
tokens_db.increment_usage(temp_db, token_id)
row = tokens_db.get_token_by_plaintext(temp_db, token)
assert row["count_total"] == 2
assert row["last_used_at"] is not None
def test_list_tokens_returns_all(temp_db):
tokens_db.create_token(temp_db, "a")
tokens_db.create_token(temp_db, "b")
rows = tokens_db.list_tokens(temp_db)
assert [r["label"] for r in rows] == ["a", "b"]
+80
View File
@@ -0,0 +1,80 @@
from src.api import tokens_db, tracking
def test_counter_worker_increments_count(temp_db):
_, token_id = tokens_db.create_token(temp_db, "x")
tracking.stop_worker() # reset any worker left by earlier tests
tracking.start_worker(str(temp_db))
try:
tracking.enqueue_counter_update(token_id)
tracking.enqueue_counter_update(token_id)
# Laisser le worker drainer la queue
tracking.flush(timeout=2.0)
finally:
tracking.stop_worker()
rows = tokens_db.list_tokens(temp_db)
assert rows[0]["count_total"] == 2
assert rows[0]["last_used_at"] is not None
def test_after_request_hook_increments_counter_async(api_client, valid_token_header):
client, db_path = api_client
# Récupérer le token_id du token créé par la fixture
from src.api import tokens_db, tracking
rows = tokens_db.list_tokens(db_path)
assert len(rows) == 1 # vérification du token créé par la fixture
# Faire une requête (qui doit déclencher l'incrément)
client.get("/api/v1/health") # pas authentifiée → ne compte pas
client.get("/api/v1/data", headers=valid_token_header) # /schema est public
tracking.flush(timeout=2.0)
rows = tokens_db.list_tokens(db_path)
assert rows[0]["count_total"] == 1
def test_matomo_disabled_skips_call(monkeypatch, api_client, valid_token_header):
monkeypatch.setenv("MATOMO_TRACKING_ENABLED", "false")
client, _ = api_client
from src.api import tracking
called = []
monkeypatch.setattr(
tracking,
"_post_matomo",
lambda **kw: called.append(kw),
)
client.get("/api/v1/data", headers=valid_token_header) # authentifiée → hook actif
tracking.flush(timeout=2.0)
assert called == []
def test_matomo_enabled_posts_event(monkeypatch, api_client, valid_token_header):
monkeypatch.setenv("MATOMO_TRACKING_ENABLED", "true")
monkeypatch.setenv("MATOMO_URL", "https://matomo.example/matomo.php")
monkeypatch.setenv("MATOMO_SITE_ID", "42")
from src.api import tracking
captured = []
monkeypatch.setattr(
tracking,
"_post_matomo",
lambda **kw: captured.append(kw),
)
client, _ = api_client
client.get("/api/v1/data", headers=valid_token_header) # /schema est public
tracking.flush(timeout=2.0)
assert len(captured) == 1
call = captured[0]
assert call["params"]["idsite"] == "42"
assert call["params"]["rec"] == "1"
assert "token-" in call["params"]["uid"]
assert call["params"]["dimension2"] == "200"
+90
View File
@@ -0,0 +1,90 @@
import datetime
import os
from pathlib import Path
import polars as pl
import pytest
from selenium.webdriver.chrome.options import Options
_TEST_DATA = [
{
"uid": "1",
"id": "1",
"acheteur_nom": "ACHETEUR 1",
"acheteur_id": "123",
"titulaire_nom": "TITULAIRE 1",
"titulaire_id": "345",
"montant": 10,
"dateNotification": datetime.date(2025, 1, 1),
"codeCPV": "71600000",
"donneesActuelles": True,
"acheteur_departement_code": "75",
"acheteur_departement_nom": "Paris",
"acheteur_commune_nom": "Paris",
"titulaire_departement_code": "35",
"titulaire_departement_nom": "Ille-et-Vilaine",
"titulaire_commune_nom": "Rennes",
"titulaire_distance": 10,
"titulaire_typeIdentifiant": "SIRET",
"objet": "Objet test",
"dureeRestanteMois": 12,
"lieuExecution_code": "75001",
"sourceFile": "test.xml",
"sourceDataset": "test_dataset",
"datePublicationDonnees": datetime.date(2025, 1, 1),
"considerationsSociales": "",
"considerationsEnvironnementales": "",
"type": "Marché",
"acheteur_categorie": "Collectivité",
"titulaire_categorie": "PME",
}
]
_PARQUET_PATH = Path(os.path.abspath("tests/test.parquet"))
_DB_PATH = Path(os.path.abspath("decp.duckdb"))
# Schéma déterministe et hors-ligne pour les tests : on pointe le cache sur un
# fixture commité et on désactive la récupération distante.
_SCHEMA_FIXTURE = Path(os.path.abspath("tests/schema.fixture.json"))
os.environ["DATA_SCHEMA_CACHE"] = str(_SCHEMA_FIXTURE)
os.environ.pop("DATA_SCHEMA_PATH", None)
def _cleanup_db_artifacts() -> None:
for artifact in (
_DB_PATH,
_DB_PATH.with_suffix(".duckdb.tmp"),
_DB_PATH.with_suffix(".duckdb.lock"),
):
if artifact.exists():
artifact.unlink()
# Runs at conftest import, before test modules import src.db (which builds the
# DuckDB at import time). Guarantees the test parquet exists and the stale DB
# from a previous `python run.py` is wiped so src.db rebuilds from test data.
pl.DataFrame(_TEST_DATA).write_parquet(_PARQUET_PATH)
_cleanup_db_artifacts()
@pytest.fixture(scope="session", autouse=True)
def test_data():
yield str(_PARQUET_PATH)
# Teardown: remove the test DuckDB so the next `python run.py` rebuilds
# from decp_prod.parquet.
_cleanup_db_artifacts()
@pytest.fixture(scope="session")
def chrome_options():
options = Options()
options.add_argument("--window-size=1200,1200 ")
options.add_experimental_option(
"prefs",
{
"download.default_directory": "/home/colin/git/decp.info",
"download.prompt_for_download": False,
"download.directory_upgrade": True,
"safebrowsing.enabled": True,
},
)
return options
+468
View File
@@ -0,0 +1,468 @@
{
"fields": [
{
"name": "acheteur_categorie",
"type": "string",
"title": "Catégorie de l'acheteur",
"description": "Catégorie de l'acheteur selon son code juridique INSEE.",
"short_title": "Catégorie acheteur",
"enum": [
"Commune",
"Groupement de communes",
"Département",
"Département outre-mer",
"Région",
"État",
"Établissement hospitalier",
"EPIC",
"Syndicat mixte"
]
},
{
"name": "acheteur_commune_code",
"type": "string",
"title": "Commune de l'acheteur (code)",
"description": "Code de la commune où se trouve l'acheteur.",
"short_title": "Commune ach. (code)"
},
{
"name": "acheteur_commune_nom",
"type": "string",
"title": "Commune de l'acheteur",
"description": "Nom de la commune où se trouve l'acheteur.",
"short_title": "Commune acheteur"
},
{
"name": "acheteur_departement_code",
"type": "string",
"title": "Département de l'acheteur (code)",
"description": "Code du département où se trouve l'acheteur.",
"short_title": "Département ach. (code)"
},
{
"name": "acheteur_departement_nom",
"type": "string",
"title": "Département de l'acheteur",
"description": "Nom du département où se trouve l'acheteur.",
"short_title": "Département acheteur"
},
{
"name": "acheteur_id",
"type": "integer",
"title": "SIRET acheteur",
"description": "Identifiant de l'établissement de l'acheteur (SIRET), référencé dans la base SIRENE de l'INSEE.",
"short_title": null
},
{
"name": "acheteur_latitude",
"type": "number",
"title": "Latitude de l'acheteur",
"description": "Latitude des coordonnées géographiques de l'acheteur.",
"short_title": "Latitude acheteur"
},
{
"name": "acheteur_longitude",
"type": "number",
"title": "Longitude de l'acheteur",
"description": "Longitude des coordonnées géographiques de l'acheteur.",
"short_title": "Longitude acheteur"
},
{
"name": "acheteur_nom",
"type": "string",
"title": "Nom acheteur",
"description": "Nom de l'acheteur tel que renseigné dans la base SIRENE de l'INSEE.",
"short_title": "Acheteur"
},
{
"name": "acheteur_region_code",
"type": "string",
"title": "Région de l'acheteur (code)",
"description": "Code de la région où se trouve l'acheteur.",
"short_title": "Région ach. (code)"
},
{
"name": "acheteur_region_nom",
"type": "string",
"title": "Région de l'acheteur",
"description": "Nom de la région où se trouve l'acheteur.",
"short_title": "Région acheteur"
},
{
"name": "attributionAvance",
"type": "boolean",
"title": "Attribution avance",
"description": "Si une avance sur le montant du marché public a été attribuée aux titulaires.",
"short_title": null
},
{
"name": "ccag",
"type": "string",
"title": "CCAG",
"description": "Cahier des clauses administratives générales et techniques (CCAG) utilisé pour le marché public.",
"short_title": null,
"enum": [
"Travaux",
"Maitrise d'œuvre",
"Fournitures courantes et services",
"Marchés industriels",
"Prestations intellectuelles",
"Techniques de l'information et de la communication"
]
},
{
"name": "codeCPV",
"type": "string",
"title": "Code CPV",
"description": "Catégorie de bien, service ou travaux achetés, selon le Vocabulaire commun pour les marchés publics (CPV).",
"short_title": "CPV"
},
{
"name": "considerationsEnvironnementales",
"type": "string",
"title": "Considérations environnementales",
"description": "Les considérations environnementales prévues dans le marché public.",
"short_title": "Cons. environnementales",
"enum": ["Clause environnementale", "Critère environnemental"]
},
{
"name": "considerationsSociales",
"type": "string",
"title": "Considérations sociales",
"description": "Les considérations sociales prévues dans le marché public.",
"short_title": "Cons. sociales",
"enum": ["Clause sociale", "Critère social", "Marché réservé"]
},
{
"name": "dateNotification",
"type": "date",
"title": "Date notification",
"description": "Date à laquelle le marché public ou de la modification a été notifiée aux titulaires du marché public.",
"short_title": null,
"format": "default"
},
{
"name": "datePublicationDonnees",
"type": "date",
"title": "Date publication données",
"description": "Date à laquelle les données du marché public ou de la modification ont été publiées sur data.gouv.fr.",
"short_title": "Date pub. données",
"format": "default"
},
{
"name": "donneesActuelles",
"type": "boolean",
"title": "Données actuelles",
"description": "Si les données de cette ligne sont les données actuelles du marché public, une fois les éventuelles modifications prises en compte.",
"short_title": null
},
{
"name": "dureeMois",
"type": "integer",
"title": "Durée (mois)",
"description": "Durée en mois du marché attribué.",
"short_title": null
},
{
"name": "dureeRestanteMois",
"type": "number",
"title": "Durée restante (mois)",
"description": "Durée approximative en mois restante dans le marché, en tenant compte de la date de notification et de la durée du marché. Ce nombre ne peut être inférieur à 0.",
"short_title": null
},
{
"name": "formePrix",
"type": "string",
"title": "Forme prix",
"description": "La forme du prix du marché public. Unitaire, Forfaitaire ou Mixte.",
"short_title": null
},
{
"name": "id",
"type": "string",
"title": "Identifiant interne",
"description": "Identifiant attribué par l'acheteur, censé être unique au sein de ses marchés.",
"short_title": "Id. interne"
},
{
"name": "idAccordCadre",
"type": "string",
"title": "Identifiant accord-cadre",
"description": "Pour un marché subséquent, l'identifiant interne du marché public relevant de la technique d'achat accord-cadre auquel il est lié.",
"short_title": "Id. accord-cadre"
},
{
"name": "lieuExecution_code",
"type": "integer",
"title": "Code lieu exécution",
"description": "Code du lieu d'exécution du marché public. Le type de code est renseigné par 'Type code lieu exécution'.",
"short_title": "Lieu exécution"
},
{
"name": "lieuExecution_typeCode",
"type": "string",
"title": "Type code lieu exécution",
"description": "Type du code du lieu d'exécution.",
"short_title": "Type lieu exécution",
"enum": [
"Code postal",
"Code commune",
"Code arrondissement",
" Code canton",
"Code département",
"Code région",
"Code pays"
]
},
{
"name": "marcheInnovant",
"type": "boolean",
"title": "Marché innovant",
"description": "Si le marché comporte des travaux, services ou fournitures innovantes.",
"short_title": null
},
{
"name": "modalitesExecution",
"type": "string",
"title": "Modalités exécution",
"description": "Les modalités d'exécution du marché public.",
"short_title": null,
"enum": ["Tranches", "Bons de commande", "Marchés subséquents"]
},
{
"name": "modification_id",
"type": "integer",
"title": "Identifiant modification",
"description": "Identifiant de la modification. 0 = données initiales du marché public, 1 = première modification, etc.",
"short_title": "Id. modification"
},
{
"name": "montant",
"type": "number",
"title": "Montant attribué",
"description": "Montant forfaitaire ou montant maximum estimé hors-taxes, en euros. Ce montant est le montant attribué. Le montant final payé aux titulaires peut évoluer lors de la signature du contrat et de l'exécution du marché.",
"short_title": "Montant"
},
{
"name": "nature",
"type": "string",
"title": "Nature",
"description": "Marché, Marché de partenariat ou Marché de sécurité.",
"short_title": null
},
{
"name": "objet",
"type": "string",
"title": "Objet",
"description": "Objet du marché public. Potentiellement coupé à 256 ou 1 000 caractères par le producteur de données.",
"short_title": null
},
{
"name": "offresRecues",
"type": "integer",
"title": "Offres reçues",
"description": "Le nombre d'offres reçues pendant la phase d'appel d'offres. Comprend aussi les offres irrégulières, inacceptables, inappropriées et anormalement basses.",
"short_title": null
},
{
"name": "origineFrance",
"type": "number",
"title": "Origine France",
"description": "Pour les marchés de fournitures de denrées alimentaires, de véhicules, de produits de santé et d'habillement, selon la liste annexée à l'arrêté du 22 décembre 2022, la part des produits français avec laquelle le marché sera exécuté. 0.2 = 20 % de la part des produits sont français. Cette valeur ne peut pas être supérieure à la valeur de origineUE.",
"short_title": null
},
{
"name": "origineUE",
"type": "number",
"title": "Origine UE",
"description": "Pour les marchés de fournitures de denrées alimentaires, de véhicules, de produits de santé et d'habillement, selon la liste annexée à l'arrêté du 22 décembre 2022, la part des produits issus de l'Union européenne avec laquelle le marché sera exécuté. 0.2 = 20 % de la part des produits provient de l'Union européenne. Cette valeur ne peut pas être inférieure à la valeur de origineFrance.",
"short_title": null
},
{
"name": "procedure",
"type": "string",
"title": "Procédure",
"description": "Le type de procédure utilisé pour le marché public.",
"short_title": null,
"enum": [
"Procédure négociée ouverte",
"Procédure non négociée ouverte",
"Procédure négociée restreinte",
"Procédure non négociée restreinte"
]
},
{
"name": "sourceDataset",
"type": "string",
"title": "Source dataset",
"description": "Code du jeu de données dont proviennent les données de ce marché public.",
"short_title": null
},
{
"name": "sourceFile",
"type": "string",
"title": "Source fichier",
"description": "Lien vers le fichier de données ouvertes dont proviennent les données de ce marché public.",
"short_title": null,
"format": "uri"
},
{
"name": "sousTraitanceDeclaree",
"type": "boolean",
"title": "Sous-traitance déclarée",
"description": "Au moment de la notification du marché, les titulaires du marché ont déclaré s'appuyer sur un ou plusieurs sous-traitants pour ce marché public.",
"short_title": "Sous-traitance"
},
{
"name": "tauxAvance",
"type": "number",
"title": "Taux avance",
"description": "Taux de l'avance attribuée au titulaire principal du marché public par rapport au montant du marché (O.1 = 10 % du montant du marché). En fonction de la valeur de attributionAvance, une valeur égale à 0 signifie qu'il y a une avance mais que le taux n'est pas connu (attributionAvance=true).",
"short_title": null
},
{
"name": "techniques",
"type": "string",
"title": "Techniques",
"description": "Les techniques d'achat utilisées pour le marché public.",
"short_title": null,
"enum": [
"Accord-cadre",
"Concours",
"Système de qualification",
"Système d'acquisition dynamique",
"Catalogue électronique",
"Enchère électronique"
]
},
{
"name": "titulaire_categorie",
"type": "string",
"title": "Catégorie du titulaire",
"description": "Catégorie de l'entreprise titulaire selon la classification de l'INSEE.",
"short_title": "Catégorie titulaire",
"enum": ["PME", "ETI", "GE"]
},
{
"name": "titulaire_commune_code",
"type": "string",
"title": "Commune du titulaire (code)",
"description": "Code de la commune où se trouve le titulaire.",
"short_title": "Commune tit. (code)"
},
{
"name": "titulaire_commune_nom",
"type": "string",
"title": "Commune du titulaire",
"description": "Nom de la commune où se trouve le titulaire.",
"short_title": "Commune titulaire"
},
{
"name": "titulaire_departement_code",
"type": "string",
"title": "Département du titulaire (code)",
"description": "Code du département où se trouve le titulaire.",
"short_title": "Département tit. (code)"
},
{
"name": "titulaire_departement_nom",
"type": "string",
"title": "Département du titulaire",
"description": "Nom du département où se trouve le titulaire.",
"short_title": "Département titulaire"
},
{
"name": "titulaire_distance",
"type": "integer",
"title": "Distance acheteur-titulaire",
"description": "Distance en kilomètres entre l'adresse de l'acheteur et celle du titulaire.",
"short_title": "Distance"
},
{
"name": "titulaire_id",
"type": "integer",
"title": "Identifiant titulaire",
"description": "Identifiant du titulaire du marché. Voir 'Type identifiant' pour le référentiel utilisé",
"short_title": "Id. titulaire"
},
{
"name": "titulaire_latitude",
"type": "number",
"title": "Latitude du titulaire",
"description": "Latitude des coordonnées géographiques du titulaire.",
"short_title": "Latitude titulaire"
},
{
"name": "titulaire_longitude",
"type": "number",
"title": "Longitude du titulaire",
"description": "Longitude des coordonnées géographiques du titulaire.",
"short_title": "Longitude titulaire"
},
{
"name": "titulaire_nom",
"type": "string",
"title": "Nom titulaire",
"description": "Nom du titulaire. Nom tel que renseigné dans la base SIRENE de l'INSEE si c'est un SIRET.",
"short_title": "Titulaire"
},
{
"name": "titulaire_region_code",
"type": "string",
"title": "Région du titulaire (code)",
"description": "Code de la région où se trouve le titulaire.",
"short_title": "Région tit. (code)"
},
{
"name": "titulaire_region_nom",
"type": "string",
"title": "Région du titulaire",
"description": "Nom de la région où se trouve le titulaire.",
"short_title": "Région titulaire"
},
{
"name": "titulaire_typeIdentifiant",
"type": "string",
"title": "Type identifiant",
"description": "Référentiel utilisé pour l'identifiant du titulaire.",
"short_title": "Type id.",
"enum": ["SIRET", "TVA", "TAHITI", "RIDET", "FRWF", "IREP", "HORS-UE"]
},
{
"name": "type",
"type": "string",
"title": "Type",
"description": "Type de marché public : fournitures, services ou travaux (dérivé du code CPV).",
"short_title": "Type",
"enum": ["Fournitures", "Services", "Travaux"]
},
{
"name": "typeGroupementOperateurs",
"type": "string",
"title": "Type groupement",
"description": "Le type de groupement d'entreprises ou d'opérateurs économiques.",
"short_title": "Groupement",
"enum": ["Conjoint", "Solidaire"]
},
{
"name": "typesPrix",
"type": "string",
"title": "Types prix",
"description": "Les types de prix du marché public.",
"short_title": null,
"enum": [
"Définitif ferme",
"Définitif actualisable",
"Définitif révisable",
"Provisoire"
]
},
{
"name": "uid",
"type": "string",
"title": "Identifiant unique",
"description": "Concaténation du SIRET de l'acheteur (acheteur_id) et de l'identifiant interne de l'acheteur (id). Utilisé comme identifiant de marché unique au niveau national.",
"short_title": "Id. unique"
}
]
}
+225
View File
@@ -0,0 +1,225 @@
from datetime import datetime, timedelta
from src.utils.table_sql import dashboard_filters_to_sql
def test_no_filters_uses_default_365_day_window():
where_sql, params = dashboard_filters_to_sql()
assert where_sql == '"dateNotification" > ?'
assert len(params) == 1
assert isinstance(params[0], datetime)
expected = datetime.now() - timedelta(days=365)
assert abs((params[0] - expected).total_seconds()) < 2
def test_year_filter_overrides_default_window():
where_sql, params = dashboard_filters_to_sql(dashboard_year="2025")
assert where_sql == 'YEAR("dateNotification") = ?'
assert params == [2025]
def test_marche_type_equality():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_marche_type="Marché",
)
assert where_sql == 'YEAR("dateNotification") = ? AND "type" = ?'
assert params == [2025, "Marché"]
def test_innovant_value_all_is_skipped():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_marche_innovant="all",
)
assert where_sql == 'YEAR("dateNotification") = ?'
assert params == [2025]
def test_innovant_value_oui_adds_clause():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_marche_innovant="oui",
)
assert where_sql == 'YEAR("dateNotification") = ? AND "marcheInnovant" = ?'
assert params == [2025, "oui"]
def test_sous_traitance_value_non_adds_clause():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_marche_sous_traitance_declaree="non",
)
assert where_sql == 'YEAR("dateNotification") = ? AND "sousTraitanceDeclaree" = ?'
assert params == [2025, "non"]
def test_acheteur_id_uses_like_wildcards():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_acheteur_id="12345678900010",
)
assert where_sql == 'YEAR("dateNotification") = ? AND "acheteur_id" LIKE ?'
assert params == [2025, "%12345678900010%"]
def test_titulaire_id_uses_like_wildcards():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_titulaire_id="999",
)
assert where_sql == 'YEAR("dateNotification") = ? AND "titulaire_id" LIKE ?'
assert params == [2025, "%999%"]
def test_marche_objet_uses_case_insensitive_ilike():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_marche_objet="travaux",
)
assert (
where_sql
== 'YEAR("dateNotification") = ? AND "objet" IS NOT NULL AND "objet" <> \'\' AND "objet" ILIKE ?'
)
assert params == [2025, "%travaux%"]
def test_code_cpv_uses_prefix_like():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_marche_code_cpv="4521",
)
assert where_sql == 'YEAR("dateNotification") = ? AND "codeCPV" LIKE ?'
assert params == [2025, "4521%"]
def test_acheteur_departement_multiple_uses_in_clause():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_acheteur_departement_code=["75", "92", "93"],
)
assert where_sql == (
'YEAR("dateNotification") = ? AND "acheteur_departement_code" IN (?, ?, ?)'
)
assert params == [2025, "75", "92", "93"]
def test_acheteur_categorie_adds_clause():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_acheteur_categorie="Commune",
)
assert where_sql == 'YEAR("dateNotification") = ? AND "acheteur_categorie" = ?'
assert params == [2025, "Commune"]
def test_titulaire_categorie_and_departement():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_titulaire_categorie="PME",
dashboard_titulaire_departement_code=["35"],
)
assert where_sql == (
'YEAR("dateNotification") = ? '
'AND "titulaire_categorie" = ? '
'AND "titulaire_departement_code" IN (?)'
)
assert params == [2025, "PME", "35"]
def test_acheteur_id_present_skips_categorie_and_departement():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_acheteur_id="123",
dashboard_acheteur_categorie="Commune",
dashboard_acheteur_departement_code=["75"],
)
assert where_sql == 'YEAR("dateNotification") = ? AND "acheteur_id" LIKE ?'
assert params == [2025, "%123%"]
def test_titulaire_id_present_skips_categorie_and_departement():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_titulaire_id="999",
dashboard_titulaire_categorie="PME",
dashboard_titulaire_departement_code=["35"],
)
assert where_sql == 'YEAR("dateNotification") = ? AND "titulaire_id" LIKE ?'
assert params == [2025, "%999%"]
def test_marche_techniques_uses_list_has_any():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_marche_techniques=["Enchère", "Accord-cadre"],
)
assert where_sql == (
'YEAR("dateNotification") = ? '
"AND list_has_any(string_split(\"techniques\", ', '), ?::VARCHAR[])"
)
assert params == [2025, ["Enchère", "Accord-cadre"]]
def test_considerations_sociales_uses_list_has_any():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_marche_considerations_sociales=["Clause sociale"],
)
assert where_sql == (
'YEAR("dateNotification") = ? '
"AND list_has_any(string_split(\"considerationsSociales\", ', '), ?::VARCHAR[])"
)
assert params == [2025, ["Clause sociale"]]
def test_considerations_environnementales_uses_list_has_any():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_marche_considerations_environnementales=["Clause env."],
)
assert where_sql == (
'YEAR("dateNotification") = ? '
"AND list_has_any(string_split(\"considerationsEnvironnementales\", ', '), ?::VARCHAR[])"
)
assert params == [2025, ["Clause env."]]
def test_montant_min_only():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_montant_min=1000,
)
assert where_sql == 'YEAR("dateNotification") = ? AND "montant" >= ?'
assert params == [2025, 1000]
def test_montant_max_only():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_montant_max=500,
)
assert where_sql == 'YEAR("dateNotification") = ? AND "montant" <= ?'
assert params == [2025, 500]
def test_montant_zero_is_a_valid_lower_bound():
# 0 est falsy mais reste un filtre valide (distinct de None)
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_montant_min=0,
)
assert where_sql == 'YEAR("dateNotification") = ? AND "montant" >= ?'
assert params == [2025, 0]
def test_montant_min_and_max_combined():
where_sql, params = dashboard_filters_to_sql(
dashboard_year="2025",
dashboard_montant_min=100,
dashboard_montant_max=1000,
)
assert where_sql == (
'YEAR("dateNotification") = ? AND "montant" >= ? AND "montant" <= ?'
)
assert params == [2025, 100, 1000]
+371
View File
@@ -0,0 +1,371 @@
import datetime
import os
import time
import polars as pl
import pytest
from src.db import should_rebuild
@pytest.fixture
def parquet_and_db(tmp_path, monkeypatch):
parquet = tmp_path / "source.parquet"
db = tmp_path / "decp.duckdb"
parquet.write_bytes(b"fake parquet content")
monkeypatch.delenv("REBUILD_DUCKDB", raising=False)
monkeypatch.delenv("DEVELOPMENT", raising=False)
return parquet, db
def test_should_rebuild_when_db_missing(parquet_and_db):
parquet, db = parquet_and_db
assert should_rebuild(db, parquet) is True
def test_should_rebuild_prod_when_parquet_newer(parquet_and_db, monkeypatch):
parquet, db = parquet_and_db
db.write_bytes(b"x")
parquet.touch()
now = time.time()
os.utime(db, (now, now))
os.utime(parquet, (now + 10, now + 10))
monkeypatch.setenv("DEVELOPMENT", "false")
monkeypatch.setattr("src.db.get_last_modified", lambda p: parquet.stat().st_mtime)
assert should_rebuild(db, parquet) is True
def test_should_not_rebuild_prod_when_parquet_older(parquet_and_db, monkeypatch):
parquet, db = parquet_and_db
parquet.touch()
db.write_bytes(b"x")
now = time.time()
os.utime(parquet, (now, now))
os.utime(db, (now + 10, now + 10))
monkeypatch.setenv("DEVELOPMENT", "false")
monkeypatch.setattr("src.db.get_last_modified", lambda p: parquet.stat().st_mtime)
assert should_rebuild(db, parquet) is False
def test_should_not_rebuild_dev_even_when_parquet_newer(parquet_and_db, monkeypatch):
parquet, db = parquet_and_db
db.write_bytes(b"x")
parquet.touch()
now = time.time()
os.utime(db, (now, now))
os.utime(parquet, (now + 10, now + 10))
monkeypatch.setenv("DEVELOPMENT", "true")
monkeypatch.delenv("REBUILD_DUCKDB", raising=False)
assert should_rebuild(db, parquet) is False
def test_should_rebuild_dev_when_rebuild_forced(parquet_and_db, monkeypatch):
parquet, db = parquet_and_db
db.write_bytes(b"x")
parquet.touch()
now = time.time()
os.utime(db, (now, now))
os.utime(parquet, (now + 10, now + 10))
monkeypatch.setenv("DEVELOPMENT", "true")
monkeypatch.setenv("REBUILD_DUCKDB", "true")
monkeypatch.setattr("src.db.get_last_modified", lambda p: parquet.stat().st_mtime)
assert should_rebuild(db, parquet) is True
@pytest.fixture
def built_db(tmp_path, monkeypatch):
"""Build a DuckDB from a small Polars frame written as parquet."""
parquet_path = tmp_path / "source.parquet"
db_path = tmp_path / "decp.duckdb"
data = pl.DataFrame(
[
{
"uid": "1",
"id": "1",
"objet": "Travaux",
"acheteur_id": "123",
"acheteur_nom": "ACHETEUR 1",
"acheteur_departement_code": "75",
"acheteur_departement_nom": "Paris",
"acheteur_commune_nom": "Paris",
"titulaire_commune_nom": "Paris",
"titulaire_departement_nom": "Paris",
"titulaire_id": "345",
"titulaire_nom": "TITULAIRE 1",
"titulaire_departement_code": "35",
"titulaire_typeIdentifiant": "SIRET",
"montant": 1000.0,
"dateNotification": datetime.date(2025, 1, 1),
"donneesActuelles": True,
"marcheInnovant": True,
},
{
"uid": "2",
"id": "2",
"objet": "Études",
"acheteur_id": "123",
"acheteur_nom": "ACHETEUR 1",
"acheteur_departement_code": "75",
"acheteur_departement_nom": "Paris",
"acheteur_commune_nom": "Paris",
"titulaire_commune_nom": "Paris",
"titulaire_departement_nom": "Paris",
"titulaire_id": "567",
"titulaire_nom": None,
"titulaire_departement_code": "75",
"titulaire_typeIdentifiant": "SIRET",
"montant": 500.0,
"dateNotification": datetime.date(2024, 6, 1),
"donneesActuelles": True,
"marcheInnovant": False,
},
{
"uid": "3",
"id": "3",
"objet": "Ancien",
"acheteur_id": "A2",
"acheteur_nom": None,
"acheteur_departement_code": "13",
"acheteur_departement_nom": "Paris",
"acheteur_commune_nom": "Paris",
"titulaire_commune_nom": "Paris",
"titulaire_departement_nom": "Paris",
"titulaire_id": "T3",
"titulaire_nom": "Autre",
"titulaire_departement_code": "13",
"titulaire_typeIdentifiant": "SIRET",
"montant": 100.0,
"dateNotification": datetime.date(2023, 1, 1),
"donneesActuelles": False, # must be filtered out
"marcheInnovant": False,
},
]
)
data.write_parquet(parquet_path)
monkeypatch.setenv("DATA_FILE_PARQUET_PATH", str(parquet_path))
monkeypatch.setenv("DUCKDB_PATH", str(db_path))
from src.db import build_database
build_database(db_path)
return db_path
def test_build_filters_donnees_actuelles(built_db):
import duckdb
with duckdb.connect(str(built_db), read_only=True) as c:
rows = c.execute("SELECT uid FROM decp ORDER BY uid").fetchall()
assert [r[0] for r in rows] == ["1", "2"]
def test_build_converts_booleans_to_oui_non(built_db):
import duckdb
with duckdb.connect(str(built_db), read_only=True) as c:
values = c.execute("SELECT marcheInnovant FROM decp ORDER BY uid").fetchall()
assert [v[0] for v in values] == ["oui", "non"]
def test_build_replaces_null_org_names(built_db):
import duckdb
with duckdb.connect(str(built_db), read_only=True) as c:
titulaire_2 = c.execute(
"SELECT titulaire_nom FROM decp WHERE uid = '2'"
).fetchone()
assert titulaire_2[0] == "[Identifiant non reconnu dans la base INSEE]"
def test_build_creates_derived_tables(built_db):
import duckdb
with duckdb.connect(str(built_db), read_only=True) as c:
tables = {r[0] for r in c.execute("SHOW TABLES").fetchall()}
assert {
"decp",
"acheteurs_marches",
"titulaires_marches",
"acheteurs_departement",
"titulaires_departement",
} <= tables
def test_query_marches_returns_polars_frame(built_db, monkeypatch):
parquet_path = built_db.parent / "source.parquet"
monkeypatch.setenv("DATA_FILE_PARQUET_PATH", str(parquet_path))
# Patch on both the source module and dst namespace: the reload re-imports
# get_last_modified from src.utils, so src.utils must be patched to survive.
monkeypatch.setattr(
"src.utils.get_last_modified", lambda p: parquet_path.stat().st_mtime
)
monkeypatch.setattr(
"src.db.get_last_modified", lambda p: parquet_path.stat().st_mtime
)
# Force src.db to load pointing at this test DB.
import importlib
import src.db
importlib.reload(src.db)
from src.db import query_marches
frame = query_marches("acheteur_id = ?", ("123",))
assert isinstance(frame, pl.DataFrame)
assert frame.height == 2
assert set(frame["uid"].to_list()) == {"1", "2"}
def test_count_marches_returns_total_without_filter():
from src.db import count_marches
n = count_marches()
assert isinstance(n, int)
assert n > 0
def test_count_marches_with_filter():
from src.db import count_marches
n = count_marches('"uid" = ?', ["__nonexistent__"])
assert n == 0
def test_count_unique_marches_respects_distinct():
from src.db import count_unique_marches
n = count_unique_marches()
assert isinstance(n, int)
assert n > 0
def test_query_marches_with_offset():
from src.db import query_marches
page_0 = query_marches(limit=2, offset=0)
page_1 = query_marches(limit=2, offset=2)
if page_0.height == 2 and page_1.height >= 1:
assert set(page_0["uid"].to_list()).isdisjoint(set(page_1["uid"].to_list()))
def test_concurrent_build_serialized(tmp_path, monkeypatch):
"""Multiple threads calling _ensure_database must serialize via flock.
Only one should actually build; others wait, see the fresh DB, and skip.
No tmp file should leak. No exceptions should occur.
"""
import fcntl
import threading
import src.db as db
# Set up source parquet
parquet_path = tmp_path / "src.parquet"
df = pl.DataFrame(
{
"uid": ["A"],
"donneesActuelles": [True],
"dateNotification": ["2024-01-01"],
"objet": ["Test"],
"acheteur_id": ["a1"],
"acheteur_nom": ["A1"],
"titulaire_id": ["t1"],
"titulaire_nom": ["T1"],
"acheteur_departement_code": ["75"],
"titulaire_departement_code": ["75"],
"montant": [1000.0],
"dureeMois": [12],
}
)
df.write_parquet(parquet_path)
monkeypatch.setenv("DATA_FILE_PARQUET_PATH", str(parquet_path))
monkeypatch.setattr(
"src.db.get_last_modified", lambda p: parquet_path.stat().st_mtime
)
db_path = tmp_path / "decp.duckdb"
lock_path = db_path.with_suffix(".duckdb.lock")
tmp_path_artifact = db_path.with_suffix(".duckdb.tmp")
errors: list[BaseException] = []
def worker():
try:
# Mirror the locking logic in _ensure_database
with open(lock_path, "w") as lf:
fcntl.flock(lf.fileno(), fcntl.LOCK_EX)
try:
if db.should_rebuild(db_path, parquet_path):
db.build_database(db_path)
finally:
fcntl.flock(lf.fileno(), fcntl.LOCK_UN)
except BaseException as exc:
errors.append(exc)
threads = [threading.Thread(target=worker) for _ in range(3)]
for t in threads:
t.start()
for t in threads:
t.join()
assert errors == []
assert db_path.exists()
assert not tmp_path_artifact.exists()
def _raise(*args, **kwargs):
raise RuntimeError("boom")
def test_ensure_database_reuses_db_when_should_rebuild_raises(tmp_path, monkeypatch):
import src.db as db
dbf = tmp_path / "decp.duckdb"
dbf.write_bytes(b"existing")
monkeypatch.setenv("DUCKDB_PATH", str(dbf))
monkeypatch.setenv("DATA_FILE_PARQUET_PATH", "http://unreachable")
monkeypatch.setattr(db, "should_rebuild", _raise)
result = db._ensure_database() # ne doit pas lever
assert result == dbf
assert dbf.read_bytes() == b"existing"
def test_ensure_database_reuses_db_when_build_raises(tmp_path, monkeypatch):
import src.db as db
dbf = tmp_path / "decp.duckdb"
dbf.write_bytes(b"existing")
monkeypatch.setenv("DUCKDB_PATH", str(dbf))
monkeypatch.setenv("DATA_FILE_PARQUET_PATH", "http://unreachable")
monkeypatch.setattr(db, "should_rebuild", lambda *a, **k: True)
monkeypatch.setattr(db, "build_database", _raise)
result = db._ensure_database() # ne doit pas lever
assert result == dbf
assert dbf.read_bytes() == b"existing"
def test_ensure_database_raises_on_cold_start(tmp_path, monkeypatch):
import src.db as db
dbf = tmp_path / "decp.duckdb" # n'existe pas
monkeypatch.setenv("DUCKDB_PATH", str(dbf))
monkeypatch.setenv("DATA_FILE_PARQUET_PATH", "http://unreachable")
monkeypatch.setattr(db, "should_rebuild", lambda *a, **k: True)
monkeypatch.setattr(db, "build_database", _raise)
with pytest.raises(RuntimeError):
db._ensure_database()
def test_ensure_database_builds_when_needed(tmp_path, monkeypatch):
import src.db as db
dbf = tmp_path / "decp.duckdb"
dbf.write_bytes(b"old")
monkeypatch.setenv("DUCKDB_PATH", str(dbf))
monkeypatch.setenv("DATA_FILE_PARQUET_PATH", "http://x")
called = {}
monkeypatch.setattr(db, "should_rebuild", lambda *a, **k: True)
monkeypatch.setattr(db, "build_database", lambda p: called.setdefault("built", p))
db._ensure_database()
assert called.get("built") == dbf
+167
View File
@@ -0,0 +1,167 @@
import polars as pl
def _make_lff(rows):
return pl.LazyFrame(rows)
def test_compute_considerations_stats_basic():
from src.figures import compute_considerations_stats
lff = _make_lff(
[
# u1 : social oui (Clause), env non (Sans objet)
{
"uid": "u1",
"considerationsSociales": "Clause sociale",
"considerationsEnvironnementales": "Sans objet",
},
# u2 : social non (Sans objet), env oui (Critère)
{
"uid": "u2",
"considerationsSociales": "Sans objet",
"considerationsEnvironnementales": "Critère environnemental",
},
# u3 : social oui (Marché réservé), env null
{
"uid": "u3",
"considerationsSociales": "Marché réservé",
"considerationsEnvironnementales": None,
},
# u4 : social autre valeur (pas "Sans objet"), env null
{
"uid": "u4",
"considerationsSociales": "Pas de considération sociale",
"considerationsEnvironnementales": "Sans objet",
},
]
)
stats = compute_considerations_stats(lff)
# champs_renseignes : basé sur sociales. 4 non-null / 4 total -> (4, 100%).
assert stats["champs_renseignes"] == (4, 100)
# Sociales renseignées : dén=4 non-null, num=3 != "Sans objet" (u1/u3/u4) -> (4, 75%).
assert stats["sociales_renseignees"] == (4, 75)
# Env renseignées : dén=3 non-null (u1/u2/u4), num=1 != "Sans objet" (u2) -> (3, 33%).
assert stats["environnementales_renseignees"] == (3, 33)
def test_compute_considerations_stats_dedup_per_uid():
from src.figures import compute_considerations_stats
lff = _make_lff(
[
# u1 présent 2 fois (2 titulaires) -> compté une seule fois
{
"uid": "u1",
"considerationsSociales": "Clause sociale",
"considerationsEnvironnementales": "Sans objet",
},
{
"uid": "u1",
"considerationsSociales": "Clause sociale",
"considerationsEnvironnementales": "Sans objet",
},
{
"uid": "u2",
"considerationsSociales": "Sans objet",
"considerationsEnvironnementales": "Sans objet",
},
]
)
stats = compute_considerations_stats(lff)
# 2 uid distincts. Social 2 non-null, 1 != "Sans objet" (u1) -> (2, 50%).
assert stats["champs_renseignes"] == (2, 100)
assert stats["sociales_renseignees"] == (2, 50)
# Env 2 non-null, 0 != "Sans objet" -> (2, 0%).
assert stats["environnementales_renseignees"] == (2, 0)
def test_compute_considerations_stats_missing_column():
from src.figures import compute_considerations_stats
lff = _make_lff(
[
{"uid": "u1", "considerationsSociales": "Clause sociale"},
{"uid": "u2", "considerationsSociales": "Sans objet"},
]
)
stats = compute_considerations_stats(lff)
# Colonne env absente -> (0, 0). Social : 2 non-null, 1 != "Sans objet" -> (2, 50%).
assert stats["champs_renseignes"] == (2, 100)
assert stats["sociales_renseignees"] == (2, 50)
assert stats["environnementales_renseignees"] == (0, 0)
def test_compute_considerations_stats_empty():
from src.figures import compute_considerations_stats
lff = pl.LazyFrame(
{
"uid": pl.Series([], dtype=pl.String),
"considerationsSociales": pl.Series([], dtype=pl.String),
"considerationsEnvironnementales": pl.Series([], dtype=pl.String),
}
)
stats = compute_considerations_stats(lff)
assert stats["champs_renseignes"] == (0, 0)
assert stats["sociales_renseignees"] == (0, 0)
assert stats["environnementales_renseignees"] == (0, 0)
def test_get_considerations_card_content_returns_three_progress_bars():
import dash_bootstrap_components as dbc
from dash import html
from src.figures import get_considerations_card_content
lff = pl.LazyFrame(
[
{
"uid": "u1",
"considerationsSociales": "Clause sociale",
"considerationsEnvironnementales": "Sans objet",
},
{
"uid": "u2",
"considerationsSociales": "Sans objet",
"considerationsEnvironnementales": "Critère environnemental",
},
]
)
div = get_considerations_card_content(lff)
assert isinstance(div, html.Div)
def find_progress(component, found):
if isinstance(component, dbc.Progress):
found.append(component)
children = getattr(component, "children", None)
if isinstance(children, (list, tuple)):
for c in children:
find_progress(c, found)
elif children is not None and not isinstance(children, str):
find_progress(children, found)
return found
inner_bars = [b for b in find_progress(div, []) if getattr(b, "bar", False)]
assert len(inner_bars) == 3
bar_ren, bar_social, bar_env = inner_bars
# Bar 1 : champs renseignés (2/2 = 100%, gris)
assert bar_ren.value == 100
assert bar_ren.color == "#6c757d"
# Bar 2 : sociales parmi renseignés (u1 != "Sans objet" -> 1/2 = 50%, rose)
assert bar_social.value == 50
assert bar_social.color == "#CC6677"
# Bar 3 : env parmi renseignés (u2 != "Sans objet" -> 1/2 = 50%, vert)
assert bar_env.value == 50
assert bar_env.color == "#117733"
+344
View File
@@ -0,0 +1,344 @@
import polars as pl
from dash.testing.composite import DashComposite
from selenium.webdriver import Keys
from selenium.webdriver.common.by import By
from selenium.webdriver.remote.webelement import WebElement
def test_001_logo_and_search(dash_duo: DashComposite):
from src.app import app
dash_duo.start_server(app)
dash_duo.wait_for_text_to_equal(".logo > h1", "decp.info", timeout=4)
assert dash_duo.find_element(".logo > h1").text == "decp.info"
for org_type in ["acheteur", "titulaire"]:
name = f"{org_type.upper()} 1"
search_bar: WebElement = dash_duo.find_element("#search")
dash_duo.clear_input(search_bar)
search_bar.send_keys(name)
search_bar.send_keys(Keys.ENTER)
dash_duo.wait_for_element(f"#results_{org_type}_datatable", timeout=2)
result_table: WebElement = dash_duo.find_element(
f"#results_{org_type}_datatable tbody"
)
assert len(result_table.find_elements(by=By.TAG_NAME, value="tr")) == 2, (
"The search should return only one result"
) # header row + 1 result
assert result_table.find_element(
by=By.CSS_SELECTOR, value=f'td[data-dash-column="{org_type}_nom"]'
).text.startswith(name), (
f"The search result should have the right {org_type} name"
)
def test_002_filter_persistence(dash_duo: DashComposite):
from src.app import app
dash_duo.start_server(app)
dash_duo.wait_for_text_to_equal(".logo > h1", "decp.info", timeout=4)
def open_page_and_check_filter_input():
dash_duo.wait_for_page(f"{dash_duo.server_url}/{page}")
filter_input_selector = (
'.marches_table th[data-dash-column="uid"] input[type="text"]'
)
dash_duo.wait_for_element(filter_input_selector, timeout=2)
_filter_input: WebElement = dash_duo.find_element(filter_input_selector)
return _filter_input
for page in ["tableau", "acheteurs/123", "titulaires/345"]:
filter_input = open_page_and_check_filter_input()
filter_input.send_keys("11") # a UID that doesn't exist
filter_input.send_keys(Keys.ENTER)
filter_input = open_page_and_check_filter_input()
assert filter_input.get_attribute("value") == "11"
def test_003_tableau_download(dash_duo: DashComposite):
from pages.acheteur import download_acheteur_data
from pages.tableau import download_data
from pages.titulaire import download_titulaire_data
from src.app import app
# Juste pour instancier l'app
print(app.server.name)
dicts = pl.read_parquet("tests/test.parquet").to_dicts()
outputs = [
download_data(1, "", [], None),
download_acheteur_data(1, dicts, "123", "2025"),
download_titulaire_data(1, dicts, "345", "2025"),
]
for output in outputs:
assert isinstance(output, dict)
for f in ["content", "filename", "type", "base64"]:
assert f in output
assert isinstance(output["content"], str) and len(output["content"]) > 100
assert isinstance(output["filename"], str) and output["filename"].startswith(
"decp_"
)
assert output["type"] is None
assert output["base64"] is True
def test_004_add_links_observatoire_acheteur():
import polars as pl
from src.utils.table import add_links
dff = pl.DataFrame(
{
"acheteur_id": ["123"],
"acheteur_nom": ["ACHETEUR 1"],
}
)
result = add_links(dff)
nom_value = result["acheteur_nom"][0]
id_value = result["acheteur_id"][0]
# acheteur_nom should contain detail link + observatoire link
assert "/acheteurs/123" in nom_value
assert "ACHETEUR 1" in nom_value
assert "/observatoire?acheteur_id=123" in nom_value
assert "📊" in nom_value
# acheteur_id should NOT contain observatoire link
assert "/observatoire" not in id_value
def test_005_add_links_observatoire_titulaire():
import polars as pl
from src.utils.table import add_links
dff = pl.DataFrame(
{
"titulaire_id": ["345"],
"titulaire_nom": ["TITULAIRE 1"],
"titulaire_typeIdentifiant": ["SIRET"],
}
)
result = add_links(dff)
nom_value = result["titulaire_nom"][0]
id_value = result["titulaire_id"][0]
# titulaire_nom should contain detail link + observatoire link
assert "/titulaires/345" in nom_value
assert "TITULAIRE 1" in nom_value
assert "/observatoire?titulaire_id=345" in nom_value
assert "📊" in nom_value
# titulaire_id should NOT contain observatoire link
assert "/observatoire" not in id_value
def test_006_observatoire_url_to_input(dash_duo: DashComposite):
from src.app import app
dash_duo.start_server(app)
dash_duo.wait_for_text_to_equal(".logo > h1", "decp.info", timeout=4)
# Navigate to observatoire with acheteur_id query param
dash_duo.wait_for_page(f"{dash_duo.server_url}/observatoire?acheteur_id=123")
dash_duo.wait_for_element("#dashboard_acheteur_id", timeout=4)
import time
time.sleep(1) # Allow callback chain to complete
acheteur_input = dash_duo.find_element("#dashboard_acheteur_id")
assert acheteur_input.get_attribute("value") == "123", (
"acheteur_id input should be populated from URL param"
)
def test_007_observatoire_share_url(dash_duo: DashComposite):
from src.app import app
dash_duo.start_server(app)
dash_duo.wait_for_text_to_equal(".logo > h1", "decp.info", timeout=4)
# Navigate to observatoire with acheteur_id query param
dash_duo.wait_for_page(f"{dash_duo.server_url}/observatoire?acheteur_id=123")
dash_duo.wait_for_element("#observatoire-share-url", timeout=4)
import time
time.sleep(1) # Allow callback chain to complete
share_url_input = dash_duo.find_element("#observatoire-share-url")
share_url_value = share_url_input.get_attribute("value")
assert "acheteur_id=123" in share_url_value, (
f"Share URL should contain acheteur_id param, got: {share_url_value}"
)
def test_008_search_to_observatoire(dash_duo: DashComposite):
from src.app import app
dash_duo.start_server(app)
dash_duo.wait_for_text_to_equal(".logo > h1", "decp.info", timeout=4)
# Search for an acheteur
search_bar = dash_duo.find_element("#search")
search_bar.send_keys("ACHETEUR 1")
search_bar.send_keys(Keys.ENTER)
dash_duo.wait_for_element("#results_acheteur_datatable", timeout=2)
# Find the observatoire link in acheteur_nom column
observatoire_link = dash_duo.find_element(
'#results_acheteur_datatable td[data-dash-column="acheteur_nom"] a[href*="observatoire"]'
)
assert "📊" in observatoire_link.text
# Click the observatoire link
observatoire_link.click()
# Wait for observatoire page to load
dash_duo.wait_for_element("#dashboard_acheteur_id", timeout=4)
import time
time.sleep(1) # Allow callback chain to complete
acheteur_input = dash_duo.find_element("#dashboard_acheteur_id")
assert acheteur_input.get_attribute("value") == "123", (
"acheteur_id input should be populated after navigating from search"
)
def test_009_observatoire_filter_persistence(dash_duo: DashComposite):
import time
from src.app import app
dash_duo.start_server(app)
dash_duo.wait_for_text_to_equal(".logo > h1", "decp.info", timeout=4)
# Clear localStorage to start from a clean state
dash_duo.driver.execute_script("localStorage.clear()")
# Navigate to observatoire without URL params
dash_duo.wait_for_page(f"{dash_duo.server_url}/observatoire")
dash_duo.wait_for_element("#dashboard_acheteur_id", timeout=4)
# Set the acheteur_id text input; press Enter to trigger the debounced save callback
acheteur_input = dash_duo.find_element("#dashboard_acheteur_id")
dash_duo.clear_input(acheteur_input)
acheteur_input.send_keys("123")
acheteur_input.send_keys(Keys.ENTER)
time.sleep(0.3) # allow the save callback to write to localStorage
# Navigate away
dash_duo.wait_for_page(f"{dash_duo.server_url}/")
# Navigate back without URL params
dash_duo.wait_for_page(f"{dash_duo.server_url}/observatoire")
dash_duo.wait_for_element("#dashboard_acheteur_id", timeout=4)
time.sleep(0.5) # allow restore callback chain to complete
acheteur_input = dash_duo.find_element("#dashboard_acheteur_id")
assert acheteur_input.get_attribute("value") == "123", (
"acheteur_id should be restored from localStorage after navigating back"
)
# Also verify URL params still override localStorage
dash_duo.wait_for_page(f"{dash_duo.server_url}/observatoire?acheteur_id=123")
dash_duo.wait_for_element("#dashboard_acheteur_id", timeout=4)
time.sleep(0.5)
acheteur_input = dash_duo.find_element("#dashboard_acheteur_id")
assert acheteur_input.get_attribute("value") == "123", (
"URL param acheteur_id should override the value stored in localStorage"
)
def test_011_observatoire_multi_param_url(dash_duo: DashComposite):
import time
from src.app import app
dash_duo.start_server(app)
dash_duo.wait_for_text_to_equal(".logo > h1", "decp.info", timeout=4)
# Navigate with multiple filter params
dash_duo.wait_for_page(
f"{dash_duo.server_url}/observatoire?annee=2024&acheteur_id=12345678901234&montant_min=10000"
)
dash_duo.wait_for_element("#dashboard_acheteur_id", timeout=4)
time.sleep(1) # Allow callback chain to complete
# Verify acheteur_id input
acheteur_input = dash_duo.find_element("#dashboard_acheteur_id")
assert acheteur_input.get_attribute("value") == "12345678901234", (
"acheteur_id input should be populated from URL param"
)
# Verify montant_min input
montant_input = dash_duo.find_element("#dashboard_montant_min")
montant_value = montant_input.get_attribute("value")
assert montant_value in ("10000", "10000.0"), (
f"montant_min input should be populated from URL param, got: {montant_value}"
)
def test_012_get_distance_histogram_returns_graph():
import polars as pl
from dash import dcc
from src.figures import get_distance_histogram
lff = pl.LazyFrame({"titulaire_distance": [1, 10, 100, 500, 1000]})
result = get_distance_histogram(lff)
assert isinstance(result, dcc.Graph)
def test_013_get_distance_histogram_handles_nulls():
import polars as pl
from dash import dcc
from src.figures import get_distance_histogram
lff = pl.LazyFrame({"titulaire_distance": [None, None, 50]})
result = get_distance_histogram(lff)
assert isinstance(result, dcc.Graph)
def test_014_get_distance_histogram_all_nulls():
import polars as pl
from dash import dcc
from src.figures import get_distance_histogram
lff = pl.LazyFrame({"titulaire_distance": pl.Series([], dtype=pl.Int64)})
result = get_distance_histogram(lff)
assert isinstance(result, dcc.Graph)
def test_015_tableau_filter_date(dash_duo: DashComposite):
from src.app import app
dash_duo.start_server(app)
dash_duo.wait_for_text_to_equal(".logo > h1", "decp.info", timeout=4)
for page in ["tableau", "acheteurs/123", "titulaires/345"]:
dash_duo.wait_for_page(f"{dash_duo.server_url}/{page}")
filter_input = '.marches_table th[data-dash-column="dateNotification"] input'
filter_cell_result = '.marches_table td[data-dash-column="dateNotification"] p'
dash_duo.wait_for_element(filter_input, timeout=2)
_filter_input: WebElement = dash_duo.find_element(filter_input)
_filter_input.send_keys("3333") # a dateNotification that doesn't exist
_filter_input.send_keys(Keys.ENTER)
_filter_result: list[WebElement] = dash_duo.find_elements(filter_cell_result)
assert len(_filter_result) == 0, f"Page : {page}"
+61
View File
@@ -0,0 +1,61 @@
import os
def test_update_timestamp_falls_back_to_db_mtime(tmp_path, monkeypatch):
import src.utils as u
from src.utils import get_data_update_timestamp
def boom(*a, **k):
raise RuntimeError("net down")
monkeypatch.setattr(u, "get_last_modified", boom)
fb = tmp_path / "decp.duckdb"
fb.write_bytes(b"x")
assert get_data_update_timestamp("http://x", str(fb)) == os.path.getmtime(str(fb))
def test_update_timestamp_none_when_all_fail(monkeypatch):
import src.utils as u
from src.utils import get_data_update_timestamp
def boom(*a, **k):
raise RuntimeError("net down")
monkeypatch.setattr(u, "get_last_modified", boom)
assert get_data_update_timestamp("http://x", None) is None
def test_update_timestamp_nominal(monkeypatch):
import src.utils as u
from src.utils import get_data_update_timestamp
monkeypatch.setattr(u, "get_last_modified", lambda p: 123.0)
assert get_data_update_timestamp("http://x", None) == 123.0
def test_sources_tables_none_path():
from src.figures import get_sources_tables
div = get_sources_tables(None)
assert "indisponible" in str(div.children).lower()
def test_sources_tables_missing_file():
from src.figures import get_sources_tables
div = get_sources_tables("/does/not/exist.csv")
assert "indisponible" in str(div.children).lower()
def test_sources_tables_valid_csv(tmp_path):
from dash import dash_table
from src.figures import get_sources_tables
csv = tmp_path / "s.csv"
csv.write_text(
"nom,organisation,nb_marchés,nb_acheteurs,code,url,unique\n"
"Source A,Org A,5,2,XA,http://a,1\n"
)
div = get_sources_tables(str(csv))
assert isinstance(div.children, dash_table.DataTable)
+77
View File
@@ -0,0 +1,77 @@
import json
import httpx
import pytest
from src.utils import data as data_mod
VALID = {"fields": [{"name": "uid", "title": "UID"}, {"name": "objet"}]}
class FakeResp:
def __init__(self, payload, ok=True, bad_json=False):
self._payload = payload
self._ok = ok
self._bad_json = bad_json
def raise_for_status(self):
if not self._ok:
raise httpx.HTTPError("boom")
return self
def json(self):
if self._bad_json:
raise json.JSONDecodeError("bad", "", 0)
return self._payload
def test_remote_ok_returns_schema_and_writes_cache(tmp_path, monkeypatch):
cache = tmp_path / "schema.cache.json"
monkeypatch.setenv("DATA_SCHEMA_PATH", "http://x")
monkeypatch.setenv("DATA_SCHEMA_CACHE", str(cache))
monkeypatch.setattr(data_mod, "get", lambda *a, **k: FakeResp(VALID))
result = data_mod.get_data_schema()
assert "uid" in result
assert json.loads(cache.read_text())["fields"][0]["name"] == "uid"
def test_remote_http_error_falls_back_to_cache(tmp_path, monkeypatch):
cache = tmp_path / "schema.cache.json"
cache.write_text(json.dumps(VALID))
monkeypatch.setenv("DATA_SCHEMA_PATH", "http://x")
monkeypatch.setenv("DATA_SCHEMA_CACHE", str(cache))
monkeypatch.setattr(data_mod, "get", lambda *a, **k: FakeResp(None, ok=False))
assert "uid" in data_mod.get_data_schema()
def test_remote_malformed_falls_back_to_cache(tmp_path, monkeypatch):
cache = tmp_path / "schema.cache.json"
cache.write_text(json.dumps(VALID))
monkeypatch.setenv("DATA_SCHEMA_PATH", "http://x")
monkeypatch.setenv("DATA_SCHEMA_CACHE", str(cache))
monkeypatch.setattr(data_mod, "get", lambda *a, **k: FakeResp({"nope": 1}))
assert "uid" in data_mod.get_data_schema()
def test_no_url_uses_cache(tmp_path, monkeypatch):
cache = tmp_path / "schema.cache.json"
cache.write_text(json.dumps(VALID))
monkeypatch.delenv("DATA_SCHEMA_PATH", raising=False)
monkeypatch.setenv("DATA_SCHEMA_CACHE", str(cache))
assert "uid" in data_mod.get_data_schema()
def test_no_source_raises(tmp_path, monkeypatch):
monkeypatch.delenv("DATA_SCHEMA_PATH", raising=False)
monkeypatch.setenv("DATA_SCHEMA_CACHE", str(tmp_path / "missing.json"))
with pytest.raises(RuntimeError):
data_mod.get_data_schema()
def test_cache_write_failure_is_non_blocking(tmp_path, monkeypatch):
# parent inexistant => l'écriture du cache échoue, mais le schéma est renvoyé
cache = tmp_path / "nodir" / "schema.cache.json"
monkeypatch.setenv("DATA_SCHEMA_PATH", "http://x")
monkeypatch.setenv("DATA_SCHEMA_CACHE", str(cache))
monkeypatch.setattr(data_mod, "get", lambda *a, **k: FakeResp(VALID))
assert "uid" in data_mod.get_data_schema()
+315
View File
@@ -0,0 +1,315 @@
import polars as pl
import pytest
@pytest.fixture
def sample_lff():
"""Small LazyFrame with the columns needed by add_links / format_values."""
return pl.LazyFrame(
[
{
"uid": "u1",
"id": "u1",
"acheteur_id": "12345678900011",
"acheteur_nom": "Mairie de Test",
"titulaire_id": "98765432100022",
"titulaire_nom": "Entreprise Test",
"titulaire_typeIdentifiant": "SIRET",
"objet": "Travaux divers",
"montant": 12500.0,
"dateNotification": "2025-03-15",
"codeCPV": "45000000",
"dureeRestanteMois": 6,
"titulaire_distance": 42.0,
}
]
)
def test_table_module_imports():
from src.utils import table
assert hasattr(table, "prepare_table_data")
def test_filter_table_data_does_not_call_track_search(monkeypatch, sample_lff):
from src.utils import table
calls = []
monkeypatch.setattr(table, "track_search", lambda *a, **kw: calls.append(a))
result = table.filter_table_data(sample_lff, "{objet} icontains travaux").collect()
assert calls == []
assert result.height == 1
def test_filter_table_data_accent_insensitive():
"""Chercher sans accent doit trouver des valeurs accentuées, et vice versa."""
from src.utils.table import filter_table_data
lff = pl.LazyFrame(
[
{"uid": "1", "acheteur_nom": "Mairie de Nîmes", "objet": "Voirie"},
{"uid": "2", "acheteur_nom": "Commune de Reims", "objet": "Éclairage"},
{"uid": "3", "acheteur_nom": "Ville de Paris", "objet": "Travaux"},
]
)
# Sans accent → trouve la valeur accentuée
result = filter_table_data(lff, "{acheteur_nom} icontains Nimes").collect()
assert result.height == 1
assert result["uid"][0] == "1"
# Avec accent → trouve la valeur accentuée
result = filter_table_data(lff, "{acheteur_nom} icontains Nîmes").collect()
assert result.height == 1
# Sans accent → trouve la valeur avec accent initial (É)
result = filter_table_data(lff, "{objet} icontains eclairage").collect()
assert result.height == 1
assert result["uid"][0] == "2"
def test_normalize_sort_by_handles_empty():
from src.utils.table import normalize_sort_by
assert normalize_sort_by(None) == ()
assert normalize_sort_by([]) == ()
def test_normalize_sort_by_returns_hashable_tuple():
from src.utils.table import normalize_sort_by
sort_by = [
{"column_id": "montant", "direction": "desc"},
{"column_id": "dateNotification", "direction": "asc"},
]
key = normalize_sort_by(sort_by)
assert key == (("montant", "desc"), ("dateNotification", "asc"))
# Must be hashable so that flask-caching can build a cache key from it
hash(key)
def test_normalize_sort_by_preserves_order():
"""Order matters for sort: [A, B] != [B, A]."""
from src.utils.table import normalize_sort_by
a_then_b = normalize_sort_by(
[{"column_id": "a", "direction": "asc"}, {"column_id": "b", "direction": "asc"}]
)
b_then_a = normalize_sort_by(
[{"column_id": "b", "direction": "asc"}, {"column_id": "a", "direction": "asc"}]
)
assert a_then_b != b_then_a
@pytest.fixture(scope="module")
def flask_app():
"""Minimal Flask app with SimpleCache so @cache.memoize() works in tests."""
from flask import Flask
from src.utils.cache import cache
app = Flask(__name__)
cache.init_app(app, config={"CACHE_TYPE": "SimpleCache"})
return app
@pytest.fixture(autouse=True)
def reset_cache(flask_app):
"""Ensure the flask-caching backend is empty between tests so that
cache-hit assertions are meaningful. Falls back to no-op when no
Flask app context is active (NullCache)."""
from src.utils.cache import cache
with flask_app.app_context():
try:
cache.clear()
except (RuntimeError, AttributeError):
# No app context — cache is NullCache, nothing to clear
pass
yield
def test_prepare_table_data_returns_expected_tuple(flask_app):
from src.utils import table
with flask_app.app_context():
result = table.prepare_table_data(
data=None,
data_timestamp=5,
filter_query=None,
page_current=0,
page_size=20,
sort_by=[],
source_table="tableau",
)
# Same arity as before: 9 outputs
assert len(result) == 9
dicts, columns, tooltip, ts, nb_rows, dl_disabled, dl_text, dl_title, cleanup = (
result
)
assert isinstance(dicts, list)
assert ts == 6 # data_timestamp + 1 must still increment
assert "lignes" in nb_rows
def test_prepare_table_data_calls_track_search_on_filter(monkeypatch, flask_app):
from src.utils import table
calls = []
monkeypatch.setattr(table, "track_search", lambda *a, **kw: calls.append(a))
with flask_app.app_context():
table.prepare_table_data(
data=None,
data_timestamp=0,
filter_query="{objet} icontains travaux",
page_current=0,
page_size=20,
sort_by=[],
source_table="tableau",
)
assert calls == [("{objet} icontains travaux", "tableau")]
def test_prepare_table_data_same_page_uses_cache(monkeypatch, flask_app):
"""Two calls with exactly the same (filter, sort, page, size)
must call _fetch_page_sql at least once."""
from src.utils import table
call_count = {"n": 0}
def counting_fetch(*args, **kwargs):
call_count["n"] += 1
import polars as pl
return (
pl.DataFrame(
{
"uid": [],
"acheteur_id": [],
"titulaire_id": [],
"titulaire_typeIdentifiant": [],
}
),
0,
0,
)
monkeypatch.setattr(table, "_fetch_page_sql", counting_fetch)
with flask_app.app_context():
table.prepare_table_data(
data=None,
data_timestamp=0,
filter_query=None,
page_current=0,
page_size=10,
sort_by=[],
source_table="tableau",
)
table.prepare_table_data(
data=None,
data_timestamp=0,
filter_query=None,
page_current=0,
page_size=10,
sort_by=[],
source_table="tableau",
)
assert call_count["n"] >= 1
def test_prepare_table_data_cleanup_trigger_for_non_tableau(flask_app):
"""Non-tableau pages still get a fresh uuid trigger, not no_update."""
from dash import no_update
from src.utils import table
with flask_app.app_context():
result = table.prepare_table_data(
data=None,
data_timestamp=0,
filter_query="{objet} icontains travaux",
page_current=0,
page_size=20,
sort_by=[],
source_table="acheteur",
)
cleanup = result[8]
assert cleanup is not no_update
assert isinstance(cleanup, str)
assert len(cleanup) >= 32 # uuid4 hex string
def test_prepare_table_data_with_external_data_does_not_use_cache(
monkeypatch, flask_app, sample_lff
):
"""When a caller passes data (acheteur/titulaire/observatoire path),
bypass the memoized helper entirely."""
from src.utils import table
sentinel = {"called": False}
def should_not_be_called(*a, **kw):
sentinel["called"] = True
raise AssertionError("Memoized helper must not be called when data is provided")
monkeypatch.setattr(table, "_fetch_page_sql", should_not_be_called)
with flask_app.app_context():
table.prepare_table_data(
data=sample_lff,
data_timestamp=0,
filter_query=None,
page_current=0,
page_size=20,
sort_by=[],
source_table="acheteur",
)
assert sentinel["called"] is False
def test_fetch_page_sql_respects_pagination(flask_app):
"""New path: returns (page_dff, total_count, total_unique) via DuckDB."""
from src.utils import table
with flask_app.app_context():
page, total, total_unique = table._fetch_page_sql(
filter_query=None, sort_by_key=(), page_current=0, page_size=5
)
assert page.height <= 5
assert total >= page.height
assert isinstance(total_unique, int)
def test_fetch_page_sql_applies_filter(flask_app):
from src.utils import table
with flask_app.app_context():
page, total, total_unique = table._fetch_page_sql(
filter_query="{uid} icontains __ne_matche_rien__",
sort_by_key=(),
page_current=0,
page_size=20,
)
assert total == 0
assert page.height == 0
def test_fetch_page_sql_post_processes_links(flask_app):
from src.utils import table
with flask_app.app_context():
page, _, _ = table._fetch_page_sql(
filter_query=None, sort_by_key=(), page_current=0, page_size=1
)
if page.height > 0:
assert "<a href" in page["uid"][0]
+140
View File
@@ -0,0 +1,140 @@
import polars as pl
SCHEMA = pl.Schema(
{
"uid": pl.String,
"objet": pl.String,
"acheteur_id": pl.String,
"montant": pl.Float64,
"dureeMois": pl.Int64,
"dateNotification": pl.Date,
}
)
def test_empty_filter_returns_true():
from src.utils.table_sql import filter_query_to_sql
where, params = filter_query_to_sql("", SCHEMA)
assert where == "TRUE"
assert params == []
def test_icontains_string_is_case_insensitive_like():
from src.utils.table_sql import filter_query_to_sql
where, params = filter_query_to_sql("{objet} icontains travaux", SCHEMA)
assert where == '"objet" IS NOT NULL AND "objet" <> \'\' AND "objet" ILIKE ?'
assert params == ["%travaux%"]
def test_icontains_with_trailing_wildcard_is_starts_with():
from src.utils.table_sql import filter_query_to_sql
where, params = filter_query_to_sql(
"{acheteur_id} icontains 24350013900189*", SCHEMA
)
assert (
where
== '"acheteur_id" IS NOT NULL AND "acheteur_id" <> \'\' AND "acheteur_id" ILIKE ?'
)
assert params == ["24350013900189%"]
def test_icontains_with_leading_wildcard_is_ends_with():
from src.utils.table_sql import filter_query_to_sql
where, params = filter_query_to_sql("{uid} icontains *2024", SCHEMA)
assert where == '"uid" IS NOT NULL AND "uid" <> \'\' AND "uid" ILIKE ?'
assert params == ["%2024"]
def test_numeric_greater_than():
from src.utils.table_sql import filter_query_to_sql
where, params = filter_query_to_sql("{montant} i> 40000", SCHEMA)
assert where == '"montant" IS NOT NULL AND "montant" > ?'
assert params == [40000.0]
def test_numeric_less_than():
from src.utils.table_sql import filter_query_to_sql
where, params = filter_query_to_sql("{montant} i< 1000", SCHEMA)
assert where == '"montant" IS NOT NULL AND "montant" < ?'
assert params == [1000.0]
def test_numeric_equality_via_icontains():
from src.utils.table_sql import filter_query_to_sql
where, params = filter_query_to_sql("{dureeMois} icontains 12", SCHEMA)
assert where == '"dureeMois" IS NOT NULL AND "dureeMois" = ?'
assert params == [12]
def test_date_column_treated_as_string_ilike():
from src.utils.table_sql import filter_query_to_sql
where, params = filter_query_to_sql("{dateNotification} icontains 2024*", SCHEMA)
assert "ILIKE" in where
assert params == ["2024%"]
def test_multiple_filters_joined_by_and():
from src.utils.table_sql import filter_query_to_sql
filter_query = "{objet} icontains voirie && {montant} i> 40000"
where, params = filter_query_to_sql(filter_query, SCHEMA)
assert " AND " in where
assert params == ["%voirie%", 40000.0]
def test_invalid_numeric_value_is_skipped():
from src.utils.table_sql import filter_query_to_sql
where, params = filter_query_to_sql("{montant} i> notanumber", SCHEMA)
assert where == "TRUE"
assert params == []
def test_unknown_column_is_skipped():
from src.utils.table_sql import filter_query_to_sql
where, params = filter_query_to_sql("{inexistant} icontains foo", SCHEMA)
assert where == "TRUE"
assert params == []
def test_sort_by_empty():
from src.utils.table_sql import sort_by_to_sql
assert sort_by_to_sql([], SCHEMA) == ""
assert sort_by_to_sql(None, SCHEMA) == ""
def test_sort_by_single_column_desc():
from src.utils.table_sql import sort_by_to_sql
result = sort_by_to_sql([{"column_id": "montant", "direction": "desc"}], SCHEMA)
assert result == '"montant" DESC NULLS LAST'
def test_sort_by_multiple_columns_preserves_order():
from src.utils.table_sql import sort_by_to_sql
result = sort_by_to_sql(
[
{"column_id": "dateNotification", "direction": "desc"},
{"column_id": "montant", "direction": "asc"},
],
SCHEMA,
)
assert result == '"dateNotification" DESC NULLS LAST, "montant" ASC NULLS LAST'
def test_sort_by_ignores_unknown_column():
from src.utils.table_sql import sort_by_to_sql
result = sort_by_to_sql([{"column_id": "fake", "direction": "asc"}], SCHEMA)
assert result == ""
Generated
+2639
View File
File diff suppressed because it is too large Load Diff