Récupération des données acheteur depuis annuaire #28

This commit is contained in:
Colin Maudry
2025-08-21 11:56:39 +02:00
parent 87d657abf8
commit 636e0b059d
2 changed files with 11 additions and 5 deletions
-4
View File
@@ -21,10 +21,6 @@ update_date = os.path.getmtime(os.getenv("DATA_FILE_PARQUET_PATH"))
update_date = datetime.fromtimestamp(update_date).strftime("%d/%m/%Y") update_date = datetime.fromtimestamp(update_date).strftime("%d/%m/%Y")
df_filtered = pl.DataFrame() df_filtered = pl.DataFrame()
# Unique les données actuelles, pas les anciennes versions de marchés
lf = lf.filter(pl.col("donneesActuelles"))
# Suppression des colonnes inutiles # Suppression des colonnes inutiles
lf = lf.drop( lf = lf.drop(
[ [
+11 -1
View File
@@ -5,6 +5,7 @@ from time import sleep
import polars as pl import polars as pl
import polars.selectors as cs import polars.selectors as cs
from dotenv import load_dotenv from dotenv import load_dotenv
from httpx import get
from polars.exceptions import ComputeError from polars.exceptions import ComputeError
load_dotenv() load_dotenv()
@@ -101,6 +102,12 @@ def format_number(number) -> str:
return number return number
def get_acheteur_data(siret: str) -> dict:
url = f"https://recherche-entreprises.api.gouv.fr/search?q={siret}"
response = get(url)
return response.json()
def get_decp_data() -> pl.LazyFrame: def get_decp_data() -> pl.LazyFrame:
# Chargement du fichier parquet # Chargement du fichier parquet
# Le fichier est chargé en mémoire, ce qui est plus rapide qu'une base de données pour le moment. # Le fichier est chargé en mémoire, ce qui est plus rapide qu'une base de données pour le moment.
@@ -123,7 +130,10 @@ def get_decp_data() -> pl.LazyFrame:
# lff = numbers_to_strings(lff) # lff = numbers_to_strings(lff)
# Tri des marchés par date de notification # Tri des marchés par date de notification
lff = lff.sort(by=["datePublicationDonnees"], descending=True, nulls_last=True) lff = lff.sort(by=["dateNotification"], descending=True, nulls_last=True)
# Uniquement les données actuelles, pas les anciennes versions de marchés
lff = lff.filter(pl.col("donneesActuelles"))
return lff return lff